问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
近日全新像素原生RAG(检索增强生成)技术正式对外公布,该技术可将网页、PDF等格式文档直接渲染为图像块完成索引,无需复杂的前置格式解析步骤,实测搭建的检索生成流水线鲁棒性较传统方案提升47%,为非结构化多模态文档的检索调用提供了全新落地路径。
在企业知识库、智能客服、学术文献检索等多个RAG落地场景中,文档预处理环节的痛点已经成为制约效果提升的核心瓶颈。不少技术团队反馈,处理版式复杂的非结构化文档时,仅OCR识别和格式校正的成本就占到整个RAG系统搭建成本的60%以上,且最终检索准确率往往很难达到商用标准。
传统RAG系统的设计逻辑围绕文本数据展开,处理包含视觉元素的文档时,需要先将PDF、网页中的内容提取为纯文本,再做向量编码和检索。这一流程对纯文字文档的适配性尚可,但遇到包含公式、图表、手绘批注、混合排版的文档时,很容易出现信息遗漏、识别错误等问题。
行业统计数据显示,当前企业内部存储的非结构化文档中,有超过75%包含非文本类视觉元素,传统RAG方案对这类文档的检索召回率普遍低于60%,无法满足实际使用需求。
此次推出的像素原生RAG技术,完全跳出了传统方案“先解析再编码”的逻辑,直接将完整的网页、PDF文档渲染为固定尺寸的图像块,再通过多模态Embedding模型对图像块直接做向量化编码存入向量库。
检索阶段,系统会直接匹配用户query对应的向量与图像块向量,召回的相关图像块会直接输入多模态大模型完成内容生成,全程不需要做文本提取或格式校正。实测数据显示,该方案对混合版式文档的检索召回率可达92%,预处理耗时较传统方案降低80%。
据了解,目前像素原生RAG的基础框架已经开放开源,普通开发者仅需调用封装好的工具包,最快10行代码即可搭建一套可投入使用的像素原生检索生成流水线,无需从零完成多模态编码、图像分块等底层功能的开发。
下一步相关开发团队还将拓展该技术的适配场景,支持PPT、Excel表格、手写笔记照片等更多类型的视觉文档处理,同时也在推进与LangChain等主流RAG开发框架的接口适配,进一步降低企业级用户的接入成本。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。