AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

像素原生RAG技术发布 为视觉文档索引提供落地可行方案

近日全新像素原生RAG(检索增强生成)技术正式对外公布,该技术可将网页、PDF等格式文档直接渲染为图像块完成索引,无需复杂的前置格式解析步骤,实测搭建的检索生成流水线鲁棒性较传统方案提升47%,为非结构化多模态文档的检索调用提供了全新落地路径。

在企业知识库、智能客服、学术文献检索等多个RAG落地场景中,文档预处理环节的痛点已经成为制约效果提升的核心瓶颈。不少技术团队反馈,处理版式复杂的非结构化文档时,仅OCR识别和格式校正的成本就占到整个RAG系统搭建成本的60%以上,且最终检索准确率往往很难达到商用标准。

传统RAG系统的设计逻辑围绕文本数据展开,处理包含视觉元素的文档时,需要先将PDF、网页中的内容提取为纯文本,再做向量编码和检索。这一流程对纯文字文档的适配性尚可,但遇到包含公式、图表、手绘批注、混合排版的文档时,很容易出现信息遗漏、识别错误等问题。

行业统计数据显示,当前企业内部存储的非结构化文档中,有超过75%包含非文本类视觉元素,传统RAG方案对这类文档的检索召回率普遍低于60%,无法满足实际使用需求。

此次推出的像素原生RAG技术,完全跳出了传统方案“先解析再编码”的逻辑,直接将完整的网页、PDF文档渲染为固定尺寸的图像块,再通过多模态Embedding模型对图像块直接做向量化编码存入向量库。

检索阶段,系统会直接匹配用户query对应的向量与图像块向量,召回的相关图像块会直接输入多模态大模型完成内容生成,全程不需要做文本提取或格式校正。实测数据显示,该方案对混合版式文档的检索召回率可达92%,预处理耗时较传统方案降低80%。

据了解,目前像素原生RAG的基础框架已经开放开源,普通开发者仅需调用封装好的工具包,最快10行代码即可搭建一套可投入使用的像素原生检索生成流水线,无需从零完成多模态编码、图像分块等底层功能的开发。

下一步相关开发团队还将拓展该技术的适配场景,支持PPT、Excel表格、手写笔记照片等更多类型的视觉文档处理,同时也在推进与LangChain等主流RAG开发框架的接口适配,进一步降低企业级用户的接入成本。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。