PixelRAG超越文本解析,智能体成本降九成

PixelRAG超越文本解析,智能体成本降九成

目前,大多数企业的检索增强生成(RAG)流程都遵循一个固定的模式:利用文本解析器将网页和文档转换为纯文本,以便进行分块和索引。然而,这种转换步骤往往会破坏关键的检索信号。根据一项最新的研究显示,这正是导致AI回答错误的主要原因。

来自加州大学伯克利分校、普林斯顿大学、洛桑联邦理工学院(EPFL)以及Databricks的研究团队本周发布了一篇论文,介绍了一种名为PixelRAG的新型系统。该系统完全跳过了文本转换步骤,不再将页面解析为文本,而是将其渲染为截图,对这些图像进行索引,并将检索到的图像切片直接输入给视觉语言模型阅读器。在覆盖整个维基百科的3000万个截图切片测试中,PixelRAG在六个基准测试中均优于基于文本的RAG,其准确率比文本基线提高了高达18.1%。

解析器破坏了企业RAG依赖的检索信号

研究人员的目标是开发一种干净、端到端的架构。论文第一作者、加州大学伯克利分校的博士生Yichuan Wang向VentureBeat表示:“改进解析器是一个永无止境的过程,因为每个网站都需要特殊处理。我们的目标是探索VLM(视觉语言模型)的最新进展是否能够让我们绕过整个问题,构建一个无需针对特定网站进行工程改造即可跨网站工作的检索系统。”

他指出,现代网络RAG流程通常涉及渲染、解析、清洗、分块等许多手工设计的阶段,每个阶段都会引入潜在的级联错误和抽象,使我们离原始网页越来越远。团队感兴趣的是能否消除大部分复杂性,直接在渲染页面上操作。

Wang强调,解析不可避免地会导致信息丢失。图像、视觉层次、排版、强调(如粗体文本)、表格和布局要么被丢弃,要么被转换为不完美的文本近似值。“无论解析器变得多么好,某些信息在转换过程中都会从根本上丢失。”

研究确定了基于文本的RAG在信息到达阅读器之前丢失答案的三种方式。这些数据均基于包含1000个维基百科事实性问题的标准基准SimpleQA进行测量:

  • 解析器损失(占失败的36.6%): HTML到文本的转换彻底破坏了结构化内容,导致语料库中没有任何文本块包含答案。
  • 排序损失(占失败的55.2%): 答案存在于语料库中,但被关键词密集的信息框(infoboxes)挤到了排名之后。这些信息框在75.9%的查询中位居第一,将包含答案的段落推至第20名或更低。
  • 阅读器损失(占失败的8.2%): 正确的内容到达了阅读器,但扁平化的结构导致了归因错误。

PixelRAG 的工作原理

与只能阅读文本的标准大语言模型不同,视觉语言模型将图像和文本作为输入,这意味着它可以像人类一样阅读渲染后的网页,保持布局和结构的完整性。Wang表示:“对于许多结构化信息提取任务,我们认为现代VLM具有内在优势,因为它们可以对内容和布局进行联合推理,而不是依赖扁平化的文本表示。”

PixelRAG正是基于这一原则构建,它用完全基于渲染截图的四阶段系统取代了文本解析流程。

  • 渲染: 使用浏览器自动化库Playwright以固定的875像素视口渲染页面,并将其切割成1024像素高的切片。维基百科的700万篇文章大约产生了3000万个切片。资产在本地缓存并完全离线渲染。
  • 索引: 使用Qwen3-VL-Embedding-2B模型将每个切片编码为单个2048维向量,并存储在FAISS近似最近邻索引中。完整的索引大小约为120 GB(fp16格式),支持无需完全重新索引的增量更新。
  • 训练: 检索模型在从数据存储生成的合成对比数据上进行微调,使用动态硬负样本挖掘来过滤假负样本。LoRA这种轻量级微调方法被应用于语言模型主干和视觉编码器。在约40,000对数据上的训练在单个H100 GPU上可在三小时内完成。
  • 存储: 维基百科的原始截图切片需要5.6 TB,但按需渲染的方法消除了持久存储的需求:嵌入所有切片,删除截图,并在查询时按需重新渲染页面。向量索引大约需要120 GB。

六大基准测试与智能体成本优势

研究人员在六个基准测试中对PixelRAG进行了测试,涵盖维基百科事实性问答、基于表格的查询、多模态问答和实时新闻检索。结果显示,它在所有六项测试中都优于基于文本的RAG,即使在仅靠文本就能回答的任务中也是如此。在SimpleQA上,其准确率达到78.8%,而最强的文本解析器为71.6%;在结构化表格查询中,差距扩大到48.8%对42.5%。团队需要使用Qwen3-VL-4B级别或以上的模型才能看到显著优势。较小的模型则落后于文本检索超过12.5个百分点。

PixelRAG在成本方面的优势是其短期内最强的应用案例。在基准测试中,使用PixelRAG作为搜索后端的AI智能体仅消耗了360万个提示词,而文本检索则消耗了3750万个。其成本比包括Google在内的替代方案低2到4倍,同时实现了更高的准确性。图像压缩可以进一步将提示词预算削减三分之一。

视觉分块是尚未解决的主要难题

基于文本的RAG系统花费了数年时间来完善如何根据主题、章节或语义内容将文档拆分为有意义的检索单元。PixelRAG目前还没有等价的机制:它按固定像素高度切割页面,这意味着表格或段落可能会在切片中间被切断,而无法识别内容边界。

“文本检索社区花费数年时间研究分块策略,而视觉检索受到的关注要少得多,”Wang说,“我们认为这是未来研究的一个重要领域。”

对企业的意义

PixelRAG所解决的检索质量问题反映了更广泛的市场转变。VB Pulse 2026年第一季度的数据显示,来自合格企业受访者的混合检索采用意图从1月份的10.3%激增至3月份的33.3%,这是数据集中增长最快的战略定位。PixelRAG的作者也指出,混合部署是最务实的短期路径——将视觉检索叠加在现有的文本系统之上,而不是完全取代它们。

对于已经在运行RAG流程的团队来说,获得这些节省的途径比从头重建要简单得多。Wang建议:“一条实用的路径是将PixelRAG作为现有文本检索系统的增强层。结合文本和视觉搜索的混合检索非常直接,这很可能是许多生产部署演进的方式。”


关注微信号:智享开源 ,及时了解更新信息。

原文链接:https://venturebeat.com/data/pixelrag-beats-text-parsers-on-accuracy-and-cuts-ai-agent-token-costs-10x

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2135篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类