Cohere Parse 5:性价比胜出,成本优势明显

企业试图将PDF、幻灯片和扫描文档导入人工智能流程时,始终面临同样的障碍:工具要么遗漏结构——表格、图表、布局——要么运行成本过高,难以规模化应用。

近日,Cohere公司发布了Parse 5模型,其定位是基于价格与性能的平衡,而非单纯的准确性,这正是企业级应用所需的成本与能力组合。Parse 5是一款拥有23亿参数的视觉语言模型,专门设计用于将PDF、幻灯片和图像转换为结构化Markdown格式,以满足企业级规模的需求。

根据Cohere发布的基准测试对比,Parse 5在准确性方面落后于三个更大型的通用前沿模型。在Cohere报告的三项ParseBench维度中,GPT-5.5、Opus 4.8和Gemini 3.5 Flash的得分均高于Parse。Cohere并未声称其模型得分最高,而是宣称以接近顶级水平的性能提供了最佳性价比。该公司将该模型定价为每1000页1.50美元,通过API提供服务,同时提供Model Vault——Cohere的安全、单租户平台,用于管理推理,可供大规模部署使用。

“文档解析问题尚未解决,因为难点不在于阅读文本,而在于保留结构和意义,”Cohere AI搜索副总裁Nils Reimers向VentureBeat表示,”企业文档混合了表格、图表和格式,这些都会改变数据的解释方式。大多数工具仍然会忽略结构或产生虚构内容,即使是前沿模型在处理布局复杂的页面时也会失效。”

单通道架构解析

Parse 5将页面作为图像输入,通过单一视觉语言模型通道处理,返回结构化Markdown,这简化了大多数工具采用的OCR加模型的多步流水线。

技术架构

它是一款基于Cohere Labs的North-Micro-Vision-Instruct架构构建的23亿参数视觉语言模型,拥有8192个令牌的上下文窗口,占用空间约4.6GB。该模型接受PDF、PowerPoint或JPEG页面作为base64编码图像,按阅读顺序返回Markdown,表格渲染为HTML格式,并提供表格和图像的描述及边界框坐标。

语言覆盖范围

阿拉伯语、英语、法语、德语、意大利语、日语、韩语、葡萄牙语和西班牙语可获得稳定的准确率,其他语言提供零样本支持,准确率较低。

输出模式

默认输出模式为每页返回一个Markdown字符串。而块状模式返回类型化元素,其中每个表格都包含自己的HTML、边界框和描述,这种格式被Cohere视为实现智能体级别可追溯性的关键。

可用性

Parse 5现已通过Cohere API、Model Vault、Microsoft Foundry和AWS SageMaker全面提供。

基准测试显示的是权衡,而非绝对优势

ParseBench是一项基准测试,用于评估文档解析工具在经过人工验证的企业页面上的表现。Cohere报告称Parse 5在三个维度上的得分为79.2:表格、内容保真度和语义格式。这一得分使Parse 5落后于GPT-5.5(84.4)、Opus 4.8(84.3)和Gemini 3.5 Flash(81.8),但领先于LlamaParse的经济型版本(78.3)、Mistral OCR 4(74.5)、Databricks AI Parse(72.4)和Azure Document Intelligence(69.3)。

Cohere的表格指出了两个未包含的维度:布局和图表,并将这两者归因于产品范围而非性能差距。Parse 5返回阅读顺序的Markdown而非文本元素的边界框,对图表进行描述而非提取底层数据,图表数据提取功能计划在后续版本中实现。

Reimers表示,这一设计选择反映了智能体工作流程实际失效的地方。

“例如对于图表,我们提供图表的总体描述以及一个指标,说明智能体如何视觉检查图表,”Reimers解释道,”其他解决方案尝试从图表中提取数据,但会遗漏关键信息(例如线条的颜色或模式),这会导致聊天和智能体AI应用中出现幻觉。”

成本才是Cohere真正强调的优势。Reimers指出该公司为一家大型金融服务公司建模的工作流程。

“我们为一家每年处理7.5亿文档的大型金融服务工作流程进行了成本计算,显示选择Parse 5而非GPT-5.5这样的通用大型模型可降低超过98%的成本。”

这一数字是Cohere针对单个建模工作流程的估计,而非经过审计的实际部署数据。

Parse 5在文档解析市场中的定位

对于寻求解析解决方案的企业来说,市场上有丰富的选择。

通用前沿模型——GPT-5.5、Opus 4.8和Gemini 3.5 Flash——在准确性对比中领先,但每页都承担着大型模型的成本和延迟。

此外还有专业解析工具,包括Mistral OCR 4、LlamaParse以及Chandra OCR 2和RedNote的dots.mocr等开源选项。

超大规模商的文档智能服务——AWS Textract、Google Document AI、Azure Document Intelligence和Databricks AI Parse——更多地依靠生态系统便利性而非原始解析质量进行竞争,在Cohere的对比中得分最低。

BARC US研究副总裁Kevin Petrie表示,文档解析目前正处于企业AI应用的中心位置。

“我们正在进行的一项调查显示,文档分析无疑是AI的第一大用例,在我们调查的组织中采用率达到62%,”Petrie向VentureBeat表示,”文档和其他非结构化对象,包括图像等,包含组织需要用来区分其智能体AI计划的专有上下文。”

Petrie补充说,只有时间才能证明Cohere的成本性能与前沿模型相比如何,但从战略角度看,他认为Cohere的定位是正确的。

HyperFRAME研究AI堆栈负责人Stephanie Walter认为Cohere Parse 5位于传统OCR和在每页使用昂贵前沿模型之间的理想位置。

“其潜在优势在于以适合大规模摄取的价格提供结构、空间来源和私有部署,”Walter向VentureBeat表示,”它不需要在每一项基准测试中都获胜。它需要使可靠的企业级解析变得经济实惠。”

真正的考验在于下游应用,而非基准测试

“解析是企业AI堆栈中的第一个质量关卡,”Walter说,”如果在摄取过程中丢失了表格、标题、图像或阅读顺序,更好的嵌入和更大的模型也无法恢复这些缺失的结构。”

基准测试得分并非这里唯一的考量因素。”企业应该针对自己最困难的文档测试解析器,并衡量下游检索和任务准确性,而非提取文本的整洁度,”Walter表示,”正确的问题不是’它读取了PDF吗?’而是’智能体现在能正确使用这些信息吗?'”


关注微信号:智享开源 ,及时了解更新信息。

原文链接:https://venturebeat.com/data/cohere-parse-5-loses-the-benchmark-on-points-it-wins-on-cost-per-page

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2827篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类