性价比之选:Anthropic发布Claude Opus 5模型

性价比之选:Anthropic发布Claude Opus 5模型

Anthropic推出Claude Opus 5:经济高效的AI新选择

Anthropic于近日正式发布Claude Opus 5模型,该公司表示这款产品几乎具备其顶级Claude Fable 5的全部智能,而成本仅需一半——这一发布标志着AI竞争正从单纯的能力比拼转向日常应用的经济性考量。

该模型已立即在Anthropic所有平台上线,定价为每百万输入代币5美元,每百万输出代币25美元,与前一版本Opus 4.8保持一致。Opus 5已成为Anthropic高级消费层Claude Max的新默认模型,同时也是Claude Pro平台上最强大的可用模型。

这一定位是经过深思熟虑的。Anthropic并未宣称Opus 5是其最智能的模型——这一殊荣仍属于Fable 5,且竞争系统在某些领域仍保持着优势。相反,该公司提出了一个可能对企业买家更重要的微妙论点:最具经济价值的AI工作发生在中等难度领域,在这里高效、廉价提供的近乎前沿智能,胜过昂贵提供的前沿智能。

“Opus 5作为您的日常驱动工具,是您交付复杂任务并在完成后进行审查的模型,”Anthropic发言人在接受VentureBeat采访时描述道,阐述了公司产品线如何分层。”Fable 5用于您最雄心勃勃的工作,那些以前没有任何系统能够承担的持续数天的自主项目…Sonnet 5用于您大规模运行的工作,此时速度和每次调用的成本决定了什么能够推出。Haiku 4.5用于子智能体和即时回答。”

性能评测:Opus 5与Fable 5及竞争AI模型的表现对比

从数据上看,结果令人瞩目。Anthropic表示,Opus 5在编程和知识工作评估中创造了新的最先进记录,包括Frontier-Bench和GDPval-AA。在Frontier-Bench v0.1(一个智能终端编程基准测试)中,Opus 5得分为43.3%——超过Opus 4.8的18.7%的两倍,并领先于Fable 5的33.7%——且每个任务的成本更低。在ARC-AGI 3(新颖问题解决能力评估)中,Anthropic报告称Opus 5的得分是次优模型的三倍。在OSWorld 2.0(计算机使用基准测试)中,该公司表示该模型仅用Fable 5三分之一的成本就超越了其最佳结果。

这些数据伴随着诚实的保留意见,这在以超级latives著称的产业中本身就值得注意。Anthropic承认,Opus 5在网络安全任务和生物学研究方面仍落后于竞争模型Mythos 5,而一个OpenAI家族模型仍在某个智能体编程基准测试中领先。

更具启示性的保留意见来自Anthropic本身,当被问及Opus 5在哪些方面仍不及Fable 5时。发言人的回答实际上坦率地承认了基准测试所能衡量和不能衡量的内容。

“Opus 5获胜的评估是具有特定结果的有界任务,这正是它最擅长的领域。这些评估没有衡量的是持续时间,”发言人对VentureBeat表示。”一种表达方式是:Opus 5是基准测试能看到的任务的最佳工具,而Fable 5是当任务超出基准测试范围时您会选择的工具。”

相比之下,Fable 5″用于最长、最自主的工作,模型需要在数小时或数天内保持连贯性,处理大量相互关联的步骤和密集的源材料,”发言人说,建议客户”在有代表性的工作负载上运行两者,一个是有界任务,一个是长期任务。”这种框架——有界任务与长期自主性——可能成为2026年模型差异化的决定性轴心,随着基准测试趋于饱和,最难解决的问题将涉及持续多天的智能体工作,而非离散的谜题。

代币效率:企业AI支出的新战场

贯穿此次发布的一个主题是Anthropic明确希望买家理解:Opus 5不仅表现良好,而且每美元表现更佳。该模型配备可调节的”努力”设置,允许客户在智能、速度和代币节省之间进行权衡,Anthropic的图表强调在给定成本下的性能,而非仅仅是峰值性能。

早期客户以不同寻常的特异性回应了这一点。法律AI公司Harvey表示,Opus 5在生成平均少26%代币的情况下,达到了与Opus 4.8最大推理模式相似的性能,其应用研究主管Niko Grupen表示。Fundamental Research Lab的Richard Pham表示,在困难的金融建模任务中,该模型平均准确率高出九个百分点,同时使用的回合和工具调用减少约三分之一,时间减少60%。

Zapier首席执行官Wade Foster表示,Opus 5在他的公司AutomationBench排行榜上名列前茅,”使用的代币不比先前的Claude模型多”,从头到尾运行了完整的客户流失预防工作流。”以前的模型没有通过测试;Opus 5达到了100%,”他说。Devin编码智能体背后的公司Cognition的首席执行官Scott Wu表示,在FrontierCode 1.1上,”Claude Opus 5在成本减半的情况下接近Fable级别的性能”,在调试和根本原因分析方面特别强大。

对效率的重视反映了商业现实。企业AI支出已不再是实验性的,推理成本——即大规模运行这些模型的实际价格——已成为董事会层面的项目。

Anthropic的业务严重偏向API和企业使用;根据Contrary Research在2026年2月的分析,截至2025年底,Claude在企业大语言模型市场中的使用量约占40%,而Claude Code的年收入已达到约10亿美元。对于一家按代币向客户收费的公司来说,能用更少代币做更多工作的模型不是锦上添花,而是产品本身。

自我验证的智能体与自动化的隐性成本

除了数字之外,Anthropic还在推销一种行为理念:Opus 5会验证其工作并迭代直到成功。该公司提供了几个来自测试的例子,读起来像是机器固执性的小型寓言。

在一个Frontier-Bench任务中,模型被要求从一张故意不给任何查看方式的图纸中重建机器零件的3D CAD模型。Anthropic表示,Opus 5没有失败,而是编写了自己的计算机视觉管道,从原始像素中提取几何形状——并且能够重复执行此操作。

在另一个测试中,当Opus 5被要求完成一个需要跨多个步骤保持上下文的任务时,该模型会定期检查自己的工作,确认是否仍然符合初始要求,并在偏离轨道时自我纠正。

这些自验证行为对自动化成本具有深远影响。当AI系统能够自我验证时,减少了对人工监督的需求,从而降低了部署AI解决方案的隐性成本。对于企业而言,这意味着更高的投资回报率和更可靠的结果。


关注微信号:智享开源,及时了解更新信息。

原文链接:https://venturebeat.com/orchestration/anthropic-launches-claude-opus-5-a-cheaper-ai-model-for-coding-agents-and-enterprise-workflows

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2123篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类