智能体模型评估:基准分数不等于实际成本

>
基准测试的局限性
近期阿里巴巴发布的Qwen 3.8-Max和Anthropic的Claude Opus 5两款智能体模型为我们提供了一个重要启示:单纯依靠基准测试分数无法准确预测实际应用中的成本表现。
阿里巴巴在推出Qwen 3.8-Max时宣传该模型仅次Claude Fable 5,但在其发布表格中,该模型仅在12个编码智能体评测项目中领先一项。然而,一项独立测试得出了几乎相反的结论:使用预览版本进行的基准测试显示,Qwen 3.8-Max的最佳设置表现中等,而默认设置则排名最后。
这两种结果都是真实且合理的,它们之间的差异主要源于令牌和时间预算的不同,而这些数据通常不是标题中的显性指标。阿里巴巴在其脚注中提到,其编码测试设置了五小时的超时限制,在PaperBench上每轮测试最长可达12小时。相比之下,独立测试平台VulcanBench仅允许45至60分钟的时间预算。阿里巴巴方面的时间预算是独立测试的5到16倍,这足以解释测试结果的巨大差异。
评估智能体模型的新标准
在选择智能体模型时,我们需要采用两种新方法来考虑这些差异。首先,应使用每个成功任务的成本作为评估指标:总支出(包括所有失败尝试的费用)除以通过验收检查的任务数量。其次,时间和令牌预算应成为明确的验收标准,而非隐藏细节。
过去,令牌价格预测总体费用的时代已经过去。以Qwen为例:推理模型需要消耗推理令牌才能得到结果。一个将大部分令牌预算用于推理的模型可能在写出答案前就达到了令牌上限,导致返回空结果,这与完全失败无异,但成本却是完整运行的代价。
人工智能分析平台(Artificial Analysis)提供了最清晰的公开测量数据:在最大努力级别下运行其智能指数测试时,DeepSeek-V4-Flash消耗了2.1亿个输出令牌,而类别中位数仅为1亿。尽管由于令牌价格低廉,绝对成本仍然保持低位,但冗长性消耗的不仅是金钱,还有时间,这可能导致某些应用场景无法使用。
失败率与配置设置的关系
产生错误答案的运行和超出预算的运行是不同的事件,需要不同的修复方法。几乎所有测试平台都无法区分这两种情况,几乎所有排行榜也不会报告这种差异。在构建自己的智能体基准测试时,我遇到了这个问题:测试平台只记录了失败,没有说明原因,我不得不自己添加这种区分。当将它们分开时,预算耗尽往往是主导因素。
7月发布的《Long-Horizon-Terminal-Bench》测试在共享测试平台上对17个前沿模型执行了46项任务,每个模型每项任务有90分钟的尝试时间。未解决的运行中,79%是由于超时,19%是智能体自行停止,3%是测试平台错误。作者谨慎地解释了这一结果的含义:超时的运行并未接近完成,平均奖励在0.10到0.35之间,因此不能假设更多时间会导致成功。但教训是:无论是否明确提及,基准测试都在隐性地衡量时间效率。
最清晰的机制案例来自VulcanBench,即Qwen图表背后的同一开源测试平台。在7月26日的报告中,Claude Opus 5的低努力设置表现最佳,解决了23项任务中的20项,而高努力级别仅解决了18项。额外的推理并非无用:高努力级别返回的错误答案最少,仅1个,而其他设置为3个。但它耗尽了时间,超时得分为零。其三个退步中的两个是在低努力级别能够解决的任务上被截断的,即使给予无限时间,它也只能以3.1倍的成本与其最便宜的设置打成平手。
行业新趋势:按成功任务计费
最近几个月,多个组织独立采用了每个成功任务的成本作为评估指标,这表明这一标准正在成为行业新趋势。
VulcanBench将每解决任务的成本作为标题栏进行报告,并从最早的报告开始就采用这一方式。《Long-Horizon-Terminal-Bench》在准确率旁边发布每任务成本,其中最有启发性的数据是GPT-5.4,每个任务约26美元,但通过率远低于Grok 4.5的约11美元。TestEvo-Bench在成本上限下运行智能体,Claude Code的测试生成分数在更严格的上限下从71%降至44%。
供应商已经接受了按成功任务计费的理念。HubSpot在4月将其Breeze客户智能体从每处理会话1美元改为每解决会话50美分。Zendesk按自动化解决方案计费。Fin按结果收费99美分,仅在端到端解决后才计费。
立即实施的改进建议
-
在每次智能体运行中必须输出失败原因,将预算耗尽、验证失败和测试平台错误作为不同值而非单一失败标志。在无法区分超时和错误答案之前,通过率同时衡量两个因素,无法确定需要修复哪一个。
-
计算每个努力级别的每个成功任务成本,而不仅是每个模型的总成本。包括失败尝试在内的总支出,除以通过验收检查的任务数量。排名不会与费率表匹配,最便宜的设置很可能获胜。
-
除非延迟确实是服务目标的一部分,否则应设置令牌上限而非墙钟时间上限。墙钟时间上限将提供商的服务速度评分视为模型质量。
-
检查已部署系统的默认努力设置。Qwen 3.8-Max在未设置努力字段时以最高推理级别运行,而独立测试中其最高设置表现最差。从不调整此参数的团队实际上运行的是每个解决任务成本最高的配置。
关注微信号:智享开源 ,及时了解更新信息。


公众号:智享开源
还没有任何评论,你来说两句吧!