智能体架构优化,成本降低40%

智能体架构优化,成本降低40%

企业AI面临的ROI困境

当前企业AI应用正面临一个ROI悖论。虽然在产品实验阶段,通过向基础模型投入更多计算资源能够取得良好效果,但当产品投入生产环境后,成本却变得难以承受。

Writer公司研究人员发表的一篇新论文为工程团队提供了一种可实施的解决方案。这项研究系统地审视了围绕基础模型的编排层(即AI harness)各个组件的优化方法。

通过优化harness,研究人员展示了每任务token数量的显著减少,成功任务成本最高降低61%,同时质量保持稳定,这一切都无需更改底层基础模型。

由于harness完全由开发者控制且无需模型微调,工程团队可以应用这些研究成果来构建高度成本效益的AI应用。

Tokenmaxxing的ROI危机

当前AI工程领域普遍存在一种被称为”tokenmaxxing”的行业趋势,即开发者依赖庞大的上下文窗口和强制性的token消耗作为良好系统设计的替代方案。

开发者们没有设计优雅的工作流程,而是引入了传统软件开发的一种本能反应:生成、运行、失败、将错误和更多上下文重新放入窗口,然后重试。

“团队采用tokenmaxxing是因为这是当时最廉价的解决方案,而且这确实是大多数工程师今天的工作方式,”Writer公司CTO兼联合创始人Waseem AlShikh告诉VentureBeat。由于这种方法在编码任务上经常成功,它已成为所有其他智能体工作负载的默认本能反应。危险在于,每token价格的下降掩盖了潜在的效率低下。

“你的账单是每任务token数量乘以每token价格,而大多数团队只关注第二个数字,”AlShikh说。”在智能体工作负载中,每任务token数量呈复合增长——每次循环迭代都会重新传输不断增长的上下文——并且其增长速度快于价格下降的速度。价格削减成了一种麻醉剂,它掩盖了循环本身正在失血的事实。”

Tokenmaxxing会导致几种企业失败模式。团队默认将简单任务路由到优质前沿模型。他们使用LLM作为懒惰的搜索索引,将原始文档塞入上下文窗口,而不是检索精确答案。最具破坏性的是,他们构建无约束的智能体循环,当模型遇到错误时,这些循环会失控。由于在所有主要模型提供商中,输出token的成本显著高于输入token,低效的任务执行成为无声的预算杀手。

行业已经引入了几种效率技术来控制这些成本,但它们大多效果不佳,因为它们孤立地看待模型:

  • 提示压缩:压缩输入文本以节省空间,但忽略了系统如何在复杂工作流程中排序这些输入。
  • 预算推理:限制模型可以采取的计算步骤,但如果工作流程没有得到智能路由,这通常会降低输出质量。
  • 简洁编码:强制模型输出最少的代码以节省输出token,但对解决低效的工具调用无能为力。
  • 推测解码:使用较小的草稿模型加速较大模型的文本生成,优化推理速度,但未能解决臃肿的智能体架构问题。

这些努力之所以失败,是因为它们优化了引擎而忽视了传输。它们没有审视编排层,导致底层架构效率低下的问题仍未解决。

解析harness:效率的杠杆

Harness是将底层LLM转化为工作系统的编排层,负责路由、格式化和转换。

Harness优化的核心杠杆包括系统提示缓存、交互历史压缩、工具管理、检索策略和错误管理。对于寻求提高AI性能的工程团队来说,这些是最容易干预的切入点。

正如Writer研究人员在研究中指出的:”如果harness是将模型调用组合成工作的层,它也是设定工作价格的层。”

历史上,开发者将harness视为一次性的粘合代码,仅用于将API连接到用户界面。这项研究表明,harness现在必须被视为一等对象:一个需要自己测试、版本控制和严谨设计的主要软件工件。

对于企业而言,这重新定义了”自有与租赁”的决策。

“企业花费数月进行模型评估,然后从货架上租赁其编排层——这意味着他们在优化较小的杠杆,而将较大的杠杆外包,”AlShikh说。”谁拥有harness,谁就拥有你的单位经济,而为演示调整的开放框架并非为你的账单调整。”

实验细节

为了隔离编排层的影响,研究人员在多个供应商和权重类别的六个基础模型上进行了实验:Claude Sonnet 4.6、Gemini 3.1、Gemini Flash 3.5、Qwen 3.6、GLM 5.1以及Writer自己的Palmyra X6模型。

他们的实验将一个冻结的、传统的生产智能体循环与完成的Writer智能体Harness在相同的22个锁定企业任务上进行了比较,这些任务涵盖基础检索、多步骤工作流程、工具使用和内容生成等能力。通过保持模型和任务不变,他们可以隔离编排层本身的影响。

优化后的harness显著降低了成本,将混合任务成本降低了41%,从21美分降至12美分。这主要通过减少token消耗实现,每任务的token数量从14.2k减少到8.8k,降幅达38%。

Harness被设计为将搜索等任务委托给专门的子智能体。子智能体仅接收其需要的工具和特定查询,检索精确数据,并返回一个有上限的干净摘要给主智能体——防止主上下文窗口被原始搜索结果填满。

即使token使用减少,任务成功率仍然保持稳定——从78%提高到81%,研究人员描述这是一种方向性增长而非在样本量上具有统计学意义,这意味着质量没有下降,而成本却降低了。

端到端任务延迟也显著降低,由于提示缓存和消除了死胡同推理循环,中位墙钟时间减少了44%,从48秒降至27秒。

然而,研究人员也发现了多智能体编排的局限性。像Gemini Flash 3.5和Qwen 3.6这样的较小模型在子智能体委托任务上的得分远低于可用可靠性阈值(分别为0.45和0.42)——在轻量级模型上,这种能力尚不可靠。

子智能体编排仅在测试的两个最强模型上跨过了可用可靠性阈值:Writer自己的Palmyra X6(0.86)和Claude Sonnet 4.6(0.85)。

开发者的行动指南:可行的启示与权衡

该研究的结果转化为企业开发者构建大规模智能体工作流程的行动指南。第一步是实施AlShikh所说的”双区提示”和”上下文卸载”策略。


关注微信号:智享开源 ,及时了解更新信息。

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2081篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类