Meta新模型:8B规模媲美Claude Opus 4.5
想象一个智能体需要处理复杂的企业级工作流程,比如将大批量客户记录从传统CRM系统迁移到云数据库。对于持续数小时的任务,智能体不能仅依赖其内部上下文窗口,而是需要运行时层,也就是我们所说的”智能体支架”(harness)。
这种支架能够提供执行反馈,如服务器日志,帮助智能体保持对动态API连接的准确理解。它还提供状态跟踪器和控制流机制来管理已完成和待处理的子目标,确保智能体不会跳过或重复处理数据批次。当出现意外错误,例如数据库因严格的API速率限制拒绝处理某一批次数据时,支架会提供工具和指令,帮助智能体恢复。

目前,指导智能体何时以及如何使用其工具的主要方式是由人类开发人员编写一套规则和指令,告诉它一步步该做什么。例如,开发人员可能会指示智能体在撰写邮件前先搜索公司维基百科。由于智能体只是遵循固定脚本,它缺乏真正的自主性,没有经过独立权衡行动成本和效益的训练。
为解决这一问题,Meta AI与伊利诺伊大学厄巴纳-香槟分校的研究人员引入了EvoHarness-RL框架,该框架为智能体的支架添加了一层抽象,并教会底层模型何时读取、更新或整合从环境中获取的信息。
在长时间跨度任务中,AI智能体如何读取和处理从环境中获取的信息对其成功至关重要。智能体必须更新其对环境的理解,跟踪已完成和待处理的子目标,从失败的操作中恢复,并重用先前经验中的程序。这种执行依赖于支架系统。
像Harness-1等一系列自进化智能体框架通过积累过去的轨迹并将其提炼为结构化的程序记忆(即可重用的技能、工作流程或代码库),解决了部分问题,为未来任务提供支持。然而,这些方法通常将长期技能培养与实时、单次内的状态跟踪分开。它们没有积极训练智能体如何在工作中管理即时的环境现实或跟踪其活跃的任务步骤。
EvoHarness-RL论文的合著者宁雪莹(VentureBeat)表示,手动逻辑和僵化的内存结构是消耗工程资源的主要因素。
“最佳的支架通常随模型而变化,”宁解释道,”不同的模型可能需要不同的提示、内存设计、权限或沙箱配置。如果所有这些都由人工编码,每次模型升级都可能导致另一个漫长的调优和调试周期。”
此外,仅积累经验的现有内存系统可能会主动降低智能体的推理能力。”仅追加式内存假设更多上下文总是有帮助,但这不一定正确,”宁说,”在长时间任务中,内存可能包含过时的结论、失败的尝试或不再相关的信息。”因此,长时间跨度智能体需要一种能够更新、压缩和替换信息的动态内存,以避免重复过去的错误。
EvoHarness-RL:统一的信念、进度和经验工作空间
为了克服僵化手动提示的局限性,研究人员引入了EvoHarness-RL,这是一种训练技术,教导智能体有效利用其支架。智能体不再盲目遵循硬编码指令,而是学习如何从混乱的执行数据中构建结构化的工作空间,并在复杂工作流程中决定何时以及如何咨询该外部状态。
为简化支架不同组件的管理,EvoHarness-RL将智能体的支持系统整合到单一、统一的界面中。这个被称为”信念、进度和经验”(BPE)的界面,将智能体的外部需求分为三个功能区域:
信念:保持对当前环境的准确感知。
进度:管理已完成和待处理的子目标。
经验:跨任务重用历史知识。
智能体使用四个紧凑的元动作与这个简洁的仪表盘进行交互,而不是使用复杂的领域特定API:跟踪(track)、提交(commit)、回忆(recall)和记录(note)。它发出命令来跟踪实时环境,提交工作流程更新,在行动前回忆过去的策略,并记录笔记以保存新发现的见解供未来运行使用。
这些状态直接映射到高价值的企业垂直领域。”在软件工程中,信念可以代表智能体对当前代码库的理解,”宁详细说明,解释智能体如何监控组件交互和工作空间变化。”进度跟踪已完成的内容、仍需完成的任务以及哪些步骤依赖于其他步骤。”同时,经验部分捕获经验教训,如用户对错误的反馈,以指导未来行动。
同样的理念也适用于金融领域,宁表示。在合规审计期间,信念可能描述适用的规则和可用证据。进度跟踪已完成的检查和仍待解决的异常。经验帮助智能体识别重复出现的差异或知道何时应该升级问题。
“这些状态共同帮助智能体保持对工作的跟踪或避免重复相同的失败方法,”宁说。
为了教会智能体管理外部工作空间的机制和策略,研究人员设计了两阶段训练方法。在第一阶段,监督支架微调,基础模型学习如何从混乱的交互日志中提取和构建有用的事实到BPE框架中。
然而,查询内存或更新跟踪器会消耗时间和计算资源,这意味着智能体不能在每个步骤都盲目检查其工具。为解决这个问题,第二阶段使用”成本感知”强化学习来教导智能体提高效率。这一阶段训练智能体计算访问其外部状态是否值得预算成本。这个两步过程将工具使用从僵化的硬编码提示转变为学习到的运行时行为。
EvoHarness-RL的实际应用
为验证EvoHarness-RL,研究人员使用ALFWorld基准测试评估了该系统,这是一个文本环境,包含测试序列逻辑和状态跟踪的多步骤任务。
他们使用Qwen3-8B作为基础模型进行训练。团队将训练后的8B模型与三个前沿大模型(Claude Opus 4.5、GPT-4.1和GPT-5)、具有静态工具的冻结智能体框架(如ReAct、ExpeL和ReasoningBank)以及高级可训练方法(如标准GRPO、SkillOS和SkillRL)进行比较。
结果表明,较小且经济高效的模型性能有了显著提升。通过EvoHarness-RL,Qwen3-8B模型实现了96.9%的平均成功率,比其基线ReAct对手提高了49.0个百分点。
此外,训练后的模型性能超越了高级可训练框架,如SkillRL(89.9%)和SkillOS(80.2%)。对企业开发者而言,最令人印象深刻的是…
关注微信号:智享开源 ,及时了解更新信息。


公众号:智享开源
还没有任何评论,你来说两句吧!