四智能体协作超越Claude Opus 4.8

四智能体协作超越Claude Opus 4.8

随着企业代码库规模不断扩大,负责分析代码的AI智能体在处理需要多次交互和工具调用的长期任务时正面临巨大压力。将工作分配给一组智能体似乎是显而易见的解决方案,但这引入了一个致命缺陷:大多数多智能体系统并非设计用于智能体在任务执行过程中实时协调。

为解决这一问题,Coral AI实验室和多家大学的研究人员引入了AgentRadio,这是一种异步消息传递层,允许智能体在执行步骤之间进行通信,而不会中断其主要工作。在子任务高度依赖的现实企业应用中,这种架构使智能体能够进行中途修正,而不是沿着错误路径执行直到正式审查阶段。

在生产库的长周期问题基准测试中,由Agent驱动的智能体团队几乎将四个独立工作的Claude Code智能体的任务准确率提高了一倍。它也超越了运行在更先进模型上的单个智能体。对于AI从业者而言,AgentRadio表明,正确的协调结构可以超越原始计算能力和模型规模。

代码库理解的挑战

基于大语言模型的智能体越来越擅长处理需要与不同工具和环境交互的长期任务。代码库理解代表了这一挑战的极端版本。它需要AI智能体构建软件、执行它、跨多个文件跟踪执行路径,并在长时间内综合证据。

在这些条件下,单智能体系统通常会因”覆盖问题”而崩溃。

《AgentRadio》论文的合著者Xinxing Ren、Caelum Forder和Peter Carroll解释:”单个智能体遵循存储库中的一个序列路径。”随着上下文的增长,”初始计划变得越来越难以修改,调查后期发现的发现并不总是能够传播。”模型通常可以执行单个步骤,但”困难之处在于在整个长期调查中保持每一个义务、依赖和矛盾证据的活跃状态。”

有助于衡量AI在大型代码库上性能的一个基准是SWE-Atlas QnA。这个基准包含对活跃生产库的长周期、自然语言问题。这些任务不能仅通过探索代码来解决。AI智能体必须运行软件并执行多个命令来找到答案。

根据研究团队的实验,在Opus 4.6上运行的单个Claude Code实例仅解决了32.3%的任务。升级到更先进的模型如Opus 4.8,成功率仅为57.2%。

一个自然的补救措施是将工作负载分配给多个智能体,让每个智能体处理更小、更清晰的上下文。当任务可以清晰地分解时,多智能体解决方案可以提供显著的性能提升,这意味着它们可以单独解决并在最后合并。

然而,代码库理解很少能够清晰地分解。子任务高度相互依赖。一个智能体发现的关键配置文件或错误可能会完全重写或改变另一个智能体的整个探索路径。由于这些依赖关系,智能体必须实时协调、协商和分享中间发现。

尽管有这种需求,异步多智能体通信仍然罕见。研究人员指出,现有的多智能体系统通常存在三种有缺陷的模式:

    并行但隔离:智能体同时运行但不进行任何通信。

    并行但轮次同步:智能体可以进行通信,但仅在严格的、同步的轮次边界上。这迫使智能体停下来等待彼此完成一个轮次,然后才能辩论或交换中间发现。基于轮次的系统假设重要发现可以等待到下一个通信阶段,当智能体在系统的相互依赖部分工作时,这是一个昂贵的假设。例如,调查API症状的智能体可能会发现使存储智能体当前假设无效的证据。”如果该信息等待两个智能体都完成,存储调查可能会沿着错误路径完成,”研究人员说。

    相邻形式的异步性:这些系统提供有限的异步功能,如自上而下的任务分配。它们没有智能体之间的点对点横向通道或共享记忆,需要智能体主动暂停工作以读取更新。

研究人员在论文中指出,阻碍当前多智能体系统的主要瓶颈是”工作的智能体无法同时监听”。

“据我们所知,没有现有系统能够让同时工作的智能体通过横向、自然语言通道被动地感知彼此,”研究人员写道。

AgentRadio的工作原理

为了解决工作和监听之间的相互排斥,研究人员开发了AgentRadio,这是一个异步消息传递层,设计用于直接插入现有的编码智能体工具中。

AgentRadio为智能体配备了三个基本操作:

    create_thread操作:在参与智能体之间开启对话。

    send_message操作:将消息附加到线程并返回,而不阻塞发送智能体。

    wait_for_mention操作:阻塞进程,直到提到调用者的消息到达。它传递消息以及所有线程的完整快照,以便智能体立即获得上下文。

这组操作使智能体能够处于”被动感知”状态,它们可以在继续其主要任务的同时在后台传递消息和更新知识。

AgentRadio的代码在GitHub上以Apache 2.0许可证提供。它设计为轻量级,无需对底层智能体工具(如Claude Code或Codex CLI)进行直接修改。

该架构由两个主要部分组成:

    消息服务器:一个独立进程,充当中央枢纽,存储所有活动线程、消息和提及。

    工具端集成:智能体使用三个简单的shell脚本与服务器交互,每个脚本对应一个基本操作。

系统工作的唯一严格要求是智能体工具必须能够将shell命令作为后台任务运行。智能体在其系统提示中被指示保持一个观察者运行,并通过提供的脚本发送消息。在后台运行wait_for_mention脚本允许智能体继续其工作并异步接收通知。

研究人员说:”要将其集成到现有堆栈中,团队仍然需要一个’薄的适配器,用于启动工作程序、分配身份、将它们连接到共享服务器并管理最终合成’。”这项工作围绕着编码智能体,而不是需要更改底层模型。

AgentRadio的实际应用

为验证AgentRadio的实际效用,研究人员在SWE-Atlas QnA基准测试的124个任务上测试了该框架。这些测试涵盖了系统设计、根本原因分析、安全和API集成等领域。

研究人员使用Claude Opus 4.6和DeepSeek V4 Pro作为骨干模型。对于工具,他们评估了从单个智能体到四个智能体团队的配置。

在测试中,四个使用AgentRadio协调的Claude Opus 4.6智能体的任务完成率达到了92.7%,远高于单个智能体的32.3%。与独立工作的四个智能体相比,使用AgentRadio的智能体团队将准确率从48.5%提高到92.7%,几乎是翻倍。

研究团队还测试了使用DeepSeek V4 Pro模型的情况。单个智能体的成功率为51.2%,而四个使用AgentRadio协调的智能体达到了85.5%的成功率,比独立工作的四个智能体高出30多个百分点。

研究人员指出,AgentRadio的最大优势在于它允许智能体在发现关键信息时实时调整方向,而不是沿着错误路径继续前进。这种能力在复杂的企业代码库中尤为重要,因为在这些代码库中,一个微小的发现可能会彻底改变整个调查方向。


关注微信号:智享开源,及时了解更新信息。

原文链接:https://venturebeat.com/orchestration/four-ai-agents-coordinating-in-real-time-outperformed-claude-opus-4-8-on-enterprise-coding-tasks

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2425篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类