Meta推出Muse编程工具,持异步智能体进军AI战场

Meta推出Muse编程工具,持异步智能体进军AI战场

今日,Meta正式发布了一款名为Muse Code的终端AI编程智能体,目前处于测试阶段,同时推出了Muse Spark 1.2,这是其Muse Spark系列前沿模型的编码专注型更新。这一双管齐下的举措,使该公司直接与Anthropic的Claude Code、OpenAI的Codex以及日益壮大的智能体编码领域展开竞争,后者已成为众多专业开发者交付软件的主要方式。

Meta联合创始人兼CEO马克·扎克伯格在竞争对手社交网络X平台(使用其长期使用的@finkd账号)发帖称:”今天我们以测试版形式发布了Muse Code。这是一个终端编程智能体,能够处理大型仓库中的完整软件工程任务:规划变更、编写代码、验证结果。”

此次发布标志着Meta迄今为止对该领域最认真的介入,而此前该公司大多只是旁观者。

虽然Anthropic和OpenAI已将他们的编程智能体打造成旗舰产品,像Cursor这样的初创公司也基于这一工作模式建立了价值十亿美元的业务,但Meta的开发者故事长期围绕Llama展开,这是该公司开源的模型系列,下载量已超过十亿次。

Muse Code从多方面改变了这一局面:它是一个完整的工具集,可通过单个curl命令在macOS或Linux上安装,与其底层模型共同训练,并且与支持它的Muse Spark模型一样,完全是专有的。

然而,扎克伯格在X上回复一个问题时暗示开源可能适用于Muse Spark或其他产品,并表示”我很快会有更多相关信息分享。”

开发者和潜在用户现在可以使用以下单行命令在终端上安装它,但请注意,如果您想尝试,需要先使用Meta账户登录并提供计费详情:curl -fsSL https://dev.meta.ai/install.sh | bash

持久的背景智能体与并行工作树

Muse Code的核心架构赌注是Meta所称的异步背景智能体。

与大多数竞争对手工具每次任务都生成新的辅助智能体不同,Muse Code在整个会话期间保持一组专业化背景智能体活跃。

根据Meta的博客文章,这些智能体”在整个会话期间保持活跃,而不是为单个任务生成,帮助避免冗余信息收集”,自主执行后续步骤,并选择何时向主智能体报告。

其实际优势是降低了延迟并减少了人工干预:已经了解仓库的智能体不需要在每次开发者提出新请求时都重新探索。

当任务足够大时,Muse Code会分散到单独的并行子智能体工作,每个都在其独立的git工作树中,因此开发者的工作副本永远不会被触及。

扎克伯格在X上写道:”在测试中,我们让它同时为游戏构建六个功能,没有发生任何冲突。”

工作树隔离和并行子智能体存在于竞争工具中,但Meta将持久性与并行性相结合作为其差异化特点。

第二个显著的设计选择是可审计性。每个模型调用、工具运行、批准和编辑在执行前都会附加到本地事件日志中——这是Meta所称的”单一事实来源”,使运行时能够”精确重放和安全重启”。

如果Muse Code在长时间任务运行20小时后崩溃,它会精确地从停止处恢复,没有丢失工作,也不需要重新提示。对于曾被不透明智能体运行困扰的工程领导者来说,完整的本地审计记录可能成为企业评估中最重要的功能。

Muse Code还捆绑了看起来与竞争对手工具用户熟悉的”技能”:/plan将任务转变为需要批准的计划,/grill对计划进行压力测试直到它成立,而/goal推动智能体完成既定目标。

Muse Spark 1.2:与自身工具共同训练

Muse Spark 1.2是底层技术,Meta将其描述为Muse Spark 1.1的编码专注型更新,具有”在编码任务上显著扩展的训练计算”和更广泛的训练环境多样性,改进了代码生成、复杂调试和代码库理解,同时保持通用智能体能力。

这次更新直接针对Muse系列最薄弱的环节。当最初的Muse Spark在4月首次亮相时,它在前沿推理和视觉基准测试中使Meta重回前五名,但在对市场最重要的智能体编码评估中表现不佳,在SWE-Bench Verified上得分为77.4,而Claude Opus 4.6为80.8,Gemini 3.1 Pro为80.6,并且在GDPval衡量长期工作任务的指标上远远落后于GPT-5.4。

四个月后,一个编码专用检查点与专门设计的工具结合,可以看作Meta对该差距的直接回应。

有两个训练细节值得关注。首先,Meta使用Muse Code本身共同训练模型,使用拒绝采样的工具轨迹和针对目标、上下文压缩和子智能体的配方优化——这意味着模型被明确调整为在此特定工具中表现最佳。这反映了行业从将模型和工具视为可分离产品的广泛转变。

其次,Meta使用了一个自我改进循环:Muse Spark 1.1生成具有挑战性的编码环境和指令遵循模板,然后根据这些要求评估候选解决方案,为其后继者生产可扩展的训练数据集。Meta将此循环归功于使1.2在遵循复杂指令方面明显更好。

Meta发布了基准图表,将Muse Spark 1.2与其他编码模型在Terminal-Bench 2.1、DeepSWE 1.1和Meta内部编码基准上进行比较,引导读者查看单独的方法报告了解详情——尽管公告文本本身没有宣传任何排名,这在竞争对手宣传排行榜胜利的领域是一种不同寻常的克制。图表解释了原因:它们显示了一个强劲但明显的第二位置。

在Terminal-Bench 2.1上,在Muse Code中运行的Muse Spark 1.2得分为82.9%,略高于OpenAI的GPT-5.6 Terra在Codex中的得分(81.8%)和xAI的Grok 4.5在Grok Build中的得分(81.6%),但落后于在Claude Code中全力以赴的Anthropic的Opus 5,后者以86.7%领先。

在DeepSWE 1.1上,Muse Spark 1.2得分为59.3%,排名第三,落后于Opus 5(65.0%)和GPT-5.6 Terra(64.8%)。最引人注目的是Meta自己的内部编码基准,其中Muse Spark 1.2的70.6%轻松击败了GPT-5.6 Terra(65.4%)和Gemini 3.6 Flash(63.9%),但仍落后Opus 5的79.4%近九个百分点——这是一个罕见的坦承,即使在Meta自己设计的测试中,Anthropic的模型仍然获胜。确实,Claude在所有三个图表上都位居榜首。

尽管如此,代际改进是真实的:Muse Spark 1.2在Terminal-Bench上比1.1提高了6.7分,在DeepSWE上提高了6.3分。图表标签中埋藏的一个注意事项是…

Muse Code代表着Meta在AI编程领域的重大突破,通过其创新的异步背景智能体技术,为开发者提供了更高效、更可靠的编程体验。尽管在基准测试中仍略逊于一些竞争对手,但其快速迭代和自我改进的承诺表明,Meta正在积极缩小与行业领先者的差距。


关注微信号:智享开源 ,及时了解更新信息。

原文链接:https://venturebeat.com/orchestration/meta-enters-the-ai-coding-wars-with-muse-spark-1-2-and-muse-code-with-persistent-async-background-agents

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2384篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类