智能体动态路由:Nvidia Switchyard降本增效新方案

智能体动态路由:Nvidia Switchyard降本增效新方案

持续运行的智能体系统一直面临两难选择。若将所有任务都交给前沿模型处理,成本会迅速攀升;而构建自定义路由逻辑将任务分配给更经济的模型,则演变成一项需要持续维护的工程难题,尤其是在工作流程发生变化时。

针对这一难题的两端,Nvidia提出了创新解决方案。该公司于周二推出Nemotron 3.5 Lightning——一个专为高容量、专业化智能体任务设计的300亿参数开放混合专家模型,同时发布了NeMo Switchyard——一个开源库,能够将智能体工作流程的每个步骤路由到最适合的模型。

性能数据与市场定位

根据Nvidia提供的数据,Lightning的输出速度可达同类模型的4倍,在准确率相当的情况下,完成智能体任务的速度比Qwen3.6-35B快约30%。通过Switchyard的配合,这套组合方案能够在保持前沿级任务完成率的同时,将基准测试成本降至单独运行Opus 4.8的三分之一左右。

这一发布时机正值行业开放模型竞争最为激烈的时期。自春季以来,阿里巴巴、月之暗面、智谱AI和DeepSeek等中国企业纷纷推出竞争性开放模型,其中多个模型性能达到或接近前沿水平,并在模型规模或价格上优于美国实验室。Meta也加入了这一竞争行列,发布了其300亿参数的开放智能体模型Muse Glimmer。短短数月间,开放权重模型已从差异化优势转变为行业标配,而Nvidia的发布恰逢其时。

这套组合方案的核心在于模型与路由器的协同作用。单一模型无法解决成本问题,而单独的路由器则缺乏高效路由的目标。Nvidia相信,在模型层和路由层同时应用开源技术,才能真正推动智能体AI的成本优化,而非仅依赖某个更便宜的模型或为他人系统添加的更智能路由器。

Switchyard的工作机制

模型路由并非全新概念。OpenRouter、LiteLLM以及多家独立路由初创公司已允许开发者在多个提供商间分配流量。Switchyard与这些系统兼容,而非完全取代它们。

Switchyard解决的核心问题是,随着智能体在任务推进中,最适合的模型会发生变化。智能体的状态会随着工具返回结果、出现错误或某步骤被证明是常规而非复杂而转变,而固定的模型选择无法适应这些变化。

Briske描述了能够响应这种变化状态而非静态任务类别的路由策略。

“它包含多种路由策略,”Briske表示,”你可以使用随机路由器(效果不佳),或采用智能体状态路由或分类器路由。根据你的路由策略,系统会选择最佳模型。在某些情况下,对于高效任务,你可能希望使用Lightning这样的模型,路由器会从模型池中选择Lightning。”

成本直接参与路由决策,而非事后考虑。在回答提问时,Briske表示Switchyard可以评估模型的冗长程度,即给定模型在任务中倾向于生成的令牌数量,并利用这一预测在调用前将工作引导至更经济的选择。

生态系统集成与测试成果

Switchyard之所以不会成为另一个集成项目,关键在于其定位。Nvidia将合作伙伴分为两类:直接调用Switchyard的智能体框架,包括Cognition、LangChain和Nous Research;以及将Switchyard支持内置其产品的LLM网关,包括Kong、LiteLLM和OpenRouter。Kong已在Kong AI Gateway中原生集成Switchyard。Briske在描述该库如何融入现有路由生态系统时也提到了相同的网关合作伙伴列表。

“我们是生态系统的支持者,确保能够无缝集成,”Briske表示,”我们已与OpenRouter、LiteLLM和Kong合作,他们已整合了我们的路由算法,因此您可以在使用现有最佳工具的同时直接选用它。”

Nvidia分享了九家测试Switchyard公司的结果,其中几家提供了具体数据。LangChain报告称,在145个多轮Deep Agents任务中,仅将7%的调用路由至前沿模型,便实现了74%的成本降低,同时仅有6%的准确率折损。Ramp表示,在Ramp SWE-Bench上匹配了前沿模型的性能,同时降低了58%的成本和33%的运行时间。Cognition将Switchyard的分阶段路由器集成到Devin Desktop用于内部,并在FrontierCode Main上实现了接近前沿的性能,相对于将所有任务路由至单一前沿模型,平均成本降低了28%。

Lightning的架构与性能优势

Nemotron 3.5 Lightning本身就是一个独立的开放模型,专为高容量、专业化智能体任务设计,而非通用用途。

它延续了Nvidia在2025年12月推出的Nemotron 3系列中引入的混合Mamba-Transformer、潜在混合专家架构,该架构也是Nemotron 3 Super的基础。Nvidia在其后训练比较中以此作为Lightning的基准。在类似Switchyard的路由设置中,Lightning被定位在决策的快速、经济端,而非前沿端,但它可独立于任何路由器运行和部署。

根据通用能力基准的数据,Lightning得分为24,与gpt-oss-120b持平,但低于得分为30的Nemotron 3 Super、Gemma 4 31B、Claude 4.5 Haiku和Mistral Medium 3.5。Lightning在其规模类别中并非通用智能领导者,Nvidia也未如此声称。

Nvidia的实际主张更为具体:根据其提供的数据,Lightning在PinchBench(涵盖编码、研究和文件管理的实际智能体任务基准)上,准确率与Qwen3.6-35B相当,但速度快约30%;与Gemma 4 26B相比,在相似完成时间内获得更高准确率。这是一种速度与准确率的权衡,而非能力上的胜出。

后训练阶段是Nvidia声称更大优势显现的地方。公司分享了四家早期合作伙伴的前后对比数据:CrowdStrike针对Nemotron 3 Super基线的恶意内容召回、CodeRabbit针对GPT 5.4 Nano基线的编码路由、Harvey和Trajectory针对Opus 4.6基线的法律任务完成,以及Lila Sciences针对Opus 4.8基线的能源模拟工作。


关注微信号:智享开源 ,及时了解更新信息。

原文链接:https://venturebeat.com/orchestration/nvidias-switchyard-router-reshuffles-ai-models-mid-task-cutting-task-costs-to-a-third-in-its-own-tests

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2503篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类