智能编程新标杆:Laguna S 2.1震撼登场

智能编程新标杆:Laguna S 2.1震撼登场

Poolside,这家旧金山AI实验室在过去三年间一直低调地向政府和防御机构销售编程模型,于周二发布了其迄今为止最强大的模型——Laguna S 2.1。这家实验室做出了一个大胆的赌注:真正的透明度而非原始规模,是小型实验室如何在前沿领域竞争的关键。

Laguna S 2.1是一个拥有1180亿参数的混合专家(MoE)系统,每次仅激活80亿参数,支持长达100万个token的上下文窗口。根据公司发布的基准测试结果,该模型在智能体编程任务上的表现与规模大数倍的开源模型相当或更优。模型权重现已通过宽松的OpenMDW-1.1许可在Hugging Face平台上公开可用。

对于这样一个小型模型而言,这些数据指标令人瞩目。Poolside报告称,Laguna S 2.1在终端任务基准测试Terminal-Bench 2.1上得分为70.2%,在公司编制的排行榜上排名第11位,领先于DeepSeek-V4-Pro-Max(拥有1.6万亿参数,得分64.0)、Thinking Machines的9750亿参数Inkling模型(得分63.8)以及Nvidia的5500亿参数Nemotron 3 Ultra(得分56.4)。在SWE-Bench多语言测试中,该模型得分为78.5%,在SWE-Bench Pro的公开数据集上得分为59.4%。

比任何单一分数更能说明问题的是:该模型从5月22日开始预训练到公开发布,用时不足九周,训练使用了4096块Nvidia H200 GPU。在一个旗舰模型周期通常以季度或年为单位衡量的行业里,Poolside在三个月内已发布三个模型。

西方开源AI差距为何成为董事会议题

此次发布正值关于开源AI来源的争论日益激烈之际。过去一年,开发者采用已明显转向开放权重系统——企业可以下载、检查并在自己基础设施上运行的系统——而这一类别中的领先选项绝大多数来自中国实验室。DeepSeek、Qwen、Kimi、GLM、MiniMax以及腾讯的混元模型在Poolside自己的比较表中都占有突出地位。

Poolside随附的新闻稿明确将Laguna S 2.1定位为对此的回应,指出该模型占据的规模类别在过去11个月中——自去年8月OpenAI的gpt-oss-120b以来——没有一家西方实验室发布过开放权重模型。Poolside联合CEO Jason Warner在公告中表示:”西方需要值得信任、可运行和可构建的开源模型。”

联合创始人兼联合CEO Eiso Kant在X平台上的长篇帖子中阐明了其中的哲学意义。”我相信智能应该并将成为一种商品,”他写道,认为开放生态系统”不会通过在自身类别中做到最好而取胜。”他辩称,用户只是想要适合手头任务的最佳智能——因此开放模型必须与封闭模型相当或更好。

这里的战略逻辑并非出于慈善。Poolside的核心业务是在政府、防御机构和受监管企业的安全边界内部署模型——对于这些客户而言,由于合规和主权原因,封闭的计量API访问通常不是可行选项。

今天采用中国开源模型的每个企业都将成为明天更难争取的客户。发布具有竞争力的开放权重既是生态系统布局,也是公司高安全性部署业务的漏斗顶端策略。这也将AI竞赛从Poolside无法竞争的领域——前沿规模的资本支出——转向其认为自己能够竞争的领域:每个token的成本、自托管和迭代速度。

稀疏架构如何使企业AI智能体运行成本降低

技术设计反映了关于编程AI价值走向的特定论点。根据Hugging Face模型卡信息,Laguna S 2.1的稀疏MoE架构包含256个路由专家加一个共享专家,具有分组查询注意力和交错滑动窗口层——这意味着推理成本与80亿个活跃参数而非1180亿个总参数成比例。Poolside强调,该模型足够小,可以在单个Nvidia DGX Spark(桌面级AI机器)上运行。

这对Poolside所谓的token经济学至关重要。长程编程智能体是token的贪婪消费者:公司发布的数据显示,在最难的基准测试中,当启用思考模式时,该模型平均每条轨迹消耗约249,000个完成token。在计量API价格下,企业规模的智能体工作负载将成为重要的预算项目。在OpenRouter上,Poolside提供免费的256K上下文端点和专用的1M上下文部署,定价为每百万输入token 0.10美元,每百万输出token 0.20美元——这一激进定价比大多数前沿选择便宜一个数量级。

生态系统支持在发布首日就异常广泛。该模型已在Baseten的模型库和Vercel的AI Gateway上上线,并与vLLM、SGLang、Ollama和llama.cpp集成,还包括低至4位的GGUF量化变体——75GB——用于本地使用。但Poolside更有趣的主张是行为性的,而非架构性的。Poolside应用研究联合负责人Pengming Wang表示,这些改进来自于改善模型的工作习惯:”更多验证,少想当然,不过早宣布胜利,更加持久。”公司认为,原始智能只是能力的一个维度;模型的工作方式是第二个维度,对于无人看管数小时的智能体而言至关重要。

发布每个基准轨迹以应对AI的信任危机

对企业买家而言,这次发布中最具影响力的部分可能是评估透明度方面的举措——在大型实验室中几乎没有先例:Poolside发布了其最终基准测试运行中每个试验的完整、未编辑轨迹——每个报告分数背后的推理步骤、工具调用和shell命令。

这解决了AI基准测试中日益增长的信任问题。随着顶级实验室在基准测试中追求更高分数,人们越来越担心这些分数是否真正反映了模型在实际应用中的能力。Poolside通过公开完整的评估过程,试图解决这一信任危机,让开发者和企业能够亲眼看到模型的表现。

这种透明度不仅增强了可信度,也为开发者提供了宝贵的学习资源。通过查看模型如何解决复杂问题,研究人员可以了解智能编程的最新方法论,从而推动整个领域的发展。

Poolside还强调,Laguna S 2.1不仅在性能上表现出色,而且在效率方面也具有显著优势。相比规模更大的模型,该模型在资源消耗和计算成本方面都有明显优势,使其更适合在资源受限的环境中部署。

随着开源AI模型的竞争日益激烈,Poolside的此次发布展示了小型实验室如何通过创新思维和技术突破,在资源有限的情况下实现卓越性能。这标志着AI领域正从单纯的规模竞赛转向更加注重实用性和效率的新阶段。


关注微信号:智享开源 ,及时了解更新信息。

原文链接:https://venturebeat.com/infrastructure/poolside-drops-laguna-s-2-1-an-open-weight-coding-model-that-beats-rivals-10x-its-size

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2081篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类