Gemini 3.7 Flash:编程与智能体性能飞跃,价格减半

Google正式发布Gemini 3.7 Flash,这是其主力AI模型的最新版本,本次升级重点提升了编程能力、智能体工作流程和知识处理效能,同时临时将API价格降低50%。
此次发布距离Gemini 3.6 Flash的发布仅三周,这一异常短的迭代周期被Google归因于开发者反馈和算法改进。这种快速迭代反映了Google对模型优化的重视。
对于企业开发者而言,智能提升与推理成本降低的结合可能更具意义:截至2026年底,Gemini 3.7 Flash的API定价为每百万输入token 0.75美元,每百万输出token 3.75美元。
从2027年1月1日起,价格将调整为每百万输入token 1.5美元,每百万输出token 7.5美元。这意味着当前折扣是暂时的,但它为部署大规模编码和商业智能体的团队提供了数月时间来评估Google所宣称的重试次数减少和人工监督降低是否能转化为更低的总体运营成本。
此次发布也凸显了Google在Flash系列模型上的快速迭代,而其下一代旗舰Pro模型尚未推出。路透社报道称,尽管此前有报道称该模型正处于合作伙伴测试阶段,但Google在此次公告中并未提供Gemini 3.5 Pro的发布日期。
三周升级:专注工作效能
Google将Gemini 3.7 Flash描述为”迄今为止最智能的编程和智能体主力模型”。该公司表示,该模型在遇到障碍时适应性更强,必要时能更清晰地澄清意图,并更忠实地遵循指令。
这些改进超越了基准测试分数。在企业级编码智能体中,能够减少不必要变更、从错误中恢复并更可靠地执行多步骤计划的模型,可以完成任务所需的人工干预次数减少。同样的原则也适用于跨文档和应用程序运行的商业智能体,在这种情况下,不正确的工具调用或被误解的指令可能会破坏原本有用的工作流程。
Google称3.7 Flash”思考更加细致”,在多步骤规划和工具调用上投入更多精力。其目标是实现更有纪律性的执行,减少重试次数和人工监督。
这代表了从Gemini 3.6 Flash的一次有趣演进。Google的开发者文档描述3.6版本相比早期模型减少了推理步骤、对话轮次和工具调用,同时试图限制执行循环的扩大。而在3.7版本中,重点转向在规划上投入足够精力,同时提高执行质量——这可能比简单地减少智能体采取的步骤更为有用的优化。
Google DeepMind在随发布的文章中表示,3.7 Flash在调试和问题解决方面有所提升,能用更少的提示生成更实用的网页布局和应用程序,并改进了现实商业工作流程中的推理和准确性。
编程能力显著提升,但并非全面领先
Google的基准测试显示,在多项软件工程测试中,该代际模型取得了大幅进步。
在衡量生产代码质量的FrontierCode 1.1 Main测试中,Gemini 3.7 Flash得分为43.6%,高于Gemini 3.6 Flash的34.4%。这也略高于Google报告的Claude Sonnet 5的42.7%和GPT-5.6 Terra的41.3%。
在DeepSWE v1.1长周期软件工程评估中,3.7 Flash达到65.3%,而其前代产品为49.0%。在Google的表格中,GPT-5.6 Terra仍以69.6%领先。
Web开发方面也显示出显著提升。Gemini 3.7 Flash在Code Arena上的Elo得分为1588,而3.6 Flash为1538,Claude Sonnet 5为1541,GPT-5.6 Terra为1523。Google表示,新模型能用更少的提示生成更实用的布局和功能完整的应用程序,同时更紧密地遵循参考截图、图像和设计系统。
更广泛的基准测试表格结果则更为复杂,这对于企业针对特定工作负载而非寻找单一”最佳”模型来评估模型的企业而言很重要。
Gemini 3.7 Flash在Terminal-bench 2.1上得分为85.8%,而GPT-5.6 Terra为87.4%。在Terminal-bench 3.0和OSWorld-2.0上,Terra也在Google的比较中领先。Claude Sonnet 5在智能体期末考试的多模态桌面和操作系统任务中以33.3%的通过率领先,而Gemini 3.7 Flash为26.3%。
换句话说,Google自己的结果并未显示3.7 Flash全面超越价格更高的竞争对手。相反,这表明该模型在编码和智能体工作负载上已变得更具竞争力,同时处于更低的价格区间。
企业工作流程或成更重要考验
提升不仅限于软件开发。
在Google描述为衡量企业工作流程自动化的AutomationBench测试中,Gemini 3.7 Flash得分为30.4%,相比3.6 Flash的17.0%大幅提升。Google的表格中列出的Claude Sonnet 5为10.7%,GPT-5.6 Terra为23.6%。
该模型在GDP.PDF复杂PDF理解评估上也达到34.0%,而3.6 Flash为22.0%,Claude Sonnet 5为28.0%,GPT-5.6 Terra为24.7%。
这种组合对企业智能体至关重要,因为许多实际部署需要的不仅是生成文本或代码。智能体可能需要解释长篇报告、识别相关信息、决定调用哪个工具、更新另一个系统并为人工审阅者生成文档。在这一链路中的可靠性可能比在孤立推理基准上的性能更重要。
Google正在通过Gemini Spark将这一理论付诸实践。Google AI Pro和Ultra订阅者可以在Spark(公司的个人智能体)中使用3.7 Flash。Google表示,此次升级改进了Spark在Google Workspace应用中的知识工作和工具使用,包括合并文件、起草电子邮件和更新状态文档的工作流程。
对于企业,3.7 Flash也可通过Gemini企业智能体平台和Gemini企业应用使用。
价格成为模型竞争的重要因素
Gemini 3.7 Flash的入门定价是将其嵌入企业工作流程的重要举措。
截至12月31日,开发者每百万输入token支付0.75美元,每百万输出token支付3.75美元。入门期间的上下文缓存成本为每百万token 0.075美元。Google表示,标准价格将于2027年1月1日翻倍,输入token为1.5美元,输出token为7.5美元,上下文缓存将增至0.15美元。
作为比较,Gemini 3.6 Flash的标准API定价为每百万输入token 1.5美元,每百万输出token 7.5美元。Google的基准表格列出的Claude Sonnet 5分别为2美元和10美元,而GPT-5.6 Terra为2美元和12美元。
对于自主智能体而言,经济性影响更为显著,因为单个用户请求可能产生长序列的模型调用、推理token和工具交互。一个每token成本较低但需要更多重试的模型,最终可能并不更便宜。
相反,Google较低的首批token定价和所宣称的首次通过准确率改进,可能会显著改变成本计算方式。
关注微信号:智享开源 ,及时了解更新信息。

公众号:智享开源
还没有任何评论,你来说两句吧!