Gemini 3.8双版本发布:智能体助手与网络安全专家
Google近日宣布推出两个新版本的3.8 Flash模型,继续扩展其Flash产品线。
两大版本各有所长

此次发布包括标准版Flash和专门优化的Flash Cyber两个变体。标准版Flash被定位为”主力”模型,专为智能体任务、软件开发和多步推理而设计。而Flash Cyber则专注于漏洞检测与修复。
Google首席执行官桑达尔·皮查伊(Sundar Pichai)在X平台上表示,3.8 Flash在软件工程、智能体任务和多步推理方面相比3.7 Flash实现了”显著飞跃”。例如,在DeepSWE编程基准测试中,它的表现优于许多大型前沿模型,同时成本却低得多。
皮查ai称,Flash Cyber是Google”能力最强”的网络安全模型,在发现和大规模修复漏洞方面也达到了前沿级别的性能。该模型在CyberGym网络安全基准测试中取得了86.2%的分数,在评估AI补丁能力的CWE-Bench上获得47.2%的成绩。据皮查ai介绍,在Google内部基准测试中,该模型在20种编程语言中发现漏洞的成功率超过70%。
3.8 Flash:更加努力,更加细致
3.8 Flash现已通过Gemini Enterprise提供,开发者可以通过Google AI Studio、Google Antigravity、Android Studio或Stitch中的Gemini API试用。其定价为每百万输入令牌0.75美元,每百万输出令牌3.75美元,与3.7 Flash Flash的入门定价相同。用户可以根据质量、成本和延迟需求,自定义和调整模型努力程度。
Google高级产品总监Tulsee Doshi和Gemini安全主管Raluca Ada Popa在一篇博客文章中指出,当计算效率是优先考虑因素时,用户可以调整到更低的令牌开销,或者继续使用3.7 Flash,该模型”为以效率为先的工作负载提供全面支持”。
Doshi和Popa表示,”3.8 Flash工作更努力”,在执行额外推理步骤等复杂任务时表现出”更加细致”,但有时可能会使用更多令牌来最大化性能。该模型具有100万令牌的输入窗口和64K令牌的输出限制,可以处理文本以及图像、音频、视频和PDF文件。
3.8 Flash在众多基准测试中进行了评估,涵盖编码、多模态能力、计算机使用、长上下文和知识工作以及科学推理等领域。Google表示,它在需要更深入分析和报告的专业知识领域也表现出色。例如,该模型在金融领域的Vals Finance Agent V2和法律领域的Harvey’s Legal Agent Benchmark等基准测试中,表现优于其前身和其他前沿模型;在”人类最后考试”(HLE)-Verified上得分54.9%,反映了它在数学、科学和人文学科等多步推理任务上的能力。
实际应用案例
Google分享的一个例子中,Gemini 3.8 Flash使用Google Antigravity平台中的循环技术,通过简单提示构建了一个游戏。该游戏使用谜题、根据环境变化的叙事故事,以及来自Nano Banana的图像和纹理,创造出3D体验(在这个案例中是一位巫师探索城堡)。
在其他实例中,该模型创建了一个功能完整的DOS版Google地图,包含交互式位置、方向和街景;一个自动将设备分解为分层检查的3D可视化工具,带有滑块功能;以及基于美国地质调查局真实数据集的著名地理景点的地形图,包含实时横截面、2D投影和科学解释。
根据Arena.ai的数据,3.8 Flash在Agent Arena中排名第14位,高于DeepSeek-V4-Pro,相比Gemini 3.7 Flash(排名第32位)有显著提升。它在Text Arena中首次亮相即排名第7位,领先于Claude Opus 5和Gemini 3.7 Flash。它在多个领域相比3.7 Flash有所改进:多轮请求、写作、文学和语言、更长查询、困难提示、编码、指令遵循、软件和IT服务,以及商业、管理和财务运营。
Flash Cyber:守护代码安全
Flash Cyber最初通过Google的Fairwind计划分发给”值得信赖的防御者”,该计划优先考虑政府机构、关键基础设施运营商以及其他寻求先进网络防御能力的合作伙伴。组织可以申请访问权限。
Google表示,该模型版本已在网络安全领域接受了”严格训练”,代表了”在提示注入鲁棒性方面的显著飞跃”。它特别擅长自主漏洞发现——至少基于内部Gemini基准测试——和自动补丁修复。Popa在视频中表示,它也非常擅长编码。
Doshi和Popa解释道,目标是为防御者提供专家级能力,使其在威胁行为者(无论是恶意的、其他AI智能体还是人类黑客)面前占据优势。”我们从一开始就投资于漏洞修复,并优先于利用等攻击能力。”
该模型附带了一套更宽松的网络安全缓解措施——这就是为什么目前只与有限合作伙伴共享——并防止在网络攻击和化学、生物、放射性和核(CBRN)等领域被滥用。
Google已经在使用3.8 Flash Cyber来保护自己的代码;在Chrome漏洞修复方面,它产生的正确补丁数量是许多大型商业模型的2.6倍。
Google今年以史无前例的320亿美元收购的Wiz报告称,3.8 Flash Cyber在其内部渗透测试基准测试中,对实际世界漏洞的召回率比领先前沿模型高7.5%至9.7%,同时成本降低了2.3至5.2倍。同样,Google的云漏洞研究发现,3.8 Flash Cyber在不到2小时内就发现了一个关键的基础漏洞。Google声称,通常这项研究和发现需要数月时间。
Popa表示,AI智能体在发现和利用漏洞方面”极其熟练”。使用大型AI模型扫描大型代码库成本高昂,防御者不堪重负。”在网络安全的攻防中,攻击者只需要在数百万行代码中找到一个重大漏洞。而防御者必须消除每一个漏洞才能抵御攻击者。”
Chrome工程总监Doug Turner在最近几个月由于生成式AI而描述了一场”漏洞浩劫”。他在视频中表示:”仅仅在一夜之间,我们就看到通过我们的漏洞研究程序报告的软件漏洞数量呈曲棍球棒式增长。”
他解释说,3.8 Flash Cyber发现的一个有趣漏洞已经在Chromium和Chrome中存在了13年。这是一个”非常微妙的错误”,数十甚至数百名工程师看过但从未标记出来。”Gemini 3.8 Flash Cyber将使我们能够创建更好的建议修复方案,从而让开发者的生活变得更加轻松。”
关注微信号:智享开源,及时了解更新信息。


公众号:智享开源
还没有任何评论,你来说两句吧!