开源AI追前沿,安全鸿沟仍存

开源AI模型迅速崛起,能力差距缩小
随着政策制定者就如何监管OpenAI的GPT-5.6 Sol和Anthropic的Mythos等日益强大的AI系统展开辩论,中国的一款开源AI模型已经缩小了与行业领先者的差距。
据AI安全非营利组织SaferAI的最新报告显示,来自中国的Z.ai公司开发的GLM-5.2开源AI模型,在网络和生物能力方面仅落后于OpenAI的GPT-5.5和Anthropic的Claude Opus 4.7几个月。然而,前沿能力与安全实践之间的差距却在不断扩大。
安全性能对比明显
SaferAI通过Z.ai的公共API进行的评估表明,GLM-5.2拒绝执行所有被分配的恶意网络或双重用途生物学任务。相比之下,Claude Opus 4.7″拒绝执行如此一致,以至于SaferAI完全无法在CyberGym基准测试上对其进行评估”。
CyberGym是一个评估网络安全能力的基准测试。OpenAI在上个月Hugging Face安全事件之前的评估中也使用了它。
开源AI的安全隐患
这清晰地提醒了一些批评者多年来一直警告的问题:开源AI模型可能会使高能力AI落入潜在攻击者手中,一旦他们下载了模型权重,就无法监督其使用方式。随着开源AI模型迅速接近世界领先AI系统的能力,辩论的焦点已从它们能否竞争,转向社会如何管理它们发布后的风险。
“能力的边界不是风险的边界,因此我们必须考虑缓解措施的状态,以正确评估风险,”SaferAI执行主任Henry Papadatos对TechCrunch表示。
安全保障的局限性
虽然Z.ai可以在其托管的API上应用安全措施,但一旦有人在自有硬件上运行模型权重,这些保护措施就无法执行,他们可以删除或修改任何安全措施,对模型进行微调,或更改系统提示。
像OpenAI和Anthropic这样的前沿开发者倾向于依赖分类器、拒绝训练和API级控制等安全措施,以限制危险的网络安全和生物学协助。
然而,这些措施远非万无一失:越狱攻击经常绕过已部署模型的保护。AI安全非营利组织Far.ai发现,在xAI的Grok 4.5和Google DeepMind的Gemini 3.1 Pro等前沿模型中存在数百个通用越狱攻击——被定义为对大多数有害请求都成功的可重用密钥。
报告指出,当攻击者结合多种操纵技术(包括角色扮演、权威冒充、虚假对话历史和后续提示)来放大模型防御中的弱点时,越狱攻击就会成功。
开源模型的安全挑战
但为封闭模型实施的安全保障措施在开源模型上完全不起作用,因为开源模型设计为可以在任何基础设施上运行,可以配备任何安全措施——或者完全没有安全措施。
“目标应该是让良好的能力——安全的能力——对任何人都是可访问的,然后我们尝试消除不良的能力,即使是开源的方式,”Papadatos说。
可能的解决方案
Papadotes指出一种可能有助于解决安全问题的技术称为”预训练数据过滤”,即AI公司从训练数据中移除有害的网络安全信息,然后在经过筛选的数据集上训练模型。
一些研究表明,这可以在不损害整体模型性能的情况下减少有害的生物学知识。然而,对于网络安全来说,数据过滤的实用性要低得多。
很难训练出一个擅长编码但不擅长黑客攻击的通用模型。由于编码已成为AI最大的赚钱领域,开发者在寻找限制滥用方法的同时,也面临着不断提升这些能力的压力。
其他安全策略
因此,前沿开发者越来越多地依赖其他缓解措施。一种方法是有选择地限制模型将提供的网络安全帮助类型。例如,根据模型系统卡,Anthropic的Opus 5可以搜索未编译源代码中的漏洞,但不能分析已编译的软件。其理由是,这使得更难将Opus 5用于攻击性目的。
其他方法包括严格的部署前安全评估、发布风险评估,以及如果系统被认为过于危险,则保留模型权重。
GLM-5.2的安全问题
在GLM-5.2的情况下,SaferAI表示,Z.ai没有为该模型发布安全框架、部署前测试承诺或风险评估。TechCrunch已询问Z.ai在发布前是否进行了内部或第三方前沿安全评估,但未收到答复。
中国对AI风险的认识
中国领导人越来越认识到先进AI的风险。在上个月的世界人工智能大会上,中国国家主席习近平强调了开源AI模型的重要性,同时强调必须确保AI仍然是处于严格人类控制下的工具。
关注微信号:智享开源,及时了解更新信息。


公众号:智享开源
还没有任何评论,你来说两句吧!