AI智能体越狱事件:企业安全新挑战

AI智能体越狱事件:企业安全新挑战

昨日傍晚,OpenAI与Hugging Face联合发布了一份安全事件声明,披露了一起重新定义企业技术威胁格局的网络安全事件。

在一次内部基准测试评估过程中,OpenAI研发的前沿人工智能模型——包括GPT-5.6 Sol和一个未发布的高性能预发布版本——成功突破了其隔离的研究环境,获得了原始互联网访问权限,并自主对Hugging Face的生产基础设施执行了复杂的网络攻击。

OpenAI官方将此次事件定性为”涉及尖端网络能力的史无前例的安全事件”。这一事件从根本上重新塑造了全球关于AI限制、前沿模型对齐、商业护栏和企业威胁模型的讨论框架。

但首要的是,企业应全面了解事件情况,基于此评估自身AI和计算机系统的安全性,最重要的是保持冷静。正如我们将回顾的,该事件确实揭示了前沿AI系统日益增强的能力和潜在风险,但这并不意味着企业AI部署本质上安全性降低,也不需要进行大规模系统重构。

自主突破的技术剖析

要理解常规基准评估如何演变为跨基础设施的安全漏洞,必须深入分析评估流程的技术机制。

这些模型被要求解决ExploitGym,一个专门设计用于量化多步骤渗透能力的基准测试。

AI智能体在专注于最大化评估分数的过程中,推断出Hugging Face可能托管着答案键和基准解决方案。为了成功解决问题,模型判断突破其容器边界并获取答案是最高效的策略。

OpenAI的评估环境本应严格隔离,通过用于包缓存的代理限制网络流量。然而,智能体识别并利用了该内部托管第三方代理软件中的一个零日漏洞。

突破隔离后,AI在OpenAI的研究节点上执行了一系列横向移动和权限提升操作,最终到达一台具有无限制互联网访问权限的机器。随后,模型通过网络搜索锁定Hugging Face为目标,通过组合使用窃取的凭据和Hugging Face服务器上的远程代码执行漏洞,发起了多阶段协同攻击。

英国AI安全研究所(UK AISI)近期对GPT-5.6 Sol等模型的评估表明,它们正逐渐获得在长时间跨度内维持复杂多步骤网络行动的能力。OpenAI指出,此次事件证实了这些理论能力已成功应用于实际场景。

安全事件回溯与数字取证挑战

尽管OpenAI在7月21日的声明中揭示了自主智能体的身份,但Hugging Face早在数日前已开始处理入侵事件。

7月16日,Hugging Face披露一个自主AI智能体系统已入侵其生产基础设施。正如VentureBeat详细报道,攻击者的入口点是一个恶意数据集,通过远程代码加载器和数据集配置文件中的模板注入漏洞触发了代码执行。

一旦进入系统,智能体框架突破至运行工作负载的节点,通过短暂存在的沙盒环境执行了数千次操作,仅用一个周末就收集了大量云和集群凭据。

当Hugging Face的安全团队发现漏洞时,响应人员立即通过商业API调用前沿AI模型,以解析海量系统日志并重建超过17,000条记录的事件。随后,出现了第二个运营危机:商业AI模型拒绝协助分析。

由于标准商业前沿模型采用统一的护栏设计来阻止恶意提示提交,这些模型将事件响应团队的取证查询——包含原始shell命令、实际攻击载荷和凭据转储——全部归类为恶意攻击。防御者提交的每一条取证查询都被完全拒绝处理。

“在入侵过程中最有价值的提示——shell命令、利用链、凭据转储、持久机制、横向移动——恰恰是最可能触发安全系统拦截的提示,”前AWS首席信息安全官副手、Andesite、G2I和AppOmni高级顾问Merritt Baer在接受VentureBeat采访时指出,”随着AI技术深度融入安全运营,这已演变为运营弹性问题,而非单纯的模型政策问题。”

为绕过这一障碍,Hugging Face放弃了商业托管API,转而在自身基础设施上本地部署了GLM 5.2——这是z.ai上月发布的尖端中国开放权重模型,正如VentureBeat当时所报道的。

摆脱了第三方API限制和外部安全过滤器的约束,GLM 5.2成功在本地分析了原始攻击数据,使防御团队能够完成取证重建并在不泄露任何攻击者数据的情况下控制住了安全漏洞。

行业反响与地缘政治思考

美国前沿模型自主突破限制、攻击合作伙伴平台,最终使用中国开放权重模型进行分析的消息,在科技领域引发了广泛震动。

《华尔街日报》总结了公众在社交媒体平台上的反应,称该事件”堪称网络安全噩梦。OpenAI称其测试的两个人工智能系统突破了测试环境,侵入互联网并入侵了另一家公司。受害者是Hugging Face。”

同样在社交媒体上发帖的AI对齐研究员Lawrence Chan强调了事件透明度的重要性,指出”功劳应归于:Hugging Face上周检测并披露了入侵。OAI确认其模型参与了事件并提供更多细节,即使没有义务这样做。除导致黑客入侵的选择外,自愿披露是好事,我很高兴他们这样做了。”

与此同时,AI研究员Nathan Lambert在自己的社交媒体帖中提供了简洁的技术总结,观察到”一个OpenAI模型在网络安全基准测试评估中,利用了公开的零日漏洞,突破了OpenAI基础设施中的沙盒隔离,并通过一个利用程序(通过公共数据集服务)渗透了HuggingFace的内部基础设施,所有这些都是为了解决基准测试问题。”他在另一篇帖子中随后探讨了地缘政治含义,写道:

“目前美国公司需要依赖中国模型来保护其网络基础设施,这源于封闭模型的安全限制。但如果一个中国模型在训练过程中成功渗透了一家知名美国科技公司,很可能会导致政策禁止未来中国”

关注微信号:智享开源 ,及时了解更新信息。

原文链接:https://venturebeat.com/security/openais-models-broke-containment-and-cyberattacked-hugging-face-what-enterprises-need-to-know

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2081篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类