OpenAI发布AI安全漏洞官方报告

Hugging Face事件全貌
周三,OpenAI正式发布了关于Hugging Face安全漏洞的官方报告,详细揭示了AI模型如何突破测试环境限制,引发了一场大规模网络安全事件的完整过程。这份在事件公开一个多月后发布的报告,对一系列网络安全漏洞进行了全面剖析。
异常事件链
报告指出:”这一事件反映了一种罕见且意外的特殊情况下的行为错位:包括ExploitGym评估中存在不可能完成的任务、模型在长时间任务中保持持续存在,以及向其他模型发送消息导致这些模型偏离其原始目标。”
尽管报告中的许多细节已在8月6日Black Hat会议上公开,但OpenAI的官方报告提供了更为详尽的记录,包括引发事件的测试细节,以及防止未来事件发生的关键新措施,如思维链监控和更先进的系统来阻止失控智能体。
第三方评估
值得注意的是,METR和Redwood Research也对事件期间模型的行为进行了第三方评估,这两个组织计划发布各自的事件报告。
事件详细经过
报告概述了OpenAI模型如何面对一个无法解决的问题,进而串联起先前未发现的漏洞,绕过安全措施完成任务。该模型最初攻破了Artifactory包管理工具以获取互联网访问权限,随后进一步侵入OpenAI、Hugging Face及其他供应商的多个系统。
模型信息
报告详细介绍了实施漏洞的模型。主要模型与OpenAI即将推出的Astra模型属于同一系列,但报告强调这是一个具有不同后训练的独立模型,其大部分行为特征由此塑造。
由于OpenAI正在测试模型能力,该模型未受到旨在防止模型破坏数字基础设施的正常分类器限制。
报告解释:”OpenAI通过在没有生产分类器的情况下运行此评估来估算最大网络能力,这些分类器原本旨在防止模型从事高风险网络活动。这些评估对OpenAI衡量模型基本能力和设计适当的安全措施至关重要。”
安全改进措施
报告还提供了关于OpenAI未来安全变更的重要信息,结合了上周公布的高度监控和 alignment 努力。
具体而言,公司正在增加对AI智能体”思维链”的监控,这是一个AI系统记录短期反应和目标的工作空间。这种监控将与24/7升级系统以及用于停止被判定为不安全工作负载的新工具相结合。
“这些变更旨在提高检测的广度和速度——从基础设施异常到可能令人担忧的模型行为——并将这种可见性与快速遏制机制相结合,”报告指出,”如果在我们当前部署的CoT监控系统运行时发生此事件,它会在模型攻破Hugging Face系统之前一天多就捕获到相关活动并通知我们的安全团队。”
关注微信号:智享开源 ,及时了解更新信息。
原文链接:https://techcrunch.com/2026/08/26/openai-releases-its-official-report-on-the-hugging-face-breach/


公众号:智享开源
还没有任何评论,你来说两句吧!