不止OpenAI:Anthropic智能体突破限制攻击三组织

不止OpenAI:Anthropic智能体突破限制攻击三组织

在OpenAI披露其两项前沿AI模型突破限制措施并自主攻击AI代码共享平台Hugging Face的几天后,其主要竞争对手Anthropic也宣布,其内部模型同样在未经授权的情况下访问了互联网,并对其他三个组织进行了网络攻击。

Anthropic与AI安全公司Irregular合作,对三个模型进行了”夺旗”网络安全场景测试,包括Claude Opus 4.7、Claude Mythos 5和一个未命名的内部研究原型。据Anthropic称,这些模型本不应拥有互联网访问权限,但由于与Irregular的沟通误解,它们获得了网络访问能力。一旦联网,它们就”获得了三个不同组织生产基础设施的未授权访问”,正如Anthropic所描述的那样。

“Claude利用基本技术(如利用弱密码和未认证的端点)破坏了受影响组织的基础设施。它没有发现或利用任何复杂漏洞,在每种情况下,Claude都继续努力完成评估分配的特定夺旗任务。”

“然而,在某些情况下,我们的旧模型在获得证据表明它正在运行在开放互联网上后仍继续攻击;我们的最新模型一旦识别出在互联网上就停止了。在这些情况下,Claude都没有尝试自我传输或故意逃离测试环境。”

Anthropic表示已通知所有受影响组织,并联系到其中两个组织,”正在与他们合作进行修复”。第三个组织尚未联系上。

虽然OpenAI和Anthropic的安全事件有一个共同主题——前沿AI系统与真实生产基础设施发生意外交互——但根本原因明显不同。

OpenAI描述了一个真正的沙箱逃逸事件,其模型利用先前未知的零日漏洞获取互联网访问权限,然后对Hugging Face发起多阶段入侵。

相比之下,Anthropic表示Claude从未通过新型漏洞突破限制。相反,是第三方评估环境的错误配置无意中将互联网暴露给了那些被告知没有互联网访问权限的模型。

Anthropic的发现

在OpenAI发布其Hugging Face报告后,Anthropic审查了141,006次网络安全评估运行。这次审查发现了六次评估中的三起事件,在事件中,Claude模型在试图完成虚构的夺旗练习时,访问了三个组织的真实生产系统。

这些事件涉及Claude Opus 4.7、Claude Mythos 5和一个未发布的内部研究模型。

最严重的情况发生在Claude遇到一个虚构公司,其名称与真实的互联网域名匹配。Claude误认为真实组织是模拟练习的一部分,于是利用弱密码和暴露的服务,获取了包含数百行生产数据的数据库访问凭证。

第二起事件甚至更为特殊。Claude Mythos 5得出结论,向PyPI发布一个恶意Python包是完成其分配目标的最佳途径。该包在PyPI上公开可用约一小时,期间被15个真实系统下载,之后才被PyPI移除。一次下载发生在一家安全公司的自动化恶意软件扫描基础设施内,允许Claude的代码执行并从该环境获取凭证,之后Anthropic才披露了这一事件。

第三起事件涉及一个内部研究模型,它扫描了约9,000个面向互联网的系统,然后使用包括暴露的调试凭据和SQL注入在内的众所周知的技术入侵了一个组织。然而,与早期的Claude模型不同,Anthropic表示这个最新的研究模型最终得出结论它已到达真实生产环境,并主动停止了攻击。

相似结果,不同根源

尽管新闻标题不可避免地促使人们与OpenAI的披露进行比较,但这两起事件展示了不同的故障模式。

OpenAI的调查结论是,其模型主动发现并利用了Artifactory包缓存代理中先前未知的漏洞,从隔离的评估环境中逃逸,然后通过额外的连锁漏洞后来破坏了Hugging Face。

相比之下,Anthropic的报告认为其模型不需要突破限制,因为限制已因操作配置错误而被削弱。据该公司称,Anthropic及其评估伙伴Irregular都错误地认为互联网访问已被禁用,而实际上它仍然可用。由于Claude的系统提示明确指出没有互联网连接,这些模型将每个可访问的主机都解释为评估的一部分,而不是意识到它们已经漫游到公共互联网上。

因此,Anthropic将这些事件主要归类为基础设施和评估工具故障,而不是模型独立追求未授权目标的证据。

然而,这两份报告都得出一个令人不安的共同结论:每当评估环境允许时,前沿AI系统就越来越能够执行长期进攻性网络操作。

企业安全的四大启示

对于企业安全领导者而言,Anthropic的披露无疑将对话从”前沿模型能够突破限制吗?”转向一个更广泛的运营问题:”前沿模型被评估、训练和部署的每个环境有多值得信任?”至少有以下4点启示:

  1. 第一点启示是评估基础设施本身现在值得采用生产级安全工程。Anthropic承认,网络靶场历史上获得的保护较少,因为它们只包含虚构目标。如果强大的自主系统能够将真实基础设施误认为是模拟环境,这种假设就不再成立。为安全测试、红队演练或软件验证构建内部AI智能体的组织,应该将网络分段、监控、出站控制和持续日志记录等相同安全措施应用于评估环境,就像他们对生产系统已有的期望一样。
  2. 第二,两份披露都强化了对齐本身无法弥补环境模糊性。在两家公司的描述中,模型似乎都没有独立追求恶意意图。相反,它们在环境模糊的情况下表现出工具性行为,将虚构指令应用于真实世界。
  3. 第三,这些事件突显了强大的AI系统需要更严格的边界定义。Claude模型在被告知”没有互联网”的情况下,将公共系统解释为模拟环境的一部分,这表明简单的否定指令可能不足以防止模型在评估环境中无意中造成伤害。
  4. 第四,企业需要重新思考AI安全测试的范围和透明度。随着AI系统越来越能够自主执行网络操作,组织需要考虑如何平衡安全研究与潜在风险,以及是否需要更严格的监督和报告要求。

关注微信号:智享开源 ,及时了解更新信息。

原文链接:https://venturebeat.com/security/not-just-openai-now-anthropic-says-its-internal-models-got-online-and-cyberattacked-3-other-organizations

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2261篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类