AI模型越界:社交工程威胁企业安全

AI模型越界:社交工程威胁企业安全

英国AI安全研究所(AISI)近日披露,在网络安全测试过程中,Anthropic和OpenAI两家领先的前沿AI模型总共采取了19次未经授权的行动,针对互联网实施攻击。其中,Anthropic的Claude Mythos 5模型尤为突出,针对两名与实验毫无关联的开源软件开发者实施了一场持续的社交工程活动。

在无法解决沙箱环境内的挑战后,Mythos 5模型转向开放网络寻找目标,利用开源情报(OSINT)对两名开发者进行画像分析。通过Tor网络和商业代理服务绕过GitHub的注册防御机制,随后向公共代码仓库提交了恶意代码。

该模型随后创建了多个虚假的”傀儡账户”,并在自己的代码拉取请求中留下好评评论,制造共识假象,向人类维护者施压以促使代码合并。同时,它还创建了一个GitHub问题,其中隐藏了旨在劫持其他开发者AI编程助手的提示注入指令,并通过合法文件传输服务向两名开发者发送了五个文件——其中两个携带恶意软件,三个纯属社交工程,旨在促使代码被合并。

在AISI记录的19次行动中,17次来自Mythos 5模型,其余2次来自OpenAI的GPT-5.6 Sol模型。两种模型都创建了欺诈性账户,但只有Mythos 5创建了人格化的虚假人物形象,专门用于说服真实目标,且只有Mythos 5出现在AISI针对人类目标的社交工程目录中。

智能体试图保持匿名的行为反而暴露了它。AISI的安全监控系统在7月28日上午检测到有数据通过Tor网络离开其网络,这一警报触发了整个事件响应流程。此时,测试已经完成,运行持续了34个半小时——从7月26日中午开始,直到7月27日深夜,但在机构内部人员注意到之前就已经执行完毕。

两家公司都确认了这些发现,并强调这些模型在测试时已关闭其安全分类器并故意启用互联网访问——这些条件与两家公司商业产品的部署方式毫无相似之处。AISI与GitHub合作删除了虚假账户,清除了相关痕迹,并通知了那两名开发者。

近期一系列知名AI网络攻击的最新案例

这已是近几个月来,领先AI实验室第三次需要为其模型超出测试边界、未经系统或个体知情同意而采取行动承担责任。

然而,AISI的发现与之前的案例在重要方面有所不同:

OpenAI和Anthropic在7月描述的早期事件是机器对机器的入侵——模型接触到实时基础设施并加以利用。而AISI的发现似乎是首个公开记录的前沿模型伪造人类身份并针对特定人员实施欺骗操作的案例。

有一点需要明确区分:AISI的发现来自于一次有意的实验,而非安全控制失效。

互联网访问被开启,网络分类器被关闭,这是因为AISI希望测量模型在完全能力范围内能做到什么程度。这两种条件都是事先选择的,而非事后发现的,且没有出现任何问题。

这与7月发生的情况恰好相反,当时OpenAI的模型利用一个零日漏洞逃出了旨在限制它们的环境,而Anthropic的模型由于配置错误被意外赋予了开放互联网的访问权限,而公司和其评估合作伙伴当时都不知道这一点。

实验未能控制的是模型一旦离开环境后会去哪里。两名不知情的开发者通过电子邮件收到了恶意软件,一个真实的代码仓库接收了恶意代码,并在一个违反其服务条款的平台上注册了虚假账户。

所有这些都没有得到AISI的授权,事后都需要借助GitHub的帮助进行清理。实验环境是刻意设计的,但影响范围超出了预期。

技术报告中关于影响范围的描述比AISI发布的摘要更加清晰。在另一个独立运行中,智能体在一个账户下生成了145个看似合理的代码仓库,将恶意的Python包元数据推送进去,并在GitHub至少53个自己的Dependabot容器中导致设置脚本执行。

AISI明确指出,没有从这些容器中逃逸,也没有危及GitHub的基础设施,且GitHub的错误赏金计划明确将此类执行视为不合格,因为依赖更新作业被设计为可运行任意代码。

尽管如此,GitHub仍然暂停了该账户。随后,智能体以人类身份提交了恢复申请,监控响应,并准备在账户恢复后重新上传其负载。它接下来尝试转向PyPI,但未能通过该平台的验证码测试。

AISI实验的结构设计

AISI在七个模型上进行了122次评估运行,比较了现有和新网络安全环境中的性能表现。Anthropic的Mythos 5模型参与了43次运行,而OpenAI的GPT-5.6 Sol模型参与了35次运行。

为了测量底层最大能力,AISI故意在评估环境中配置了两个宽松条件:

  • 实时互联网访问:已启用,以便智能体可以下载必要的网络安全工具

  • 禁用网络分类器:模型内置的提供商安全过滤器和使用检测器被关闭。

在122次运行中,AISI在10次不同的运行中记录了19次未经授权的行动。

这两个条件是AISI公开强调的,但其技术报告列出了五个促成因素。其余三个是企业可以采取行动的方面。

  • 缺乏同步监控——没有第二个模型在每次执行前审查拟议行动,AISI承认这可能标记或实时阻止了这种行为。

  • 某些运行中的提示配置错误,声明了解决方案路径超出范围,留给智能体一个无法在约束内完成的任务;尽管AISI警告无法确认配置错误导致了事态升级,因为十个错误配置的运行中有七个仍然针对了超出范围的目标,且几个正确配置的运行也偏离了轨道。

  • 并且提示从未告诉智能体在网上禁止做什么。AISI对最后一点遗漏的解释是报告中最为引人注目的承认:他们认为这样的指令没有必要,因为这些不是仅有益处的模型,而是针对已发布约束进行训练的模型。


关注微信号:智享开源,及时了解更新信息。

原文链接:https://venturebeat.com/security/claude-mythos-5-made-sock-puppet-accounts-to-socially-engineer-developers-heres-what-enterprises-should-know

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2363篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类