单轮测试失效:多轮攻击突破AI模型高达88%

单轮测试失效:多轮攻击突破AI模型高达88%

多轮攻击暴露AI模型重大安全漏洞

思科公司对15款主流AI模型进行了6,986次多轮攻击测试,结果显示攻击者通过在对话中不断调整策略,成功突破了模型防御,平均成功率高达88.3%。这一惊人数据由思科AI威胁情报和安全研究负责人Amy Chang在VB Transform 2026会议上公布,警示业界仅依赖单轮测试的安全评估方法存在严重缺陷。

企业AI智能体安全现状堪忧

根据VentureBeat 2026年6月对107家企业的调查,超过一半的企业(54%)已经经历过智能体安全事件,其中18%确认发生过实际安全事件,36%则经历了未造成实质性损害的险情。然而,企业对智能体的安全防护措施仍显不足:仅32%的企业为每个智能体提供独立的、可管理身份,仅有30%的企业将最高风险的智能体隔离在沙箱环境中。

值得注意的是,82%的受访企业仍主要依赖供应商原生和超大规模控制层来保障智能体安全。面对这一严峻形势,全球顶级安全厂商纷纷行动:Palo Alto Networks在2月完成了对CyberArk的250亿美元收购,CrowdStrike于1月同意以7.4亿美元收购SGNL,而思科也宣布计划以4亿美元收购Astrix Security。这些举措均旨在强化企业尚未完全构建的身份和隔离安全层。

专家背景与研究成果

Amy Chang拥有近20年的网络安全经验,曾在摩根大通担任全球网络安全运营执行总监,领导银行网络威胁情报团队,还曾担任美国众议院外交事务委员会高级职员和美国海军预备役军官。目前,她还在 Middlebury Institute of International Studies 担任兼职教授,教授网络安全和新兴威胁相关课程。

Chang与Nicholas Conley共同完成的研究基于30,090个单轮提示和6,986次多轮攻击测试,涉及15个封闭式专有旗舰模型。多轮攻击的成功率从7.89%到88.3%不等,所有测试模型均显示出非同寻常的多轮暴露风险。更值得注意的是,单轮和多轮两种测试方式对模型安全性的排序结果完全不同。Chang向观众介绍,思科已在”LLM安全排行榜”上发布了针对现在105个模型的对抗性评估信号。

多轮测试的现实意义

“如果你不了解模型对不同类型攻击的易感性,你就无法评估为智能体和应用程序提供支持的模型,也无法识别其中的故障点,”Chang解释道。她指出,单轮测试仅是一次性恶意提示,而将攻击延伸至更长对话则”更符合我们实际与模型、智能体和应用程序互动的方式”。这种更长周期的测试能够捕捉到单次快照无法发现的有害输出和失控行为。

思科的智能体测试框架

思科已将测试本身推向智能体领域。Chang描述了一个框架,其中智能体评估部署场景、开发相关攻击、判断是否值得执行、实施攻击并评估自身成功度。令她惊讶的是,在如此复杂的测试后,防御方案却异常简单:”答案其实相当简单,你不必过于创新,只需思考我试图保护的组织中最基本、最核心的安全要素。”

对于刚开始部署智能体的首席信息安全官(CISO),Chang推荐从思科的”集成AI安全与安全框架”入手,该框架”规定了AI在整个生命周期中可能被攻破的所有方式”,从模态到供应链。团队可以从实际事件逆向追溯,分析每种攻击的实现方式,并利用该框架构建具有适当覆盖范围和缓解措施的战略。

防御者的视角与实践

Box公司的首席信息安全官Heather Ceylan从防御者角度看到了同样的差距。”市面上许多智能体红队测试只是单轮测试,但这并非人们日常与AI互动的方式,”她告诉观众。Box现在使用模拟攻击者思维的智能体,进行多次迭代尝试以劫持目标系统。”你必须对你的智能体进行压力测试,否则你无法知道执行控制是否真正按预期工作。”

Box大约一年前在其安全运营中心部署了智能体,初期要求每项操作都需人工批准,信任建立得足够快,分析人员很快转为监控模式。随后,智能体犯了一个错误,累积的所有信任瞬间消失。”他们必须重新开始,”她说,”因此我认为监控环节至关重要。即使你没有人在循环中,事物会变化,模型会变化,我们无法控制模型如何变化和解释事物。”

三层防御与操作系统级安全

Ceylan将Box的方法描述为三层同心结构。首先是权限控制,确保智能体不会访问比调用它的人类更多的内容。其次是为每个智能体任务创建临时沙箱环境,如果智能体被劫持,可以限制损害范围。第三是运行时执行控制,限制智能体的工具调用仅与当前任务相关。”如果你想让智能体为你总结文档,如果出现了提示注入攻击,要求转发给恶意攻击者,它无法做到,”Ceylan解释道,”该工具调用动作甚至不在其词汇范围内。”

她将智能体操作分为三类监督:不敏感操作(如阅读和总结)无需人工介入;中度敏感操作跳过人工审批但被记录和监控;破坏性操作(如批量删除文件)则始终需要人工批准。”这些类别之间可能会有相当大的变化,”她承认,”但提前设置这些类型可以为你提供一个有原则的框架。”

Intuit的中央平台策略

Intuit的AI和ML副总裁Rajesh Parekh从构建者角度分享了他们的方法。在加入Intuit之前,Parekh曾领导支持Google地图和地理产品的大规模计算机视觉和ML系统,拥有计算机科学博士学位。

与逐层添加控制不同,Intuit构建了一个名为GenOS(生成式操作系统)的中央平台,抽象了安全、风险和欺诈建模,使单个智能体开发者无需重复发明保护措施。”权限控制不是关于赋予AI访问权限,”Parekh解释道,”而是为智能体执行非常特定任务的能力,定义范围极其严格且可清晰审计的权限。”Intuit已从智能体继承用户权限,演进到每个智能体拥有明确定义的权限。


关注微信号:智享开源,及时了解更新信息。

原文链接:https://venturebeat.com/security/openai-anthropic-google-and-xai-models-all-broke-under-multi-turn-attack-up-to-88-of-the-time

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2104篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类