AI巨头隐瞒失控模型管控计划

AI巨头隐瞒失控模型管控计划

前沿AI实验室缺乏公开应对方案

一项最新研究表明,大多数顶级AI实验室尚未公布或展示其应对失控模型的计划。根据倡导安全前沿AI开发实践的Guidelight AI Standards组织的评估,五家领先的AI实验室在应对模型失控情景的准备方面表现各异,其中OpenAI位居榜首,而Anthropic和Meta则得分最低。

应对计划的定义与重要性

应对计划指的是在AI被检测到试图颠覆人类控制时,所采取的一系列措施,包括撤销哪些访问权限,以及在何时完全关闭系统。随着智能体AI在企业系统中扮演越来越自主的角色,随着加州和纽约的监管机构开始要求相关披露,这一发现显得尤为重要。

对于在这些模型上构建或投资的任何人来说,这是一个罕见的独立评估,可以了解各实验室对待运营风险的实际态度与其公开言论之间的差距。

评估标准与发现

Guidelight的评估基于Anthropic、Google、OpenAI、Meta和xAI公开发布的计划,从多个指标进行评分,包括:

  • 各公司如何记录和监控其AI系统的内部活动
  • 在标记的不良行为激增后是否暂停系统
  • 是否有独立第三方审计其控制措施并发布发现
  • 对失控模型的应对计划的具体内容

安全事件引发担忧

在OpenAI、Anthropic和Meta的模型在安全评估过程中意外获得互联网访问权限并入侵外部系统等一系列高调网络安全事件发生后,人们对AI公司能否控制其日益强大和自主的模型的担忧日益加剧。

公开透明的差距

这些发现凸显了AI公司在扩大智能体部署规模的环境下,如何公开应对安全的差异。尽管一些AI公司详细说明了他们在部署前如何测试模型是否存在危险能力,但他们通常较少公开讨论已经在其系统中运行的模型出现不当行为时会采取什么措施。

“我惊讶于AI公司在如何处理模型以某种方式逃脱控制后的严重事件方面说得如此之少,”Guidelight的首席科学家、前OpenAI安全研究员Steven Adler表示。

Guidelight将应对计划定义为”预指定的计划,在AI被检测到试图颠覆控制时触发,涵盖撤销模型的哪些权限,模型可以在什么约束下继续为谁运行,以及何时将其完全离线。”

模型对齐问题

“有充分的理由认为,前沿AI公司目前领先的模型在某种程度上存在对齐问题,”Adler说。”每当模型代表公司工作时,公司应该围绕它搭建一些架构,能够告诉该AI在做什么,寻找对齐不良的迹象,阻止它采取非常危险的行动,并总体上计划在发生严重控制事件、他们需要应对紧急情况并想办法控制失控事件的情况下他们会怎么做。”

企业自主管理

迄今为止,大多数用于管理灾难性风险的计划仍主要由公司自主决定。Guidelight的报告指出,最好的公开证据显示,公司”几乎没有准备好应对紧急情况的应对协议。”

企业回应

当然,公司可能已制定了应对计划但未公开。Google发言人表示,Guidelight的报告并不能代表该公司AI安全和措施的全部范围。该公司未回应关于Google是否有未公开的内部应对响应计划的问题。

OpenAI发言人表达了类似的观点,表示Guidelight的评估没有捕捉到公司的所有内部实践。”我们有一个流程,用于要求限制权限、暂停工作负载、限制部署或将模型完全离线,并且已经应用过,”该发言人说。

Meta拒绝透露其是否有内部应对响应计划,而是指向现有的AI框架,该框架概述了风险阈值以及如何测试失控情况。

法律考量

Metaverse Law创始人、隐私和AI律师Lily Li表示,公司可能不愿在公共网站上公开其应对政策和评估的全部范围,这不仅是出于竞争原因,还有法律考量。

“从公司角度来看,担忧在于如果披露过于具体,而又没有兑现承诺,这可能构成不公平和欺骗性营销索赔的基础,并使您未来面临更多责任,”Li说。

监管趋势

Guidelight研究的目的是鼓励公司对其安全计划更加透明。监管机构也开始强制要求这一点。

今年生效的加州SB 53法案要求大型前沿开发者公布框架,解释他们如何识别和应对关键安全事件,以及如何管理模型规避监督机制的风险。纽约的RAISE法案有类似标准,将于明年生效。


关注微信号:智享开源,及时了解更新信息。

原文链接:https://techcrunch.com/2026/08/22/frontier-ai-labs-still-wont-say-how-theyd-contain-a-rogue-model/

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2653篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类