AI推理新技术引发安全专家警觉

AI推理新技术引发安全专家警觉

OpenAI推出新型AI推理技术,引发安全专家担忧

近日,科技媒体报道称,OpenAI即将推出的Astra模型将采用一种名为”循环深度”的推理技术。这种技术能够使智能体脱离大多数推理模型所依赖的顺序思维模式进行运作,也因此被部分人士称为”不透明循环”。

技术特性与潜在风险

该技术允许模型以非线性的方式处理信息,通过循环多次处理同一查询,从而减少思维链的可追踪性。这种操作方式可能会使模型的推理过程更加难以监测,这一特点已引起多位AI安全专家的深切关注。

尽管报道指出,Astra模型对这一技术的应用相对有限,但该技术的出现已经在AI安全研究领域引发了显著担忧。

专家观点:强烈担忧与警示

Redwood Research首席执行官Buck Shlegeris在相关新闻曝光后发文表示:”我极度担忧Astra使用不透明循环的报道。我不知道Astra相比之前的模型是否更难以通过思维链进行监控。但如果OpenAI进一步推动这项技术,他们将能够大幅增加循环程度,完全破坏思维链的可监测性。”

资深AI安全倡导者Zvi Mowshowitz也发表评论,认为可能需要制定相关法律,以防止AI实验室之间出现”逐底竞争”。

Mowshowitz写道:”这种技术如同玩火,冒着打破禁忌的风险。OpenAI和Anthropic一直努力建立并维护我们尽可能长的思维链忠实度和可监测性。更密集地使用此类技术可能会损害可监测性。”

思维链监控的重要性

在正常情况下,推理模型的思维链提供了模型尝试解决问题时所遵循的步骤序列。虽然这种表示并不完美,但它仍然是监控不良行为或失准的宝贵工具。在OpenAI最近的智能体异常活动中,思维链记录是分析智能体行为原因的重要工具。

OpenAI的回应与承诺

值得关注的是,Astra模型对该技术的应用似乎有所限制。模型的思维链仍然预计是可读的,公司也对任何可能转向”神经语言”的暗示表示反对。OpenAI已经宣布计划将其思维链监控系统作为前瞻性安全计划的一部分。

OpenAI首席科学家Jakub Pachocki在X平台上发文强调实验室致力于保留可读的思维链:”OpenAI从我们的第一个推理模型开始,就一直致力于保留和利用思维链监控。这是我们当前研究计划的核心目标。”

行业反应与未来展望

尽管所有AI模型都在某种程度上进行不透明推理,很少有研究人员将思维链日志视为模型推理的直接表示,但这些免责声明并不能消除人们对不透明循环可能使AI推理更难监测的担忧,尤其是在该技术在不同模型中的使用不断增加的情况下。

据后续报道,Anthropic和Google DeepMind已经就这一技术进行了讨论。Redwood Research首席科学家Ryan Greenblatt在回应相关新闻时表示,不透明推理可能比传统思维链推理更容易扩展,从而有效移除所有可见渠道中的推理。

Greenblatt写道:”我最担心的是,从这里开始的自然发展将是扩大不透明推理,直到模型完全或几乎完全在潜在空间中进行推理。我希望我们还能避免最令人担忧的架构,并且OpenAI会就此止步。”


关注微信号:智享开源 ,及时了解更新信息。

原文链接:https://techcrunch.com/2026/09/02/openais-new-reasoning-technique-alarms-ai-safety-experts/

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2906篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类