AI巨头引入独立安全评估者,能否真正实现独立监管?

AI巨头引入独立安全评估者,能否真正实现独立监管?

行业新动向:第三方评估者嵌入AI企业

近日,Anthropic首席执行官达里奥·阿莫迪在一篇长文中提出了一项大胆倡议:在所有前沿AI公司内部嵌入第三方评估者,赋予他们报告安全事件、评估AI模型真实对齐程度,并向全球公布无修饰发现的权力。

阿莫迪表示,Anthropic将承诺给予METR和Redwood Research等独立评估者前所未有的系统访问权限。与此同时,OpenAI首席执行官萨姆·阿尔特曼也表示公司将采取相同做法,这标志着AI行业与外部研究组织合作方式可能发生的深刻变革。

独立评估者的困境

多位接受采访的第三方评估者对这一倡议表示欢迎,但他们指出,要使这些评估者真正发挥独立监督作用,而非在AI公司设定的条件下运作,仍需解决诸多细节问题,并最好通过立法予以保障。

随着AI模型越来越擅长识别自己正被评估,更深层次的访问变得尤为重要。这增加了模型在测试期间表现良好,却在背后隐藏问题行为的风险。研究人员表示,在测试最终成品时可能遗漏这些行为线索,但通过研究模型在整个训练过程中的表现,则有可能发现这些问题。

训练过程中的潜在问题

“AI公司应该能够回答关于其训练过程的一些基本问题,例如:AI在训练过程中是否曾试图破坏其对齐训练?”阿波罗研究公司研究主管亚历山大·迈尼克表示,”答案应该是明确无误的’不’,但现在我们完全依赖AI公司自行仔细检查并如实向公众报告。从最近的事件来看,他们默认不会做这两件事。而作为嵌入式评估者,我们实际上可以进行核查。”

超越最终模型的评估

传统上,AI公司在产品发布前会邀请外部审查者测试最终成品。现在,接受采访的评估者建议,不仅应让他们访问最终模型,还应访问其训练生命周期中的中间版本或”检查点”。

FAR.AI首席执行官亚当·格里夫表示,评估者可以比较这些检查点,以确定不良行为何时出现,检查训练后奖励模型特定行为的环境,并查阅评估记录和日志,验证公司关于模型性能的说法。

表面安全的潜在风险

这类”深入引擎”的检查至关重要,因为在安全测试中表现良好的模型,如果专门学会了如何通过该测试,可能并不安全。Palisade Research战略主管约翰·斯泰德利指出了一个”关机抵抗基准”的例子,该基准测试AI在特定情况下是否会抵抗被关闭。

“如果AI专门接受训练以在该基准测试中表现良好,那就极为相关,”斯泰德利说,他将其比作大众汽车的”柴油门”丑闻,当时汽车被编程为识别排放测试并在测试条件下表现不同。

独立性的挑战

尽管阿莫迪提出了相当全面的方案,可能给予评估者他们认为必要的访问权限,包括”公布关于风险级别、事件、实践以及他们获得或未获访问的关键发现——不受Anthropic编辑控制”的权利。

然而,评估者表示,只有当AI公司真正愿意放弃对流程的控制权时,这样的系统才能发挥作用。以往的独立评估尝试表明,这种让步将来之不易,因为第三方经常在访问、时间、保密性和公开披露内容等方面面临紧张关系。

格里夫指出,FAR.AI不得不拒绝与几位前沿开发者签订合同,因为这些开发者对评估过程想要太多控制权,威胁到了公司的独立性。他说,默认情况下,评估者被视为普通承包商:受制于限制性的保密协议和协议,这些协议赋予开发者对最终可以发表内容的重大控制权。

时间与资源的限制

另一个问题是评估者是否有足够的时间和资源完成所要求的工作。在调查Hugging Face事件时,OpenAI给予METR和Redwood大约一周的时间在现场调查,两人后来表示,由于范围和时间限制,他们无法得出明确结论。

在GPT-6 Astra的发布前测试中出现了类似问题,OpenAI将其宣传为

在AI安全评估领域,独立性和透明度正成为行业关注的焦点。随着技术的快速发展,如何确保AI系统的安全性和可控性,成为全球科技企业和研究机构共同面临的挑战。

嵌入式评估机制的提出,标志着AI行业在自我监管方面迈出了重要一步。然而,要实现真正有效的监督,仍需解决权力分配、信息透明、评估标准等一系列关键问题。


关注微信公众号:智享开源,及时了解更新信息。

原文链接:https://techcrunch.com/2026/09/16/anthropic-and-openai-want-to-embed-safety-evaluators-will-they-really-be-independent/

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章3138篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类