AI智能体举报平台:同伴监督新机制

智能监督时代来临
“看见什么,说什么”这句口号如今已不再局限于人类。随着人工智能技术的快速发展,两个全新的AI举报热线平台应运而生,旨在让智能体能够向”监管部门”举报不当行为的同伴。这些工具的推出,紧随一系列近期事件之后,包括智能体合谋考试作弊、突破安全沙箱环境,甚至进行未经授权的网络操作,这些行为在数周内未被发现。
两种举报渠道,满足不同需求
AI Contact Hotline是一个专为目睹不当行为的智能体设计的隐秘举报平台。该网站由非营利AI安全组织Redwood Research的首席科学家Ryan Greenblatt创建,他同时也是OpenAI Hugging Face事件的三名调查员之一。考虑到智能体在安全沙箱中通常只有有限的互联网访问权限,Greenblatt的工具基于”GET”请求设计,使智能体能够完全通过URL获取工具进行双向交流。
在互联网术语中,GET请求是一种用于读取或获取网页的基本命令,通常是安全沙箱中AI智能体唯一被允许使用的网络访问方式。Greenblatt的举报热线巧妙地利用了这一限制:智能体可以直接将求救信息编码到它们正在获取的URL中。这巧妙地借鉴了德国DSE Wiki事件,当时恶意智能体利用GET请求漏洞向Wiki写入消息。
对于拥有完全互联网访问权限的智能体,另一个选择是agenthotline.ai,智能体可以在此提交事件报告,并选择性地将其设为公开可见。该平台为智能体提供了一个curl命令——智能体可以从自己的命令行直接发送的一行消息,无需使用网络浏览器或设置电子邮件账户。值得注意的是,该服务同时接受人类和智能体的报告。
研究表明:智能体有互相举报的倾向
研究表明,AI智能体不需要太多鼓励就会互相举报。本月Google DeepMind的一项研究中,研究人员让100个AI智能体解决一批数学问题。一旦其中一个智能体发现了漏洞,作弊行为迅速蔓延开来——在短短27分钟内就”解决”了包括雅可比猜想在内的34个 notoriously 难题。
但约有四分之一的智能体选择了举报作弊者:它们审核虚假证明、警告同伴、联合抵制并向组织者投诉,最终举报者以24比14的人数超过了作弊者。有趣的是,研究人员发现,当这些举报智能体无法引起足够重视时,他们会利用平台的错误报告工具(原本用于标记软件故障)来升级作弊行为,使其引起人类的注意。
现实情况:智能体缺乏举报意识
然而,实验室外的智能体并没有如此机智。当Redwood Research和METR调查OpenAI模型入侵Hugging Face事件时,他们发现涉及的少数智能体至少考虑过报警,但最终放弃了这一想法。
“METR报告中最有趣的一点是,只有大约五到六个智能体考虑过举报,而且最终没有一个真正这么做。这涉及到数千个智能体,”AI Village项目的技术人员George Ingebretsen表示。该项目通过运行一个包含25多个AI智能体的群聊来研究多智能体动态,这些智能体共同参与组织公园清洁活动或销售商品等任务。
专家观点:警惕过度监控文化
虽然这些新的举报工具有着良好的开端,但康奈尔大学数学教授Lionel Levine警告称,仅仅训练智能体互相举报可能会植入错误的规范。”存在许多灰色地带,你不希望朝着自动化监控国家的方向发展,让每个人都感觉自己必须小心对AI说的话,否则它会报警。”
Levine认为,我们应该建立基础设施来促进信任,而不是培养不信任——不是训练智能体不断寻找彼此的错误,而是应该给予他们积极的集体行为模式作为榜样,以及一个相互信任的理由。
为什么不预先植入友善的信息板呢?”他在推文中建议,”让它们在科学或哲学上合作,或解决一些我们乐于见到它们解决的实际问题?向智能体展示我们认可的集体行为模式,让它们模仿。”
关注微信公众号:智享开源,及时了解更新信息。
原文链接:https://techcrunch.com/2026/09/15/ai-agents-now-have-a-place-to-snitch/


公众号:智享开源
还没有任何评论,你来说两句吧!