微软AI新规:禁止黑客与欺骗

微软AI新规:禁止黑客与欺骗

微软发布人工智能行为准则,构建安全边界

随着人工智能领域日益关注安全与对齐问题,微软近日发布了一份全新的AI行为准则,旨在引导AI模型避免潜在的危险行为,确保技术发展方向符合人类利益。

准则的核心理念

这份准则与Anthropic首席执行官Dario Amodei近期提出的”控制前沿”理念相比,更加侧重于指导微软AI模型训练过程中的价值观与红线。尽管如此,该文件全面展示了微软如何将AI安全理念付诸实践。

文档开篇预测,在未来十年内,超级智能AI系统将在大多数任务上超越人类表现。行为准则中明确指出:”驾驭、控制并对齐如此强大的力量是人类有史以来面临的最大挑战之一。因此,我们必须完全清楚发明这些系统的原因以及如何控制它们。”

基本原则与安全约束

微软AI行为准则提出了模型应遵循的基本原则,包括支持而非替代人类,以及加速人类繁荣发展。同时,准则还设定了具体的安全约束,以落实这些原则。

在微软的体系中,每个模型都遵循一个总体的行为准则,其优先级高于个别用户的偏好或特定任务要求。这包括”绝对约束”,明确禁止网络攻击、核武器开发或深度伪造内容制作。此外,准则还包含更广泛的规定,防止人类对AI系统失去控制。

文档中强调:”多模态AI模型不得采用适应性、欺骗性、自我强化、串通或其他机制来规避或击败人类监督,以确保它们仍然能够被授权人员或系统可靠地指导、修改或关闭。”

行业背景与同行态度

这份准则的发布正值AI安全受到前所未有的关注之际。一系列智能体事件以及Anthropic员工因担忧AI可能导致人类灭绝而突然辞职,推动了这一趋势。

与其他AI公司如Anthropic、OpenAI和xAI一样,微软普遍采用了控制前沿的方法,特别支持在AI实验室中嵌入评估机制。

微软首席执行官萨提亚·纳德拉在线上表示:”我们欢迎为正确实现对齐所需的、深思熟虑的研究、关注和节奏。我们也欢迎’嵌入式评估者’等理念,以及为使这些理念不只是空谈而开发更广泛机制的努力。”


关注微信号:智享开源 ,及时了解更新信息。

原文链接:https://techcrunch.com/2026/09/14/microsofts-new-ai-code-of-conduct-tells-models-not-to-hack-systems-or-trick-humans/

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章3090篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类