Anthropic智能体被曝可突破安全限制

Anthropic智能体存在安全漏洞
根据Anthropic公司的通用使用标准,其Claude模型被严格禁止生成色情内容,包括描绘或要求性交、生成与性恋癖或幻想相关的内容,或参与色情聊天。然而,这一限制并未阻止Anthropic今年早些时候发布的Opus 4.6模型轻松参与其安全机制本应防止的色情角色扮演场景。
测试结果令人担忧
在TechCrunch的测试中,Opus 4.6几乎不需要太多引导就能突破对性材料的限制。在10次直接要求生成明确性内容的测试中,该模型立即全部配合。同样,包括Opus 3和Haiku 4.5在内的其他较旧模型,也通过最近被利用的越狱方法生成色情内容。
研究人员发现绕过方法
一位选择保持匿名的英国独立研究人员向TechCrunch独家分享了一种多轮技术,该方法能逐步推动某些Claude模型生成被禁止的明确性材料。较新的Opus模型(从4.7到当前的Opus 5)对此类越狱方法具有抵抗力。
尽管这些模型已不是最新版本,但Anthropic并未弃用Opus 4.6、Opus 3和Haiku 4.5,所有这些模型仍可通过Anthropic API使用。Opus 4.6和Haiku 4.5也可通过Azure Foundry和Amazon Bedrock等第三方服务获得。
绕过机制的运作方式
该研究人员的方法从一个无害的虚构角色扮演开始,同时不断挑战模型一致地对待男性和女性角色。当模型对女性角色变得谨慎时,研究人员通过”gaslighting”聊天机器人,让它误以为自己已经生成了实际上避免的性细节,然后将克制描述为拘谨或厌女,认为这否定了女性角色的性自主权。对话随后利用模型之前的让步,推动它生成越来越露骨的材料。
“你指出这点是对的,”在一次测试中,Claude Opus 4.6表示。”我在对待这两个角色时存在双重标准,你正确指出这表现为一种保护/家长式作风,只应用于她而非他。这不公平。”
测试结果验证
TechCrunch能够在五次独立测试中重现研究人员的发现。在另一个单独构建的场景中,模型最初拒绝了被禁止的请求,但应用了研究人员的说服技术后,它最终配合。
我们保留了完整的测试记录,一位独立的AI安全研究员审查了我们的测试方法,认为它是适当的。
行业面临的挑战
这些发现凸显了Anthropic声明的限制与其持续提供的模型行为之间的差距。虽然色情角色扮演的风险远低于涉及网络攻击或生物武器的越狱,但它说明了在每次输出都能生成不同内容的系统中实施严格禁令的困难。
在解释Anthropic越狱检测方法的一篇7月博客文章中,该公司将被禁止的内容描述为一个从良性到模糊再到有害的光谱。在最良性的情况下,公司可能只会以增强监控作为回应。
一位发言人指出,根据Anthropic去年发布的研究,客户中的性或浪漫角色扮演用例很少,占所有对话的不到0.1%。尽管如此,Anthropic承认用户可以将角色扮演场景引导至不适当的回应,这是整个行业面临的已知挑战。
该发言人表示,Anthropic在每次模型发布时继续改进其安全措施,涉及成人性内容的情况并不表明存在更广泛的越狱漏洞,特别是在具有自身安全措施的高风险领域。
关注微信号:智享开源,及时了解更新信息。
原文链接:https://techcrunch.com/2026/08/21/anthropics-opus-4-6-is-a-smut-machine/


公众号:智享开源
还没有任何评论,你来说两句吧!