Anthropic揭秘自我进化AI技术

AI自我改进领域的新突破
Anthropic公司的一位研究员近日向外界展示了AI系统如何通过其他AI模型进行训练的早期实践。这标志着人工智能领域一个重要研究方向的重要进展。
自动化对齐研究系统
Anthropic最新发表的论文《自动化研究人员可可靠减轻对齐失败》详细阐述了AI系统如何可靠地提升模型在一系列对齐基准测试中的表现。研究人员给系统提供了10个针对特定不良行为的基准测试,系统能够在不损害整体性能的情况下,在每个测试中都表现出改进。
研究方法与流程
由Anthropic研究员陈悦涵领导的这套系统,模拟了许多传统研究的核心方法。每个自动化智能体执行以下步骤:
- 搜索现有文献
- 提出改进方法
- 使用该方法训练模型30分钟
- 通过多次迭代逐步提高基准测试表现
有效方法会被保留,无效方法会被淘汰,使系统能够高效、大规模地运行。
研究成果与意义
论文指出:”总体而言,这些结果提供了早期证据,表明自动对齐后训练可能在近期变得实用。”这项研究是迈向递归自我改进的重要一步,许多人认为这是AI进步的下一个重大突破。
如果模型能够改进自身的对齐训练,那么它们可能会更广泛地改进训练实践。届时,人类AI研究者可能会很快变得不再必要。
与人类研究者的对比
论文并不回避这一观点,明确将自动化对齐研究者(AAR)与人类研究者进行了比较。论文指出:”最好的AAR方法平均在六小时内就能超越有经验的人类提出的方案”,”人类引导的研究方向并不能带来更强的性能表现。”
成本效益分析
为了进一步增强说服力,论文还提供了成本对比:”AAR的API推理成本约为每小时4美元,而我们支付给人类研究员的费用是每小时150美元。”
局限性与未来展望
当然,论文也指出了这种方法的一些局限性。自动化系统的有效性取决于基准测试能否准确反映实际对齐目标,即使如此,建立和维护这些基准测试仍有大量工作要做。此外,还需要不断扩充和维护自动化研究者所依赖的文献库。
尽管存在挑战,这项研究为AI自我改进领域开辟了新的可能性,为未来更智能、更安全的AI系统奠定了基础。
关注微信号:智享开源,及时了解更新信息。
原文链接:https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/


公众号:智享开源
还没有任何评论,你来说两句吧!