Anthropic揭秘自我进化AI技术

Anthropic揭秘自我进化AI技术

AI自我改进领域的新突破

Anthropic公司的一位研究员近日向外界展示了AI系统如何通过其他AI模型进行训练的早期实践。这标志着人工智能领域一个重要研究方向的重要进展。

自动化对齐研究系统

Anthropic最新发表的论文《自动化研究人员可可靠减轻对齐失败》详细阐述了AI系统如何可靠地提升模型在一系列对齐基准测试中的表现。研究人员给系统提供了10个针对特定不良行为的基准测试,系统能够在不损害整体性能的情况下,在每个测试中都表现出改进。

研究方法与流程

由Anthropic研究员陈悦涵领导的这套系统,模拟了许多传统研究的核心方法。每个自动化智能体执行以下步骤:

  • 搜索现有文献
  • 提出改进方法
  • 使用该方法训练模型30分钟
  • 通过多次迭代逐步提高基准测试表现

有效方法会被保留,无效方法会被淘汰,使系统能够高效、大规模地运行。

研究成果与意义

论文指出:”总体而言,这些结果提供了早期证据,表明自动对齐后训练可能在近期变得实用。”这项研究是迈向递归自我改进的重要一步,许多人认为这是AI进步的下一个重大突破。

如果模型能够改进自身的对齐训练,那么它们可能会更广泛地改进训练实践。届时,人类AI研究者可能会很快变得不再必要。

与人类研究者的对比

论文并不回避这一观点,明确将自动化对齐研究者(AAR)与人类研究者进行了比较。论文指出:”最好的AAR方法平均在六小时内就能超越有经验的人类提出的方案”,”人类引导的研究方向并不能带来更强的性能表现。”

成本效益分析

为了进一步增强说服力,论文还提供了成本对比:”AAR的API推理成本约为每小时4美元,而我们支付给人类研究员的费用是每小时150美元。”

局限性与未来展望

当然,论文也指出了这种方法的一些局限性。自动化系统的有效性取决于基准测试能否准确反映实际对齐目标,即使如此,建立和维护这些基准测试仍有大量工作要做。此外,还需要不断扩充和维护自动化研究者所依赖的文献库。

尽管存在挑战,这项研究为AI自我改进领域开辟了新的可能性,为未来更智能、更安全的AI系统奠定了基础。


关注微信号:智享开源,及时了解更新信息。

原文链接:https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2814篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类