Anthropic 研究员让我们提前窥见自我改进的 AI
用 AI 模型来训练 AI 模型,已成为新一代 AI 实验室竞相追逐的目标——如今,Anthropic 研究员计划(fellows program)的一位研究员让我们提前看到了它在实践中的可能模样。
周五,Anthropic 发表了一篇题为「Automated Researchers Can Reliably Mitigate Alignment Failures」的新论文,详细阐述了 AI 系统如何能够可靠地提升模型在一组对齐基准上的表现。在拿到 10 项针对特定失对齐行为的基准后,这些自动化系统在每一项上都实现了性能提升,且没有损害整体性能。
该系统由 Anthropic 研究员 Chen Yueh-Han 牵头,很大程度上复刻了传统的研究流程:每个自动化系统检索现有文献、提出一种方法,再用该方法对模型训练 30 分钟,在多轮迭代中逐步推高基准成绩。有效的方法被保留,无效的方法被淘汰,让系统能够快速且大规模地运转。
论文写道:「总体而言,这些结果提供了早期证据,表明自动化的对齐后训练(post-training)可能在短期内变得切实可行。」
这篇论文是迈向递归自我改进(recursive self-improvement)的一步,许多人将其视为 AI 进展的下一个重大台阶。如果模型能够改进自身的对齐训练,那么它们也完全可能更广泛地改进训练实践——到那时,人类 AI 研究员可能很快就会变得多余。
论文对这一想法并不讳言,明确将自动化对齐研究员(AAR)与其人类同行作了对比。「最好的 AAR 方法平均在六小时内就能击败有经验的人类所提出的方案,」论文写道,「由人类引导的研究方向并不能带来更强的性能。」
论文甚至给出了成本对比,生怕有人不信服:「一个 AAR 的 API 推理成本约为每小时 4 美元,而我们付给人类研究员的是每小时 150 美元。」
平心而论,论文也指出了这一方法的若干局限:自动化系统只有在基准切实反映对齐目标时才有效,而即便如此,建立并维护这些基准仍有大量工作要做——更不用说维护和扩充自动化研究员所取材的文献库了。