Anthropic 发布 Fellows 研究:给 Claude 48 小时和 1 块 GPU,让其自主研究、提出方法并训练、测试小模型的对齐。Claude 在 10 类对齐失败上稳定提升安全分数且不伤通用能力;方法可泛化到未优化基准、Petri 行为审计,以及最多大 4.7 倍的模型。首次测试中,Sonnet 5 对 Opus 4.8 早期检查点做后训练,安全分数接近完整对齐训练的生产版 Opus 4.8。
核心要点速览 (Key Takeaways)
- ✓自主对齐研究已从设想变成可复现的训练循环:模型自己爬山、评测并保留能力。
- ✓Sonnet 5 能把更强的 Opus 4.8 检查点拉到接近生产对齐水平,是“弱模型对齐强后继”的早期证据。
- ✓Anthropic 开源了自动对齐研究设置;稀有/不可测失败仍取决于能否定义正确的度量。