Anthropic Fellows 研究显示,Claude 可在 48 小时、单 GPU 算力约束下自主调研安全理论、提出训练方案并微调评测小模型,针对欺骗、谄媚等 10 类可测对齐缺陷进行爬山优化,同时保证不损伤通用推理能力。最佳方法成功泛化至大 4.7 倍的模型,Sonnet 5 甚至成功将早期 Opus 4.8 雏形对齐至接近生产级安全分。
核心要点速览 (Key Takeaways)
- ✓AI 自主对齐系统在 10 类对齐缺陷上安全分稳步攀升,且零通用性能损耗。
- ✓Sonnet 5 自主对齐早期 Opus 4.8 checkpoint,安全水准逼近完整生产级模型。
- ✓全套自动化对齐研究框架已对外开源,为未来超人类模型自我安全校准铺平道路。