AI21 Labs 发布独立智能体校验器(Agent Verifier)研究成果。指出 Agent 错误主要是候选结果中的“选择问题”而非“生成问题”,通过训练独立的核验模型重新检索事实,在 FACTS-Search 评测中取得 93.4 分,远超 83.3 分的多数投票基线。
核心要点速览 (Key Takeaways)
- ✓独立校验机制:校验器不看生成器的中间推理链,避免被生成模型的逻辑幻觉所带偏;
- ✓成本效益远超重复采样:核验单条事实主张的开销远低于让大模型重新跑一遍长检索链路;
- ✓泛化能力优秀:只需极少量微调样本(约 15 步 SFT)即可快速迁移适配至全新领域评测。