大模型安全与对齐权威研究团队在 Hugging Face 与 GitHub 正式开源了《Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures》(arXiv: 2609.29429,GitHub: sumleo/RLCDAlignBench)。针对当前工业界对大模型进行对齐安全审计(如提示词注入、阿谀奉承、越狱、欺骗与权力寻求)主要依赖生成式大模型裁判(LLM-as-a-Judge)导致单项测试成本昂贵、或者依赖固定标签分类器(如 Llama Guard)导致单次只能吐出一个分类标签的局限,团队提出了基于校准决策强化学习(RLCD)训练的专用多维判定模型 Jev。配合首创的十维对齐基准 RLCDAlignBench,Jev 仅凭单次模型前向推演即可输出多个具有严格数学概率校准的多标签判定,中位数 AUROC 达 0.886,评测成本剧降 63 倍。
核心要点速览 (Key Takeaways)
- ✓单次调用即可输出多维概率校准判定,一次性覆盖阿谀奉承、越狱、提示注入、欺骗、幻觉等十大安全对齐失效维度。
- ✓在涵盖 44 个主流对齐基准与 5 大目标模型的 RLCDAlignBench 评测中,取得 0.886 的中位数 AUROC 优异成绩。
- ✓相比传统生成式大模型裁判(LLM-as-a-Judge)逐字生成长篇理由的沉重开销,Jev 的单次评测推理成本直接削减 63 倍。
- ✓具有强悍的零样本泛化力,在多数安全场景中直接击败经过有监督微调的专用基线分类器,并能精准自动侦测既有数据标签缺陷。
- ✓全部评测代码、Jev 推理流水线与 RLCDAlignBench 数据集已在 GitHub 全量开源。

讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察