开发者 3 秒速决决策指标
同策略蒸馏(On-Policy Distillation, OPD)作为前沿推理大模型后训练(Post-Training)的核心手段,被普遍认为是将强教师模型的思维链推理知识“传输灌注”给弱学生模型的关键技术。然而,在模型的隐层高维空间中,OPD 究竟在学生的表征内部雕刻了什么,长期处于未解的黑盒状态。香港大学(HKU)联合团队创新性地引入可解释性利器“稀疏交叉编码器”(Sparse Crosscoders)与全新探针“交换读取”(Swap Readout)技术,对 OPD 训练全生命周期展开显微镜式特征解构。研究惊人地发现:OPD 既没有为学生模型凭空创造新的神经表征特征,也没有将教师专有的私有特征硬塞进去,学生模型 98% 的高频特征激活频率变化幅度均在 20% 以内;OPD 的核心本质是“重塑既有特征的权重”。同时,研究从机理上阐明了为何在 OPD 前必须进行 SFT 热身:热身阶段提前完成了特征重构并注入了格式范式。这一突破性发现为大模型蒸馏对齐与模型瘦身提供了强有力的机械可解释性基石。
核心要点速览 (Key Takeaways)
- ✓颠覆“知识传输”直觉认知:首次证实同策略蒸馏(OPD)并未赋予学生模型全新的潜在特征,亦未直接传递教师私有特征,其本质是重构并重新分配学生已有特征的调用权重。
- ✓98% 高频特征保留与激活校准:显微镜级分析显示,学生模型 98% 的核心特征在蒸馏后激发频率稳定在 20% 范围内,模型是在教师的策略引导下学会更合理地组合调用自身既有表征。
- ✓解密 SFT 热身必不可少的数学本质:揭示了为何在 OPD 之前先用教师轨迹微调至关重要——SFT 提前抬升了与最终推理相关的共有特征,并注入了对话格式、思维范式与数学符号体系等持久特征。
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察