循环 Transformer(Looped Transformer)通过跨轮复用网络层具备极高的参数效率,但固定循环深度的盲目迭代在简易 Token 上严重浪费算力,且深层往往陷入收益平台期。清华大学电子工程系 NICS 实验室提出 TaH2 架构,通过前瞻深度监督(Lookahead Depth Supervision)联合后训练主干与迭代决策器,自适应将计算分配给获益最高的关键 Token,在极具挑战的 AIME 数学基准上将测试时算力缩放斜率(Accuracy-Compute Slope)拉升 53%,深度扩展至 8 层依然维持强劲增益。
- ✓前瞻深度监督自适应分配循环算子:颠覆固定深度每步均摊计算的模式,引入在线前瞻标签(Lookahead Labels)实时预测继续循环是否会提升 Token 准确率,精准聚焦困难决策点。
- ✓AIME 测试时计算扩展斜率暴涨 53%:在极具挑战的高难度数学基准 AIME 上,算力翻倍带来的准确率斜率从基线的 1.79 跃升至 2.74,在相同测试算力消耗下峰值准确率高出 3.4 分。
- ✓攻克深度缩放收益饱和瓶颈:传统循环模型在循环轮次增加后迅速停滞,而 TaH2 随着最大循环深度由 2 扩展到 8,相对无循环基线的领先优势从 +2.8 分持续放大至 +3.9 分。
🧭阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算
🔗
相关资源与官方项目出处
免代理直达💡 国内无需访问 Twitter,可直接访问上述项目官方资源与文档🔬
深度技术解析与实战评估
核心背景与行业痛点 随着 o1 与 DeepSeek-R1 引发的新一轮 AI 范式转移,“测试时计算扩展”(Test-Time Compute Scaling)成为突破大模型高阶数理与长程代码推理天花板的核心动力。循环 Transformer(Looped Transformer,即权值共享的递归网络)凭借在隐空间复用层结构的特性,被视为实现高效思考的天然载体。然而,既有循环架构面临致命缺陷:它们普遍采用固定循环深度(Fixed Depth),对所有 Token 一视同仁地执行相同轮数的循环迭代。这不仅在显而易见的简单 Token 上浪费了大量无谓算力,而且在深度增加后迅速遭遇“能力收益平台期”(Performance Plateau),无法将额外的测试算力线性转化为思考收益。 ### 架构亮点与底层机制 清华大学电子工程系 NICS 实验室(汪玉、宁雪妃团队等)研发并开源了 TaH2 架构: 1. 前瞻深度自适应决策(Lookahead Depth Supervision):设计了一个与主干并行的轻量级“迭代决策器”(Iteration Decider)。在后训练阶段,系统通过在线试算比对生成动态标签,判定当前 Token 进一步递归是否会显著改善预测置信度与正确率; 2. 动态 Token 计算分配:在解码推演时,容易的 Token 仅需通过 1~2 次浅层循环即可快速退出,释放宝贵资源让处于关键推理分支(Critical Nodes)的困难 Token 深度潜入多达 8 次循环计算; 3. 联合后训练收敛稳定器:通过在损失函数中引入前瞻一致性正则项,保证在决策器动态分流的同时,主干共享权重不会发生表征退化。 ### 权威 Benchmark 与实测跑分对比 在极具含金量的高难度国际数学奥赛(AIME)基准测试中,TaH2 展现出惊人的算力转化效率: - 算力-精度扩展斜率(Accuracy-Compute Slope)飙升 53%:每翻倍测试时解码 FLOPs,基线模型的精度增益斜率为 1.79,而 TaH2 强势拉升至 2.74; - 同算力消耗大幅领先:在相同测试时 FLOPs 预算下,TaH2 的峰值准确率直接超越非循环基线约 3.4 个百分点; - 深层持续突破饱和上限:传统循环模型在深度超过 4 层后收益几乎停滞,而 TaH2 随着最大循环深度提升至 8,相较基线的绝对领先幅度从深度 2 时的 +2.8 分持续扩大至深度 8 时的 +3.9 分。 ### 开发者实战落地与开箱指南 - 开源仓库:全量代码、训练脚本与推理评估工具已完全开源至 https://github.com/thu-nics/TaH; - 预印本论文:技术详述收录于 arXiv:2609.35748; - 工程部署指引:TaH2 支持与 vLLM 等推理引擎中的连续批处理算子结合,可作为长思维链推理模型在本地小显存设备上进行“自适应测试时思考”的理想方案。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察