循环神经网络与共享层循环大模型(Looped LMs)支持简单 Token 少循环、复杂 Token 多循环的深度自适应推理,但变长层数导致标准 vLLM 等拼批系统彻底失效。慕尼黑工大与帝国理工学者提出“连续深度批处理”(Continuous Depth Batching, CDB)。通过循环步间动态重组批次、循环 KV 缓存管理以及基于置信度的提前退出异步预测,实现在单一 GPU 内多序列并发执行不同循环深度,在 Ouro 和 Huginn 模型上榨干高达 99% 的理论上限加速比。

核心要点速览 (Key Takeaways)

  • ✓攻克循环大模型无法拼批痛点:循环架构模型虽能按需为 Token 分配计算深度,但因各序列循环次数不一,导致无法直接送入传统 Tensor 并行或固定 Batch 流水线;CDB 首次建立步间连续拼批范式。
  • ✓步间重组与异步退出预测:在循环层执行步之间建立动态调度器,实时回收已满足退出条件的序列并插拔新请求;通过置信度前瞻预测器提前异步准备下一组 Batch,消除 GPU 气泡。
  • ✓逼近理论加速极限:在开源 Ouro 1.4B 与 Huginn 3.5B 循环模型上的测试显示,CDB 实现了理论估算最大推理加速比的 99%,彻底扫清循环推理模型走向生产级高并发部署的工程阻碍。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点 随着模型参数与推理成本激增,“按需思考”(Compute-Optimal Thinking)成为下一代架构的关键方向。循环大语言模型(Looped Language Models,如权值共享递归 Transformer)凭借其原生支持“深度自适应推理”(Depth-Adaptive Inference)备受关注:简单容易的 Token 仅需通过 2~4 次循环层即可精准输出,而遭遇复杂代码推理时则可递归深潜 16~32 次循环。然而,这一理论优势在工业落地中遭遇了毁灭性障碍:不同序列所需的循环次数完全不一致,传统的静态批处理和 vLLM 连续批处理(Continuous Batching)无法统一单次 Forward 步幅,要么被迫大量补零对齐(Padding Waste),要么陷入单请求串行运行,吞吐量暴跌。 ### 架构亮点与底层机制 来自慕尼黑工大(TUM)与帝国理工学院的研究团队提出了 连续深度批处理(Continuous Depth Batching, CDB): 1. 步间批次动态重构(Inter-Loop Batching):CDB 将批处理的重排时机从“整个 Token 生成结束后”下放至“每一次循环层执行完毕之后”。每一轮循环结束,调度器瞬间检测已达到退出阈值的 Token,将其剔除并将处于相同循环轮次的其他活跃 Token 重新规整打包; 2. 循环 KV-Cache 管理器:专门设计了适配层内多次迭代的轻量循环 KV 缓存指针机制,避免多轮展开导致的显存爆炸与碎片化; 3. 异步前瞻退出预测(Asynchronous Exit Prediction):利用浅层隐藏状态的范数与熵快速预估后续 Token 是否即将终止循环,提前在一个步长前完成下游 Batch 预构建,消除 GPU 核心在重排时的空转气泡。 ### 权威 Benchmark 与实测跑分对比 在两款经典开源循环模型架构 Ouro 1.4B 与 Huginn 3.5B 上,CDB 展现出极致的系统级吞吐能力: - 理论加速比转化率:在各种长短序列混合的高并发评测中,CDB 转化了理论上最高估计加速比的 99%,证明其几乎完全消除了动态深度带来的调度损耗; - 全循环架构的最佳适配:实验揭示完全循环(Fully Looped)的模型最具自适应收益;若模型外围存在庞大的非共享层(如巨大的 Embedding 和 LM Head),调度开销会略有增加; - 并发吞吐提升:相较于朴素填充方案,高负载下的真实服务吞吐量提升了 2.8 倍至 3.6 倍,显存利用率维持在 94% 以上。 ### 开发者实战落地与开箱指南 - 预印本研究:详见 arXiv:2608.09444; - 架构启示:对于设计下一代思考型推理 Agent 的底层系统工程师,CDB 证明了“无需牺牲并发吞吐即可享受动态递归计算的红利”; - 服务引擎对接:团队目前正在将 CDB 核心调度算子整理为独立模块,计划向 vLLM 与 SGLang 社区提交 PR,为未来的循环深度自适应模型提供开箱即用的 Serving 支持。