标准 Transformer 架构长久以来依赖残差流(Residual Stream h)作为层间信息流转的单一叠加通道,导致各注意力层为了独立解耦深层语义,必须各自投影并持久化保存极其庞大的键值缓存(KV Cache),持久显存开销随层数与隐藏层维度以 2 * L * d_model 线性膨胀,严重制约了端侧推理与百万 Token 超长上下文扩展。研究学者提出了颠覆性的对数结构 Transformer 架构 The Extender(arXiv:2609.32759):在传统的残差叠加流 h 之外,额外开辟了一条极度轻量的层间拼接通道(Concatenation Channel x)。每一层仅向残差流输出正常更新 delta_l,同时向拼接通道追加一个尺寸极小的新增扩展向量 epsilon_l(例如 |epsilon_l| = 32)。最为关键的创新在于:FFN 与 Query 投影继续读取承载高维融合语义的 h,而各层的 Key/Value 投影则完全且唯一地读取拼接通道 x!这一重构使得持久注意力显存占用从 2 * L * d_model 暴降至 sum |epsilon_l|。在 924M 参数、隐藏维度 1664 的模型实测中,The Extender 将注意力持久显存占用水准断崖式削减了 104 倍,不仅在短文本 CORE 基准上与标准 Transformer 表现持平,在 RULER 超长上下文严苛测试中更是全面反超标准 MHA,且模型越宽省存效益越呈几何级放大。

核心要点速览

  • ✓提出对数结构 Transformer 架构 The Extender,额外引入拼接通道 x 彻底解耦 FFN 与注意力的层间输入
  • ✓将 Key/Value 投影约束在拼接通道,注意力持久显存占用从 2 * L * d_model 压缩为 sum |epsilon_l|
  • ✓924M 模型注意力显存暴降 104 倍,短文本 CORE 精度完全打平,超长文本 RULER 测试全面超越标准 MHA
Transformer 底层架构巨变!The Extender 提出对数结构架构:注意力持久显存骤降 104 倍,长文本全面超越 MHA
🖼️要闻配图
点击全屏高清查看
🧭

把技术选型换算成你的开发预算

29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

自 2017 年诞生以来,标准 Transformer 模型已成为现代大语言模型的基础基石。然而,其底层的通信通道设计存在着天生缺陷:所有层级仅通过唯一的残差流(Residual Stream h)进行叠加通信。由于残差流是一个高维“叠加通道(Superposition Channel)”,后续层想要读取特定历史特征,就必须由各层的 Multi-Head Attention(MHA)或 Grouped-Query Attention(GQA)重新投影并保存独立的 Key 与 Value 缓存。这导致在长文本生成与批量并发推理时,KV Cache 的持久显存占用高达 2 L d_model(其中 L 为模型层数,d_model 为隐藏层维度)。当上下文达到 128k 乃至 1M 时,KV Cache 往往吞噬数百 GB 显存,甚至远超模型自身权重,成为大模型服务推理最大的成本包袱。

架构亮点与底层机制

针对这一经典结构的固有缺陷,研究学者 Jakob Eriksson 提出了革命性的对数结构变体 The Extender(arXiv:2609.32759):

  1. 双通道正交通信设计(Dual Superposition & Concatenation Channels):在传统的残差叠加流 h 之外,平行引入轻量级“拼接通道(Concatenation Channel x)”。每一层计算时,既向 h 输出正常的残差更新增量 delta_l,同时仅向 x 追加极小的一小段扩展向量 epsilon_l;
  2. 注意力与前馈网络的输入彻底解耦:模型的前馈网络(FFN)与 Query 投影保持对残差流 h 的全局视野,以汲取多层深层非线性语义;但各层的 Key 和 Value 投影则唯一且完全依赖拼接通道 x 作为输入;
  3. **注意力持久显存占用从 2 L d_model 压缩为 sum |epsilon_l|**:由于完整的 x 已经完整包含了所有层计算 KV 所需的全部历史输入,注意力持久状态无需在每层重复维护 d_model 维度的冗余投影,极大斩断了层间重复记录历史的冗余开销。

权威 Benchmark 与实测跑分对比

在跨越短文本与百万级超长文本任务的严格消融与基准评测中,The Extender 展现出惊人的显存压缩比与强大的精度表现:

  1. 显存占用暴降 104 倍(104x Footprint Reduction):在模型隐藏宽度为 1664 的 924M 模型实测中,当设定扩展向量尺寸 |epsilon_l| = 32 时,The Extender 的持久注意力显存开销相比标准 Multi-Head Attention(MHA)实现了整整 104 倍的断崖式削减;且随着模型宽度 d_model 进一步增大,节省比例呈乘数级扩大;
  2. 短文本 CORE 基准完全打平标准 Transformer:在涵盖标准自然语言理解与推理的 CORE 短文本测试套件中(199M 至 924M 参数模型),The Extender 的准确率完全打平了标准稠密 Transformer,证明极简拼接通道没有损失任何核心语义表征力;
  3. 超长上下文 RULER 评测全面超越 MHA:在公认严苛的 RULER 长上下文评测任务中(924M 参数),The Extender 的实际召回与推理准确率甚至全面超越了标准 Transformer MHA,打破了以往注意力压缩算法“减存必然牺牲精度”的物理魔咒。

开发者实战落地与开箱指南

The Extender 的架构设计为下一代端侧小模型(On-Device LLMs)、高并发企业推理服务器以及千万 Token 超长上下文架构打开了全新视野。对于正在设计新型底层基础模型、自研注意力算子或致力于优化 vLLM/SGLang 显存开销的算法架构师,The Extender 证明了“残差叠加+拼接解耦”在根本机制上优于单纯的线性注意力或传统稀疏注意力。开发者可借鉴其 Key/Value 共享拼接输入的思想,以极低的架构迁移代价,让未来大模型彻底卸下沉重的 KV Cache 显存枷锁。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。