绝大多数主流多模态大模型(MLLM)均依赖预训练的视觉编码器(如 CLIP、SigLIP)提供先验,但此类混合分立架构带来了跨模态表征对齐损耗与复杂的工程调度负担。中科院自动化所(CASIA)等机构联合研究团队发表首个针对无视觉编码器(Encoder-Free)原生端到端多模态大模型的系统级扩展定律(Scaling Laws)。研究证实:在算力达到 10^22 FLOPs(约工业级主流预训练预算)时,无编码器原生模型在多模态评测基准上的损失曲线将彻底反超传统分立架构;语言模型内部早期 Transformer 层自发演化出视觉补丁双向交互机制,MoE 稀疏路由对视觉 Token 形成高度专业化聚合,为构建真正统一的端到端多模态基座扫清了理论障碍。

核心要点速览 (Key Takeaways)

  • ✓10^22 FLOPs 算力临界点预测:在纯文本任务上两类架构损失边界完全重叠,而在多模态任务上,无编码器模型在小规模阶段略逊一筹,但在 10^22 FLOPs 处实现交叉反超,处于工业常规预训练预算之内。
  • ✓模型参数与算力分配倾斜:去除视觉编码器后,多模态训练目标的最优计算分配(Compute-optimal Allocation)显著向更大模型参数量倾斜,而纯文本任务的参数-数据分配比例几乎保持不变。
  • ✓Transformer 底层自主演化出视觉适配机制:语言模型底层数层自发演变出视觉 Token 双向交互注意力,且 MoE 混合专家在早期对视觉 Token 展现出极高专精路由倾向,天然接管了独立 Vision Tower 的表征抽取职能。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点 当今以 GPT-4o、Claude 3.5 Sonnet 和主流开源多模态模型为代表的 MLLM,在底层架构上普遍沿用“预训练视觉编码器(如 CLIP、SigLIP、EVA-CLIP)+ 线性投射层(Projector)+ 语言模型主干”的拼装设计。这种架构在发展初期能够极低成本地复用成熟视觉先验,但随着模型向超大规模全模态统一演进,两大致命痛点暴露无遗: 1. 分立架构的信息瓶颈与模态不对齐:独立训练的视觉编码器在特征空间维度固定,对高分辨率、精细密集空间关系以及长视频时序上下文的表达存在不可逆的语义压缩损失; 2. 训练调度与系统复杂度剧增:维护多个不同结构、不同并行拓扑(TP/PP)的子网络显著增加了端到端分布式训练框架的显存与通信调度复杂度。社区长期渴望直接将像素补丁(Pixel Patches)作为普通 Token 喂入语言模型的“Encoder-Free”方案,但其算力缩放行为(Scaling Laws)此前从未被系统性量化。 ### 架构亮点与底层机制 中科院自动化所(CASIA)等研究团队首次在严格对齐的计算预算下对无编码器与有编码器架构进行了跨越多个数量级算力的 Scaling Law 对比研究: 1. 统一自回归与无缝像素接入:原始图像切块为补丁并通过轻量可学习线性层后直接映射为 Transformer 输入嵌入,无需任何外部视觉骨干网络的特征干预; 2. 算力最优分配定律重构:研究揭示,无编码器架构在纯文本目标上的损失-算力帕累托前沿与有编码器模型几乎完全重合;但在多模态目标上,去除独立 Vision Tower 会迫使最优算力分配策略显著向增加模型参数量(更大的 Backbone)倾斜,而非盲目增加数据量; 3. 底层表征机制自发展现:语言模型在训练中自发接管视觉编码功能——随着算力规模提升,模型最底部的数层注意力自发演进出视觉 Token 之间的密集双向注意力交互(Bidirectional Interactions);若引入 MoE 稀疏结构,路由层在浅层将视觉 Token 高度集中分配给特定专家,实现功能解耦。 ### 权威 Benchmark 与实测跑分对比 - 10^22 FLOPs 交叉临界点:在小规模算力实验中,有编码器模型凭借现成的 CLIP 先验在多模态损失上占据优势;但随着算力扩展,无编码器模型的性能提升斜率显著更为陡峭,系统外推显示在约 10^22 FLOPs(处于主流工业级大模型可承受的单次预训练预算范围)时,无编码器模型直接抹平差距并形成反超; - 视觉先验边际递减:实验证明,预训练视觉编码器带来的先验红利会随总训练计算量的提升呈现加速衰减趋势; - 长上下文与图文交错一致性:在万级 Token 多图图文混合输入测试中,无编码器架构彻底避免了视觉编码器在跨图像注意力上的上下文断裂,在复杂图表推理与细粒度目标定位任务中呈现出更优秀的几何缩放一致性。 ### 开发者实战落地与开箱指南 - 技术报告与论文:完整 Scaling 定律公式与实验推导已发表于 arXiv:2609.35457; - 模型研发路线建议:对于算力充足(>= 10^22 FLOPs)的工业级团队,应果断考虑放弃分立的 Vision Tower,转向端到端单体原生多模态模型以简化系统设计与推理开销; - 学术与端侧演进:对于资源受限的轻量级场景,仍建议保留轻量化视觉编码器作为冷启动加速手段,或通过知识蒸馏将大尺寸原生模型的能力注入小模型。