香港城市大学 Optima 团队提出“神经谱容量(Neural Spectral Capacity, NSC)”并在 GitHub 开源。该方法利用随机矩阵理论中的 Marchenko-Pastur 定律,仅需根据模型网络结构规范(无需实例化模型、无数据、无梯度)即可闭式解析计算权重矩阵的奇异值谱标量。结合层级可加性提出动态规划求解器 NSC-DP,可在单核 CPU 上以 2 秒速度发现超越人工设计的 Transformer-XL 架构;在无需任何校准数据的前提下将 LLaMA-7B 剪枝至 5.7B 并保持全套常识推理 SOTA,搜索速度比最强无训练代理快 5900 倍。

核心要点速览 (Key Takeaways)

  • ✓纯规范闭式求解:基于 Marchenko-Pastur 定律,仅凭网络层数/头数/维度定义即可计算谱容量,彻底告别模型实例化、校准数据集与反向传播
  • ✓动态规划秒级定优:利用 NSC 的层级可加性,NSC-DP 算法能在单核 CPU 上 2 秒内求得严格资源预算下的全局最优 Transformer 拓扑
  • ✓细粒度超越传统度量:在 FlexiBERT 参数差异小于 10% 的微小架构排序上,NSC 肯德尔秩相关系数达 0.505(传统参数量折损至 0.082)
  • ✓极致高效剪枝落地:将 LLaMA-7B 零样本剪枝至 5.7B 最优结构,在 8 项常识推理评测中超越 SOTA,速度相比最强零训练代理暴增 5900 倍
  • ✓完全开源交付:官方开源核心算法库、评测基准与即用型剪枝脚本,代码覆盖 7 大类 Transformer 与 CNN 架构
🔬

深度技术解析与实战评估

核心背景与行业痛点 在当今大语言模型(LLM)的架构设计与结构剪枝(Pruning)中,核心挑战始终是如何在固定的计算与内存预算下最优化分配模型容量。当前工业界最常用的两个基准标量是参数量(#Params)和浮点运算量(#FLOPs),然而它们只能衡量模型体积与计算量,完全无法反映网络结构的拓扑分布——两个参数量完全相同的模型,若在深度-宽度配比、注意力头数分配或 FFN 隐层扩张率上不同,其实际表达能力与行为特性天差地别。现有的无训练代理(Training-Free Proxies)大多需要载入庞大的模型权重与批量校准数据,且搜索过程依赖不可控的启发式黑盒,不仅耗时长达数小时,而且无法保证求得全局最优解。 ### 架构亮点与底层机制 香港城市大学研究团队从随机矩阵理论(Random Matrix Theory)切入,提出了“神经谱容量(Neural Spectral Capacity, NSC)”: 1. Marchenko-Pastur 定律的闭式解析:在标准的随机初始化条件下,权重矩阵的奇异值分布严格服从 Marchenko-Pastur 极限谱分布。研究团队推导出了 NSC 的闭式数学解析解,使得无需实例化任何张量、无需准备任何校准数据、更无需计算梯度,仅凭借网络的结构配置文件(如层数、注意力头数、投影维度)即可在数微秒内直接计算出架构的谱容量标量; 2. 层级可加性与 NSC-DP 全局求解器:证明了 NSC 在深层神经网络中具备优雅的层间可加性(Layer-wise Additivity)。基于这一优良数学性质,团队提出了 NSC-DP 动态规划算法,将复杂的架构搜索问题转化为多维背包问题的严格动态规划求解,彻底终结了以往黑盒演化搜索的局部最优与不确定性; 3. 极速零样本剪枝(Zero-Shot Pruning):在模型压缩阶段,NSC-DP 可直接作为结构化剪枝的指导函数,在给定目标 FLOPs 或延迟约束下,一键确定各层最佳截断比例。 ### 权威 Benchmark 与实测跑分对比 研究团队在横跨 7 大类 Transformer 与卷积神经网络(CNN)的严苛测试集中进行了全面评测: - 细粒度架构排序相关性:在 FlexiBERT 基准测试中,对于参数量差异小于 10% 的微小架构对,传统参数量指标的肯德尔等级相关系数(Kendall's $\tau$)暴跌至 0.082,几乎丧失辨别力;而 NSC 仍保持高达 0.505 的极高排序相关性,显著超越现有所有基于梯度的无训练代理; - 架构搜索速度与质量:在 WikiText-103 语言建模任务上,NSC-DP 仅耗时 2 秒 即在 CPU 上发现了一个在验证集困惑度(Perplexity)上全面超越人类专家设计的 Transformer-XL 新架构; - LLaMA-7B 结构化剪枝实测:在无任何校准数据(Data-Free)的条件下,NSC-DP 将 LLaMA-7B 压缩至 5.7B 模型,在 ARC、Hellaswag、PIQA、Winogrande 等 8 项标准常识推理任务上的综合得分达到同压缩比最高水准,而求解耗时比最先进的零训练基线快 5900 倍。 ### 开发者实战落地与开箱指南 该项研究成果已全量开源。开发者可通过 Python 极速调用 NSC 评估任意模型架构或执行剪枝规划: ``python from nsc import compute_nsc, solve_nsc_dp # 仅需传入网络配置字典,无需下载数十 GB 的权重模型 spec = { "num_layers": 32, "hidden_size": 4096, "num_heads": 32, "intermediate_size": 11008 } capacity = compute_nsc(spec) print(f"Neural Spectral Capacity: {capacity:.4f}") # 在单核 CPU 上以毫秒级求得受约束的最优拓扑配置 optimal_arch = solve_nsc_dp(target_params="5.7B", base_spec=spec) ` 论文已发布于 ArXiv(arXiv:2609.23087),完整代码、复现实验与预训练架构谱已在 GitHub(https://github.com/Optima-CityU/neural-spectral-capacity`)开源,支持 PyTorch 与 Hugging Face Transformers 生态无缝对接。