Q Labs 发布研究 Dust(登上 Hacker News 首页):一种零阶(只用前向)优化算法,在每个 token 上独立扰动激活值,把一次前向变成数千个「虚拟种群成员」,再用损失变化估计梯度。在 GPT 式 Transformer、FineWeb 预训练上,100k/1M token 预算下 Dust 损失低于调优后的 backprop,10M/20M 下差距随种群扩大而收窄;最大测到 243M 参数。作者明确:算力效率尚远不足以取代 backprop。

核心要点速览

  • ✓1M token 预算下,种群约 1k 起 Dust 测试损失低于 backprop;100k 预算下数百个 draw 即反超(论文页)
  • ✓20M token:幂律外推极限 4.431(95% 区间 3.89–4.58)vs backprop 4.633,作者称外推约束较松,仅作趋势证据
  • ✓效率:相对权重空间 ES 方法 EGGROLL 约 10³–10⁴ 倍;EGGROLL 用 256 倍种群仍不及 Dust 64 draw
  • ✓反直觉:10M token 下 243M 参数模型在多数种群规模上优于 120 倍更小的模型,大模型更「种群高效」
  • ✓qlabs-eng/dust(MIT):默认种群 16,384,8 卡 torchrun 复现 1M/10M 实验,另有单卡小规模配置
🧭

把技术选型换算成你的开发预算

29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

从 1986 年至今,训练神经网络几乎只有反向传播一条路:架构、优化器和硬件都围绕「可微 + 一阶梯度」共同演化。零阶方法(只做前向、靠扰动估计梯度)一直被认为无法扩展到大网络,因为估计方差随维度增长。Q Labs 的 Dust 想证明:算力足够时,基于搜索的信用分配可以在最难的任务——Transformer 预训练——上与 backprop 竞争。

架构亮点与底层机制

Dust 不扰动权重,而是在每个线性层输出、每个 token 上独立加高斯噪声,以该 token 的损失变化作为奖励,种群平均后得到输出误差估计,再与层输入做外积得到权重梯度。于是一次前向就评估了「每个 token 一个成员」的虚拟种群,比权重空间 ES 大至少三个数量级。注意力内部(Q/K/V 等)通过注意力输出的估计误差打分,K/V 还接收未来 token 的衰减信用;不同层类型分开前向以减少干扰。

权威 Benchmark 与实测跑分对比

论文自报(8 层、宽 512 的 GPT 式模型,FineWeb,SGD,三种子):100k 与 1M token 下 Dust 低于调优 backprop;20M token 外推极限 4.431 vs backprop 4.633;相对 EGGROLL 效率约 10³–10⁴ 倍;最大 243M 参数。尚无独立复现,且规模远小于生产级预训练。

开发者实战落地与开箱指南

qlabs-eng/dust 提供最小实现:python prepare_data.py 从 Hugging Face 流式准备 FineWeb,torchrun --nproc_per_node=8 dust.py --tokens 1M 复现主实验,baselines/backprop.py 是同模型对照。需 Linux、Python 3.10+、支持 bf16 的 NVIDIA GPU。现阶段更适合研究不可微架构、循环/展开计算等 backprop 难训的方向。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。