Q Labs 发布研究 Dust(登上 Hacker News 首页):一种零阶(只用前向)优化算法,在每个 token 上独立扰动激活值,把一次前向变成数千个「虚拟种群成员」,再用损失变化估计梯度。在 GPT 式 Transformer、FineWeb 预训练上,100k/1M token 预算下 Dust 损失低于调优后的 backprop,10M/20M 下差距随种群扩大而收窄;最大测到 243M 参数。作者明确:算力效率尚远不足以取代 backprop。
核心要点速览
- ✓1M token 预算下,种群约 1k 起 Dust 测试损失低于 backprop;100k 预算下数百个 draw 即反超(论文页)
- ✓20M token:幂律外推极限 4.431(95% 区间 3.89–4.58)vs backprop 4.633,作者称外推约束较松,仅作趋势证据
- ✓效率:相对权重空间 ES 方法 EGGROLL 约 10³–10⁴ 倍;EGGROLL 用 256 倍种群仍不及 Dust 64 draw
- ✓反直觉:10M token 下 243M 参数模型在多数种群规模上优于 120 倍更小的模型,大模型更「种群高效」
- ✓qlabs-eng/dust(MIT):默认种群 16,384,8 卡
torchrun复现 1M/10M 实验,另有单卡小规模配置
把技术选型换算成你的开发预算
29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
从 1986 年至今,训练神经网络几乎只有反向传播一条路:架构、优化器和硬件都围绕「可微 + 一阶梯度」共同演化。零阶方法(只做前向、靠扰动估计梯度)一直被认为无法扩展到大网络,因为估计方差随维度增长。Q Labs 的 Dust 想证明:算力足够时,基于搜索的信用分配可以在最难的任务——Transformer 预训练——上与 backprop 竞争。
架构亮点与底层机制
Dust 不扰动权重,而是在每个线性层输出、每个 token 上独立加高斯噪声,以该 token 的损失变化作为奖励,种群平均后得到输出误差估计,再与层输入做外积得到权重梯度。于是一次前向就评估了「每个 token 一个成员」的虚拟种群,比权重空间 ES 大至少三个数量级。注意力内部(Q/K/V 等)通过注意力输出的估计误差打分,K/V 还接收未来 token 的衰减信用;不同层类型分开前向以减少干扰。
权威 Benchmark 与实测跑分对比
论文自报(8 层、宽 512 的 GPT 式模型,FineWeb,SGD,三种子):100k 与 1M token 下 Dust 低于调优 backprop;20M token 外推极限 4.431 vs backprop 4.633;相对 EGGROLL 效率约 10³–10⁴ 倍;最大 243M 参数。尚无独立复现,且规模远小于生产级预训练。
开发者实战落地与开箱指南
qlabs-eng/dust 提供最小实现:python prepare_data.py 从 Hugging Face 流式准备 FineWeb,torchrun --nproc_per_node=8 dust.py --tokens 1M 复现主实验,baselines/backprop.py 是同模型对照。需 Linux、Python 3.10+、支持 bf16 的 NVIDIA GPU。现阶段更适合研究不可微架构、循环/展开计算等 backprop 难训的方向。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察