Gökdeniz Gülmez 于 10 月 5 日发布 MLX-LM-LoRA v5.8.6(GitHub Release + PyPI 同步上线),这是 3.1.3 之后的大版本。新增 DSLA(可选 DPO/ORPO/CPO 目标)与无 Critic 的 KLPO(token/sequence 两种路线、多种 KL 估计器),改进 GRPO 数值稳定性与 Online DPO/XPO/RLHF/PPO 微批处理,为 gated-delta 层加入快速 VJP。最低依赖升至 mlx>=0.32.3、mlx_lm>=0.32.0、Python>=3.11,许可证统一为 Apache 2.0。
核心要点速览
- ✓版本跨度:从 v3.1.3(9 月 16 日)直接跳到 v5.8.6,合并 PR #64、#94、#96–#102 共 9 个,见 Release 说明。
- ✓两种新训练模式:
--train-mode dsla(--dsla-loss dpo|orpo|cpo,默认--latent-weight 0.1)与--train-mode klpo(--klpo-route token|sequence,--klpo-kl-estimator mc|binary|topk|full)。 - ✓KLPO 不使用 GRPO 组归一化、PPO 比率裁剪,也不需要参考模型,复用 GRPO 奖励回调与生成/打分流水线。
- ✓依赖门槛提高:
mlx>=0.32.3、mlx_lm>=0.32.0、Python>=3.11,旧环境需先升级。 - ✓QAT 扩展到 DSLA;新增 Python API 参考文档,见 官方文档站。
开发者 3 秒速决决策指标
把技术选型换算成你的开发预算
29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
在 Mac 上做本地微调,过去大多停留在 SFT/LoRA;偏好对齐和强化学习(DPO、GRPO、PPO 等)往往要搬到 NVIDIA 集群上跑。MLX-LM-LoRA 是基于 Apple MLX 的训练库,目标是在 Apple Silicon 上直接跑完整的后训练流程。10 月 5 日发布的 v5.8.6 是 9 月 16 日 v3.1.3 之后的首个版本,版本号一次跨过 4.x。
架构亮点与底层机制
- DSLA:在偏好目标之外加入 prompt-response 相似度与 batch 方向的隐空间监督,可选 DPO、ORPO 或 CPO;DSLA-DPO 使用冻结参考模型,ORPO/CPO 版本无需参考模型。
- KLPO:每个 prompt 采样一条完整回答,用终局奖励和采样器条件 KL 记录训练,支持 token 与 sequence 两种回归路线,以及 MC、binary、top-k、full 四种 KL 估计器;实现来自 KLPO 原始仓库。
- 在线训练省显存:Online DPO、XPO、RLHF REINFORCE、PPO 加入微批处理和共享工具,GRPO 打分更稳定。
- 循环模型提速:兼容的 MLX 版本上为 gated-delta 层提供快速 VJP,不可用时回退到检查点实现。
权威 Benchmark 与实测跑分对比
Release 说明和 README 没有公布训练速度、显存或下游任务的对比数字,本文不做推测。可核实的硬指标只有依赖门槛:mlx>=0.32.3、mlx_lm>=0.32.0、Python >=3.11。效果请在自己的模型和数据上实测。
开发者实战落地与开箱指南
升级:pip install -U mlx-lm-lora(PyPI 5.8.6)。DSLA 示例:mlx_lm_lora.train --model <model> --train --train-mode dsla --dsla-loss orpo --data <偏好数据>,数据沿用 prompt/chosen/rejected 格式。KLPO 示例:--train-mode klpo --klpo-route token --klpo-kl-estimator mc,数据为 prompt/answer。QAT 现已支持 DSLA。完整参数和 Python API 见 文档站,改动对比见 v3.1.3...v5.8.6。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察