Liquid AI 发布两款开源权重多模态决策模型 d1-3B(文本+图像)与实验性 d1-omni-600M(文本+图像/音频)。它们不生成 token,单次前向直接输出概率化答案;d1-3B 在 Decision Index v0.2.1 公开集拿到 48.57,10B 以下第一、比肩 12 倍体量的 Decider 35B-A3B,RTX 4090 单问 8ms、Jetson Orin Nano 50ms,首日支持 llama.cpp,适合 Agent 护栏、重排序与视觉质检。
核心要点速览
- ✓d1-3B 在 Decision Index v0.2.1 公开集得分 48.57,10B 以下第一,与 Decider 35B-A3B 持平;d1-omni-600M 得分 15.95(官方博客)
- ✓7 项文本基准均分:d1-3B 82.9 > Decider 4B 81.1;d1-omni-600M 78.4 > Decider 2B 77.1,Civil Comments 毒性检测 95.8
- ✓单问延迟:RTX 4090 8ms、AMD MI325X 9ms、Jetson AGX Thor 16ms、Apple M5 Pro 30ms、Jetson Orin Nano 50ms
- ✓批量打包吞吐:RTX 4090 每秒 475 个状态,MI325X 每秒 1,106 个;三个问题共享一个状态仅为单问耗时约 1.3 倍
- ✓权重已上 Hugging Face(含 GGUF / w8a8 版本),LFM Open License v1.0,首日支持 llama.cpp 与 NVFP4

开发者 3 秒速决决策指标
把技术选型换算成你的开发预算
40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
Agent 系统里大量环节其实不需要“写作文”:护栏判断要不要放行、重排序挑哪个候选、质检判断零件是否合格、语音指令该路由到哪里。用生成式大模型逐 token 输出答案,既慢又贵,还要再解析文本。Liquid AI 10 月 7 日发布 Open d1,把此前只走 API 的 d1 决策模型家族开源成两款可本地部署的权重:d1-3B 与 d1-omni-600M。
架构亮点与底层机制
d1 不生成 token,而是单次前向直接给出校准后的答案(是/否、选项、打分)。d1-3B 基于解码器结构的 LFM2.5-VL-3B,先把 LFM2.5-2.6B 与其文本骨干做权重平均,再用不同随机种子和数据配比微调后合并;官方称长输入训练、打乱选项顺序、修数据捷径比花哨技巧更有效。d1-omni-600M 基于双向编码器 LFM2.5-Encoder-350M,分阶段接入 FastConformer 音频编码器和来自 LFM2.5-VL-450M 的视觉编码器(LoRA 仅在有图像输入时激活),可处理文本+图像或文本+音频。
权威 Benchmark 与实测跑分对比
- Decision Index v0.2.1 公开集:d1-3B 48.57,10B 以下第一,与 12 倍体量的 Decider 35B-A3B 持平;d1-omni-600M 15.95。
- 7 项文本基准均分:d1-3B 82.9(Decider 4B 为 81.1);d1-omni-600M 78.4(Decider 2B 为 77.1),Civil Comments 95.8、PAWS-X 79.5 为全表最高。
- 延迟(单请求):RTX 4090 8ms、MI325X 9ms、Jetson AGX Thor 16ms、AGX Orin 26ms、Orin Nano 50ms;4090 打包吞吐 475 状态/秒。
- 视觉私有集未公布分数,音频决策基准官方坦言尚属空白。
开发者实战落地与开箱指南
权重已上架 d1-3B、d1-omni-600M 与 d1-3B-GGUF,许可证为 LFM Open License v1.0,首日支持 llama.cpp(覆盖 Apple、AMD、Qualcomm、NVIDIA,含 NVFP4)。本地部署参考 决策模型文档,不想装环境可先在 d1 Playground 试 10 个摄像头实时 demo。适合场景:Agent 工具调用前的安全护栏、RAG 重排序、工业视觉质检、端侧语音指令路由。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察