Kandinsky Lab 于 10 月 6 日开源 Kandinsky 6.0 Video:Lite 3B 与 Pro 29B 两款文生/图生「音视频」基础模型,一次生成 5 秒带 44kHz 同步音频(含口型)的视频,内置超分到 1080p。双流 CrossDiT 架构,代码、权重与 Diffusers 集成全部 MIT 协议;论文称在 VABench 多数指标超过开源 LTX 2.5,语音质量可与 Veo 3.1 Fast 等闭源模型掰手腕。
核心要点速览
- ✓规模:Lite 3B / Pro 29B;Pro 拆分为视频流 19B + 音频流 5B + 跨模态注意力 5B(技术报告)
- ✓输出:5 秒片段 + 44kHz 同步音频(含口型),支持 T2AV 与 I2AV,内置 SR 超分至 1920×1080
- ✓评测:VABench 多数指标超过开源 LTX 2.5;人评对 Veo 3.1 Fast 互有胜负(伪影、运镜显著占优,语音/同步落后),对 MiniMax H3、Seedance 2.0 视觉明显落后
- ✓效率:两阶段蒸馏至 10 次函数评估,蒸馏版与完整版人评偏好 51% vs 49%;H100 上 Pro 1080p 约 402 秒/条,RTX 4090 约 1247 秒(非蒸馏版,README)
- ✓部署:块卸载后 Pro 峰值显存 72.8 → 21.7 GiB(SD),提供 16GB 预设;已接入 Diffusers、ComfyUI 与 vLLM-Omni,MIT 可商用

开发者 3 秒速决决策指标
把技术选型换算成你的开发预算
40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
「有声视频」一直是闭源模型的护城河:Veo 3.1、Sora 2 能一次生成画面、对白与音效,开源侧多是先出无声视频再配乐,口型和节奏常对不上。Kandinsky 6.0 Video 把音画联合生成整套开源,代码、权重与 Diffusers 集成全部采用 MIT 协议。
架构亮点与底层机制
核心是双流 CrossDiT:沿用 Kandinsky 5.0 的视频流,新训音频流,两者在每个块内用双向交叉注意力做时序与语义对齐(视频 3D RoPE、音频 1D RoPE)。Pro 版 29B = 视频 19B + 音频 5B + 跨模态 5B。训练先在大规模音频语料上单训音频流,再用音视频配对数据联合训练,之后 SFT、RL 后训练,并两阶段蒸馏到 10 步。
权威 Benchmark 与实测跑分对比
据技术报告:VABench 多数指标超过开源 LTX 2.5;人评明显胜过 Kandinsky 5.0 Pro;对 Veo 3.1 Fast 互有胜负(伪影、运镜显著占优,语音与同步落后);对 MiniMax H3、Seedance 2.0 视觉明显落后,但语音质量有竞争力。以上均为官方自评,暂无第三方复现。
开发者实战落地与开箱指南
需 NVIDIA GPU + Python 3.13/3.14:git clone 后执行 just setup、just download pro-distill、just generate "a cat on a mat"。块卸载让 Pro 峰值显存从 72.8 降到 21.7 GiB,另有 16GB 预设;H100 上 Pro 1080p 约 402 秒/条。不想本地部署可先玩 HF 在线 Demo,或用 ComfyUI 节点、Diffusers 权重集合。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察