Reka Labs 于 10 月 5 日发布 Rho-1 研究预览:19B 参数、从零训练,在单一网络、单一 KV Cache 里统一文本、图像、视频与机器人动作 token,不依赖工具调用或第二个模型。每个 Transformer 块拆成「理解流」与「生成流」两路专家权重并共享注意力,联合优化 next-token 与 flow matching。官方称基础版视频生成约 0.79× 实时(中位),蒸馏版把去噪从 99 步压到 8 步,5.3 秒视频约 1 秒返回;全部结果来自 320 张 H100 训练三个月的检查点。目前仅为研究预览,无公开权重,需邮件合作。
核心要点速览
- ✓规模:19B 参数,从零训练;算力仅 320 张 H100 × 3 个月(官方博客)
- ✓速度:基础版视频生成中位 0.79× 实时,约 6 秒出可看流;蒸馏版去噪 99 步 → 8 步,5.3 秒片段约 1 秒返回,改提示词重渲约 1.1 秒
- ✓架构:每块双专家流(理解 / 生成)+ 共享注意力与同一 KV Cache;目标函数 = next-token + flow matching
- ✓局限:原生视频分辨率上限 672×384;长程漂移、跨视频时序定位、编辑稳定性官方自认未成熟
- ✓可用性:仅研究预览,无开源权重/公开 API,合作需邮件 [email protected]

开发者 3 秒速决决策指标
把技术选型换算成你的开发预算
29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
今天主流的多模态系统本质是「Agent 流水线」:一个中心 LLM 负责规划,再把画图、做视频、控机械臂分别交给专用模型。每次交接都增加延迟,下游专家也只看到一句窄指令而非完整上下文。Reka Labs 在 Rho-1 官方博客 中提出把这条栈「压扁」:19B 参数、从零训练的单一网络,在同一上下文里统一理解与生成文本、图像、视频,并直接输出机器人动作。
架构亮点与底层机制
Rho-1 采用对称设计:离散 token 承载文本与指令,连续 token 承载图像/视频潜变量、动作与本体感知。每个 Transformer 块内拆成「理解流」与「生成流」两套专家权重,二者共享注意力并读写同一个 KV Cache;理解流发出切换 token 后,生成流用扩散头从完整状态直接渲染。训练同时优化 next-token 与 flow matching。机器人侧可配合 Reka 的逆动力学模型,从无标注网络视频反推动作标签做预训练。
权威 Benchmark 与实测跑分对比
官方未给出 MMLU、VBench 等标准榜单分数,仅公布内部速度数据:基础版视频生成中位 0.79× 实时、约 6 秒出可看流;蒸馏版把去噪从 99 步压到 8 步,5.3 秒视频约 1 秒返回。机器人部分只展示了 LIBERO 仿真演示,没有成功率表格。官方坦承原生分辨率仅 672×384,长程漂移与编辑稳定性仍弱。
开发者实战落地与开箱指南
Rho-1 目前只是研究预览,没有开源权重和公开 API,合作需邮件联系 [email protected];Reka 现有产品可通过 Reka 文档 与 Reka Cloud 使用。它的意义在于方向:做机器人、仿真环境或交互式视频应用的团队,可以参考「单模型 + 共享 KV 状态」替代多模型编排,并关注其数据管线与实时视频生成系列文章。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察