Reka Labs 于 10 月 5 日发布 Rho-1 研究预览:19B 参数、从零训练,在单一网络、单一 KV Cache 里统一文本、图像、视频与机器人动作 token,不依赖工具调用或第二个模型。每个 Transformer 块拆成「理解流」与「生成流」两路专家权重并共享注意力,联合优化 next-token 与 flow matching。官方称基础版视频生成约 0.79× 实时(中位),蒸馏版把去噪从 99 步压到 8 步,5.3 秒视频约 1 秒返回;全部结果来自 320 张 H100 训练三个月的检查点。目前仅为研究预览,无公开权重,需邮件合作。

核心要点速览

  • ✓规模:19B 参数,从零训练;算力仅 320 张 H100 × 3 个月(官方博客)
  • ✓速度:基础版视频生成中位 0.79× 实时,约 6 秒出可看流;蒸馏版去噪 99 步 → 8 步,5.3 秒片段约 1 秒返回,改提示词重渲约 1.1 秒
  • ✓架构:每块双专家流(理解 / 生成)+ 共享注意力与同一 KV Cache;目标函数 = next-token + flow matching
  • ✓局限:原生视频分辨率上限 672×384;长程漂移、跨视频时序定位、编辑稳定性官方自认未成熟
  • ✓可用性:仅研究预览,无开源权重/公开 API,合作需邮件 [email protected]
Reka 发布 Rho-1 研究预览:19B 从零训练的「全能推理」模型,一个网络同时理解与生成文本/图像/视频并输出机器人动作
🖼️要闻配图
点击全屏高清查看
🧭

把技术选型换算成你的开发预算

29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

今天主流的多模态系统本质是「Agent 流水线」:一个中心 LLM 负责规划,再把画图、做视频、控机械臂分别交给专用模型。每次交接都增加延迟,下游专家也只看到一句窄指令而非完整上下文。Reka Labs 在 Rho-1 官方博客 中提出把这条栈「压扁」:19B 参数、从零训练的单一网络,在同一上下文里统一理解与生成文本、图像、视频,并直接输出机器人动作。

架构亮点与底层机制

Rho-1 采用对称设计:离散 token 承载文本与指令,连续 token 承载图像/视频潜变量、动作与本体感知。每个 Transformer 块内拆成「理解流」与「生成流」两套专家权重,二者共享注意力并读写同一个 KV Cache;理解流发出切换 token 后,生成流用扩散头从完整状态直接渲染。训练同时优化 next-token 与 flow matching。机器人侧可配合 Reka 的逆动力学模型,从无标注网络视频反推动作标签做预训练。

权威 Benchmark 与实测跑分对比

官方未给出 MMLU、VBench 等标准榜单分数,仅公布内部速度数据:基础版视频生成中位 0.79× 实时、约 6 秒出可看流;蒸馏版把去噪从 99 步压到 8 步,5.3 秒视频约 1 秒返回。机器人部分只展示了 LIBERO 仿真演示,没有成功率表格。官方坦承原生分辨率仅 672×384,长程漂移与编辑稳定性仍弱。

开发者实战落地与开箱指南

Rho-1 目前只是研究预览,没有开源权重和公开 API,合作需邮件联系 [email protected];Reka 现有产品可通过 Reka 文档 与 Reka Cloud 使用。它的意义在于方向:做机器人、仿真环境或交互式视频应用的团队,可以参考「单模型 + 共享 KV 状态」替代多模型编排,并关注其数据管线与实时视频生成系列文章。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。