Vivix 推出流式原生多模态视频模型 Vivix-W1:文本、图像、音频、视频都可作为参考,并能在生成过程中持续插入新指令改变画面走向。官方称模型约 30B 激活参数,10 月 31 日前限时价 0.003 美元/输出秒;按厂商自测,8 秒 720p 参考图生视频平均耗时 8.4 秒。API 目前为有限预览,提供标准、fast、ultrafast 三档。

核心要点速览

  • ✓官方口径约 30B 激活参数,原生支持音画同步生成、多镜头叙事与连续流式输出(模型页)
  • ✓限时价 $0.003/秒(至 10 月 31 日),厂商对比表:MiniMax H3 Max $0.080、Kling 3.0 $0.112、Seedance 2.5 $0.231(10 月 8 日核价)
  • ✓厂商自测 8 秒 720p 参考图生视频平均 8.4 秒完成,Kling 3.0 为 145.9 秒、Seedance 2.5 为 272.4 秒(不含排队)
  • ✓API 三档:vivix-w1 1 credit/秒、-fast 3、-ultrafast 4,单条 5–15 秒(文档)
  • ✓尚无 VBench 等第三方画质评测,画质对比仅为厂商展示
Vivix 发布流式实时视频模型 W1:约 30B 激活参数,限时 0.003 美元/秒,API 预览开放
🖼️要闻配图
点击全屏高清查看
🧭

把技术选型换算成你的开发预算

40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

主流视频模型(Kling、Seedance 等)走的是“提交任务—排队—拿到成片”的离线渲染路线,一条几秒的片段动辄几分钟、按秒计费也不便宜,很难用在游戏、互动叙事或直播这类需要即时响应的场景。Vivix 这次发布的 Vivix-W1 把目标定为“可以边生成边交互的视频世界”。

架构亮点与底层机制

官方介绍,W1 是流式原生的多模态模型,在中等训练规模下验证,约 30B 激活参数。文本、图像、音频、视频都能作为参考,而且参考不只在开头输入:生成过程中可以继续插入图片、语音或动作信号,模型把每段新生成的音视频当作后续上下文,让画面从当前状态沿新方向继续,而不是另起一条片段。原生支持音画同步、多镜头叙事和连续流式输出。

权威 Benchmark 与实测跑分对比

目前没有 VBench 等第三方画质评测,以下均为厂商口径(对比页,10 月 8 日核价):限时价 $0.003/秒,对比 MiniMax H3 Max $0.080、Kling 3.0 $0.112、Seedance 2.0 $0.151、Seedance 2.5 $0.231。8 秒 720p、单张参考图的生成测试(10 次平均、不含排队)中,W1 用时 8.4 秒,H3 Max 10.8 秒,Kling 3.0 145.9 秒,Seedance 2.5 272.4 秒。

开发者实战落地与开箱指南

API 文档显示 W1 处于有限预览:先上传参考素材,再 POST 创建异步任务拿 job_id,轮询到终态后读 video_url。model 可选 vivix-w1(1 credit/秒)、vivix-w1-fast(3)、vivix-w1-ultrafast(4),画质相同只差速度;时长 5–15 秒,支持 16:9、9:16 等比例。定价页有 5,700 credits 的试用包,实时 Streaming World API 标注为即将推出,适合先拿来做互动剧情、游戏过场的原型。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。