AI at Meta 公布 Muse Spark 1.2 的多模态能力:可把视觉输入转成可运行代码,也能把感知转成物理动作。演示包括根据图像或视频生成网页与游戏,并用渲染与行为结果做自我改进;以及作为机器人“大脑”拆解指令、调用工具、观察结果直到完成,例如双臂整理桌面。该模型还用于内部媒体生成与下游信号抽取。

核心要点速览 (Key Takeaways)

  • Muse Spark 1.2 能把图像/视频的布局与风格翻译成可运行网页和游戏代码,并按真实渲染结果迭代。
  • 专用变体可编排机器人工具循环,完成非结构化环境中的多步操作。
  • 内部已用于媒体生成与跨文本、图像、视频的信号抽取。
ADSponsored