AI at Meta detailed Muse Spark 1.2 across multimodal coding and robotics. The model can turn images or video into working web pages and games, scoring itself on actual rendering and behavior in a self-improvement loop. A specialized variant acts as a robot orchestrator: it parses an instruction, issues tool calls, observes results, and loops until the task is done, including bimanual desk-tidying. Meta also uses it internally with Muse Image/Video for agentic media generation and downstream insight extraction.
Key Takeaways
- ✓Muse Spark 1.2 generates working web pages and games from images or video and refines them against live rendering.
- ✓A robotics variant plans tool calls and loops until physical tasks complete.
- ✓Meta already uses it for agentic media generation and multimodal insight extraction.