Andrej Karpathy 撰文指出简单 LLM 测试已过时。他给 Opus 5 输入《魔戒》开篇段落、赋予 100 万 Token 预算并要求用 Three.js 渲染;模型自主持续运行约两小时,生成了 5500 行高复杂度的过程式 3D 渲染代码,证明前沿模型已具备构建超定制复杂世界的惊人耐力。
核心要点速览 (Key Takeaways)
- ✓前沿编程模型已具备极强耐力,能在数小时内自主探索并产出数千行复杂 3D 交互代码。
- ✓传统玩具级 Coding Benchmark(如画简单图形)已无法衡量新一代 Agent 极限。
- ✓指出当前瓶颈在于视觉与交互审计,智能体未来需具备原生多模态视频与动态体验审核能力。