开发者 3 秒速决决策指标
通用智能体虽具备长程规划与工具调用能力,但在实际工程落地中,其生产力能力依然深度割裂在文本、图像、音频、视频、文档、3D 资产与代码这 7 大异构模态之间。直接微调端到端全模态底座成本极其高昂且极易出现灾难性遗忘,而简单外挂多个专用模型又缺乏跨模态依赖编排、中间产物复用与跨轮次协同能力。新加坡国立大学(NUS)NExT++ 实验室研究团队提出即插即用的全模态智能体底座增强运行时 Omni-IO Skills。该框架构建了层级化技能库、标准化多模态执行接口、依赖感知编排引擎与持久化资产注册表(Asset Registry)。工作流被建模为声明式执行图(Declare Execution Graphs),不仅原生支持无依赖动作并发调度,更能将多步生成的中间产物自动缓存供下游复用。在全新全模态基准 UniM-90 上,该运行时将 GPT-5.6 Sol 与 Claude Sonnet 5 的输入模态支持率从约 40% 直拉至 100%,语义质量综合得分实现近 3 倍爆发式跃升。
核心要点速览 (Key Takeaways)
- ✓7 大模态即插即用统一运行时:无需重新训练或微调底座大模型,通过 Harness 级能力编排,无缝打通文本、图像、音频、视频、文档、3D 资产与代码 7 大模态。
- ✓声明式执行图与持久资产注册表:以 Declare Execution Graphs 支持无依赖多模态任务并发调度,并通过 Persistent Asset Registry 实现中间多模态生成物跨轮次确定性复用。
- ✓顶级商业模型全模态输入支持率直冲 100%:在严苛的 UniM-90 全模态基准上,将 GPT-5.6 Sol 与 Claude Sonnet 5 的输入支持率从不足 40% 彻底拉升至 100%,综合语义质量分暴增近 3 倍。
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察