通用智能体虽具备长程规划与工具调用能力,但在实际工程落地中,其生产力能力依然深度割裂在文本、图像、音频、视频、文档、3D 资产与代码这 7 大异构模态之间。直接微调端到端全模态底座成本极其高昂且极易出现灾难性遗忘,而简单外挂多个专用模型又缺乏跨模态依赖编排、中间产物复用与跨轮次协同能力。新加坡国立大学(NUS)NExT++ 实验室研究团队提出即插即用的全模态智能体底座增强运行时 Omni-IO Skills。该框架构建了层级化技能库、标准化多模态执行接口、依赖感知编排引擎与持久化资产注册表(Asset Registry)。工作流被建模为声明式执行图(Declare Execution Graphs),不仅原生支持无依赖动作并发调度,更能将多步生成的中间产物自动缓存供下游复用。在全新全模态基准 UniM-90 上,该运行时将 GPT-5.6 Sol 与 Claude Sonnet 5 的输入模态支持率从约 40% 直拉至 100%,语义质量综合得分实现近 3 倍爆发式跃升。

核心要点速览 (Key Takeaways)

  • ✓7 大模态即插即用统一运行时:无需重新训练或微调底座大模型,通过 Harness 级能力编排,无缝打通文本、图像、音频、视频、文档、3D 资产与代码 7 大模态。
  • ✓声明式执行图与持久资产注册表:以 Declare Execution Graphs 支持无依赖多模态任务并发调度,并通过 Persistent Asset Registry 实现中间多模态生成物跨轮次确定性复用。
  • ✓顶级商业模型全模态输入支持率直冲 100%:在严苛的 UniM-90 全模态基准上,将 GPT-5.6 Sol 与 Claude Sonnet 5 的输入支持率从不足 40% 彻底拉升至 100%,综合语义质量分暴增近 3 倍。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点 尽管现代前沿智能体在长思维链推导与通用工具调用上取得了惊人进步,但在真实数字化生产管线中,核心业务产物天然跨越多种不同模态——一份设计提案既包含文字说明、三维模型原形(3D Mesh)、矢量示意图、音频旁白,又包含动态展示视频与可执行代码。 面对全模态(Omni-Modal)协同需求,现有方案存在两极分化的致命缺陷: 1. 端到端原生全模态模型成本极高且难迭代:训练一个能直接原生理解并输出音频、视频、3D 点云与代码的单体全模态大模型,不仅需要极其庞大的算力,而且任意一个垂直模态的微小改动都会引发整个大模型的灾难性遗忘与重新预训练; 2. 松散拼装的工具链缺乏统一资产协同机制:通过简单的 Function Calling 拼接各领域专用模型时,缺乏结构化的依赖拓扑管理,导致中间产物丢失、无法跨轮次迭代修改,且各个工具接口格式千差万别。 ### 架构亮点与底层机制 新加坡国立大学(NUS)NExT++ 实验室联合团队提出了即插即用的外置增强运行时 Omni-IO Skills: 1. 7 大模态标准化执行抽象:构建覆盖文本、图像、音频、视频、文档、3D 资产与代码 7 大类工件的统一标准 I/O 协议,封装了 27 项层级化技能(Hierarchical Skills),涵盖理解、生成、推理与检索四大能力维度; 2. 声明式执行图(Declare Execution Graphs):Agent 在规划复杂多模态任务时,将工作流输出为声明式有向无环图(DAG),编排引擎自动识别互相独立的子操作进行高效并发调度,极大降低端到端渲染时延; 3. 持久化资产注册表(Asset Registry):每一个被生成的中间产物(如音频片段、3D 粗模)均被赋予唯一 URI 并登入注册表,后续步骤与多轮对话可随时按图索骥进行无损增量修改与跨后端替换。 ### 权威 Benchmark 与实测跑分对比 研究团队在涵盖 38 项代表性任务的新基准 UniM-90 上,对搭载 Omni-IO Skills 的前沿基座进行了系统评测: - 输入支持率直接拉满至 100%:在 UniM-90 全模态输入基准上,原始的 GPT-5.6 Sol 与 Claude Sonnet 5 输入支持率分别仅有 40.00% 和 38.89%,接入该运行时后,两款模型均实现 100% 完整全模态输入支持; - 语义与质量耦合评分暴涨近 3 倍:在评估多模态生成质量与语义对齐度的核心指标(Semantic-Quality Coupled Score)上,GPT-5.6 Sol 从 26.99 跃升至 74.94,Claude Sonnet 5 从 27.82 飙升至 77.78; - 严格结构化遵循率近乎满分:严格格式遵循分(Strict Structure Score)分别达到 100.00 与 99.78,证明通过声明式执行图能够彻底根治多模态生成中的格式崩溃。 ### 开发者实战落地与开箱指南 - 技术论文收录:arXiv:2609.31847 提供了完整的 27 项技能定义表与声明式图执行规范; - 全模态智能体工程化指引:在构建支持跨媒体(如游戏资产自动生成、全媒体自动化运营)的复杂智能体时,切忌等待单一全能多模态大模型的诞生。应采用 Omni-IO 的“声明式执行图 + 持久资产注册表”解耦模式,底座大模型专注逻辑编排,底层挂载稳定优化的专用垂直模型; - 生产无缝适配:该框架支持在无需改动任何 LLM 权重的前提下以插件化形式嵌入生产环境。