工具聚合平台 Composio 发布针对 GLM 5.3、GLM 5.3 Flash、Kimi K3 与 DeepSeek V4 的 30 个多步 Agent 任务实测对比。结果显示 GLM 5.3 完成率最高,而 DeepSeek V4 Flash 与 GLM 5.3 Flash 以约 1/4 的成本完成了近乎相同的任务量。

核心要点速览 (Key Takeaways)

  • Flash 档模型迅速崛起:在多步工具调用中几乎追平完整版大模型,但单次成功成本仅数美分;
  • 跨应用协作仍是通用短板:所有受测模型在面对多软件跨平台数据流转时均暴露出工具调用瓶颈;
  • 为企业 Agent 选型提供了客观的成本与成功率权衡参考。