Together AI 宣布在其无服务器推理平台全面上线 GLM-5.3 Flash。作为首款 320B-A18B 原生多模态 MoE 模型,具备 100 万超长上下文与混合注意力,在 DeepSWE 编程基准中性能直逼 Luna,同等成本下产出翻倍。

核心要点速览 (Key Takeaways)

  • 320B 总参、18B 激活的原生多模态模型正式进入托管 API 矩阵,支持秒级自动扩缩容;
  • 原生视觉与混合注意力融合,兼顾大图表与海量代码库解析,大幅降低智能体开发调用开销;
  • 在 DeepSWE 软件工程基准评测中展现极高性价比,同等 Token 预算下完成的真实编程任务超两倍。