Together AI 正式在其算力平台提供 GLM-5.3 Flash 原生多模态推理服务。该模型采用 320B 总参、18B 激活与 100 万 Token 混合注意力架构,在 DeepSWE 编程基准上对齐前沿模型,且同等预算下完成工作量翻倍以上。
核心要点速览 (Key Takeaways)
- ✓极致性价比架构:320B-A18B MoE 稀疏激活在保持高精度的同时大幅压缩单 Token 成本;
- ✓原生多模态 + 百万上下文:支持在超长代码库、架构图纸与系统日志中进行精准跨模态定位;
- ✓为长周期自主编程 Agent 提供了兼顾推理吞吐与质量的云端托管方案。