Serverless GPU 算力平台 Modal 宣布上线 GLM-5.3-Flash 自动端点(Auto Endpoints)。开发者无需编写复杂的容器镜像与显存调度配置,即可通过标准 OpenAI 兼容 API 极速调用 320B-A18B 混合注意力大模型。

核心要点速览 (Key Takeaways)

  • 新开源模型 Day-0 / 当周极速上线成为 Serverless GPU 平台的核心竞争力标配;
  • Auto Endpoints 让工程团队完全跳过 Dockerfile 构建与显卡驱动调优,直接获得高弹性 API;
  • 针对多轮 Agent 编程场景提供高并发无状态执行支持,按需计费降低自建集群空转成本。