深度求索开启 DeepSeek-V4-Flash 开发者限量内测,专为超低延迟代码补全与大规模代码分析设计,在单卡 A100/H800 上吞吐量达到 180 Tokens/秒,API 输入定价低至 0.10 元/1M。
核心要点速览 (Key Takeaways)
- ✓推理速度突破 180 Tokens/秒,比标准模型提速 300%,专为 Tab 实时补全优化
- ✓支持 1M 超长上下文,可一次性检索整个巨型工程仓库而不损失局部细节
- ✓国内开发者现可通过深度求索开放平台申请免费公测 API Key
深度求索开启 DeepSeek-V4-Flash 开发者限量内测,专为超低延迟代码补全与大规模代码分析设计,在单卡 A100/H800 上吞吐量达到 180 Tokens/秒,API 输入定价低至 0.10 元/1M。
企业级大模型领军者 Cohere 正式推出针对复杂软件工程微调的 Command R+ 代码专精版,在检索增强生成 (RAG) 场景下可精准引用跨微服务架构代码定义,首字延迟缩短 50%。
Google DeepMind 推出 Gemini 3.5 Transcribe,面向实时语音交互的高精度语音转写模型。Artificial Analysis 测得流式 WER 4.0%、非流式 2.6%,支持 85+ 语言,并可结合 Antigravity 屏幕上下文准确转写文件名、变量与 Agent 思路。
阿里云通义千问发布多模态 MoE 模型 Qwen3.8-Flash 并开源权重,仅 6B 激活参数即在 DeepSWE 1.1 拿到 58.7、SWE-bench Pro 拿到 62.5,训练成本仅为 Qwen3.7-Plus 的 1/9,同时放出 Qwen3.8-Flash-Next 作为 Qwen4 架构先行预览。