Google DeepMind / Google AI Studio 正式推出两款实时对话音频模型:Gemini 3.8 Live(偏规模、速度与成本)与 Gemini 3.8 Live Extended Thinking(偏高复杂度多步推理)。两款均支持近实时视觉理解、97 种语言自动检测与后台工具调用;开发者可在 AI Studio 与 Gemini API 公开预览中接入,消费侧覆盖 Search Live / Gemini App,企业侧为私有预览。
核心要点速览 (Key Takeaways)
- ✓两款实时音频模型:3.8 Live(规模/速度/成本)与 3.8 Live Extended Thinking(高复杂度多步推理)。
- ✓能力含近实时视觉理解、97 语种自动检测、后台 tool calling,不打断对话流。
- ✓开发者:AI Studio + Gemini API 公开预览;消费端 Search Live/Gemini App;企业端私有预览。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察