Google DeepMind 宣布最新 Gemini 模型具备智能体视频理解能力:不再扫描整段视频,而是结合转录、音频与画面推理,并动态调整帧率只抽取关键时刻。长视频效率提升最明显,Token 用量最高可降 88%;该能力正通过 API 向 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 开放。
核心要点速览 (Key Takeaways)
- ✓智能体式抽帧替代全量扫描,长视频 Token 消耗最高降低 88%
- ✓模型联合推理转录、音频与画面,并按需动态调整帧率
- ✓已在 Google AI Studio API 上线 3.7 / 3.6 Flash 与 3.5 Flash-Lite,Gemini App 即将跟进