Google DeepMind 宣布最新 Gemini 模型具备智能体视频理解能力:不再扫描整段视频,而是结合转录、音频与画面推理,并动态调整帧率只抽取关键时刻。长视频效率提升最明显,Token 用量最高可降 88%;该能力正通过 API 向 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 开放。

核心要点速览 (Key Takeaways)

  • 智能体式抽帧替代全量扫描,长视频 Token 消耗最高降低 88%
  • 模型联合推理转录、音频与画面,并按需动态调整帧率
  • 已在 Google AI Studio API 上线 3.7 / 3.6 Flash 与 3.5 Flash-Lite,Gemini App 即将跟进
ADSponsored