Google 与 DeepMind 为最新 Gemini 模型引入智能体视频理解:模型不再默认按每秒一帧静态扫描,而是结合字幕、音频与画面动态调帧,只抓取关键片段。该能力已通过 Gemini API 向 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 开放。
核心要点速览 (Key Takeaways)
- ✓相对默认每秒一帧的静态处理,智能体方式可动态调帧并联合推理音视频与转写
- ✓长视频(10 分钟教程到数小时录像)节省最为明显,Token 最多减少 88%
- ✓已在 Google AI Studio / Gemini API 上线,随后将进入 Gemini App 与 YouTube「Ask YouTube」