Google DeepMind 将智能体式视频理解接入最新 Gemini 模型:系统不再扫描整段视频,而是结合转录、音频与关键帧动态取证,长视频效率提升最明显。该能力已通过 API 向 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 推出,准确率更高且 Token 最多减少 88%。

核心要点速览 (Key Takeaways)

  • 以转录、音频与帧为线索做动态取证,而非整文件扫描,长视频(10 分钟到数小时)收益最大
  • 准确率提升的同时 Token 最多减少 88%,显著降低多模态智能体的视频理解成本
  • 已在 Google AI Studio API 向 Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite 开放,随后登陆 Gemini 应用
ADSponsored