Gemini「エージェント型の動画理解」──毎秒1フレームで丸ごと読む代わりに、必要な区間だけ探して見直す。トークン最大88%減・費用最大66%減・精度最大7%向上(Google DeepMind、3.7 Flash・3.6 Flash・3.5 Flash-Lite)。APIの設定を"agentic"にするだけ、追加料金なし。Geminiアプリと「Ask YouTube」にも順次
Google DeepMindは2026年9月1日、Gemini APIに「agentic video understanding(エージェント型の動画理解)」を導入した。従来は動画を固定のフレームレート(既定1FPS)で丸ごと取り込んでいたが、新方式はモデルが内部ツールで動画の必要な区間だけを読み込み、何を・どの速さで・どの様相(フレーム・音声・字幕)で見るかを自分で決める。標準的な動画ベンチマークで費用最大66%減・トークン最大88%減・精度最大7%向上(3.7 Flashの例)。0.1秒未満の瞬間の特定、数時間の動画からの検索、異常検知、動作や物体の数え上げに向く。Gemini 3.7 Flash・3.6 Flash・3.5 Flash-Liteで、Google AI StudioとGemini Enterprise Agent Platformから、API設定のprocessingを"agentic"にすれば使え、料金は通常のトークン課金のみ。Geminiアプリ全ユーザーと、YouTubeの「Ask YouTube」にも数か月内に。

2026年9月18日・日本時間時点の情報です。 Google DeepMindのブログ(9月1日)を読んだ。当サイトはGemini 3.7 Flashの発売は追ったが、同月に入ったこの動画機能は扱っていなかった。Gemini APIの使い方はGoogle AI StudioとGemini APIの手引きに。
3行まとめ
- 何が変わるか。 これまでの動画理解は「静的」で、動画を固定のフレームレート(既定1FPS、APIで変更可)で丸ごと取り込んでいた。新しいエージェント型の動画理解は、モデルが何を見るか・どの速さで見るか・どの様相(フレーム/音声/字幕)で見るかを自分で決め、内部ツールで動画ファイルの必要な部分だけを読み込む。画像版の「agentic vision」(コード実行と画像理解の組み合わせ)と同じ発想の動画版で、開発者が手で組んでいた「該当区間を切り出して見直す」ループをモデル側が回す。
- 数字。 標準的な動画ベンチマークで、費用最大66%減・トークン最大88%減・精度最大7%向上(グラフは3.7 Flash)。10分の解説動画から90分の講義、数時間の録画まで長いほど差が出る。向く用途として、1FPSでは落ちる1秒未満の状態変化の特定(自動編集)、数時間の動画からの「干し草の山から針」検索、注目区間を高FPSで再サンプルする異常検知、繰り返し動作や物体の数え上げを挙げる。
- 使い方と範囲。 Gemini 3.7 Flash・3.6 Flash・3.5 Flash-Liteで、Google AI StudioとGemini Enterprise Agent PlatformのGemini APIから、動画のアップロードとYouTube動画に使える。API設定のprocessingを"agentic"にするだけで、料金は通常のトークン課金のみ・機能追加料なし。Geminiアプリの全ユーザー(FlashとFlash-Lite)に近く展開し、数か月内にYouTubeの**「Ask YouTube」**の裏側にも入る。
精度が上がる理由と対象外モデル
- 「安くなる」の仕組みが明快で、読むフレームを減らしているだけなので、精度が上がる理由は「注目区間を高FPSで見直せる」側にある。1FPSの取りこぼしが多い速い動作の動画ほど恩恵が大きい、と読める
- 当サイトのAsk YouTubeの記事で見た「視聴ページの質問機能」が、この動画理解に載り替わる予定だと本文にある
- 数字はGoogle自身の測定で、ベンチマーク名として本文に出るのはLongVideoBench。「最大」の値なので平均ではない
- 3.8 Flash(9月2日発売)は対象に書かれていない。時系列上は前日の発表なので、対応状況は別途確認が要る
ブログの記載を照合、動画は未検証
この記事の下調べで、筆者は9月18日にGoogle DeepMindのブログを取得し、対象モデル・数字・設定名(processing: "agentic")・コード例がその原文にあることを確認した。開発者ガイドは開いていない。筆者は自分のAPIで動画を投げて試していない。
3.8対応・内訳・展開日は非公開
- 3.8 Flashでの対応
- ベンチマークの内訳(LongVideoBench以外)と「最大」の条件
- Geminiアプリ側の展開日
出典はGoogle DeepMindのブログ
- Introducing agentic video understanding with Gemini(Google DeepMind・2026年9月1日)
関連記事
出典・参照資料
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。
関連記事
Google、Gemini 3.7 Flashを発表──3.6から3週間・導入価格は半額の0.75ドル、一方で総合指標と知識労働は他社の下
Google AI Studio 使い方──Gemini APIを無料で試す方法【2026年】
