Gemini Omni を発表

2026年 5月 20日

Gemini Omni Flashは、あらゆるインプットからあらゆるコンテンツを生成できるモデルで、まずは動画から、これまでにないクリエイティブな体験が始まります。


Koray Kavukcuoglu

CTO, Google DeepMind and Chief AI Architect, Google


昨年公開した Nano Banana は、古い写真を復元したり、スケッチからデザインを起こしたり、これまでにない方法でアイデアを視覚化するお手伝いをしてきました。Gemini は、開発の初期段階からネイティブなマルチモーダルとして構築してきましたが、本日、また新たな可能性を広げます。

本日、Gemini の高い推論能力と創造力を組み合わせた新しいモデルファミリー 「 Gemini Omni 」 を発表します。 Gemini Omni は、動画をはじめとして、あらゆる入力から様々なものを創り出すことができる新しいモデルです。画像、音声、動画、テキストを自由に組み合わせて入力し、Gemini が持つ現実世界の知識に基づいたハイクオリティな動画を生成することができます。また、まるで会話をするように簡単に動画を編集することも可能です。

本日より 、 Gemini Omni ファミリーの第一弾として Gemini Omni Flash を Gemini アプリ 、 Google Flow 、そして YouTube Shorts で順次提供を開始します。今後、画像や音声といった出力形式にも対応予定です。

話すだけで簡単に動画編集

Gemini Omni は、自然言語だけで、より直感的に動画を編集できます。すべてのプロンプトが前の文脈を引き継ぐため、登場キャラクターの見た目や特徴は一貫して保たれ、物理法則も崩れず、シーン全体の流れもしっかりと記憶されます。

一から世界を創りだす:特定の部分を変更することも、すべてを作り変えることも可能です。自分で撮影するのが難しかったような映像も、撮影した動画を初めから全く新しい作品に変えることも可能です。

プロンプト:泡のアート作品を作って。

続きを再構築する:Gemini Omni では、 自分で撮影した動画をベースに「そこで何が起きているか」 を自由に変更や追加ができます。キャラクターの動きを編集したり、新しいキャラクターやオブジェクトを追加したり、ある一瞬を思いがけない展開へと変貌させることができます。

やり取りしながらよりより作品に:元のシーンの文脈を失うことなく、背景環境、カメラアングル、スタイル、さらには細かなディテールまで調整が可能です。編集がどのように積み重なっていくかに関しては、下のカルーセルをスクロールして動画をご覧ください。

Gemini の世界知識に基づき、アイデアを形にする

Gemini Omni は、単にリアルに見えるシーンを作るだけでなく、 「次に何が起こるか」 を論理的に推論します。物理法則に対する直感的な理解と、Gemini が持つ歴史、科学、文化的な背景知識を組み合わせることで、単なる写真のような美しさを超えた、意味のある物語りが可能になります。

より正確な物理法則を取り入れたビジュアル生成:Gemini Omni は、重力、運動エネルギー、流体力学といった物理に対する理解が向上しています。これにより、水や物の動きがより自然で、リアリティ溢れるシーンを創り出すことができます。

プロンプト:連鎖反応コースを高速で転がるビー玉。途切れのないスムーズなワンカット撮影。

知識とクリエイティビティ:Gemini Omni は Gemini の知識を活用し、単なるパターンマッチングを超え、言葉、映像、あるいはその意味を結びつけます。

プロンプト:アルファベットのアイテムを紹介する動画。各文字で始まる「珍しいアイテム」がテーブルの上に置かれている様子を映す(例:C ならカピバラ、D ならディスコボール、L ならラバランプなど)。全 26 文字を象徴する 26 個のアイテムが登場し、それぞれの文字を画面下部のテロップで表示。一度に表示するのは、1 つのアイテムと1 つのテロップのみ。各テロップのデザインは、画面左下に配置された紙に、黒のペンで文字が手書きされているような見た目にする。テンポは超高速で、24FPS 換算で 1 アイテムあたり約 9 フレーム。最後のフレームには「THE END」と書かれた紙を表示。動画全体に、穏やかでスムーズな音楽が流れている。

複雑なアイデアの視覚化:短いプロンプトだけで、 Gemini Omni が説得力のある解説動画を作成できます。難解で複雑なアイデアをわかりやすく噛み砕いたビジュアルを生成してくれます。

プロンプト:タンパク質の折りたたみを解説するクレイアニメ。すべてが粘土でできており、制作中の人間の手は映らないこと。ストップモーション撮影、正確な描写。

あらゆる入力を組み合わせて動画を生成する

リファレンスへの対応:Gemini Omni は、画像、テキスト、動画、音声など、どんなフォーマットからでも、それらを組み合わせた 1 つ の動画作品をつくりあげます。音声の参照については、 まずは音声リファレンスから対応し、 今後 、その他の入力にも対応していく予定です。

手元にある素材から始める:入力リファレンス機能を使うことで、お気に入りのキャラクターの画像、背景シーン、あるいは手書きのスケッチなどを活用し、ご自身の思い描くビジョンに完全に一致する作品を創り出すことができます。

スタイル、モーション、エフェクトの適用:入力リファレンスを使って視覚的な表現を定義することも、自然な言葉で説明するだけでも構いません。 Gemini Omni がそれらの要素を組み合わせ、まとまりのある 1 つ のクリップを生成します。

デジタルアバターを使った動画作成

私たちは、責任ある AI の開発に全力で取り組んでおり、ユーザーの皆さまを害から守り、AI ツールの適切な利用を管理するための明確なポリシーを定めています。 まず 、ご自身の声を使って動画を作成できる アバター機能を提供します。これにより、ご自身のデジタルバージョンを作成し、見た目も声も自分そっくりの動画を生成できるようになります。なお、動画内の音声や会話を編集・変更する機能については、ユーザーの皆さまに責任ある形でお届けできるよう、現在も慎重にテストと評価を重ねています。

Gemini Omni で作成されたすべての動画には、電子透かし技術 SynthID が埋め込まれます。動画が Gemini Omni によって生成されたものかどうかは、 Gemini アプリ 、Gemini in Chrome 、あるいは Google 検索 を通じて簡単に確認することができます。ウェブ全体でコンテンツがどのように作成・編集されたかを理解しやすくするための、コンテンツの透明性と検証ツールの拡大に向けた取り組みについては、こちらのブログ記事をご覧ください。

Gemini Omni を今すぐ体験しましょう

Gemini Omni Flash は、 本日より 、 世界中のすべての Google AI Plus 、 Pro 、および Ultra ユーザーの皆さまを対象に、 Gemini アプリ および Google Flow を通じて 順次提供を開始します。また、 今週から は、 YouTube Shorts および YouTube Create アプリ ユーザーの方にも、 無料で順次提供開始されます 。

さらに、 数週間以内には 、API を通じてデベロッパーや企業の皆さま向けにも提供を開始する予定です。

皆さまがこの新しい Gemini Omni を使って、どのような素晴らしい作品や心躍るストーリーを創造されるのか、心から楽しみにしています!

Get the latest news from Google in your inbox

Sign up for our newsletters with product updates, event information, special offers, and more.

Your information will be used in accordance with Google's privacy policy. You may opt out at any time.