Gemini 3.8 音声合成モデルを発表
本日、Gemini ファミリーに 2 つの新しいテキスト読み上げ(TTS: Text-to-Speech)モデルが加わりました。音声生成をこれまでの固定的なプリセット音声から、躍動感あるクリエイティブ スタジオ レベルへと進化させます。これらのモデルにより、クリエイター、開発者、企業の皆さまは、より豊かで表現力に富んだ音声体験を創造できるようになります。さらに、Gemini Notebook や Google Vids といったプロダクトにおいても、ユーザー体験の向上を実現します。
- Gemini 3.8 Flash TTS: 深いクリエイティブ演出やキャラクター デザインのために構築されています。自然言語のプロンプトを用いてゼロから完全に新しい音声を生成し、ゲーム、没入感のあるオーディオブック、ポッドキャスト、インタラクティブ メディアなどでキャラクターを創造します。演技の指示や話すペース、方言の切り替え、相づちなどをきめ細かく制御し、一行ごとの演技を自在にディレクションできます。
- Gemini 3.8 Flash-Lite TTS: 大規模かつコスト効率の高い運用のために構築されています。大量の吹き替えや音声コンテンツの制作、表現力豊かな音声エージェントに最適化されており、トーンや話すペース、表現のニュアンスをきめ細かくコントロールできます。
これらのモデルは、急速に進化を続ける Gemini オーディオ ファミリーをさらに強化するもので、3.5 Live Translate、3.5 Transcribe、そして 3.8 Live および 3.8 Live Extended Thinking に続く最新の成果です。
自分だけの音声を自由に作成・カスタマイズ
従来の 30 種類の標準音声から、無限のライブラリへと拡張できるようになりました。完全にオリジナルのキャラクター ボイスから一貫したブランド アンバサダーの音声まで、Gemini 3.8 Flash TTS モデルが本格的な音声スタジオ機能を提供します。あらゆる瞬間に合わせた表現力豊かで自然な音声を作成して活用できるほか、開発者や企業の皆さまが独自のカスタム オーディオ体験を容易に構築できるよう支援します。
- 生成音声デザイン: Gemini 3.8 Flash TTS では、自然言語プロンプトを使って、役柄、アクセント、声の特徴を細かく指定することで、100 以上の言語や方言にわたる独自の音声をゼロから作成できます。ドラマチックに火を吹くドラゴンの声を再現したい場合でも、独特な地域特有のイントネーションを持つ魅力的なナレーターを作りたい場合でも、思いのままに表現できます。
Gemini 3.8 Flash TTSが、メルボルン出身のエネルギッシュなDJの声をどのように生成するのか、ぜひお聞きください。
Gemini 3.8 Flash TTSが、いかにして非常に金属的で単調なロボット音声を生成するかを聞いてみてください。
Gemini 3.8 Flash TTSが日本の竜をどのように生き生きと表現するのか、ぜひお聞きください。
- 充実した音声ライブラリ: メキシコ スペイン語、ケベック フランス語、スコットランド 英語などの地域ごとのバリエーションを含め、幅広い言語をカバーする 2,000 種類以上の実用的な音声にアクセスできます。
- 音声の複製: ご自身の声、または利用許諾を得ている音声のわずか 30 秒のサンプルから、一貫した音声プロファイルを再現できます。組み込みの同意確認機能、SynthID による電子透かし、C2PA クレデンシャルによって保護されており、開発者と声優・ナレーター双方の権利を守ります。
- 保存と拡張: デザインしたカスタム音声を保存・管理することで、進行中のプロジェクト全体で一貫した演技を維持し、音声のブレを最小限に抑えることができます。
- 音声のリミックス: 近日提供予定の機能として、音声ライブラリから声を選択し、音色、ピッチ、話すペース、アクセントを微調整できるようになります。プロンプトを使用して、「米国南部のアクセントをかすかに加える」や「語り口を柔らかくする」といった特徴を細かく指定できます。
一行ごとの演技を自在にディレクション
音声を選択した後は、両方の TTS モデルを用いて、各セリフの表現方法を精密にコントロールできます。
- 一行ごとの演技指導: 独自の演技指示を記述することも、落ち着いたカスタマー サービス担当者から囁くようなサスペンス シーンまで、自然な台本上の指示をもとに Gemini にセリフ回しを委ねることも可能です。
Gemini 3.8 Flash TTSが、対話型音声エージェント向けに、自然で表現力豊かな会話をどのように実現するのか、ぜひお聞きください。
Gemini 3.8 Flash TTSが、きめ細かなスクリプト制御を用いて、深く引き込まれるような没入感のあるオーディオ体験をどのように構築しているか、ぜひご覧ください。
- 長尺音声の生成: 数時間におよぶ連続した音声でも、高い音声品質、自然なペース、キャラクター特有の音色を維持し、話者のブレを最小限に抑えます。ポッドキャストやオーディオブックの制作に最適です。
- ネイティブな 2 者間対話シーンの演出: ポッドキャストでもドラマのストーリーテリングでも、単一の台本から複数ターンの対話をスムーズに演出できます。自然な会話のキャッチボールを再現しながら、2 つの音声を明確に識別して表現します。
- 台本による発話のニュアンス表現と相づち: 笑い声(<laughs>)、ため息(<sigh>)、息をのむ音(<gasp>)といった非言語の手がかりや、「相づち・同意」(|mhm|、|yeah| など)を取り入れることで、リアルな会話の質感を加え、正確なコメディの間やリアクションのリズムを表現できます。
Gemini 3.8 Flash TTSが、自然言語のプロンプトをゼロから独自の音声ペルソナに変換する様子をご覧ください。
Gemini 3.8 Flash TTSが、クリエイターがアニメーションによるセリフに命を吹き込むためのカスタムシーンをどのようにデザインできるかをご覧ください。
Gemini 3.8 Flash TTSが、スクリプトを本格的な対話シーンに変換し、クリエイターが音声の発声や自然な会話のやり取りを指示できるようにする様子をご覧ください。
グローバル規模に対応した、高品質で表現力豊かな音声生成
Gemini 3.8 Flash TTS は卓越した音声カスタマイズ機能を提供し、Hume AI の音声デザイン ベンチマーク(Voice Design Benchmark)で総合 1 位(71.4)を獲得したほか、アクセント モデリングにおいても首位(60.8)を獲得しました。
Gemini 3.8 Flash TTS と Gemini 3.8 Flash-Lite TTS は、信頼性を損なうことなく極めて表現力豊かな演技を可能にし、Hume AI の総合品質インデックス(Overall Quality Index)でもそれぞれ 1 位と 2 位を獲得しています。Gemini 3.1 Flash TTS と比較して、長尺コンテンツや 2 者間の脚本制御など、幅広いユースケースにおいて大幅な進化を遂げています。
ブラインド形式の人間による選好評価を行う Voice Arena において、Gemini 3.8 Flash TTS および Flash-Lite TTS は、日本語、ブラジル ポルトガル語、ベトナム語、現代標準アラビア語(MSA)、メキシコ スペイン語、ヒンディー語を含む主要なグローバル言語において、競合モデルを抑えてトップの座を獲得しました。100 以上の言語をサポートするこれらのモデルは、クリエイター、開発者、企業の皆さまが、世界中に向けた高品質な多言語音声体験を構築することを力強く後押しします。
信頼と透明性に基づいて構築
Google は、声優やナレーターの保護、アイデンティティの尊重、コンテンツの透明性の確保を目的として、厳格なセーフガードを備えた音声作成・複製機能を構築しました。音声の複製にあたっては同意確認システムを採用しており、音声を作成する前に、参照話者と一致する音声所有者本人からの音声による同意録音の提出を義務付けています。
さらに広く、Gemini オーディオ モデルによって生成されたすべての音声クリップには、SynthID による電子透かしが埋め込まれています。この人間の耳には知覚できない電子透かしを音声出力に直接織り込むことで、AI 生成音声であることを検出可能にし、誤情報の拡散防止に貢献します。安全性と責任ある AI への取り組みの詳細については、モデル カードをご確認ください。
Google AI Studio の新しいオーディオ プレイグラウンドをお試しください
本日より、開発者の皆さまは Google AI Studio でこれらの新しい音声生成機能をご体験いただけます。音声デザインのワークスペースとして構築されており、プロンプトを入力してゼロからまったく新しい音声アイデンティティを作成したり、ご自身の音声を複製したりすることができます¹。さらに、それらを 2 者間の台本エディタに直接取り込み、一行ごとのセリフ回しをディレクションすることも可能です。
Google AI Studioで音声再現を試してみましょう。
最新の Gemini 音声モデルをお試しください
Gemini 3.8 Flash TTS は、本日より順次提供を開始します:
- 開発者の皆さま向け: Gemini API および Google AI Studio にて提供
- 企業の皆さま向け: Gemini Enterprise の API 経由で近日提供予定
- すべての皆さま向け: Gemini Notebook にて提供
Gemini 3.8 Flash-Lite TTS は、本日より順次提供を開始します:
- 開発者の皆さま向け: Gemini API および Google AI Studio にて提供
- 企業の皆さま向け: Gemini Enterprise の API 経由で近日提供予定
- すべての皆さま向け: Google Vids にて提供
最新のGemini Audioモデルをぜひお試しください。
Gemini 3.8 Flash TTSは本日より順次展開されます。
- 開発者向け: Gemini APIとGoogle AI Studio
- 企業向け: Gemini EnterpriseのAPI経由で近日公開予定
- すべての人へ:ジェミニノートブックで。
Gemini 3.8 Flash-Lite TTSは本日より順次リリースされます。
- 開発者向け: Gemini APIとGoogle AI Studio
- 企業向け: Gemini EnterpriseのAPI経由で近日公開予定
- すべての人へ: Google動画で