Gemini 3.8 Flash と 3.8 Flash Cyber を発表
Google は、これまでのモデルの中で最も優れた推論およびコーディング性能を誇る Gemini 3.8 を発表します。3 週間前に発表した 3.7 と同等のスピードと低コストを維持しながら、Gemini 3.8 では以下の 2 モデルを提供します。
- Gemini 3.8 Flash:ソフトウェア エンジニアリング、エージェント タスク、そして専門領域における重要な多段階推論において、3.7 Flash から進化した最も高性能な主力モデルです。3.7 Flash と同じ初期提供価格¹ である入力 100 万トークンあたり 0.75 ドル、出力 100 万トークンあたり 3.75 ドル でご利用いただけます。
- Gemini 3.8 Flash Cyber:脆弱性検出と自動パッチ適用においてフロンティア モデルクラスの性能を発揮する、最も高機能なサイバーセキュリティ モデルです。新しい Fairwind Program を通じて、パートナーの皆さまに提供されます。
本日公開した両モデル は、異なる運用環境に合わせて最適化されているものの、同一の基盤知能を備えています。さらに、基盤モデルを再帰的に評価・改善するように設計された、長時間実行型のエージェント ループによってその性能がさらに加速されています。この共通コアにおけるコーディングおよび推論能力の大幅な向上は、高い要求が課されるサイバーセキュリティ領域での厳格なトレーニングをはじめとする、数々の過程によって実現しました。
Gemini 3.8 Flash:長期的なコーディングと自律型エージェントのために構築
Gemini 3.8 Flash は、3.7 Flash から大幅な進化を遂げており、より高コストなフロンティア モデルの性能に迫る実力を発揮します。
長期間にわたるソフトウェア エンジニアリング能力を評価するベンチマーク DeepSWE v1.1(Long-Horizon Software Engineering)において、3.8 Flash は、複雑なエンジニアリング課題を自律的かつエンドツーエンドで解決する能力で、より大規模なフロンティア モデルの多くを上回りながら、そのコストはほんのわずかに抑えられています。
さらに、3.8 Flash は、専門知識を要する領域において、企業の重要なオペレーションに求められる高い信頼性を備えています。高度な分析やレポート作成が必要とされる定量的・専門的分野において、3.8 Flash は Vals Finance Agent V2 や Harvey 社の Legal Agent Benchmark などのベンチマークで、3.7 Flash や他のフロンティア モデルを上回るパフォーマンスを発揮します。また、HLE-Verified でも 54.9% を記録し、STEM、人文学、専門分野にまたがる複雑な多段階推論に対応できる能力を実証しています。
こうした性能向上は、「3.8 Flash がより熱心に処理に取り組む」という設計思想に基づいています。複雑なタスクにおいて、このモデルはより高い勤勉性を発揮し、追加の推論ステップを実行しながら、ツールを繰り返し呼び出します。特にエフォート レベル(思考の深さの度合い)を高く設定した場合には、パフォーマンスを最大限に引き出すために、より多くのトークンを消費することがあります。
計算効率が最優先される用途では、エフォート レベルを低く設定してトークンのオーバーヘッドを最小限に抑えることもできますし、効率重視のワークロード向けに引き続きフルサポートされている Gemini 3.7 Flash を活用し続けることも可能です。
Gemini 3.8 Flash Cyber:専門性の高いサイバーセキュリティ性能
Fairwind Program を通じて信頼できるパートナーの皆さまに提供される Gemini 3.8 Flash Cyber は、迅速な反復作業を可能にする Flash ならではのスピードと低コストを備え、今日の複雑なサイバーセキュリティ環境において優位性をもたらします。
自律的な脆弱性の発見
脆弱性発見の業界標準ベンチマークである「CyberGym」において、Gemini 3.8 Flash Cyber は自律的な脆弱性検出でフロンティア モデル級の性能を実証しました。3.5 Flash Cyber だけでなく、大幅に規模の大きいフロンティア モデルをも凌駕しています。
CyberGym のような C/C++ コードベースにとどまらない、現実世界の防御ニーズをより的確に捉えるため、20 種類ものプログラミング言語にまたがる複雑なコードベースから広範な脆弱性を検出する、包括的な社内ベンチマークでも Gemini 3.8 Flash Cyber を評価しました。この評価において、本モデルは従来のモデルから 70% を超える成功率を達成しています。
自動パッチ適用
Gemini 3.8 Flash Cyber の開発にあたり、Google は攻撃者に対して優位に立てる専門的な能力を提供することに注力しました。つまり、最初から脆弱性の修正に投資し、悪用などの攻撃的な機能よりも修正を優先しました。
パッチ適用能力を評価する難関の外部ベンチマークである Collinear 社の CWE-Bench において、Gemini 3.8 Flash Cyber はパレート境界に位置しています。主要なフロンティア モデルの pass@1 が 47.8% であるのに対し、Gemini 3.8 Flash Cyber は 47.2% を記録しながら、大幅に低いコストで提供されています。
実世界での成果:Google のコードの安全性を強化
Google では、社内全体のコードを保護するために、すでに Gemini 3.8 Flash Cyber を活用しています。例えば、以下のような成果が得られています。
- Chrome セキュリティ チームの検証では、3.8 Flash Cyber は、より大規模な最高峰の商用モデルと比べて、Chrome の脆弱性に対して 2.6 倍もの正確なパッチを生成しました。
- Wiz の社内ペネトレーション テスト ベンチマークにおいて、Gemini 3.8 Flash Cyber は、他の主要なフロンティア モデルと比較して 2.3 〜 5.2 倍低いコストでありながら、再現率が +7.5 〜 9.7% 向上したことが確認されました。
- Google Cloud の脆弱性調査チーム(Cloud Vulnerability Research team)は、通常であれば調査と発見に数か月を要するような重大な基盤の脆弱性を、3.8 Flash Cyber を活用して 2 時間足らずで発見しました。
安全性を最優先した設計
3.8 Flash は、Google の Frontier Safety Framework に基づき、有益なユースケースを可能にしながら、化学・生物・放射線・核(CBRN)兵器およびサイバー攻撃への悪用を防ぐセーフガードを備えています。一方、3.8 Flash Cyber は、サイバーセキュリティ用途に対してより柔軟な緩和策を備えているため、より包括的なサイバー機能を必要とする信頼できる皆さまにのみ提供されます。
また、Gemini 3.8 モデルは、Gray Swan による測定においてプロンプト インジェクション耐性が飛躍的に向上しており、プロンプト インジェクションに関連する悪意ある攻撃から Gemini ユーザーをしっかりと保護します。
Gemini 3.8 Flash と Cyber:本日より提供開始
- 開発者の皆さま:Google Antigravity で 3.8 Flash を使った開発やエージェント ファーストのワークフローを体験していただけます。また、本日より Google AI Studio や Android Studio を通じた Gemini API での開発、Stitch での UI 生成も可能です。まずは開発者向けドキュメントをご確認ください。
- 法人のお客様:Gemini Enterprise で 3.8 Flash をご利用いただけます。
- 一般ユーザーの皆さま:Google AI Pro および Ultra の登録ユーザーは、Gemini アプリ、Google 検索の AI モード、および Google スプレッドシートの Gemini で 3.8 Flash をご利用いただけます。
- サイバーセキュリティ:新しい Fairwind Program を通じて、信頼できる政府機関、重要インフラ事業者、およびソフトウェア メンテナーの皆さまに、Gemini 3.8 Flash Cyber への優先アクセスを提供します。詳細はこちらをご確認ください。