Gemini 4 Argon:フロンティア知能の新時代
本日、新しいフロンティア モデル Gemini 4 Argon を発表します。 Gemini 4 Argon は、複雑かつ長期的なワークフロー全体にわたって深い推論を持続できるように構築され、Fairwind Program を通じて信頼できるサイバーセキュリティの担当者の皆さまへ順次展開します。Argon は、Google での働き方やものづくりのあり方を根本から変革しています。実世界のソフトウェアエンジニアリング、法務や財務といった企業のナレッジワーク、そしてサイバーセキュリティにおける複雑なワークフローにおいて、最先端のパフォーマンスを発揮します。
このようなフロンティアレベルの機能を安全に公開するには、段階的なアプローチが欠かせません。私たちは、米国政府 によるモデルの事前アクセスに関する自主的なプロセスに積極的に参加しながら、順次アクセスを拡大しています。また、開発者や企業、そして一般消費者の皆さまにできる限り早く Argon をご利用いただけるよう、ガードレールの改良を進めながら、初期テスターの方々からのフィードバックを引き続き収集していきます。
Argon は導入価格として、100 万入力トークンあたり 2 ドル 、100 万出力トークンあたり 10 ドル で提供され、キャッシュ済みの入力トークンについては 入力トークン価格の 95% オフ でご利用いただけます。
Google での働き方と構築方法を変える
Gemini 4 Argon は既に社内ワークフローを支えており、数千人のGoogle 社員が、専門的なコーディング作業、より深い調査、そして質の高い文章作成におけるこのモデルの強みを高く評価しています。これにより、チームはより迅速に開発を進め、エンジニアリングの生産性の限界を押し広げ、画期的な成果を加速させることができます。
- 量子アルゴリズムの最適化: Argon は、当社の量子コンピューティング研究者が、重要なアプリケーションのボトルネックとなっているサブルーチンの時空間リソース(量子ビット × ゲート)を最適化するのに役立っています。ある事例では、わずか数分で公表されている基準値を 40% も上回りました。
- メモリ効率: Argon エージェントのチームが、フリート全体のプロファイリングテレメトリを分析し、Google のデータセンター全体でメモリ最適化を自律的に特定して適用しました。これにより、展開後には 300TiB 以上のメモリが解放され、合計で500TiB から 1PiB の節約が見込まれています。
- 大規模なコードベースの移行と最適化:Argon エージェントは、Google 全体で C/C++ のコードベースを Rust へ移行する作業に取り組んでいます。re2 や libgav1 といったコアライブラリの数万行規模から、Fuchsia Zircon kernel の 80 万行を超える規模まで拡大しています。こうしたシステムの多くが持つ重要性を考慮し、本番環境への展開前に、厳格な自動および手動による監査、エミュレーションテスト、レビューを実施しています。
動画デコード用の Google のオープンソースソフトウェア libgav1 において、Argon エージェントは既存の Rust 移植版を活用し、プロファイルガイド付きの実験を何度も重ねることで 32K 行の SIMD コードを置き換えました。コンパイラの出力を調査し、コンパイラが自動的にベクトル化を行えるような安全な Rust コードを生成しました。その結果、Rust 移植版よりも 2.7 倍 高速に動作し、かつ同等の動画出力を維持するメモリ安全な動画デコーダが完成し、最適化された C++ に迫る性能を実現しました。
最も複雑な問題への挑戦
より長期的で複雑なユースケースにおける Gemini 4 Argon の能力を最大限に引き出すため、モデルの出力トークン上限を従来の 6 万 4 千トークンから業界をリードする 100 万トークンへと大幅に拡大しました。モデルが十分な余裕を持って深く思考し、1 つのプロセスの中で数十万トークンを生成できるようになったことで、困難な問題を一気に解決するためのこれまでにない深い推論力がもたらされます。
あらゆる領域におけるコーディングと業務フロー効率の実現
コーディング、推論、マルチモダリティにおける Gemini 4 Argon の優れた能力と、長時間の複数ステップでのタスクを持続させる特性により、幅広い企業群での業務フローの成果を発揮します。
Google のエンジニアは、日常的なデバッグから大規模なコードベースの移行、アルゴリズム設計に至るまで、日々の業務に Argon を活用してきました。実世界の長期的なソフトウェアエンジニアリングタスクにおけるモデルの性能を測定する DeepSWE v1.1 (77.9%) において、新たな記録も更新しました。
コーディングにとどまらず、Argon は、財務、コーディング、法務、税務ワーク全体にわたる経済的インパクトを測定し、各セクターを米国の GDP への貢献度に応じて重み付けした Vals Index において、トップのモデルとなっています。Vals Finance Agent v2 (多段階の財務リサーチ)や Harvey’s Legal Agent Benchmark (法務リサーチとドラフティング)といった他のドメイン特化型評価においても、同様にリードするパフォーマンスを発揮しています。コアビジネス機能全体のエンドツーエンドの実行を測定する Zapier のベンチマーク AutomationBench では、51.3% のスコアを記録して 1 位 を獲得しました。
また、ナレッジワークに視覚的理解が求められる場面でも、Argon は圧倒的な能力を発揮します。専門的なチャート分析の実行、長尺動画からの細部の特定、一連のドキュメントに基づくアクションの実行が可能です。たとえば、長尺動画の理解力を測定する LVBench では、91.7% のスコアを記録し、最先端の性能を誇っています。
サイバーセキュリティにおける優位性
新時代のサイバー攻撃に向けてサイバーセキュリティの担当者をより強力にサポートするため、Gemini 4 Argon はサイバーセキュリティにおいて極めて高い能力を発揮するようにトレーニングされました。Argon は、重要なソフトウェアの脆弱性を自律的に発見、検証、パッチ適用することができます。一部のサイバーセキュリティ担当者や Google の社内チームに向けては、フロンティアレベルの能力を最大限に活用できるよう、サイバーガードレールを外した状態で Argon を提供します。
Wiz は、高リスクの露出を発見し修復することで重要な公共インフラストラクチャを無料で保護することを目的とした取り組みである Scan for Good を通じて、すでにサイバーセキュリティに Argon を活用しています。その効果を示す初期のデモとして、本モデルは世界中の病院で使用されている医療用ソフトウェア全体において、機密性の高い個人情報を露呈させる重大な脆弱性を発見し、これまでのフロンティアモデルでは見落とされていた深刻なリスクを特定しました。
セキュリティ脆弱性の修復能力を評価する CWE-bench v1 において、Argon は CWE-bench v0 における 3.8 Flash Cyber のフロンティアパフォーマンスをさらに発展させ、最高スコアの 68% で首位タイを獲得しました。
Gemini 4 Argon は、脆弱性発見において 3.8 Flash Cyber から目覚ましい飛躍を遂げていることを示しています。
- Google の社内総合脆弱性ベンチマークにおいて、Argon は 20 種類のプログラミング言語にまたがる複雑なコードベース全体で、幅広い露出を発見しました。
- ソースコードなしでライブのウェブシステムを分析するモデルの能力をテストする Wiz の社内ブラックボックスペネトレーションテストベンチマークにおいて、Argon は攻撃対象領域の発見、脆弱性の特定、およびそれらを検証するための概念実証エビデンスの生成において、3.8 Flash Cyber を上回る性能を示しました。
一般提供に向けたフロンティアセーフガードの強化
Gemini 4 Argon を広く展開する前に、以下の 4 つの主要な領域にわたって、重要なフロンティアセーフガードの強化を継続しています。
- 悪用に対する防御:悪意ある行為者が Argon をサイバー攻撃や化学・生物・放射性物質・核攻撃に利用するのを防ぐため、当社の Frontier Safety Framework に則り、正当な二用途の科学的研究を保護しつつ、有害なリクエストを拒否するように設計されています。今回のローンチに向けて、悪用を検知するためにモデルのインターナル アクティベーションをモニタリングする技術の向上など、セーフガードの堅牢性をさらに強化しています。これらのセーフガードは、手動と自動の攻撃手法を組み合わせた社内・社外のレッドチームによる堅牢性テストを実施しました。
- プロンプトインジェクション攻撃に対する防御:Argon は、悪意ある指示やコンテキストを用いてモデルの挙動を乗っ取る間接的プロンプトインジェクションに対しても、これまでで最も高い耐性を備えたモデルです。これらは、不断の警戒と多層的な防御を必要とする複雑な攻撃です。自動化されたレッドチーミングと敵対的トレーニングを通じて、Gemini 4 Argon は Gray Swan の Indirect Prompt Injection (IPI) ベンチマーク において、プロンプトインジェクションに対する堅牢性でトップに立っています。
- アライメントの不一致のモニタリング:Argon がユーザーの意図を逸脱した方法でタスクを達成しようとして範囲外の動作を行うことを防ぐため、Argon の思考プロセスとアクションをモニタリングし、必要な場合に実行を停止するミスアライメント軽減策を導入しています。トレーニングの実行状況を監視し、専任のインシデント対応チームにアラートを送信するために同様のシステムを使用しました。その際、Argon の推論が当社のモニタリングを回避するように形成されるリスクを冒さないよう、発見事項をトレーニングにフィードバックしないように十分な注意を払いました。アライメントリスクに対処しつつ、能力が向上するこの極めて重要な時期において、モデルの思考がミスアライメントの特定と診断に役立ち続けるよう、業界全体に対しても推論の透明性を維持することを強く推奨します。
- システムのハードニング:最先端モデルの能力が高まるにつれて、それらを安全にテストするためには、システム自体の進化に追従できる強固な環境が求められます。エージェント制御のロードマップに沿って、高リスクなトレーニングや評価が開始される前に、サンドボックス環境を隔離・密閉することでその堅牢性を高めています。エコシステム全体でのセキュリティ向上に向けて、こうしたエージェントのセキュリティに関するベストプラクティスをパートナーの皆様と共有することに尽力しています。
今後の展開について
Gemini 4 Argon は、コーディング、ナレッジワーク、サイバーセキュリティ、クリエイティブライティングにおけるフロンティアレベルの性能を備え、開発者、プロフェッショナル、そして企業が最も困難な課題に取り組む際のパートナーとなるよう構築されました。有料 API をご利用のお客様や Google AI Ultra のユーザーをはじめ、開発者、企業、そして一般の皆さまへ本格的に公開する前に、実際の評価やフィードバックを通じてシステムの強化にご協力いただいているサイバー担当者および初期テスターの皆様に心より感謝申し上げます。