Gemini 4 Argon: nossa próxima era de inteligência de fronteira
Hoje, estamos anunciando nosso novo modelo de vanguarda, Gemini 4 Argon, que está sendo implementado para um grupo seleto de profissionais de segurança cibernética por meio do nosso Programa Fairwind . Desenvolvido para suportar raciocínio profundo em fluxos de trabalho complexos e de longo prazo, o Argon está mudando fundamentalmente a forma como trabalhamos e desenvolvemos no Google. Ele oferece desempenho de ponta em fluxos de trabalho complexos em engenharia de software do mundo real, trabalho intelectual corporativo, como jurídico e financeiro, e defesa de segurança cibernética.
Liberar com segurança recursos de ponta neste nível exige uma abordagem gradual. Estamos participando ativamente do processo voluntário do governo dos EUA para acesso ao modelo de pré-lançamento, enquanto expandimos o acesso progressivamente. Continuaremos coletando feedback dos primeiros testadores à medida que aprimoramos as diretrizes de segurança antes de disponibilizar o Argon para desenvolvedores, empresas e consumidores o mais breve possível.
Argon será lançado a um preço promocional de lançamento. 1 de US$ 2 por milhão em tokens de entrada e US$ 10 por milhão em tokens de saída, com tokens de entrada em cache precificados com 95% de desconto sobre o preço do token de entrada.
Mudando a forma como trabalhamos e construímos no Google
O Gemini 4 Argon já está impulsionando nossos fluxos de trabalho internos, com milhares de funcionários do Google destacando os pontos fortes do modelo em tarefas de codificação especializadas, realização de pesquisas mais aprofundadas e qualidade de escrita. Ele está ajudando as equipes a desenvolver mais rapidamente, a expandir os limites da produtividade em engenharia e a acelerar descobertas inovadoras.
- Otimização algorítmica quântica: o Argon está ajudando nossos pesquisadores de computação quântica a otimizar os recursos de espaço-tempo (qubits × portas) de sub-rotinas que limitam aplicações importantes. Em um exemplo, ele superou a linha de base publicada em 40% em questão de minutos.
- Eficiência de memória: Uma equipe de agentes da Argon analisou a telemetria de perfil de toda a frota para identificar e aplicar otimizações de memória de forma autônoma nos data centers do Google, liberando mais de 300 TiB de memória após a implementação, com uma economia total estimada entre 500 TiB e 1 PiB.
- Migrações e otimizações de código em larga escala: os agentes da Argon estão trabalhando na migração de bases de código C/C++ para Rust em todo o Google — desde dezenas de milhares de linhas em bibliotecas principais como re2 e libgav1 até mais de 800 mil linhas para o kernel Zircon do sistema operacional Fuchsia. Dada a criticidade de muitos desses sistemas, essas reescritas em larga escala passam por auditorias automatizadas e manuais rigorosas, testes de emulação e revisões antes de serem implementadas em produção.
Para a libgav1, o software de código aberto do Google para decodificação de vídeo, os agentes do Argon pegaram uma implementação existente em Rust e substituíram 32 mil linhas de código SIMD executando várias rodadas de experimentos guiados por perfil, estudando a saída do compilador e produzindo Rust seguro para que o compilador o vetorizasse automaticamente. O resultado final é um decodificador de vídeo com uso seguro de memória que roda 2,7 vezes mais rápido que a implementação em Rust, com saída de vídeo idêntica, aproximando-o do C++ otimizado.
Dedicando-se com mais afinco aos seus problemas mais complexos.
Para dar suporte às capacidades do Gemini 4 Argon em casos de uso mais longos e complexos, estamos expandindo significativamente o limite de tokens de saída do modelo para 1 milhão de tokens, um número líder no setor, em comparação com os 64 mil tokens anteriores. Quando o modelo tem a capacidade de pensar profundamente e gerar centenas de milhares de tokens em uma única trajetória, ele adiciona um novo nível de profundidade ao raciocínio para resolver problemas complexos de uma só vez.
Habilitando a codificação e os fluxos de trabalho empresariais em diversos domínios.
As capacidades do Gemini 4 Argon em codificação, raciocínio e multimodalidade, bem como sua habilidade para lidar com tarefas longas e complexas, permitem que ele se destaque em uma ampla gama de fluxos de trabalho empresariais.
Os engenheiros do Google têm usado o Argon em suas tarefas diárias, desde a depuração rotineira até migrações de código em larga escala e projetos de algoritmos. Ele estabelece um novo padrão de excelência no DeepSWE v1.1 (77,9%), que mede o desempenho de um modelo em tarefas reais de engenharia de software de longo prazo.
Além da programação, o Argon é o modelo líder no Índice Vals , que mede o impacto econômico em finanças, programação, direito e tributação, com cada setor ponderado por sua contribuição ao PIB dos EUA. Observamos um desempenho igualmente líder em outras avaliações específicas de domínio, como o Vals Finance Agent v2 (pesquisa financeira em várias etapas) e o Harvey's Legal Agent Benchmark (pesquisa e redação jurídica). No AutomationBench, benchmark da Zapier que mede a execução de ponta a ponta em funções essenciais de negócios, o Argon ocupa o 1º lugar com uma pontuação de 51,3%.
O Argon também se destaca quando o trabalho intelectual exige compreensão visual. Ele é capaz de realizar análises gráficas profissionais, identificar detalhes em vídeos longos e tomar decisões com base em uma série de documentos. Por exemplo, no LVBench, que mede a compreensão de vídeos longos, o Argon alcança o estado da arte com uma pontuação de 91,7%.
Líderes em cibersegurança defensiva
Para melhor equipar os defensores cibernéticos para a nova era de ataques cibernéticos, treinamos o Gemini 4 Argon para ser altamente capaz em defesa de segurança cibernética. O Argon pode encontrar, validar e corrigir vulnerabilidades críticas de software de forma autônoma. Para defensores confiáveis e nossas próprias equipes internas do Google, lançaremos o Argon sem restrições cibernéticas para que possam aproveitar ao máximo seus recursos de defesa de segurança cibernética de ponta.
A Wiz já utiliza o Argon para defesa cibernética por meio de sua iniciativa Scan for Good – um programa dedicado a proteger gratuitamente infraestruturas públicas críticas, encontrando e corrigindo vulnerabilidades de alto risco. Em uma demonstração inicial de seu impacto, o modelo descobriu uma vulnerabilidade crítica que expunha informações pessoais sensíveis em softwares de saúde utilizados por hospitais em todo o mundo, identificando um risco grave que modelos de ponta anteriores haviam ignorado.
No CWE-bench v1 , que avalia a capacidade do modelo de remediar vulnerabilidades de segurança, o Argon empata em primeiro lugar com uma pontuação máxima de 68%, superando o excelente desempenho do Flash Cyber (3.8) no CWE-bench v0 .
O Gemini 4 Argon demonstra avanços impressionantes na descoberta de vulnerabilidades em comparação com o Flash Cyber 3.8. Por exemplo:
- No benchmark interno de vulnerabilidades abrangente do Google, o Argon descobriu uma ampla gama de exposições em bases de código complexas, abrangendo 20 linguagens de programação.
- No benchmark interno de teste de penetração de caixa preta da Wiz, que testa a capacidade de um modelo de analisar sistemas web em tempo real sem o código-fonte, o Argon supera o Flash Cyber 3.8 na descoberta da superfície de ataque, na identificação de vulnerabilidades e na produção de evidências de prova de conceito para validá-las.
Reforçar as salvaguardas nas fronteiras antes da sua ampla disponibilidade.
Antes de implementar o Gemini 4 Argon em larga escala, continuamos a reforçar as salvaguardas críticas na fronteira em quatro áreas principais:
Defesa contra o uso indevido: Para impedir que agentes mal-intencionados usem o Argon para ataques cibernéticos ou químicos, biológicos, radiológicos e nucleares (CBRN), o modelo foi projetado para recusar solicitações prejudiciais, preservando a pesquisa científica legítima de dupla utilização, conforme nossa Estrutura de Segurança de Fronteira . Estamos reforçando a robustez de nossas salvaguardas para este lançamento, incluindo o aprimoramento de nossas técnicas para monitorar as ativações internas do modelo e detectar usos indevidos. Essas salvaguardas foram submetidas a testes de robustez por equipes vermelhas internas e externas, utilizando uma combinação de métodos de ataque manuais e automatizados.
Defesa contra ataques de injeção de instruções: O Argon também é o nosso modelo mais resiliente até o momento contra injeções de instruções indiretas, nas quais instruções ou contexto maliciosos são usados para sequestrar o comportamento de um modelo. Esses são ataques complexos que exigem vigilância constante e múltiplas camadas de defesa. Por meio de testes automatizados de intrusão e treinamento adversarial, o Gemini 4 Argon lidera em robustez contra injeções de instruções no benchmark de Injeção de Instruções Indiretas (IPI) da Gray Swan.
Monitoramento de desalinhamento: Para evitar que o Argon ultrapasse os limites ao tentar realizar uma tarefa de uma maneira que vá além das intenções do usuário, estamos implementando medidas de mitigação de desalinhamento que monitoram a linha de raciocínio e as ações do Argon e interrompem a execução quando necessário.
Utilizamos um sistema semelhante para monitorar nossos treinamentos e enviar alertas a uma equipe dedicada de resposta a incidentes, tomando precauções cuidadosas para evitar que as descobertas fossem incorporadas ao treinamento, de modo a não correr o risco de influenciar o raciocínio do Argon a ponto de burlar nosso monitoramento. Recomendamos fortemente que o restante do setor preserve a transparência do raciocínio nesses momentos cruciais de aumento de capacidades, ao mesmo tempo em que lida com os riscos de desalinhamento, para que os princípios do modelo continuem sendo úteis na identificação e no diagnóstico de desalinhamentos.
Reforço da segurança dos sistemas: À medida que os modelos de vanguarda se tornam cada vez mais sofisticados, testá-los com segurança exige ambientes protegidos que acompanhem o ritmo dos próprios sistemas. Em consonância com nosso roteiro de controle de agentes , estamos reforçando a segurança de nossos ambientes de sandbox, isolando-os e selando-os antes do início de treinamentos ou avaliações de alto risco. Temos o compromisso de compartilhar essas práticas recomendadas de segurança de agentes com nossos parceiros para aprimorar a segurança em todo o ecossistema.
Em breve estará disponível.
Criamos o Gemini 4 Argon com recursos de ponta em programação, trabalho intelectual, defesa cibernética e escrita criativa para sermos parceiros de desenvolvedores, profissionais e empresas na resolução dos problemas mais complexos. Somos gratos ao grupo inicial de especialistas em segurança cibernética e testadores de confiança, cujas avaliações e feedbacks práticos nos ajudarão a fortalecer nossos sistemas antes do lançamento para desenvolvedores, empresas e consumidores, começando pelos clientes da API paga e assinantes do Google AI Ultra.