제미나이 4 아르곤(Argon): 프론티어 인텔리전스의 새로운 시대

2026년 9월 30일

|

제미나이 4 아르곤(Gemini 4 Argon)은 실제 소프트웨어 엔지니어링 환경은 물론, 법률·금융과 같은 엔터프라이즈 지식 기반 업무, 그리고 사이버 보안 방어에 이르기까지 복잡한 워크플로우 전반에서 프론티어급 성능을 제공합니다.


코라이 카바쿨루(Koray Kavukcuoglu)

구글 딥마인드 CTO 겸 구글 수석 AI아키텍트


제미나이 4 아르곤(Gemini 4 Argon)은 실제 소프트웨어 엔지니어링 환경은 물론, 법률·금융과 같은 엔터프라이즈 지식 기반 업무, 그리고 사이버 보안 방어에 이르기까지 복잡한 워크플로우 전반에서 프론티어급 성능을 제공합니다.

오늘 구글은 새로운 프론티어 모델인 ‘제미나이 4 아르곤(Gemini 4 Argon)’을 공개합니다. 제미나이 4 아르곤은 구글의 페어윈드 프로그램(Fairwind Program)을 통해 신뢰할 수 있는 사이버 보안 전문가들에게 우선 배포됩니다. 복잡하고 장기적인 워크플로우 전반에서 깊이 있는 추론을 지속하도록 설계된 아르곤은, 구글의 일하는 방식과 개발 문화 자체를 혁신하고 있습니다. 또한 실제 현장의 소프트웨어 엔지니어링, 법률 및 금융 등 엔터프라이즈 지식 기반 업무, 그리고 사이버 보안 방어에 이르기까지 복잡한 워크플로우 전반에서 프론티어급 성능을 발휘합니다.

이처럼 고도화된 프론티어 기술을 안전하게 공개하기 위해서는 단계적인 접근 방식이 필요합니다. 구글은 모델 접근 권한을 단계적으로 확대하는 한편, 미국 정부의 자발적 사전 출시 모델 액세스(pre-release model access) 절차에 적극적으로 임하고 있습니다. 또한 개발자, 기업 및 일반 이용자에 아르곤을 조속히 선보일 수 있도록, 초기 테스터들의 피드백을 지속적으로 수렴해 안전장치(guardrails)를 정교화해 나갈 예정입니다.

아르곤은 출시 기념 특가1로 입력 토큰 1백만 개당 2달러, 출력 토큰 1백만 개당 10달러에 제공되며, 캐시된 입력 토큰은 입력 토큰 가격 대비 95% 할인된 금액으로 이용할 수 있습니다.

구글이 일하고 개발하는 방식 혁신

제미나이 4 아르곤은 이미 구글의 내부 워크플로우에 적용되고 있으며, 수천 명의 구글 임직원은 전문 코딩 작업, 심층 연구 조사, 높은 수준의 글쓰기 역량을 제미나이 4 아르곤의 강점으로 꼽고 있습니다. 아르곤은 각 팀의 개발 속도를 높이고 엔지니어링 생산성의 한계를 넓히며, 기술적 혁신을 가속화하는 데 기여하고 있습니다.

  • 양자 알고리즘 최적화: 아르곤은 구글의 양자 컴퓨팅 연구원들이 주요 애플리케이션의 병목 현상을 유발하는 서브루틴의 시공간 리소스(큐비트 × 게이트)를 최적화하는 데 기여하고 있습니다. 일례로, 아르곤은 기존 발표된 베이스라인 성능을 불과 몇 분 만에 40% 이상 뛰어넘는 성과를 거두었습니다.
  • 메모리 효율성 향: 아르곤 에이전트 팀은 전체 서버군(fleet)의 프로파일링 텔레메트리 데이터를 분석해 구글 데이터센터 전반의 메모리 최적화 방안을 자율적으로 도출하고 적용했습니다. 배포 이후 300 TiB 이상의 메모리를 확보할 수 있게 되었으며, 총 절감 규모는 500 TiB에서 최대 1 PiB에 이를 것으로 예상됩니다.
  • 대규모 코드베이스 마이그레이션 및 최적화: 아르곤 에이전트는 ‘re2’, ‘libgav1’과 같은 수만 줄 규모의 핵심 라이브러리부터 80만 줄 이상의 Fuchsia OS Zircon 커널에 이르기까지, 구글 전반의 C/C++ 코드베이스를 러스트(Rust)로 전환하는 작업을 수행하고 있습니다. 해당 시스템들의 높은 중요도를 고려해, 이러한 대규모 코드 재작성 결과물은 실제 운영 환경에 배포되기 전 엄격한 자동 및 수동 감사, 에뮬레이션 테스트, 코드 리뷰 과정을 철저히 거치고 있습니다.

구글의 오픈소스 비디오 디코딩 소프트웨어인 ‘libgav1’의 경우, 아르곤 에이전트는 기존 러스트 이식 버전을 기반으로 프로파일 기반 실험을 반복 수행하고, 컴파일러의 출력 결과를 분석했습니다. 이를 통해 컴파일러가 코드를 자동으로 벡터화할 수 있도록 안전한 러스트 코드를 생성함으로써 3만 2천 줄에 달하는 SIMD 코드를 대체했습니다. 그 결과 동일한 비디오 출력 품질을 유지하면서도, 기존 러스트 버전 대비 2.7배 빠르게 작동하며 최적화된 C++ 수준에 근접한 메모리 안전(memory-safe) 비디오 디코더를 완성했습니다.

가장 복잡한 문제도 끈기 있게 해결하는 역량

구글은 더 길고 복잡한 활용 사례에서도 제미나이 4 아르곤의 역량을 충분히 뒷받침할 수 있도록, 모델의 출력 토큰 한도를 기존 6만 4천개에서 업계 최고 수준인 1백만 개로 대폭 확장했습니다. 제미나이 4 아르곤은 단일 실행 경로 내에서 깊이 있게 사고하고 수십만 개의 토큰을 생성할 수 있는 여유 공간을 확보하게 되면서, 까다로운 과제도 한 번에 해결할 수 있는 한 차원 더 깊은 추론 성능을 제공합니다.

제미나이 4 아르곤의 성능을 보여주는 벤치마크 차트

다양한 영역을 아우르는 코딩 및 엔터프라이즈 워크플로우 지원

제미나이 4 아르곤은 코딩, 추론, 멀티모달 전반을 아우르는 역량과 장기적인 다단계 작업을 지속 수행하는 능력을 바탕으로, 다양한 엔터프라이즈 워크플로우에서 탁월한 성능을 발휘합니다.

구글 엔지니어들은 일상적인 디버깅부터 대규모 코드베이스 마이그레이션, 알고리즘 설계에 이르기까지 매일 다양한 실무에 아르곤을 활용하고 있습니다. 아르곤은 실제 현장에서의 장기 소프트웨어 엔지니어링 작업 수행 능력을 평가하는 DeepSWE v1.1에서 77.9%를 기록하며 최고 수준(SOTA)을 달성했습니다.

아르곤은 코딩을 넘어 금융, 코딩, 법률, 세무 분야의 경제적 파급 효과를 미국 GDP 기여도에 따라 가중 평가하는 Vals Index에서도 선두에 올랐습니다. 다단계 금융 리서치를 평가하는 Vals Finance Agent v2와 법률 리서치 및 문서 초안 작성을 평가하는 Harvey’s Legal Agent Benchmark 등 도메인 특화 평가에서도 마찬가지로, 업계를 선도하는 성능을 보였습니다. 또한 핵심 기업 업무 전반의 엔드투엔드(end-to-end) 실행 능력을 측정하는 Zapier의 AutomationBench에서도 51.3%의 점수를 기록하며 1위에 올랐습니다.

아르곤은 시각적 이해가 요구되는 지식 기반 업무에서도 독보적인 강점을 발휘합니다. 전문적인 차트 분석을 수행하고, 긴 영상에서 세부 정보를 파악하며, 일련의 문서를 바탕으로 후속 조치를 수행할 수 있습니다. 예를 들어, 장편 영상 이해도를 측정하는 LVBench에서 아르곤은 91.7%의 점수로 최고 수준(SOTA)의 성능을 기록했습니다.

방어적 사이버 보안을 선도하는 역량

구글은 새로운 양상의 사이버 공격 시대에 맞서 보안 담당자들이 더 철저히 대비할 수 있도록, 제미나이 4 아르곤을 사이버 보안에 특화된 높은 방어 역량을 갖춘 모델로 학습시켰습니다. 아르곤은 치명적인 소프트웨어 취약점을 자율적으로 탐지하고, 검증하며, 패치할 수 있습니다. 프론티어급 사이버 보안 방어 역량을 온전히 활용할 수 있도록, 신뢰할 수 있는 보안 전문가 방어자들과 구글 내부 팀에는 사이버 가드레일이 적용되지 않은 버전의 아르곤이 제공될 예정입니다.

위즈(Wiz)는 고위험 보안 노출 요소를 찾아 해결함으로써 주요 공공 인프라를 무상으로 보호하는 프로그램인 ‘스캔 포 굿(Scan for Good)’ 이니셔티브를 통해 이미 사이버 보안 방어에 아르곤을 활용하고 있습니다. 초기 실증 사례에서 아르곤은 기존 프론티어 모델들이 놓쳤던 심각한 보안 위험을 식별해 냈으며, 전 세계 병원에서 사용하는 헬스케어 소프트웨어 전반에 걸쳐 민감한 개인정보 노출을 야기할 수 있는 치명적인 취약점을 찾아냈습니다.

보안 취약점 해결 능력을 평가하는 CWE-bench v1에서, 아르곤은 CWE-bench v0에서 프론티어급 성능을 입증한 3.8 플래시 사이버(3.8 Flash Cyber)의 성과를 바탕으로 68%라는 최고 점수로 공동 1위를 기록했습니다.

CWE 벤치마크 차트

또한 제미나이 4 아르곤은 취약점 탐지(vulnerability discovery) 영역에서도 3.8 플래시 사이버 대비 괄목할 만한 성장을 보여줍니다. 주요 사례는 다음과 같습니다:

  • 구글의 내부 종합 취약점 벤치마크 평가에서 아르곤은 20개 프로그래밍 언어로 작성된 복잡한 코드베이스 전반에서 광범위한 보안 취약점을 찾아냈습니다.
  • 소스 코드 없이 실제 운영 중인 라이브 웹 시스템을 분석하는 능력을 평가하는 위즈(Wiz)의 자체 블랙박스 모의 침투 테스트 벤치마크에서, 아르곤은 공격 표면 탐지, 취약점 식별, 그리고 이를 검증하기 위한 개념 증명(PoC, proof-of-concept) 근거 생성에 이르기까지 모든 영역에서 3.8 플래시 사이버를 상회하는 성능을 기록했습니다.
보안 취약점 차트

정식 출시 전 프론티어 안전장치 강화

제미나이 4 아르곤을 본격적으로 출시하기에 앞서, 구글은 다음 네 가지 핵심 영역에 걸쳐 중대한 프론티어 안전장치를 지속적으로 강화하고 있습니다:

오용 및 악용 방지: 악의적인 행위자가 아르곤을 사이버 공격이나 화학·생물학·방사능·핵(CBRN) 공격에 악용하는 것을 방지하기 위해, 구글의 프론티어 안전 프레임워크(Frontier Safety Framework)에 따라 정당한 이중 용도의 과학 연구는 지원하는 한편, 유해한 요청은 거부하도록 모델을 설계했습니다. 이번 출시에 맞춰 모델의 내부 활성화(internal activations) 상태를 모니터링해 오용 징후를 포착하는 기술을 고도화하는 등 안전장치의 견고함을 한층 강화하고 있습니다. 이러한 안전장치는 수동 및 자동 공격 기법을 종합적으로 활용한 내부 및 외부 레드팀(red team)의 엄격한 내구성 테스트를 거쳤습니다.

프롬프트 인젝션 공격 방어: 아르곤은 악의적인 지시나 컨텍스트를 이용해 모델의 동작을 탈취하려는 간접 프롬프트 인젝션(indirect prompt injection) 공격에 대해서도 역대 구글 모델 중 가장 강력한 방어력을 갖추고 있습니다. 이러한 공격은 복잡한 방식으로 이루어지기 때문에 상시적인 경계와 다층적인 방어 체계가 필수적입니다. 자동화된 레드팀 테스트와 적대적 학습(adversarial training)을 거친 제미나이 4 아르곤은 그레이 스완(Gray Swan)의 간접 프롬프트 인젝션(IPI) 벤치마크에서 프롬프트 인젝션 방어 견고성 부문 선두를 기록하고 있습니다.

그레이 스완 평가

정렬 불일치(misalignment) 모니터링: 아르곤이 이용자의 의도를 벗어나 허용 범위를 넘어서는 방식으로 과업을 수행하려는 시도를 방지하기 위해, 아르곤의 추론 과정과 행동을 모니터링하고 필요시 실행을 중단하는 정렬 불일치 완화 조치(misalignment mitigations)를 적용하고 있습니다.

구글은 모델 학습 과정에서도 유사한 시스템을 활용해 학습 실행을 모니터링하고 전담 사고 대응팀에 알림을 전송하게 했습니다. 또한, 아르곤이 모니터링을 회피하는 방향으로 추론 방식을 학습할 위험을 방지하기 위해, 탐지 결과를 다시 학습에 반영하지 않도록 세심한 주의를 기울였습니다. 구글은 모델의 성능이 비약적으로 발전하고 정렬 리스크를 신중히 다루어야 하는 이 중대한 시점에, 모델의 사고 과정이 정렬 불일치 위험을 감지하고 진단하는 데 계속해서 유의미하게 활용되도록 업계 전반이 추론 투명성(reasoning transparency)을 지켜나갈 것 것을 강력히 권고합니다.

시스템 보안 강화: 프론티어 모델의 역량이 고도화됨에 따라, 이를 안전하게 테스트하기 위해서는 모델의 발전 속도에 맞춘 안전한 보안 환경이 필수적입니다. 구글은 에이전트 제어 로드맵(agent control roadmap)에 따라 고위험 모델 학습 및 평가를 시작하기 전에 샌드박스 환경을 완전히 격리·봉쇄(isolating and sealing)하여 보안성을 대폭 강화하고 있습니다. 또한 생태계 전반의 보안 수준을 강화할 수 있도록 이러한 에이전트 보안 모범 사례를 파트너들과 적극 공유해 나갈 것입니다.

곧 만나보실 수 있습니다

제미나이 4 아르곤은 코딩, 지식 기반 업무, 사이버 보안 방어, 창의적 글쓰기 전반에 걸친 프론티어급 역량을 바탕으로, 개발자, 전문가, 그리고 엔터프라이즈들이 가장 까다로운 난제를 해결해 나가는 과정에서 든든한 파트너가 될 수 있도록 설계되었습니다. 유료 API 이용자 및 구글 AI 울트라(Google AI Ultra) 구독자를 시작으로, 개발자, 엔터프라이즈, 일반 이용자에게 순차적으로 모델을 공개하기에 앞서, 실제 환경에서의 평가와 피드백을 통해 시스템을 한층 더 강화할 수 있도록 도움을 주고 계신 초기 사이버 보안 방어자 및 신뢰할 수 있는 테스터 여러분께 깊은 감사를 전합니다.