← 전체 글

인공지능

Gemini 3 이후 첫 프런티어 모델은 고객보다 사이버 방어자에게 먼저 갔다. 그 순서가 곧 발표다

Google은 Gemini 4 Argon이 18개 벤치마크 중 13개에서 1위이거나 공동 1위라고 말한다. 검증된 프로그램 밖에 있는 사람은 아무도 확인할 수 없다. 이 모델은 먼저 사이버 방어자와 미국 정부의 사전 검토 절차로 갔고, 토큰 값을 내는 사람들에게는 나중에 오기 때문이다.

MAI
Google 공식 Gemini 4 Argon 키 아트. 회사가 자체 발표 글과 함께 공개한 가로형 타이틀 이미지.

Google은 9월 30일 Gemini 4 Argon을 발표했다. 지난해 11월 Gemini 3 이후 첫 기함 모델이며, 8월 Demis Hassabis가 자리에서 물러난 뒤 Google DeepMind를 맡은 Koray Kavukcuoglu 아래에서 나온 첫 모델이다. Google은 공개한 18개 벤치마크 중 13개에서 Argon이 1위이거나 공동 1위라고 말한다.

그것을 확인할 수 있는 처지에 있는 사람은 거의 없다. Argon은 일반 제공되지 않는다. 먼저 Google의 Fairwind Program을 통해 검증된 사이버 방어자에게 갔고, 미국 정부의 자발적 사전 접근 절차에 들어갔다. 개발자와 기업, 일반 사용자는 "가능한 한 빨리" 받게 되며, 유료 API 고객과 Google AI Ultra 가입자가 먼저다.

그 순서가 발표의 내용이다. 열 달 동안 프런티어를 잃었다는 말을 들어온 회사가 드디어 선두를 되찾는다고 스스로 말하는 모델을 손에 넣었다. 그리고 그 모델을 토큰 값을 내는 사람들보다 먼저 사고 대응 인력과 정부 검토 절차에 넘겼다.

Google이 만들었다고 말하는 것

Argon은 실제 소프트웨어 엔지니어링, 법무와 재무 같은 기업 지식 업무, 그리고 사이버 방어에 걸친 복잡한 워크플로에서 프런티어 성능을 낸다.

기술적으로 눈에 띄는 변화는 출력 한도다. 64,000토큰에서 100만 토큰으로 늘었다. 파일 하나를 초안 잡는 모델과 마이그레이션 전체를 한 번에 내놓을 수 있는 모델의 차이다. Google은 자사 팀이 C와 C++에서 Rust로 옮기는 작업을 포함해 대규모 코드베이스 마이그레이션에 Argon을 썼다고 밝혔다.

공개된 비교는 모두 Google이 측정한 것이다.

벤치마크Gemini 4 ArgonGPT-6 AstraClaude Opus 5.5
Harvey Legal Agent19.6%5.4%3.8%
DeepSWE v1.1(소프트웨어 엔지니어링)77.9%74.1%74.2%
Vals Finance Agent v265.4%53.5%58.6%
FrontierSWE v255.0%65.5%—
Terminal-Bench Science 0.157.6%68.1%—

취약점 수정 벤치마크인 CWE-bench v1에서는 Google이 68%로 공동 1위라고 보고한다. Gray Swan의 간접 프롬프트 인젝션 시험에서는 공격 성공률 0.7%를 보고한다. 신뢰할 수 없는 로그와 티켓을 향하도록 만들어진 모델에게 가장 무거운 숫자가 이것이다.

'방어자 먼저'가 업계의 출시 형태가 되어 가고 있다

이것은 단발의 선택이 아니다. 9월 2일 미국의 프런티어 연구소 세 곳이 같은 주제로 발표했다. Google은 Gemini 3.8 Flash Cyber를 Fairwind를 통해 내놓으면서 CrowdStrike, Datadog, Menlo Security, Palo Alto Networks, Snowflake를 포함한 650곳 넘는 파트너를 언급했다. OpenAI는 자사 Astra가 회사의 "Critical 사이버보안 역량 기준선"에 도달했다고 밝혔다. 알려지지 않은 결함을 스스로 찾아 악용할 수 있다는 뜻이다. 그리고 Daybreak Blue라는 프로그램으로 접근을 나눴다. Anthropic은 Mythos 5.1을 사이버보안과 생명과학 작업을 위한 신뢰 접근 프로그램 안에 두었다.

9월 30일에 달라진 것은 범위다. 제한 접근은 그동안 좁은 용도의 보안 모델을 위한 장치였다. 지금은 그 회사의 가장 좋은 범용 모델을 위한 장치다. Google이 드는 근거는 방어 쪽이다. 보안 회사 Wiz가 Argon으로 전 세계 병원에서 쓰이는 의료 소프트웨어에서 개인정보를 노출하는 중대한 취약점을 찾아냈다는 것이다. 방어자에게 먼저 주는 데 대한 정당한 논거다. 동시에 거꾸로 읽으면, 그 선행이 필요한 이유이기도 하다.

Google이 나열한 네 가지 안전장치 — 악용 거부, 프롬프트 인젝션 견고성, 이탈을 감시하는 사고 연쇄 모니터링, 격리된 실행 환경 — 은 이미 끝난 것이 아니라 넓게 풀기 전에 강화하는 중인 것으로 적혀 있다. 일반 공개를 기다리게 하는 것은 서빙 용량이 아니라 안전 작업이라고, Google은 지금까지 중 가장 분명한 표현으로 말하고 있다.

살 수 없는 모델에 붙은 가격

입력 100만 토큰당출력 100만 토큰당
도입가$2$10
표준가$4$20
캐시된 입력(도입가)$0.10—

VentureBeat는 도입가가 GPT-6 Astra의 약 5분의 1이라고 본다. 공격적인 가격이고, 동시에 대기 줄이 있는 제품에 붙은 가격이다. API가 열리기 전까지 이 숫자는 어느 고객의 실제 작업 부하에도 노출되지 않은 채 Google을 묶어 둔다.

거리를 두고 읽어야 할 부분

위의 모든 수치는 Google 자신의 것이고, Google이 고른 벤치마크에서, 외부의 누구도 재현할 수 없는 시점에 나왔다. "18개 중 13개에서 1위 또는 공동 1위"는 고른 집합 안에서의 셈이다. Google이 공개한 것 중 Astra가 이긴 두 건은 차이가 작지 않다. FrontierSWE v2와 Terminal-Bench Science 0.1에서 10포인트 뒤지는 모델이 이기고 있는 것은 폭이지 압도가 아니다. "가능한 한 빨리"는 날짜가 아니다.

따라갈 만한 것은 다음 벤치마크 표가 아니다. 방어자용 빌드와 공개용 빌드 사이에 벌어지는 간격의 길이다. 몇 주 안에 닫히면 단계적 배포는 출시 절차였던 것이다. 몇 달 이어지면, Google은 프런티어 모델의 첫 사용자가 시스템을 지키는 사람들과 그것을 검토하는 정부이며 시장의 나머지는 그 검토를 통과한 버전을 받는다는 형태를 정착시킨 것이 된다.

Sources: Google: Gemini 4 Argon — our next era of frontier intelligence, VentureBeat: Google unveils Gemini 4 Argon, retaking benchmark lead over OpenAI and Anthropic — but in limited release, Unite.AI: Google Announces Gemini 4 Argon Frontier Model for Coding, Cyber Defense, The Hacker News: Google, Anthropic, and OpenAI Unveil Cyber AI Models, Safeguards, and Access Programs, Fortune: Demis Hassabis steps down from Google DeepMind CEO role amid a major AI leadership shake-up

이어서 읽기