구글 제미나이 4 아르고 발표… 100만 토큰 출력으로 코딩·보안 겨냥
구글이 내놓은 새 카드, 제미나이 4 아르고
구글 딥마인드가 9월 30일(현지 시각) 제미나이 4 세대 첫 모델 **아르고(Argon)**를 발표했다. 가장 큰 차별점은 단일 응답 출력 길이다. 기존 제미나이 모델이 64K 토큰이던 것을 100만 토큰으로 늘렸다. 클로드 오퍼스 5.5, 클로드 페이블 5.1, GPT-6 아스트라 모두 128K 토큰 상한인 점을 감안하면 8배 차이.
대상은 세 가지다. 장시간 소프트웨어 엔지니어링, 법률·금융 같은 기업 지식 업무, 사이버 보안 방어. 구글은 "복잡한 워크플로 전반을 위해 만들었다"고 설명했다. 단, 즉시 누구나 쓸 수 있는 건 아니다. 미국 정부의 자발적 사전 검증 절차에 참여 중이며, 초기 테스터 피드백을 받아 가드레일을 다듬은 뒤 확대한다는 방침이다.
100만 토큰이 바꾸는 것 — 경쟁 모델과 비교해보니
| 모델 | 최대 출력 토큰 | 비고 |
|---|---|---|
| 제미나이 4 아르고 | 1,000,000 | 도입기 가격 적용 |
| GPT-6 아스트라 | 128,000 | 단문 컨텍스트 티어 기준 |
| 클로드 오퍼스 5.5 | 128,000 | |
| 클로드 페이블 5.1 | 128,000 |
숫자만 보면 압도적이다. 하지만 출력 길이만 늘린다고 장문 작업이 저절로 되는 건 아니다. 구글 스스로 "깊게 사고하며 수십만 토큰을 한 궤적에서 생성한다"고 표현했는데, 이건 모델이 중간에 끊기지 않고 추론을 이어간다는 뜻이다. 개발자 입장에선 대규모 리팩토링이나 긴 리포트를 여러 턴으로 쪼개지 않고 한 번에 받을 수 있다.
벤치마크는 구글 발표 기준으로 18개 중 12개에서 1위, 1개에서 공동 1위다. 인공지능 분석 업체 아티피셜 애널리시스(Artificial Analysis)는 지능 지수에서 GPT-6 아스트라와 동급이면서 작업당 비용은 60% 수준이라고 평가했다. 단, 이 계산엔 캐시 입력 95% 할인 가격이 반영됐다. 실제 워크로드에서 캐시 히트율이 얼마나 나올지는 미지수다.
레딧 r/singularity 유출 글에선 **자율 법률 업무 벤치마크에서 아르고 19.6% 대 GPT-6 아스트라 5.4%**라는 수치도 돌고 있다. 본지가 8일 전 다룬 GPT-6 아스트라, 20년 풀리지 않던 에니그마 암호 해독 당시 아스트라의 자율 추론 능력을 높게 본 것과 대비된다. 당시엔 "이틀 만에 20년 미해독 암호 해독"이 화제였는데, 법률 같은 영역에선 아르고가 앞선다는 신호다.
가격과 가용성 — 도입기에는 싸지만 조건이 있다
- 도입기(현재): 입력 $2/1M, 출력 $10/1M, 캐시 입력 $0.10/1M(95% 할인)
- 도입기 종료 후: 입력 $4/1M, 출력 $20/1M
로건 킬패트릭(구글 AI 스튜디오 총괄)이 도입기 가격을 확인해 줬다. 전체 100만 토큰을 다 쓰면 도입기에도 $10, 종료 후엔 $20이 든다. 경쟁 모델 출력 상한이 128K임을 감안하면, 아르고로 100만 토큰을 한 번 뽑는 비용이 타 모델로 8번 나눠 뽑는 비용과 비슷해질 수 있다.
문제는 캐시 할인 전제다. 같은 문맥을 반복 입력할 때만 95% 할인이 적용된다. 신규 코드베이스 분석이나 최초 문서 검토처럼 캐시가 안 맞는 작업에선 정상 요금이 붙는다. 한국 기업이 도입 검토할 때 이 부분이 실제 청구서에 어떻게 찍힐지 미리 계산해 봐야 한다.
사이버 보안 특화 — 실제 현장에서 이미 쓰였다
아르고는 사이버 방어에 특화 훈련됐다. 자율적으로 취약점을 찾고, 검증하고, 패치까지 한다. 구글은 "신뢰하는 방어자와 내부 팀엔 사이버 가드레일 없이 제공한다"고 밝혔다.
CWE-벤치 v1(취약점 수정 벤치마크)에서 68%로 공동 1위를 기록했다. 경쟁 모델들은 자체 에이전트 하네스 안에서 돌린 결과다. 아르고만 '맨몸'으로 낸 성적인지, 하네스 도움을 받았는지는 자료에 없다.
이미 실전 사례도 있다. 보안 업체 위즈(Wiz)가 '스캔 포 굿(Scan for Good)' 이니셔티브로 아르고를 썼는데, 전 세계 병원이 쓰는 의료 소프트웨어에서 치명적 취약점을 찾아냈다. 구글은 "이전 프론티어 모델들이 놓쳤던 것"이라고 강조했다. 기술 검증 차원을 넘어 실제 피해 예방에 쓰였다는 점에서 의미가 크다.
쉽게 풀어보면
구글이 제미나이 4 아르고를 내놨습니다. 뷔페에 비유하면 접시 크기가 8배 커진 셈입니다. 기존 모델들은 한 번에 128K 토큰(약 9만 단어)까지만 답할 수 있었는데, 아르고는 100만 토큰(약 70만 단어)까지 한 번에 뱉어냅니다.
이게 왜 중요하냐면, 큰 코드베이스 전체를 한 번에 읽고 리팩토링 제안을 받거나, 수백 페이지 법률 문서를 한 번에 검토해서 요약본을 뽑을 수 있기 때문입니다. 중간에 "계속해줘"라고 말하지 않아도 됩니다.
가격은 도입기엔 100만 토큰 출력이 10달러. 비싸 보이지만, 경쟁 모델로 같은 양을 뽑으려면 8번 나눠서 요청해야 하고 그 비용도 만만찮습니다. 단, 전에 쓴 문맥을 재활용하는 '캐시' 기능을 쓸 때만 95% 할인이 붙습니다. 새 프로젝트마다 할인받긴 어렵습니다.
보안 쪽이 더 눈에 띕니다. 아르고가 실제 병원 의료 소프트웨어에서 다른 AI가 못 찾은 치명적 구멍을 찾아냈습니다. 구글 직원 수천 명도 이미 일상 업무에 쓰고 있다고 합니다. 다만 일반 공개는 아직이고, 미국 정부 검증 절차를 밟는 중입니다.
나에게 미치는 영향
개발자·보안 담당자라면
- 구글 AI 스튜디오나 버텍스 AI에서 아르고 접근 권한 신청부터 넣어두세요. 페어윈드(Fairwind) 프로그램 파트너사가 우선순위입니다.
- 대규모 리팩토링이나 코드베이스 마이그레이션 계획 중이면, 아르고 접근권이 생길 때 시범 적용해 볼 만합니다. 100만 토큰 한 방으로 끝낼 수 있는 작업인지 먼저 범위를 따져보세요.
일반 직장인·학생이라면
- 당장은 챗GPT나 제미나이 앱에서 아르고를 못 씁니다. 일반 공개 일정이 안 나왔습니다.
- 제미나이 앱(월 10억 사용자 돌파)에 아르고가 들어올 때까지는 기존 모델로 작업 쪼개서 쓰는 습관을 유지하세요. "한 번에 다 해결"이 습관이 되면 나중에 모델 바꿀 때 적응이 어렵습니다.
기업 의사결정자라면
- 도입기 가격($2/$10)은 매력적입니다. 단, 캐시 할인 전제임을 잊지 마세요. 신규 문서·코드 분석 비중이 높으면 정상 요금($4/$20) 기준으로 예산 잡으세요.
- 보안 팀이 있다면 위즈 사례처럼 취약점 스캔 자동화에 아르고를 쓸 수 있는지 검토해 보세요. 가드레일 없는 버전은 '신뢰하는 방어자'만 받습니다. 자사 보안 팀이 해당되는지 구글 쪽에 확인부터 하세요.
남은 쟁점 — 검증 안 된 벤치마크와 공개 일정
구글 발표 벤치마크는 자체 공개 자료다. 제3자 독립 검증 결과는 아직 없다. 레딧 유출 글도 비공식 소스다. 본지가 12일 전 다룬 오픈AI 'GPT-6 아스트라 포 로' 발표 때도 "검증은 여전히 진행 중"이라고 짚었듯, 아르고 역시 법률·금융 특화 성능은 실사용 전 검증이 필요하다.
가드레일 강화 4개 영역이 뭔지도 미공개다. 사이버 가드레일을 푼 버전을 신뢰하는 방어자에게만 준다는 건, 일반 공개 버전에선 그 기능이 제한될 수 있음을 시사한다. 실제 쓸 수 있는 시점과 기능 범위가 아직 불확실하다는 게 지금 시점의 결론이다.
이 기사의 출처
- GeekNewsGoogle, Gemini 4 Argon 발표
- MarkTechPostGoogle DeepMind Unveils Gemini 4 Argon with 1M Output Tokens for Coding, Knowledge Work and Cyber Defense
- TechCrunch AIGoogle releases Gemini 4 Argon, called its most powerful model yet
- r/singularityGoogle’s unreleased Gemini 4 Argon may have just leaked—and it tops 12 of 18 benchmarks against Fable 5.1, Opus 5.5 and GPT-6 Astra, including 19.6% vs GPT-6 Astra’s 5.4% on autonomous legal work
이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.