신모델·

제미나이 4 아르고, 지능 1위권인데 "아직 못 씁니다"

한 줄 요약지능 최상위권 도달했으나 비공개·고비용·검증 미흡으로 당장은 그림의 떡
광고

구글이 새로운 추론 모델 '제미나이 4 아르고(하이)'를 인공지능 분석 사이트 아티피셜 어낼리시스(Artificial Analysis)에 올렸다. 인텔리전스 인덱스 53점. 전체 223개 모델 중 8위다. 중간값 26점의 두 배다. 텍스트·이미지 입력을 받고 텍스트를 내보낸다. 컨텍스트 창은 100만 토큰, A4 1500장 분량이다.

가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러. 캐시 할인 95%를 적용하면 인텔리전스 인덱스 태스크 하나당 1.99달러가 든다. 속도 수치는 아직 공개되지 않았다.

성능 지표만 보면 최상위권

인텔리전스 인덱스 v4.3.2는 10개 평가를 합친다. AA-브리프케이스, GDPval-AA, 터미널벤치 4.0, 사이코드, 휴머니티즈 라스트 엑시즘 등이다. 제미나이 4 아르고(하이)는 이 종합 점수에서 상위 4%에 들었다. 추론 모델임이 명시돼 있다.

출력 길이는 1억 1000만 토큰. 중간값 8200만보다 많다. 말이 길다는 뜻이다. 같은 질문에 더 많은 토큰을 쓰면 비용이 올라간다.

솔 6.1과 비교하면 비용 효율성이 뒤진다

해커뉴스 댓글에서 나온 비교가 날카롭다. 솔 6.1(Sol 6.1)은 인텔리전스 지수 52점으로 1점 차이인데, 태스크당 비용이 0.72달러다. 제미나이의 1.99달러보다 3분의 1 수준이다. 아스트라(Astra) 같은 상위 옵션도 오픈에이아이 쪽에 있다.

구글이 벤치마크 점수 올리기에만 집중한다는 '벤치맥싱(benchmaxxing)' 의심도 커뮤니티에 퍼져 있다. 점수는 높은데 실사용에서 그만한 체감이 오느냐는 의문이다.

광고

가장 큰 걸림돌: 아직 공개되지 않았다

아티피셜 어낼리시스 페이지 곳곳에 "Not publicly available"이 뜬다. API 제공자 란도 비어 있다. 구글 클라우드 버텍스 AI(Vertex AI)나 제미나이 웹사이트(gemini.google.com)에서도 아직 쓰지 못한다. 한 유료 구독자는 "월 20달러 내는데 여전히 제미나이 3.1 프로만 나온다"고 캡처와 함께 올렸다.

속도 측정값이 없는 것도 실사용 예측을 막는다. 출력 초당 토큰 수가 '알 수 없음'으로 표기돼 있다. 추론 모델은 보통 느리다. 빠른 응답이 필요한 업무엔 맞지 않을 수 있다.

한국 사용자 입장에서 보면

국내에선 구글 클라우드 리전 서울이 있다. 기업이 버텍스 AI를 쓴다면 나중에 접근성은 나쁘지 않다. 하지만 개인 사용자는 제미나이 웹이나 앱에서 모델이 뜨길 기다려야 한다. 오픈에이아이·앤스로픽처럼 바로 써보는 건 불가능하다.

쉽게 풀어보면

구글이 새 AI 모델 '제미나이 4 아르고(하이)'를 벤치마크 사이트에 등록했습니다. 지능 점수가 전체 모델 중 8위로 매우 높게 나왔습니다. 100만 토큰 컨텍스트(긴 문서 처리 가능), 이미지 이해, 추론 능력까지 갖췄습니다.

문제는 세 가지입니다.

첫째, 아직 아무도 못 씁니다. API도, 웹사이트도, 유료 구독자 화면에도 없습니다. "곧 나온다"는 일정도 없습니다.

둘째, 비쌉니다. 경쟁 모델 솔 6.1은 지능 점수가 1점 낮은데, 작업당 비용이 3분의 1입니다. 구글이 점수 올리기에만 급급해 가성비를 챙기지 않았다는 비판이 나옵니다.

셋째, 속도를 모릅니다. 추론 모델은 대체로 느립니다. 실시간 대화나 코딩 보조처럼 즉각 반응이 필요한 용도면 답답할 수 있습니다.

뷔페에 비유하면, 음식 종류(성능)는 최고급인데 식당 문이 닫혀 있고, 가격표만 붙어 있는 상태입니다. 게다가 옆집(솔 6.1)은 문이 열려 있고 반값입니다.

나에게 미치는 영향

  • 챗GPT 플러스·클로드 프로 구독자: 지금 쓰는 걸 유지하세요. 제미나이 4 아르고가 공개돼도 당분간은 웹·앱에서 바로 못 씁니다. 구글 원 AI 프리미엄(월 2만 원대) 구독 중이라면, 모델 업데이트 알림만 기다리면 됩니다.
  • 기업 개발자(버텍스 AI 사용): 구글 클라우드 콘솔에서 '모델 가든' 새 탭을 주 1회 확인하세요. 서울 리전 배포 시점이 진짜 시작입니다. 그 전까진 솔 6.1이나 클로드 3.5 소넷 API로 대체 개발을 진행하세요.
  • 무료 사용자: 제미나이 웹(gemini.google.com)에서 모델 선택 드롭다운에 '4 아르고'가 뜨면 그때 테스트하세요. 현재는 3.1 프로가 최신입니다. 뜨기 전까진 아무 액션도 필요 없습니다.
  • 비용 민감한 팀: 태스크당 1.99달러(약 2700원)는 소규모 실험엔 부담입니다. 솔 6.1(태스크당 0.72달러)이나 오픈소스 모델(람다 3.1 405B 등)로 선행 검증한 뒤, 최종 단계만 제미나이로 돌리는 하이브리드 전략을 짜두세요.

남은 건 구글이 '언제, 어디서, 얼마에' 문을 여느냐다. 벤치마크 1위권 모델이 서랍 속에 있는 동안, 현장에서는 이미 다른 도구가 일을 하고 있다.

이 기사의 출처

이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.

광고