클로드 오퍼스 5.5, 지능 1위지만 요금 2배·장황함 3배 '삼중고'
앤스로픽이 클로드 오퍼스 5.5를 내놨다. 제3자 평가 기관 인공분석(Artificial Analysis) 인텔리전스 인덱스에서 58점을 받아 212개 모델 중 1위에 올랐다. 중간값 25점의 두 배를 넘는다.
가격표를 펴면 이야기가 달라진다. 입력 토큰(모델이 읽는 텍스트 단위) 100만 개당 4달러, 출력 토큰(모델이 뱉는 텍스트 단위) 20달러. 동급 모델 중간값(입력 2달러, 출력 10달러)의 두 배다.
성능 1위, 요금도 1위급
인공분석 페이지는 이 모델을 "비슷한 가격 모델과 비교하면 다소 비싸다"고 표현했다. 1위 성능에 1위급 요금이 붙은 셈이다. 캐시 할인(반복 입력 재사용 시 95% 할인)을 적용해도 인텔리전스 인덱스 태스크 하나당 5.98달러가 든다. 전체 평가 비용만 8,708달러였다.
맥락 창은 100만 토큰. A4 1500장 분량이다. 추론 모델이라 '생각하는 과정'을 보여준다. 그런데 그 생각이 너무 길다.
말이 너무 길다 — 중간값 3배 출력
인텔리전스 인덱스 평가에서 이 모델은 2억 6천만 토큰을 뱉었다. 중간값 8천8백만의 약 3배다. '버보시티(장황함)' 순위 95위. 성능은 1위인데 말수는 하위권이다.
해커뉴스 댓글 하나가 현장을 보여준다.
8분 동안 50줄 넘게 '생각'만 하더라. "태양, 구름, 갈매기, 바다 배경 배치 중", "꼬리 깃 위치 잡고 핸들바 기하학 계산 중" 같은 화면만 뜨다가 포기했다.
작업 자체는 반 토막 시간에 끝난다는 반론도 있다. 하지만 "몇 주 지나면 느려질 것"이란 경험담이 따라붙는다. 앤스로픽 서비스 특성상 초반만 빠르다는 지적이다.
파블 5.1과 같다는데, 기업은 외면했다
본지가 28일 전 다룬 앤스로픽 최상위 모델 '파블', 기업 외면…Ramp 데이터가 보여준 '가격·통합'의 벽에서 파블(Fable)은 성능보다 가격과 통합에서 밀렸다. 이번 오퍼스 5.5는 파블 5.1급 성능을 40% 싼 운영비로 낸다고 앤스로픽이 홍보한다. 하지만 API 요금표는 여전히 중간값 두 배다. 기업 구매 담당자가 볼 땐 '할인율'이 아닌 '청구서 금액'이 중요하다.
쉽게 풀어보면
앤스로픽이 새로 내놓은 클로드 오퍼스 5.5는 현재 공개된 AI 모델 중 가장 똑똑하다는 평가를 받았다. 인공분석이라는 제3자 평가 기관이 10가지 테스트를 종합해 매긴 점수에서 212개 모델 중 1등이다.
문제는 대화 비용이다. 이 모델과 API로 대화하려면 입력 토큰(질문 텍스트) 100만 개당 4달러, 출력 토큰(답변 텍스트) 100만 개당 20달러를 내야 한다. 비슷한 급 모델 평균(입력 2달러, 출력 10달러)의 두 배다. 캐시 할인을 받아도 질문 하나 처리하는 데 몇 달러씩 나간다.
더 골치 아픈 건 답변이 너무 길다는 점. 평가에서 이 모델은 평균의 3배에 가까운 2억 6천만 토큰을 쏟아냈다. 사용자 입장에선 "짧게 답해줘" 해도 스스로 생각하는 과정을 길게 풀어놓느라 시간과 돈이 더 든다. 해커뉴스 한 사용자는 "단순 작업인데 8분 동안 '구름 배치 중' 같은 소리만 하다가 껐다"고 썼다.
기업용 최상위 모델 '파블'과 성능이 비슷하면서 40% 싸다고 광고하지만, 실제 API 청구서를 받아볼 기업 입장에선 여전히 비싼 축에 속한다. 성능 1등이 곧 '쓰기 좋은 모델'은 아니다.
나에게 미치는 영향
챗GPT 플러스나 클로드 프로 구독자라면 — 지금 쓰는 채팅창에서 바로 체감하긴 어렵다. API 요금제가 아니라 월 구독제라서다. 다만 답변이 전보다 길어질 수 있다. "핵심만 말해줘" 프롬프트를 습관처럼 붙여두자.
개발자나 스타트업이 API를 쓴다면 — 토큰 요금 계산기를 꼭 돌려보라. 같은 작업이라도 오퍼스 5.5는 출력 토큰이 3배 가까이 나온다. 월 100만 토큰 쓰던 작업이 300만 토큰으로 뛴다.
먼저 테스트해볼 대안
- 소넷 3.5
- 하이쿠 3.5
지능 차이가 체감되지 않으면 요금 차이만 남는다.
한국어 문서 작업이 주 목적이라면 — 100만 토큰 맥락 창은 매력적이다. 긴 계약서나 보고서 통째로 넣고 요약시킬 수 있다. 하지만 출력 장황함이 한국어에서도 똑같이 나타나는지는 아직 검증 안 됐다. 소량 테스트 후 결정하라.
남은 건 검증
인공분석 데이터는 '맥스 노력(Max Effort)' 모드 기준이다. 해커뉴스에 인공분석 팀원이 "모든 추론 노력 수준과 트레이드오프 곡선도 공개했다"고 댓글을 달아, 기본·저비용 모드 데이터도 이미 확인 가능하다.
앤스로픽은 '덜 클로드스러운 문체'를 약속했다. 이전 모델 특유의 과한 정중함, 반복적 사과, 우회적 표현이 줄었단 뜻이다. 이건 벤치마크로 안 나온다. 실제로 써봐야 안다.
파블이 기업에서 밀린 건 성능 부족이 아니었다. 가격·통합이었다. 오퍼스 5.5가 그 벽을 넘었는지는 청구서가 나와야 안다.
이 기사의 출처
- Hacker NewsClaude Opus 5.5 Intelligence, Performance and Price Analysis (Max)
- Anthropic 뉴스Anthropic Launches Claude Opus 5.5 With Fable-Level Performance at a Lower Price - MacRumors
- Anthropic 뉴스Anthropic Releases Claude Opus 5.5: Fable 5.1-Level Performance at 40% Lower Running Cost Than Opus 5 - MarkTechPost
- Anthropic 뉴스Anthropic Releases Claude Opus 5.5 With Lower Pricing and New Safeguards - Unite.AI
- Anthropic 뉴스Claude Opus 5.5 delivers Fable 5.1 performance – and costs 40% less - ZDNET
- Anthropic 뉴스Claude Opus 5.5 beats Fable 5.1 at a much lower cost - Techzine Global
- Anthropic 뉴스Claude Opus 5.5 matches Fable 5.1 performance at lower cost and promises less "Claudish" writing - the-decoder.com
이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.