앤스로픽 클로드 오퍼스 5.5 공개… 성능은 파블급, 가격은 40% 낮춰
오퍼스 5의 혹평, 5.5가 만회할 수 있을까
앤스로픽이 클로드 오퍼스 5.5를 발표했다. 새 모델군 '클로드 5.5 패밀리'의 첫 주자다. 발표문 핵심은 세 가지다. 파블 5.1급 성능, 오퍼스 5 대비 40% 비용 절감, 안전성·문체 개선이다.
그런데 시선은 자연스레 전작 오퍼스 5로 향한다. 해커뉴스 댓글 700여 개 중 상당수가 오퍼스 5를 "2026년 최악의 릴리스"라고 불렀다. 월 20달러 구독자가 여름 내내 2등급 모델(4.8)을 써야 했다는 불만도 터져 나왔다. 본지가 28일 전 다룬 앤스로픽 최상위 모델 '파블', 기업 외면…Ramp 데이터가 보여준 '가격·통합'의 벽 기사에서도 파블이 성능보다 가격·통합 장벽에 막혔다는 점이 확인됐다.
오퍼스 5.5는 그 빈틈을 노린다. 파블급을 더 싸게, 더 안전하게, 더 쓰기 쉽게 내놓은 셈이다.
가격표부터 보자 — 캐시 읽기 60% 인하가 핵심
토큰당 요금은 입력 4달러, 출력 20달러(백만 토큰 기준)다. 오퍼스 5보다 20% 싸다. 더 중요한 건 캐시 읽기 요금 0.20달러다. 60% 인하됐다. 앤스로픽은 "에이전트·코딩 작업 비용의 다수를 차지한다"고 설명했다.
출력 속도도 30% 이상 빨라졌다. 프로·맥스·팀·엔터프라이즈 플랜의 5시간 사용량 한도가 늘었고, 속도 제한 리셋권을 사용자가 원하는 시점에 쓸 수 있게 바꿨다.
| 항목 | 오퍼스 5 | 오퍼스 5.5 | 변화 |
|---|---|---|---|
| 입력(백만 토큰) | $5 | $4 | -20% |
| 출력(백만 토큰) | $25 | $20 | -20% |
| 캐시 읽기(백만 토큰) | $0.50 | $0.20 | -60% |
| 출력 속도 | 기준 | +30% 이상 | — |
코딩 실력, 숫자 아닌 사례로 입증
발표문에 나온 두 사례가 인상적이다.
- 68만 줄 코드 마이그레이션을 하루 만에 완료. 엔지니어 팀이면 수 주 걸릴 작업.
- 웹앱 전 페이지 로딩 시간 단축 과제에서 40회 중 39회 성공. 오퍼스 5는 동작 변경 부작용이 있었다.
터미널벤치 4.0에서는 어댑티브 싱킹 최대 노력 모드로 평가받았다. GPT-6 아스트라 하이 노력 모드와 비교 대상이 됐다. 단, 앤스로픽 스스로 "이 수준에서 벤치마크 격차는 실체감 차이를 덜 반영한다"고 밝혔다. 프로덕션 세이프가드 작동 시 사이버 과제는 4.8이, 생물학·프론티어 LLM 개발 과제는 오퍼스 5가 대신 수행해 점수가 깎였다고도 덧붙였다.
안전성 — 가장 높은 행동 감사 점수
자동화 행동 감사(수천 개 시뮬레이션 시나리오)에서 역대 최고 점수를 받았다. 되돌리기 어려운 행동 회피, 경계 이탈 감소, 프롬프트 인젝션 저항성 모두 오퍼스 5보다 낫다. 단 "여전히 한계가 있다"며 시스템 카드 공개를 약속했다.
생물학·사이버보안 영역에서 파블 5.1과 동급이라, 파블과 유사한 세이프가드를 적용했다. 라이프사이언스 검증 프로그램 신청을 오늘부터 받고, 사이버 검증 프로그램도 수주 내 확대한다.
문체 개선 — "내 글쓰기 같더라"
오퍼스 5의 고질적 비판이 '클로디즘(Claudism)'이라 불리는 기계적 문체였다. 해커뉴스에서도 "단어 선택이 구역질 난다"는 표현까지 나왔다.
오퍼스 5.5는 핵심 정보를 앞쪽에 배치하고, 장시간 대화에서도 일관된 톤을 유지한다. 초기 테스터 평: "내 글쓰기 방식이랑 똑같다." 앤스로픽 내부에서도 검토가 쉬워져 안전성 이득도 봤다고 한다.
소넷 5.5와 하이쿠 5.5도 수주 내 나온다. 같은 방향 개선이 적용된다.
쉽게 풀어보면
앤스로픽이 새 최상위 모델 클로드 오퍼스 5.5를 내놨습니다. 이전 최상위 모델 '파블 5.1'과 거의 맞먹는 성능을 내면서, 기존 오퍼스 5보다 쓰는 돈은 40% 줄였습니다.
뷔페에 비유하면 이렇습니다. 파블은 '프리미엄 뷔페'라 비싸서 기업들이 잘 안 갔습니다. 오퍼스 5는 '가성비 뷔페'라 내세웠는데 음식이 영 별로였죠(이용자 혹평). 오퍼스 5.5는 프리미엄 뷔페 음식을 가성비 뷔페 가격에 내놓겠다는 시도입니다.
구체적으로 달라진 점 세 가지:
첫째, 코딩이 확실히 강해졌습니다. 68만 줄짜리 거대한 코드 이전을 하루 만에 끝냈고, 웹사이트 로딩 속도 최적화도 40번 중 39번 성공했습니다. 이전 모델은 코드 고치면서 동작까지 바꿔버리는 실수를 했는데, 5.5는 그런 부작용이 줄었습니다.
둘째, 안전장치가 더 단단해졌습니다. 수천 가지 가상 상황 테스트에서 역대 최고 점수를 받았습니다. '되돌리기 힘든 행동'을 덜 하고, 악의적 지시(프롬프트 인젝션)에도 더 잘 버팁니다. 단, "완벽하지 않다"며 한계를 솔직히 밝혔습니다.
셋째, 말이 자연스러워졌습니다. 이전 모델은 'AI 티 나는 말투'로 욕을 먹었습니다. 5.5는 중요한 말을 앞에 두고, 사람처럼 자연스럽게 씁니다. 테스터 말이 "내 글쓰기랑 똑같다"였습니다. 이 덕분에 결과물 검토가 쉬워져 안전성에도 도움 된다고 합니다.
가격표도 바꿨습니다. 입력·출력 토큰 값 20% 내렸고, 캐시 읽기(반복 작업의 핵심 비용)는 60% 내렸습니다. 월 20달러 구독자의 사용 한도도 늘렸고, 한도 리셋권도 내가 원할 때 쓸 수 있게 했습니다.
나에게 미치는 영향
월 20달러 프로 구독자라면
오늘부터 오퍼스 5.5를 쓸 수 있습니다. 사용량 한도가 늘었고, 리셋권도 아껴뒀다 필요할 때 쓰세요. 코딩·장문 작업이 많다면 체감 비용이 꽤 내려갈 겁니다.
클로드 코드(CLI) 쓰는 개발자라면
캐시 읽기 요금 60% 인하가 바로 와닿습니다. 같은 작업 반복 시 토큰 재사용 비중이 크거든요. 오퍼스 5에서 '말 많은 답변' 때문에 프롬프트 훅으로 제어하던 분들, 5.5는 기본 출력이 깔끔해졌으니 훅 없이 써보세요.
기업 의사결정자라면
파블 5.1급 성능을 40% 싼 값에 쓸 수 있습니다. 단, 생물학·사이버보안 용도면 라이프사이언스/사이버 검증 프로그램 승인부터 받아야 합니다. 일반 업무면 바로 도입 검토해볼 만합니다.
무료 사용자라면
소넷 5.5와 하이쿠 5.5가 수주 내 나옵니다. 오퍼스 5.5 개선분이 아래로 내려올 테니, 급하지 않다면 그때까지 기다려도 됩니다.
한 가지 확인해볼 것
발표문엔 "벤치마크 격차가 실체감 차이를 덜 반영한다"는 문구가 있습니다. 수치보다 내 실제 업무 프롬프트 몇 개를 5.5로 돌려보고 비교하는 게 가장 빠릅니다. 챗GPT·제미나이 쓰고 있다면 같은 프롬프트로 세 모델 답변 나란히 놓고 보세요.
남은 쟁점 — 발표문에 없는 것들
한국어 성능
발표문과 시스템 카드 어디에도 한국어 벤치마크가 없습니다. 영어권 위주 테스트라 다국어 품질은 별도 검증 필요합니다.
장문 컨텍스트 실사용
캐시 읽기 요금 인하는 긴 컨텍스트 반복 작업에 유리합니다. 하지만 최대 컨텍스트 길이·실제 유지 성능은 공개되지 않았습니다.
경쟁 모델과 직접 비교
GPT-6 아스트라 하이 노력 모드와 터미널벤치에서만 비교됐습니다. 제미나이, 그록 등 다른 최상위 모델과는 벤치마크가 없습니다.
국내 클라우드·IDE 연동
아마존 베드록, 구글 버텍스, VS코드·커서 등 국내 개발 환경 연동 시점·조건은 별도 공지 기다려야 합니다.
한 줄 평
오퍼스 5의 '비싼 값에 못 쓸 물건' 오명을 5.5가 얼마나 씻어낼지, 실제 코드베이스에 던져보고 판단하세요.
이 기사의 출처
- Hacker NewsClaude Opus 5.5
- Hacker NewsClaude Opus 5.5
- r/singularityIntroducing Claude Opus 5.5, 40% Cheaper and Smarter Than Ever Before
이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.