신모델·

GPT-6.1 솔, "아스트라급 5분의 1 가격"… 벤치마크엔 아스트라보다 뒤처져

한 줄 요약오픈AI 신모델 GPT-6.1 솔, 가격 경쟁력 내세웠으나 실성능은 경쟁 모델들에 뒤처져
광고

오픈AI가 내놓은 '가성비 모델'의 실체

오픈AI가 17일(현지 시각) GPT-6.1 솔을 발표했다. 핵심 주장은 "GPT-6 아스트라에 근접한 지능을 아스트라 표준 입력·출력 토큰 가격의 5분의 1에 제공한다"는 것이다. 캐시된 입력 토큰은 100만 개당 0.10달러. 표준 입력 가격 대비 95%, 기존 GPT-6 솔 캐시 입력 대비 50% 저렴하다.

발표문에선 딥SWE v1.1(코딩), GDP.pdf(복잡 문서 이해), 오토메이션벤치(업무 워크플로), OS월드 2.0(컴퓨터 사용), 터미널벤치 사이언스 0.1(과학 연구) 등 다섯 개 벤치마크에서 아스트라와 격차가 2~7%포인트 안팎임을 강조했다. 가격 대비 성능비만 보면 개발자·기업 입장에서 매력적이다.

독립 지표에선 아스트라·오퍼스·소넷·페이블 모두에 밀려

하지만 AA 인텔리전스 인덱스라는 독립 평가에선 GPT-6.1 솔이 아스트라뿐 아니라 클로드 오퍼스 5.5, 소넷 5.5, 페이블 5.1에도 뒤처지는 것으로 나타났다(레딧 r/singularity). 오픈AI가 선정한 다섯 개 벤치마크는 모두 자사·경쟁사 모델이 강점을 보이는 영역을 골라 비교한 결과일 수 있다. 발표문이 "여러 평가에서 아스트라에 근접"이라고만 할 뿐, 전체 지능 순위를 보여주는 종합 벤치마크 결과는 인용하지 않았다는 점이 걸린다.

앞서 본지가 7일 전 다룬 GPT-6 아스트라, 20년 풀리지 않던 에니그마 암호 해독 기사에서 아스트라의 '자율적 난제 해결 능력'이 화제가 됐지만, 26일 전 커뮤니티는 회의적 반응을 보였고 25일 전 오픈라우터 등장 때도 실체는 안개 속이었다. 아스트라 자체가 검증 덜 된 상태에서 '아스트라급'을 내세우는 건 기준이 모호하다.

광고

가격표엔 안 적힌 조건들… 캐시 혜택엔 '272K 토큰' 함정

가격표엔 캐시 입력 0.10달러가 눈에 띄지만, 프롬프트가 272K 토큰을 넘으면 입력·캐시 요금 2배, 출력 1.5배가 부과된다. 장문 컨텍스트를 재사용하려는 에이전트 워크플로에서 정확히 이 구간을 넘기 쉽다. EU 데이터 레지던시 선택 시 패스트 모드(2배 속도)를 쓸 수 없고, 파인튜닝도 지원하지 않는다. 개발 문서엔 "리저닝 노력 높음·최대에서만 성능이 나온다"는 식의 조건이 붙어 있어, 기본 설정으론 발표 수치가 안 나올 수 있다.

해커뉴스 댓글에선 "이 모델이 솔 6보다 훨씬 크다(생성 속도가 느리다)", "오픈AI가 오퍼스 5.5와 경쟁하려고 마진을 깎아 가격 내린 것", **"구독제 토큰 보조금이 IPO 전엔 유지 안 될 것"**이라는 분석이 나왔다. 가격 경쟁력이 구조적인 원가 절감이 아니라 일시적 마케팅·경쟁 대응일 가능성을 시사한다.

쉽게 풀어보면

오픈AI가 새 모델 GPT-6.1 솔을 내놨습니다. **"최상위 모델 아스트라랑 성능은 비슷한데 가격은 5분의 1"**이라고 광고합니다. 실제로 코딩·문서 분석·업무 자동화 등 다섯 가지 테스트에서 아스트라와 점수 차이가 몇 %포인트 안 났습니다.

그런데 독립 평가 기관(AA 인텔리전스 인덱스)에선 얘가 아스트라뿐 아니라 경쟁사 앤스로픽의 오퍼스 5.5, 소넷 5.5, 페이블 5.1보다도 순위가 낮았습니다. 오픈AI가 자기한테 유리한 테스트만 골라 보여줬을 수 있다는 뜻입니다.

가격도 자세히 보면 긴 문맥(27만 토큰 넘으면) 쓸 때 요금이 2배로 뛴다는 조건이 숨어 있습니다. 유럽 서버 쓰면 빠른 모드도 못 씁니다. 파인튜닝(맞춤 학습)도 안 됩니다.

커뮤니티에선 "모델 크기를 키워서 속도가 느려진 것 같다", "경쟁사 견제용으로 마진 깎아 판 것 같다"는 분석이 나옵니다. 구독제(월 200·500달러)에 딸린 API 크레딧도 곧 줄일 거라는 전망도 있습니다.

나에게 미치는 영향

API로 직접 개발하는 분이라면: 지금 GPT-6 솔이나 클로드 소넷 5.5를 쓰고 있다면, 캐시 입력이 많은 워크플로(반복되는 긴 프롬프트)에서만 6.1 솔로 갈아타서 비용을 아낄 수 있는지 테스트해 보세요. 단, 272K 토큰 넘으면 요금 폭탄 맞으니 컨텍스트 길이부터 확인하세요.

챗GPT 플러스/프로/팀 구독자라면: 이 모델이 챗GPT 인터페이스에 언제 들어올지, 들어올 때 어떤 이름으로 나올지 아직 모릅니다. 당장 설정을 바꿀 필요 없습니다. 오히려 구독제 API 크레딧 축소 가능성이 거론되니, 월 사용량을 확인해 두는 게 낫습니다.

그냥 AI 써보고 싶은 일반인이라면: 챗GPT 무료·유료 버전으로 충분합니다. 새 모델 나왔다고 성능이 드라마틱하게 좋아지는 건 아닙니다. 답이 이상하면 새 대화창에서 다시 물어보세요 — 그게 지금 당장 할 수 있는 가장 확실한 성능 향상법입니다.

지금 써야 할 사람 vs 아직 기다려도 되는 사람

상황 권장
에이전트·자동화 파이프라인 돌리며 캐시 히트율 높은 개발팀 지금 테스트 권장 — 비용 절감 체감 가능
장문 컨텍스트(272K↑) 필수인 워크플로 보류 — 2배 요금 적용돼 이점 사라짐
한국 데이터 레지던시 필요한 기업 보류 — US/EU만 지원, 한국 리전 없음
챗GPT 웹·앱만 쓰는 일반 사용자 대기 — 인터페이스 반영 시점·방식 미정
파인튜닝 필요한 팀 대기 — 미지원

남은 쟁점

  1. 실제 프로덕션 지연 시간·처리량: 해커뉴스에서 "생성 속도가 현저히 느리다"는 반응이 여럿 나왔으나, 오픈AI는 레이턴시 수치를 공개하지 않았다.
  2. 구독제 API 크레딧 축소 시점: "200·500달러 플랜 사용자가 매출에서 차지하는 비중이 크지 않다"는 회의론이 커뮤니티에 있다. IPO 전 가격 인상·크레딧 삭감 가능성을 배제 못 한다.
  3. 한국어·한국 도메인 벤치마크 부재: 발표 벤치마크는 영문·서구 업무 중심이다. 한국어 복잡 문서·코딩·행정 워크플로에서 아스트라·클로드 대비 어떤지 알 수 없다.

한 줄 평: 가격표만 보면 혁신, 벤치마크 전체를 보면 '아스트라급' 기준부터 모호한 포지셔닝 모델. 캐시 재사용 많은 특정 파이프라인 외엔 당장 갈아탈 이유 약하다.

이 기사의 출처

이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.

광고