xAI 그록 4.7 공개… "코딩·지식작업 최강, 절반 가격에 두 배 속도"
xAI가 21일 그록 4.7을 공개했습니다. 코딩과 지식 작업에 가장 강력한 모델이라는 소개입니다. 전작 4.6과 같은 요금·속도를 유지하면서, 더 긴 과제를 풀고 스스로 검증하는 능력을 키웠습니다.
가격·속도·성능, 세 마리 토끼를 동시에
요금은 입력 100만 토큰당 2달러, 출력 6달러. 원화로 약 2,700원, 8,100원 수준(환율 1,350원 기준). 빠른 변종은 속도 두 배에 값도 두 배입니다.
xAI 주장대로면 동급 모델 절반 가격에 두 배 속도입니다. 커서벤치 4.0에서 '가격 대비 성능 최전선'이라 밝혔습니다. 1위라는 표현은 원문에 없습니다.
눈에 띄는 모순 하나. 발표문은 "비교 모델 대비 절반 가격·두 배 속도"라고 했지만, 빠른 변종은 돈을 두 배 내고 속도 두 배를 산 구조입니다. 기본형이 이미 '절반 가격'이라면, 빠른 변종은 결국 경쟁사와 비슷해집니다. 이 전제가 뭔지는 아직 공개되지 않았습니다.
GDPval·AA 브리프케이스(변호사·간호사·금융 분석가 과제)에서도 전작과 타사 최신 모델 사이 선두권을 지켰습니다.
안전성 스택 전면 교체… "거절률 낮으면서 위험 차단"
새 안전 장치로 무장했습니다. 래치바이오 생물안전 벤치마크 62.4%, 해커벤치 v0.3에서 위험 프롬프트 3.3%만 통과시켰습니다.
정당한 보안 작업은 거의 차단하지 않으면서 위험한 이중용도 요청은 걸러낸다는 설명입니다. 일부 사이버 보안 파트너에게 레드팀 기능도 개방했습니다.
커뮤니티 반응은 "일단 써보자"… 회의론도 여전
해커뉴스 댓글 368개 중 두 갈래가 눈에 띕니다.
- "코드베이스가 워터마크 투성이가 될 것"이란 우려
- "브루드워 열 판은 해봐야 진짜 실력 안다"는 농담 섞인 검증 요구
그록 4.6이 "컴포저 2.5보다 느리고 재미없었다"는 평가를 받은 터라, 4.7이 "버튼 취소 같은 구체 지시를 잘 따른다"는 후기만으론 부족하다는 시선도 있습니다. 트위터 데이터·RLHF 탓에 답변이 너무 간결해진 게 아니냐는 추측도 나옵니다.
쉽게 풀어보면
xAI가 새 모델 그록 4.7을 내놨습니다. 핵심은 '실무에서 바로 쓸 만하게 만들었다'는 점입니다.
뷔페에 비유해 보겠습니다. 그록 4.7은 이전보다 큰 접시(컨텍스트 창)를 들고 뷔페에 갑니다. 한 번에 더 많은 일감(코드·문서)을 담아옵니다. 스스로 음식을 검수하는 습관도 들였습니다. "이 코드 돌아가는 거 맞나?" 하고 한 번 더 들여다봅니다.
가격표도 매력적입니다. 입력 100만 토큰에 2달러(약 2,700원), 출력은 6달러(약 8,100원). 경쟁 모델 절반 수준입니다. 빠른 버전은 돈 두 배 내고 속도 두 배 뽑아 쓰면 됩니다.
안전장치도 새로 짰습니다. **위험한 요청 100개 중 97개는 차단(3.3%만 통과), 정당한 보안 분석은 거의 통과(래치바이오 62.4%)**시킵니다. "칼을 줄 테니 요리만 해라" 식이 아니라, "칼 쓸 줄 아는지 확인하고 주겠다"에 가깝습니다.
당장 커서(Cursor)라는 인기 코딩 도구에서 골라 쓸 수 있습니다. API 키만 있으면 내 서비스에도 붙일 수 있습니다.
나에게 미치는 영향
코딩하는 직장인·학생
- 오늘 커서 설정에 들어가 모델을 'Grok 4.7'로 바꿔보세요. 커서에서 바로 이용 가능합니다.
- 요금제는 커서 정책을 따릅니다(별도 확인 필요).
- 긴 리팩토링이나 테스트 작성 같은 '시간 오래 걸리는 작업'에서 체감 차이가 클 겁니다.
문서·발표 자료 자주 만드는 기획자·마케터
- 그록 빌드나 API로 '초안 생성 → 검수 → 수정' 루프를 돌려보세요.
- GDPval·AA 브리프케이스는 변호사·애널리스트 등 전문가 과제를 다룹니다. 여기서 전작 대비 향상됐다는 건, 전문 용어·구조 잡는 감각이 올라갔다는 신호로 보입니다.
보안·컴플라이언스 팀
- 레드팀 기능 초청 여부를 xAI 영업 쪽에 문의해볼 만합니다.
- 위험 프롬프트 3.3%만 통과시켰다는 수치는, 내부 가드레일 테스트용으로 쓸 여지가 있습니다.
무료로 써보고 싶다면
- 그록 웹·앱에서 대화해보세요.
- API 무료 크레딧 정책은 아직 공개되지 않았습니다.
남은 건 실전 검증
벤치마크 숫자는 발표자(xAI 블로그)에게 유리하게 짜여 있기 마련입니다. 커서벤치 4.0이 "긴 작업"을 강조하지만, 실제 내 코드베이스에서 얼마나 버티는지는 다릅니다. 해커뉴스 말마따나 "브루드워 열 판" 같은 비표준 테스트가 더 솔직할 수 있습니다.
여기서 걸리는 대목 하나. 4.6 때 "컴포저 2.5보다 못하다"는 평을 들은 건, 속도·비용·품질 삼박자 중 하나가 어긋났기 때문으로 보입니다. 그런데 4.7은 4.6과 '동일 속도·동일 가격'을 내세웁니다. 그렇다면 빨라진 건 '비교 대상'이 바뀐 덕분일 가능성이 큽니다. 4.7이 그 균형을 진짜 맞췄는지는, 이번 주말 사이드 프로젝트 하나 돌려보면 압니다. 그때 다시 정리하겠습니다.
이 기사의 출처
- Hacker NewsGrok 4.7
- r/singularityIntroducing Grok 4.7
이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.