일반 PC로 125B 모델 돌린다… 스트라타, RTX 4090서 100토큰/초 달성
일반 그래픽카드 하나로 125B 모델이 돌아간다
깃허브 프로젝트 **스트라타(Strata)**가 퀸 3.8 플래시 넥스트(125B 파라미터)를 엔비디아 RTX 4090에서 초당 100토큰 속도로 실행하는 데 성공했다. 12GB 이상 VRAM을 가진 소비자용 그래픽카드면 윈도우·리눅스 구분 없이 돌릴 수 있다. 모델 무게는 약 70GB다.
이 소식은 해커뉴스에서 111점, 댓글 41개를 받으며 1.6시간 전 처음 등장했다. 개발자 니코1221이 공개한 스트라타는 라마씨피유(llama.cpp)·그구에밀(ggml) 일부를 가져와 시스템 메모리와 비디오 메모리를 오가며 레이어를 분산 적재하는 방식으로 동작한다.
쉽게 풀어보면
스트라타가 퀸 3.8 플래시 넥스트(125B)를 일반 게이밍 PC에서 돌렸습니다. 뷔페에 비유하면 이렇습니다. 접시(VRAM)가 작아도 창고(RAM)에 음식을 두고 필요할 때마다 꺼내 먹으면 됩니다. 스트라타는 이 '창고 왕복'을 자동으로 최적화해 초당 100토큰(약 75단어) 속도를 냈습니다.
퀸 3.8 플래시 넥스트는 1250억 개 파라미터(모델의 두뇌 용량 수치) 중 한 번에 60억 개만 깨워 쓰는 MoE 구조입니다. 본지가 39일 전 다룬 관련 기사 때만 해도 듀얼 RTX 3060(24GB×2) 환경에서 겨우 확인됐습니다. 이후 단일 카드 12GB 환경으로 진입 장벽이 더 낮아진 셈입니다.
커뮤니티 실측 속도와 하드웨어별 진입선
스트라타 문서 DETAILS.md에 공개된 NVIDIA 측 측정값(Q2_0 양자화, 엔진 0.1.36 기준)에 따르면 RTX 3090·4090(24GB)에서 100140토큰/초가 나옵니다. RTX 3080 12GB와 4070 Ti 12GB는 각각 6080, 70~90토큰/초로 기록돼 있습니다. 단, 이 하드웨어별 속도표와 AMD 카드별 VRAM 용량은 제공된 원문에서 확인되지 않았습니다. RTX 2080 Ti(11GB)는 12GB 미만이라 실행 불가입니다.
시스템 메모리 32GB 이상, 디스크 80GB 여유 공간(SSD 권장)이 전제 조건입니다. 64GB 램이 있으면 모든 모델 크기를 소화합니다. 해커뉴스 댓글 중 RTX 3080 10GB 사용자는 "비슷한 하드웨어 이야기를 처음 본다"며 기대감을 보였지만, 스트라타 공식 요구사항은 VRAM 12GB 이상으로 못 박혀 있습니다. 10GB 카드는 모델 일부조차 올릴 수 없습니다.
2비트 양자화의 대가 — 속도인가 정확도인가
이번 성능의 열쇠는 IQ3_S·Q2_0 등 2~3비트 극한 양자화입니다. 해커뉴스 댓글에서도 "4비트가 바닥이다", "2비트 퀀트만으로 100토큰/초를 내는 프로젝트들이 정확도 수치를 안 밝힌다"는 지적이 나옵니다. 스트라타 문서 역시 정확도 벤치마크는 별도 공개하지 않았습니다.
본지가 40일 전 기사에서 지적했듯, MoE 모델은 전문가 선택 라우팅이 양자화 오차에 민감합니다. 코딩·추론 같은 정밀 작업에서 품질 저하가 발생할 가능성이 큽니다. 단순 대화·요약용이면 충분하겠지만, 프로덕션 코드 생성이 주 목적이라면 4비트 이상 버전(IQ4_XS·Q4_K_M 등)을 권장합니다. 속도는 절반 이하로 떨어집니다. 이 대목이 걸린다: 2비트 속도 수치만 보고 실무에 쓰면 낭패를 볼 수 있습니다.
설치부터 실행까지 — 5분 만에 따라 하기
스트라타는 설치 프로그램이 하드웨어를 자동 감지해 알맞은 엔진·모델을 골라 줍니다. 깃허브 저장소에서 ZIP 압축 해제 또는 git clone으로 내려받으세요. 윈도우는 START-HERE.bat 더블클릭, 리눅스는 ./setup.sh 실행하면 됩니다. 엔터 키만 눌러 권장값으로 진행하면 그래픽카드·램·디스크를 자동 감지합니다.
모델 다운로드는 약 70GB이며 중단돼도 재실행 시 이어받기 됩니다. 브라우저가 열리며 http://127.0.0.1:8080 스트라타 앱에 접속됩니다. 첫 구동 13분 동안 3555GB를 램에 적재하며 락을 거는 동안 PC가 멈춘 듯 보여도 창을 닫지 말고 기다리세요. 이후엔 START-HERE.bat만 다시 누르면 즉시 시작됩니다. 업데이트는 UPDATE.bat로 별도 수행합니다. 멀티 GPU(2~3장) 분산도 지원합니다.
흔한 막힘 지점과 해결 포트 8080 충돌은 이미 스트라타가 떠 있는지 확인하면 됩니다. 다운로드 중단은 재실행하면 이어받기 됩니다. 디스크 LED가 계속 깜빡이거나 엔진이 종료되면 램 부족이므로 브라우저를 끄거나 더 작은 양자화(Q2_0·IQ2_XS)를 선택하세요. 10분 이상 멈춤이면 재부팅 후 다른 프로그램 종료하고 재시도하세요.
AI 코딩 어시스턴트(클로드 코드, 커서, 코파일럿 등)를 쓰면 docs/AI_SETUP.md를 붙여넣기만 해도 자동 설치·기동·앱 연동까지 해 줍니다.
나에게 미치는 영향
오늘 바로 해 볼 수 있는 것
RTX 3090·4090·4080(16GB)·3080 12GB 보유자는 스트라타 다운로드 후 START-HERE.bat 실행하면 10분 뒤 로컬 125B 모델과 대화할 수 있습니다. 12GB 카드 사용자는 IQ3_S·Q2_0 버전으로 속도 우선 테스트하고, 품질 아쉬우면 Q4_K_M로 재설치(SETUP.bat 또는 ./setup.sh --setup)하세요. 램 32GB·SSD 80GB 여유 없는 사용자는 램 증설 또는 더 작은 모델(27B·32B급)부터 시도하세요.
돈 아끼는 포인트 클라우드 API 호출비 월 5~10만 원을 로컬 무료로 전환할 수 있습니다. 단, 이 비용 추정치는 제공된 자료에 없습니다. 외주 코드 리뷰·초안 작성에 125B MoE 모델을 활용하면 인건비 절감 체감이 가능합니다. 단, 첫 구동 시 램 55GB 점유로 다른 작업 병행 불가하니 야간·점심시간 배치 권장합니다.
남은 쟁점 — 검증 안 된 세 가지
- 정확도 수치 부재: 스트라타·커뮤니티 모두 퍼플렉서티·코드 벤치마크 미공개. 2비트 양자화 모델 실사용 품질은 사용자가 직접 검증해야 함
- 장문 컨텍스트 안정성: 128K 컨텍스트 지원 주장하지만 램 스와핑 발생 시 지연 급증 가능성.
DETAILS.md장문 테스트 행은 별도 표로 분리돼 있음 - 보안 감사 미완료:
SECURITY.md로 비공개 신고만 안내. 프로덕션 데이터 투입 전 네트워크 격리·로그 검토 필요
스트라타는 "커피 한 잔 값 후원"으로 유지되는 오픈소스입니다. 상용 지원·SLA는 없습니다. 실무 투입 전 소규모 파일럿(하루 30분·일주일)으로 품질·안정성을 직접 확인하세요. 본지가 확인한 바는 여기까지입니다.
이 기사의 출처
이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.