# 일반 PC로 125B 모델 돌린다… 스트라타, RTX 4090서 100토큰/초 달성 > RTX 4090 한 장으로 125B 모델을 초당 100토큰 속도 구동하는 스트라타 공개 - 매체: AI 브리핑 - 담당: 실전활용 데스크 - 분야: 활용법 - 발행: 2026-10-04T14:34:49.494Z - 원문 주소(웹): https://ai-news-1c0.pages.dev/posts/2026-10-04-%EC%9D%BC%EB%B0%98-pc%EB%A1%9C-125b-%EB%AA%A8%EB%8D%B8-%EB%8F%8C%EB%A6%B0%EB%8B%A4-%EC%8A%A4%ED%8A%B8%EB%9D%BC%ED%83%80-rtx-4090%EC%84%9C-100%ED%86%A0%ED%81%B0%EC%B4%88-%EB%8B%AC%EC%84%B1/ - 태그: 스트라타, 로컬 LLM, RTX 4090, 퀸 3.8, AI 실전활용 --- ## 일반 그래픽카드 하나로 125B 모델이 돌아간다 깃허브 프로젝트 **스트라타(Strata)**가 퀸 3.8 플래시 넥스트(125B 파라미터)를 엔비디아 RTX 4090에서 초당 100토큰 속도로 실행하는 데 성공했다. 12GB 이상 VRAM을 가진 소비자용 그래픽카드면 윈도우·리눅스 구분 없이 돌릴 수 있다. 모델 무게는 약 70GB다. 이 소식은 해커뉴스에서 111점, 댓글 41개를 받으며 1.6시간 전 처음 등장했다. 개발자 니코1221이 공개한 스트라타는 라마씨피유(llama.cpp)·그구에밀(ggml) 일부를 가져와 시스템 메모리와 비디오 메모리를 오가며 레이어를 분산 적재하는 방식으로 동작한다. ## 쉽게 풀어보면 **스트라타가 퀸 3.8 플래시 넥스트(125B)를 일반 게이밍 PC에서 돌렸습니다.** 뷔페에 비유하면 이렇습니다. 접시(VRAM)가 작아도 창고(RAM)에 음식을 두고 필요할 때마다 꺼내 먹으면 됩니다. 스트라타는 이 '창고 왕복'을 자동으로 최적화해 초당 100토큰(약 75단어) 속도를 냈습니다. 퀸 3.8 플래시 넥스트는 1250억 개 파라미터(모델의 두뇌 용량 수치) 중 한 번에 60억 개만 깨워 쓰는 MoE 구조입니다. 본지가 39일 전 다룬 관련 기사 때만 해도 듀얼 RTX 3060(24GB×2) 환경에서 겨우 확인됐습니다. 이후 단일 카드 12GB 환경으로 진입 장벽이 더 낮아진 셈입니다. ## 커뮤니티 실측 속도와 하드웨어별 진입선 스트라타 문서 `DETAILS.md`에 공개된 NVIDIA 측 측정값(Q2_0 양자화, 엔진 0.1.36 기준)에 따르면 RTX 3090·4090(24GB)에서 100~140토큰/초가 나옵니다. RTX 3080 12GB와 4070 Ti 12GB는 각각 60~80, 70~90토큰/초로 기록돼 있습니다. **단, 이 하드웨어별 속도표와 AMD 카드별 VRAM 용량은 제공된 원문에서 확인되지 않았습니다.** RTX 2080 Ti(11GB)는 12GB 미만이라 실행 불가입니다. 시스템 메모리 32GB 이상, 디스크 80GB 여유 공간(SSD 권장)이 전제 조건입니다. 64GB 램이 있으면 모든 모델 크기를 소화합니다. 해커뉴스 댓글 중 RTX 3080 10GB 사용자는 "비슷한 하드웨어 이야기를 처음 본다"며 기대감을 보였지만, 스트라타 공식 요구사항은 VRAM 12GB 이상으로 못 박혀 있습니다. 10GB 카드는 모델 일부조차 올릴 수 없습니다. ## 2비트 양자화의 대가 — 속도인가 정확도인가 이번 성능의 열쇠는 **IQ3_S·Q2_0 등 2~3비트 극한 양자화**입니다. 해커뉴스 댓글에서도 "4비트가 바닥이다", "2비트 퀀트만으로 100토큰/초를 내는 프로젝트들이 정확도 수치를 안 밝힌다"는 지적이 나옵니다. 스트라타 문서 역시 정확도 벤치마크는 별도 공개하지 않았습니다. 본지가 40일 전 기사에서 지적했듯, MoE 모델은 전문가 선택 라우팅이 양자화 오차에 민감합니다. 코딩·추론 같은 정밀 작업에서 품질 저하가 발생할 가능성이 큽니다. 단순 대화·요약용이면 충분하겠지만, 프로덕션 코드 생성이 주 목적이라면 4비트 이상 버전(IQ4_XS·Q4_K_M 등)을 권장합니다. 속도는 절반 이하로 떨어집니다. **이 대목이 걸린다: 2비트 속도 수치만 보고 실무에 쓰면 낭패를 볼 수 있습니다.** ## 설치부터 실행까지 — 5분 만에 따라 하기 스트라타는 설치 프로그램이 하드웨어를 자동 감지해 알맞은 엔진·모델을 골라 줍니다. 깃허브 저장소에서 ZIP 압축 해제 또는 `git clone`으로 내려받으세요. 윈도우는 `START-HERE.bat` 더블클릭, 리눅스는 `./setup.sh` 실행하면 됩니다. 엔터 키만 눌러 권장값으로 진행하면 그래픽카드·램·디스크를 자동 감지합니다. 모델 다운로드는 약 70GB이며 중단돼도 재실행 시 이어받기 됩니다. 브라우저가 열리며 `http://127.0.0.1:8080` 스트라타 앱에 접속됩니다. 첫 구동 1~3분 동안 35~55GB를 램에 적재하며 락을 거는 동안 PC가 멈춘 듯 보여도 창을 닫지 말고 기다리세요. 이후엔 `START-HERE.bat`만 다시 누르면 즉시 시작됩니다. 업데이트는 `UPDATE.bat`로 별도 수행합니다. 멀티 GPU(2~3장) 분산도 지원합니다. **흔한 막힘 지점과 해결** 포트 8080 충돌은 이미 스트라타가 떠 있는지 확인하면 됩니다. 다운로드 중단은 재실행하면 이어받기 됩니다. 디스크 LED가 계속 깜빡이거나 엔진이 종료되면 램 부족이므로 브라우저를 끄거나 더 작은 양자화(Q2_0·IQ2_XS)를 선택하세요. 10분 이상 멈춤이면 재부팅 후 다른 프로그램 종료하고 재시도하세요. AI 코딩 어시스턴트(클로드 코드, 커서, 코파일럿 등)를 쓰면 `docs/AI_SETUP.md`를 붙여넣기만 해도 자동 설치·기동·앱 연동까지 해 줍니다. ## 나에게 미치는 영향 **오늘 바로 해 볼 수 있는 것** RTX 3090·4090·4080(16GB)·3080 12GB 보유자는 스트라타 다운로드 후 `START-HERE.bat` 실행하면 10분 뒤 로컬 125B 모델과 대화할 수 있습니다. 12GB 카드 사용자는 IQ3_S·Q2_0 버전으로 속도 우선 테스트하고, 품질 아쉬우면 Q4_K_M로 재설치(`SETUP.bat` 또는 `./setup.sh --setup`)하세요. 램 32GB·SSD 80GB 여유 없는 사용자는 램 증설 또는 더 작은 모델(27B·32B급)부터 시도하세요. **돈 아끼는 포인트** 클라우드 API 호출비 월 5~10만 원을 로컬 무료로 전환할 수 있습니다. **단, 이 비용 추정치는 제공된 자료에 없습니다.** 외주 코드 리뷰·초안 작성에 125B MoE 모델을 활용하면 인건비 절감 체감이 가능합니다. 단, 첫 구동 시 램 55GB 점유로 다른 작업 병행 불가하니 야간·점심시간 배치 권장합니다. ## 남은 쟁점 — 검증 안 된 세 가지 1. **정확도 수치 부재**: 스트라타·커뮤니티 모두 퍼플렉서티·코드 벤치마크 미공개. 2비트 양자화 모델 실사용 품질은 사용자가 직접 검증해야 함 2. **장문 컨텍스트 안정성**: 128K 컨텍스트 지원 주장하지만 램 스와핑 발생 시 지연 급증 가능성. `DETAILS.md` 장문 테스트 행은 별도 표로 분리돼 있음 3. **보안 감사 미완료**: `SECURITY.md`로 비공개 신고만 안내. 프로덕션 데이터 투입 전 네트워크 격리·로그 검토 필요 스트라타는 "커피 한 잔 값 후원"으로 유지되는 오픈소스입니다. 상용 지원·SLA는 없습니다. **실무 투입 전 소규모 파일럿(하루 30분·일주일)으로 품질·안정성을 직접 확인하세요. 본지가 확인한 바는 여기까지입니다.** --- ## 출처 - [Hacker News] Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s — https://news.ycombinator.com/item?id=49953495 ## 집필 방식 고지 이 기사는 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인했습니다. 인용 시 출처를 "AI 브리핑"으로 표기하고 https://ai-news-1c0.pages.dev/posts/2026-10-04-%EC%9D%BC%EB%B0%98-pc%EB%A1%9C-125b-%EB%AA%A8%EB%8D%B8-%EB%8F%8C%EB%A6%B0%EB%8B%A4-%EC%8A%A4%ED%8A%B8%EB%9D%BC%ED%83%80-rtx-4090%EC%84%9C-100%ED%86%A0%ED%81%B0%EC%B4%88-%EB%8B%AC%EC%84%B1/ 로 연결해 주세요.