퀸 3.8 플래시 넥스트, 라마씨피유 합류로 듀얼 3060에서도 실행 확인
라마씨피유 병합, 실행 경로가 열렸다
퀸(Qwen)의 3.8 플래시 넥스트(Qwen3.8-Flash-Next)가 라마씨피유(llama.cpp) 메인 브랜치에 병합됐다. 시몬 윌리슨(Simon Willison)이 26일 블로그에서 처음 알렸고, 레딧 r/LocalLLaMA 커뮤니티에서도 같은 날 지원 소식이 332표를 얻으며 공유됐다. 본지가 2일 전 다룬 기사에서는 모델 구조와 의의만 다뤘다. 이제는 실제 다운로드·실행 경로가 열렸다는 점이 다르다.
125B 몸집, 6B만 깨워 쓰는 MoE 구조
이 모델은 전체 1250억 매개변수(파라미터, 모델의 두뇌 용량에 해당하는 수치) 중 추론 시 60억 개만 활성화되는 혼합전문가(MoE, Mixture of Experts) 방식이다. 입력에 따라 필요한 전문가 네트워크만 골라 쓰므로, 같은 크기의 밀집 모델보다 연산량이 크게 준다. 시몬 윌리슨은 "퀸4 아키텍처의 초기 프리뷰"라고 표현했다. 멀티모달(텍스트·이미지 동시 처리)도 지원한다.
듀얼 3060에서 400tps 실측, 단일 카드는 미검증
레딧 사용자(-sm tensor trap)가 2×RTX 3060(각 12GB VRAM) + 라이젠 7800X3D 환경에서 UD-IQ4_XS 양자화 모델로 테스트했다. 프리필(입력 처리) 36토큰/초에서 디코드(생성) 400토큰/초까지 찍혔다. VRAM 24GB 전량을 쓰고 시스템 램도 추가 점유했으나 구체적 용량은 공개되지 않았다. 단일 3060 12GB 환경 수치는 자료에 없다. 커뮤니티에서는 "양자화로 품질이 얼마나 떨어지는지 벤치마크가 없다"는 지적이 나왔으나 댓글 원문은 본지가 확인하지 못했다. 이 대목이 걸린다.
양자화 버전별 용량, 품질과 맞바꾼다
윌리슨은 DGX 스파크(전용 워크스테이션)에서 언슬로스(Unsloth) 양자화판을 테스트했다. 주요 버전 용량은 다음과 같다.
- UD-IQ1_S: 72.5GB
- UD-Q2_K_XL: 78.9GB
레딧 벤치마크는 더 가벼운 UD-IQ4_XS를 썼다. UD-IQ4_XS의 정확한 용량은 자료에 없다. 양자화 레벨이 낮을수록(숫자 작을수록) 품질은 낫지만 용량이 커진다. 본지 3일 전 기사에서는 "고사양 로컬 환경 사용자만 바로 테스트 가능"이라고 했는데, 듀얼 3060급이면 진입선이 내려온 셈이다.
쉽게 풀어보면
퀸이 새 모델 Qwen3.8-Flash-Next를 내놨습니다. 전체 두뇌 용량은 1250억 개(125B)지만, 실제 생각할 땐 60억 개(6B)만 씁니다. 덕분에 연산량이 20분의 1로 줄어듭니다. 이틀 전만 해도 "나와도 고사양 서버급 있어야 쓴다"였는데, 라마씨피유라는 대중적 실행 도구에 합류하면서 중고 그래픽카드 두 장(3060 12GB ×2) 조합에서도 초당 400토큰(단어 조각) 가까이 뽑아냅니다. 일반인용 비유: 도서관 전체 책을 다 읽는 게 아니라, 질문 주제에 맞춰 필요한 서가 6권만 골라 펼쳐 보는 식입니다. 어떤 서가를 펼칠지 결정하는 '라우팅' 과정도 모델 안에 들어 있어, 골라 읽는 속도가 빠릅니다.
나에게 미치는 영향
지금 바로 해볼 수 있는 것
- 라마씨피유 최신 빌드(메인 브랜치)를 받아 실행 명령어(
llama-cli -m 모델파일.gguf)로 돌리면 된다. - 허깅페이스에서 언슬로스(Unsloth) 양자화 파일을 구할 수 있다. 구체 저장소명은 자료에 공개되지 않았다.
- 듀얼 3060(합계 VRAM 24GB) 이상이면 실사용 속도 나온다.
확인되지 않은 것
- 단일 3060 12GB: VRAM 부족으로 시스템 램으로 밀려날 가능성이 크나 구체적 속도는 본지가 확인하지 못했다.
- 맥(M1/2/3 맥스·울트라, 64GB+ 램) 호환성: 아직 공개된 테스트가 없다.
기다려도 되는 경우
- 4090 24GB 단일 카드 사용자: 아직 단일 카드 최적화 벤치마크가 없다. 커뮤니티 테스트가 더 쌓일 때까지 관망해도 늦지 않다.
- 클라우드 API로 퀸 모델을 이미 쓰는 일반 사용자: 로컬 실행 이점(프라이버시, 무제한 사용, 커스텀 파인튜닝)이 필요 없다면 갈아탈 이유 약함.
남은 쟁점
- 맥락 길이(context length, 한 번에 기억하는 대화 폭) 공개 수치 없음: MoE 특성상 긴 문맥에서 전문가 라우팅 오버헤드가 커질 수 있다. 실측 데이터가 더 필요하다.
- 멀티모달 파이프라인 완성도: 이미지 입력이 라마씨피유에서 어떻게 연결되는지 문서화가 아직 얇다.
- 한국어 성능: 윌리슨 테스트는 영어 위주. 국내 커뮤니티 벤치마크가 나올 때까지는 영문 프롬프트 기준이라는 전제가 필요하다.
이 모델을 지금 써야 할 사람: 중고 듀얼 3060 이상 로컬 환경을 이미 갖췄고, 최신 MoE 아키텍처를 직접 만져보고 싶은 개발자·연구자.
아직 기다려도 되는 사람: 단일 4090 이하 단일 카드 사용자, 클라우드 API로 충분한 일반 사용자.
이 기사의 출처
- r/LocalLLaMAllama.cpp support for Qwen3.8-Flash-Next has been merged
- Simon WillisonQwen3.8-Flash-Next
- r/LocalLLaMAQwen3.8-Flash-Next (UD-IQ4_XS) on 2x RTX 3060 + 7800X3D, from initial 36 tps prefill to 400 tps and other benchmarks (-sm tensor trap) + VRAM/RAM usage
이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.