신모델·

퀸 3.8 플래시 넥스트 공개 임박, 125B MoE가 노리는 것

한 줄 요약퀸 새 MoE 모델 125B-a6B 공개 예고, 고사양 로컬 환경 사용자만 바로 테스트 가능
광고 자리 (top) — .env 에 NEXT_PUBLIC_ADSENSE_CLIENT / _SLOT_TOP 설정 시 노출

퀸 3.8 플래시 넥스트, 무엇이 달라지나

알리바바 퀸 팀이 모델스코프 페이지로 'Qwen3.8-Flash-Next(125B a6B)' 공개를 예고했습니다. 총 파라미터 1250억 개 중 활성 파라미터 60억 개만 쓰는 MoE(Mixture-of-Experts, 전문가 혼합) 구조입니다. 입력마다 일부 전문가만 깨워 연산량을 줄이는 방식이라, 같은 크기 밀집 모델보다 추론이 빠릅니다. 기존 퀸 3.5 시리즈가 27B·72B·110B로 나왔던 것과 달리, '플래시' 수식어와 함께 활성 파라미터를 6B로 대폭 줄인 점이 다릅니다.

공식 블로그나 기술 리포트는 아직 없습니다. 해커뉴스(92점·댓글 31개)와 레딧 r/LocalLLaMA(합계 28점·댓글 0) 스레드만으로 정보가 퍼집니다. 커뮤니티 관심은 '내 장비에서 돌아가는가' 한 곳에 쏠려 있습니다.

하드웨어 요구사항, 현실은 어떤가

해커뉴스 댓글에선 이전 버전 퀸 3.5 110B가 BF16 기준 약 250GB를 차지했다는 증언이 나옵니다. 8비트 양자화(FP8)로 줄여도 약 125GB입니다. 4비트(FP4/Q4) 압축이 필수적이라는 의견이 지배적이나, 정확한 용량은 자료에 없습니다.

VRAM만으로는 부족해 시스템 램 전체에 모델을 올려야 합니다. 타깃은 맥 스튜디오(통합 메모리 대용량), AMD 스트릭스 헤일로, 엔비디아 DGX 스파크 같은 워크스테이션급 장비입니다. 27B·31B급은 이미 RTX 5090(32GB)나 M5 맥스(128GB)에서 편하게 돕니다.

한 사용자는 M5 맥스 16인치에서 qwen3.5:122b-a10b로 초당 6065토큰, 27B Q4로는 3035토큰이 나온다고 적었습니다. 이 수치는 퀸 3.8이 아닌 3.5 모델 측정값입니다. 125B-a6B가 어디쯤 위치할지는 벤치마크가 나와야 알 수 있습니다.

또 다른 댓글은 "듀얼 32GB GPU가 스트릭스 헤일로보다 대역폭이 높아 로컬 추론에 더 유리하다"며 통합 메모리 장비의 대역폭 한계를 지적합니다. 클라우드 대안(클로드·제미나이)을 쓰는 사용자도 "이걸로 클로드를 대체하겠다, 트레이드오프는 토큰 처리량"이라는 반응을 보였습니다. 클라우드가 낫다는 주장은 아니었습니다.

광고 자리 (inArticle) — .env 에 NEXT_PUBLIC_ADSENSE_CLIENT / _SLOT_INARTICLE 설정 시 노출

쉽게 풀어보면

알리바바 퀸 팀이 새 모델을 내놓습니다. 전체 두뇌 용량은 1250억 파라미터지만, 실제 추론 때 쓰는 건 60억 개만 골라 쓰는 '전문가 혼합' 방식입니다. 비유하자면 125명 교수진이 있는 대학원에서, 과제마다 관련 전공 교수 6명만 불러 답을 내주는 식입니다. 덕분에 같은 크기 일반 모델보다 빠르고 메모리를 덜 먹습니다.

문제는 이 '덜 먹는다'가 어느 정도냐입니다. 이전 110B 모델은 16비트 정밀도로 250GB를 차지했습니다. 8비트로 줄여도 125GB, 4비트로 압축해야 겨우 현실적인 크기가 됩니다. 일반 데스크톱 그래픽카드(24GB 이하)로는 어림없고, 맥 스튜디오나 AMD 스트릭스 헤일로, 엔비디아 DGX 스파크 같은 워크스테이션급 장비가 있어야 무난히 돌립니다. 커뮤니티에선 "드디어 내 128GB 맥 스튜디오 쓸 일 생겼다"는 반응이 나옵니다.

나에게 미치는 영향

일반 사용자라면 지금 당장 할 일은 없습니다. 챗GPT·클로드·제미나이 같은 클라우드 서비스로는 이 모델을 바로 쓸 수 없고, 로컬 실행 환경이 갖춰진 고사양 머신이 있어야 합니다.

맥 스튜디오(128GB 이상 통합 메모리)나 AMD 스트릭스 헤일로 탑재 노트북, 엔비디아 DGX 스파크 사용자라면 내일 모델 파일이 뜨자마자 테스트해 볼 만합니다. 그 외 환경은 4비트 양자화 버전이 허깅페이스나 모델스코프에 올라올 때까지 며칠 기다렸다가, 본인 램 용량과 비교해 내려받을지 결정하세요. 무료 클라우드 데모(스페이스 등)가 열릴 가능성도 있으니 퀸 공식 채널을 지켜보세요.

챗GPT나 클로드에서 답이 이상하면 같은 질문을 새 대화창에서 다시 해 보세요. 컨텍스트가 꼬였을 때 가장 빠른 해결법입니다.

남은 쟁점

아직 공개되지 않은 정보가 많습니다. 라이선스(상업 이용 가능 여부), 컨텍스트 길이, 학습 데이터 컷오프, 벤치마크 점수 모두 미공개입니다. 본지가 확인하지 못했습니다. 퀸 3.5 시리즈가 아파치 2.0으로 풀렸던 전례도 제공 자료에 없습니다. '플래시'가 추론 속도 최적화를 뜻하는지, 학습 단계를 줄인 경량 버전인지도 불분명합니다. 국내 제도·요금·서비스와의 연계 여부도 자료에 없습니다. 내일 공개될 자료가 나오기 전까지는 하드웨어 스펙 추정에 머무를 수밖에 없습니다.

모델 분석 데스크 관점: 지금 쓸 사람 vs 기다릴 사람

본지가 앞서 다룬 퀸 3.5 27B 리뷰에서 "일반 사용자도 24GB VRAM으로 충분히 쓴다"는 결론을 냈습니다. 이번 125B-a6B는 그 대상이 아닙니다. 128GB 이상 통합 메모리 장비를 이미 가진 파워 유저·연구자만 1순위입니다. 나머지 사용자는 27B·32B급 검증 모델을 쓰거나, 클라우드 서비스를 쓰는 게 현실적입니다. 모델 카드와 벤치마크가 공개된 뒤에 판단해도 늦지 않습니다.

이 기사의 출처

이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.

광고 자리 (bottom) — .env 에 NEXT_PUBLIC_ADSENSE_CLIENT / _SLOT_BOTTOM 설정 시 노출