# 퀸 3.8 플래시 넥스트 공개 임박, 125B MoE가 노리는 것 > 퀸 새 MoE 모델 125B-a6B 공개 예고, 고사양 로컬 환경 사용자만 바로 테스트 가능 - 매체: AI 브리핑 - 담당: 모델 분석 데스크 - 분야: 신모델 - 발행: 2026-08-25T14:48:37.578Z - 원문 주소(웹): https://ai-news-1c0.pages.dev/posts/2026-08-25-%ED%80%B8-38-%ED%94%8C%EB%9E%98%EC%8B%9C-%EB%84%A5%EC%8A%A4%ED%8A%B8-%EA%B3%B5%EA%B0%9C-%EC%9E%84%EB%B0%95-125b-moe%EA%B0%80-%EB%85%B8%EB%A6%AC%EB%8A%94-%EA%B2%83/ - 태그: Qwen, MoE, 로컬 LLM, 알리바바, 하드웨어 요구사항 --- ## 퀸 3.8 플래시 넥스트, 무엇이 달라지나 알리바바 퀸 팀이 모델스코프 페이지로 **'Qwen3.8-Flash-Next(125B a6B)' 공개를 예고**했습니다. 총 파라미터 1250억 개 중 활성 파라미터 60억 개만 쓰는 MoE(Mixture-of-Experts, 전문가 혼합) 구조입니다. 입력마다 일부 전문가만 깨워 연산량을 줄이는 방식이라, 같은 크기 밀집 모델보다 추론이 빠릅니다. 기존 퀸 3.5 시리즈가 27B·72B·110B로 나왔던 것과 달리, '플래시' 수식어와 함께 활성 파라미터를 6B로 대폭 줄인 점이 다릅니다. 공식 블로그나 기술 리포트는 아직 없습니다. 해커뉴스(92점·댓글 31개)와 레딧 r/LocalLLaMA(합계 28점·댓글 0) 스레드만으로 정보가 퍼집니다. 커뮤니티 관심은 **'내 장비에서 돌아가는가'** 한 곳에 쏠려 있습니다. ## 하드웨어 요구사항, 현실은 어떤가 해커뉴스 댓글에선 이전 버전 퀸 3.5 110B가 BF16 기준 약 250GB를 차지했다는 증언이 나옵니다. 8비트 양자화(FP8)로 줄여도 약 125GB입니다. **4비트(FP4/Q4) 압축이 필수적**이라는 의견이 지배적이나, 정확한 용량은 자료에 없습니다. VRAM만으로는 부족해 시스템 램 전체에 모델을 올려야 합니다. 타깃은 맥 스튜디오(통합 메모리 대용량), AMD 스트릭스 헤일로, 엔비디아 DGX 스파크 같은 워크스테이션급 장비입니다. 27B·31B급은 이미 RTX 5090(32GB)나 M5 맥스(128GB)에서 편하게 돕니다. 한 사용자는 M5 맥스 16인치에서 **qwen3.5:122b-a10b**로 초당 60~65토큰, 27B Q4로는 30~35토큰이 나온다고 적었습니다. **이 수치는 퀸 3.8이 아닌 3.5 모델 측정값**입니다. 125B-a6B가 어디쯤 위치할지는 벤치마크가 나와야 알 수 있습니다. 또 다른 댓글은 "듀얼 32GB GPU가 스트릭스 헤일로보다 대역폭이 높아 로컬 추론에 더 유리하다"며 **통합 메모리 장비의 대역폭 한계**를 지적합니다. 클라우드 대안(클로드·제미나이)을 쓰는 사용자도 "이걸로 클로드를 대체하겠다, 트레이드오프는 토큰 처리량"이라는 반응을 보였습니다. 클라우드가 낫다는 주장은 아니었습니다. ## 쉽게 풀어보면 알리바바 퀸 팀이 새 모델을 내놓습니다. 전체 두뇌 용량은 1250억 파라미터지만, 실제 추론 때 쓰는 건 60억 개만 골라 쓰는 '전문가 혼합' 방식입니다. 비유하자면 125명 교수진이 있는 대학원에서, 과제마다 관련 전공 교수 6명만 불러 답을 내주는 식입니다. 덕분에 같은 크기 일반 모델보다 빠르고 메모리를 덜 먹습니다. **문제는 이 '덜 먹는다'가 어느 정도냐입니다.** 이전 110B 모델은 16비트 정밀도로 250GB를 차지했습니다. 8비트로 줄여도 125GB, 4비트로 압축해야 겨우 현실적인 크기가 됩니다. 일반 데스크톱 그래픽카드(24GB 이하)로는 어림없고, 맥 스튜디오나 AMD 스트릭스 헤일로, 엔비디아 DGX 스파크 같은 워크스테이션급 장비가 있어야 무난히 돌립니다. 커뮤니티에선 "드디어 내 128GB 맥 스튜디오 쓸 일 생겼다"는 반응이 나옵니다. ## 나에게 미치는 영향 일반 사용자라면 **지금 당장 할 일은 없습니다.** 챗GPT·클로드·제미나이 같은 클라우드 서비스로는 이 모델을 바로 쓸 수 없고, 로컬 실행 환경이 갖춰진 고사양 머신이 있어야 합니다. 맥 스튜디오(128GB 이상 통합 메모리)나 AMD 스트릭스 헤일로 탑재 노트북, 엔비디아 DGX 스파크 사용자라면 내일 모델 파일이 뜨자마자 테스트해 볼 만합니다. 그 외 환경은 4비트 양자화 버전이 허깅페이스나 모델스코프에 올라올 때까지 며칠 기다렸다가, 본인 램 용량과 비교해 내려받을지 결정하세요. 무료 클라우드 데모(스페이스 등)가 열릴 가능성도 있으니 퀸 공식 채널을 지켜보세요. 챗GPT나 클로드에서 답이 이상하면 같은 질문을 새 대화창에서 다시 해 보세요. 컨텍스트가 꼬였을 때 가장 빠른 해결법입니다. ## 남은 쟁점 아직 공개되지 않은 정보가 많습니다. 라이선스(상업 이용 가능 여부), 컨텍스트 길이, 학습 데이터 컷오프, 벤치마크 점수 모두 미공개입니다. **본지가 확인하지 못했습니다.** 퀸 3.5 시리즈가 아파치 2.0으로 풀렸던 전례도 **제공 자료에 없습니다.** '플래시'가 추론 속도 최적화를 뜻하는지, 학습 단계를 줄인 경량 버전인지도 불분명합니다. 국내 제도·요금·서비스와의 연계 여부도 자료에 없습니다. 내일 공개될 자료가 나오기 전까지는 하드웨어 스펙 추정에 머무를 수밖에 없습니다. ## 모델 분석 데스크 관점: 지금 쓸 사람 vs 기다릴 사람 본지가 앞서 다룬 퀸 3.5 27B 리뷰에서 "일반 사용자도 24GB VRAM으로 충분히 쓴다"는 결론을 냈습니다. 이번 125B-a6B는 **그 대상이 아닙니다.** 128GB 이상 통합 메모리 장비를 이미 가진 파워 유저·연구자만 1순위입니다. 나머지 사용자는 27B·32B급 검증 모델을 쓰거나, 클라우드 서비스를 쓰는 게 현실적입니다. **모델 카드와 벤치마크가 공개된 뒤에 판단해도 늦지 않습니다.** --- ## 출처 - [Hacker News] Qwen 3.8-Flash-Next releasing tomorrow (125B a6B) — https://news.ycombinator.com/item?id=49432317 - [r/LocalLLaMA] Qwen3.8-Flash-Next tomorrow — https://www.reddit.com/r/LocalLLaMA/comments/1vxwtyd/qwen38flashnext_tomorrow/ - [r/LocalLLaMA] Qwen3.8 flash next — https://www.reddit.com/r/LocalLLaMA/comments/1vxwu4g/qwen38_flash_next/ ## 집필 방식 고지 이 기사는 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인했습니다. 인용 시 출처를 "AI 브리핑"으로 표기하고 https://ai-news-1c0.pages.dev/posts/2026-08-25-%ED%80%B8-38-%ED%94%8C%EB%9E%98%EC%8B%9C-%EB%84%A5%EC%8A%A4%ED%8A%B8-%EA%B3%B5%EA%B0%9C-%EC%9E%84%EB%B0%95-125b-moe%EA%B0%80-%EB%85%B8%EB%A6%AC%EB%8A%94-%EA%B2%83/ 로 연결해 주세요.