알리바바 퀸, 8단계로 가속한 7B 이미지 모델 '퀸-이미지-2.1-터보' 공개
알리바바 퀸, 추론 단계를 8개로 고정한 경량 이미지 모델 공개
알리바바 클라우드 산하 퀸(Qwen) 팀이 9일(현지 시각) **퀸-이미지-2.1-터보(Qwen-Image-2.1-Turbo)**를 허깅페이스·모델스코프·깃허브에 공개했다. 기존 퀸-이미지-2.1의 가속 체크포인트다. 디노이징 단계(denoising steps)를 8개로 고정하고, CFG(Classifier-Free Guidance, 분류기 자유 유도) 값을 1로 기본 설정해 추론 속도를 끌어올렸다. 모델 크기는 7B(70억) 파라미터로, 텍스트-이미지 생성과 이미지 편집을 모두 지원한다.
바뀐 건 단계 수와 캐싱
허깅페이스 모델 카드에 따르면 터보 버전은 권장 샘플링 스케줄이 체크포인트에 내장돼 있어 스케줄러를 따로 만질 필요가 없다. 여기에 **프리픽스 KV 캐싱(prefix KV caching, 앞부분 키-값 캐시)**을 적용해 텍스트 프롬프트와 참조 이미지 컨텍스트를 단계마다 재계산하지 않고 재사용한다. 그 결과 동일 하드웨어에서 체감 생성 시간이 눈에 띄게 줄어든다.
로컬 실행: 공식 요구사항만 확인됨
공개된 코드는 디퓨저스(Diffusers) 최신 소스 빌드(pip install git+https://github.com/huggingface/diffusers.git)와 트랜스포머스 5.17.0 이상, 액셀러레이트(accelerate)를 요구한다. 엔비디아 CUDA 환경이 기본이며, 애플 실리콘 맥에서는 device_map="mps"로 돌릴 수 있다. 7B 모델을 bfloat16(16비트 부동소수점)로 올리는 데 필요한 VRAM은 자료에 공개되지 않았다. 단순 계산(70억×2바이트=14GB)만으로는 12GB 카드에 가중치조차 올라가지 않으므로, 실제 구동 가능 여부는 커뮤니티 검증을 기다려야 한다. 이 대목이 걸린다. 컴피유아이(ComfyUI) 노드는 Comfy-Org/Qwen-Image-2.1 저장소에서 배포 중이며, 퀸-이미지-2.1 시리즈 공용으로 쓰인다. 터보 전용 노드는 별도로 확인되지 않았다.
라이선스와 상업 이용
라이선스는 qwen-research다. 연구 목적 이용을 전제로 하며, 상용 서비스 임베디드·재배포·파인튜닝 모델 판매 등은 별도 확인이 필요하다. 허깅페이스 모델 카드에 전체 라이선스 전문 링크가 걸려 있다. '무료 오픈소스=상용 자유'가 아님을 꼭 확인하세요.
퀸 3.8 플래시 넥스트와는 별개 라인업
본지가 지난달 다룬 퀸 3.8 플래시 넥스트는 텍스트 LLM(대언어모델) 계열이다. 이번 퀸-이미지-2.1-터보는 이미지 생성 전용 비전 모델로, 아키텍처도 용도도 완전히 다르다. 퀸 팀이 언어·비전 양쪽에서 '경량·고속' 체크포인트를 동시에 밀고 있다는 점만 공통분모다.
쉽게 풀어보면
알리바바가 '그림 그리는 AI' 새 버전을 내놨다. 이름은 퀸-이미지-2.1-터보. 기존 버전은 그림 한 장을 완성하려 수십 번 지우개질(디노이징 단계)을 반복했다. 터보는 딱 8번만 지우개질하고 끝낸다. 덕분에 같은 컴퓨터에서 생성 속도가 훨씬 빨라진다.
모델 크기는 70억 파라미터(파라미터: 모델의 두뇌 용량을 나타내는 수치)다. 텍스트로 그림을 새로 그리기도 하고, 기존 사진을 불러와 "배경을 밤으로 바꿔줘" 같은 편집도 가능하다. 다만 **연구용 라이선스(qwen-research)**다. 이 모델을 그대로 상용 서비스에 붙여 팔려면 별도 허락을 받아야 한다. 깃허브·허깅페이스·모델스코프에서 코드와 가중치를 모두 내려받을 수 있고, 컴피유아이 같은 노코드 툴에서도 바로 쓸 수 있게 노드가 나와 있다.
나에게 미치는 영향
로컬에서 이미지 생성을 해보려는 일반인은 엔비디아 GPU 환경이라면 파이썬 몇 줄로 오늘 바로 테스트 가능하다. pip install 명령 세 줄이면 환경이 잡힌다. VRAM 8GB 이하 사용자는 bitsandbytes 4bit 로드 스크립트가 아직 공식 제공되지 않는다. 커뮤니티 양자화 버전을 기다리거나 클라우드 노트북(Colab·Kaggle)을 쓰는 편이 안전하다.
맥 사용자는 MPS 백엔드 지원으로 M1/M2/M3 맥북에서도 구동된다. 속도는 GPU 대비 느리지만 '돌아간다'는 데 의미가 있다. 컴피유아이·드로우씽스·디퓨전비 유저는 Qwen-Image-2.1 시리즈용 노드·플러그인을 업데이트하면 바로 메뉴에 나타난다.
상용 서비스 기획자는 라이선스가 연구용이므로 수익화하려면 알리바바 쪽과 별도 계약이 필요하다. 기존 퀸-이미지-2.1을 쓰던 개발자는 파이프라인 클래스가 QwenImage21Pipeline로 동일하니, 체크포인트만 Qwen/Qwen-Image-2.1-Turbo로 바꾸면 코드 수정 거의 없이 속도 이득을 본다.
남은 확인 사항
품질 대비 속도 트레이드오프: 8단계로 줄였을 때 디테일·프롬프트 준수율이 어느 정도 떨어지는지는 커뮤니티 벤치마크가 더 쌓여야 알 수 있다. 현재 레딧 r/StableDiffusion 스레드에서 초기 비교 이미지가 올라오고 있으나 샘플 수가 적다.
한국어 프롬프트 이해도: 퀸 계열은 중국어·영어 위주 학습이라 한국어 프롬프트에서 의도한 구도가 안 나올 수 있다. 영문 프롬프트 병행 테스트가 권장된다.
공식 양자화 배포 여부: 4bit/8bit 가중치가 허깅페이스에 올라오면 8GB 이하 환경 진입 장벽이 크게 낮아질 전망이다.
이 기사의 출처
- MarkTechPostAlibaba Qwen Releases Qwen-Image-2.1-Turbo, an 8-Step 7B Image Model
- r/LocalLLaMAQwen/Qwen-Image-2.1-Turbo · Hugging Face
- r/LocalLLaMAQwen-Image-2.1-Turbo released!
- r/StableDiffusionQwen Image 2.1 Turbo Released -- Hugging Face
- r/StableDiffusionHunyuan Image 3 vs Qwen Image 2.1 vs Krea 2 Turbo
- r/StableDiffusionQwen-Image-2.1-Turbo just officially published
- r/StableDiffusionComfy-Org/Qwen-Image-2.1 · Hugging Face
이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.