신모델·

알레프 알파 '콜리브리' 공개… 독일 주권형 78B MoE 모델

한 줄 요약독일산 주권형 LLM 콜리브리, 78B 몸집에 3.5B만 깨워 쓴다
광고

독일 알레프 알파(Aleph Alpha)가 10월 3일 대형 언어 모델 '콜리브리(Kolibri)'를 공개했습니다. 781억 개 파라미터(모델의 두뇌 용량에 해당하는 수치) 규모지만, 실제 추론 때는 34.6억 개만 활성화되는 Mixture of Experts(전문가 혼합, MoE) 구조입니다. 아파치 2.0 라이선스로 가중치가 허깅페이스에 올라와 있습니다.

독일어에 맞춘 토크나이저가 핵심이다

콜리브리의 가장 큰 특징은 토크나이저(문장을 쪼이는 사전)입니다. 독일어는 단어를 붙여 긴 합성어를 만듭니다. '연방헌법재판소(Bundesverfassungsgericht)' 같은 단어를 GPT 계열 토크나이저는 6조각으로 쪼갭니다. 콜리브리는 전용 알고리즘 'UniBPE'로 2조각만 만듭니다. 12만 8천 개 어휘로 독일어 문장을 더 짧게, 더 정확히 읽습니다. 이는 연산량과 문맥 이해 모두에 유리합니다.

'주권형'의 두 가지 의미

알레프 알파가 내세우는 '주권형'은 두 축입니다. 첫째, 개발·학습 인프라가 독일·핀란드에 있고 유럽·독일 법 아래 있습니다. 둘째, 고객은 모델을 자기 서버에 돌리고 데이터를 밖으로 안 보냅니다. 아무도 아래에서 모델을 끄거나 바꿀 수 없습니다. 알레프 알파는 EU의 범용 AI 행동 강령(GPAI Code of Practice)에도 서명했습니다.

광고

메모리 역설: 3.5B 연산인데 78B 메모리 필요하다

여기서 제약이 생깁니다. MoE는 연산만 줄입니다. 384개 전문가 중 6개만 쓰지만, 전체 781억 파라미터를 메모리에 올려야 합니다. 모델 카드에 "비활성 파라미터도 메모리에 상주해야 한다"고 명시돼 있습니다. 실질적으로 3.5B 모델처럼 빠르게 돌리려면 78B 모델이 들어갈 GPU 메모리가 필요합니다. 이 점은 퀸 3.8 플래시 넥스트(125B 몸집, 6B 활성) 때도 본지가 지적한 바 있습니다.

퀸·딥시크와 다른 점: '유럽 법 준수'가 설계 단계부터

본지가 39일 전 다룬 퀸 3.8 플래시 넥스트는 중국 알리바바 모델이고, 16일 전 다룬 딥시크 V4.1 플래시도 중국산입니다. 둘 다 MoE로 활성 파라미터를 줄였지만, 학습 데이터 출처나 법적 준수 여부는 공개하지 않았습니다. 콜리브리는 EU AI Act를 '바닥부터' 염두에 두고 만들었다는 점이 다릅니다. 학습 데이터도 구글 젬마 4, 미스트랄 네모, 퀸3-32B로 재작성·필터링했고 정치적 편향도 걸러냈습니다.

학습 데이터 출처를 솔직히 밝혔다

모델 카드에 "영어 웹 텍스트는 젬마 4로, 독일어는 미스트랄 네모로 바꿔 썼다"고 적혀 있습니다. 외부 모델 출력을 쓴 사실을 숨기지 않았습니다. 대신 그 과정에서 생길 수 있는 편향을 자체 측정해 걸렀다고 설명합니다. 이 투명성은 벤치마크 점수보다 실무 신뢰도에 더 중요할 수 있습니다.

쉽게 풀어보면

알레프 알파가 독일어를 잘하는 대형 언어 모델 콜리브리를 내놨습니다. 이 모델의 전체 크기는 781억 개 파라미터지만, 실제 일을 할 때는 34.6억 개만 깨워 씁니다. 병원 전체 의사가 384명인데, 환자 하나당 6명 전문의만 진료 보는 식입니다. 덕분에 연산은 가벼운데, 독일어 합성어(예: 연방헌법재판소)를 한두 조각으로 읽어내 정확도가 높습니다.

'주권형'이라는 말은 두 가지 뜻입니다. 첫째, 독일·핀란드 서버에서 유럽 법 따라 만들었고 외국 통제가 없습니다. 둘째, 기업이나 정부가 자기 서버에 깔아 쓰면 데이터가 밖으로 안 나가고, 아무도 모델을 강제로 끌 수 없습니다.

단, 메모리는 781억짜리 전체를 올려야 합니다. 활성 파라미터만 작은 거지, 모델 파일 전체가 GPU 메모리에 들어갈 공간은 필요합니다. 집이 작아도 가구는 다 들여놔야 하는 셈입니다.

학습 데이터도 솔직히 밝혔습니다. 구글·미스트랄·퀸 같은 외부 모델로 텍스트를 다듬었고, 거기서 온 정치적 편향도 걸러냈습니다. EU AI 행동 강령에도 서명했습니다. 알레프 알파 내부 평가로는 동급 크기 모델 중 독일어·영어 모두 1등입니다.

나에게 미치는 영향

일반 사용자가 오늘 당장 쓸 일은 적습니다. 하지만 독일 기업이나 공공기관이 '데이터 안 나가게 AI 쓰기'를 고민한다면 후보 1순위가 됩니다. 챗GPT·클로드·제미나이 같은 클라우드 서비스로는 못 쓰는 민감 데이터(의료, 국방, 금융)를 온프레미스(자체 서버)에서 돌릴 때 고려해 볼 만합니다.

개발자라면 허깅페이스에서 가중치를 내려받아 테스트해 볼 수 있습니다. 단, 78B 모델이 들어갈 GPU(예: H100 80GB × 2장 이상)가 있어야 합니다. 3.5B만 쓴다고 해서 소형 GPU로 돌릴 수 있는 건 아닙니다.

한국 기업 입장에서는 '한국어 특화 MoE'가 나올 때 참고 사례로 볼 만합니다. 콜리브리가 독일어 토크나이저를 따로 만든 것처럼, 한국어 합성어·조사 체계를 반영한 토크나이저 설계가 성능을 가릅니다.

남은 쟁점

  • 독립 벤치마크가 없습니다. 알레프 알파 자체 평가만 공개돼 있습니다. 외부 검증 전까지 성능 주장은 참고만 하세요.
  • 한국어 성능은 미지수입니다. 학습 데이터에 한국어가 포함됐는지 자료에 없습니다.
  • 팀 역량 검증 필요. 해커뉴스 댓글에 훈련팀원이 "팀 결성 1년 미만, 반복 속도 중시"라고 썼습니다. 신생 팀의 첫 릴리스라는 점은 리스크이자 가능성입니다.
  • 업데이트 주기. 팀원이 "더 나올 것"이라고 했습니다. 지금 버전을 고정해 쓰기보다 릴리스 주기를 지켜보는 편이 안전합니다.

이 기사의 출처

이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.

광고