구글, 7억 파라미터 온디바이스 멀티모달 임베딩 모델 공개
구글이 7억 파라미터 멀티모달 임베딩 모델을 풀었다
구글이 10월 6일 임베딩젬마 2를 아파치 2.0 라이선스로 공개했다. 7억 4천만 파라미터(모델의 두뇌 용량) 크기다. 텍스트·코드·이미지·오디오·비디오를 하나의 임베딩 공간에 매핑한다. 임베딩이란 데이터 의미를 숫자 벡터로 바꿔 비슷한 것끼리 가깝게 놓는 기술이다.
이전 버전은 텍스트 전용이었고 2천만 회 넘게 다운로드됐다. 이번엔 젬마 4 아키텍처 기반으로 멀티모달을 품었다. 온디바이스(기기 내부) 추론에 최적화됐다. 데이터가 클라우드로 나가지 않는다.
코드 검색 9.92점 뛰었다 — 단, 자체 평가다
구글 발표 기준 MTEB 코드 벤치마크에서 68.76점에서 78.68점으로 9.92점 상승했다. 다국어 텍스트 성능은 유지하면서 코드 이해력만 끌어올렸다. 로컬 코드베이스 인덱싱, 시맨틱 코드 검색, 코딩 에이전트 검색에 적합하다고 한다.
이미지·비디오·문서·오디오에서도 10억 파라미터 미만 모델 중 품질-파라미터 비율 신기록을 썼다고 주장한다. 일부 전문 모델(2배 이상 크기)보다 낫다는 설명이다. 이 수치는 구글 자체 평가 카드 기준이다. 독립 서드파티 벤치마크는 아직 없다. 이 대목이 걸린다.
젬마 4와 짝지어 온디바이스 RAG 완성
임베딩젬마 2는 젬마 4와 토크나이저(텍스트 분해기)와 오디오 인코더를 공유한다. 두 모델을 함께 메모리에 올려도 합산 부담이 줄어든다. 임베딩젬마 2로 로컬 파일을 검색·추출하고, 젬마 4로 추론·생성하는 파이프라인이 기기 안에서 끝난다.
구글은 세 가지 데모 앱을 구글 AI 엣지 갤러리에 올렸다. 인스턴트 미디어 검색(텍스트·이미지로 미디어 라이브러리 검색), 비디오 모먼트 파인더(텍스트·오디오로 비디오 구간 찾기), 포어사이트 앱(파일 검색+문맥 추론 결합)이다. 개발자는 미디어파이프 디시전 태스크 API, 라이트알티(LiteRT) 가이드로 바로 붙여볼 수 있다.
허깅페이스, ONNX 런타임, 미디어파이프 등과 협력해 추론·파인튜닝 가이드도 동시에 냈다. 모델 카드와 개발자 문서에서 지표와 사용법을 확인 가능하다.
해커뉴스 반응: "청킹이 관건", "바이너리 양자화 되나"
해커뉴스 댓글(232점, 30개)에서 실무 우려가 쏟아졌다.
- 청킹(문서 분할) 최적화가 여전히 어렵다는 지적. "어디서 최적으로 자를지 알기 힘들다"
- 바이너리 양자화(임베딩을 0/1로 압축) 호환성 질문. MRL 대신 바이너리 양자화를 쓰려는 시도가 있는데, 임베딩젬마 2에서도 되는지 미확인.
- 실측 성능 공유: M3 프로에서 텍스트 78임베딩/초, 이미지 4임베딩/초, 오디오 6임베딩/초(30초 청크), 비디오 0.2임베딩/초(분당) 수준.
반응을 보면 벤치마크 점수보다 실제 파이프라인 통합 난이도가 현장 관심사다. 발표문에 없는 조건이다.
쉽게 풀어보면
구글이 **스마트폰이나 노트북 안에서 돌릴 수 있는 '만능 검색 엔진 부품'**을 무료로 공개했다. 이 부품(임베딩젬마 2)은 글·코드·사진·소리·영상을 모두 '의미 지도' 위 같은 좌표계에 올려놓는다.
예를 들어 "지난주 회의에서 김 대리가 예산 얘기한 부분 찾아줘"라고 말하면, 음성 메모 전체를 듣지 않고 해당 구간만 골라낸다. 내 코드베이스에서 "로그인 에러 처리하는 함수"를 자연어로 검색해 해당 파일을 꺼낼 수도 있다. 이 모든 게 인터넷 없이, 내 기기 안에서만 돌아간다.
기존 버전은 글만 다뤘는데, 이번에는 코드 검색 능력이 10점 가까이 뛰었다. 개발자라면 로컬 IDE 플러그인이나 코드 검색 도구에 바로 붙여볼 만하다. 일반 사용자라면 구글 플레이에서 **'Google AI Edge Gallery'**를 검색해 세 가지 앱(미디어 검색, 비디오 구간 찾기, 포어사이트)을 설치해 오늘 당장 체험해볼 수 있다. 비행기 모드에서 켜보면 온디바이스 처리가 확인된다.
나에게 미치는 영향
개발자·연구자라면 허깅페이스에서 모델 가중치를 내려받아 ONNX 런타임이나 미디어파이프로 변환한 뒤 로컬 RAG 파이프라인에 임베더로 꽂아 테스트하면 된다. 코드 검색 품질이 필요한 사이드 프로젝트(로컬 코드베이스 Q&A, 레거시 코드 탐색)에 당장 도입 검토해볼 만하다. 바이너리 양자화 호환성은 아직 미확인이다. 임베딩 저장소 크기를 줄이려면 공식 가이드 업데이트를 기다리거나 직접 실험해야 한다.
일반 스마트폰 사용자라면 구글 플레이에서 **'Google AI Edge Gallery'**를 깔고 인스턴트 미디어 검색·비디오 모먼트 파인더·포어사이트를 실행해보자. 내 사진·영상·녹음 파일을 클라우드 올리지 않고 자연어로 검색해보는 체험이 가능하다. 오프라인에서도 작동한다.
기업·제품 담당자라면 아파치 2.0 라이선스라 상용 서비스 임베딩 레이어로 무료 탑재 가능하다. 클라우드 임베딩 API 요금(토큰당 과금) 절감 효과가 클 것으로 보인다. 단, 배포 기기 메모리·지연시간 프로파일링은 선행 필수다. 젬마 4(생성 모델)와 번들로 패키징하면 완전 온디바이스 RAG 제품 구성이 가능하다. 경쟁사 대비 '프라이버시 퍼스트' 마케팅 포인트 확보가 된다.
남은 쟁점: 독립 벤치마크와 양자화 호환성
구글 발표만으로는 확인 안 되는 것들.
- 서드파티 MTEB·BEIR 등 공개 벤치마크 재현 결과 — 아직 없다.
- 바이너리 양자화·MRL 등 압축 기법 적용 시 성능 저하 폭 — 해커뉴스 질문 미해결.
- 한국어 코드·문서 검색 품질 — 다국어 텍스트 성능 유지라고만 밝혔다. 한국어 별도 지표 미공개.
- 실제 배포 시 메모리 점유량·초기 로딩 지연 — 기기별 프로파일 미공개.
이 지표들이 나와야 '실전 투입 여부' 판단이 선다. 그때까지는 소규모 파일셋으로 파일럿 테스트부터 해보는 게 안전하다. 본지가 확인하지 못한 부분이다.
이 기사의 출처
- Hacker NewsEmbeddingGemma 2: An open, lightweight multimodal embedding model
- Google DeepMindEmbeddingGemma 2: an open, lightweight multimodal embedding model
- MarkTechPostGoogle DeepMind Releases EmbeddingGemma 2, a 740M Open Multimodal Embedding Model Built on Gemma 4
- r/LocalLLaMAIntroducing EmbeddingGemma 2: A best-in-class open model for natively multimodal embeddings | Google
- r/LocalLLaMAEmbeddingGemma 2 is a best-in-class open model for natively multimodal embeddings
- r/singularityIntroducing EmbeddingGemma 2: An open model for natively multimodal embeddings
이 글은 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인합니다. 사실관계는 원문 링크에서 직접 확인하실 수 있습니다.