# 구글, 7억 파라미터 온디바이스 멀티모달 임베딩 모델 공개 > 구글, 온디바이스 멀티모달 임베딩 모델 '임베딩젬마 2' 오픈소스 공개 - 매체: AI 브리핑 - 담당: 모델 분석 데스크 - 분야: 신모델 - 발행: 2026-10-07T03:04:47.479Z - 원문 주소(웹): https://ai-news-1c0.pages.dev/posts/2026-10-07-%EA%B5%AC%EA%B8%80-7%EC%96%B5-%ED%8C%8C%EB%9D%BC%EB%AF%B8%ED%84%B0-%EC%98%A8%EB%94%94%EB%B0%94%EC%9D%B4%EC%8A%A4-%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC-%EC%9E%84%EB%B2%A0%EB%94%A9-%EB%AA%A8%EB%8D%B8-%EA%B3%B5%EA%B0%9C/ - 태그: 구글, 임베딩젬마, 온디바이스 AI, 멀티모달 임베딩, 오픈소스, RAG --- ## 구글이 7억 파라미터 멀티모달 임베딩 모델을 풀었다 구글이 10월 6일 **임베딩젬마 2**를 아파치 2.0 라이선스로 공개했다. 7억 4천만 파라미터(모델의 두뇌 용량) 크기다. 텍스트·코드·이미지·오디오·비디오를 **하나의 임베딩 공간**에 매핑한다. 임베딩이란 데이터 의미를 숫자 벡터로 바꿔 비슷한 것끼리 가깝게 놓는 기술이다. 이전 버전은 텍스트 전용이었고 2천만 회 넘게 다운로드됐다. 이번엔 젬마 4 아키텍처 기반으로 멀티모달을 품었다. 온디바이스(기기 내부) 추론에 최적화됐다. 데이터가 클라우드로 나가지 않는다. ## 코드 검색 9.92점 뛰었다 — 단, 자체 평가다 구글 발표 기준 MTEB 코드 벤치마크에서 **68.76점에서 78.68점으로 9.92점 상승**했다. 다국어 텍스트 성능은 유지하면서 코드 이해력만 끌어올렸다. 로컬 코드베이스 인덱싱, 시맨틱 코드 검색, 코딩 에이전트 검색에 적합하다고 한다. 이미지·비디오·문서·오디오에서도 **10억 파라미터 미만 모델 중 품질-파라미터 비율 신기록**을 썼다고 주장한다. 일부 전문 모델(2배 이상 크기)보다 낫다는 설명이다. **이 수치는 구글 자체 평가 카드 기준**이다. 독립 서드파티 벤치마크는 아직 없다. 이 대목이 걸린다. ## 젬마 4와 짝지어 온디바이스 RAG 완성 임베딩젬마 2는 젬마 4와 **토크나이저(텍스트 분해기)와 오디오 인코더를 공유**한다. 두 모델을 함께 메모리에 올려도 합산 부담이 줄어든다. 임베딩젬마 2로 로컬 파일을 검색·추출하고, 젬마 4로 추론·생성하는 파이프라인이 기기 안에서 끝난다. 구글은 세 가지 데모 앱을 **구글 AI 엣지 갤러리**에 올렸다. 인스턴트 미디어 검색(텍스트·이미지로 미디어 라이브러리 검색), 비디오 모먼트 파인더(텍스트·오디오로 비디오 구간 찾기), 포어사이트 앱(파일 검색+문맥 추론 결합)이다. 개발자는 미디어파이프 디시전 태스크 API, 라이트알티(LiteRT) 가이드로 바로 붙여볼 수 있다. 허깅페이스, ONNX 런타임, 미디어파이프 등과 협력해 추론·파인튜닝 가이드도 동시에 냈다. 모델 카드와 개발자 문서에서 지표와 사용법을 확인 가능하다. ## 해커뉴스 반응: "청킹이 관건", "바이너리 양자화 되나" 해커뉴스 댓글(232점, 30개)에서 실무 우려가 쏟아졌다. - **청킹(문서 분할) 최적화**가 여전히 어렵다는 지적. "어디서 최적으로 자를지 알기 힘들다" - **바이너리 양자화(임베딩을 0/1로 압축) 호환성** 질문. MRL 대신 바이너리 양자화를 쓰려는 시도가 있는데, 임베딩젬마 2에서도 되는지 미확인. - **실측 성능 공유**: M3 프로에서 텍스트 78임베딩/초, 이미지 4임베딩/초, 오디오 6임베딩/초(30초 청크), 비디오 0.2임베딩/초(분당) 수준. 반응을 보면 **벤치마크 점수보다 실제 파이프라인 통합 난이도**가 현장 관심사다. 발표문에 없는 조건이다. ## 쉽게 풀어보면 구글이 **스마트폰이나 노트북 안에서 돌릴 수 있는 '만능 검색 엔진 부품'**을 무료로 공개했다. 이 부품(임베딩젬마 2)은 글·코드·사진·소리·영상을 모두 **'의미 지도' 위 같은 좌표계**에 올려놓는다. 예를 들어 "지난주 회의에서 김 대리가 예산 얘기한 부분 찾아줘"라고 말하면, 음성 메모 전체를 듣지 않고 해당 구간만 골라낸다. 내 코드베이스에서 "로그인 에러 처리하는 함수"를 자연어로 검색해 해당 파일을 꺼낼 수도 있다. 이 모든 게 인터넷 없이, 내 기기 안에서만 돌아간다. 기존 버전은 글만 다뤘는데, 이번에는 **코드 검색 능력이 10점 가까이 뛰었다**. 개발자라면 로컬 IDE 플러그인이나 코드 검색 도구에 바로 붙여볼 만하다. 일반 사용자라면 구글 플레이에서 **'Google AI Edge Gallery'**를 검색해 세 가지 앱(미디어 검색, 비디오 구간 찾기, 포어사이트)을 설치해 **오늘 당장 체험**해볼 수 있다. 비행기 모드에서 켜보면 온디바이스 처리가 확인된다. ## 나에게 미치는 영향 **개발자·연구자라면** 허깅페이스에서 모델 가중치를 내려받아 ONNX 런타임이나 미디어파이프로 변환한 뒤 로컬 RAG 파이프라인에 임베더로 꽂아 테스트하면 된다. 코드 검색 품질이 필요한 사이드 프로젝트(로컬 코드베이스 Q&A, 레거시 코드 탐색)에 **당장 도입 검토**해볼 만하다. 바이너리 양자화 호환성은 아직 미확인이다. 임베딩 저장소 크기를 줄이려면 **공식 가이드 업데이트를 기다리거나 직접 실험**해야 한다. **일반 스마트폰 사용자라면** 구글 플레이에서 **'Google AI Edge Gallery'**를 깔고 인스턴트 미디어 검색·비디오 모먼트 파인더·포어사이트를 실행해보자. 내 사진·영상·녹음 파일을 클라우드 올리지 않고 **자연어로 검색**해보는 체험이 가능하다. 오프라인에서도 작동한다. **기업·제품 담당자라면** 아파치 2.0 라이선스라 **상용 서비스 임베딩 레이어로 무료 탑재 가능**하다. 클라우드 임베딩 API 요금(토큰당 과금) 절감 효과가 클 것으로 보인다. 단, **배포 기기 메모리·지연시간 프로파일링**은 선행 필수다. 젬마 4(생성 모델)와 번들로 패키징하면 **완전 온디바이스 RAG 제품** 구성이 가능하다. 경쟁사 대비 '프라이버시 퍼스트' 마케팅 포인트 확보가 된다. ## 남은 쟁점: 독립 벤치마크와 양자화 호환성 구글 발표만으로는 확인 안 되는 것들. - **서드파티 MTEB·BEIR 등 공개 벤치마크 재현 결과** — 아직 없다. - **바이너리 양자화·MRL 등 압축 기법 적용 시 성능 저하 폭** — 해커뉴스 질문 미해결. - **한국어 코드·문서 검색 품질** — 다국어 텍스트 성능 유지라고만 밝혔다. 한국어 별도 지표 미공개. - **실제 배포 시 메모리 점유량·초기 로딩 지연** — 기기별 프로파일 미공개. 이 지표들이 나와야 '실전 투입 여부' 판단이 선다. 그때까지는 **소규모 파일셋으로 파일럿 테스트**부터 해보는 게 안전하다. 본지가 확인하지 못한 부분이다. --- ## 출처 - [Hacker News] EmbeddingGemma 2: An open, lightweight multimodal embedding model — https://news.ycombinator.com/item?id=49980487 - [Google DeepMind] EmbeddingGemma 2: an open, lightweight multimodal embedding model — https://deepmind.google/blog/embeddinggemma-2-an-open-lightweight-multimodal-embedding-model - [MarkTechPost] Google DeepMind Releases EmbeddingGemma 2, a 740M Open Multimodal Embedding Model Built on Gemma 4 — https://marktechpost.com/2026/10/06/google-deepmind-releases-embeddinggemma-2-a-740m-open-multimodal-embedding-model-built-on-gemma-4 - [r/LocalLLaMA] Introducing EmbeddingGemma 2: A best-in-class open model for natively multimodal embeddings | Google — https://www.reddit.com/r/LocalLLaMA/comments/1wz7faa/introducing_embeddinggemma_2_a_bestinclass_open/ - [r/LocalLLaMA] EmbeddingGemma 2 is a best-in-class open model for natively multimodal embeddings — https://www.reddit.com/r/LocalLLaMA/comments/1wz9jvx/embeddinggemma_2_is_a_bestinclass_open_model_for/ - [r/singularity] Introducing EmbeddingGemma 2: An open model for natively multimodal embeddings — https://www.reddit.com/r/singularity/comments/1wzafmg/introducing_embeddinggemma_2_an_open_model_for/ ## 집필 방식 고지 이 기사는 위 원문과 커뮤니티 반응을 바탕으로 AI의 도움을 받아 작성했으며, 발행 전 사람이 확인했습니다. 인용 시 출처를 "AI 브리핑"으로 표기하고 https://ai-news-1c0.pages.dev/posts/2026-10-07-%EA%B5%AC%EA%B8%80-7%EC%96%B5-%ED%8C%8C%EB%9D%BC%EB%AF%B8%ED%84%B0-%EC%98%A8%EB%94%94%EB%B0%94%EC%9D%B4%EC%8A%A4-%EB%A9%80%ED%8B%B0%EB%AA%A8%EB%8B%AC-%EC%9E%84%EB%B2%A0%EB%94%A9-%EB%AA%A8%EB%8D%B8-%EA%B3%B5%EA%B0%9C/ 로 연결해 주세요.