Google DeepMind, 글·이미지·소리·영상을 한 번에 검색하는 폰용 오픈 모델 EmbeddingGemma 2 공개
7억 4천만 파라미터짜리 임베딩 모델 하나로 텍스트·코드·이미지·오디오·영상을 같은 공간에 담아요. Apache 2.0이라 바로 받아 쓸 수 있어요.
- EmbeddingGemma 2는 글·코드·이미지·오디오·영상을 숫자 목록(임베딩, 의미를 담은 벡터)으로 바꿔 한 공간에 모아 주는 모델이에요. 그래서 '글로 영상 장면 찾기' 같은 검색이 가능해져요.
- 전체 740M 파라미터(텍스트 270M + 이미지 170M + 오디오 300M). Pixel 11 Pro에서 양자화(용량 줄이기)한 전체 모델이 약 567MB 메모리로 돌아가고, 텍스트만 쓰면 약 191MB예요.
- Apache 2.0 라이선스로 Hugging Face·Kaggle·Ollama에 공개됐고, 100개 넘는 언어를 이해해요.
사진·영상·음성 메모가 섞인 자료를 서버 없이 기기 안에서 검색하는 기능(RAG, 자료를 찾아 AI 답변에 붙이는 방식 포함)을 만들 때 써 볼 만해요. sentence-transformers, transformers.js, llama.cpp, Ollama에서 바로 불러올 수 있어요.
쌓아 둔 촬영 소스·썸네일·녹음 파일을 '바닷가에서 웃는 장면'처럼 말로 찾는 개인 검색 도구가 곧 이 모델 위에서 나올 가능성이 커요. 지금 직접 쓰려면 간단한 코드가 필요해요.
상품 사진·안내 영상·고객 음성 문의를 한곳에 모아 비슷한 것끼리 묶거나 찾는 사내 검색을, 비싼 서버 없이 노트북에서 시험해 볼 수 있어요.
1) Ollama에서 embeddinggemma-2를 받거나 pip install sentence-transformers
2) SentenceTransformer("google/embeddinggemma-2")로 모델 불러오기
3) 내 이미지·짧은 영상·텍스트 메모를 encode로 임베딩해 저장
4) 검색어는 prompt_name="SearchQuery"로 임베딩해 가장 가까운 파일 찾기
5) 저장 공간이 아까우면 768차원을 256차원으로 잘라 써 보기(원문: 거의 손실 없음)촬영 소스가 수백 개 쌓인 크리에이터라면, 폴더 하나를 골라 '글로 장면 찾기'가 얼마나 맞는지 먼저 시험해 보면 좋을 것 같아요. 영상은 약 58프레임, 오디오는 약 5분 30초까지만 한 번에 넣을 수 있으니 긴 영상은 잘라서 넣어 보는 게 좋을 것 같아요.
Google DeepMind가 10월 6일(현지 시간) EmbeddingGemma 2를 공개했어요. 공식 X에서는 '기기 안에서 돌리는 임베딩용 첫 네이티브 멀티모달 오픈 모델'이라고 소개했어요. Gemma 4를 바탕으로 만들었어요.
무엇이 달라졌나 — 1세대가 텍스트 전용이었다면, 2세대는 텍스트 백본(270M)에 이미지 인코더(170M)와 오디오 인코더(300M)를 선택해서 붙이는 구조예요. 텍스트만 필요하면 작은 부분만 쓰면 돼요. 한 번에 이미지 약 29장, 영상 약 58프레임, 오디오 약 5분 30초까지 넣을 수 있어요(기본 설정 기준).
숫자로 보면 — 결과 벡터는 768차원이고, 마트료시카 방식(MRL, 앞부분만 잘라 써도 뜻이 유지되게 학습)이라 512·256·128차원으로 줄여 쓸 수 있어요. 모델 카드 기준 MTEB 코드 점수 78.68로 1세대보다 9.92점 올랐고, 다국어 MTEB 61.36, 이미지 MIEB 64.64를 기록했어요(Google 발표 수치).
어디서 쓰나 — Hugging Face, Kaggle, Ollama에서 받을 수 있고, transformers.js(WebGPU), MLX, vLLM, llama.cpp, SGLang, LM Studio, MediaPipe, LiteRT, sentence-transformers를 지원해요. 폰용으로 최적화한 버전은 Hugging Face의 LiteRT Community에 올라와 있어요.
X 게시물 보기 · https://x.com/GoogleDeepMind/status/2107502286758895878
