LIVE · 2026 OCT 07 KST⟟ RSS 구독FEED 049 SIGNALS
AI 소식 · 어렵지 않게 · 실시간
📰 소식 목록 전체 49건 · 최신순
  1. 2026 OCT 07 03:33API · 요금 등급참고만OpenAI API 유료 등급 5개→3개… 최고 등급 문턱 $1,000→$500
  2. 2026 OCT 07 02:47검색 API · 장소 데이터참고만Exa 검색 API에 장소 2억 1,100만 곳… 영업시간·전화번호까지 한 번에
  3. 2026 OCT 07 02:40업무 도구 · 문서써 보세요Claude, 이제 구글 문서·시트·슬라이드 안에서 바로 읽고 고쳐요
  4. 2026 OCT 07 02:20AI 안전 · 보안참고만AI가 남긴 작업 기록, 화면만 믿어도 될까… METR, '기록 숨기기' 빈틈을 직접 시연
  5. 2026 OCT 07 02:10오픈 모델 · 검색지켜보기Google DeepMind, 글·이미지·소리·영상을 한 번에 검색하는 폰용 오픈 모델 EmbeddingGemma 2 공개
오픈 모델 · 검색

Google DeepMind, 글·이미지·소리·영상을 한 번에 검색하는 폰용 오픈 모델 EmbeddingGemma 2 공개

7억 4천만 파라미터짜리 임베딩 모델 하나로 텍스트·코드·이미지·오디오·영상을 같은 공간에 담아요. Apache 2.0이라 바로 받아 쓸 수 있어요.

핵심 3줄
  • EmbeddingGemma 2는 글·코드·이미지·오디오·영상을 숫자 목록(임베딩, 의미를 담은 벡터)으로 바꿔 한 공간에 모아 주는 모델이에요. 그래서 '글로 영상 장면 찾기' 같은 검색이 가능해져요.
  • 전체 740M 파라미터(텍스트 270M + 이미지 170M + 오디오 300M). Pixel 11 Pro에서 양자화(용량 줄이기)한 전체 모델이 약 567MB 메모리로 돌아가고, 텍스트만 쓰면 약 191MB예요.
  • Apache 2.0 라이선스로 Hugging Face·Kaggle·Ollama에 공개됐고, 100개 넘는 언어를 이해해요.
🧪 CONTENTSLAB 평지켜보세요★★★★★실전 활용도 3/5
개발자

사진·영상·음성 메모가 섞인 자료를 서버 없이 기기 안에서 검색하는 기능(RAG, 자료를 찾아 AI 답변에 붙이는 방식 포함)을 만들 때 써 볼 만해요. sentence-transformers, transformers.js, llama.cpp, Ollama에서 바로 불러올 수 있어요.

AI 크리에이터·마케터

쌓아 둔 촬영 소스·썸네일·녹음 파일을 '바닷가에서 웃는 장면'처럼 말로 찾는 개인 검색 도구가 곧 이 모델 위에서 나올 가능성이 커요. 지금 직접 쓰려면 간단한 코드가 필요해요.

1인 사업자·기획자

상품 사진·안내 영상·고객 음성 문의를 한곳에 모아 비슷한 것끼리 묶거나 찾는 사내 검색을, 비싼 서버 없이 노트북에서 시험해 볼 수 있어요.

$ 바로 해 보기
1) Ollama에서 embeddinggemma-2를 받거나 pip install sentence-transformers
2) SentenceTransformer("google/embeddinggemma-2")로 모델 불러오기
3) 내 이미지·짧은 영상·텍스트 메모를 encode로 임베딩해 저장
4) 검색어는 prompt_name="SearchQuery"로 임베딩해 가장 가까운 파일 찾기
5) 저장 공간이 아까우면 768차원을 256차원으로 잘라 써 보기(원문: 거의 손실 없음)
CONTENTSLAB
CONTENTSLAB 생각 · 이렇게 써 볼 수 있을 것 같아요

촬영 소스가 수백 개 쌓인 크리에이터라면, 폴더 하나를 골라 '글로 장면 찾기'가 얼마나 맞는지 먼저 시험해 보면 좋을 것 같아요. 영상은 약 58프레임, 오디오는 약 5분 30초까지만 한 번에 넣을 수 있으니 긴 영상은 잘라서 넣어 보는 게 좋을 것 같아요.

Google DeepMind가 10월 6일(현지 시간) EmbeddingGemma 2를 공개했어요. 공식 X에서는 '기기 안에서 돌리는 임베딩용 첫 네이티브 멀티모달 오픈 모델'이라고 소개했어요. Gemma 4를 바탕으로 만들었어요.

무엇이 달라졌나 — 1세대가 텍스트 전용이었다면, 2세대는 텍스트 백본(270M)에 이미지 인코더(170M)와 오디오 인코더(300M)를 선택해서 붙이는 구조예요. 텍스트만 필요하면 작은 부분만 쓰면 돼요. 한 번에 이미지 약 29장, 영상 약 58프레임, 오디오 약 5분 30초까지 넣을 수 있어요(기본 설정 기준).

숫자로 보면 — 결과 벡터는 768차원이고, 마트료시카 방식(MRL, 앞부분만 잘라 써도 뜻이 유지되게 학습)이라 512·256·128차원으로 줄여 쓸 수 있어요. 모델 카드 기준 MTEB 코드 점수 78.68로 1세대보다 9.92점 올랐고, 다국어 MTEB 61.36, 이미지 MIEB 64.64를 기록했어요(Google 발표 수치).

어디서 쓰나 — Hugging Face, Kaggle, Ollama에서 받을 수 있고, transformers.js(WebGPU), MLX, vLLM, llama.cpp, SGLang, LM Studio, MediaPipe, LiteRT, sentence-transformers를 지원해요. 폰용으로 최적화한 버전은 Hugging Face의 LiteRT Community에 올라와 있어요.

Google 블로그 · EmbeddingGemma 2
원문 화면 · Google 블로그 · EmbeddingGemma 2

이런 AI 소식, 매일 쉽게 정리해서 X에 먼저 올려요.

@Contentslab_ai 팔로우