문서 페이지를 그림째로 찾는 검색용 모델… Perplexity가 pplx-embed-v2-late 두 개를 MIT로 공개했어요
Perplexity가 글·이미지·문서 페이지를 함께 찾는 검색용 임베딩 모델 두 개(0.6B·9B)를 Hugging Face에 올렸어요. 검색 도구를 직접 만드는 개발자용 기반 기술이에요.
- pplx-embed-v2-late는 글, 이미지, 문서 페이지 그림을 같은 방식으로 찾게 해 주는 임베딩 모델(글이나 그림을 숫자 묶음으로 바꿔 비슷한 것끼리 찾게 해 주는 모델)이에요. 크기는 0.6B와 9B 두 가지예요.
- 글 전체를 숫자 묶음 하나로 뭉치지 않고 토큰(글을 잘게 자른 조각)마다 128개 숫자짜리 묶음을 남겨요. 두 모델은 같은 숫자 공간을 써서, 9B로 만들어 둔 색인을 0.6B로 검색할 수 있어요.
- 라이선스는 MIT이고 Hugging Face에서 받아요. 공개 시험(ViDoRe v3)의 이미지 검색 점수는 0.6B가 62.3%, 9B가 65.2%로 모델 카드에 적혀 있어요. 만든 회사가 밝힌 값이에요.
표·그래프가 많은 PDF나 스캔 문서를 검색하는 RAG(자료를 찾아서 답하는 AI 구조)를 직접 만들고 있다면, 페이지를 그림으로 넣는 방식과 지금 쓰는 글자 추출 방식을 같은 질문 20개로 비교해 볼 만해요. 토큰마다 숫자 묶음이 남아 저장 공간이 얼마나 느는지도 같이 재 보세요.
ChatGPT·Claude·Perplexity 같은 서비스를 쓰기만 한다면 당장 할 일은 없어요. '문서를 글자로 바꾸지 않고 페이지 모양 그대로 찾는 방식이 있다'는 것만 알아 두면 돼요.
강의 자료나 스캔한 계약서처럼 표와 그림이 섞인 PDF를 수백 장 쌓아 두고 '그 표 어디 있었지' 하고 찾는 일이 잦다면, 파이썬을 다룰 수 있는 분은 작은 0.6B 모델로 페이지 그림 검색을 시험해 볼 수 있을 것 같아요. 직접 검색 도구를 만들지 않는다면 지금은 읽고 넘어가도 괜찮아 보여요.
Perplexity가 10월 8일 새벽(한국 시간) 검색용 모델 pplx-embed-v2-late 두 개를 공개했어요. 글을 써 주는 AI가 아니라, 많은 자료 가운데 질문과 맞는 것을 찾아 주는 부품이에요.
임베딩이 뭔가요 — 글이나 그림을 숫자 묶음으로 바꿔서, 뜻이 비슷한 것끼리 가까이 놓이게 하는 기술이에요. 'AI가 내 자료를 찾아서 답한다'는 서비스 뒤에는 대부분 이 단계가 있어요.
무엇이 다른가 — 보통은 글 한 덩어리를 숫자 묶음 하나로 뭉쳐요. 이 모델은 토큰(글을 잘게 자른 조각)마다 128개 숫자짜리 묶음을 따로 남기고, 질문의 조각과 문서의 조각을 하나하나 맞춰 본 뒤 점수를 매겨요(레이트 인터랙션이라고 부르는 방식). 모델 카드는 이렇게 적어요. "The models produce one 128-dimensional vector per token"(토큰 하나에 128차원 벡터 하나를 만든다).
문서 페이지를 그림째로 — 공식 X는 글, 이미지, 페이지를 찾는 모델이라고 소개해요. 모델 카드의 예제도 문서 한 쪽을 찍은 그림 파일(document.png)을 그대로 넣어 검색 대상으로 만들어요. 표·그래프·도장 찍힌 스캔 문서는 글자로 뽑아내는 과정에서 표가 깨지거나 그림이 빠지기 쉬운데, 페이지 모양을 그대로 넣으면 그 단계를 건너뛸 수 있어요. '3분기 매출 표 어디 있었지' 같은 질문으로 그 쪽을 찾는 쓰임이에요.
작은 모델로 큰 모델의 색인을 검색 — 0.6B와 9B는 같은 숫자 공간을 써요. 그래서 문서는 큰 9B로 한 번 정리해 두고, 질문은 가벼운 0.6B로 바꿔서 찾을 수 있어요. 질문은 매번 들어오니 그쪽을 가볍게 하는 구성이 가능해요.
크기와 성적 (만든 회사가 밝힌 값) — 모델 카드에 적힌 실제 쓰이는 파라미터(모델 크기를 나타내는 숫자)는 0.6B가 3억 4천만, 9B가 74억이에요. 문서 그림 검색 공개 시험 ViDoRe v3의 점수(nDCG@10, 높을수록 좋음)는 0.6B가 이미지 62.3%·마크다운 61.2%, 9B가 이미지 65.2%·마크다운 64.7%예요. Perplexity는 공식 그래프에서 0.6B가 5배 큰 모델과 맞먹는다고 설명해요.
어떻게 만들었나 — 두 모델은 Qwen3.5를 바탕으로 했고, Perplexity 내부의 18B 모델을 선생 삼아 작게 줄여 배우게 했다고(증류) 모델 카드에 적혀 있어요.
다만 — 글 묶음과 그림 묶음은 따로 넣어야 하고, 글과 그림이 섞인 입력은 지원하지 않아요. API로 제공되는지와 가격은 모델 카드와 공식 X에서 확인하지 못했어요.
라이선스와 받는 곳 — 두 모델 모두 MIT(상업적으로도 쓸 수 있는 공개 라이선스)이고 Hugging Face에서 받아요. 같은 모음에는 문서를 조각내어 넣는 방식의 미리보기 모델 pplx-embed-v2-context-9b-preview도 함께 올라와 있어요.
X 게시물 보기 · https://x.com/perplexity_ai/status/2107866029745746177
