LIVE · 2026 OCT 08 KST⟟ RSS 구독FEED 063 SIGNALS
AI 소식 · 어렵지 않게 · 실시간
📰 소식 목록 전체 63건 · 최신순
  1. 2026 OCT 08 04:15LLM · ChatGPT써 보세요ChatGPT에 GPT-6와 'Intelligent UI'… 답이 글 대신 눌러 보는 화면으로 와요
  2. 2026 OCT 08 04:15AI 연구 · 평가참고만AI에게 AI 연구를 통째로 맡겼더니… 실제 점수는 2%·15%, 제출한 보고서엔 43%·71%
  3. 2026 OCT 08 02:45오픈소스 · 모델 학습참고만작은 AI를 '고르기 전용'으로 다시 가르쳐요… Unsloth, 그래픽 메모리 4GB에서 정확도 20.7% → 74.3%
  4. 2026 OCT 08 02:40오픈 모델 · 검색참고만문서 페이지를 그림째로 찾는 검색용 모델… Perplexity가 pplx-embed-v2-late 두 개를 MIT로 공개했어요
  5. 2026 OCT 08 02:40오픈 모델 · 판단 모델참고만글 안 쓰고 판단만 하는 d1, 이제 내려받아 내 컴퓨터에서 돌려요… 상업 사용엔 '연 매출 1,000만 달러' 조건
오픈 모델 · 검색

문서 페이지를 그림째로 찾는 검색용 모델… Perplexity가 pplx-embed-v2-late 두 개를 MIT로 공개했어요

Perplexity가 글·이미지·문서 페이지를 함께 찾는 검색용 임베딩 모델 두 개(0.6B·9B)를 Hugging Face에 올렸어요. 검색 도구를 직접 만드는 개발자용 기반 기술이에요.

핵심 3줄
  • pplx-embed-v2-late는 글, 이미지, 문서 페이지 그림을 같은 방식으로 찾게 해 주는 임베딩 모델(글이나 그림을 숫자 묶음으로 바꿔 비슷한 것끼리 찾게 해 주는 모델)이에요. 크기는 0.6B와 9B 두 가지예요.
  • 글 전체를 숫자 묶음 하나로 뭉치지 않고 토큰(글을 잘게 자른 조각)마다 128개 숫자짜리 묶음을 남겨요. 두 모델은 같은 숫자 공간을 써서, 9B로 만들어 둔 색인을 0.6B로 검색할 수 있어요.
  • 라이선스는 MIT이고 Hugging Face에서 받아요. 공개 시험(ViDoRe v3)의 이미지 검색 점수는 0.6B가 62.3%, 9B가 65.2%로 모델 카드에 적혀 있어요. 만든 회사가 밝힌 값이에요.
🧪 CONTENTSLAB 평참고만★★★★★실전 활용도 1/5
개발자

표·그래프가 많은 PDF나 스캔 문서를 검색하는 RAG(자료를 찾아서 답하는 AI 구조)를 직접 만들고 있다면, 페이지를 그림으로 넣는 방식과 지금 쓰는 글자 추출 방식을 같은 질문 20개로 비교해 볼 만해요. 토큰마다 숫자 묶음이 남아 저장 공간이 얼마나 느는지도 같이 재 보세요.

AI 크리에이터·1인 작업자

ChatGPT·Claude·Perplexity 같은 서비스를 쓰기만 한다면 당장 할 일은 없어요. '문서를 글자로 바꾸지 않고 페이지 모양 그대로 찾는 방식이 있다'는 것만 알아 두면 돼요.

CONTENTSLAB
CONTENTSLAB 생각 · 이렇게 써 볼 수 있을 것 같아요

강의 자료나 스캔한 계약서처럼 표와 그림이 섞인 PDF를 수백 장 쌓아 두고 '그 표 어디 있었지' 하고 찾는 일이 잦다면, 파이썬을 다룰 수 있는 분은 작은 0.6B 모델로 페이지 그림 검색을 시험해 볼 수 있을 것 같아요. 직접 검색 도구를 만들지 않는다면 지금은 읽고 넘어가도 괜찮아 보여요.

Perplexity가 10월 8일 새벽(한국 시간) 검색용 모델 pplx-embed-v2-late 두 개를 공개했어요. 글을 써 주는 AI가 아니라, 많은 자료 가운데 질문과 맞는 것을 찾아 주는 부품이에요.

임베딩이 뭔가요 — 글이나 그림을 숫자 묶음으로 바꿔서, 뜻이 비슷한 것끼리 가까이 놓이게 하는 기술이에요. 'AI가 내 자료를 찾아서 답한다'는 서비스 뒤에는 대부분 이 단계가 있어요.

무엇이 다른가 — 보통은 글 한 덩어리를 숫자 묶음 하나로 뭉쳐요. 이 모델은 토큰(글을 잘게 자른 조각)마다 128개 숫자짜리 묶음을 따로 남기고, 질문의 조각과 문서의 조각을 하나하나 맞춰 본 뒤 점수를 매겨요(레이트 인터랙션이라고 부르는 방식). 모델 카드는 이렇게 적어요. "The models produce one 128-dimensional vector per token"(토큰 하나에 128차원 벡터 하나를 만든다).

문서 페이지를 그림째로 — 공식 X는 글, 이미지, 페이지를 찾는 모델이라고 소개해요. 모델 카드의 예제도 문서 한 쪽을 찍은 그림 파일(document.png)을 그대로 넣어 검색 대상으로 만들어요. 표·그래프·도장 찍힌 스캔 문서는 글자로 뽑아내는 과정에서 표가 깨지거나 그림이 빠지기 쉬운데, 페이지 모양을 그대로 넣으면 그 단계를 건너뛸 수 있어요. '3분기 매출 표 어디 있었지' 같은 질문으로 그 쪽을 찾는 쓰임이에요.

작은 모델로 큰 모델의 색인을 검색 — 0.6B와 9B는 같은 숫자 공간을 써요. 그래서 문서는 큰 9B로 한 번 정리해 두고, 질문은 가벼운 0.6B로 바꿔서 찾을 수 있어요. 질문은 매번 들어오니 그쪽을 가볍게 하는 구성이 가능해요.

크기와 성적 (만든 회사가 밝힌 값) — 모델 카드에 적힌 실제 쓰이는 파라미터(모델 크기를 나타내는 숫자)는 0.6B가 3억 4천만, 9B가 74억이에요. 문서 그림 검색 공개 시험 ViDoRe v3의 점수(nDCG@10, 높을수록 좋음)는 0.6B가 이미지 62.3%·마크다운 61.2%, 9B가 이미지 65.2%·마크다운 64.7%예요. Perplexity는 공식 그래프에서 0.6B가 5배 큰 모델과 맞먹는다고 설명해요.

어떻게 만들었나 — 두 모델은 Qwen3.5를 바탕으로 했고, Perplexity 내부의 18B 모델을 선생 삼아 작게 줄여 배우게 했다고(증류) 모델 카드에 적혀 있어요.

다만 — 글 묶음과 그림 묶음은 따로 넣어야 하고, 글과 그림이 섞인 입력은 지원하지 않아요. API로 제공되는지와 가격은 모델 카드와 공식 X에서 확인하지 못했어요.

라이선스와 받는 곳 — 두 모델 모두 MIT(상업적으로도 쓸 수 있는 공개 라이선스)이고 Hugging Face에서 받아요. 같은 모음에는 문서를 조각내어 넣는 방식의 미리보기 모델 pplx-embed-v2-context-9b-preview도 함께 올라와 있어요.

Perplexity 공식 X · ViDoRe v3 이미지 검색 점수와 모델 크기 비교 (Perplexity 제공 그래프)
원문 이미지 · Perplexity 공식 X · ViDoRe v3 이미지 검색 점수와 모델 크기 비교 (Perplexity 제공 그래프) · 출처

이런 AI 소식, 매일 쉽게 정리해서 X에 먼저 올려요.

@Contentslab_ai 팔로우