LIVE · 2026 OCT 09 KST⟟ RSS 구독FEED 080 SIGNALS
AI 소식 · 어렵지 않게 · 실시간
📰 소식 목록 전체 80건 · 최신순
  1. 2026 OCT 09 14:06이미지 생성 · 시험 기능지켜보기Midjourney, 알파 사이트에서 'Thinking Mode' 시험 시작… 만든 그림을 'Rerun (Thinking)' 버튼으로 다시 돌려 볼 수 있어요
  2. 2026 OCT 09 11:30오픈소스 · 문서 OCR써 보세요PDF에서 글자만이 아니라 위치·그림 설명·차트 숫자까지… 공개 OCR 모델 LightOnOCR-3, Apache 2.0으로 나왔어요
  3. 2026 OCT 09 07:55오픈소스 · 검색지켜보기PostgreSQL 안에서 '뜻으로 찾기'까지… 벡터 DB도 GPU도 없이 도는 오픈소스 확장 Evoke 공개
  4. 2026 OCT 09 07:54LLM · API 가격지켜보기GPT-6.1 Sol에도 Ultrafast 모드, 값은 Standard의 6배… 사람이 기다리는 화면에만 쓸 만해요
  5. 2026 OCT 09 07:53AI 도구 · 업무써 보세요Claude에서 문서·슬라이드·디자인 만들기, 무료 요금제까지 열렸어요… 대시보드와 설명 애니메이션은 베타로 추가
오픈소스 · 문서 OCR

PDF에서 글자만이 아니라 위치·그림 설명·차트 숫자까지… 공개 OCR 모델 LightOnOCR-3, Apache 2.0으로 나왔어요

LightOn이 문서 읽기 모델 LightOnOCR-3를 0.8B·1B·4B 세 크기로 공개했어요. 4B는 olmOCR-Bench 86.3점으로, 파라미터 35.1B인 1위 모델에 1.3점 뒤예요. 상업 사용도 되는 Apache 2.0이에요.

86.3
LightOnOCR-3-4B의 olmOCR-Bench 종합 점수. 1위 Infinity Parser Pro(35.1B, 87.6)에 1.3점 뒤, 같은 4B 크기 Chandra 2(85.8)보다 0.5점 위 (LightOn 자체 측정)
핵심 3줄
  • LightOn이 10월 8일 LightOnOCR-3를 0.8B·1B·4B 세 크기로 공개했어요. 라이선스는 Apache 2.0이라 연구와 상업 사용 모두 돼요.
  • 프롬프트에 grounding이라고 넣으면 글 덩어리마다 종류와 위치 좌표를 붙이고, 그림에는 짧은 설명을, 차트에는 숫자를 뽑은 표를 달아 줘요. 프롬프트를 비우면 글자만 옮겨 적어요.
  • LightOn 측정으로 4B는 olmOCR-Bench 86.3점(1위 Infinity Parser Pro 87.6), ParseBench 5개 분야 종합 75.1점으로 1위예요. 다만 오래된 스캔 문서와 머리말·꼬리말은 Infinity Parser Pro가 더 잘해요.
🧪 CONTENTSLAB 평지금 써 보세요★★★★★실전 활용도 3/5
개발자

PDF를 잘라 검색에 넣는 RAG(문서를 찾아 답에 붙이는 방식) 앞단에 써 볼 만해요. grounding 모드는 블록마다 종류(제목·표·각주 등)와 좌표가 붙어 나와서, 제목 단위로 자르거나 답의 근거 위치를 PDF 위에 표시하는 데 쓸 수 있어요. 출력 토큰은 일반 모드보다 약 25% 늘어요.

1인 사업자·기획자

영수증·서식·표가 든 스캔 문서를 글로 옮길 일이 있다면, Hugging Face의 LightOnOCR-3 Demo에서 결과를 먼저 볼 수 있어요. 한국어 문서 점수는 원문에 없으니 내 문서로 직접 확인이 필요해요.

$ 바로 해 보기
써 보는 순서 · 모델 값 0원 · 라이선스 Apache 2.0
1) 먼저 보기: Hugging Face의 'LightOnOCR-3 Demo' 스페이스 열기
2) 서버로 띄우기 (모델 카드에 적힌 명령): pip install vllm 다음에 vllm serve "lightonai/LightOnOCR-3-4B"
3) 글자만 받으려면 이미지만 보내고(빈 프롬프트), 위치·그림 설명·차트 표까지 받으려면 프롬프트에 grounding 한 단어만 넣기
CONTENTSLAB
CONTENTSLAB 생각 · 이렇게 써 볼 수 있을 것 같아요

보고서나 논문 PDF를 요약·검색용으로 쌓아 두는 분이라면, 차트가 많은 문서 몇 장으로 차트 숫자가 표로 제대로 나오는지부터 확인해 보면 좋을 것 같아요. 점수는 만든 회사가 직접 잰 것이고 한국어 결과는 없어서, 내 문서로 비교해 본 뒤 정하는 편이 안전해 보여요.

AI 회사 LightOn이 10월 8일 문서 읽기 모델 LightOnOCR-3를 공개했어요. OCR은 그림 속 글자를 읽어 텍스트로 바꾸는 기술이에요. 크기는 0.8B·1B·4B 세 가지이고, 라이선스는 연구와 상업 사용이 모두 되는 Apache 2.0이에요.

무엇이 새로운가요

발표 글은 이번 모델이 문서의 모든 영역에 종류가 붙은 위치 좌표를 내고, 그림 설명을 쓰고, 그림·차트 속 숫자를 뽑을 수 있게 됐다고 소개해요. 쓰는 법은 프롬프트에 grounding이라고만 넣는 것이에요. 그러면 글 덩어리마다 종류(제목·본문·표·각주 등)와 위치 좌표(0~1000으로 맞춘 네모 좌표)가 앞에 붙어 나와요. 그림에는 짧은 설명이 붙고, 차트는 그 안의 숫자를 뽑은 HTML 표로 바뀌어요.

프롬프트를 비워 두면 예전처럼 글자만 옮겨 적어요. 모델 카드는 grounding 모드가 일반 모드보다 출력 토큰을 약 25% 더 쓴다고 적었어요(4B 기준 쪽당 평균 1,433개 대 1,158개). 이 두 가지 말고 다른 지시문은 학습 범위 밖이라고 해요.

점수

아래 숫자는 모두 LightOn이 직접 잰 값이에요.

  • olmOCR-Bench — 4B가 종합 86.3점. 파라미터 35.1B인 Infinity Parser Pro(87.6)에 1.3점 뒤지고, 같은 4B 크기인 Chandra 2(85.8)보다 0.5점 높아요. 0.8B는 85.5, 1B는 84.5예요.
  • ParseBench — 5개 분야 종합에서 4B(75.1)와 0.8B(74.6)가 1·2위, Infinity Parser Pro는 74.3이에요. 4B는 차트(66.1)에서 가장 높고, 위치 맞히기(visual grounding)는 Infinity Parser Pro(74.9)가 가장 높아요.
  • fr-bench-pdf2md(프랑스어 문서) — 4B가 74.1로 1위, 0.8B 70.5, 1B 69.6이에요.

약한 곳도 원문에 적혀 있어요. 오래된 스캔 문서와 머리말·꼬리말은 Infinity Parser Pro가 더 잘해요(olmOCR-Bench 오래된 스캔 항목: Infinity Parser Pro 58.2, LightOnOCR-3-4B 52.5). LightOn은 OCR 점수가 출력 표기 방식에 따라 눈에 띄게 달라질 수 있다고 설명하고, 채점 전에 쓴 정리 함수와 재현용 자료를 저장소에 함께 공개한다고 밝혔어요.

속도

H100 그래픽카드 한 장, vLLM 0.30.0, 같은 512쪽으로 쟀어요. 페이지를 긴 쪽 1540px로 넣으면 최대 처리량이 0.8B는 초당 4.78쪽, 4B는 초당 3.36쪽이에요. 한 장만 넣을 때 걸리는 시간은 1B가 2.7초로 가장 짧아요. 같은 Qwen3.5-4B 바탕인 Chandra-OCR-2와 견주면, 각자의 olmOCR-Bench 설정에서 4B가 한 장 기준 19% 빠르고 초당 21% 더 많은 쪽을 처리한다고 해요.

써 보려면

Hugging Face에 세 모델과 데모 스페이스(LightOnOCR-3 Demo)가 올라와 있어요. 모델 카드에는 Transformers와 vLLM으로 돌리는 방법이 적혀 있고, 4B는 Transformers 5.2 이상이 필요해요. 한국어 문서 점수는 원문에 없어요.

LightOn 발표 글의 olmOCR-Bench 표 · LightOnOCR-3-4B 종합 86.3 (종합 열은 화면 오른쪽 밖, 위 문단에 숫자가 적혀 있어요)
원문 화면 · LightOn 발표 글의 olmOCR-Bench 표 · LightOnOCR-3-4B 종합 86.3 (종합 열은 화면 오른쪽 밖, 위 문단에 숫자가 적혀 있어요)
LightOn 발표 글 첫 화면 · 10월 8일 게시, Apache 2.0으로 공개한다고 적혀 있어요
원문 화면 · LightOn 발표 글 첫 화면 · 10월 8일 게시, Apache 2.0으로 공개한다고 적혀 있어요
Hugging Face 모델 카드 · lightonai/LightOnOCR-3-4B, License: apache-2.0
원문 화면 · Hugging Face 모델 카드 · lightonai/LightOnOCR-3-4B, License: apache-2.0
발표 글의 속도 설명 · 0.8B 초당 4.78쪽, 4B 초당 3.36쪽
원문 화면 · 발표 글의 속도 설명 · 0.8B 초당 4.78쪽, 4B 초당 3.36쪽

이런 AI 소식, 원문을 확인해서 매일 쉽게 정리해요.

뉴스 첫 화면으로