LIVE · 2026 OCT 05 KST⟟ RSS 구독FEED 020 SIGNALS
AI 소식 · 어렵지 않게 · 실시간
📰 소식 목록 전체 20건 · 최신순
  1. 2026 OCT 04 01:35LLM · 번역써 보세요Cohere 번역 AI, DeepL·구글 번역 제쳤다… 한국어도 '1급 언어'
  2. 2026 OCT 03 09:07이미지지켜보기Ideogram 4.5, "고칠수록 망가지는 그림" 잡았다… 가격은 화질별 27배 차이
  3. 2026 OCT 03 07:17인프라참고만Prime Intellect, 수조 토큰 굴려 본 추론 서비스 'Prime Inference' 공개
  4. 2026 OCT 03 04:44벤치마크참고만Cohere "검색 벤치마크, 맞는 답 28%를 오답 처리해 왔다"
  5. 2026 OCT 03 04:11LLM · 연구지켜보기수학자 + 일반 채팅창 AI = 논문 6편… 메타 'Muse Spark'가 미해결 문제 5개 풀었다
벤치마크

Cohere "검색 벤치마크, 맞는 답 28%를 오답 처리해 왔다"

정답표에 없는 좋은 검색 결과까지 AI 심사위원이 채점하는 새 지표 RCP-nDCG@10을 내놨어요.

핵심 3줄
  • 기존 검색 벤치마크가 '관련 없음'으로 친 문서 중 28%는 사람이 보기엔 쓸모 있었어요.
  • 벤치마크는 29%만 관련 있다고 했지만, 사람은 60%를 관련 있다고 봤어요.
  • 새 지표는 사람 판단과 77% 일치했어요. 기존 nDCG는 52%였어요.
🧪 CONTENTSLAB 평참고만★★★★★실전 활용도 2/5
RAG 개발자

검색 품질을 잴 때 기존 정답표 점수만 믿지 말고, 루브릭을 준 AI 심사로 상위 10개를 다시 채점해 보세요.

CONTENTSLAB
CONTENTSLAB 생각 · 이렇게 써 볼 수 있을 것 같아요

저희 일에는 당장 쓸 곳이 없어 보여요. 다만 언젠가 뉴스 아카이브 검색을 만든다면, "정답표 밖 좋은 결과"를 놓치지 않는 평가 기준으로 참고해 볼 만할 것 같아요.

RAG(검색해서 답하는 AI)의 실력은 '좋은 문서를 얼마나 잘 찾아오나'로 재요. 그런데 기존 채점표는 예전 검색 시스템이 찾은 문서로만 만들어져, 새로 찾은 좋은 문서를 오답으로 처리하는 문제가 있었어요. Cohere는 채점 기준표(루브릭)를 받은 AI 심사위원이 찾아온 문서를 전부 다시 채점하게 했어요.

원문 영상 · Cohere 블로그 속 소개 영상 · 출처
🎬 영상 요약
  • 기존 검색 벤치마크가 '관련 없음'으로 친 결과 4개 중 1개 이상은 사람에게 실제로 쓸모 있었어요.
  • RCP-nDCG는 AI가 결과끼리 비교하고 모든 결과에 같은 질문(주제에 맞나, 답이 되나)을 던져 사람 라벨 없이 점수를 내요.
  • 사람 46명이 300번 넘게 비교해 보니 새 지표와 약 4번 중 3번 일치했고, 점수 차가 클수록 최대 97%까지 맞았어요.
Cohere 공식 블로그
원문 화면 · Cohere 공식 블로그

이런 AI 소식, 매일 쉽게 정리해서 스레드에 먼저 올려요.

@contentslab.ai 팔로우