Cohere "검색 벤치마크, 맞는 답 28%를 오답 처리해 왔다"
정답표에 없는 좋은 검색 결과까지 AI 심사위원이 채점하는 새 지표 RCP-nDCG@10을 내놨어요.
핵심 3줄
- 기존 검색 벤치마크가 '관련 없음'으로 친 문서 중 28%는 사람이 보기엔 쓸모 있었어요.
- 벤치마크는 29%만 관련 있다고 했지만, 사람은 60%를 관련 있다고 봤어요.
- 새 지표는 사람 판단과 77% 일치했어요. 기존 nDCG는 52%였어요.
🧪 CONTENTSLAB 평참고만★★★★★실전 활용도 2/5
RAG 개발자
검색 품질을 잴 때 기존 정답표 점수만 믿지 말고, 루브릭을 준 AI 심사로 상위 10개를 다시 채점해 보세요.
CONTENTSLAB 생각 · 이렇게 써 볼 수 있을 것 같아요
저희 일에는 당장 쓸 곳이 없어 보여요. 다만 언젠가 뉴스 아카이브 검색을 만든다면, "정답표 밖 좋은 결과"를 놓치지 않는 평가 기준으로 참고해 볼 만할 것 같아요.
RAG(검색해서 답하는 AI)의 실력은 '좋은 문서를 얼마나 잘 찾아오나'로 재요. 그런데 기존 채점표는 예전 검색 시스템이 찾은 문서로만 만들어져, 새로 찾은 좋은 문서를 오답으로 처리하는 문제가 있었어요. Cohere는 채점 기준표(루브릭)를 받은 AI 심사위원이 찾아온 문서를 전부 다시 채점하게 했어요.
🎬 영상 요약
- 기존 검색 벤치마크가 '관련 없음'으로 친 결과 4개 중 1개 이상은 사람에게 실제로 쓸모 있었어요.
- RCP-nDCG는 AI가 결과끼리 비교하고 모든 결과에 같은 질문(주제에 맞나, 답이 되나)을 던져 사람 라벨 없이 점수를 내요.
- 사람 46명이 300번 넘게 비교해 보니 새 지표와 약 4번 중 3번 일치했고, 점수 차가 클수록 최대 97%까지 맞았어요.

X 게시물 보기 · https://twitter.com/cohere/status/2106108159739998525
출처 (원문)