같은 AI가 도구 따라 62% vs 33%… 허깅페이스, 코딩 에이전트용 학습법 공개
Claude Code·Codex 등 4곳에서 동시에 강화학습을 시켜 작은 모델 LFM2.5의 점수를 42%에서 54%로 올렸어요.
핵심 3줄
- 같은 모델도 어떤 에이전트 도구(하네스)에 넣느냐에 따라 62%와 33%로 갈렸어요.
- 도구는 그대로 두고 중간에 '기록 장치'를 끼워, 실제 작업 기록으로 강화학습을 시켰어요.
- 도구 호출은 31% 줄었고, 코드·데이터·학습된 모델 7개를 모두 공개했어요.
🧪 CONTENTSLAB 평지켜보세요★★★★★실전 활용도 2/5
에이전트 개발자
같은 모델도 하네스에 따라 62% vs 33%. 모델만 바꾸지 말고 Claude Code·Codex·OpenCode에 같은 작업을 넣어 비교해 보세요.
CONTENTSLAB 생각 · 이렇게 써 볼 수 있을 것 같아요
같은 작업을 Claude Code와 Codex에 나눠 줄 때, 작업 종류별로 어느 쪽이 나은지 기록해 보는 데 참고하면 좋을 것 같아요. 강화학습 자체는 저희 일과는 거리가 있어 보여요.
하네스(harness)는 AI 모델을 감싸 실제 일을 하게 만드는 프로그램이에요. Claude Code, Codex, OpenCode 같은 것들이죠. 허깅페이스 팀은 큰 모델의 성공 기록을 흉내 내게 하는 방식은 47.5%에서 멈췄고, 직접 연습시키는 강화학습이 더 낫다고 보여 줬어요.

X 게시물 보기 · https://twitter.com/huggingface/status/2106034221005312448