투표 500만 건 넘게 써서 다시 가르쳤더니… 오픈 이미지 모델 FLUX.2-dev 69점 상승
Arena가 사람 투표와 채점표 보상을 섞은 후속 학습법을 공개했어요. 학습 전 모델과 붙이면 최고 66% 이겨요.
핵심 3줄
- 사람 투표 약 560만 건으로 '사람이 좋아하는 그림'을 판단하는 보상 모델을 만들었어요.
- 여기에 '프롬프트를 제대로 지켰나', '글자가 깨지지 않았나' 같은 채점표 보상을 더했어요.
- FLUX.2-dev는 Arena 순위 점수가 69점 올라 1202점, Ideogram 4는 1224점이 됐어요.
🧪 CONTENTSLAB 평참고만★★★★★실전 활용도 2/5
이미지 모델 개발자
후속 학습 때 "사람 취향 보상"만 쓰지 말고 "프롬프트 지켰나·글자 안 깨졌나" 채점표 보상을 섞어 꼼수를 막기.
CONTENTSLAB 생각 · 이렇게 써 볼 수 있을 것 같아요
모델을 직접 학습시키지 않아서 그대로 쓸 곳은 없어 보여요. 다만 생성 이미지를 고를 때 "예쁜가 + 요청대로인가 + 글자 멀쩡한가" 3단 체크로 빌려 써 보면 좋을 것 같아요.
사람 취향만 보고 학습시키면, 보기엔 예쁘지만 요청과 다른 그림을 그리는 '꼼수'가 생겨요. Arena는 취향 점수와 채점표 점수를 함께 써야 이 문제를 줄일 수 있다고 정리했어요. 학습 전 모델과 1:1로 붙였을 때 이긴 비율은 64.2%, 두 방식을 섞은 모델은 66.0%였어요.


X 게시물 보기 · https://twitter.com/arena/status/2106037792870649995