가짜 세상에서 훈련하다 틀리면 세상부터 고친다… Odyssey 'PROWL-2', 스타크래프트 승률 7.5%→87.5%
AI 팀이 '월드 모델(학습된 가상 세계)' 안에서 훈련하는 동안, 월드 모델이 틀리게 예측한 장면은 걸러서 고쳐 쓰는 방식이에요.
핵심 3줄
- Odyssey가 AI 에이전트 팀과 월드 모델(학습된 시뮬레이터)이 한 훈련 루프 안에서 함께 배우는 PROWL-2를 공개했어요.
- '정확도 관문'이 월드 모델의 예측을 실제 기록과 비교해, 틀린 장면은 에이전트 훈련에서 빼고 월드 모델 수리로 돌려요.
- 스타크래프트 II 협동 전투(SMACv2) 테란 5대5 승률이 비교 기준 7.5%에서 87.5%로 올랐어요.
🧪 CONTENTSLAB 평참고만★★★★★실전 활용도 1/5
게임·로봇 개발자
학습된 시뮬레이터로 여러 에이전트를 훈련할 때, 시뮬레이터 예측을 주기적으로 실제 기록과 대조해 틀린 장면을 걸러 내는 '관문' 아이디어를 가져다 쓸 만해요.
CONTENTSLAB 생각 · 이렇게 써 볼 수 있을 것 같아요
저희 일에는 당장 쓸 곳이 없어 보여요. 다만 스타크래프트 대결 영상이 직관적이라, 'AI 팀이 진형을 짜는 법' 같은 뉴스 릴스 소재로는 재밌을 것 같아요.
월드 모델은 진짜 환경 대신 AI가 연습할 수 있는 '학습된 가상 세계'예요. 문제는 월드 모델이 틀리게 예측하면, 에이전트가 있지도 않은 미래(환각)로 훈련한다는 점이에요. PROWL-2는 월드 모델의 예측을 실제 기록과 주기적으로 비교해, 많이 틀린 장면은 에이전트 훈련에서 잠시 빼고 그 장면으로 월드 모델을 고쳐요. 연속으로 맞게 예측하면 다시 훈련에 넣어요.
스타크래프트 II 협동 전투 벤치마크(SMACv2) 9개 시나리오 모두에서 평균 성능이 가장 높았고, 40판 평가에서 저그 10대10 승률은 비교 기준 0%에서 90%, 테란 10대11(한 유닛 열세)은 2.5%에서 55%였어요. 네 발 로봇 협동 과제(MQE)에서도 로봇 3대가 좁은 문을 통과하는 Gate-3 성공률이 29.8%에서 70.4%로 올랐어요. 코드는 공개되지 않았고 논문만 나왔어요.
X 게시물 보기 · https://twitter.com/odysseyml/status/2105714716316438684

