Reka, 영상만 보고 '키보드·마우스 조작'을 읽어 내는 AI 무료 공개
앞으로 가기·돌기 같은 움직임을 영상에서 뽑아내, 월드 모델 학습용 데이터를 만들어 줘요. Apache 2.0이에요.
핵심 3줄
- 영상 속 카메라 움직임을 '앞으로·옆으로·돌기·기울이기' 같은 조작 명령으로 바꿔 줘요.
- 게임 영상으로만 학습했는데 실제 촬영 영상에서도 통해요.
- 모델은 280만~980만 파라미터로 아주 작고, Apache 2.0으로 무료 공개됐어요.
🧪 CONTENTSLAB 평참고만★★★★★실전 활용도 1/5
게임·로봇 연구자
라벨 없는 게임·주행 영상에 "앞으로·돌기" 조작 라벨을 자동으로 붙여 월드 모델 학습 데이터 만들기.
CONTENTSLAB 생각 · 이렇게 써 볼 수 있을 것 같아요
저희 일에는 당장 쓸 곳이 없어 보여요. 월드 모델을 학습시킬 일이 없어서, 영상 AI가 어디로 가는지 흐름을 보는 참고용으로 좋을 것 같아요.
월드 모델(조작하면 반응하는 가상 세계를 만드는 AI)을 학습하려면 '이때 어떤 버튼을 눌렀는지'가 붙은 영상이 필요한데, 실제 영상엔 그런 정보가 없어요. RIDM은 이 빈칸을 영상만 보고 채워 줘요. 실제 영상에서 앞으로 가기·돌기 구분 정확도는 85.9%였어요.

X 게시물 보기 · https://twitter.com/rekaailabs/status/2106026685779091562
출처 (원문)