쓰던 코딩 에이전트를 그대로 두고 모델만 다시 가르쳐요… Agent Lightning v1.0, SWE-bench 41.8% → 56.4%
마이크로소프트 리서치가 에이전트 강화학습 도구 Agent Lightning v1.0을 블로그로 소개했어요. 코드는 8월에 이미 공개됐고, 숫자는 모두 마이크로소프트가 직접 잰 값이에요.
- Agent Lightning v1.0은 에이전트를 학습 도구 안에서 다시 만들지 않고, 실제로 쓰는 실행 틀(하네스: 도구·맥락·작업 흐름을 관리하는 바깥 프로그램)을 그대로 학습에 참여시켜요. 코드는 약 3,500줄, MIT 라이선스예요.
- 코딩 에이전트 예제에서 작은 공개 모델 Qwen3.5-9B가 SWE-bench Verified 41.8% → 56.4%로 14.6%포인트 올랐어요. 학습 데이터는 약 6,000개예요.
- 새 출시는 아니에요. 저장소 소식란에는 2026년 8월에 v1.0과 기술 보고서를 공개했다고 적혀 있고, 이번 건 10월 7일 자 연구 블로그 소개 글이에요. 학습에는 그래픽 카드(GPU)가 필요해요.
mini-SWE-agent나 OpenHands 같은 코딩 에이전트를 공개 모델로 돌리고 있고, 내 저장소 작업 기록과 테스트가 쌓여 있다면 살펴볼 만해요. 에이전트 코드는 고치지 않고 모델 요청만 Agent Lightning의 프록시(중간에서 요청을 받아 넘기는 통로)로 돌리면 학습 데이터가 모여요. 다만 GPU와 강화학습 설정 경험이 필요해요.
Claude·ChatGPT 같은 완성된 서비스를 쓰고 있다면 당장 쓸 일은 없어요. '작은 공개 모델도 내 작업에 맞춰 다시 가르치면 꽤 올라간다'는 흐름만 알아 두면 돼요.
1) 저장소 받기: github.com/microsoft/agent-lightning 2) 설치(CUDA 13.0 예시): uv sync → bash scripts/setup_verl.sh 0.8.0 cu130 3) 문서의 Quick Start로 내 컴퓨터에서 한 번 돌려 보기 4) Coding Agent 예제로 학습 전후 점수 비교 · 라이선스: MIT · 비용: 도구는 무료, 학습용 GPU는 직접 준비
직접 만든 자동화 에이전트를 공개 모델로 돌리는 분이라면, 실패한 작업 기록을 모아 두었다가 모델을 내 작업에 맞게 다시 가르치는 실험에 써 볼 수 있을 것 같아요. GPU가 없다면 지금은 읽고 넘어가도 괜찮아 보여요.
마이크로소프트 리서치가 10월 7일(현지 시간) 블로그에서 Agent Lightning v1.0을 소개했어요. AI 에이전트를 강화학습(해 보고 받은 점수로 모델을 고쳐 가는 학습 방법)으로 더 잘하게 만드는 오픈소스 도구예요. 코드 자체는 새로 나온 게 아니에요. GitHub 저장소 소식란에는 2026년 8월에 v1.0과 기술 보고서를 공개했다고 적혀 있어요.
무엇이 다른가 — 요즘 에이전트는 모델 혼자 일하지 않아요. 도구 호출, 맥락 관리, 작업 흐름을 맡는 바깥 프로그램(하네스)이 같이 움직여요. 지금까지는 학습을 하려면 이 하네스를 학습 도구 안에 다시 만들어야 하는 경우가 많았어요. Agent Lightning은 에이전트의 모델 요청을 프록시로 받아서, 실제로 쓰는 하네스를 그대로 학습에 참여시켜요. 저장소는 에이전트 쪽을 "ZERO changes"(고칠 것 없음)로 붙일 수 있다고 적었어요. 블로그는 이런 하네스의 예로 mini-SWE-agent, OpenHands, OpenCode, Claude Code, Codex를 들어요.
숫자 (모두 마이크로소프트가 직접 잰 값)
- 코드 크기: 약 3,500줄
- Qwen3.5-9B, SWE-bench Verified(실제 코드 저장소의 버그 고치기 시험): 41.8% → 56.4% (+14.6%포인트, 학습 데이터 약 6,000개)
- 9월에 더한 예제 — Qwen3.5-35B-A3B: 47.8% → 61.6% (+13.8%포인트, 학습 데이터 1,800개)
- 학습 속도: 동기식 강화학습(묶음에서 가장 느린 에이전트를 기다렸다가 학습하는 방식)보다 전체 과정이 약 2배 빨랐다고 블로그에 적혀 있어요
구성 — 부품은 세 개예요. 학습을 돌리는 Trainer, 모델 요청을 받아 학습 데이터로 남기는 API Gateway, 에이전트를 내 컴퓨터나 쿠버네티스(여러 서버에서 프로그램을 돌리는 관리 도구)에서 실행하는 Rollout Controller예요.
다만 — 점수는 다른 곳에서 다시 잰 값이 아니에요. 대상도 직접 내려받아 학습시킬 수 있는 공개 모델이라, Claude나 GPT처럼 API로만 쓰는 모델에는 해당하지 않아요. 학습에는 GPU가 필요하고, 설치 안내는 CUDA 13.0 장비를 예로 들어요.
라이선스와 비용 — MIT 라이선스(상업적으로도 쓸 수 있는 공개 라이선스)이고 도구는 무료예요. 데이터 정리, 점수 속임 방지, 학습 스크립트까지 코딩 에이전트 학습 과정을 통째로 공개했다고 해요.
