음악 AI 순위표가 새로 나왔다… 보컬·연주 모두 Suno v6가 1위, 무료로 쓰는 v6-mini가 2위
Artificial Analysis가 새 지시문 1,000개와 블라인드 투표 3만 7천 건 이상으로 음악 생성 모델 순위를 다시 매겼어요. 연주곡 3~6위는 사실상 동률이에요.
- Suno v6가 보컬(1142점)·연주(1140점) 두 순위표에서 모두 1위, Suno v6-mini가 모두 2위예요.
- 연주곡 3~6위(Mureka V9·V9.5, Lyria 3 Pro·3.5)는 5점 안에 몰려 있어 통계상 동률이에요.
- 점수는 모집한 평가단의 블라인드 투표만으로 매겨요. 누구나 하는 공개 투표는 점수에 들어가지 않아요.
배경음악을 고를 때 연주 순위표를 먼저 보세요. 3~6위가 동률이라 Mureka·Lyria 중에는 이미 결제한 쪽을 그대로 써도 순위상 차이가 없어요.
보컬 순위표는 가사까지 모델이 쓰게 한 결과예요. 가사를 직접 써서 넣는 작업이라면 순위가 달라질 수 있으니 내 가사로 두세 모델을 따로 들어 보세요.
광고·수익 영상에 넣을 음악이면 순위보다 상업 이용 조건이 먼저예요. Suno 요금표 기준 무료 요금제는 상업 권리가 없고 Pro부터 있어요.
1) artificialanalysis.ai/music/arena 에서 두 곡을 10초 이상씩 듣고 투표해 보기 (모델 이름은 투표 뒤에 공개) 2) 연주 순위표에서 상위 모델 두세 개 고르기 (3~6위는 동률이니 이미 쓰는 서비스 우선) 3) 고른 모델에 같은 지시문을 넣어 30초씩 비교하기 4) 영상 목소리 아래에 깔아 보고, 목소리가 묻히지 않는 쪽 고르기 5) 올리기 전에 그 회사 요금표에서 상업 이용 조건 확인하기
영상 배경음악을 AI로 만든다면, 무료로 쓸 수 있는 Suno v6-mini부터 시험해 보면 좋을 것 같아요. 다만 이 순위는 약 3분짜리 곡을 듣고 고른 선호도라, 목소리 밑에 까는 30초 배경음으로 좋은지는 직접 깔아 봐야 알 수 있을 것 같아요.
무슨 일이야?
AI 모델을 비교·평가하는 Artificial Analysis가 한국 시간 10월 8일 아침, 음악 생성 모델 순위표를 새 기준으로 다시 냈어요. 이름은 AA-Music-Vocal v1.1(노래가 들어간 곡)과 AA-Music-Instrumental v1.1(목소리 없는 연주곡)이에요. 두 순위표 모두 Suno v6가 1위예요.
순위는 '뮤직 아레나'라는 블라인드 비교로 매겨요. 같은 지시문(프롬프트)으로 만든 두 곡을 모델 이름을 가린 채 듣고, 더 나은 쪽을 고르는 방식이에요. 그 결과를 Elo(엘로, 맞대결 결과로 실력을 매기는 점수)로 바꿔요. 점수가 높을수록 더 자주 선택됐다는 뜻이에요.
X 게시물 보기 · https://x.com/ArtificialAnlys/status/2107942662481612982
보컬 순위표 (노래가 들어간 곡, 13개 모델)
| 순위 | 모델 | Elo |
|---|---|---|
| 1 | Suno v6 | 1142 (±15) |
| 2 | Suno v6-mini | 1116 (±15) |
| 3 | Mureka V9.5 | 1103 (±15) |
| 4 | Mureka V9 | 1052 (±14) |
| 5 | Lyria 3.5 (구글) | 1052 (±14) |
| 6 | Lyria 3 Pro (구글) | 1046 (±14) |
| 7 | Eleven Music v2.5 | 1012 (±14) |
| 11 | MiniMax Music 3.0 | 1000 (기준점) |
Suno v6는 2위 v6-mini보다 26점 높아요. Mureka V9.5는 이전 버전 V9보다 51점 올랐는데, Artificial Analysis는 이것이 보컬 순위표에서 같은 계열 두 버전 사이의 가장 큰 상승이라고 적었어요.
연주 순위표 (목소리 없는 곡, 19개 모델)
| 순위 | 모델 | Elo |
|---|---|---|
| 1 | Suno v6 | 1140 (±15) |
| 2 | Suno v6-mini | 1109 (±15) |
| 3 | Mureka V9 | 1081 (±14) |
| 4 | Mureka V9.5 | 1080 (±15) |
| 5 | Lyria 3 Pro (구글) | 1078 (±14) |
| 6 | Lyria 3.5 (구글) | 1076 (±14) |
| 7 | Eleven Music | 1021 (±14) |
| 8 | Stable Audio 3 Large | 1017 (±14) |
| 13 | MiniMax Music 3.0 | 1000 (기준점) |
| 19 | MusicGen | 881 (±16) |
영상 배경음악을 찾는 사람이라면 이 표가 더 중요해요. 눈에 띄는 점은 세 가지예요.
- 1·2위는 Suno v6가 v6-mini보다 31점 높아요. 두 순위표 모두 1·2위가 Suno예요.
- 3~6위는 동률 Mureka V9, Mureka V9.5, Lyria 3 Pro, Lyria 3.5가 5점 안에 몰려 있어요. Artificial Analysis도 "통계적으로 동률"이라고 적었어요. 표의 ±숫자는 95% 신뢰 구간(실제 점수가 이 안에 있을 가능성이 95%라는 범위)인데, 네 모델의 범위가 서로 겹쳐요.
- 공개된 모델 중 1위는 MiniMax Music 3.0 Artificial Analysis는 이 모델을 오픈 웨이트(모델 파일이 공개된) 음악 모델 중 선두라고 적었어요. 보컬 11위, 연주 13위예요. 연주에서는 Stable Audio 3 Medium(998점)이 3점 안으로 붙어 있어요.
v1.1에서 무엇이 바뀌었나
- 새 지시문 1,000개 보컬용 500개, 연주용 500개예요. 클래식, 재즈·블루스부터 EDM, 메탈, 레게까지 17개 장르에 고르게 나눴어요.
- 더 길고 복잡한 지시문 곡 구조, 분위기, 악기 구성, 보컬 스타일을 시험해요. 요즘 사람들이 실제로 쓰는 방식과 최신 모델의 능력을 반영했다고 해요.
- 평가단 투표만 반영 점수는 "모집한 평가단(recruited evaluator panel)"의 블라인드 투표로만 매겨요. 누구나 참여하는 공개 아레나 투표는 점수에 들어가지 않아요.
- 표본 블라인드 선호 투표가 37,000건 이상이에요. 보컬 16,000건 이상, 연주 21,000건 이상이고, 순위에 오른 모델마다 2,000건 넘게 받았어요.
순위를 읽을 때 알아 둘 조건
- 곡 길이 모델마다 약 3분(또는 그 모델이 지원하는 가장 가까운 길이)으로 만들어 비교했어요. 지시문 하나에 곡 하나만 만들어요.
- 10초 이상 듣기 두 곡을 각각 10초 이상 들어야 투표할 수 있어요.
- 음량 맞춤 모든 곡의 음량을 같은 기준(-16 LUFS)으로 맞추고 같은 형식(320kbps MP3)으로 바꿔요. 소리가 큰 곡이 유리해지는 일을 막으려는 장치예요.
- 가사는 모델이 직접 보컬 순위표에서는 가사를 주지 않아요. 지시문만 보고 가사와 노래를 모두 만들게 해서, 작사까지 포함한 실력을 봐요.
- 독립성 Artificial Analysis는 어느 회사에서도 순위 등재나 좋은 결과의 대가를 받지 않는다고 밝혔어요.
값과 상업 이용 조건
순위표에는 가격이나 이용 조건이 없어요. 각 회사 요금표에서 직접 확인한 것만 적어요.
- Suno 무료 요금제는 하루 50크레딧에 무료 모델(비교표에는 v6-mini로 표시)을 쓰고, "No commercial rights"(상업 권리 없음)라고 적혀 있어요. Pro는 한국에서 연 화면에 연 결제 기준 월 ₩12,000으로 나오고, v6를 쓸 수 있으며 "Commercial use rights"(상업 이용 권리)가 들어 있어요. Suno는 상업 이용의 제한은 이용 약관을 보라고 덧붙였어요.
- ElevenLabs 요금표에 무료 요금제에도 Music이 들어 있고, "Music commercial use"는 Starter(월 $6) 요금제부터 적혀 있어요.
- Mureka·구글 Lyria·MiniMax·Stable Audio 요금과 상업 이용 조건은 확인하지 못했어요.
아직 확인 안 된 것
평가단이 몇 명이고 어떤 사람들인지는 공식 글과 방법론 문서에 나와 있지 않아요. 방법론 문서에는 장르별 순위도 낸다고 적혀 있지만, 순위표 화면에서 장르별 숫자는 확인하지 못해 전체 순위만 담았어요. 영상 목소리 아래에 까는 짧은 배경음으로 어느 모델이 좋은지는 이 평가가 따로 재지 않아요.




