사진 한 장을 소리 나는 영상으로, 1분에 $5.80… HiDream-O1-Video-1.0이 Artificial Analysis 이미지→영상 순위 6위예요
중국 HiDream.ai의 영상 모델 HiDream-O1-Video-1.0이 Artificial Analysis 이미지→영상(소리 포함) 순위표에서 6위예요. 2~6위는 점수 차가 오차 범위 안이고, 값은 1분에 $5.80이에요. 모델 자체는 9월 17일에 발표됐어요.
- 10월 11일에 확인한 Artificial Analysis 이미지→영상 순위표(AA-Video-I2V v1.0, 소리 포함)에서 HiDream-O1-Video-1.0은 6위, Elo 1,175점(±10)이에요. 2위(1,181점)부터 6위까지는 순위표가 같은 범위로 묶어요.
- 순위표의 API 값은 1분에 $5.80이에요(1080p 1분 기준). 위쪽 모델 가운데 1위 MiniMax H3 Max($4.80)와 3위 Vidu Q4 Preview($5.04)는 더 싸고, 5위 Dreamina Seedance 2.0 720p는 $9.07이에요.
- 새로 나온 모델은 아니에요. HiDream.ai는 9월 17일 발표문에서 1080p, 5~20초, 소리까지 함께 만드는 모델이라고 소개했어요. API 문서에는 사진 한 장과 프롬프트로 영상 하나를 만든다고 적혀 있어요.
캐릭터나 제품 사진 한 장을 소리 나는 짧은 영상으로 바꾸는 작업의 후보가 하나 늘었어요. 순위표에서 2~5위 모델과 같은 범위에 있고 값은 중간쯤이라, 같은 사진을 MiniMax H3나 Seedance와 나란히 뽑아 비교해 볼 만해요.
API는 작업을 먼저 등록하고 task_id로 결과를 물어보는 방식이에요. 넣는 값은 이미지(주소 또는 Base64, 40KB~20MB)와 프롬프트이고, 길이는 모델이 정하거나 10초로 고정할 수 있어요. 화면 비율은 넣은 이미지를 따라가요.
당장 바꿀 까닭은 크지 않아요. 더 싸면서 순위가 높은 모델이 이미 있고, 가입·결제 절차는 직접 확인하지 못했어요. 이름을 알아 두고, 쓰는 도구에 들어오는지 지켜보면 돼요.
캐릭터 사진 한 장으로 소리까지 든 짧은 컷을 만드는 분이라면, 지금 쓰는 모델과 같은 사진·같은 프롬프트로 나란히 뽑아 입 모양과 소리가 맞는지 비교해 보면 좋을 것 같아요. 위쪽 모델들과 점수가 붙어 있어서, 순위보다 내 그림체에서의 결과를 보고 고르는 편이 맞아 보여요.
AI 모델을 비교·측정하는 Artificial Analysis의 이미지→영상 순위표(소리 포함)에서 HiDream-O1-Video-1.0이 6위에 올라 있어요. 중국 베이징의 HiDream.ai가 만든 영상 모델이에요. 아래 순위와 값은 10월 11일 새벽에 순위표를 직접 열어 확인한 숫자예요.
순위와 값
이 순위표는 사진 한 장을 소리 나는 영상으로 바꾼 결과를 사람들이 둘씩 비교해 고른 투표로 Elo 점수를 매겨요.
- 1위 MiniMax H3 Max — 1,195점(±9), 1분 $4.80
- 2위 MiniMax H3 — 1,181점(±8), 1분 $7.80
- 3위 Vidu Q4 Preview — 1,179점(±10), 1분 $5.04
- 4위 Gemini Omni Flash — 1,178점(±7), 1분 $6.00
- 5위 Dreamina Seedance 2.0 720p — 1,176점(±7), 1분 $9.07
- 6위 HiDream-O1-Video-1.0 — 1,175점(±10), 1분 $5.80, 투표 표본 3,231개
- 7위 Wan 3.0 — 1,164점(±8), 1분 $12.00
순위표는 2위부터 6위까지를 같은 범위(2~6위)로 표시해요. 점수가 그만큼 붙어 있다는 뜻이에요. 값은 "모델을 만든 회사의 API에서 기본 설정으로 1080p 영상 1분을 만드는 비용"이라고 적혀 있어요.
어떤 모델인가요
HiDream.ai는 9월 17일 발표문에서 이 모델(줄여서 HiDream V1)을 글·영상·소리를 한 틀에서 함께 다루는 모델이라고 소개했어요. 발표문에 적힌 내용은 이래요.
- 1080p 영상을 5~20초 길이로 만들고, 내용에 맞춰 길이를 모델이 정해요
- 글·이미지·영상을 입력으로 받는다고 해요
- 발표 당시 Artificial Analysis 이미지→영상(소리 포함) 순위 4위, Arena.ai 이미지→영상 순위 8위라고 적었어요. 발표문에도 순위는 바뀔 수 있다는 단서가 붙어 있어요
지금 공개된 API 문서는 범위가 더 좁아요. 참고 이미지 한 장과 프롬프트를 넣어 영상 하나를 받는 방식이고, 화면 비율은 넣은 이미지를 따라가요. 길이는 모델이 정하거나 10초로 고정할 수 있어요.
다만
1080p, 5~20초, 물리 법칙에 맞는 움직임 같은 설명은 회사가 직접 한 말이에요. 순위표에서는 더 싸면서 순위가 높은 모델(MiniMax H3 Max, Vidu Q4 Preview)이 있어요. 발표문에는 발표 당시 내부 테스트 중이라고 적혀 있었고, 가입·결제 절차는 직접 확인하지 못했어요.

