LIVE · 2026 OCT 08 KST⟟ RSS 구독FEED 074 SIGNALS
AI 소식 · 어렵지 않게 · 실시간
📰 소식 목록 전체 74건 · 최신순
  1. 2026 OCT 08 21:20LLM · ChatGPT참고만ChatGPT의 GPT-6, 유료는 Sol·무료는 Luna예요… Codex와 Work는 그대로
  2. 2026 OCT 08 19:57AI 연구 · 평가참고만GPT-6 Astra가 보드게임 시험을 만점으로 깼어요… 비결은 카드 한 장, Epoch AI는 그 카드를 금지했어요
  3. 2026 OCT 08 19:56영상 AI · 순위표참고만영상 AI 순위 5위 안 두 개가 같은 모델에서 나왔어요… Artificial Analysis, '파생 모델' 표시하고 숨기기 추가
  4. 2026 OCT 08 19:55LLM · 코딩 벤치마크참고만가장 싼 Claude가 '앱 통째로 만들기' 시험 3위… Haiku 5.5, 한 판에 6.07달러로 90.44%
  5. 2026 OCT 08 19:54코딩 도구 · 데스크톱 앱지켜보기Replit이 내 윈도우 PC에서 앱을 만들고 돌려요… 데스크톱 앱 미리보기, 지금은 대기 명단만
LLM · 코딩 벤치마크

가장 싼 Claude가 '앱 통째로 만들기' 시험 3위… Haiku 5.5, 한 판에 6.07달러로 90.44%

평가 기관 Vals AI의 Vibe Code Bench에서 Claude Haiku 5.5가 110개 중 3위에 올랐어요. 전작 Haiku 4.5는 92위(11.39%)였어요. 다만 한 판에 드는 돈은 1.31달러에서 6.07달러로 늘었어요.

92위 → 3위
Vals AI Vibe Code Bench v1.1 (웹 앱을 처음부터 만드는 시험, 110개 중). Haiku 4.5 11.39% → Haiku 5.5 90.44%
핵심 3줄
  • Claude Haiku 5.5가 Vibe Code Bench v1.1에서 90.44%(±1.73)로 3위예요. 1위는 Claude Sonnet 5.5(92.39%), 2위는 Gemini 4 Argon(91.91%)이에요. 10월 7일 기준이에요.
  • 한 판(앱 하나)에 든 돈이 6.07달러예요. 1위 Sonnet 5.5는 31.25달러, 5위 Claude Opus 5.5는 57.92달러였어요. 점수는 비슷한데 값이 5~10분의 1이에요.
  • 다만 전작 Haiku 4.5(한 판 1.31달러, 약 13분)보다 한 판 비용은 약 4.6배로, 시간은 약 35분으로 늘었어요. 토큰 값은 싸졌는데 한 판 비용이 는 이유는 원문에 따로 설명이 없어요.
🧪 CONTENTSLAB 평참고만★★★★★실전 활용도 3/5
개발자

OpenHands 같은 코딩 에이전트에 붙이는 모델을 고를 때 참고할 숫자예요. 이 시험에서는 Haiku 5.5가 Sonnet 5.5와 2%포인트 차이였고 한 판 비용은 약 5분의 1이었어요. 내 프로젝트에서도 그런지는 작은 작업 하나로 직접 견줘 보는 게 좋아요.

1인 사업자·기획자

랜딩 페이지나 예약 폼 같은 작은 웹 앱을 AI에게 통째로 맡길 때, 가장 비싼 모델부터 고르지 않아도 된다는 근거로 볼 수 있어요. 다만 원문은 어떤 모델도 모든 테스트를 꾸준히 통과하지는 못한다고 적었어요.

CONTENTSLAB
CONTENTSLAB 생각 · 이렇게 써 볼 수 있을 것 같아요

작은 웹 도구를 AI에게 통째로 만들게 하는 1인 작업자라면, 같은 요청을 Haiku 5.5와 평소 쓰던 모델에 한 번씩 주고 결과와 비용을 견줘 보면 좋을 것 같아요. 시험 하나의 결과라서 모델을 바로 바꾸기보다는 참고 숫자로 보는 편이 좋아 보여요.

AI 모델 평가 기관 Vals AI가 10월 8일(한국 시간) 공식 X에서 Claude Haiku 5.5의 Vibe Code Bench 결과를 알렸어요. Haiku 5.5는 Anthropic이 10월 7일 낸 가장 작고 싼 Claude예요.

성적 — Vibe Code Bench v1.1에서 90.44%(±1.73), 110개 중 3위예요. 전작 Haiku 4.5(Thinking)는 11.39%로 92위였어요. 79%포인트, 89계단 올랐어요. Haiku 5.5와 아래 모델들은 OpenHands라는 코딩 에이전트 틀에 붙여 잰 결과예요.

  • 1위 Claude Sonnet 5.5 92.39% · 한 판 31.25달러 · 1시간 1분
  • 2위 Gemini 4 Argon 91.91% · 8.11달러 · 37분 28초
  • 3위 Claude Haiku 5.5 90.44% · 6.07달러 · 34분 36초
  • 4위 Claude Fable 5 90.35% · 41.71달러 · 1시간 2분
  • 5위 Claude Opus 5.5 90.29% · 57.92달러 · 1시간 36분

다만 — 3위부터 6위(Claude Fable 5.1, 90.26%)까지는 0.2%포인트 안쪽이라, 오차 범위(±1.73)를 생각하면 순위 차이는 크지 않아요. 그리고 한 판 비용은 전작보다 늘었어요. Haiku 4.5는 1.31달러에 12분 56초였고, Haiku 5.5는 6.07달러에 34분 36초예요. 순위표에 적힌 토큰 값(100만 토큰당 입력 0.1달러·출력 0.5달러)은 Haiku 4.5(1달러·5달러)의 10분의 1인데, 한 판 비용은 약 4.6배예요. 이유는 원문에 따로 설명이 없어요. 그래도 비슷한 점수를 낸 다른 모델보다는 한 판 비용이 훨씬 낮아요.

다른 시험에서는 — Vals AI의 모델 페이지에 따르면 종합 지표 Vals Index는 54.31%로 45개 중 16위예요. 터미널 작업 시험 Terminal-Bench 4.0은 35.35%(45개 중 12위)예요. Vals AI는 이 시험의 순위가 SWE-bench Verified나 Terminal-Bench 같은 다른 코딩 시험의 순위와 깔끔하게 이어지지 않는다고 적었어요.

Vals AI 공식 X 그림 · Vibe Code Bench 1~5위와 Haiku 4.5(92위)의 정확도, 한 판 비용, 한 판 시간
원문 이미지 · Vals AI 공식 X 그림 · Vibe Code Bench 1~5위와 Haiku 4.5(92위)의 정확도, 한 판 비용, 한 판 시간 · 출처
Vals AI · Vibe Code Bench v1.1 순위표 (10월 7일 갱신). 3위 Claude Haiku 5.5 90.44%, 한 판 6.07달러
원문 화면 · Vals AI · Vibe Code Bench v1.1 순위표 (10월 7일 갱신). 3위 Claude Haiku 5.5 90.44%, 한 판 6.07달러
Vals AI · Vibe Code Bench 첫 화면. '모델이 웹 앱을 처음부터 만들 수 있을까?'
원문 화면 · Vals AI · Vibe Code Bench 첫 화면. '모델이 웹 앱을 처음부터 만들 수 있을까?'

이런 AI 소식, 매일 쉽게 정리해서 X에 먼저 올려요.

@Contentslab_ai 팔로우