量子位

Claude 신모델 출시! 벤치마크에서 GPT-6 Luna를 완파하고, 가격은 양원구(梁文谷)보다도 저렴, OpenAI는 리셋 카드로만 체면을 지킬 수 있을 뿐

소형 모델의 새로운 관문 수호자

멍천(梦晨), 어페이쓰(凹非寺) 발
양자위(量子位) | 위챗 공식계정 QbitAI

Claude Haiku 5.5 출시, 소형 모델의 대역습!

벤치마크 점수만 놓고 보면, 이전의 두 대형 '참수 라인'인 DeepSeek V4.1Flash와 GLM-5.3-Flash를 제치고 소형 모델의 새로운 관문 수호자가 되었다.

공식 벤치마크를 보면, 이건 어명이 GPT-6 Luna를 겨냥한 것으로, 항목별로 Luna를 모두 앞선다.

펠리컨 자전거 타기 테스트가 이미 거의 포화 상태에 이르렀기 때문에, 이번 최신 전장에 등장한 것은 달리는 얼룩말 테스트다.

Haiku 5.5는 가격마저 GPT-6 Luna와 완전히 맞춰왔다.

이전 세대 Haiku 4.5는 꼭 1년 전에 나왔고, 가격은 5.5의 10배였다.

다만 Haiku 5.5의 가격에는 조건이 있는데, 프롬프트가 10만 token 이내인 요청(Haiku 4.5 요청량의 90% 차지)은 입출력 가격을 90% 할인하고, 10만 token을 초과하는 부분은 50%만 할인한다.

이로써 캐시 히트 입력 항목을 제외하고, Haiku 5.5의 가격은 DeepSeek-V4.1 Flash보다도 저렴해졌다.

이로써 Opus 5.5는 복잡한 추론, Sonnet 5.5는 범용 실행, Haiku 5.5는 처리량과 속도를 담당하며, 현현이 모여 Fable만 남았다.

옆집 OpenAI가 노력하지 않는 한, Claude도 굳이 Fable 5.5라는 대형 치약 관을 짜낼 필요는 없을 것이다.

마치 인텔과 AMD가 CPU로 겨루던 시절로 돌아온 듯하다.

tokenizer 교체로 token 소비 증가

Haiku 5.5는 effort 조절을 지원하는 최초의 Haiku 모델로, 시리즈의 low부터 max까지 다섯 단계 설정을 물려받았다.

이전 세대 Haiku 4.5는 컴퓨터 조작과 코딩 분야에서 사실상 백지 상태였지만, 이번 세대는 직접 진화했다.

OSWorld 2.1(에이전트가 실제 컴퓨터를 조작해 다단계 작업을 수행하는 테스트) 기준: Low 단계 정확도 42.0%, 단회 비용 $0.07; Max 단계 72.4%, $0.61. Haiku 4.5는 Max 단계에서 겨우 15.7%, $1.45였다.

즉, 5.5의 Low 단계가 4.5의 Max 단계보다 정확하고, 비용도 절반以下로 저렴하다.

GDPval-AA v2.1(44개 직업의 실제 전문 업무 테스트)도 비슷한 곡선을 보인다: Low 단계 Elo 1125, $0.01; Max 단계 1620, $0.87. 4.5의 Max 단계는 겨우 735, $0.24였다.

다만 Haiku 5.5는 tokenizer를 교체했고(Sonnet 5.5, Opus 5.5와 동일), 같은 작업에서 더 많은 token을 소비하므로, 실제 절감액은 표기 할인율보다 조금 적다.

특히 코드, 표,비영어권 콘텐츠의 팽창은 더 클 수 있다.

AA 평가에서 Haiku 5.5는 API 가격이 저렴해졌지만, '작업 완료 평균 비용'은 이상적인 구간에 도달하지 못했다.

Sonnet을 대체할 수는 없다

많은 사람들이 Haiku 5.5에 기대한 것은 일부 작업에서 Sonnet 5.5를 대체해 비용을 더 낮출 수 있기를 바랐다.

하지만 이번에는 기적이 일어나지 않았다. 스몰컵은 어디까지나 스몰컵이다.

Terminal-Bench 4.0에서 Haiku 5.5는 39.2%, Sonnet 5.5는 70.6%를 기록했다. 복잡한 다단계 코딩, 파일 간 리팩토링, 장기 자율 계획 측면에서 격차는 매우 뚜렷하다.

Anthropic 자체적으로도 복잡한 에이전트 코딩에는 Sonnet 5.5 또는 Opus 5.5를 우선 사용할 것을 권장했다.

Haiku 5.5의 가치는 실행 계층에 있다. 작업이 이미 분해되어 있고, 검수 기준이 명확하며, 병렬로 실행할 수 있는 작업들이다.

예컨대 Cognition의 Devin은 Opus 5.5를 메인 모델로, Haiku 5.5를 서브 에이전트로 사용하며, FrontierCode 조합이 66.2%를 기록해 두 모델 각각 단독 실행보다 높았다.

만약 이전에 Haiku 4.5를 쓰던 사업이라면, 이번에는 모델 이름만 바꾼다고 바로 출시할 수 있는 것이 아니다.

budget_tokens 수동 사고 설정은 바로 오류가 발생하며, 반드시 적응형 사고에 effort 파라미터를 추가하는 방식으로 변경해야 한다.

temperature, top_p, top_k는 모두 기본값으로 고정되었으므로, 샘플링 파라미터로 창의성 제어나 다양화 생성을 하던 애플리케이션은 로직을 수정해야 한다.

assistant 메시지 프리필(prefill)이 취소되었으므로, 예전에 프리필로 JSON 시작을 강제하던 작성 방식은 도구 호출이나 구조화된 출력 인터페이스로 바꿔야 한다.

컴퓨터 조작 도구 버전도 업데이트되어 computer_20250124에서 computer_toolset_20260801로 변경되었으며, 인터페이스 형식과 반환 구조가 모두 다를 수 있다.

또한 적응형 사고가 기본 활성화되어 응답의 첫 번째 콘텐츠 블록이 본문이 아니라 사고 블록일 수 있으므로, 파싱 로직은 type 필드로 필터링해야 한다.

다섯 가지 변경 사항 모두 요청이 바로 오류를 내거나 예상치 못한 구조를 반환하게 만들 수 있다.

Anthropic이 마이그레이션 가이드를 제공했으니, 전환하기 전에 대조하며 한 번 훑어볼 것을 권장한다.

덤으로 두 가지 혜택

Sonnet 5.5의 캐시 읽기 비용이 $0.20/M에서 $0.10/M으로 인하되었으며, Anthropic은 대부분의 agent 작업 비용이 이로 인해 약 20% 감소한다고 밝혔다.

Max 및 Team 구독 사용자는 이번 주부터 API 크레딧을 받을 수 있으며, Max 5x는 매월 $100, Max 20x는 매월 $200, Team은 최대 $500/월을 팀 내에서 공유할 수 있다.

이 크레딧은 API를 실험하며 도구, 애플리케이션, agent를 만드는 데 사용할 수 있으며, 모든 모델에 공통 적용된다.

뭐라고? A사가 내 Coding Plan 돈을 돌려주고, API에서 한 번 더 쓸 수 있게 해준다고?

그럼 OpenAI는 뭐하고 있을까? OpenAI는 또 리셋 카드 한 장을 보냈다.

참고 링크:
[1]https://www.anthropic.com/claude-haiku-5-5 해당 링크는 안스로픽의 Claude Haiku 5.5 페이지로 연결됩니다.
[2]https://x.com/AI_Screening/status/2107906044915749274?s=20

원문 출처

量子位

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요