Artificial Analysis · X

Anthropic이 Claude Haiku 5.5를 출시했습니다. Artificial Analysis Intelligence Index에서 43점을 기록했으며, 이는 지난 Haiku 출시 1년 후 26점 상승한 수치입니다…

Anthropic이 Claude Haiku 5.5를 출시했습니다. Artificial Analysis Intelligence Index에서 43점을 기록했으며, 이는 지난 Haiku 출시 1년 후 26점 상승한 수치입니다. Haiku 5.5는 Anthropic의 effort 설정과 adaptive thinking을 갖춘 최초의 Haiku 모델이며, Anthropic은 단계별 요금제를…

이미지 출처 · Artificial Analysis · X

Anthropic이 Claude Haiku 5.5를 출시했습니다. Artificial Analysis Intelligence Index에서 43점을 기록했으며, 이는 지난 Haiku 출시 1년 후 26점 상승한 수치입니다

Haiku 5.5는 Anthropic의 effort 설정과 adaptive thinking을 갖춘 최초의 Haiku 모델이며, Anthropic은 단계별 요금제를 도입했습니다.

Haiku 5.5는 이전 모델보다 저렴합니다 - 100k 토큰까지의 프롬프트에 대해 1M 입출력 토큰당 $0.10/$0.50의 비용이 듭니다(GPT-6 Luna와 동일하며 이전 Haiku 모델의 10% 수준). 그러나 100k를 초과하면 이 요금이 5배인 $0.50/$2.50으로 인상됩니다. 사이트에는 아직 단계별 요금이 반영되지 않아 Haiku 5.5의 잠정 비용 수치에는 단계별 인상 비용이 포함되어 있지 않습니다. 저희는 지원 작업을 진행 중이며 곧 Cost per Task 범위로 후속 안내를 드릴 예정입니다.

주요 내용:

➤ 소형 클래스 모델 중 선두권 성능: max effort에서 Haiku 5.5는 GLM-5.3 Flash(42), Gemini 3.8 Flash(41), GPT-6 Luna(38) 등의 모델을 약간 앞섭니다. 이 점수는 2.8T 파라미터 오픈 웨이트 모델인 Kimi K3(44)와 비슷하며, Claude Sonnet 5.5(max, 56)보다는 13점 낮습니다

➤ GPT-6 Luna 대비 많은 토큰 사용: Haiku 5.5(max)는 Intelligence Index 작업당 ~162k 출력 토큰을 사용하며, 이는 GPT-6 Luna(max, ~50k)의 약 3배입니다. xhigh에서 max로 올리면 약 1.8배의 토큰으로 2점이 추가됩니다. 비슷한 지능 수준에서도 GPT-6 Luna보다 더 많은 토큰을 사용합니다: Haiku 5.5(high)는 작업당 ~55k 토큰으로 38점을 기록하는 반면 Luna(max)는 ~50k 토큰으로 38점을 기록하며, 낮은 effort 설정에서는 격차가 더 벌어집니다

➤ 에이전틱 지식 작업에서 뛰어난 능력: 현실적인 지식 작업 과제를 위한 저희의 비공개 평가인 AA-Briefcase에서 Haiku 5.5(max)는 1578 Elo에 도달하여 Kimi K3 및 GLM-5.3을 포함한 모델들을 앞서며, Muse Spark 1.3(max)과 비슷한 수준입니다

➤ 터미널 사용 개선: Terminal-Bench 4.0에서 33%를 기록하여 Haiku 4.5의 0%에서 상승했습니다. 이는 GLM-5.3 Flash와 동일하며, Gemini 3.8 Flash(20%)와 GPT-6 Luna(13%)보다 앞섭니다

➤ 낮은 사실 지식, 그러나 상대적으로 낮은 환각: 소형 클래스 모델에서 예상되듯 Haiku 5.5는 같은 계열 모델들보다 사실 지식이 낮습니다. AA-Omniscience 정확도는 36%로, Gemini 3.8 Flash의 55%, GPT-6 Luna의 44%에 미치지 못하지만, 이는 모를 때 인정하려는 의지가 더 강하기 때문이기도 합니다 - 환각률은 40%로 55%와 77%보다 낮습니다

➤ AutomationBench-AA 결과는 과소평가되었을 가능성: Haiku 5.5는 35%를 기록한 반면, GPT-6 Luna, Gemini 3.8 Flash, GLM-5.3 Flash는 53–60%를 기록했습니다. 사전 출시 테스트 중 안전 거부 문제로 모델이 과도하게 거부했습니다. Anthropic이 이 문제 해결을 진행 중이며, 저희는 수정 사항이 적용된 상태로 이 평가를 재실행할 예정이고 이 점수가 상승할 것으로 예상합니다

기타 모델 세부 사항:

➤ 컨텍스트 윈도우: 100만 토큰으로, Claude 4.5 Haiku의 200k에서 상향되었습니다

➤ 요금: 100k 토큰까지 1M 입출력 토큰당 $0.10/$0.50, 100k 초과 시 $0.50/$2.50. 캐시 읽기 $0.01(100k 초과 시 $0.05), 5분 캐시 쓰기 $0.125(100k 초과 시 $0.625)

➤ 멀티모달: 텍스트 및 이미지 입력, 텍스트 출력

원문 출처

Artificial Analysis · X

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요