작성자丨정자메이(郑佳美)
편집丨셍 펑(岑峰)
방금 Anthropic이 Claude Haiku 5.5를 공개했다. 이번 업그레이드의 폭은 작지 않다. 특히 컴퓨터 조작 분야에서 OSWorld 2.1 평가 점수가 이전 세대의 15.7%에서 72.4%로 향상되었다. 지식 노동과 복잡한 추론 능력도 뚜렷한 개선을 보였으며, Anthropic이 공개한 데이터에 따르면 신모델의 평균 실행 비용도 약 75% 하락했다. 그 외에도 Haiku 5.5는 적응형 추론 메커니즘을 도입하고 100만 Token 컨텍스트를 지원한다. 과거 Haiku는 주로 요약, 분류, 정보 추출 같은 고빈도 작업을 처리하는 데 사용되었으며, 장점은 줄곧 빠른 속도와 낮은 비용이었다. 이번 업데이트 이후 처리할 수 있는 작업은 한층 복잡해졌고, 일부 평가 점수는 이미 Sonnet 5.5에 근접하기도 한다. 다만 복잡한 코딩 작업으로 바꾸면 두 모델 간 격차는 여전히 뚜렷하다. 다시 이번 업데이트의 추론 메커니즘과 가격 규칙을 보면, Haiku 5.5가 서로 다른 작업에서 보이는 성능과 실제 사용 비용에는 사실 세부적으로 살펴야 할 부분이 많다.
01
복잡한 코딩에는 여전히 격차
Haiku 5.5의 성능 향상은 주로 컴퓨터 조작, 지식 노동, 다학제 추론 방향에서 나타났으며, 그중에서도 컴퓨터 조작의 변화가 특히 두드러진다. 라이펑왕(雷峰网, 공식 계정: 雷峰网)에 따르면 OSWorld 2.1 오프라인 서브셋에서 Haiku 5.5는 72.4%를 기록했고, 이전 세대는 15.7%에 불과했으며, Sonnet 5.5는 83.9%에 도달했다. OSWorld는 모델이 컴퓨터 인터페이스를 통해 장기 연쇄 작업을 완수하는 능력을 시험하며, 인터페이스 이해, 조작 실행, 환경 피드백에 따라 작업을 계속 수행하는 것이 포함된다. 일반 텍스트 질의응답과 비교할 때, 컴퓨터 조작은 더 많은 상태 의존성이 존재한다. 모델이 한 번의 클릭이나 입력을 완료한 후 페이지가 변경될 수 있으며, 이후 동작은 새로운 인터페이스 상태에 따라 결정되어야 한다. 조작이 실패하면 모델은 현재 환경이 여전히 작업 요구 사항에 부합하는지 판단해야 한다. 이 평가에서 Haiku 5.5의 성장은 연속 조작 작업을 처리하는 능력이 이전 세대에 비해 뚜렷이 개선되었음을 보여준다. 하지만 72.4%는 특정 테스트 세트에서의 완수율에 해당하며, 모든 브라우저나 데스크톱 작업의 실제 성공률을 직접 대표할 수 없다. 실제 업무에서의 동적 페이지, 권한 제한, 예외 상태는 여전히 해당 환경에서 별도로 테스트해야 한다. 지식 노동 분야에서 Haiku 5.5는 GDPval-AA v2.1에서 1620점을 획득했으며, Haiku 4.5는 735점, Sonnet 5.5는 1840점이었다. 이 평가는 44개 직군의 실제 업무 과제를 다루며, 자료 분석, 정보 통합, 업무 결과물 생성이 포함된다. 또 다른 AA-Briefcase v1.1 평가에서 Haiku 5.5는 이전 세대의 614점에서 1578점으로 향상되었다. 다학제 추론 테스트인 Humanity's Last Exam의 도구 미사용 점수는 45.9%에 도달했고, 도구 연결 후에는 57.4%로 이전 세대보다 명백히 높았다. 이러한 평가가 다루는 과제는 일반적인 정보 추출보다 더 복잡하다. 모델은 여러 정보원 간의 관계를 이해하고, 자료 속 제약 조건을 처리하며, 기존 내용에 근거해 결과를 형성해야 한다. 도구의 도입은 정보 획득과 결과 통합 단계를 더했다. 다만 코딩 평가는 다른 양상을 보인다. FrontierCode 1.1 메인 테스트에서 Haiku 5.5는 46.4%를 기록해 Sonnet 5.5의 52.1%와 격차가 작았다. 그러나 Terminal-Bench 4.0에서 Haiku 5.5는 39.2%를 기록한 반면, Sonnet 5.5는 70.6%에 도달했다. Terminal-Bench는 명령줄 환경에서의 복잡한 다단계 작업을 다루며, 모델은 통상 파일을 읽고, 명령을 실행하고, 오류를 처리하고, 테스트 피드백에 따라 조작을 조정해야 한다. 이는 지속적인 계획과 실행 상태 유지에 대한 요구가 높다. Anthropic도 발표 자료에서 Sonnet 5.5와 Opus 5.5가 여전히 복잡한 에이전트 코딩 작업에 더 적합하며, Haiku 5.5는 주로 범위가 명확한 하위 작업, 요약, 컨텍스트 압축 등의 업무를 겨냥한다고 명확히 지적했다. 기업들의 초기 테스트는 더 구체적인 데이터를 제공했다. Asana는 AI Teammates 관련 테스트에서 Haiku 5.5의 작업 완료 지연이 기존 사용 모델 대비 30% 이상 감소했고, 단일 라운드 추론 속도는 최대 2.5배 향상되었다고 보고했다. HubSpot은 시뮬레이션 CRM 환경에서 세 번의 실행 평균 92.8%의 성적을 측정했으며, AlphaSense는 400회 문서 질의응답 테스트에서 Haiku 5.5의 점수가 0.84, 이전 세대는 0.76임을 측정했다. 이러한 결과는 서로 다른 기업의 내부 테스트에서 나온 것으로, 각기 다른 과제와 평가 기준을 채택했으므로 특정 업무 시나리오에서의 성능을 파악하는 데 적합할 뿐, 통일된 모델 능력 순위로 직접 삼을 수는 없다.02
적응형 추론이 Haiku에 도입되다
성능 변화 외에도 Haiku 5.5는 조절 가능한 추론 강도를 지원하는 최초의 Haiku 모델이 되었다. 라이펑왕(雷峰网) 기준으로 이전 Haiku 4.5는 확장 사고 기능을 사용할 때 개발자가 고정된 내부 추론 예산을 미리 설정해야 했다. 과제가 단순한 정보 검색이든 여러 조건을 수반하는 복잡한 분석이든, 모델이 사용할 수 있는 추론 공간은 사전에 설정된 수치로 제한되었다. Haiku 5.5는 Adaptive Thinking으로 전환했다. 모델은 과제 내용에 따라 내부 추론 사용 여부와 투입할 연산량을 결정할 수 있고, 개발자는 Effort 설정으로 전체 추론 강도를 조절한다. 예를 들어 문서에서 날짜를 추출하는 것은 대개 긴 시간의 분석이 필요 없지만, 여러 계약서 버전 간 조항 차이를 비교하는 것은 더 많은 조건과 상호 연관된 정보를 동시에 처리해야 한다. 적응형 추론은 모델이 이 두 유형의 과제에서 서로 다른 연산 투입을 취할 수 있게 한다. 이 메커니즘은 추론 시 연산 자원의 할당과도 관련된다. 복잡한 과제의 경우 내부 추론을 늘리면 모델이 더 많은 중간 단계를 처리할 수 있지만, 더 긴 추론 과정은 Token 소비와 응답 시간도 증가시킨다. 단순한 과제의 경우 내부 추론을 줄이면 불필요한 연산 비용을 낮출 수 있다. Anthropic은 발표 페이지에서 서로 다른 추론 강도에서 Haiku 5.5가 OSWorld, GDPval-AA, Humanity's Last Exam에서 보이는 비용과 성능의 관계를 보여주었다. 다만 서로 다른 과제가 추가 추론 연산에 반응하는 정도가 일치하지 않으므로, 추론 단계를 높이는 것을 고정된 폭의 성능 향상으로 직접 동일시할 수는 없다. API 차원에서도 처리해야 할 변화가 몇 가지 있다. 첫째, Haiku 5.5는 더 이상 이전 세대의 고정 사고 Token 수를 수동으로 지정하는 방식을 사용하지 않으므로, 기존의 추론 설정을 조정해야 한다. 둘째, 내부 추론은 모델의 출력 Token 예산을 차지한다. 기존 프로그램이 최종 답변 길이만으로 출력 상한을 설정했다면, 업그레이드 후 내부 추론이 과도한 공간을 차지해 본문이 완전하게 생성되지 못하는 상황이 발생할 수 있다. 또한 적응형 추론을 활성화하면 모델 응답에 독립적인 사고 데이터 블록이 포함될 수 있다. 애플리케이션은 내부 추론 내용과 최종 출력을 올바르게 구분해야 하며, 반환 내용의 시작 부분이 반드시 답변이라고 가정하는 방식을 계속 사용할 수 없다. 도구를 지속 사용하는 에이전트의 경우, 추론 데이터와 대화 이력 간에 일관성 요구 사항도 존재한다. 개발자가 이후 요청에서 기존 이력 메시지를 수정하면 기존 추론 상태의 유효성에 영향을 미칠 수 있다. Haiku 5.5는 일부 샘플링 파라미터에도 제한을 추가했으므로, 기존에 이 파라미터들로 출력 동작을 조정하던 애플리케이션은 인터페이스 호환성을 점검해야 한다. 이러한 변화는 주로 Haiku 4.5의 확장 사고 기능을 이미 사용 중인 프로젝트에 영향을 미친다. 마이그레이션 시 모델 버전 교체 외에도 추론 예산, 응답 파싱, 다중 라운드 메시지 처리 방식을 다시 점검해야 한다.03
백만 컨텍스트에는 획일적인 저렴한 가격이 없다
Haiku 5.5는 100만 Token 컨텍스트와 12.8만 Token 출력을 지원하며, 긴 문서, 대형 코드 내용, 지속 실행되는 도구 기록 등을 처리할 수 있다. 다만 Anthropic은 전체 컨텍스트 윈도우에 대해 획일적인 저렴한 가격을 설정하지 않았다. 10만 Token을 초과하지 않는 프롬프트의 경우, 백만 입력 Token당 0.10달러, 백만 출력 Token당 0.50달러를 청구한다. 프롬프트가 10만 Token을 초과하면 입력 가격은 0.50달러로, 출력 가격은 2.50달러로 인상된다. 캐시 비용도 계층화 방식을 채택한다. 짧은 프롬프트의 백만 Token당 캐시 읽기 가격은 0.01달러, 긴 프롬프트는 0.05달러이다. 전체 내용을 반복해서 전달하는 것에 비해, 캐시는 시스템 지침, 도구 정의, 공용 자료의 재사용에 적합하다. Anthropic에 따르면 Haiku 4.5 요청의 약 90%가 길이 10만 Token 이내에 분포한다. 이 부분의 요청은 새 요금 체계에서 상당한 가격 인하를 얻었지만, 실제 비용은 Token 사용량 변화의 영향도 받는다. Haiku 5.5는 토크나이저를 업데이트했으므로, 동일한 내용에 해당하는 Token 수가 이전 세대와 다를 수 있다. 따라서 입력 텍스트에 변화가 없더라도 업그레이드 후 실제 과금 수량이 변할 수 있으므로 재측정이 필요하다. 장시간 실행되는 에이전트의 경우, 컨텍스트 관리가 비용에 더 큰 영향을 미친다. 예를 들어 하나의 코딩 과제에서 파일 검색 결과, 코드 분석 기록, 테스트 로그가 연속해서 생성될 수 있다. 매 호출마다 전체 이력을 함께 전달하면, 입력 길이는 과제 진행에 따라 지속적으로 증가한다. Prompt Caching은 반복되는 내용의 읽기 비용을 낮출 수 있고, Compaction은 완료된 작업을 더 짧은 과제 상태로 정리해 이후 호출에서 처리해야 할 이력 정보를 줄일 수 있다. Anthropic은 발표 자료에서 컨텍스트 압축을 Haiku 5.5의 주요 적용 시나리오 중 하나로 꼽았다. 구체적인 배치 사례로, Rogo는 Haiku 서브 에이전트를 사용해 기업 10-K 문서에서 매출 데이터를 추출하고, 이후 프레젠테이션 제작은 더 큰 모델이 담당하는 사례를 보고했다. Cognition은 Haiku 5.5를 Devin Fusion의 보조 모델로 사용했으며, Opus 5.5 주도의 구성에서 FrontierCode 점수가 66.2%에 도달했고 비용과 지연이 감소했다고 보고했다. 이러한 사례들은 서로 다른 모델로 서로 다른 과제를 처리하는 방식을 채택했지만, 발표 자료는 완전한 호출 횟수, Token 분포, 비용 명세를 제공하지 않으므로, 일반 업무가 동일한 아키텍처를 채택했을 때의 절감 폭을 이를 근거로 계산할 수는 없다. 이번에 Anthropic은 Sonnet 5.5의 캐시 읽기 가격도 50% 인하하여, 백만 Token당 0.20달러에서 0.10달러로 조정했다. Anthropic의 통계에 따르면 이로써 Sonnet 5.5의 대부분의 에이전트 과제에서 실행 비용이 약 20% 하락한다. 이 조정은 캐시 읽기 비용에만 관련되며, 입력과 출력 Token의 표준 가격은 동일한 비율로 동반 인하되지 않았다.04
마이그레이션 시에도 실제 과제 성능을 점검해야
Claude Haiku 5.5는 Claude API, AWS, Google Cloud, Microsoft Azure 등의 플랫폼을 통해 제공되고 있으며, Anthropic은 동시에 Python 및 TypeScript SDK 업데이트를 시작하여 컴퓨터 조작과 브라우저 조작에 베타 지원을 추가했습니다. 현재 공개된 데이터에 따르면 Haiku 5.5는 컴퓨터 조작, 지식 노동 및 다학제 추론 평가에서 이전 세대보다 확연히 높은 성적을 보였지만, 복잡한 터미널 프로그래밍에서는 여전히 Sonnet 5.5와 큰 격차가 있습니다. 가격 측면에서는 짧은 프롬프트일수록 더 뚜렷한 비용 우위를 얻을 수 있으며, 10만 Token을 초과하면 별도의 요금 기준이 적용됩니다. 기존의 Haiku 4.5 애플리케이션의 경우 마이그레이션에는 추론 설정, Token 계산 및 응답 파싱 등의 구체적인 수정이 필요합니다. 기존에 Sonnet으로 일부 고빈도 작업을 처리하던 경우라면, 동일한 테스트 세트를 기준으로 Haiku 5.5의 완료율, 응답 시간 및 호출 비용을 비교해볼 수도 있습니다. Anthropic은 이미 모델 능력, 인터페이스 변경 및 가격 정보를 제공했지만, 실제 비즈니스에서의 비용 개선은 해당 워크로드를 통해 검증해야 합니다. 특히 다중 턴 도구 호출 시나리오에서는 모델의 요청당 가격, 작업 실패 후의 재시도 횟수, 그리고 컨텍스트 증가 상황을 하나의 완전한 작업 안에서 함께 계산해야 합니다.지금 탑승하세요, 전 세계 AI 주요 학회의 핵심을 모두 보여드립니다
독점적으로 감상 가능:
전문가 발표 PPT
컨퍼런스 보고서 전문
인기 논문 해설
학계 신성 인터뷰
위 QR코드를 스캔하거나
「阅读原文(원문 보기)」을 클릭하여 전용 페이지를 팔로우하세요.
레이펑왕(雷峰网) 오리지널 기사이며, 무단 전재를 금지합니다. 자세한 내용은전재 안내를 참조하세요。