Artificial Analysis · X

Anthropic a publié Claude Haiku 5.5, obtenant un score de 43 sur l'Indice d'Intelligence d'Artificial Analysis - en hausse de 26 points un…

Anthropic a publié Claude Haiku 5.5, obtenant un score de 43 sur l'Artificial Analysis Intelligence Index - en hausse de 26 points un an après la dernière sortie de Haiku. Haiku 5.5 est le premier modèle Haiku avec les…

Source de l’image · Artificial Analysis · X

Anthropic a publié Claude Haiku 5.5, obtenant un score de 43 sur l'Indice d'Intelligence d'Artificial Analysis - en hausse de 26 points un an après la dernière sortie de Haiku

Haiku 5.5 est le premier modèle Haiku avec les paramètres d'effort et la réflexion adaptative d'Anthropic, et Anthropic a introduit une tarification par paliers.

Haiku 5.5 est moins cher que son prédécesseur - il coûte $0.10/$0.50 par 1M de tokens d'entrée/sortie pour les prompts jusqu'à 100k tokens (le même prix que GPT-6 Luna et 10% du modèle Haiku précédent). Cependant, cette tarification est multipliée par 5 pour atteindre $0.50/$2.50 au-delà de 100k. Le site ne reflète pas encore la tarification par paliers, donc les chiffres de coûts provisoires pour Haiku 5.5 n'incluent pas le supplément de coût. Nous travaillons sur la prise en charge et publierons prochainement une couverture Cost per Task.

Points clés :

➤ Performance de premier plan parmi les modèles de petite classe : à effort maximum, Haiku 5.5 se situe légèrement devant des modèles tels que GLM-5.3 Flash (42), Gemini 3.8 Flash (41) et GPT-6 Luna (38). Son score est comparable à celui de Kimi K3 (44), un modèle à poids ouverts de 2.8T paramètres, et il est à 13 points derrière Claude Sonnet 5.5 (max, 56)

➤ Utilisation élevée de tokens par rapport à GPT-6 Luna : Haiku 5.5 (max) utilise environ 162k tokens de sortie par tâche de l'Indice d'Intelligence, soit environ 3x GPT-6 Luna (max, ~50k). Passer de xhigh à max ajoute 2 points pour environ 1.8x les tokens. À intelligence similaire, il utilise également plus de tokens que GPT-6 Luna : Haiku 5.5 (high) obtient 38 avec ~55k tokens par tâche contre 38 avec ~50k pour Luna (max), et l'écart se creuse aux paramètres d'effort plus bas

➤ Très performant dans le travail cognitif agentique : sur AA-Briefcase, notre évaluation privée des tâches réalistes de travail cognitif, Haiku 5.5 (max) atteint 1578 Elo, devant des modèles tels que Kimi K3 et GLM-5.3, et comparable à Muse Spark 1.3 (max)

➤ Améliorations de l'utilisation du terminal : sur Terminal-Bench 4.0, il obtient 33 %, contre 0 % pour Haiku 4.5. Cela le place au niveau de GLM-5.3 Flash, et devant Gemini 3.8 Flash (20 %) et GPT-6 Luna (13 %)

➤ Connaissances factuelles plus faibles, mais hallucinations relativement rares : comme prévu pour un modèle de classe plus petite, Haiku 5.5 a des connaissances factuelles inférieures à celles de ses homologues. La précision sur AA-Omniscience est de 36 %, contre 55 % pour Gemini 3.8 Flash et 44 % pour GPT-6 Luna, mais cela s'explique en partie par une plus grande disposition à admettre qu'il ne sait pas - son taux d'hallucination est plus faible, à 40 % contre 55 % et 77 %

➤ Résultat sur AutomationBench-AA probablement sous-estimé : Haiku 5.5 obtient 35 %, contre 53–60 % pour GPT-6 Luna, Gemini 3.8 Flash et GLM-5.3 Flash. Lors des tests de pré-version, un problème de refus de sécurité a amené le modèle à refuser excessivement. Anthropic travaille à la résolution de ce problème - nous réexécuterons cette évaluation avec le correctif et nous attendons à ce que ce score augmente

Autres détails du modèle :

➤ Fenêtre de contexte : 1 million de tokens, contre 200k pour Claude 4.5 Haiku

➤ Tarification : $0.10/$0.50 par 1M de tokens d'entrée/sortie jusqu'à 100k tokens, $0.50/$2.50 au-delà. Lectures de cache $0.01 ($0.05 au-delà de 100k), écritures de cache de 5 minutes $0.125 ($0.625 au-delà de 100k)

➤ Multimodalité : entrée texte et image, avec sortie texte

Source originale

Artificial Analysis · X

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original