Par Mengchen depuis Aofeisi
QbitAI | Compte officiel QbitAI
Claude Haiku 5.5 est sorti, la grande contre-attaque des petits modèles !
Rien qu'en termes de scores, il dépasse directement les deux anciennes « lignes d'élimination » DeepSeek V4.1Flash et GLM-5.3-Flash, devenant le nouveau gardien des petits modèles.
Un coup d'œil aux scores officiels : eh bien, c'est clairement visé contre GPT-6 Luna, le battant point par point.
Comme le test du pélicot à vélo est pratiquement saturé, le dernier arrivé sur le champ de bataille est le test du zèbre au galop.
Haiku 5.5 est même aligné prix sur GPT-6 Luna.
Le précédent Haiku 4.5 était sorti il y a tout juste un an, à un prix 10 fois supérieur à celui du 5.5.
Cependant, le prix d'Haiku 5.5 est assorti de conditions : pour les requêtes dont les prompts contiennent moins de 10万 tokens (ce qui représente 90 % du volume de requêtes d'Haiku 4.5), les prix d'entrée et de sortie sont directement réduits de 90 % ; au-delà de 10万 tokens, la réduction n'est que de 50 %.
Du coup, à l'exception de l'entrée avec cache hit, le prix d'Haiku 5.5 est aussi devenu moins cher que DeepSeek-V4.1 Flash.
Désormais, Opus 5.5 gère le raisonnement complexe, Sonnet 5.5 l'exécution générale, Haiku 5.5 le volume et la vitesse : les talents sont tous réunis, ne manque plus que Fable.
On peut juste dire que si OpenAI, son voisin, ne fait pas d'efforts, Claude n'aura pas besoin de sortir l'énorme tube de dentifrice qu'est Fable 5.5.
Comme un retour aux jours où Intel et AMD s'affrontaient sur les CPU.
Nouveau tokenizer, consommation de tokens plus élevée
Haiku 5.5 est le premier modèle Haiku à prendre en charge le réglage de l'effort, héritant des cinq niveaux de configuration de la série, de low à max.
La génération précédente Haiku 4.5 rendait pratiquement copie blanche en matière d'opérations informatiques et de codage, cette génération évolue directement.
Sur OSWorld 2.1 (test d'agents opérant un vrai ordinateur pour accomplir des tâches en plusieurs étapes) : niveau Low 42.0 % de précision, coût unitaire $0.07 ; niveau Max 72.4 %, $0.61. Haiku 4.5 n'avait qu'au niveau Max 15.7 %, $1.45,
Autrement dit, le niveau Low du 5.5 est plus précis que le niveau Max du 4.5, et moitié moins cher.
GDPval-AA v2.1 (test de travail professionnel réel dans 44 métiers) présente une courbe similaire : niveau Low Elo 1125, $0.01 ; niveau Max 1620, $0.87. Le niveau Max du 4.5 n'avait que 735, $0.24.
Cependant, Haiku 5.5 a changé de tokenizer (le même que Sonnet 5.5 et Opus 5.5), et consommera plus de tokens pour la même tâche, donc les économies réelles sont un tout petit peu moindres que la remise affichée.
En particulier pour le code, les tableaux et lescontenus non anglaisl'inflation peut être encore plus élevée.
Dans l'évaluation AA, bien que le prix API d'Haiku 5.5 soit moins cher, le « coût moyen par tâche accomplie » n'atteint pas la fourchette idéale.
Il ne remplace pas Sonnet
Beaucoup espéraient qu'Haiku 5.5 puisse remplacer Sonnet 5.5 sur certaines tâches, afin de réduire encore les coûts.
Mais aucun miracle cette fois : le petit format reste le petit format.
Sur Terminal-Bench 4.0, Haiku 5.5 obtient 39.2 %, Sonnet 5.5 obtient 70.6 %. L'écart est très net en codage complexe multi-étapes, en refactoring multi-fichiers et en planification autonome à long terme.
Anthropic le recommande elle-même : pour le codage agentique complexe, privilégier Sonnet 5.5 ou Opus 5.5.
La valeur de Haiku 5.5 se situe au niveau de l'exécution. Des tâches déjà décomposées, avec des critères d'acceptation clairs et pouvant être exécutées en parallèle.
Par exemple, Devin de Cognition utilise Opus 5.5 comme modèle principal et Haiku 5.5 comme sous-agent ; la combinaison FrontierCode atteint 66.2 %, soit plus que chacun des deux modèles exécuté seul.
Si votre activité utilisait auparavant Haiku 4.5, il ne suffira pas cette fois de changer le nom du modèle pour passer en production.
La configuration de réflexion manuelle via budget_tokens renvoie directement une erreur ; il faut passer à la réflexion adaptative avec le paramètre effort.
temperature, top_p et top_k sont tous verrouillés sur leurs valeurs par défaut ; les applications qui dépendaient des paramètres d'échantillonnage pour le contrôle créatif ou la génération diversifiée doivent revoir leur logique.
Le pré-remplissage des messages assistant a été supprimé ; les écritures qui reposaient auparavant sur le pré-remplissage pour forcer un début en JSON doivent passer aux appels d'outils ou aux interfaces de sortie structurée.
L'outil d'opération sur ordinateur a aussi été mis à jour, passant de computer_20250124 à computer_toolset_20260801 ; le format d'interface et la structure de retour peuvent être différents.
Par ailleurs, la réflexion adaptative est activée par défaut ; le premier bloc de contenu de la réponse peut être un bloc de réflexion plutôt que le corps du texte, la logique d'analyse doit donc filtrer selon le champ type.
Cinq changements, et chacun d'entre eux peut faire échouer une requête avec une erreur directe ou renvoyer une structure inattendue.
Anthropic a fourni un guide de migration ; il est conseillé de le parcourir avant de basculer.
Deux bonus au passage
La lecture du cache de Sonnet 5.5 passe de $0.20/M à $0.10/M ; Anthropic indique que la plupart des tâches d'agents voient ainsi leur coût baisser d'environ 20%.
Les abonnés Max et Team peuvent, à partir de cette semaine, réclamer des crédits API : Max 5x à $100 par mois, Max 20x à $200 par mois, Team jusqu'à $500/mois à partager au sein de l'équipe.
Ces crédits peuvent servir à expérimenter en appelant l'API pour construire des outils, des applications ou des agents, et sont valables pour tous les modèles.
Quoi ? Tu dis que la société A te rembourse l'argent de ton Coding Plan et te permet en plus de l'utiliser encore une fois via l'API ?
Alors, qu'est-ce qu'OpenAI fait pendant ce temps ? OpenAI a encore envoyé une carte de réinitialisation.
Liens de référence :
[1]Voici le lien : https://www.anthropic.com/claude-haiku-5-5
[2]https://x.com/AI_Screening/status/2107906044915749274?s=20