Auteur丨Zheng Jiamei
Révision丨Cen Feng
À l'instant, Anthropic a publié Claude Haiku 5.5. Cette mise à niveau est considérable, notamment en ce qui concerne l'utilisation de l'ordinateur : le score d'évaluation OSWorld 2.1 est passé de 15.7 % pour la génération précédente à 72.4 %. Les capacités de travail intellectuel et de raisonnement complexe se sont également nettement améliorées, et selon les données publiées par Anthropic, le coût moyen d'exécution du nouveau modèle a en outre baissé d'environ 75 %. Par ailleurs, Haiku 5.5 intègre un mécanisme de raisonnement adaptatif et prend en charge un contexte de 1,000,000 de tokens. Par le passé, Haiku servait principalement à traiter des tâches fréquentes comme le résumé, la classification et l'extraction d'informations, son atout ayant toujours été la rapidité et le faible coût. Après cette mise à jour, il peut traiter des travaux nettement plus complexes, et certains résultats d'évaluation approchent même ceux de Sonnet 5.5. Toutefois, pour les tâches de programmation complexes, l'écart entre les deux reste manifeste. Si l'on examine le mécanisme de raisonnement et les règles tarifaires de cette mise à jour, les performances de Haiku 5.5 selon les différentes tâches et son coût d'utilisation réel recèlent encore bien des détails à examiner de près.
01
Un écart subsiste en programmation complexe
La croissance des performances de Haiku 5.5 se manifeste principalement dans l'utilisation de l'ordinateur, le travail intellectuel et le raisonnement multidisciplinaire, l'évolution étant particulièrement marquée pour l'utilisation de l'ordinateur. 雷峰网 Sur le sous-ensemble hors ligne d'OSWorld 2.1, Haiku 5.5 obtient 72,4 %, contre seulement 15,7 % pour la génération précédente, tandis que Sonnet 5.5 atteint 83,9 %. OSWorld teste la capacité du modèle à accomplir des tâches à long enchaînement via une interface informatique, impliquant la compréhension de l'interface, l'exécution des opérations et la poursuite de la tâche selon les retours de l'environnement. Par rapport au questionnaire textuel classique, l'utilisation de l'ordinateur présente davantage de dépendances d'état. Après un clic ou une saisie, la page peut changer, et les actions suivantes doivent être décidées en fonction du nouvel état de l'interface. Si une opération échoue, le modèle doit également juger si l'environnement actuel répond toujours aux exigences de la tâche. La progression de Haiku 5.5 dans cette évaluation montre que sa capacité à traiter des tâches d'opérations consécutives s'est nettement améliorée par rapport à la génération précédente. Mais 72,4 % correspond à un taux d'accomplissement sur un jeu de tests spécifique et ne peut pas représenter directement le taux de réussite réel de toutes les tâches de navigateur ou de bureau. Les pages dynamiques, les restrictions de permissions et les états anormaux des activités réelles doivent encore être testés séparément dans les environnements correspondants. Concernant le travail intellectuel, Haiku 5.5 obtient 1620 points sur GDPval-AA v2.1, contre 735 points pour Haiku 4.5 et 1840 points pour Sonnet 5.5. Cette évaluation couvre des tâches professionnelles réelles dans 44 catégories de métiers, impliquant l'analyse de documents, l'intégration d'informations et la génération de livrables. Dans une autre évaluation, AA-Briefcase v1.1, Haiku 5.5 passe de 614 points pour la génération précédente à 1578 points. Au test de raisonnement multidisciplinaire Humanity's Last Exam, le score sans outils atteint 45,9 %, et 57,4 % avec outils, également nettement supérieur à la génération précédente. Les tâches de ces évaluations sont plus complexes que la simple extraction d'informations. Le modèle doit comprendre les relations entre plusieurs sources d'informations, gérer les contraintes des documents et produire un résultat à partir du contenu existant. L'introduction d'outils ajoute en outre des étapes d'acquisition d'informations et d'intégration des résultats. Cependant, les évaluations de programmation présentent une situation différente. Dans le test principal de FrontierCode 1.1, Haiku 5.5 obtient 46,4 %, avec un écart relativement faible face aux 52,1 % de Sonnet 5.5. Mais dans Terminal-Bench 4.0, Haiku 5.5 obtient 39,2 %, tandis que Sonnet 5.5 atteint 70,6 %. Terminal-Bench implique des tâches complexes en plusieurs étapes dans un environnement de ligne de commande, où le modèle doit généralement lire des fichiers, exécuter des commandes, gérer les erreurs et ajuster ses opérations selon les retours des tests. Les exigences en matière de planification continue et de maintenance de l'état d'exécution y sont élevées. Anthropic a également indiqué explicitement dans son document de publication que Sonnet 5.5 et Opus 5.5 restent plus adaptés aux tâches de programmation agentique complexes, tandis que Haiku 5.5 vise principalement les sous-tâches au périmètre défini, le résumé et la compression de contexte. Les premiers tests effectués par des entreprises fournissent davantage de données concrètes. Asana rapporte que, dans les tests liés à AI Teammates, la latence d'achèvement des tâches de Haiku 5.5 a diminué de plus de 30 % par rapport à son modèle actuellement utilisé, et la vitesse de raisonnement en une seule passe a augmenté jusqu'à 2,5 fois. HubSpot, dans un environnement CRM simulé, a mesuré un score moyen de 92,8 % sur trois exécutions, tandis qu'AlphaSense, sur 400 tests de questions-réponses documentaires, a mesuré un score de 0,84 pour Haiku 5.5, contre 0,76 pour la génération précédente. Ces résultats proviennent de tests internes de différentes entreprises, avec des tâches et des critères d'évaluation distincts ; ils conviennent pour comprendre les performances dans des scénarios d'affaires spécifiques, mais ne peuvent pas servir directement de classement unifié des capacités des modèles.02
Le raisonnement adaptatif arrive dans Haiku
Outre les changements de performances, Haiku 5.5 devient également le premier modèle Haiku à prendre en charge une intensité de raisonnement réglable. 雷峰网 (公众号:雷峰网) Auparavant, avec Haiku 4.5, lors de l'utilisation de la fonction de réflexion étendue, les développeurs devaient définir à l'avance un budget de raisonnement interne fixe. Que la tâche soit une simple recherche d'information ou une analyse complexe impliquant plusieurs conditions, l'espace de raisonnement disponible pour le modèle était limité par la valeur préétablie. Haiku 5.5 adopte désormais Adaptive Thinking. Le modèle peut décider, selon le contenu de la tâche, s'il utilise le raisonnement interne et combien de calcul y consacrer, tandis que les développeurs définissent l'intensité globale de raisonnement via Effort. Par exemple, extraire une date d'un document ne nécessite généralement pas d'analyse prolongée, tandis que comparer les différences de clauses entre plusieurs versions d'un contrat exige de traiter simultanément davantage de conditions et d'informations interdépendantes. Le raisonnement adaptatif permet au modèle d'adopter des investissements de calcul différents pour ces deux types de tâches. Ce mécanisme implique également l'allocation des ressources de calcul au moment du raisonnement. Pour les tâches complexes, augmenter le raisonnement interne permet au modèle de traiter davantage d'étapes intermédiaires, mais un processus de raisonnement plus long augmente aussi la consommation de tokens et le temps de réponse. Pour les tâches simples, réduire le raisonnement interne permet de diminuer les coûts de calcul inutiles. Anthropic a présenté sur sa page de publication la relation coût-performance de Haiku 5.5 sous différentes intensités de raisonnement sur OSWorld, GDPval-AA et Humanity's Last Exam. Cependant, les différentes tâches ne réagissent pas uniformément au calcul de raisonnement supplémentaire ; on ne peut pas assimiler l'augmentation du niveau de raisonnement à un gain de performance d'ampleur fixe. Au niveau de l'API, plusieurs changements doivent être traités. Premièrement, Haiku 5.5 ne reprend plus la méthode de la génération précédente consistant à spécifier manuellement un nombre fixe de tokens de réflexion ; les anciennes configurations de raisonnement doivent être ajustées. Deuxièmement, le raisonnement interne consomme le budget de tokens de sortie du modèle. Si le programme existant définit une limite de sortie uniquement selon la longueur de la réponse finale, après la mise à niveau, le raisonnement interne peut occuper trop d'espace et empêcher la génération complète du texte principal. Par ailleurs, avec le raisonnement adaptatif activé, la réponse du modèle peut contenir des blocs de données de réflexion distincts. L'application doit correctement distinguer le contenu du raisonnement interne de la sortie finale, et ne plus supposer que le début du contenu renvoyé est nécessairement la réponse. Pour les agents utilisant des outils de manière continue, il existe également une exigence de cohérence entre les données de raisonnement et l'historique de la conversation. Si un développeur modifie des messages existants de l'historique dans des requêtes ultérieures, la validité de l'état de raisonnement initial peut être affectée. Haiku 5.5 a également ajouté des restrictions sur certains paramètres d'échantillonnage ; les applications qui s'appuyaient sur ces paramètres pour ajuster le comportement de sortie doivent vérifier la compatibilité de l'interface. Ces changements concernent principalement les projets utilisant déjà la fonction de réflexion étendue de Haiku 4.5. Lors de la migration, outre le remplacement de la version du modèle, il faut également revérifier le budget de raisonnement, l'analyse des réponses et le traitement des messages multi-tours.03
Pas de prix bas unifié pour le contexte d'un million de tokens
Haiku 5.5 prend en charge un contexte de 100 万 Token et une sortie de 12.8 万 Token, pouvant traiter des documents longs, du code de grande ampleur ainsi que des journaux d'outils en exécution continue. Cependant, Anthropic n'a pas établi de prix bas uniforme pour l'ensemble de la fenêtre de contexte. Pour les prompts ne dépassant pas 10 万 Token, le tarif est de 0.10 dollar par million de Tokens d'entrée et de 0.50 dollar par million de Tokens de sortie. Lorsque le prompt dépasse 10 万 Token, le prix d'entrée passe à 0.50 dollar et le prix de sortie à 2.50 dollars. Les frais de cache suivent également une tarification par paliers. Pour les prompts plus courts, le prix de lecture du cache est de 0.01 dollar par million de Tokens, et de 0.05 dollar pour les prompts plus longs. Plutôt que de transmettre répétitivement le contenu complet, le cache convient à la réutilisation des instructions système, des définitions d'outils et des documents communs. Anthropic indique qu'environ 90 % des requêtes de Haiku 4.5 avaient une longueur inférieure à 10 万 Token. Ces requêtes bénéficient d'une forte baisse de prix sous la nouvelle tarification, mais le coût réel reste influencé par les variations du volume de Tokens utilisés. Haiku 5.5 a mis à jour son tokeniseur, et le nombre de Tokens correspondant à un même contenu peut différer de celui de la génération précédente. Ainsi, même si le texte d'entrée reste inchangé, la quantité réellement facturée après la mise à niveau peut évoluer et doit être remesurée. Pour les agents fonctionnant sur de longues durées, la gestion du contexte influence encore davantage les coûts. Par exemple, une tâche de programmation peut produire successivement des résultats de recherche de fichiers, des journaux d'analyse de code et des journaux de tests. Si chaque appel transporte l'historique complet, la longueur d'entrée augmente continuellement au fur et à mesure de l'avancement de la tâche. Le Prompt Caching permet de réduire les frais de lecture du contenu répétitif, tandis que la Compaction permet de condenser les opérations déjà accomplies en un état de tâche plus court, réduisant ainsi la quantité d'historique à traiter lors des appels suivants. Dans ses documents de publication, Anthropic cite la compression de contexte comme l'un des principaux scénarios d'application de Haiku 5.5. Concernant les déploiements concrets, Rogo a rapporté un cas d'utilisation de sous-agents Haiku pour extraire des données de revenus des documents 10-K d'entreprises, un modèle plus grand étant chargé de la conception ultérieure des présentations. Cognition, de son côté, utilise Haiku 5.5 comme modèle auxiliaire de Devin Fusion : dans une configuration dominée par Opus 5.5, le score FrontierCode atteint 66.2 %, avec une baisse signalée des coûts et de la latence. Ces cas adoptent une approche consistant à confier différentes tâches à différents modèles, mais les documents de publication ne fournissent pas le nombre complet d'appels, la répartition des Tokens ni le détail des coûts, il est donc impossible d'en déduire l'économie réalisée par une activité générale adoptant la même architecture. Anthropic a également réduit de 50 % le prix de lecture du cache de Sonnet 5.5, le faisant passer de 0.20 dollar à 0.10 dollar par million de Tokens. Selon les statistiques d'Anthropic, cela fait baisser d'environ 20 % le coût d'exécution de Sonnet 5.5 dans la plupart des tâches d'agents. Cet ajustement ne concerne que les frais de lecture du cache ; les prix standard des Tokens d'entrée et de sortie n'ont pas baissé dans la même proportion.04
La migration exige toujours de vérifier les performances réelles sur les tâches
Claude Haiku 5.5 est déjà disponible via des plateformes telles que l'API Claude, AWS, Google Cloud et Microsoft Azure, et Anthropic a commencé à mettre à jour les SDK Python et TypeScript, ajoutant une prise en charge bêta des opérations sur ordinateur et du contrôle du navigateur. D'après les données publiées à ce jour, Haiku 5.5 obtient des résultats nettement supérieurs à ceux de la génération précédente dans les évaluations portant sur les opérations sur ordinateur, le travail cognitif et le raisonnement pluridisciplinaire, mais il conserve un écart important avec Sonnet 5.5 en matière de programmation complexe en terminal. Concernant les tarifs, les prompts plus courts bénéficient d'un avantage de coût plus marqué, tandis qu'au-delà de 10 万 tokens s'applique une autre grille tarifaire. Pour les applications existantes reposant sur Haiku 4.5, la migration implique des modifications concrètes concernant la configuration d'inférence, le calcul des tokens et l'analyse des réponses. Si Sonnet était auparavant utilisé pour certaines tâches à haute fréquence, il est également possible de comparer, sur le même jeu de tests, le taux de réussite, le temps de réponse et le coût d'appel de Haiku 5.5. Anthropic a fourni les informations relatives aux capacités du modèle, aux changements d'interface et à la tarification, mais l'amélioration réelle des coûts en production devra encore être validée sur les charges de travail correspondantes. En particulier, dans les scénarios d'appels d'outils en plusieurs tours, le prix d'une requête unique du modèle, le nombre de tentatives après un échec de tâche et la croissance du contexte doivent être évalués au sein d'une même tâche complète.Montez à bord, découvrez avec nous le meilleur des grandes conférences mondiales sur l'IA
Accès exclusif à :
Présentations PPT d'experts
Textes intégraux des rapports de conférence
Analyses d'articles populaires
Entretiens avec les étoiles montantes de la recherche
Scannez le QR code ci-dessus
ou cliquez sur « Lire l'article original » pour suivre la rubrique.
Article original de Lei Feng Wang, reproduction interdite sans autorisation. Voir les détails dansles règles de republication。