La société Anthropic a récemment lancé officiellement Claude Haiku 5.5, le dernier modèle léger de la série Claude 5.5. Pour les requêtes ordinaires allant jusqu'à 10万 tokens, ses prix d'entrée et de sortie descendent respectivement à 0,10 dollar et 0,50 dollar par million de tokens, soit une baisse affichée de 90 % par rapport au modèle précédent.
En tant que modèle au temps de réponse le plus rapide actuellement, Haiku 5.5 mise sur les scénarios à haute concurrence, faible latence et excellent rapport qualité-prix, parfaitement adapté aux tâches à haute fréquence telles que le service client en temps réel, l'extraction de résumés et la classification de données. En outre, le système intègre pour la première fois des fonctions de réflexion adaptative et de réglage dynamique, capables d'équilibrer automatiquement la profondeur de raisonnement et le coût de calcul selon la complexité de la tâche.
Un nouveau mécanisme de tokenisation attire l'attention : la consommation réelle pourrait augmenter les coûts
Cependant, l'éditeur rappelle en même temps que, comme Haiku 5.5 utilise le même nouveau tokenizer que les modèles haut de gamme, le nombre de tokens générés à partir d'un même texte a augmenté. Les tests montrent que les tâches sur de longs textes peuvent consommer 25 % à 30 % de tokens en plus ; ainsi, après prise en compte des charges de travail réelles, la baisse globale des coûts d'exploitation est d'environ 75 %.
Il faut noter que dès qu'une requête dépasse le seuil de 10万 tokens, les prix unitaires d'entrée et de sortie grimpent tous deux à 5 fois le prix de base. Cela signifie que les développeurs, tout en profitant de l'avantage des prix unitaires bas, doivent évaluer précisément la consommation de tokens pour des flux de travail spécifiques, afin d'éviter de tomber dans le piège des coûts cachés.