Anthropic a publié Claude Haiku 5.5, son plus petit modèle le moins cher et le plus rapide à ce jour. Il cible les charges de travail à fort volume comme les résumés, la compaction, la classification et les tâches de sous-agents. Il conserve une fenêtre de contexte de 1M de tokens et jusqu'à 128K tokens de sortie. Le prix démarre à 0,10 $ par million de tokens d'entrée et 0,50 $ par million de tokens de sortie. C'est 90 % moins cher que Claude Haiku 4.5 pour les prompts allant jusqu'à 100K tokens.
Est-il déployable ? Oui, sous forme d'API hébergée. Haiku 5.5 est généralement disponible sur l'API Claude, Amazon Bedrock, Google Cloud, Microsoft Foundry et Claude Platform on AWS.
Ce qu'Anthropic a livré
Haiku 5.5 est le premier modèle de classe Haiku avec un réglage d'effort ajustable. La pensée adaptative est activée par défaut, et le paramètre d'effort a pour valeur par défaut medium.
Il accepte du texte et des images, produit du texte, et a une date de coupure des connaissances de juin 2026. Les traitements par lots prennent en charge jusqu'à 300K tokens de sortie en version bêta.
Il est important de noter deux points clés. Les valeurs non par défaut temperature, top_p ou top_k renvoient une erreur 400. Le nouveau tokenizer compte également le même texte comme environ 30 % de tokens en plus que Haiku 4.5. Le guide de migration traite des deux.
Tarification : une structure à 2 paliers
La tarification se divise à 100K tokens de prompt. Jusqu'à 100K, l'entrée coûte 0,10 $ et la sortie 0,50 $ par million. Les lectures de cache coûtent 0,01 $ et les écritures de cache de 5 minutes 0,125 $. Au-delà de 100K, les tarifs passent à 0,50 $ en entrée et 2,50 $ en sortie.
Haiku 4.5 facturait 1 $ en entrée et 5 $ en sortie. Anthropic indique qu'environ 90 % des requêtes de Haiku 4.5 restaient sous 100K tokens. Après ajustement pour le tokenizer, l'entreprise estime que Haiku 5.5 tourne en moyenne environ 75 % moins cher. Le traitement par lots permet une réduction supplémentaire de 50 %.
GPT-6 Luna affiche des tarifs identiques pour les contextes courts. Son palier supérieur ne commence qu'au-dessus de 272K tokens d'entrée, à 0,20 $ et 0,75 $. Pour un prompt de 150K tokens, Luna est moins cher en tarif affiché.
Benchmarks
Tous les chiffres ci-dessous sont rapportés par Anthropic (voir la fiche système):
- OSWorld 2.1 (sous-ensemble hors ligne) : 72,4 %, contre 48,9 % pour GPT-6 Luna et 15,7 % pour Haiku 4.5.
- Terminal-Bench 4.0 : 39,2 %, contre 16,4 % pour Luna et 0,0 % pour Haiku 4.5.
- FrontierCode 1.1 (Main) : 46,4 %, contre 42,4 % pour Luna.
- Humanity’s Last Exam : 45,9 % sans outils et 57,4 % avec outils.
- GDPval-AA v2.1 : 1620, contre 1437 pour Luna et 735 pour Haiku 4.5.
Sonnet 5.5 domine toujours chaque ligne, y compris 70,6 % sur Terminal-Bench 4.0. Anthropic elle-même recommande Sonnet 5.5 et Opus 5.5 pour le codage agentique complexe.
Meilleurs cas d'usage
Trois charges de travail correspondent le mieux à Haiku 5.5 :
- La première est le travail de sous-agent sous Opus 5.5 ou Sonnet 5.5. Chez Rogo, un sous-agent Haiku 5.5 extrait une ligne de revenus d'un 10-K pendant qu'un modèle plus gros construit la présentation.
- La deuxième est la questions-réponses et la synthèse de documents à fort volume. AlphaSense l'a testée sur une fonctionnalité traitant environ 8M d'appels par semaine.
- La troisième est le travail sensible à la vitesse comme le support client en direct et l'utilisation du navigateur.
Haiku 5.5 face à ses concurrents les plus proches
| Fonctionnalité | Claude Haiku 5.5 | GPT-6 Luna | Gemini 3.5 Flash-Lite |
|---|---|---|---|
| Entrée / sortie (par 1M) | $0.10 / $0.50 | $0.10 / $0.50 | $0.30 / $2.50 |
| Tarification long prompt | 0,50 $ / 2,50 $ au-delà de 100K | 0,20 $ / 0,75 $ au-delà de 272K | Tarif fixe |
| Lecture du cache (par 1M) | $0.01 | $0.01 | 0,03 $ + stockage |
| Fenêtre de contexte | 1M de tokens | 1 050 000 tokens | 1 048 576 tokens |
| Sortie maximale | 128K tokens | 128 000 tokens | 65 536 tokens |
| Entrées | Texte, images | Texte, images | Texte, image, vidéo, audio, PDF |
| Contrôle du raisonnement | Réflexion adaptative + effort (moyen par défaut) | reasoning.effort de none à max (moyen par défaut) | Réflexion prise en charge |
| Utilisation de l'ordinateur | Prise en charge du SDK en version bêta | Pris en charge (API Responses) | Pris en charge (Aperçu) |
| Remise par lot | 50% | 50 % (Batch et Flex) | 50% |
| Date de coupure des connaissances | Juin 2026 | 18 mai 2026 | Non répertorié sur la page du modèle |
| Où l'exécuter | Claude API, Bedrock, Google Cloud, Microsoft Foundry, Claude Platform on AWS | OpenAI API | Gemini API |
Sources : Documentation Anthropic, Annonce d'Anthropic, Page du modèle OpenAI, Tarification OpenAI, Page du modèle Google, Tarification Google. Prix publics de niveau standard, vérifiés le 7 octobre 2026.
Explication interactive
Points clés
- 0,10 $ en entrée et 0,50 $ en sortie par 1M de tokens pour les prompts allant jusqu'à 100K tokens.
- Contexte de 1M, sortie de 128K, réflexion adaptative avec un paramètre d'effort (par défaut
medium). - 72,4 % sur OSWorld 2.1 contre 15,7 % pour Haiku 4.5 (selon Anthropic).
- Même prix public en contexte court que GPT-6 Luna ; Luna est moins cher au-delà de 100K tokens.
- Positionné comme un sous-agent sous Opus 5.5 et Sonnet 5.5, et non comme un responsable du code.
Découvrez les Détails techniques. Tout le crédit revient au chercheur de ce projet. Par ailleurs, n'hésitez pas à nous suivre sur Twitter et n'oubliez pas de rejoindre notre SubReddit ML de plus de 150k et de vous abonner à notre Newsletter. Attendez ! êtes-vous sur telegram ? vous pouvez désormais nous rejoindre également sur telegram.
L'article Anthropic publie Claude Haiku 5.5 : un petit modèle avec 1M de contexte au prix de $0.10 par million de tokens d'entrée est applué pour la première fois sur MarkTechPost.