Anthropic publie Haiku 5.5, 75 % moins cher que Haiku 4.5
Anthropic met en ligne le 7 octobre 2026 Claude Haiku 5.5, son petit modèle le plus rapide et le moins cher, facturé jusqu'à 90 % sous Haiku 4.5 pour les requêtes de moins de 100 000 tokens, soit environ 75 % moins cher à l'usage en moyenne. Premier modèle de la classe Haiku doté d'un réglage d'effort, il se place derrière Sonnet 5.5 sur le code d'agentIA agentiqueModèle qui boucle : il choisit une action, le plus souvent un appel d'outil, en lit le résultat, puis recommence jusqu'à l'objectif ou l'abandon. La boucle est ce qui distingue un agent d'une réponse unique.Fiche du lexique complexe, mais Anthropic le destine aux tâches courtes et répétitives qui remplissent les installations d'agents.
par Gyom 9 octobre 2026 à 13:01 4 min de lecture rubrique : Machines et coûts
etiquettes : En entreprise · Hébergé · Coût
Le modèle est disponible sous l'identifiant claude-haiku-5-5 sur la plateforme Claude, dans Claude Code, sur Amazon Bedrock, Google Cloud et Microsoft Foundry, et depuis le 7 octobre dans l'interface de GitHub Copilot. Son prix dépend de la longueur de la requête :
- 0,10 dollar par million de tokens d'entrée et 0,50 dollar par million de tokens de sortie pour les requêtes allant jusqu'à 100 000 tokens, lectures de cache à 0,01 dollar.
- 0,50 dollar et 2,50 dollars au-delà de 100 000 tokens, lectures de cache à 0,05 dollar.
- GitHub applique le prix catalogue de l'éditeur, sans marge propre, pour la sélection du modèle dans Copilot.
90 % moins cher sous 100 000 tokens, environ 75 % en moyenne
Anthropic chiffre l'écart par rapport à Haiku 4.5 : 90 % moins cher pour les requêtes allant jusqu'à 100 000 tokens, 50 % au-delà, et environ 75 % moins cher à l'usage en moyenne sur l'ensemble des requêtes. Le calcul tient compte d'un tokenizer mis à jour, proche de ceux de Sonnet 5.5 et Opus 5.5, qui découpe une même tâche en un peu plus de tokens. Sur Haiku 4.5, l'éditeur indique que 90 % des requêtes tombaient dans la première catégorie.
Un réglage d'effort pour arbitrer entre coût et intelligence
Haiku 5.5 est le premier modèle de la classe Haiku à porter un réglage d'effort, du plus bas au plus haut, qui laisse choisir la part de calcul consacrée à chaque tâche au lieu de figer un réglage pour toute une charge. Anthropic publie le coût par tentative de trois épreuves à chaque niveau d'effort, et les niveaux élevés rapprochent le petit modèle de ses aînés sur des tâches ciblées.
72,4 % sur OSWorld contre 15,7 % pour Haiku 4.5
C'est sur la conduite d'un ordinateur que l'écart avec la génération précédente est le plus net. Sur OSWorld 2.1, sous-ensemble hors ligne, Haiku 5.5 marque 72,4 % contre 15,7 % pour Haiku 4.5 et 48,9 % pour GPT-6 Luna, encore loin des 83,9 % de Sonnet 5.5.
- Sur GDPval-AA v2.1, qui note les agents sur le travail professionnel, il rend 1 620 points contre 735 pour Haiku 4.5 et 1 437 pour GPT-6 Luna.
- Sur Humanity's Last Exam, il passe de 10,2 % sans outils chez Haiku 4.5 à 45,9 %, et de 18,7 % à 57,4 % avec outils.
- Sur Chartography, une épreuve de raisonnement visuel, 46,4 % contre 6,4 % pour Haiku 4.5.
Sur le code d'agent complexe, Sonnet 5.5 garde 70,6 % contre 39,2 %
Anthropic tempère lui-même la portée du gain. Sur Terminal-Bench 4.0, qui enchaîne des tâches professionnelles en ligne de commande, Haiku 5.5 marque 39,2 % là où Sonnet 5.5 atteint 70,6 %, et l'éditeur écrit que Sonnet 5.5 comme Opus 5.5 restent les meilleurs choix pour le code d'agent complexe. Haiku 5.5 vise les tâches étroites qui auraient coûté trop cher avec les versions précédentes : compaction, résumé et travail de sous-agent. GitHub rapporte qu'en test précoce le modèle a égalé Claude Sonnet 5 sur beaucoup de tâches de code en consommant nettement moins de tokens et d'étapes.
Sonnet 5.5 baisse de 20 % sur les agents, crédits mensuels pour les abonnés
La sortie s'accompagne de deux mesures sur le reste de la gamme. Anthropic divise par deux le prix des lectures de cache de Sonnet 5.5, de 0,20 à 0,10 dollar par million de tokens, ce qui rend le modèle environ 20 % moins cher sur la plupart des charges d'agent. L'éditeur ouvre aussi un crédit mensuel d'API sur la plateforme Claude aux abonnés Max et Team : 100 dollars pour Max 5x, 200 dollars pour Max 20x, et jusqu'à 500 dollars mutualisés entre les utilisateurs d'une équipe.
Les clients mesurent la vitesse : 30 % de latence en moins chez Asana
Quelques clients cités donnent des repères en production. HubSpot annonce le meilleur score obtenu sur sa suite de tâches CRM, 92,8 % en moyenne sur trois passages. AlphaSense, qui porte une fonction de questions sur documents à environ 8 millions d'appels par semaine, passe de 0,76 à 0,84 sur 400 requêtes. Asana mesure plus de 30 % de latence en moins sur les tâches complétées et jusqu'à 2,5 fois plus d'inférenceExécution d'un modèle : une entrée, une sortie. Le calcul se sépare en un pré-remplissage de la question, puis une génération token par token.Fiche du lexique par tour d'agent.
Reste à voir l'usage hors des bancs. Anthropic fixe la date de coupure des connaissances du modèle à juin 2026 et n'annonce pas de publication des poids. Pour une équipe qui fait tourner des agents payés à la tâche, le calcul se déplace vers le nombre de sous-agents qu'un budget supporte, et la lecture du prix par million de tokens ne suffit plus : le coût par tentative à effort donné, publié par l'éditeur, en donne une idée plus juste.
Source primaire Anthropic, annonce de Claude Haiku 5.5