Claude Opus 5.5 coûte 20 % de moins. Voici comment en tirer vraiment parti.
Le nouveau modèle d'Anthropic est moins cher, plus rapide et, selon l'entreprise, aussi performant que sa gamme premium. Six actions concrètes à mener avant de changer de modèle.
Anthropic a lancé Claude Opus 5.5 le 22 septembre. Les chiffres clés : l'entrée coûte 4 $ par million de tokens (contre 5 $ auparavant), la sortie coûte 20 $ par million (contre 25 $), et les lectures en cache baissent de 60 %, à 0,20 $. Anthropic affirme que le modèle atteint le niveau de Claude Fable 5.1, son modèle plus coûteux sorti plus tôt en septembre, et revient environ 40 % moins cher qu'Opus 5 sur des charges de travail typiques.
Les baisses de prix sont faciles à annoncer et faciles à mal interpréter. Voici ce que cette sortie change concrètement, et ce qu'il convient de faire.
Ce que signifie réellement un prix par « token » pour vous
Un token est un morceau de texte, soit environ les trois quarts d'un mot. Vous payez séparément ce que vous envoyez (vos instructions, vos documents et l'historique de la conversation) et ce qui revient. La sortie coûte cinq fois plus cher que l'entrée : un modèle qui rédige de longues réponses revient donc bien plus cher qu'un modèle qui lit de longs documents.
Un exemple chiffré : une tâche qui envoie 1 million de tokens et en reçoit 200 000 en retour coûtait 10 $ avec Opus 5 (5 $ plus 5 $). Avec Opus 5.5, elle coûte 8 $ (4 $ plus 4 $). C'est là que se trouvent les 20 %. La plus grosse économie, celle que la plupart des équipes manqueront, se trouve dans la mise en cache.
Six actions à mener
1. Activez la mise en cache des prompts. Si votre application envoie à répétition le même long contexte, comme un catalogue de produits, un manuel de procédures ou une base de code, la mise en cache permet au modèle de le réutiliser. Les lectures en cache coûtent désormais 0,20 $ par million au lieu de 4 $. Pour un bot de support qui envoie le même manuel de 50 pages à chaque question, c'est le levier de réduction des coûts le plus puissant dont vous disposez.
2. Utilisez le réglage d'effort comme curseur de coût. Opus 5.5 propose cinq niveaux d'effort, de faible à maximal, et utilise le niveau moyen par défaut. Un effort plus élevé signifie plus de raisonnement, de meilleures réponses sur les problèmes difficiles et une facture plus lourde. Partez du niveau par défaut et ne l'augmentez que pour les tâches qui en ont mesurablement besoin, plutôt que de tout régler au maximum.
3. Réservez le mode rapide aux cas où quelqu'un attend. Le mode rapide va jusqu'à 2,5 fois plus vite, pour le double du prix (8 $ en entrée, 40 $ en sortie). Il vaut la peine pour un chat en direct qu'un client regarde se dérouler. Il est inutile pour un rapport généré pendant la nuit.
4. Refaites vos propres calculs, pas ceux des benchmarks. Anthropic annonce de bons scores sur les tests qu'elle a choisis, dont 66,4 % sur Terminal-Bench 4.0. Ce sont les résultats du fournisseur. Prenez 20 à 50 tâches réelles issues de votre travail, exécutez-les sur votre modèle actuel et sur Opus 5.5, puis comparez qualité et coût côte à côte avant de modifier quoi que ce soit en production.
5. Changez le nom du modèle de façon réfléchie. L'identifiant est claude-opus-5-5. Modifiez-le derrière un paramètre que vous pouvez rebasculer, et non dans du code éparpillé, afin qu'une régression se règle par un retour en arrière d'une seule ligne.
6. Attendez-vous au reste de la famille. Anthropic a indiqué que Sonnet 5.5 et Haiku 5.5 arrivent. Pour les tâches simples à fort volume, un modèle plus petit est souvent le meilleur choix : évitez donc d'enfermer toutes vos charges de travail sur Opus.
Les questions à vous poser
- Quelle part de notre facture d'IA correspond à la sortie plutôt qu'à l'entrée, et des réponses plus courtes feraient-elles économiser davantage qu'un nouveau modèle ?
- Renvoyons-nous le même contexte à chaque requête sans le mettre en cache ?
- Quelles tâches exigent réellement un effort maximal, et lesquelles le paient par défaut ?
- Avons-nous testé ce modèle sur notre propre travail, ou seulement lu l'article de lancement ?
À surveiller ensuite
La sortie de Sonnet 5.5 et de Haiku 5.5. Si les modèles plus petits arrivent avec des baisses de prix similaires, la meilleure option pour la plupart des entreprises sera d'orienter les tâches simples vers eux et de réserver Opus aux cas difficiles.
Sources
Ready to implement AI in your business?
Our team builds the AI systems you just read about. Start with a free 30-minute discovery meeting.
