Claude Opus 5.5 supprime l'interrupteur de la réflexion
Le nouveau guide de prompting d'Anthropic confirme qu'Opus 5.5 rejette thinking: disabled. Le niveau d'effort devient le seul réglage disponible, et sa valeur par défaut passe de high à medium.
Le paramètre qui n'existe plus
Dans le guide de prompting d'Anthropic pour Claude Opus 5.5 se cache un changement qui casse du code fonctionnel au lieu de simplement l'améliorer : le modèle n'accepte pas thinking: {"type": "disabled"}. Claude Opus 5 l'autorisait à un niveau d'effort high ou inférieur. Opus 5.5 ne le permet pas. La réflexion est toujours activée, et le seul moyen de contrôler son ampleur est le niveau d'effort.
Pour la plupart des équipes, les chiffres mis en avant sont plus engageants. Anthropic affirme qu'Opus 5.5 produit des tokens de sortie plus de 30 % plus vite qu'Opus 5 et qu'il a tendance à en utiliser moins pour accomplir la même tâche. L'entreprise indique aussi que les prompts Opus 5 existants devraient fonctionner sans modification. Le piège se trouve dans les réglages qui entourent le prompt, pas dans le prompt lui-même.
Pourquoi « medium » n'est pas le même medium
L'effort est le réglage qui détermine combien de temps le modèle délibère avant de répondre. Opus 5.5 utilise medium par défaut, là où Opus 5 utilisait high. Les noms des niveaux ne se transposent pas d'un modèle à l'autre. Selon les tests d'Anthropic eux-mêmes, Opus 5.5 à medium égale ou dépasse Opus 5 à high sur les évaluations de code et de travail intellectuel, et sur plusieurs évaluations de code, low s'en approche à un coût bien inférieur. Il s'agit d'un benchmark du fournisseur, pas d'un benchmark indépendant, et le guide recommande de tester les niveaux sur vos propres évaluations plutôt que de reprendre la valeur utilisée auparavant.
Si vous recopiez l'ancien réglage, la facture évolue dans le mauvais sens. À niveau égal, indique le guide, Opus 5.5 réfléchit davantage à chaque tour qu'Opus 5, surtout à xhigh et max. Les tokens de réflexion comptent dans max_tokens même lorsque le contenu de la réflexion ne vous est jamais renvoyé : un plafond dimensionné pour Opus 5 avec la réflexion désactivée peut donc tronquer les réponses. Anthropic suggère 128 000, le maximum du modèle, pour les longs tours que produit le code agentique, et précise que baisser le niveau d'effort réduit la réflexion de façon plus fiable que des instructions demandant au modèle de réfléchir moins.
Un piège opérationnel : modifier la valeur d'effort de niveau supérieur entre deux requêtes invalide le cache de prompt, la copie stockée de votre prompt système répété qui permet de maîtriser les coûts. Un changement d'effort par message, actuellement en bêta, le préserve.
L'agent qui s'arrête par politesse
Le mode de défaillance le plus intéressant du guide est comportemental. Sur les longues tâches en plusieurs parties, Opus 5.5 tient l'utilisateur informé au fil de son travail, et certaines de ces mises à jour terminent le tour par du texte au lieu d'un appel d'outil, en renvoyant stop_reason: "end_turn". Une boucle d'agent sans surveillance interprète cela comme « tâche terminée » et s'arrête. Le travail n'était pas fini. Le modèle faisait un point d'étape.
Les correctifs d'Anthropic sont simples et méritent d'être copiés : conserver les différentes parties de la tâche dans une liste de contrôle que le modèle met à jour, traiter une fin composée uniquement de texte comme un compte rendu plutôt que comme une preuve d'achèvement, et envoyer un court message nommant les points encore ouverts. Plafonnez les relances automatiques à deux ou trois, afin qu'une exécution réellement bloquée prenne fin et soit examinée. Si une commande en arrière-plan ou un sous-agent est encore en cours, attendez sa sortie avant de conclure que tout est terminé.
Le guide propose aussi un long paragraphe de prompt système qui nomme quatre façons précises dont le modèle termine prématurément ses tours, notamment des résumés qui annoncent l'étape suivante sans l'exécuter, et des propositions de poursuite qui attendent une réponse que personne ne donnera. Anthropic est explicite : ce paragraphe est réservé aux agents entièrement autonomes, vous devez conserver votre propre étape de confirmation pour les actions irréversibles, et il entraîne un peu plus d'appels d'outils et de tokens de sortie par tâche. L'ajouter en cours de session invalide les blocs de réflexion antérieurs de la conversation : il faut donc l'inclure dès la première requête.
Les questions à vous poser
- Si la réflexion ne peut plus être désactivée, quel est notre plancher réel pour le délai avant le premier token sur les fonctionnalités destinées au chat, mesuré sur notre propre trafic plutôt que sur les évaluations d'Anthropic ?
- Lesquels de nos prompts demandent au modèle d'écrire son raisonnement dans la réponse en remplacement de la réflexion ? Ils peuvent désormais être refusés au titre de la catégorie de refus reasoning_extraction.
- Notre harnais d'agent inspecte-t-il les types de blocs de contenu, ou suppose-t-il que le premier bloc est du texte ? Une réponse peut commencer par un bloc de réflexion dont le champ est vide avec le paramètre d'affichage par défaut.
- Combien de nos exécutions autonomes « réussies » du dernier trimestre se sont en réalité arrêtées sur un point d'étape que nous avons compté comme un achèvement ?
- Qui est responsable du réglage d'effort, et payons-nous du xhigh sur des tâches où nous n'avons jamais mesuré de gain de qualité ?
Ce qu'il faut surveiller ensuite
Surveillez vos factures de tokens à effort constant. Si les coûts augmentent après la migration malgré le gain de vitesse annoncé de 30 % et la baisse du nombre de tokens par tâche, la cause sera presque certainement une valeur d'effort reprise telle quelle, combinée à un plafond max_tokens fixé à l'époque où la réflexion était facultative. Cette seule comparaison, à charge de travail identique avant et après, vous dira si Opus 5.5 est moins cher pour vous ou simplement plus rapide sur les benchmarks d'Anthropic.
- 1Recherchez thinking: {"type": "disabled"} dans votre code avant de passer à Opus 5.5, car ce paramètre déclenche désormais une erreur au lieu d'être ignoré.
- 2Remplacez les appels à réflexion désactivée par le niveau d'effort le plus bas, puis refaites des mesures de latence et de coût, car une réflexion minimale consomme encore des tokens.
- 3Retestez tout prompt réglé au niveau d'effort « medium » sur Opus 5.5, car les niveaux d'effort ont été recalibrés et ne correspondront pas au comportement d'Opus 5.
Ready to implement AI in your business?
Our team builds the AI systems you just read about. Start with a free 30-minute discovery meeting.
