Une IA de Stratego a battu le meilleur joueur du monde 15 à 1 avec 16 GPU, et non 1 024 puces
Ataraxos a battu Pim Niemeijer 15 parties à une, et son coût d'entraînement est le fait le plus marquant. Ce que ce résultat prouve, et ce qu'il ne prouve pas.
Des chercheurs de Carnegie Mellon, du MIT, de NYU et de Stanford affirment que leur IA, Ataraxos, a battu Pim Niemeijer, sans doute le meilleur joueur de Stratego de l'histoire, 15 parties à 1, avec quatre nulles. Selon l'équipe, elle a été entraînée sur 16 GPU pendant une semaine, plus quatre GPU supplémentaires pendant quatre jours. La tentative précédente de DeepMind, DeepNash, avait mobilisé 1 024 puces spécialisées pendant deux à trois mois, un entraînement que l'équipe d'Ataraxos estime entre 3 et 4,5 millions de dollars aux prix de 2025.
Pourquoi Stratego résistait
Stratego est un jeu à information imparfaite : vous voyez où se trouvent les 40 pièces de l'adversaire, mais pas ce qu'elles sont. Leur identité n'est révélée que lorsque les pièces s'affrontent. Le poker est lui aussi un jeu à information imparfaite, mais le Texas Hold'em ne compte que 1 326 mains possibles, assez peu pour les évaluer de façon exhaustive. Stratego offre plus d'un décillion de dispositions de départ possibles, et une partie peut durer 2 000 coups, contre environ 40 aux échecs.
Le bluff aggrave les choses. Déplacer une pièce faible comme s'il s'agissait d'un maréchal peut effrayer l'adversaire, mais si vous bluffez trop souvent, vos menaces ne valent plus rien ; si vous ne bluffez jamais, vous devenez prévisible. Les chercheurs affirment que cet équilibre a fait échouer les systèmes précédents.
Comment fonctionne Ataraxos
Comme DeepNash, Ataraxos a appris par auto-jeu, sur 163 millions de parties au total : les coups qui menaient à la victoire étaient joués plus souvent, ceux qui menaient à la défaite moins souvent. Deux changements ont compté. D'abord, l'information cachée tend à faire tourner l'apprentissage par auto-jeu en rond ; l'équipe a donc opéré de grands ajustements de stratégie au début de l'entraînement, puis de petits ajustements ensuite.
Ensuite, le système peut anticiper avant chaque coup, ce que DeepNash ne faisait jamais. Ce type de recherche, utilisé par AlphaGo, était jugé trop coûteux à Stratego, car il y avait trop de plateaux possibles à examiner. La solution a été un second réseau de neurones, un modèle de croyance, qui devine les pièces cachées de l'adversaire d'après la façon dont elles se sont déplacées. Au lieu d'énumérer toutes les dispositions, Ataraxos en échantillonne des plausibles, déroule les coups candidats dans chacune, puis choisit en fonction des résultats.
Ce qui est démontré, et ce qui ne l'est pas
Démontré : un résultat évalué par les pairs (Nature, 2026) contre un quadruple champion du monde, ainsi que 38 victoires en 40 parties contre des participants au Championnat du monde 2025. La même approche a aussi battu trois champions du monde à Barrage Stratego, maîtrisé le jeu de cartes coopératif Hanabi et battu les meilleurs bots au dou dizhu.
Réserves fournies par la source elle-même : le match contre Niemeijer comptait 20 parties en ligne sur trois semaines, un petit échantillon dans un jeu où le hasard est intégré. Les chercheurs précisent que même une stratégie parfaite perd parfois. Niemeijer savait aussi que l'IA ne s'adapterait pas à lui, ce qui joue dans les deux sens : cela lui a laissé le temps de chercher des failles, mais cela signifie aussi que le test n'a jamais porté sur un adversaire auquel l'IA aurait dû s'adapter.
Non démontré : tout ce qui sort du cadre des jeux. L'équipe cite la simulation de conflits, la négociation et les marchés financiers comme cibles futures, et soutient que l'écart est plus faible qu'il n'y paraît, puisque tout problème réel commence par un modèle simplifié. C'est un argument, pas un résultat. Les problèmes réels n'ont ni règles fixes ni vainqueur clair, et personne n'a montré qu'Ataraxos fonctionne sur l'un d'eux. Le système ne peut pas non plus expliquer ses coups ; Farina a indiqué que l'équipe n'en est pas encore à des stratégies solides et interprétables.
Les questions à se poser
- Si le gain d'efficacité vient en grande partie d'un simulateur sur mesure exécutant des millions de coups par seconde sur GPU, quelle part est transférable à un domaine où un tel simulateur n'existe pas ?
- Le modèle de croyance devine l'information cachée à partir du comportement observé. Que se passe-t-il lorsque le comportement de l'adversaire ne ressemble en rien à celui des adversaires d'auto-jeu sur lesquels il s'est entraîné ?
- Vingt parties, c'est un petit échantillon. Combien en faudrait-il pour distinguer un véritable avantage du hasard, et la marge de 15 à 1 résisterait-elle face à un adversaire capable de s'adapter ?
- Pour des usages réels comme la négociation ou la simulation de conflits, qui construit le modèle simplifié, et qui vérifie qu'il reflète la réalité plutôt que les hypothèses de son concepteur ?
- Si le système ne peut pas expliquer ses coups, comment auditer une recommandation avant d'agir ?
Ce qu'il faut surveiller ensuite
Le signal à guetter, c'est de savoir si l'approche sort du domaine des jeux. Surveillez la publication d'une application où les règles ne sont pas fixes et où aucun simulateur bon marché n'existe, ainsi que les progrès sur le manque d'explicabilité reconnu par Farina. D'ici là, le résultat solide est un jeu plus performant et moins coûteux dans les jeux à information cachée, et non un outil général pour la négociation ou les marchés.
- 1Optimisez l'efficacité de l'entraînement des IA en privilégiant des algorithmes spécialisés plutôt que la puissance de calcul brute, pour réduire les coûts de plus de 99 %.
- 2Appuyez-vous sur les stratégies des jeux à information imparfaite pour améliorer les systèmes de décision lorsque les données sont incomplètes ou cachées.
- 3Comparez les performances de l'IA à celles d'experts humains dans des domaines complexes afin de valider son applicabilité réelle au-delà des tests synthétiques.
Ready to implement AI in your business?
Our team builds the AI systems you just read about. Start with a free 30-minute discovery meeting.
