L'arène d'agents est une excellente démo, mais un piètre benchmark
TinyAIArena fait s'affronter des agents d'IA en direct sous vos yeux. Cela prouve que la plomberie fonctionne, pas qu'un modèle soit meilleur qu'un autre.
Un développeur a publié TinyAIArena dans la section Show HN de Hacker News ce mois-ci : une petite arène ouverte où des agents d'IA jouent les uns contre les autres pendant que vous regardez les coups s'afficher en temps réel. L'argument est exactement celui annoncé : regardez les agents s'affronter. Cela fonctionne, c'est amusant, et c'est le genre de projet qu'un ingénieur compétent construit en quelques week-ends.
Le bémol ne vise pas l'auteur, qui n'a rien revendiqué de plus que ce qu'il a construit. Il vise ce qui se passera ensuite : d'ici quelques semaines, des captures d'écran de classements de l'arène seront collées dans des présentations de fournisseurs et des fils de discussion d'achat comme preuve que le modèle A bat le modèle B. Cette inférence ne résiste pas à la manière dont ces systèmes sont réellement assemblés.
Ce que fait réellement une arène d'agents
Si l'on retire l'animation, une arène n'est qu'une boucle. L'état du jeu (un plateau, un ensemble de ressources, un numéro de tour) est sérialisé en texte et placé dans un prompt. Le modèle renvoie du texte. Du code transforme ce texte en un coup légal, l'applique, puis recommence. L'enveloppe qui accomplit ce travail s'appelle le harness ou scaffold, et c'est là que se logent la plupart des décisions intéressantes.
Les parties difficiles sont peu spectaculaires. Les modèles renvoient des coups mal formés, donc le harness réessaie, ou relance avec un message d'erreur, ou fait perdre le tour : trois choix qui produisent trois classements différents. Les modèles sont non déterministes : le même prompt avec le même état peut donner un coup différent, parce que l'échantillonnage introduit de l'aléa par conception. Les fenêtres de contexte se remplissent au fil des longues parties, donc le harness décide quel historique conserver et lequel résumer. La latence et le coût des API limitent le nombre de parties que l'on peut se permettre de lancer.
Ce que la démo prouve, et ce qu'elle ne prouve pas
Ce qui est démontré : la boucle se referme. Plusieurs modèles peuvent être pilotés via une interface de jeu commune, produire des actions analysables et mener des parties à terme sans intervention humaine. C'est un vrai résultat d'ingénierie, et c'est la raison pour laquelle ces projets méritent d'être lus : le code du harness est l'artefact utile, pas le classement.
Ce qui n'est pas démontré : qu'un modèle soit plus performant qu'un autre. Les classements d'arène utilisent généralement l'Elo, le système de notation des échecs, qui suppose un grand nombre de parties contre un panel d'adversaires stable avant que le chiffre ait un sens. Quelques dizaines de parties produisent un classement dont les marges d'erreur sont assez larges pour engloutir tout le tableau. Les adversaires bougent aussi : chaque modèle du panel est reconfiguré et re-promptés en permanence, de sorte que ce que l'on mesure ne reste jamais en place.
Il y a ensuite l'avantage du scaffold. Un modèle doté d'un meilleur prompt système, d'un budget de nouvelles tentatives ou d'une représentation d'état plus soignée battra un modèle identique qui n'en bénéficie pas. Des évaluations d'agents publiées ont montré à plusieurs reprises que les différences de scaffolding éclipsent les différences entre modèles. Et si le jeu est bien connu, la performance peut refléter la part du jeu présente dans les données d'entraînement plutôt qu'un raisonnement sur le moment.
Les questions à vous poser
- Combien de parties ont produit ce classement, et quel est l'intervalle de confiance ? Si le fournisseur ne peut pas indiquer les marges d'erreur, l'ordre n'est que de la décoration.
- Chaque modèle a-t-il reçu le même prompt, la même politique de nouvelles tentatives et le même budget de contexte, et pouvez-vous voir tout cela côte à côte ?
- Que se passe-t-il quand un modèle émet un coup invalide : nouvelle tentative, forfait ou correction silencieuse par le harness ? Qui a choisi cette règle, et favorise-t-elle un modèle en particulier ?
- Le jeu ou sa stratégie sont-ils documentés dans des textes publics sur lesquels les modèles ont probablement été entraînés ?
- Quelle tâche de votre activité réelle ressemble à un jeu au tour par tour, avec un validateur de coups légaux et un vainqueur sans ambiguïté ? Si aucune, que ce chiffre est-il censé vous apprendre ?
Ce qu'il faut surveiller ensuite
Le signal à guetter : le projet publie-t-il les journaux de parties bruts, les graines aléatoires et le prompt exact utilisé pour chaque modèle, et quelqu'un relance-t-il l'ensemble en obtenant le même classement ? La reproduction par un tiers fait la différence entre un benchmark et un tableau d'affichage. Le contre-signal : un fournisseur de modèles qui cite sa place dans l'arène dans son marketing sans lier les journaux. Cela signifie que le chiffre a cessé d'être une preuve pour devenir une affirmation.
- 1Considérez les classements d'arène comme une démo de votre scaffold (prompts, outils, nouvelles tentatives), et non comme une preuve de la qualité d'un modèle, et dites-le quand vous partagez des captures d'écran.
- 2Avant de citer un résultat d'arène dans une présentation de fournisseur, relancez les mêmes parties avec le scaffold, la température et les limites de tours que votre pile de production utilise réellement.
- 3Évaluez les modèles sur vos propres tâches avec des harness fixes et plus de 20 exécutions répétées, car les tournois à élimination directe masquent la variance et la sensibilité au prompt.
Ready to implement AI in your business?
Our team builds the AI systems you just read about. Start with a free 30-minute discovery meeting.
