Pew laisse l'IA écrire son code, pas ses conclusions
Le Pew Research Center a publié ses règles sur l'IA : pas de répondants synthétiques, pas de photos générées par IA, pas de rapports rédigés par IA. Le seuil de divulgation reste à sa seule appréciation.
La ligne tracée par Pew
Le 28 septembre 2026, le Pew Research Center a republié sa déclaration sur la manière dont il utilise, et n'utilise pas, l'intelligence artificielle, une mise à jour d'un article paru pour la première fois le 27 août 2024. La phrase la plus lourde de conséquences est un refus : le Centre affirme ne pas recourir à l'IA pour créer ou modéliser une opinion publique synthétique. Selon lui, ses résultats d'enquête aux États-Unis proviennent d'un panel multimode, fondé sur des probabilités, d'environ 10 000 adultes sélectionnés au hasard dans tout le pays. De vraies personnes, qui répondent.
C'est un engagement précis à un moment où l'alternative est bon marché et le devient chaque jour davantage. Le reste de l'article, signé Claudia Deane, décrit les endroits où l'IA fonctionne bel et bien au sein de l'organisation : le code, la préparation des données, la classification de textes, la relecture rédactionnelle et les publications sur les réseaux sociaux.
Pourquoi les « répondants synthétiques » sont le combat qui vaut la peine
Un panel fondé sur des probabilités signifie que chaque adulte de la population cible avait une chance connue, non nulle, d'être sélectionné. C'est cette propriété qui autorise le passage de 10 000 personnes à quelque 260 millions, et qui donne un sens à une marge d'erreur. Elle est aussi lente et coûteuse : recrutement, incitations, plusieurs modes de contact pour les personnes qui ne répondent pas en ligne.
Les grands modèles de langage proposent un raccourci séduisant. Il suffit de demander à un modèle de répondre en tant qu'indépendant rural de 58 ans, de répéter l'opération sur une grille démographique, et l'on obtient en quelques minutes un jeu de données qui ressemble à un sondage. Le résultat n'est pas de l'opinion. C'est la reconstitution de ce que les motifs textuels du corpus d'entraînement suggèrent qu'une telle personne pourrait dire, ce qui signifie qu'il reproduit le passé, lisse les opinions minoritaires et ne peut pas détecter que quelque chose a changé. Pew affirme ne pas le faire. À noter que cette affirmation est vérifiable en principe : les données synthétiques laissent des empreintes dans la structure de la variance, et Pew publie sa méthodologie.
Les usages qui touchent réellement aux chiffres
Deux des usages divulgués sont peu dramatiques. Les ingénieurs utilisent des assistants de code IA pour construire pewresearch.org, où les bugs sont visibles et corrigeables. La relecture rédactionnelle, pour la grammaire et la ponctuation, est présentée comme expérimentale, la version finale du texte étant approuvée par des humains.
Le plus intéressant concerne les données textuelles. Pew indique que l'IA aide à coder les réponses ouvertes des enquêtes en catégories et à extraire des données de sites web. Le codage des réponses ouvertes est le moment, dans la recherche par enquête, où un humain lit des milliers de réponses en texte libre (« Qu'est-ce qui vous inquiète le plus dans l'économie ? ») et range chacune dans une grille. C'est un travail laborieux, dont la qualité est historiquement contrôlée en faisant travailler plusieurs codeurs sur les mêmes réponses et en mesurant leur taux d'accord.
Confiez cette tâche à un classifieur et le coût en main-d'œuvre s'effondre. Le contrôle d'erreur naturel aussi. Un modèle qui range systématiquement les réponses ambiguës dans la mauvaise catégorie ne produit pas de bug évident ; il produit un pourcentage légèrement faux qui paraît parfaitement normal. La garantie annoncée par Pew est que les chercheurs conçoivent les plans d'analyse et interprètent les résultats, et que le Centre décrira tout usage significatif de l'IA dans la section méthodologie d'un rapport.
Ce qui est déployé, et ce qui relève d'une politique
Soyons clairs sur la nature de ce document. C'est une déclaration d'intention, pas un audit. Aucun outil ni modèle n'est nommé. Aucun taux d'erreur n'est publié pour le codage assisté par IA par rapport à une référence humaine. Aucun décompte n'est donné des rapports ayant déjà recouru à ces méthodes. Deux des quatre usages divulgués, la relecture rédactionnelle et les produits dérivés comme les publications sociales, sont décrits comme des expériences, ce qui est honnête mais signifie que la pratique établie est plus restreinte que la liste ne le laisse penser.
Le critère de divulgation est lui aussi défini par l'institution elle-même. L'« usage significatif » relève du jugement de Pew, et l'article s'engage à réexaminer la divulgation si l'usage de l'IA s'étend de manière à affecter « sensiblement » les produits externes, là encore selon l'appréciation de Pew. Comparé à la plupart des instituts de recherche, qui n'ont rien publié, on se situe au-dessus de la barre. Comparé à un standard de preuve, c'est une promesse.
Les questions à vous poser
- Lorsqu'un modèle code des réponses ouvertes, quelle part est revérifiée par un humain, et à quelle fréquence ces derniers sont-ils en désaccord ?
- Qui décide qu'un usage donné est assez « significatif » pour être divulgué, et cette décision est-elle consignée quelque part où un lecteur peut la consulter ?
- Si le comportement d'un classifieur change après une mise à jour du modèle, qu'est-ce qui, dans la chaîne de traitement, détecterait une variation de deux points sur un chiffre publié ?
- Quels rapports publiés ont déjà recouru au codage assisté par IA, et leur section méthodologie le mentionne-t-elle ?
- Pour votre propre organisation : pourriez-vous rédiger dès aujourd'hui cette liste de refus, et quelqu'un d'extérieur pourrait-il la vérifier ?
Ce qu'il faut surveiller ensuite
Surveillez les sections méthodologie. Pew s'est engagé à y décrire tout usage significatif de l'IA ; le signal à guetter est donc un rapport de Pew dont l'annexe méthodologique nomme un modèle, une tâche et, idéalement, un taux d'accord avec des codeurs humains. Si ce paragraphe apparaît avec des chiffres, la politique a des dents. Si le codage assisté par IA se développe et que les annexes restent muettes, c'est le seuil qui faisait tout le travail depuis le début.
- 1Publiez une déclaration explicite sur l'usage de l'IA qui nomme les endroits où elle intervient (code, nettoyage, classification, rédaction) et ceux où elle n'intervient jamais, comme la génération de réponses d'enquête.
- 2Ne remplacez jamais des humains issus d'un échantillon probabiliste par des « répondants synthétiques » générés par un LLM lorsque votre affirmation porte sur ce que le public pense réellement.
- 3Lorsque l'IA classe des textes ou écrit du code d'analyse, validez-la sur un échantillon codé par des humains et publiez le taux d'accord avec vos résultats.
Ready to implement AI in your business?
Our team builds the AI systems you just read about. Start with a free 30-minute discovery meeting.
