L'outil d'IA de veille de l'Inquirer, Scrape, fonctionne parce qu'un rédacteur en chef l'a noté pendant des mois
Scrape a réduit le bruit de l'actualité hyperlocale en s'entraînant sur les retours quotidiens d'un rédacteur en chef. Ce sont les prompts, et non le modèle, qui ont fait le travail.
Un rédacteur en chef du Philadelphia Inquirer consacrait environ 12 heures par semaine à la seule recherche d'éléments pour les newsletters locales, selon une étude de cas publiée le 30 septembre 2026 par le Lenfest Institute. La solution a été un outil d'IA appelé Scrape, qui, selon l'institut, est depuis devenu une « infrastructure essentielle et critique » pour six newsletters, deux autres étant prévues, et près de 20 journalistes suivent sa production.
Ce que fait réellement Scrape
Scrape s'exécute chaque jour sur une liste de sources soigneusement sélectionnées : réunions municipales, calendriers scolaires, pages Facebook et autres petits médias dispersés. Il produit une fiche de pistes d'éléments potentiels pour les newsletters. Les newsletters hyperlocales de l'Inquirer couvrent chacune une communauté précise, et l'actualité de ces communautés provient, selon les mots de Kevin Hoffman, Lenfest AI Fellow, de « beaucoup de toutes petites sources, et il y a donc énormément à passer au crible ».
La source ne décrit ni nouveau modèle ni nouvelle architecture. Elle décrit une manière de construire autour d'un modèle.
La méthode : le travail du rédacteur en chef comme corrigé de référence
Le rédacteur en chef responsable avait déjà compilé la liste des sources et produisait à la main des fiches de pistes quotidiennes. Hoffman a traité ces fiches faites main comme la référence. Chaque jour, l'IA produisait son propre condensé, et l'équipe le comparait à celui du rédacteur en chef : avait-elle extrait les mêmes éléments, trouvé des choses que le rédacteur en chef avait manquées, ou laissé passer des éléments qu'elle aurait dû repérer ?
Pendant trois ou quatre mois, le rédacteur en chef a annoté les condensés un jour sur deux, en indiquant ce qui était utile et ce qui relevait du bruit. Hoffman décrit cet effort comme « plutôt intense ». Des puces ont été ajoutées au prompt et d'autres retirées, et la production s'est éloignée des réunions reportées et des fermetures de routes de routine pour se rapprocher des nouvelles communautaires qui comptaient.
Notez ce que signifie ici « entraîner ». La source décrit un affinement itératif des prompts, c'est-à-dire la réécriture des instructions données au modèle, et non un réentraînement du modèle lui-même.
Pourquoi encoder le jugement était la partie difficile
L'« intérêt journalistique » n'est pas quelque chose qu'un modèle connaît dans l'abstrait. La première conception était fondée sur les régions : collecter tout ce qui concerne un lieu comme Lower Merion, puis filtrer avec un prompt générique d'intérêt journalistique. Cela fonctionnait de manière « gérable » pour un rédacteur en chef et quelques newsletters, mais ne passait pas à l'échelle, selon Hoffman.
Le remplacement est un brief par newsletter, rédigé par le rédacteur en chef de cette newsletter. Pour la newsletter du comté de Chester, le brief précise ce que veulent les lecteurs (administration municipale et locale, actualité régionale adaptée au niveau local, sujets touchant la vie quotidienne comme les restaurants et le commerce de détail), ce qu'il faut exclure (l'actualité économique pure comme la couverture de la Bourse ou les changements de personnel), qui sont les lecteurs, quels districts scolaires comptent et quelles communautés voisines n'ont pas leur place. Scrape prend désormais tout cela en entrée.
C'est l'idée transposable. Le modèle reste le même ; la norme éditoriale est consignée par écrit, appartient aux rédacteurs en chef et est fournie explicitement.
Le coût, et ce que la source omet
Fouiller de nombreuses petites sources coûte cher. L'équipe a constaté que les prompts peuvent orienter implicitement la profondeur et l'étendue de la recherche du système, mais seulement par tâtonnements. Le conseil rétrospectif de Hoffman est de fixer dès le premier jour des compromis acceptables entre coût et qualité, et de concevoir les prompts et l'architecture en conséquence.
L'étude de cas est publiée par le Lenfest Institute, dont le programme d'IA est soutenu par OpenAI et Microsoft, et ses résultats sont rapportés par les personnes qui ont mené le projet. Elle ne donne aucun coût en dollars, aucune mesure du nombre d'heures que le rédacteur en chef économise désormais, et aucun taux d'erreur.
Les questions à vous poser
- À combien sont tombées les 12 heures hebdomadaires du rédacteur en chef, et qui l'a mesuré ? L'étude de cas indique le chiffre de départ, mais aucun résultat.
- Que manque Scrape ? La comparaison avec les fiches de pistes du rédacteur en chef a servi à repérer les lacunes, mais la source ne rapporte aucun taux de omissions, et un article qui n'atteint jamais une fiche de pistes reste invisible.
- Combien coûte son exécution quotidienne sur toutes ces sources, et qui a décidé que c'était acceptable ? La source admet que le coût a été une leçon apprise, et non un problème résolu.
- Qui maintient le brief de chaque newsletter quand le rédacteur en chef part ? Si le jugement réside dans un prompt rédigé par une seule personne, qu'advient-il de la qualité quand cette personne change de poste ?
- Comment audite-t-on un brief qui exclut certaines communautés ? Des exclusions explicites sont un choix sur les actualités qui comptent et celles qui ne comptent pas.
Ce qu'il faut surveiller ensuite
Le signal à suivre est l'extension de six newsletters à huit, puis au-delà. La conception par régions n'a pas réussi à se généraliser d'un rédacteur en chef à plusieurs, et les briefs par newsletter en sont la correction. Si de nouveaux rédacteurs en chef peuvent rédiger des briefs efficaces sans des mois d'annotation quotidienne, la méthode se transfère. Si chaque lancement exige sa propre période de réglage intense, Scrape est un projet artisanal, et non un outil reproductible.
- 1Entraînez les outils d'IA avec une relecture éditoriale humaine pendant plusieurs semaines pour garantir la qualité avant un déploiement complet dans les rédactions.
- 2Utilisez l'IA pour surveiller des sources locales fragmentées, comme les réunions municipales et les réseaux sociaux, afin de faire gagner du temps de recherche aux journalistes.
- 3Commencez l'adoption de l'IA par un point de friction précis dans un flux de travail avant de la déployer à plusieurs équipes et publications.
Ready to implement AI in your business?
Our team builds the AI systems you just read about. Start with a free 30-minute discovery meeting.
