L'affaire des auteurs contre OpenAI porte désormais sur les téléchargements, et non sur l'entraînement
Les mémoires déscellés déplacent le débat du fair use vers la manière dont les livres ont été obtenus. Et le règlement de 3 000 $ par livre conclu par Anthropic est le chiffre sur lequel tout le monde fait ses calculs.
Ce qui est réellement devenu public
Des passages caviardés des mémoires de jugement sommaire dans le contentieux regroupé des auteurs contre OpenAI et Microsoft figurent désormais au dossier public. Le titre repris par la plupart des médias était une variante de « des documents internes montrent que l'entreprise d'IA savait ». L'observation la plus utile est d'ordre structurel : le mémoire des plaignants consacre beaucoup plus d'arguments à la manière dont les livres ont été acquis qu'à la question de savoir si l'entraînement relève du fair use. Ce n'est pas un choix rhétorique. C'est ce que la jurisprudence depuis 2025 a imposé.
Premier rappel à la réalité : un mémoire est la meilleure version de sa propre cause que présente une partie, rédigée par des avocats payés pour gagner. Le déscellement le rend visible, pas vrai. Les pièces jointes à un mémoire sont des éléments de preuve. Le mémoire lui-même est un plaidoyer. Tout article qui cite l'argumentation sans citer la pièce rapporte un communiqué de presse affublé d'un numéro de dossier.
Pourquoi l'acquisition est devenue l'enjeu central
Pour construire un grand modèle de langage, il faut un corpus de préentraînement : des centaines de milliards de mots de prose continue. Les extractions du web apportent du volume mais une qualité médiocre : fils de commentaires, contenus de remplissage SEO, textes standardisés. Les livres offrent une argumentation et un récit de longue haleine, édités par des professionnels, ce qui est d'une valeur disproportionnée pour apprendre à un modèle à tenir une idée sur des milliers de mots. Tous les grands laboratoires voulaient des livres. La question est de savoir d'où ils venaient.
Il existe trois voies. Acheter et numériser des exemplaires physiques. Obtenir une licence auprès des éditeurs. Ou télécharger une « bibliothèque fantôme » existante, c'est-à-dire des collections pirates en masse comme celles mentionnées dans les actes de procédure de plusieurs de ces affaires, parce que le corpus entier arrive en un après-midi, indexé et dédoublonné, gratuitement.
Les décisions de 2025 se sont départagées précisément sur cette ligne. Dans l'affaire Anthropic, le juge Alsup a estimé que l'entraînement en lui-même relevait d'un fair use transformatif, tandis que la conservation de copies piratées dans une bibliothèque interne permanente n'en relevait pas. Anthropic a conclu un règlement d'environ 1,5 milliard de dollars couvrant quelque 500 000 œuvres, soit de l'ordre de 3 000 $ par livre. Ce chiffre est désormais le prix de référence dans toutes les discussions de règlement dans ce domaine, et il a été fixé par la question de l'acquisition, non par celle de l'entraînement.
Ainsi, quand vous lisez que les plaignants ont « prouvé qu'OpenAI avait enfreint la loi », demandez-vous de quelle revendication il s'agit. L'entraînement sur des textes obtenus légalement a résisté à la contestation à plus d'une reprise. Télécharger un torrent de 200 000 romans est un acte distinct, qui engage sa propre responsabilité, et il a eu lieu des années avant la mise sur le marché de tout produit.
Où se situe Microsoft, et où elle ne se situe pas
Il n'est pas allégué que Microsoft ait exploité les robots d'extraction. Son exposition passe par ce qu'elle a livré et ce qu'elle a alimenté : la puissance de calcul Azure pour les cycles d'entraînement, et les produits grand public construits sur les modèles qui en résultent. Il s'agit d'une théorie de la responsabilité contributive et du fait d'autrui, et elle est véritablement plus difficile à prouver que la copie directe. Considérez comme fausse toute affirmation selon laquelle Microsoft « a été reconnue responsable » tant qu'un tribunal ne l'a pas dit : rien n'a été tranché sur le fond.
L'autre affirmation à relativiser est la régurgitation. Les plaignants ont montré dans ces affaires que l'on peut amener les modèles, par des invites adéquates, à reproduire des passages de livres précis. Cela démontre une mémorisation sous sollicitation adverse, non que les utilisateurs ordinaires reçoivent des contenus contrefaisants. Les défendeurs répondent que des filtres bloquent cela dans le produit livré. Les deux affirmations peuvent être vraies, et elles n'emportent pas les mêmes dommages et intérêts.
Les questions à vous poser
- Quand un fournisseur affirme que son modèle est « entraîné sur des données sous licence », cela couvre-t-il le modèle de base ou seulement la couche de réglage fin ajoutée à un modèle de base entraîné des années plus tôt ?
- Que couvre réellement votre clause d'indemnisation : les réclamations pour contrefaçon au niveau des sorties dirigées contre vous, ou la responsabilité du fournisseur lui-même liée à ses acquisitions en amont ? Ce ne sont presque jamais la même clause.
- Si les dommages et intérêts légaux atteignaient le maximum applicable en cas de faute intentionnelle plutôt que le taux négocié, votre fournisseur pourrait-il l'absorber, et que deviendrait votre déploiement s'il ne le pouvait pas ?
- Quelqu'un dans votre équipe a-t-il lu les pièces de ces dossiers, ou seulement les mémoires qui les résument ?
- Votre fournisseur peut-il produire un registre de provenance de son corpus de préentraînement, ou seulement une politique affirmant qu'il respecte le droit d'auteur ?
Ce qu'il faut surveiller ensuite
Observez si le tribunal sépare la revendication d'acquisition de la revendication d'entraînement au stade du jugement sommaire. S'il le fait, en renvoyant la revendication relative au téléchargement devant un jury tout en tranchant la question du fair use pour l'entraînement en faveur de la défense, l'affaire devient une négociation de dommages et intérêts par rapport au repère par œuvre fixé par Anthropic, et le règlement suit rapidement. Si les revendications restent groupées, l'affaire ira en procès, et tous les contrats d'entreprise signés dans l'hypothèse d'une indemnisation peu coûteuse seront réévalués.
Ready to implement AI in your business?
Our team builds the AI systems you just read about. Start with a free 30-minute discovery meeting.
