Un scientifique de Microsoft l'a qualifié de plus grand vol de travail de l'histoire
Des pièces déscellées, une décision étroite de la Ninth Circuit et une nouvelle plainte antitrust révèlent trois lignes de défense juridiques différentes qui aboutissent toutes au même résultat.
La citation vient de l'intérieur
Dans un mémoire commun de 92 pages déposé par les plaignants du secteur de la presse dans l'affaire de droit d'auteur opposant le New York Times à OpenAI et Microsoft, un Director of Applied Science de Microsoft, le Dr Brent Hecht, est cité comme décrivant l'affaire comme « un vol stupéfiant d'une ampleur sans précédent » et peut-être le « plus grand vol de travail de l'histoire de l'humanité ». Ce n'est pas un journaliste militant. C'est un cadre supérieur de l'une des parties défenderesses, cité dans des documents récemment déscellés et relayés par 404 Media, comme le résume une chronique d'opinion du Register publiée le 27 septembre.
Il s'agit des arguments des plaignants. Le juge Sidney H. Stein du tribunal fédéral du district sud de New York (US District Court for the Southern District of New York) n'a pas statué. OpenAI et Microsoft contestent ces allégations et invoquent le fair use : selon eux, l'entraînement sur des articles et des livres publics fait progresser la connaissance publique et ne constitue pas un « substitut économique illicite sur le marché » aux originaux.
Ce que décrivent réellement les pièces
Si l'on met la rhétorique de côté, les documents décrivent un mécanisme. Les grands modèles de langage sont entraînés en ingérant d'énormes volumes de texte ; le modèle apprend des régularités statistiques plutôt que de stocker des copies, ce qui explique pourquoi le « fair use » est la défense naturelle. Le point intéressant du fair use est le quatrième critère : l'effet sur le marché. Si le résultat produit se substitue à l'original sur le marché, la défense s'affaiblit. C'est précisément le terrain sur lequel les parties s'affrontent.
Deux détails des pièces comptent davantage que les insultes. Premièrement, selon le mémoire, le représentant d'entreprise d'OpenAI a déclaré sous serment qu'il n'avait connaissance d'« aucun effort visant à détecter les contenus derrière un paywall dans ses jeux de données d'entraînement » ni « à retirer les contenus derrière un paywall de ses jeux de données d'entraînement ». Lorsqu'on a dit au cofondateur Greg Brockman qu'OpenAI pouvait contourner un paywall, le mémoire le cite répondant : « ah, nice ». Deuxièmement, un document de politique interne de Microsoft cité dans les pièces admet que l'IA générative pourrait « perturber de manière significative l'emploi des personnes mêmes qui ont produit les données sur lesquelles le modèle de fondation a été entraîné [parce que] les LLM sont un produit qui détruit sa propre chaîne d'approvisionnement » — ce que les mêmes documents appelleraient une « doom loop » (boucle fatale), conduisant à l'effondrement des modèles à mesure que l'offre de travail humain neuf se tarit.
Sous le problème juridique se cache un problème de distribution. Comme le dit un ingénieur logiciel d'OpenAI cité : « Quelle que soit la visibilité des liens, les utilisateurs ne cliqueront pas. » Faire de la citation un remède suppose que le trafic suive l'attribution. L'observation de l'ingénieur lui-même dit le contraire.
Pourquoi la victoire de GitHub est plus étroite qu'il n'y paraît
La Ninth Circuit a donné gain de cause à GitHub, Microsoft et OpenAI dans l'affaire Doe v. GitHub, mais sur une disposition précise du DMCA relative aux informations de gestion du droit d'auteur (CMI) : le nom de l'auteur, la mention de licence et les conditions attachées à une œuvre. Le juge Eric Miller a écrit : « Celui qui crée une nouvelle œuvre et omet d'y inclure des CMI ne peut être dit avoir “retiré” ou “modifié” quoi que ce soit. »
Cela tranche un grief, pas le domaine entier. La décision n'a pas jugé que l'entraînement sur des logiciels open source sans restriction est permis, que copier du code dans un jeu d'entraînement relève toujours du fair use, que le code généré ne peut pas contrefaire, ni que les licences GPL, Apache, BSD ou MIT sont inapplicables. Un avocat spécialisé en open source cité dans la chronique signale un risque plus subtil : les parties plaident de plus en plus les licences open source comme des contrats plutôt que comme les licences de droit d'auteur qu'elles ont été conçues pour être. Les théories contractuelles contournent les questions que le droit d'auteur vous oblige à trancher : êtes-vous titulaire de l'œuvre, s'agit-il d'une expression protégeable, y a-t-il eu copie effective ? En gagnant sur le terrain contractuel, on peut avoir fait respecter les conditions tout en transformant discrètement la licence en autre chose.
La conséquence pratique est un déficit de traçabilité. Un développeur qui accepte une suggestion ne peut pas savoir quelle licence, le cas échéant, régissait le code dont elle est dérivée, et dans les chaînes de production assistées par IA, il n'existe aucun lien à vérifier.
Les questions à vous poser
- Si un tribunal conclut ultérieurement que les données d'entraînement ont été acquises illégalement, l'indemnisation de votre fournisseur d'assistant de code vous couvre-t-elle, et couvre-t-elle les actions contractuelles fondées sur des licences open source, ou seulement les actions en droit d'auteur ?
- Votre fournisseur peut-il produire un quelconque historique de provenance pour le code généré, ou « nouvelle œuvre, pas de CMI » est-il toute la réponse ?
- Si votre modèle économique dépend d'être cité par un produit d'IA, que vaut-il, compte tenu de la déclaration d'un ingénieur d'OpenAI selon laquelle les utilisateurs ne cliqueront pas, quel que soit l'emplacement des liens ?
- Pour la plainte antitrust visant Anthropic, OpenAI, SpaceXAI et Google : quelles preuves existe-t-il d'un accord réel et d'un préjudice à la concurrence, au-delà de dirigeants tenant des propos publics similaires sur la sécurité au cours d'un même week-end ?
- Si les documents internes de Microsoft admettent que les LLM détruisent leur propre chaîne d'approvisionnement, quel est le plan pour se procurer du travail humain neuf, et qui paie ?
Ce qu'il faut surveiller ensuite
La décision du juge Stein dans le district sud de New York est le signal à attendre. Si la défense fondée sur le fair use survit au jugement sommaire, le modèle « prendre maintenant, discuter ensuite » est de fait ratifié et les accords de licence deviennent une simple bonne volonté facultative. Dans le cas contraire, chaque note interne déscellée sur les boucles fatales et les paywalls devient un élément de preuve dans les vingt prochaines affaires. Il faut aussi observer si une sanction aura du mordant : la chronique note que les récentes victoires antitrust contre les activités publicitaires et de recherche de Google ont été édulcorées au stade de la sanction.
Ready to implement AI in your business?
Our team builds the AI systems you just read about. Start with a free 30-minute discovery meeting.
