Microsoft et OpenAI sont de nouveau traînés en justice, et cette fois ce sont des médias d'information locaux, rarement sous les projecteurs, qui se tiennent à la barre des plaignants. Menés par le groupe de presse Emmerich du Mississippi, plusieurs médias d'information locaux américains ont récemment déposé plainte devant les tribunaux, accusant les deux géants de la technologie d'avoir injecté, de façon systématique et durable, sans autorisation et sans aucune compensation, des dizaines de milliers d'articles de presse protégés par le droit d'auteur dans le processus d'entraînement de leurs grands modèles, et d'avoir engrangé une immense valeur commerciale grâce à ces produits d'IA, alors que les fournisseurs des contenus originaux n'ont même pas vu la couleur d'un centime.
Cette affaire n'est pas un cas isolé. Ces dernières années, la poudre n'a jamais cessé de flotter : le New York Times et d'autres grands médias ont déjà attaqué Microsoft et OpenAI en justice pour les mêmes raisons. Mais l'arrivée des médias locaux étend le front des grands journaux de tête jusqu'aux journaux communautaires. Les plaignants l'écrivent noir sur blanc dans leur plainte : Microsoft et OpenAI ont généré et continueront de générer des milliards de dollars de revenus, tandis que les producteurs de contenus n'ont « pas reçu un centime » ; plus frappant encore, certains articles qui étaient pourtant derrière un paywall et soumis à des restrictions d'accès auraient également été prélevés en contournant ces limites pour servir à l'entraînement.
Les éléments les plus techniques de la plainte portent sur les marques de droits d'auteur. Les plaignants soulignent que les articles concernés contenaient à l'origine des informations de gestion des droits — noms des auteurs, noms des organismes de publication, mentions de copyright, conditions d'utilisation — qui constituent en quelque sorte la carte d'identité des œuvres. Ils accusent Microsoft et OpenAI d'avoir effacé ces marques avant d'injecter les contenus dans l'entraînement, effaçant ainsi la paternité des œuvres comme on arrache furtivement des photos d'un album de famille. Une autre preuve vient des sorties : les plaignants affirment que leurs contenus de presse ont été, à plusieurs reprises au cours des dernières années, recrachés par les systèmes d'IA de manière quasi verbatim, ce qui prouve rétrospectivement que ces matériaux ont été profondément absorbés dans les entrailles des modèles.
Pour les médias locaux, il ne s'agit pas seulement d'un contentieux de droits d'auteur, mais d'une question de survie. Les journaux locaux américains sont déjà, ces dernières années, écrasés par la double pression du déclin des ventes papier et de la contraction de la publicité, et le fait que l'IA livre directement des réponses aux utilisateurs leur retire encore davantage ce maigre trafic. Les plaignants qualifient donc la pratique des entreprises technologiques de « glas de la presse locale » — sur beaucoup des marchés qu'ils desservent, le groupe de presse Emmerich est l'unique source d'information locale, et si ces médias sont contraints de se réduire voire de fermer, le canal d'information des habitants sera directement coupé. Outre Emmerich, cette action collective réunit Ojai Media ainsi que plusieurs sociétés d'édition et de médias du groupe Coopwood, tous éditeurs indépendants de journaux et de magazines.
Sur le plan juridique, les plaignants estiment que les deux sociétés ont violé le Copyright Act américain et le Digital Millennium Copyright Act (DMCA), constituant une contrefaçon de droits d'auteur et des infractions connexes. La plainte relève aussi un flagrant deux poids deux mesures : Microsoft et OpenAI sont accusés de bafouer les droits d'auteur des éditeurs tout en protégeant activement leurs propres codes, modèles et systèmes par des accords de licence, des services payants et des moyens juridiques ; les plaignants ressortent même une affaire récente — OpenAI s'était publiquement plaint que des concurrents utilisaient les contenus qu'il avait générés pour entraîner leurs modèles, lui portant préjudice, une posture qui contraste avec le comportement qui lui est aujourd'hui reproché.
Les revendications des médias locaux sont claires : obtenir du tribunal des dommages-intérêts et des compensations, mais surtout une injonction obligeant Microsoft et OpenAI à supprimer intégralement de leurs données d'entraînement tout contenu relevant des œuvres protégées des plaignants. Alors que de plus en plus d'organes de presse, d'éditeurs et de créateurs de contenus brandissent l'arme juridique, la question de la légalité des données d'entraînement de l'IA et des mécanismes de licence et de rétribution des contenus s'installe solidement au premier rang des sujets juridiques les plus scrutés de l'industrie mondiale de l'intelligence artificielle.