L’ancien gouverneur de l’Arkansas, Mike Huckabee, fait partie d’un groupe d’auteurs poursuivant Meta, Microsoft et d’autres sociétés pour l’utilisation de leur travail dans la création d’outils d’IA.
Le recours collectif proposé est le dernier exemple d’auteurs alléguant que des entreprises technologiques ont utilisé leurs travaux sans autorisation pour former des modèles d’IA génératifs. Au cours des derniers mois, une série d’auteurs populaires, dont George RR Martin, Jodi Picoult et Michael Chabon, ont poursuivi OpenAI pour violation du droit d’auteur.

L’affaire Huckabee se concentre sur un ensemble de données controversé appelé « Books3 » qui contient plus de 180 000 ouvrages faisant partie de l’ensemble de données utilisé pour former de grands modèles de langage.
En août, The Atlantic a publié une base de données consultable de tous les titres de Books3 avec des informations sur l’auteur. Books3 fait partie d’une plus grande montagne de données appelée Pile, créée par EleutherAI, qui, selon la poursuite, a été utilisée par les entreprises pour former leurs produits.
« « Nous avons pu incorporer des ensembles de données sophistiqués, qui comprenaient des documents piratés protégés par le droit d’auteur dans Books3, dans le cadre du processus de formation du LLM, sans avoir à rémunérer les auteurs », indique le procès.
Les entreprises d’IA s’appuient sur d’énormes quantités de données publiques pour former des modèles d’IA – pas seulement des livres mais aussi des photographies, des œuvres d’art, de la musique, etc.