Apple a-t-il entraîné son intelligence artificielle sur des données de manière illégale ?

Apple a récemment publié un document de recherche affirmant sa démarche éthique dans le développement de ses modèles d’intelligence artificielle. L’entreprise précise qu’elle ne collecte pas d’informations sans autorisation et met en avant son respect des droits d’auteur.

Apple détaille son éthique

Dans un nouveau document de recherche, Apple annonce qu’il ne formera ses modèles d’intelligence artificielle qu’avec des données pour lesquelles il dispose de licences ou qui sont accessibles au public. La société affirme : « Nous croyons à la formation de nos modèles en utilisant des données diverses et de haute qualité », ajoutant que « nous n’utilisons pas les données personnelles privées de nos utilisateurs ou les interactions utilisateur lors de la formation ». Apple indique également avoir mis en place des filtres pour retirer certaines informations considérées comme identifiables ou inappropriées.

Apple a-t-il entraîné son intelligence artificielle sur des données de manière illégale ?

Le document souligne l’importance du système interne nommé Applebot, qui permet à l’entreprise d’accéder à une information utile, tout en respectant les règles établies par les éditeurs web concernant le grattage. Apple déclare : « Continuez à suivre les meilleures pratiques pour la rampe du Web éthique ». Les éditeurs disposent ainsi de « contrôles à grain fin » sur ce que peut voir Applebot.

Ce que disent les entreprises et ce qu’elles font

D’autres entreprises du secteur, telles qu’OpenAI, se montrent moins précises quant au respect des demandes spécifiques formulées par les sites via le fichier robots.txt. OpenAI a déclaré dans un article de blog daté mai 2024 : « Il y a des décennies, la norme Robots.txt a été introduite. nous prenons en compte ces signaux chaque fois que nous formons un nouveau modèle », sans confirmer explicitement son uniformité concernant ces directives.

Les entreprises ayant développé des outils similaires semblent ignorer fréquemment ce type d’instructions. Une étude menée par Tollbit révèle qu’en mars 2025, plus de 26 millions d’accès ont contourné les restrictions posées par robots.txt; ce chiffre augmentant régulièrement avec seulement 3,3% lors du quatrième trimestre 2024 contre environ 13% au premier trimestre 2025.

Robots.txt est plus qu’un simple non

Lorsqu’un système tente d’accéder à un site web, il doit s’identifier. Googlebot fournit une liste exhaustive aux propriétaires informant des sections bloquées. Selon la BBC en 2023, celle-ci avait mis en œuvre des mesures pour empêcher explicitement certains systèmes IA tels qu’OpenAI d’accéder aux contenus Web protégés.

Apple se démarque en IA

Tandis que plusieurs sociétés accusent souvent leurs concurrentes comme Perplexity.ai d’avoir gratté illégalement leur contenu, aucune plainte similaire n’a été formulée contre Apple jusqu’à présent concernant ses pratiques éthiques dans l’entraînement basé sur l’IA.

L’avenir révélera si les engagements pris par Apple tiendront face aux cadences juridiques qui pèsent sur le secteur technologique. Pour l’heure, alors que plusieurs grandes entreprises doivent faire face à la justice sur ces sujets épineux liés au droit d’auteur, Apple semble explorer une voie distincte privilégiant le consentement et la légalité dans son action envers l’intelligence artificielle.