Perplexity défend son choix d'ignorer le robots.txt et de collecter des données

La perplexité et la collecte de données : une controverse grandissante

Perplexity continue de contourner les règles de robots.txt pour accéder à des données en ligne, selon un rapport récent de CloudFlare. Tandis qu’Apple et d’autres entreprises respectent ces directives, Perplexity adopte des méthodes controversées pour alimenter ses modèles d’IA, ce qui pourrait nuire à sa réputation.

Perplexity défend son choix d’ignorer le robots. Txt et de collecter des données

Le contournement des blocs par Perplexity

L’entreprise Perplexity a été accusée de grapiller activement du contenu en ligne malgré l’inexistence de soutien légal aux fichiers robots.txt, conçus pour bloquer l’accès. Cela soulève des questions sur la légitimité des pratiques utilisées pour former ses grands modèles linguistiques. Un rapport de CloudFlare révèle que l’entreprise a développé plusieurs techniques pour ignorer ces protections.

Les tests menés par CloudFlare ont démontré que lorsque Perplexity rencontrait un fichier robots.txt interdisant le grattage, elle utilisait un nouveau bot avec une adresse IP différente pour récupérer les informations disponibles uniquement sur le site web concerné. Le rapport indique que « les nouvelles techniques étaient plus précises lorsque les nouveaux robots pouvaient passer. »

Une réponse défensive face à Cloudflare

En réponse aux accusations, Perplexity a pris une posture défensive affirmant que son grattoir Web et ses agents d’IA sont distincts. L’entreprise soutient que Cloudflare ne parvient pas à faire la différence entre eux et souligne : « Cette controverse révèle que les systèmes de Cloudflare sont fondamentalement inadéquats… Si vous ne pouvez pas dire un assistant numérique utile d’un grattoir malveillant… »

Cependant, cela semble bizarre dans le contexte où les sites Web expriment leur droit de protéger leur contenu contre tout vol.

Le positionnement d’Apple dans cette situation

Lorsqu’Apple a présenté Apple Intelligence, elle a reconnu avoir utilisé Applebot pour gratter le Web afin d’obtenir des données destinées à former ses modèles fondamentaux tout en déclarant respecter les règles imposées par robots.txt. Après cette annonce, plusieurs sites Web ont rapidement mis à jour leurs restrictions contre Applebot ainsi qu’autres bots IA.

Malgré la controverse entourant ce sujet sensible sur la collecte donnée AI, Apple s’est efforcé de se démarquer grâce à des pratiques éthiques durables en matière de récupération et d’utilisation des données utilisateurs pendant que sa réputation reste intacte dans cet environnement concurrentiel complexe.

Cette situation met également en évidence la nécessité croissante pour les entreprises technologiques comme Perplexity et Apple d’adopter une approche éthique vis-à-vis du traitement des données sur Internet afin d’éviter toute dégradation supplémentaire du paysage digital ouvert.