AIO APEX

Cloudflare commence à bloquer par défaut les robots d'IA qui se cachent derrière des bots de recherche

Cloudflare Blog
Partager:
Cloudflare commence à bloquer par défaut les robots d'IA qui se cachent derrière des bots de recherche

La nouvelle politique par défaut de Cloudflare concernant les robots d'exploration est entrée en vigueur le 15 septembre, bloquant automatiquement les robots d'entraînement d'IA et les robots agents sur toute page comportant de la publicité, à moins que le robot ne déclare clairement lequel des trois objectifs il sert. Ce changement comble une faille qui permettait aux robots de se faire passer pour des indexeurs de recherche tout en récoltant simultanément du contenu pour l'entraînement de modèles d'IA — une pratique dont se plaignent les éditeurs depuis que les grands modèles de langage ont commencé à explorer le web ouvert à grande échelle.

Trois catégories, une seule règle d'application

Cloudflare classe désormais le trafic des robots d'IA en trois catégories. Recherche couvre l'exploration qui indexe du contenu pour répondre ultérieurement à des questions à son sujet, le type d'activité que les propriétaires de sites tolèrent depuis des décennies en échange de trafic de référencement. Agent couvre le comportement automatisé agissant en temps réel pour le compte d'une personne — des outils comme ChatGPT-User d'OpenAI ou Claude d'Anthropic lorsqu'il pilote directement un navigateur pour un utilisateur. Entraînement couvre les robots qui ingèrent du contenu spécifiquement pour entraîner ou affiner un modèle, où les données sont absorbées de façon permanente dans le système plutôt que consultées à la demande.

C'est la logique d'application qui rend cela important : lorsqu'un seul robot remplit plusieurs fonctions — le propre robot de Google, par exemple, combine Recherche et Entraînement — Cloudflare applique désormais la règle la plus restrictive sur l'ensemble. Un bot qui mélange indexation de recherche et collecte de données d'entraînement est traité comme un robot d'entraînement aux fins de blocage, point final, même sur les requêtes où il ne fait nominalement qu'indexer.

Ce que les propriétaires de sites contrôlent réellement

Les éditeurs peuvent désormais définir la permissivité du contenu indépendamment des paramètres par défaut liés à la catégorie du robot : l'accès immédiat permet à un robot d'interagir sans stocker ni réutiliser le contenu, l'accès de référence permet l'indexation, les extraits et les liens retour (le nouveau paramètre par défaut pour les pages financées par la publicité), et l'accès complet autorise le résumé et la reproduction. Les contrôles granulaires eux-mêmes sont entrés en vigueur le 1er juillet ; le 15 septembre marque le moment où la nouvelle posture par défaut — robots d'entraînement et agents bloqués, robots de recherche autorisés — s'applique automatiquement aux nouveaux clients, aux sites nouvellement créés et à tous les clients existants du niveau gratuit. Les clients payants ayant déjà configuré leurs propres paramètres les conservent inchangés.

Pourquoi cela compte au-delà de la politique d'un seul CDN

Cloudflare se trouve en amont d'une grande partie du contenu des éditeurs financé par la publicité sur le web, ce qui fait de ce changement de paramètre par défaut une norme de facto pour l'industrie plutôt qu'une simple règle maison d'une seule entreprise — les sites qui ne touchent jamais à leurs paramètres Cloudflare vont tout simplement commencer à bloquer les robots d'entraînement d'IA dès aujourd'hui. Pour les laboratoires d'IA, cela augmente le coût pratique de la collecte de données d'entraînement à grande échelle sur le web : les robots doivent désormais déclarer honnêtement leur objectif, sous peine d'être totalement bloqués, plutôt que de se glisser discrètement dans le trafic d'indexation de recherche. C'est aussi un pari que les éditeurs utiliseront le levier ainsi créé pour négocier un paiement — le marché plus large Pay Per Crawl de Cloudflare, qui permet aux éditeurs de facturer l'accès de l'IA à leur contenu, a été conçu exactement pour ce moment.

Initialement rapporté par Cloudflare Blog. Lisez l'article original pour plus de détails.

Voir la source originale
Partager: