Cloudflare empieza a bloquear por defecto los rastreadores de IA que se esconden tras bots de búsqueda

La nueva política de rastreadores predeterminada de Cloudflare entró en vigor el 15 de septiembre, bloqueando automáticamente a los bots de entrenamiento de IA y de agentes en cualquier página que incluya publicidad, a menos que el rastreador declare claramente cuál de los tres propósitos está cumpliendo. El cambio cierra una brecha que permitía a los rastreadores identificarse como indexadores de búsqueda mientras recopilaban simultáneamente contenido para el entrenamiento de modelos de IA, una práctica de la que los editores se han quejado desde que los grandes modelos de lenguaje empezaron a rastrear la web abierta a gran escala.
Tres categorías, una sola regla de aplicación
Cloudflare ahora clasifica el tráfico de bots de IA en tres categorías. Búsqueda abarca el rastreo que indexa contenido para responder preguntas sobre él más adelante, el tipo de actividad que los propietarios de sitios han tolerado durante décadas a cambio de tráfico de referencia. Agente cubre el comportamiento automatizado que actúa en tiempo real en nombre de una persona, herramientas como ChatGPT-User de OpenAI o Claude de Anthropic cuando maneja directamente un navegador para un usuario. Entrenamiento abarca a los rastreadores que ingieren contenido específicamente para entrenar o ajustar un modelo, donde los datos quedan absorbidos permanentemente en el sistema en lugar de consultarse bajo demanda.
La lógica de aplicación es lo que hace esto relevante: cuando un mismo rastreador cumple varias funciones —el propio rastreador de Google, por ejemplo, combina Búsqueda con Entrenamiento—, Cloudflare ahora aplica la regla más restrictiva en todos los casos. Un bot que mezcla indexación de búsqueda con recopilación de datos de entrenamiento se trata como rastreador de entrenamiento a efectos de bloqueo, sin excepciones, incluso en solicitudes donde nominalmente solo está indexando.
Lo que los propietarios de sitios realmente controlan
Los editores ahora pueden configurar la permisividad de contenido de forma independiente a los valores predeterminados por categoría de bot: el acceso inmediato permite que un rastreador interactúe sin almacenar ni reutilizar el contenido, el acceso de referencia permite indexar, extraer fragmentos y enlazar de vuelta (el nuevo valor predeterminado para páginas con publicidad), y el acceso completo permite resumir y reproducir. Los controles granulares en sí se activaron el 1 de julio; el 15 de septiembre es cuando la nueva postura predeterminada —bots de entrenamiento y agentes bloqueados, bots de búsqueda permitidos— se aplica automáticamente a los nuevos clientes, a los sitios recién creados y a todos los clientes existentes del nivel gratuito. Los clientes de pago que ya configuraron sus propios ajustes los mantienen sin cambios.
Por qué esto importa más allá de la política de un CDN
Cloudflare se sitúa delante de una gran parte del contenido publicado con publicidad en la web, lo que significa que este cambio de valores predeterminados funciona como un estándar de facto de la industria más que como la norma interna de una sola empresa: los sitios que nunca toquen su configuración de Cloudflare simplemente empezarán a bloquear los rastreadores de entrenamiento de IA hoy mismo. Para los laboratorios de IA, esto eleva el costo práctico de recopilar datos de entrenamiento a gran escala en la web: los rastreadores ahora tienen que declarar honestamente su propósito o arriesgarse a ser bloqueados por completo, en lugar de camuflarse silenciosamente entre el tráfico de indexación de búsqueda. También es una apuesta a que los editores usarán la ventaja que esto genera para negociar pagos: el mercado más amplio Pay Per Crawl de Cloudflare, que permite a los editores cobrar por el acceso de la IA a su contenido, se construyó exactamente para este momento.
Publicado originalmente por Cloudflare Blog. Lee el artículo original para más detalles.
Ver fuente original