Cloudflare passa a bloquear por padrão os rastreadores de IA que se escondem atrás de bots de busca

A nova política padrão de rastreadores da Cloudflare entrou em vigor em 15 de setembro, bloqueando automaticamente bots de treinamento de IA e de agentes em qualquer página que exiba publicidade, a menos que o rastreador declare claramente qual dos três propósitos está cumprindo. A mudança fecha uma brecha que permitia que rastreadores se apresentassem como indexadores de busca enquanto coletavam simultaneamente conteúdo para o treinamento de modelos de IA — uma prática da qual editores vêm reclamando desde que os grandes modelos de linguagem começaram a rastrear a web aberta em larga escala.
Três categorias, uma única regra de aplicação
A Cloudflare agora classifica o tráfego de bots de IA em três categorias. Busca abrange o rastreamento que indexa conteúdo para responder perguntas sobre ele mais tarde, o tipo de atividade que donos de sites toleram há décadas em troca de tráfego de referência. Agente cobre comportamento automatizado que age em tempo real em nome de uma pessoa — ferramentas como o ChatGPT-User da OpenAI ou o Claude da Anthropic quando ele controla diretamente um navegador para um usuário. Treinamento abrange rastreadores que absorvem conteúdo especificamente para treinar ou ajustar um modelo, em que os dados são incorporados permanentemente ao sistema em vez de consultados sob demanda.
A lógica de aplicação é o que torna isso relevante: quando um único rastreador desempenha múltiplas funções — o próprio rastreador do Google, por exemplo, combina Busca com Treinamento —, a Cloudflare agora aplica a regra mais restritiva em todos os casos. Um bot que mistura indexação de busca com coleta de dados de treinamento passa a ser tratado como rastreador de treinamento para fins de bloqueio, sem exceções, mesmo em solicitações em que nominalmente está apenas indexando.
O que os donos de sites realmente controlam
Os editores agora podem definir a permissividade do conteúdo de forma independente das configurações padrão por categoria de bot: o acesso imediato permite que um rastreador interaja sem armazenar ou reutilizar conteúdo, o acesso de referência permite indexação, trechos e links de volta (o novo padrão para páginas com publicidade), e o acesso total permite resumo e reprodução. Os controles granulares em si entraram em vigor em 1º de julho; 15 de setembro é quando a nova postura padrão — bots de treinamento e de agentes bloqueados, bots de busca permitidos — passa a valer automaticamente para novos clientes, sites recém-criados e todos os clientes existentes do nível gratuito. Clientes pagantes que já configuraram suas próprias definições as mantêm inalteradas.
Por que isso importa além da política de um único CDN
A Cloudflare está à frente de uma grande parcela do conteúdo de editores sustentado por publicidade na web, o que faz dessa mudança de padrão funcionar como um padrão de fato da indústria, em vez de uma regra interna de uma única empresa — sites que nunca mexerem em suas configurações da Cloudflare simplesmente começarão a bloquear rastreadores de treinamento de IA hoje. Para os laboratórios de IA, isso eleva o custo prático da coleta de dados de treinamento em larga escala na web: os rastreadores agora precisam declarar honestamente seu propósito ou correm o risco de serem bloqueados por completo, em vez de passar despercebidos junto ao tráfego de indexação de busca. É também uma aposta de que os editores usarão a vantagem criada por isso para negociar pagamento — o mercado mais amplo Pay Per Crawl da Cloudflare, que permite que editores cobrem pelo acesso da IA a seu conteúdo, foi criado exatamente para este momento.
Publicado originalmente por Cloudflare Blog. Leia o artigo original para mais detalhes.
Ver fonte original