← Voltar ao Blog
Marketing & Growth

Cloudflare Disallow AI Training: um mapa de migração de rastreadores para equipes de busca

O Disallow AI Training da Cloudflare separa as preferências de treinamento do acesso de busca, mas Training Block pode bloquear rastreadores de busca de uso misto. Mapeie o suporte dos provedores, a lacuna do Bing até o início de 2027 e as verificações de reversão sem confundir acesso de rastreamento com cumprimento das preferências de treinamento.

Escrito por Hamza Diaz
16 de setembro de 202610 min de leitura6 visualizações

O que mudou: Disallow AI Training não é o mesmo que Block

O Disallow AI Training da Cloudflare publica preferências de treinamento e mantém permitido o acesso dos rastreadores de busca de uso misto classificados como Accountable. Training Block pode bloquear esses mesmos rastreadores. Essa é a distinção prática na atualização da Cloudflare de 15 de setembro de 2026. Já o suporte do Bing à preferência de não uso para treinamento via robots.txt continua previsto para o início de 2027.

Comece pelo resultado que você deseja. Manter as páginas disponíveis para busca não define se o conteúdo delas pode ser usado para treinamento, e nenhuma dessas decisões define sua inclusão em resumos de IA. Cada uma exige um controle compatível. Ter o painel configurado é um critério insuficiente para considerar o trabalho concluído. Verifique se o rastreador pretendido ainda consegue acessar as páginas relevantes.

A atualização descreve como os controles funcionam; ela não demonstra que os sites perderam posições nos resultados quando foi lançada.

Três resultados que exigem controles separados

Com Disallow AI Training, o Bot Preference Sync publica as preferências de treinamento aplicáveis por meio do robots.txt. Os rastreadores de uso misto classificados como Accountable continuam autorizados a acessar o site para busca. Outros rastreadores de treinamento são bloqueados, incluindo as vias exclusivas de treinamento da Amazon, Anthropic, Meta e OpenAI. Seus rastreadores de busca separados são alvos distintos.

Google-Extended e Applebot-Extended são tokens de controle de uso, não nomes alternativos para Googlebot e Applebot. Recusar o uso para treinamento não significa recusar automaticamente toda resposta gerada. O guia de SEO, AEO e GEO apresenta o contexto mais amplo; aqui, o foco são as decisões de migração e as evidências necessárias para justificá-las.

Mapeie as configurações existentes da Cloudflare antes de alterar o acesso de busca

Configurações e efeitos: Allow, Disallow e Block

Registre os valores atuais da zona antes de alterar qualquer coisa. A seleção de Allow não se sobrepõe a outra configuração nem a uma regra de WAF independente. Training Block e Block on pages with ads agora incluem Applebot, Bingbot e Googlebot, que são de uso misto, portanto uma suposição sobre o que conta como tráfego de IA pode causar um bloqueio involuntário do acesso de busca.

As configurações e os resultados de migração a seguir estão documentados na atualização de setembro da Cloudflare.

Configuração existente ou ação propostaResultado documentadoImplicação para a buscaVerificação pendente
Block AI legado desativadoSearch Allow, Training Allow, Agent AllowA migração não adiciona bloqueio por categoriaRegras existentes e robots.txt
Block AI legado em Block ou bloqueio apenas em páginas com anúnciosSearch Allow, Training Disallow AI Training, Agent Block on pages with adsEssa seleção de treinamento mantém permitido o acesso de busca dos rastreadores de uso mistoSuporte do provedor
Configuração granular anterior de Training Block ou bloqueio apenas em páginas com anúnciosTraining passa a Disallow; as seleções de Search e Agent permanecem inalteradasAs restrições de Search preservadas continuam relevantesValores efetivamente migrados
Selecionar Training Disallow AI TrainingPreferências para rastreadores de uso misto classificados como Accountable; outros rastreadores de treinamento bloqueadosO acesso de busca pode ser mantidoLacuna do Bing e WAF
Selecionar Training BlockTodos os rastreadores de treinamento bloqueados, incluindo os de uso mistoPode impedir o acesso de buscaSe o bloqueio é intencional
Selecionar Training Block on pages with adsRastreadores de treinamento bloqueados em páginas nas quais foram detectados anúnciosEssas páginas podem perder o acesso de buscaDetecção de anúncios e caminhos afetados

A migração automática não é uma predefinição para novos domínios

A Cloudflare afirma que a maioria das configurações existentes migra automaticamente. O novo significado de Block não implica que todos os sites anteriormente protegidos passem de repente a bloquear o Googlebot. Verifique os valores migrados antes de decidir se é necessário fazer uma alteração.

As recomendações para novos domínios são um assunto separado. Para sites financiados por anúncios, a predefinição oferece Search Allow, Training Disallow AI Training e Agent Block on pages with ads. Para sites que não são financiados por anúncios, a predefinição oferece Allow nas três categorias. O Bot Preference Sync é ativado em ambos os casos, e os proprietários podem alterar essas recomendações.

Os controles estão disponíveis em todos os planos, no âmbito do domínio ou da zona. Não existe uma opção Disallow AI Training restrita a páginas com anúncios nem uma opção Agent Disallow. Testar caminhos individuais não transforma os controles em configurações por caminho.

A documentação de Block AI Bots ainda apresentava, quando consultada, uma redação de julho sobre os padrões de setembro. Nos pontos em que as descrições divergem, este artigo atribui o comportamento de migração mais recente à atualização de setembro. Verifique o painel antes de seguir uma sequência de cliques presumida.

Verifique os recursos dos provedores, especialmente a lacuna do Bing até o início de 2027

A classificação Accountable abrange mais do que mecanismos já disponíveis. Ela exige opções de recusa de treinamento e de resumos, transparência no nível de URL e garantia de que a recusa de treinamento não afete a busca tradicional, seja por recursos já disponíveis ou por compromissos assumidos. Cada mecanismo ainda precisa ser verificado individualmente.

ProvedorDistinção entre busca e treinamentoMecanismo para resumosCompromisso ou lacuna
GoogleGooglebot cuida da busca; Google-Extended controla usos específicos de treinamento e fundamentaçãoA busca tem controles de trechos e indexaçãoA Cloudflare informa que se espera transparência adicional de URLs para o Extended dentro de algumas semanas
AppleApplebot rastreia; Applebot-Extended controla o uso para treinamento de modelos fundacionaisnosnippet abrange determinadas respostas generativasA Cloudflare informa que o trabalho de inspeção no nível de URL está previsto para 2027
BingBingbot continua autorizado com Disallow; não há suporte ao envio automático da preferência de não uso para treinamento via robots.txtOs controles históricos do Bing Chat vinculam algumas restrições de respostas e de treinamentoO suporte à preferência de não uso para treinamento via robots.txt está previsto para o início de 2027

Google: Google-Extended não é Googlebot

A documentação de rastreadores do Google descreve Google-Extended como um token de produto sem uma string user-agent própria para requisições HTTP. Ele controla usos específicos de treinamento e fundamentação do Gemini. O Google afirma que ele não afeta a inclusão nem a classificação na Busca.

Para as Visões gerais criadas por IA e o Modo IA do Google, as orientações sobre IA na Busca apontam o Googlebot como o controle de acesso para rastreamento e listam nosnippet, data-nosnippet, max-snippet e noindex como formas de limitar as informações exibidas. Esses controles têm consequências diferentes. Em particular, noindex não é uma preferência exclusiva de treinamento e não deve ser tratado como tal.

Depois de alterar os controles de prévia, use a Inspeção de URL do Search Console para ver o HTML que o Googlebot recebeu e aguarde um novo rastreamento e o processamento. Não procure um rastreador Google-Extended separado nos registros de acesso como prova de que a preferência funcionou, pois a documentação não descreve a existência de um.

A Cloudflare também descreve uma opção de ativação em um portal de busca generativa. A documentação do Google consultada aqui não confirma de forma independente essa interface universal específica. Por isso, este mapa não recomenda seu uso nem trata a transparência de URLs prometida como algo já disponível.

Apple: Applebot-Extended não bloqueia o rastreador de busca

A Apple afirma que Applebot-Extended não rastreia páginas. Proibi-lo controla o uso para treinamento do conteúdo coletado pelo Applebot; as páginas podem continuar sendo encontradas na busca.

A Apple documenta separadamente o uso de nosnippet para determinadas respostas generativas, com efeitos sobre descrições e respostas da web. Revise esses efeitos de apresentação antes da implementação, pois eles afetam a forma como o conteúdo aparece, além de seu uso para treinamento. A Cloudflare situa o trabalho de inspeção de URLs da Apple no próximo ano, ou seja, 2027, sem fornecer uma data de lançamento.

Bing: uma lacuna no envio de preferências não é uma recomendação de remoção

Até que chegue o suporte do Bing previsto para o início de 2027, Disallow AI Training não envia automaticamente uma preferência de não uso para treinamento por meio do robots.txt. Registre esse estado claramente como não resolvido, e não como implementado.

O anúncio da Microsoft de setembro de 2023 afirma que NOARCHIVE exclui o conteúdo das respostas do Bing Chat e de futuros treinamentos de modelos fundacionais, mantendo a elegibilidade para os resultados de busca. NOCACHE tem precedência quando ambos estão presentes. Esses são comportamentos históricos documentados, não uma confirmação independente de cobertura de todos os ambientes atuais da Microsoft.

A Cloudflare menciona NOARCHIVE e ferramentas de remoção. Não use a remoção como substituto de um controle exclusivo de treinamento, pois as consequências para a indexação precisam ser verificadas separadamente. Este artigo não recomenda procedimentos de remoção. O controle unificado da Cloudflare sobre a quantidade de conteúdo nos resumos também é uma meta para o início de 2027, não um recurso lançado em setembro.

Use o Mapa de Migração da Intenção dos Rastreadores

Registre o estado inicial e os resultados desejados

O Mapa de Migração da Intenção dos Rastreadores é um modelo de trabalho apresentado neste artigo, não um recurso da Cloudflare nem uma metodologia alegadamente usada com clientes. Use-o para relacionar o estado registrado da zona aos resultados que você deseja. Junto de cada controle proposto, mantenha o estado do suporte do provedor e as evidências necessárias para aceitar a alteração. Inclua o procedimento de reversão.

Exporte as configurações quando possível ou registre os valores exatos de Search, Training e Agent, o estado do Bot Preference Sync, a resposta pública do robots.txt e as regras de WAF relevantes. Inclua data e hora no registro. Oculte detalhes sensíveis das regras antes de compartilhá-los fora da equipe operacional.

Anote se o acesso de busca deve permanecer aberto e depois especifique a preferência de treinamento. Tome uma decisão separada sobre a política de resumos. Uma preferência sem suporte continua sendo uma lacuna mesmo quando o painel parece configurado; a configuração, por si só, não comprova o suporte do provedor nem o cumprimento da preferência.

Escolha caminhos indexáveis representativos, incluindo páginas com e sem anúncios, quando relevante. Registre as observações disponíveis de rastreamento e indexação antes da alteração. Defina em conjunto quais bloqueios inesperados acionarão a reversão e identifique a pessoa que pode restaurar as configurações. Registre quaisquer proteções independentes que devam permanecer intactas.

flowchart TD A[Registrar estado inicial da zona] --> B[Especificar resultados de busca, treinamento e resumos] B --> C{O provedor oferece suporte à combinação pretendida?} C -->|Não ou desconhecido| D[Registrar lacuna ou adiar alteração] C -->|Sim| E[Registrar controles propostos] E --> F[Inspecionar robots.txt e acesso dos rastreadores] F --> G{Acesso de busca pretendido preservado?} G -->|Não| H[Restaurar estado inicial e investigar] G -->|Sim| I[Observar sinais de rastreamento e indexação] I --> J[Manter evidências e limitações não resolvidas]

Este registro ilustrativo não é um corpo de requisição da API da Cloudflare nem uma observação em produção. Ele propõe recusar o treinamento e deixar os resumos sem decisão.

{
  "zone": "example.com",
  "observedAt": null,
  "desiredOutcomes": {"search": "allow", "training": "decline", "summaries": "undecided"},
  "currentControls": "not_checked",
  "proposedControls": {"Search": "Allow", "Training": "Disallow AI Training", "Agent": "retain_recorded_baseline"},
  "providerSupport": {"bingRobotsTraining": "target_early_2027_not_shipped"},
  "evidence": {"robotsTxt": "not_checked", "verifiedCrawlerAccess": "not_checked"},
  "rollback": "restore_recorded_baseline_after_unintended_search_denial"
}

Inspecione o robots.txt e o acesso dos rastreadores

O Bot Preference Sync insere o conteúdo gerado antes do material existente no robots.txt. Inspecione a resposta inteira, não apenas as linhas recém-geradas. Verifique os grupos de user-agent aplicáveis e a precedência das diretivas de acordo com as regras de cada operador de rastreador. A ordem em que as linhas aparecem não é um teste de aceitação. A Cloudflare também afirma que essa sincronização por categoria não lê diretamente regras personalizadas individuais com lógica mais complexa. Não presuma que uma exceção personalizada de WAF foi traduzida para o robots.txt.

Teste de migraçãoEvidênciaCondição de falhaResposta
Estado inicial registradoControles, regras e robots.txtNão é possível reconstruir o estado anteriorAdiar alteração
Preferência expressarobots.txt servido e token do provedorDiretiva ausente ou conflitanteRestaurar configuração anterior; investigar sincronização
Caminhos de busca acessíveisRequisições verificadas, caminhos e códigos de respostaNovo bloqueio de um rastreador de busca pretendidoRestaurar controles alterados; identificar regra
Redirecionamentos funcionandoCadeias de respostas e destinosDestino inesperado ou inacessívelReverter alteração responsável
Outras proteções preservadasEventos de WAF e evidências das regrasNecessidade inexplicada de contornar amplamente as proteçõesInterromper; evitar exceções generalizadas
Lacuna do provedor registradaFonte datada e estado do suporteSuporte prometido marcado como implementadoCorrigir registro; adiar resultado sem suporte

Um user-agent copiado do Googlebot permite inspecionar uma resposta, mas não comprova o acesso do Googlebot real. Use a verificação de identidade documentada quando disponível. A documentação de gerenciamento de rastreadores da Cloudflare descreve a identificação por user-agent no plano gratuito e uma detecção mais detalhada nos planos superiores. Indique o nível de confiança de acordo com isso.

A mesma documentação alerta que requisições malsucedidas podem decorrer de outras regras ou de erros de resposta. Identifique o controle responsável antes de alterar a política de treinamento. Caso contrário, a equipe pode enfraquecer a regra errada e ainda deixar o problema do rastreador sem solução.

Meça os resultados e mantenha a possibilidade de reversão

A estrutura de medição de busca com IA oferece um contexto mais amplo de medição. Esta migração precisa de um registro mais específico, que vincule cada observação à alteração de configuração correspondente.

MediçãoEvidênciaLimite de interpretação
Envio da preferênciarobots.txt com data e hora e diretivas aplicáveisPublicação não é cumprimento
Acesso de buscaRequisições verificadas por provedor, caminho e código de respostaCaminhos não testados continuam desconhecidos
Comportamento de rastreamento e indexaçãoObservações do Search Console e do Bing WebmasterO momento de uma nova visita e o atraso dos relatórios importam
Resultados de busca e resumosDesempenho na busca e observações separadas de visibilidadeUma mudança não estabelece causalidade
Resultados comerciaisTráfego de referência e conversões relevantesA demanda e outros lançamentos dificultam a atribuição

O Google inclui as Visões gerais criadas por IA e o Modo IA nos relatórios gerais da Web do Search Console. Não classifique uma mudança agregada como um efeito isolado dos resumos. Escolha janelas de observação com base nas visitas reais dos rastreadores e no processamento, em vez de presumir um resultado imediato.

Se o acesso de busca pretendido passar a ser bloqueado, restaure as configurações registradas e verifique novamente os caminhos afetados. A restauração não garante um novo rastreamento imediato nem a recuperação imediata da indexação. O teste de rastreabilidade de evidências do Cloudflare Radar oferece um contexto relacionado ao tratamento de evidências para outro produto, não para a implementação deste controle.

Erros comuns ao separar busca de treinamento

O erro central é selecionar Training Block e esperar que um rastreador de uso misto continue operando para busca. Inspecione os valores migrados em vez de confiar no significado antigo do rótulo. Search Allow não cancela restrições independentes em outras partes da configuração.

As configurações de Agent não resolvem a ausência de um mecanismo de treinamento. Uma opção Disallow restrita a páginas com anúncios também não pode resolvê-la, pois nenhuma é oferecida. A classificação Accountable não elimina a lacuna do Bing, e uma diretiva de treinamento não é uma opção de recusa de resumos.

Tenha cuidado com o que as evidências realmente mostram. Uma string user-agent copiada diz pouco sobre a identidade do rastreador, enquanto o robots.txt registra uma preferência publicada sem comprovar que o treinamento foi interrompido. Posições estáveis nos resultados também podem tranquilizar pelo motivo errado: elas não informam se todos os caminhos importantes continuam acessíveis.

Evite receitas universais de tags. A interação entre NOARCHIVE e NOCACHE da Microsoft mostra como diretivas combinadas podem alterar o resultado. Verifique a abrangência do produto antes da implementação, especialmente antes de usar ferramentas de remoção.

Ressalvas: o que este mapa não pode comprovar

Publicar uma preferência não comprova seu cumprimento. Também não permite remover conteúdo de modelos existentes nem estabelecer como coletas anteriores foram usadas. Evidências sobre a aplicação de controles de rastreamento não podem, por si só, responder a questões sobre identidade ou uso posterior dos dados.

Preveja o esforço de implementação, as mudanças na documentação, as respostas em cache, o tempo até uma nova visita e os registros incompletos. Limite a retenção de evidências e o acesso a elas quando a privacidade exigir.

Nenhuma configuração garante posições nos resultados, tráfego, citações ou conversões. Este artigo se baseia na análise de fontes públicas, não em uma alteração real de configuração da Cloudflare, uma implementação em cliente ou um experimento controlado de SEO. Mantenha visíveis os resultados sem suporte em vez de declarar a migração concluída para todos os sites.

Pontos principais

  • 1Disallow AI Training combina preferências no robots.txt para rastreadores de uso misto classificados como Accountable com o bloqueio de outros rastreadores de treinamento.
  • 2Selecionar Training Block pode bloquear rastreadores de busca de uso misto, mas as configurações existentes geralmente migram em vez de adotar automaticamente o novo comportamento de bloqueio.
  • 3Accountable inclui recursos e compromissos; avalie cada mecanismo de cada provedor separadamente.
  • 4O suporte do Bing à preferência de não uso para treinamento via robots.txt está previsto para o início de 2027, portanto Disallow AI Training não transmite automaticamente essa preferência ao Bing hoje.
  • 5Trate os resumos separadamente, verifique o acesso dos rastreadores e mantenha as evidências necessárias à reversão sem alegar que comprovam a ausência de uso para treinamento.

Conclusão

Mantenha o acesso de busca aberto de forma deliberada, com um estado inicial registrado e condições claras para acionar a reversão. Training Block pode bloquear rastreadores de busca de uso misto; o suporte do Bing à preferência de não uso para treinamento via robots.txt continua previsto para o início de 2027. Nem um rótulo no painel nem um compromisso do provedor elimina essa lacuna. Defina a política de resumos separadamente e mantenha os resultados sem suporte marcados como não resolvidos. Se for útil, a Optijara pode ajudar a definir o escopo do mapa de configurações e os requisitos de medição antes da implementação.

Perguntas frequentes

O que faz o Disallow AI Training da Cloudflare?

Ele publica as preferências de treinamento aplicáveis no robots.txt por meio do Bot Preference Sync para rastreadores de uso misto classificados como Accountable e bloqueia outros rastreadores de treinamento. As lacunas de suporte dos provedores permanecem; a publicação não comprova que o treinamento foi interrompido.

Training Block pode impedir que o Googlebot ou o Bingbot acessem as páginas?

Sim. O novo comportamento de Training Block inclui Googlebot, Bingbot e Applebot, que são de uso misto. O bloqueio restrito a páginas com anúncios pode afetar aquelas nas quais foram detectados anúncios. As configurações existentes geralmente migram, portanto isso não significa que os sites perderam automaticamente o acesso de busca.

Proibir Google-Extended ou Applebot-Extended bloqueia a busca tradicional?

Esses tokens de controle de uso são distintos de Googlebot e Applebot. Google e Apple documentam os controles de treinamento separadamente da busca tradicional. Nenhum dos tokens é uma opção universal de recusa de resumos de IA.

Disallow AI Training envia hoje ao Bing uma preferência de não uso para treinamento?

Não automaticamente por meio do robots.txt. A atualização da Cloudflare de 15 de setembro de 2026 prevê o suporte do Bing para o início de 2027. As orientações históricas sobre NOARCHIVE exigem uma revisão de sua abrangência atual; as ferramentas de remoção não substituem controles exclusivos de treinamento.

Accountable significa que todos os controles já estão disponíveis?

Não. Accountable inclui recursos atuais e compromissos com prazo definido. Verifique cada mecanismo. O controle unificado da Cloudflare sobre a quantidade de conteúdo nos resumos é uma meta futura, não um recurso lançado nesta atualização. Registre as lacunas dos provedores, verifique o acesso de rastreadores com identidade confirmada e defina condições para acionar a reversão, em vez de tratar a classificação como prova de implementação.

Fontes

Compartilhar este artigo

Hamza Diaz

Escrito por

Hamza Diaz

Hamza Diaz é o fundador da Optijara, onde cria agentes de IA práticos, sistemas de automação e fluxos de trabalho do Copilot para empresas de serviços. Ele escreve sobre operações de IA, estratégia de agentes e implementação no mundo real para equipes que querem sistemas úteis em vez de exagero.