Cloudflare Disallow AI Training: mapa de migración de rastreadores para equipos de búsqueda
Cloudflare Disallow AI Training separa las preferencias de entrenamiento del acceso a la búsqueda, pero la opción Block de Training puede detener a los rastreadores de búsqueda de uso mixto. Revisa la compatibilidad de cada proveedor, la carencia de Bing hasta principios de 2027 y las comprobaciones para revertir cambios sin confundir el acceso de rastreo con el cumplimiento de las preferencias de entrenamiento.
Qué ha cambiado: Disallow AI Training no es lo mismo que Block
Cloudflare Disallow AI Training publica las preferencias de entrenamiento y mantiene el acceso de los rastreadores de búsqueda de uso mixto con la designación Accountable. La opción Block de Training puede detener a esos mismos rastreadores. Esa es la diferencia práctica que introduce el lanzamiento de Cloudflare del 15 de septiembre de 2026. Mientras tanto, la compatibilidad de Bing con la exclusión del entrenamiento mediante robots.txt sigue prevista para principios de 2027.
Empieza por el resultado que buscas. Mantener las páginas disponibles para la búsqueda no resuelve si su contenido puede utilizarse para entrenar modelos, y ninguna de esas decisiones resuelve su inclusión en los resúmenes de IA. Cada una necesita un control compatible. Configurar el panel no basta para dar el trabajo por terminado. Comprueba si el rastreador previsto sigue pudiendo acceder a las páginas que importan.
El anuncio explica cómo funcionan los controles; no demuestra que los sitios perdieran posiciones cuando se lanzó la actualización.
Tres resultados que necesitan controles independientes
Con Disallow AI Training, Bot Preference Sync publica las preferencias de entrenamiento aplicables a través de robots.txt. Los rastreadores de uso mixto con la designación Accountable conservan el acceso para la búsqueda. Los demás rastreadores de entrenamiento quedan bloqueados, incluidas las vías dedicadas exclusivamente al entrenamiento de Amazon, Anthropic, Meta y OpenAI. Sus rastreadores de búsqueda independientes son objetivos distintos.
Google-Extended y Applebot-Extended son identificadores de control de uso, no nombres alternativos de Googlebot y Applebot. Rechazar el uso para entrenamiento no supone rechazar automáticamente todas las respuestas generadas. La guía de SEO, AEO y GEO ofrece un contexto más amplio; aquí nos centramos en las decisiones de migración y en las pruebas necesarias para justificarlas.
Revisa los ajustes actuales de Cloudflare antes de cambiar el acceso a la búsqueda
Ajustes y efectos: Allow, Disallow y Block
Registra los valores actuales de la zona antes de cambiar nada. Seleccionar Allow no anula otro ajuste ni una regla independiente del WAF. Las opciones Block y Block on pages with ads de Training incluyen ahora a Applebot, Bingbot y Googlebot, que son de uso mixto, por lo que una suposición sobre qué se considera tráfico de IA puede causar una denegación involuntaria del acceso a la búsqueda.
Los siguientes ajustes y resultados de migración están documentados en el anuncio de septiembre de Cloudflare.
| Ajuste existente o acción propuesta | Resultado documentado | Consecuencia para la búsqueda | Comprobación pendiente |
|---|---|---|---|
| Opción antigua Block AI desactivada | Search en Allow, Training en Allow, Agent en Allow | La migración no añade bloqueos por categoría | Reglas existentes y robots.txt |
| Opción antigua Block AI en Block o bloqueo solo en páginas con anuncios | Search en Allow, Training en Disallow AI Training, Agent en Block on pages with ads | Esta selección de entrenamiento mantiene permitido el acceso de los rastreadores de búsqueda de uso mixto | Compatibilidad del proveedor |
| Opción granular anterior de Training en Block o bloqueo solo en páginas con anuncios | Training pasa a Disallow; las selecciones de Search y Agent no cambian | Las restricciones de Search que se conservan siguen siendo relevantes | Valores realmente aplicados tras la migración |
| Seleccionar Disallow AI Training en Training | Preferencias para los rastreadores de uso mixto con la designación Accountable; bloqueo de los demás rastreadores de entrenamiento | El acceso para la búsqueda puede mantenerse | Carencia de Bing y WAF |
| Seleccionar Block en Training | Se bloquean todos los rastreadores de entrenamiento, incluidos los de uso mixto | Puede denegar el acceso a la búsqueda | Si la denegación es intencionada |
| Seleccionar Block on pages with ads en Training | Se bloquean los rastreadores de entrenamiento en las páginas donde se detectan anuncios | Esas páginas pueden perder el acceso para la búsqueda | Detección de anuncios y rutas afectadas |
La migración automática no es un ajuste predefinido para dominios nuevos
Cloudflare afirma que la mayoría de los ajustes existentes migran automáticamente. El nuevo significado de Block no implica que todos los sitios que ya estaban protegidos bloqueen de repente a Googlebot. Comprueba los valores resultantes de la migración antes de decidir si hace falta algún cambio.
Las recomendaciones para dominios nuevos son una cuestión aparte. Para los sitios financiados con publicidad, el ajuste predefinido propone Search en Allow, Training en Disallow AI Training y Agent en Block on pages with ads. Para los sitios que no se financian con publicidad, propone Allow en las tres categorías. Bot Preference Sync está activado en ambos casos, y los propietarios pueden modificar esas recomendaciones.
Los controles están disponibles en todos los planes y se aplican al dominio o a la zona. No existe una opción Disallow AI Training exclusiva para páginas con anuncios ni una opción Disallow para Agent. Probar rutas concretas no convierte estos controles en ajustes por ruta.
La documentación de Block AI Bots todavía mostraba, cuando se consultó, una redacción de julio sobre los valores predeterminados de septiembre. Cuando las descripciones difieren, este artículo atribuye el comportamiento de migración más reciente al anuncio de septiembre. Comprueba el panel antes de seguir una secuencia de clics supuesta.
Comprueba las capacidades de los proveedores, especialmente la carencia de Bing hasta principios de 2027
La designación Accountable abarca más que los mecanismos que ya están activos. Exige la posibilidad de excluirse del entrenamiento y de los resúmenes, transparencia a nivel de URL y garantías de que la exclusión del entrenamiento no afecta a la búsqueda tradicional, ya sea mediante funciones disponibles o mediante compromisos. Aun así, cada mecanismo necesita su propia comprobación.
| Proveedor | Distinción entre búsqueda y entrenamiento | Mecanismo para los resúmenes | Compromiso o carencia |
|---|---|---|---|
| Googlebot se ocupa de la búsqueda; Google-Extended controla determinados usos de entrenamiento y fundamentación | La búsqueda dispone de controles de fragmentos e indexación | Cloudflare informa de que se espera más transparencia de URL en Extended en unas semanas | |
| Apple | Applebot rastrea; Applebot-Extended controla el uso para entrenar modelos fundacionales | nosnippet se aplica a determinadas respuestas generativas | Cloudflare informa de trabajos de inspección a nivel de URL previstos para 2027 |
| Bing | Bingbot sigue permitido con Disallow; no se admite la transmisión automática de la preferencia de exclusión del entrenamiento mediante robots.txt | Los controles históricos de Bing Chat vinculan algunas restricciones de respuestas y entrenamiento | La compatibilidad con la exclusión del entrenamiento mediante robots.txt está prevista para principios de 2027 |
Google: Google-Extended no es Googlebot
La documentación de rastreadores de Google describe Google-Extended como un identificador de producto sin una cadena de agente de usuario propia en las solicitudes HTTP. Controla determinados usos de entrenamiento y fundamentación de Gemini. Google afirma que no afecta a la inclusión ni a la posición en la búsqueda.
Para las vistas creadas con IA de Google y el Modo IA, las directrices de IA en la búsqueda señalan a Googlebot como el control de acceso de rastreo e indican nosnippet, data-nosnippet, max-snippet y noindex como formas de limitar la información que se muestra. Estos controles tienen consecuencias distintas. En particular, noindex no es una preferencia exclusiva de entrenamiento y no debe tratarse como tal.
Tras cambiar los controles de vista previa, utiliza la inspección de URLs de Search Console para ver el HTML que recibió Googlebot y deja tiempo para que se vuelva a rastrear y procesar. No busques un rastreador Google-Extended independiente en los registros de acceso como prueba de que la preferencia ha funcionado, porque la documentación no describe ninguno.
Cloudflare también describe un interruptor en un portal de búsqueda generativa. La documentación de Google consultada aquí no confirma de forma independiente la existencia de esa interfaz concreta para todos los usuarios. Por ello, este mapa no recomienda utilizarla ni considera que la transparencia de URL prometida ya esté disponible.
Apple: Applebot-Extended no bloquea al rastreador de búsqueda
Apple afirma que Applebot-Extended no rastrea páginas. Excluirlo controla el uso para entrenamiento del contenido recopilado por Applebot; las páginas pueden seguir apareciendo en las búsquedas.
Apple documenta por separado el uso de nosnippet para determinadas respuestas generativas, con efectos sobre las descripciones y las respuestas web. Revisa esos efectos de presentación antes de aplicar el cambio, porque afectan a cómo aparece el contenido y no solo a cómo se utiliza para entrenamiento. Cloudflare sitúa los trabajos de inspección de URL de Apple en el año siguiente, es decir, 2027, sin dar una fecha de lanzamiento.
Bing: una carencia en las preferencias no es una recomendación de retirada
Hasta que llegue la compatibilidad de Bing prevista para principios de 2027, Disallow AI Training no transmite automáticamente una preferencia de exclusión del entrenamiento a través de robots.txt. Registra claramente ese estado como pendiente de resolver, no como implementado.
El anuncio de Microsoft de septiembre de 2023 afirma que NOARCHIVE excluye el contenido de las respuestas de Bing Chat y del futuro entrenamiento de modelos fundacionales, pero mantiene la posibilidad de aparecer en los resultados de búsqueda. NOCACHE tiene prioridad cuando aparecen ambos. Ese es el comportamiento documentado históricamente, no una cobertura verificada de forma independiente para todos los servicios actuales de Microsoft.
Cloudflare menciona NOARCHIVE y las herramientas de retirada. No utilices la retirada como sustituto de una preferencia exclusiva de entrenamiento, porque sus consecuencias para la indexación deben verificarse por separado. Este artículo no recomienda procedimientos de retirada. El control unificado de Cloudflare sobre la cantidad de contenido en los resúmenes también es un objetivo para principios de 2027, no una función de septiembre.
Utiliza el mapa de migración según la finalidad del rastreo
Registra el estado inicial y los resultados deseados
El mapa de migración según la finalidad del rastreo es una plantilla de trabajo que se presenta en este artículo, no una función de Cloudflare ni una metodología que se afirme haber aplicado a clientes. Úsalo para relacionar el estado registrado de la zona con los resultados que buscas. Junto a cada control propuesto, conserva el estado de compatibilidad del proveedor y las pruebas necesarias para aceptar el cambio. Incluye el procedimiento de reversión.
Exporta los ajustes cuando sea posible o registra los valores exactos de Search, Training y Agent, el estado de Bot Preference Sync, la respuesta pública de robots.txt y las reglas pertinentes del WAF. Añade fecha y hora al registro. Oculta los detalles sensibles de las reglas antes de compartirlo fuera del equipo operativo.
Anota si el acceso a la búsqueda debe mantenerse abierto y especifica después la preferencia de entrenamiento. Decide por separado la política de resúmenes. Una preferencia no admitida sigue siendo una carencia aunque el panel parezca configurado; el ajuste por sí solo no demuestra ni la compatibilidad del proveedor ni el cumplimiento.
Elige rutas indexables representativas, incluidas páginas con y sin anuncios cuando corresponda. Recopila las observaciones disponibles de rastreo e indexación antes del cambio. Acuerda qué denegaciones inesperadas activarán la reversión y designa a la persona que pueda restaurar los ajustes. Registra cualquier protección independiente que deba mantenerse intacta.
Este registro ilustrativo no es un cuerpo de solicitud de la API de Cloudflare ni una observación en producción. Propone rechazar el entrenamiento y dejar sin decidir los resúmenes.
{
"zone": "example.com",
"observedAt": null,
"desiredOutcomes": {"search": "allow", "training": "decline", "summaries": "undecided"},
"currentControls": "not_checked",
"proposedControls": {"Search": "Allow", "Training": "Disallow AI Training", "Agent": "retain_recorded_baseline"},
"providerSupport": {"bingRobotsTraining": "target_early_2027_not_shipped"},
"evidence": {"robotsTxt": "not_checked", "verifiedCrawlerAccess": "not_checked"},
"rollback": "restore_recorded_baseline_after_unintended_search_denial"
}Inspecciona robots.txt y el acceso de los rastreadores
Bot Preference Sync antepone contenido generado al contenido existente de robots.txt. Inspecciona la respuesta completa, no solo las líneas nuevas. Comprueba los grupos de agentes de usuario aplicables y la prioridad de las directivas según las reglas de cada operador de rastreo. El orden de las líneas no constituye una prueba de aceptación. Cloudflare también afirma que esta sincronización por categorías no lee directamente las reglas personalizadas individuales con lógica más compleja. No supongas que una excepción personalizada del WAF se ha trasladado a robots.txt.
| Prueba de migración | Pruebas disponibles | Condición de fallo | Respuesta |
|---|---|---|---|
| Estado inicial registrado | Controles, reglas y robots.txt | No se puede reconstruir el estado anterior | Aplazar el cambio |
| Preferencia expresada | robots.txt servido e identificador del proveedor | Directiva ausente o en conflicto | Restaurar la configuración anterior; investigar la sincronización |
| Rutas de búsqueda accesibles | Solicitudes verificadas, rutas y estados | Nueva denegación al rastreador de búsqueda previsto | Restaurar los controles modificados; identificar la regla |
| Redirecciones operativas | Cadenas de respuestas y destinos | Destino inesperado o inaccesible | Revertir el cambio responsable |
| Otras protecciones conservadas | Eventos del WAF y pruebas de las reglas | Necesidad injustificada de omitir protecciones de forma generalizada | Detenerse; evitar excepciones generales |
| Carencia del proveedor registrada | Fuente con fecha y estado de compatibilidad | Compatibilidad prometida marcada como implementada | Corregir el registro; aplazar el resultado no admitido |
Una cadena de agente de usuario copiada de Googlebot permite inspeccionar una respuesta, pero no demuestra que el Googlebot real tenga acceso. Utiliza la verificación de identidad documentada cuando esté disponible. La documentación de gestión de rastreadores de Cloudflare describe la identificación por agente de usuario en el plan gratuito y una detección más exhaustiva en los planes superiores. Indica el nivel de confianza en consecuencia.
La misma documentación advierte de que las solicitudes fallidas pueden deberse a otras reglas o a errores de respuesta. Identifica el control responsable antes de cambiar la política de entrenamiento. De lo contrario, un equipo puede debilitar la regla equivocada y dejar sin resolver el problema del rastreador.
Mide los resultados y conserva la posibilidad de revertir los cambios
El conjunto de herramientas para medir la búsqueda con IA ofrece un contexto de medición más amplio. Esta migración necesita un registro más acotado que relacione cada observación con el cambio concreto de ajuste.
| Medición | Pruebas disponibles | Límite de interpretación |
|---|---|---|
| Transmisión de la preferencia | robots.txt con fecha y hora y directivas aplicables | Publicar no equivale a cumplir |
| Accesibilidad para la búsqueda | Solicitudes verificadas por proveedor, ruta y estado | Las rutas no probadas siguen siendo desconocidas |
| Comportamiento de rastreo e indexación | Observaciones de Search Console y Bing Webmaster | Importan los plazos de nuevas visitas y el retraso de los informes |
| Resultados de búsqueda y resúmenes | Rendimiento en búsquedas y observaciones de visibilidad por separado | Un cambio no demuestra causalidad |
| Resultados comerciales | Tráfico referido y conversiones pertinentes | La demanda y otros lanzamientos dificultan la atribución |
Google incluye las vistas creadas con IA y el Modo IA en los informes generales de Web de Search Console. No atribuyas un cambio agregado a un efecto aislado de los resúmenes. Elige periodos de observación en función de las visitas reales de los rastreadores y del procesamiento, sin dar por supuesto que habrá un resultado inmediato.
Si se deniega por primera vez el acceso previsto para la búsqueda, restaura los ajustes registrados y vuelve a comprobar las rutas afectadas. La restauración no garantiza un nuevo rastreo ni la recuperación de la indexación de forma inmediata. La prueba de trazabilidad de evidencias de Cloudflare Radar aporta contexto sobre el tratamiento de pruebas en otro producto, no sobre este despliegue de controles.
Errores comunes al separar la búsqueda del entrenamiento
El error principal es seleccionar Block en Training y esperar que un rastreador de uso mixto siga realizando búsquedas. Inspecciona los valores resultantes de la migración en lugar de confiar en el antiguo significado de la etiqueta. Allow en Search no anula las restricciones independientes presentes en otras partes de la configuración.
Los ajustes de Agent no pueden suplir un mecanismo de entrenamiento inexistente. Una opción Disallow exclusiva para páginas con anuncios tampoco puede hacerlo, porque no se ofrece. La designación Accountable no resuelve la carencia de Bing, y una directiva de entrenamiento no equivale a excluirse de los resúmenes.
Presta atención a lo que realmente muestran las pruebas. Una cadena de agente de usuario copiada dice poco sobre la identidad del rastreador, mientras que robots.txt registra una preferencia publicada sin demostrar que el entrenamiento haya cesado. La estabilidad de las posiciones también puede dar una tranquilidad injustificada: no indica si todas las rutas importantes siguen siendo accesibles.
Evita las recetas universales de etiquetas. La interacción entre NOARCHIVE y NOCACHE de Microsoft muestra cómo las directivas combinadas pueden cambiar el resultado. Verifica el ámbito del producto antes de aplicar los cambios, especialmente antes de utilizar herramientas de retirada.
Limitaciones: qué no puede demostrar este mapa
Publicar una preferencia no demuestra su cumplimiento. Tampoco permite retirar contenido de modelos existentes ni determinar cómo se utilizaron las recopilaciones anteriores. Las pruebas sobre la aplicación de restricciones de rastreo no pueden, por sí solas, responder a preguntas sobre la identidad o el uso posterior de los datos.
Prevé el esfuerzo de implementación, los cambios en la documentación, las respuestas en caché, los plazos de nuevas visitas y los registros incompletos. Limita la conservación de las pruebas y el acceso a ellas cuando la privacidad lo exija.
Ningún ajuste garantiza posiciones, tráfico, citas ni conversiones. Este artículo se basa en la revisión de fuentes públicas, no en un cambio real de configuración de Cloudflare, un despliegue para un cliente ni un experimento SEO controlado. Mantén visibles los resultados no admitidos en lugar de dar la migración por terminada para todos los sitios.
Puntos clave
- 1Disallow AI Training combina las preferencias de robots.txt para los rastreadores de uso mixto con la designación Accountable con el bloqueo de los demás rastreadores de entrenamiento.
- 2Seleccionar Block en Training puede denegar el acceso a los rastreadores de búsqueda de uso mixto, pero los ajustes existentes suelen migrar en lugar de adoptar automáticamente el nuevo comportamiento de bloqueo.
- 3Accountable incluye capacidades y compromisos; evalúa por separado cada mecanismo de los proveedores.
- 4La compatibilidad de Bing con la exclusión del entrenamiento mediante robots.txt está prevista para principios de 2027, por lo que Disallow AI Training no transmite hoy esa preferencia a Bing de forma automática.
- 5Trata los resúmenes por separado, verifica el acceso de los rastreadores y conserva las pruebas para revertir los cambios sin afirmar que demuestran la ausencia de uso para entrenamiento.
Conclusión
Mantén abierto el acceso a la búsqueda de forma deliberada, con un estado inicial registrado y criterios claros para revertir los cambios. La opción Block de Training puede denegar el acceso a los rastreadores de búsqueda de uso mixto; la compatibilidad de Bing con la exclusión del entrenamiento mediante robots.txt sigue prevista para principios de 2027. Ni una etiqueta del panel ni un compromiso del proveedor resuelven esa carencia. Define por separado la política de resúmenes y deja los resultados no admitidos marcados como pendientes de resolver. Si te resulta útil, Optijara puede ayudarte a delimitar el mapa de ajustes y los requisitos de medición antes de la implementación.
Preguntas frecuentes
¿Qué hace Disallow AI Training de Cloudflare?
Publica las preferencias de entrenamiento aplicables en robots.txt mediante Bot Preference Sync para los rastreadores de uso mixto con la designación Accountable y bloquea los demás rastreadores de entrenamiento. Persisten carencias de compatibilidad de los proveedores; la publicación no demuestra que el entrenamiento haya cesado.
¿Puede la opción Block de Training impedir que Googlebot o Bingbot accedan a las páginas?
Sí. El nuevo comportamiento de Block en Training incluye a Googlebot, Bingbot y Applebot, que son de uso mixto. El bloqueo exclusivo de páginas con anuncios puede afectar a las páginas donde se detecten anuncios. Los ajustes existentes suelen migrar, por lo que esto no significa que los sitios hayan perdido automáticamente el acceso para la búsqueda.
¿Excluir Google-Extended o Applebot-Extended bloquea la búsqueda tradicional?
Estos identificadores de control de uso son distintos de Googlebot y Applebot. Google y Apple documentan los controles de entrenamiento por separado de la búsqueda tradicional. Ninguno de los dos identificadores permite excluirse de todos los resúmenes de IA.
¿Disallow AI Training envía hoy a Bing una preferencia de exclusión del entrenamiento?
No de forma automática mediante robots.txt. El anuncio de Cloudflare del 15 de septiembre de 2026 sitúa la compatibilidad de Bing a principios de 2027. Es necesario revisar el ámbito actual de las directrices históricas de NOARCHIVE; las herramientas de retirada no sustituyen a los controles exclusivos de entrenamiento.
¿Accountable significa que todos los controles ya están disponibles?
No. Accountable incluye capacidades actuales y compromisos con plazos definidos. Verifica cada mecanismo. El control unificado de Cloudflare sobre la cantidad de contenido en los resúmenes es un objetivo futuro, no una función incluida en este lanzamiento. Registra las carencias de los proveedores, comprueba el acceso de los rastreadores cuya identidad se haya verificado y define los criterios de reversión, en lugar de tratar la designación como prueba de implementación.
Fuentes
- https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/
- https://blog.cloudflare.com/bot-preference-sync/
- https://support.apple.com/en-us/119829
- https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers
- https://developers.google.com/search/docs/appearance/ai-features
- https://blogs.bing.com/webmaster/september-2023/Announcing-new-options-for-webmasters-to-control-usage-of-their-content-in-Bing-Chat
- https://developers.cloudflare.com/bots/additional-configurations/block-ai-bots/
- https://developers.cloudflare.com/ai-crawl-control/features/manage-ai-crawlers/
Escrito por
Hamza DiazHamza Diaz es el fundador de Optijara, donde crea agentes de IA prácticos, sistemas de automatización y flujos de trabajo de Copilot para empresas de servicios. Escribe sobre operaciones de IA, estrategia de agentes e implementación real para equipos que quieren sistemas útiles en lugar de promesas vacías.
