← Volver al Blog
Marketing & Growth

Cloudflare Disallow AI Training: mapa de migración de rastreadores para equipos de búsqueda

Cloudflare Disallow AI Training separa las preferencias de entrenamiento del acceso a la búsqueda, pero la opción Block de Training puede detener a los rastreadores de búsqueda de uso mixto. Revisa la compatibilidad de cada proveedor, la carencia de Bing hasta principios de 2027 y las comprobaciones para revertir cambios sin confundir el acceso de rastreo con el cumplimiento de las preferencias de entrenamiento.

Escrito por Hamza Diaz
16 de septiembre de 202610 min de lectura5 vistas

Qué ha cambiado: Disallow AI Training no es lo mismo que Block

Cloudflare Disallow AI Training publica las preferencias de entrenamiento y mantiene el acceso de los rastreadores de búsqueda de uso mixto con la designación Accountable. La opción Block de Training puede detener a esos mismos rastreadores. Esa es la diferencia práctica que introduce el lanzamiento de Cloudflare del 15 de septiembre de 2026. Mientras tanto, la compatibilidad de Bing con la exclusión del entrenamiento mediante robots.txt sigue prevista para principios de 2027.

Empieza por el resultado que buscas. Mantener las páginas disponibles para la búsqueda no resuelve si su contenido puede utilizarse para entrenar modelos, y ninguna de esas decisiones resuelve su inclusión en los resúmenes de IA. Cada una necesita un control compatible. Configurar el panel no basta para dar el trabajo por terminado. Comprueba si el rastreador previsto sigue pudiendo acceder a las páginas que importan.

El anuncio explica cómo funcionan los controles; no demuestra que los sitios perdieran posiciones cuando se lanzó la actualización.

Tres resultados que necesitan controles independientes

Con Disallow AI Training, Bot Preference Sync publica las preferencias de entrenamiento aplicables a través de robots.txt. Los rastreadores de uso mixto con la designación Accountable conservan el acceso para la búsqueda. Los demás rastreadores de entrenamiento quedan bloqueados, incluidas las vías dedicadas exclusivamente al entrenamiento de Amazon, Anthropic, Meta y OpenAI. Sus rastreadores de búsqueda independientes son objetivos distintos.

Google-Extended y Applebot-Extended son identificadores de control de uso, no nombres alternativos de Googlebot y Applebot. Rechazar el uso para entrenamiento no supone rechazar automáticamente todas las respuestas generadas. La guía de SEO, AEO y GEO ofrece un contexto más amplio; aquí nos centramos en las decisiones de migración y en las pruebas necesarias para justificarlas.

Revisa los ajustes actuales de Cloudflare antes de cambiar el acceso a la búsqueda

Ajustes y efectos: Allow, Disallow y Block

Registra los valores actuales de la zona antes de cambiar nada. Seleccionar Allow no anula otro ajuste ni una regla independiente del WAF. Las opciones Block y Block on pages with ads de Training incluyen ahora a Applebot, Bingbot y Googlebot, que son de uso mixto, por lo que una suposición sobre qué se considera tráfico de IA puede causar una denegación involuntaria del acceso a la búsqueda.

Los siguientes ajustes y resultados de migración están documentados en el anuncio de septiembre de Cloudflare.

Ajuste existente o acción propuestaResultado documentadoConsecuencia para la búsquedaComprobación pendiente
Opción antigua Block AI desactivadaSearch en Allow, Training en Allow, Agent en AllowLa migración no añade bloqueos por categoríaReglas existentes y robots.txt
Opción antigua Block AI en Block o bloqueo solo en páginas con anunciosSearch en Allow, Training en Disallow AI Training, Agent en Block on pages with adsEsta selección de entrenamiento mantiene permitido el acceso de los rastreadores de búsqueda de uso mixtoCompatibilidad del proveedor
Opción granular anterior de Training en Block o bloqueo solo en páginas con anunciosTraining pasa a Disallow; las selecciones de Search y Agent no cambianLas restricciones de Search que se conservan siguen siendo relevantesValores realmente aplicados tras la migración
Seleccionar Disallow AI Training en TrainingPreferencias para los rastreadores de uso mixto con la designación Accountable; bloqueo de los demás rastreadores de entrenamientoEl acceso para la búsqueda puede mantenerseCarencia de Bing y WAF
Seleccionar Block en TrainingSe bloquean todos los rastreadores de entrenamiento, incluidos los de uso mixtoPuede denegar el acceso a la búsquedaSi la denegación es intencionada
Seleccionar Block on pages with ads en TrainingSe bloquean los rastreadores de entrenamiento en las páginas donde se detectan anunciosEsas páginas pueden perder el acceso para la búsquedaDetección de anuncios y rutas afectadas

La migración automática no es un ajuste predefinido para dominios nuevos

Cloudflare afirma que la mayoría de los ajustes existentes migran automáticamente. El nuevo significado de Block no implica que todos los sitios que ya estaban protegidos bloqueen de repente a Googlebot. Comprueba los valores resultantes de la migración antes de decidir si hace falta algún cambio.

Las recomendaciones para dominios nuevos son una cuestión aparte. Para los sitios financiados con publicidad, el ajuste predefinido propone Search en Allow, Training en Disallow AI Training y Agent en Block on pages with ads. Para los sitios que no se financian con publicidad, propone Allow en las tres categorías. Bot Preference Sync está activado en ambos casos, y los propietarios pueden modificar esas recomendaciones.

Los controles están disponibles en todos los planes y se aplican al dominio o a la zona. No existe una opción Disallow AI Training exclusiva para páginas con anuncios ni una opción Disallow para Agent. Probar rutas concretas no convierte estos controles en ajustes por ruta.

La documentación de Block AI Bots todavía mostraba, cuando se consultó, una redacción de julio sobre los valores predeterminados de septiembre. Cuando las descripciones difieren, este artículo atribuye el comportamiento de migración más reciente al anuncio de septiembre. Comprueba el panel antes de seguir una secuencia de clics supuesta.

Comprueba las capacidades de los proveedores, especialmente la carencia de Bing hasta principios de 2027

La designación Accountable abarca más que los mecanismos que ya están activos. Exige la posibilidad de excluirse del entrenamiento y de los resúmenes, transparencia a nivel de URL y garantías de que la exclusión del entrenamiento no afecta a la búsqueda tradicional, ya sea mediante funciones disponibles o mediante compromisos. Aun así, cada mecanismo necesita su propia comprobación.

ProveedorDistinción entre búsqueda y entrenamientoMecanismo para los resúmenesCompromiso o carencia
GoogleGooglebot se ocupa de la búsqueda; Google-Extended controla determinados usos de entrenamiento y fundamentaciónLa búsqueda dispone de controles de fragmentos e indexaciónCloudflare informa de que se espera más transparencia de URL en Extended en unas semanas
AppleApplebot rastrea; Applebot-Extended controla el uso para entrenar modelos fundacionalesnosnippet se aplica a determinadas respuestas generativasCloudflare informa de trabajos de inspección a nivel de URL previstos para 2027
BingBingbot sigue permitido con Disallow; no se admite la transmisión automática de la preferencia de exclusión del entrenamiento mediante robots.txtLos controles históricos de Bing Chat vinculan algunas restricciones de respuestas y entrenamientoLa compatibilidad con la exclusión del entrenamiento mediante robots.txt está prevista para principios de 2027

Google: Google-Extended no es Googlebot

La documentación de rastreadores de Google describe Google-Extended como un identificador de producto sin una cadena de agente de usuario propia en las solicitudes HTTP. Controla determinados usos de entrenamiento y fundamentación de Gemini. Google afirma que no afecta a la inclusión ni a la posición en la búsqueda.

Para las vistas creadas con IA de Google y el Modo IA, las directrices de IA en la búsqueda señalan a Googlebot como el control de acceso de rastreo e indican nosnippet, data-nosnippet, max-snippet y noindex como formas de limitar la información que se muestra. Estos controles tienen consecuencias distintas. En particular, noindex no es una preferencia exclusiva de entrenamiento y no debe tratarse como tal.

Tras cambiar los controles de vista previa, utiliza la inspección de URLs de Search Console para ver el HTML que recibió Googlebot y deja tiempo para que se vuelva a rastrear y procesar. No busques un rastreador Google-Extended independiente en los registros de acceso como prueba de que la preferencia ha funcionado, porque la documentación no describe ninguno.

Cloudflare también describe un interruptor en un portal de búsqueda generativa. La documentación de Google consultada aquí no confirma de forma independiente la existencia de esa interfaz concreta para todos los usuarios. Por ello, este mapa no recomienda utilizarla ni considera que la transparencia de URL prometida ya esté disponible.

Apple: Applebot-Extended no bloquea al rastreador de búsqueda

Apple afirma que Applebot-Extended no rastrea páginas. Excluirlo controla el uso para entrenamiento del contenido recopilado por Applebot; las páginas pueden seguir apareciendo en las búsquedas.

Apple documenta por separado el uso de nosnippet para determinadas respuestas generativas, con efectos sobre las descripciones y las respuestas web. Revisa esos efectos de presentación antes de aplicar el cambio, porque afectan a cómo aparece el contenido y no solo a cómo se utiliza para entrenamiento. Cloudflare sitúa los trabajos de inspección de URL de Apple en el año siguiente, es decir, 2027, sin dar una fecha de lanzamiento.

Bing: una carencia en las preferencias no es una recomendación de retirada

Hasta que llegue la compatibilidad de Bing prevista para principios de 2027, Disallow AI Training no transmite automáticamente una preferencia de exclusión del entrenamiento a través de robots.txt. Registra claramente ese estado como pendiente de resolver, no como implementado.

El anuncio de Microsoft de septiembre de 2023 afirma que NOARCHIVE excluye el contenido de las respuestas de Bing Chat y del futuro entrenamiento de modelos fundacionales, pero mantiene la posibilidad de aparecer en los resultados de búsqueda. NOCACHE tiene prioridad cuando aparecen ambos. Ese es el comportamiento documentado históricamente, no una cobertura verificada de forma independiente para todos los servicios actuales de Microsoft.

Cloudflare menciona NOARCHIVE y las herramientas de retirada. No utilices la retirada como sustituto de una preferencia exclusiva de entrenamiento, porque sus consecuencias para la indexación deben verificarse por separado. Este artículo no recomienda procedimientos de retirada. El control unificado de Cloudflare sobre la cantidad de contenido en los resúmenes también es un objetivo para principios de 2027, no una función de septiembre.

Utiliza el mapa de migración según la finalidad del rastreo

Registra el estado inicial y los resultados deseados

El mapa de migración según la finalidad del rastreo es una plantilla de trabajo que se presenta en este artículo, no una función de Cloudflare ni una metodología que se afirme haber aplicado a clientes. Úsalo para relacionar el estado registrado de la zona con los resultados que buscas. Junto a cada control propuesto, conserva el estado de compatibilidad del proveedor y las pruebas necesarias para aceptar el cambio. Incluye el procedimiento de reversión.

Exporta los ajustes cuando sea posible o registra los valores exactos de Search, Training y Agent, el estado de Bot Preference Sync, la respuesta pública de robots.txt y las reglas pertinentes del WAF. Añade fecha y hora al registro. Oculta los detalles sensibles de las reglas antes de compartirlo fuera del equipo operativo.

Anota si el acceso a la búsqueda debe mantenerse abierto y especifica después la preferencia de entrenamiento. Decide por separado la política de resúmenes. Una preferencia no admitida sigue siendo una carencia aunque el panel parezca configurado; el ajuste por sí solo no demuestra ni la compatibilidad del proveedor ni el cumplimiento.

Elige rutas indexables representativas, incluidas páginas con y sin anuncios cuando corresponda. Recopila las observaciones disponibles de rastreo e indexación antes del cambio. Acuerda qué denegaciones inesperadas activarán la reversión y designa a la persona que pueda restaurar los ajustes. Registra cualquier protección independiente que deba mantenerse intacta.

flowchart TD A[Capturar el estado inicial de la zona] --> B[Especificar los resultados de búsqueda, entrenamiento y resúmenes] B --> C{¿El proveedor admite la combinación prevista?} C -->|No o se desconoce| D[Registrar la carencia o aplazar el cambio] C -->|Sí| E[Registrar los controles propuestos] E --> F[Inspeccionar robots.txt y el acceso de los rastreadores] F --> G{¿Se conserva el acceso previsto para la búsqueda?} G -->|No| H[Restaurar el estado inicial e investigar] G -->|Sí| I[Observar las señales de rastreo e indexación] I --> J[Conservar las pruebas y las limitaciones pendientes]

Este registro ilustrativo no es un cuerpo de solicitud de la API de Cloudflare ni una observación en producción. Propone rechazar el entrenamiento y dejar sin decidir los resúmenes.

{
  "zone": "example.com",
  "observedAt": null,
  "desiredOutcomes": {"search": "allow", "training": "decline", "summaries": "undecided"},
  "currentControls": "not_checked",
  "proposedControls": {"Search": "Allow", "Training": "Disallow AI Training", "Agent": "retain_recorded_baseline"},
  "providerSupport": {"bingRobotsTraining": "target_early_2027_not_shipped"},
  "evidence": {"robotsTxt": "not_checked", "verifiedCrawlerAccess": "not_checked"},
  "rollback": "restore_recorded_baseline_after_unintended_search_denial"
}

Inspecciona robots.txt y el acceso de los rastreadores

Bot Preference Sync antepone contenido generado al contenido existente de robots.txt. Inspecciona la respuesta completa, no solo las líneas nuevas. Comprueba los grupos de agentes de usuario aplicables y la prioridad de las directivas según las reglas de cada operador de rastreo. El orden de las líneas no constituye una prueba de aceptación. Cloudflare también afirma que esta sincronización por categorías no lee directamente las reglas personalizadas individuales con lógica más compleja. No supongas que una excepción personalizada del WAF se ha trasladado a robots.txt.

Prueba de migraciónPruebas disponiblesCondición de falloRespuesta
Estado inicial registradoControles, reglas y robots.txtNo se puede reconstruir el estado anteriorAplazar el cambio
Preferencia expresadarobots.txt servido e identificador del proveedorDirectiva ausente o en conflictoRestaurar la configuración anterior; investigar la sincronización
Rutas de búsqueda accesiblesSolicitudes verificadas, rutas y estadosNueva denegación al rastreador de búsqueda previstoRestaurar los controles modificados; identificar la regla
Redirecciones operativasCadenas de respuestas y destinosDestino inesperado o inaccesibleRevertir el cambio responsable
Otras protecciones conservadasEventos del WAF y pruebas de las reglasNecesidad injustificada de omitir protecciones de forma generalizadaDetenerse; evitar excepciones generales
Carencia del proveedor registradaFuente con fecha y estado de compatibilidadCompatibilidad prometida marcada como implementadaCorregir el registro; aplazar el resultado no admitido

Una cadena de agente de usuario copiada de Googlebot permite inspeccionar una respuesta, pero no demuestra que el Googlebot real tenga acceso. Utiliza la verificación de identidad documentada cuando esté disponible. La documentación de gestión de rastreadores de Cloudflare describe la identificación por agente de usuario en el plan gratuito y una detección más exhaustiva en los planes superiores. Indica el nivel de confianza en consecuencia.

La misma documentación advierte de que las solicitudes fallidas pueden deberse a otras reglas o a errores de respuesta. Identifica el control responsable antes de cambiar la política de entrenamiento. De lo contrario, un equipo puede debilitar la regla equivocada y dejar sin resolver el problema del rastreador.

Mide los resultados y conserva la posibilidad de revertir los cambios

El conjunto de herramientas para medir la búsqueda con IA ofrece un contexto de medición más amplio. Esta migración necesita un registro más acotado que relacione cada observación con el cambio concreto de ajuste.

MediciónPruebas disponiblesLímite de interpretación
Transmisión de la preferenciarobots.txt con fecha y hora y directivas aplicablesPublicar no equivale a cumplir
Accesibilidad para la búsquedaSolicitudes verificadas por proveedor, ruta y estadoLas rutas no probadas siguen siendo desconocidas
Comportamiento de rastreo e indexaciónObservaciones de Search Console y Bing WebmasterImportan los plazos de nuevas visitas y el retraso de los informes
Resultados de búsqueda y resúmenesRendimiento en búsquedas y observaciones de visibilidad por separadoUn cambio no demuestra causalidad
Resultados comercialesTráfico referido y conversiones pertinentesLa demanda y otros lanzamientos dificultan la atribución

Google incluye las vistas creadas con IA y el Modo IA en los informes generales de Web de Search Console. No atribuyas un cambio agregado a un efecto aislado de los resúmenes. Elige periodos de observación en función de las visitas reales de los rastreadores y del procesamiento, sin dar por supuesto que habrá un resultado inmediato.

Si se deniega por primera vez el acceso previsto para la búsqueda, restaura los ajustes registrados y vuelve a comprobar las rutas afectadas. La restauración no garantiza un nuevo rastreo ni la recuperación de la indexación de forma inmediata. La prueba de trazabilidad de evidencias de Cloudflare Radar aporta contexto sobre el tratamiento de pruebas en otro producto, no sobre este despliegue de controles.

Errores comunes al separar la búsqueda del entrenamiento

El error principal es seleccionar Block en Training y esperar que un rastreador de uso mixto siga realizando búsquedas. Inspecciona los valores resultantes de la migración en lugar de confiar en el antiguo significado de la etiqueta. Allow en Search no anula las restricciones independientes presentes en otras partes de la configuración.

Los ajustes de Agent no pueden suplir un mecanismo de entrenamiento inexistente. Una opción Disallow exclusiva para páginas con anuncios tampoco puede hacerlo, porque no se ofrece. La designación Accountable no resuelve la carencia de Bing, y una directiva de entrenamiento no equivale a excluirse de los resúmenes.

Presta atención a lo que realmente muestran las pruebas. Una cadena de agente de usuario copiada dice poco sobre la identidad del rastreador, mientras que robots.txt registra una preferencia publicada sin demostrar que el entrenamiento haya cesado. La estabilidad de las posiciones también puede dar una tranquilidad injustificada: no indica si todas las rutas importantes siguen siendo accesibles.

Evita las recetas universales de etiquetas. La interacción entre NOARCHIVE y NOCACHE de Microsoft muestra cómo las directivas combinadas pueden cambiar el resultado. Verifica el ámbito del producto antes de aplicar los cambios, especialmente antes de utilizar herramientas de retirada.

Limitaciones: qué no puede demostrar este mapa

Publicar una preferencia no demuestra su cumplimiento. Tampoco permite retirar contenido de modelos existentes ni determinar cómo se utilizaron las recopilaciones anteriores. Las pruebas sobre la aplicación de restricciones de rastreo no pueden, por sí solas, responder a preguntas sobre la identidad o el uso posterior de los datos.

Prevé el esfuerzo de implementación, los cambios en la documentación, las respuestas en caché, los plazos de nuevas visitas y los registros incompletos. Limita la conservación de las pruebas y el acceso a ellas cuando la privacidad lo exija.

Ningún ajuste garantiza posiciones, tráfico, citas ni conversiones. Este artículo se basa en la revisión de fuentes públicas, no en un cambio real de configuración de Cloudflare, un despliegue para un cliente ni un experimento SEO controlado. Mantén visibles los resultados no admitidos en lugar de dar la migración por terminada para todos los sitios.

Puntos clave

  • 1Disallow AI Training combina las preferencias de robots.txt para los rastreadores de uso mixto con la designación Accountable con el bloqueo de los demás rastreadores de entrenamiento.
  • 2Seleccionar Block en Training puede denegar el acceso a los rastreadores de búsqueda de uso mixto, pero los ajustes existentes suelen migrar en lugar de adoptar automáticamente el nuevo comportamiento de bloqueo.
  • 3Accountable incluye capacidades y compromisos; evalúa por separado cada mecanismo de los proveedores.
  • 4La compatibilidad de Bing con la exclusión del entrenamiento mediante robots.txt está prevista para principios de 2027, por lo que Disallow AI Training no transmite hoy esa preferencia a Bing de forma automática.
  • 5Trata los resúmenes por separado, verifica el acceso de los rastreadores y conserva las pruebas para revertir los cambios sin afirmar que demuestran la ausencia de uso para entrenamiento.

Conclusión

Mantén abierto el acceso a la búsqueda de forma deliberada, con un estado inicial registrado y criterios claros para revertir los cambios. La opción Block de Training puede denegar el acceso a los rastreadores de búsqueda de uso mixto; la compatibilidad de Bing con la exclusión del entrenamiento mediante robots.txt sigue prevista para principios de 2027. Ni una etiqueta del panel ni un compromiso del proveedor resuelven esa carencia. Define por separado la política de resúmenes y deja los resultados no admitidos marcados como pendientes de resolver. Si te resulta útil, Optijara puede ayudarte a delimitar el mapa de ajustes y los requisitos de medición antes de la implementación.

Preguntas frecuentes

¿Qué hace Disallow AI Training de Cloudflare?

Publica las preferencias de entrenamiento aplicables en robots.txt mediante Bot Preference Sync para los rastreadores de uso mixto con la designación Accountable y bloquea los demás rastreadores de entrenamiento. Persisten carencias de compatibilidad de los proveedores; la publicación no demuestra que el entrenamiento haya cesado.

¿Puede la opción Block de Training impedir que Googlebot o Bingbot accedan a las páginas?

Sí. El nuevo comportamiento de Block en Training incluye a Googlebot, Bingbot y Applebot, que son de uso mixto. El bloqueo exclusivo de páginas con anuncios puede afectar a las páginas donde se detecten anuncios. Los ajustes existentes suelen migrar, por lo que esto no significa que los sitios hayan perdido automáticamente el acceso para la búsqueda.

¿Excluir Google-Extended o Applebot-Extended bloquea la búsqueda tradicional?

Estos identificadores de control de uso son distintos de Googlebot y Applebot. Google y Apple documentan los controles de entrenamiento por separado de la búsqueda tradicional. Ninguno de los dos identificadores permite excluirse de todos los resúmenes de IA.

¿Disallow AI Training envía hoy a Bing una preferencia de exclusión del entrenamiento?

No de forma automática mediante robots.txt. El anuncio de Cloudflare del 15 de septiembre de 2026 sitúa la compatibilidad de Bing a principios de 2027. Es necesario revisar el ámbito actual de las directrices históricas de NOARCHIVE; las herramientas de retirada no sustituyen a los controles exclusivos de entrenamiento.

¿Accountable significa que todos los controles ya están disponibles?

No. Accountable incluye capacidades actuales y compromisos con plazos definidos. Verifica cada mecanismo. El control unificado de Cloudflare sobre la cantidad de contenido en los resúmenes es un objetivo futuro, no una función incluida en este lanzamiento. Registra las carencias de los proveedores, comprueba el acceso de los rastreadores cuya identidad se haya verificado y define los criterios de reversión, en lugar de tratar la designación como prueba de implementación.

Fuentes

Compartir este artículo

Hamza Diaz

Escrito por

Hamza Diaz

Hamza Diaz es el fundador de Optijara, donde crea agentes de IA prácticos, sistemas de automatización y flujos de trabajo de Copilot para empresas de servicios. Escribe sobre operaciones de IA, estrategia de agentes e implementación real para equipos que quieren sistemas útiles en lugar de promesas vacías.