← Retour au Blog
Marketing & Growth

Cloudflare Disallow AI Training : une carte de migration des robots pour les équipes de référencement

Cloudflare Disallow AI Training sépare les préférences d’entraînement de l’accès à la recherche, mais Training Block peut bloquer les robots de recherche à usages mixtes. Cartographiez la prise en charge par les fournisseurs, la lacune de Bing jusqu’à début 2027 et les vérifications de retour arrière sans confondre accès d’exploration et respect des préférences d’entraînement.

Rédigé par Hamza Diaz
16 septembre 202610 min de lecture9 vues

Ce qui a changé : Disallow AI Training n’a pas le même effet que Block

Cloudflare Disallow AI Training publie les préférences d’utilisation pour l’entraînement tout en maintenant l’autorisation des robots de recherche à usages mixtes désignés Accountable. Training Block peut bloquer ces mêmes robots. C’est la distinction pratique introduite par la version de Cloudflare du 15 septembre 2026. La prise en charge par Bing du refus de l’entraînement via robots.txt reste, quant à elle, prévue pour début 2027.

Commencez par le résultat souhaité. Maintenir les pages accessibles à la recherche ne détermine pas si leur contenu peut servir à l’entraînement, et aucune de ces décisions ne règle la question de leur inclusion dans les résumés générés par l’IA. Chacune nécessite un contrôle pris en charge. Un tableau de bord configuré ne suffit pas pour considérer le travail comme terminé. Vérifiez que le robot concerné peut toujours accéder aux pages importantes.

L’annonce décrit le fonctionnement des contrôles ; elle n’établit pas que des sites ont perdu des positions dans les résultats de recherche lors de cette mise à jour.

Trois résultats qui nécessitent des contrôles distincts

Avec Disallow AI Training, Bot Preference Sync publie les préférences d’entraînement applicables via robots.txt. Les robots à usages mixtes désignés Accountable restent autorisés pour la recherche. Les autres robots d’entraînement sont bloqués, y compris les accès réservés à l’entraînement d’Amazon, d’Anthropic, de Meta et d’OpenAI. Leurs robots de recherche distincts constituent d’autres cibles.

Google-Extended et Applebot-Extended sont des identifiants de contrôle d’utilisation, et non d’autres noms pour Googlebot et Applebot. Refuser l’utilisation pour l’entraînement ne revient pas automatiquement à refuser toute réponse générée. Le guide du SEO, de l’AEO et du GEO présente le contexte général ; cet article se concentre sur les décisions de migration et les preuves nécessaires pour les justifier.

Recenser les réglages Cloudflare existants avant de modifier l’accès à la recherche

Réglages et effets : Allow, Disallow et Block

Consignez les valeurs actuelles de la zone avant toute modification. Le choix Allow ne supplante pas un réglage distinct ni une règle WAF indépendante. Training Block et Block on pages with ads incluent désormais les robots à usages mixtes Applebot, Bingbot et Googlebot. Une hypothèse sur ce qui constitue du trafic d’IA peut donc entraîner un refus d’accès involontaire pour la recherche.

Les réglages et les résultats de migration suivants sont documentés dans l’annonce de Cloudflare de septembre.

Réglage existant ou action proposéeRésultat documentéConséquence pour la rechercheVérification restante
Ancien réglage Block AI désactivéSearch Allow, Training Allow, Agent AllowAucun blocage par catégorie ajouté par la migrationRègles existantes et robots.txt
Ancien réglage Block AI sur Block ou blocage limité aux pages publicitairesSearch Allow, Training Disallow AI Training, Agent Block on pages with adsCe choix pour l’entraînement maintient l’autorisation de la recherche à usages mixtesPrise en charge par le fournisseur
Ancien réglage granulaire Training sur Block ou blocage limité aux pages publicitairesTraining passe à Disallow ; les choix Search et Agent restent inchangésLes restrictions Search conservées restent déterminantesValeurs réellement obtenues après migration
Choisir Training Disallow AI TrainingPréférences pour les robots à usages mixtes désignés Accountable ; autres robots d’entraînement bloquésL’accès pour la recherche peut être maintenuLacune de Bing et WAF
Choisir Training BlockTous les robots d’entraînement sont bloqués, y compris les robots à usages mixtesPeut refuser l’accès pour la rechercheCaractère intentionnel du refus
Choisir Training Block on pages with adsRobots d’entraînement bloqués sur les pages où des publicités sont détectéesCes pages peuvent perdre leur accessibilité pour la rechercheDétection publicitaire et chemins concernés

La migration automatique diffère des préréglages d’un nouveau domaine

Cloudflare indique que la plupart des réglages existants migrent automatiquement. Le nouveau sens de Block ne signifie pas que tous les sites auparavant protégés bloquent soudainement Googlebot. Vérifiez les valeurs après migration avant de décider si une modification est nécessaire.

Les recommandations pour les nouveaux domaines constituent un sujet distinct. Pour les sites financés par la publicité, le préréglage propose Search Allow, Training Disallow AI Training et Agent Block on pages with ads. Pour les sites qui ne sont pas financés par la publicité, il propose Allow pour les trois catégories. Bot Preference Sync est activé dans les deux cas, et les propriétaires peuvent modifier ces recommandations.

Les contrôles sont disponibles avec toutes les offres, à l’échelle du domaine ou de la zone. Il n’existe ni option Disallow AI Training limitée aux pages publicitaires, ni option Agent Disallow. Tester des chemins individuels ne transforme pas ces contrôles en réglages applicables à chaque chemin.

Lors de la vérification, la documentation de Block AI Bots présentait encore une formulation datant de juillet au sujet des valeurs par défaut de septembre. Lorsque les descriptions divergent, cet article attribue le comportement de migration le plus récent à l’annonce de septembre. Vérifiez le tableau de bord avant de suivre un parcours de clics supposé.

Vérifier les capacités des fournisseurs, notamment la lacune de Bing jusqu’à début 2027

Le statut Accountable ne couvre pas uniquement des mécanismes déjà disponibles. Il exige la possibilité de refuser l’entraînement et les résumés, une transparence au niveau de l’URL et l’assurance que le refus de l’entraînement n’affecte pas la recherche traditionnelle. Ces éléments peuvent être disponibles dès maintenant ou faire l’objet d’engagements. Chaque mécanisme nécessite encore sa propre vérification.

FournisseurDistinction entre recherche et entraînementMécanisme relatif aux résumésEngagement ou lacune
GoogleGooglebot gère la recherche ; Google-Extended contrôle certains usages d’entraînement et d’ancrage des réponsesLa recherche dispose de contrôles des extraits et de l’indexationCloudflare annonce une transparence supplémentaire sur les URL pour Extended, attendue sous quelques semaines
AppleApplebot explore les pages ; Applebot-Extended contrôle leur utilisation pour l’entraînement des modèles de fondationnosnippet couvre certaines réponses générativesCloudflare fait état de travaux sur l’inspection au niveau de l’URL pour 2027
BingBingbot reste autorisé avec Disallow ; la transmission automatique du refus de l’entraînement via robots.txt n’est pas prise en chargeLes contrôles historiques de Bing Chat associent certaines restrictions sur les réponses et sur l’entraînementLa prise en charge du refus de l’entraînement via robots.txt est prévue pour début 2027

Google : Google-Extended n’est pas Googlebot

La documentation des robots de Google décrit Google-Extended comme un identifiant de produit sans chaîne user-agent propre dans les requêtes HTTP. Il contrôle certains usages d’entraînement et d’ancrage des réponses de Gemini. Google indique qu’il n’affecte ni l’inclusion ni le classement dans la recherche.

Pour les AI Overviews et AI Mode de Google, les consignes relatives à l’IA dans la recherche désignent Googlebot comme le contrôle de l’accès d’exploration et citent nosnippet, data-nosnippet, max-snippet et noindex comme moyens de limiter les informations affichées. Ces contrôles ont des conséquences différentes. En particulier, noindex n’est pas une préférence limitée à l’entraînement et ne doit pas être traité comme telle.

Après avoir modifié les contrôles d’aperçu, utilisez l’inspection d’URL de Search Console pour consulter le HTML reçu par Googlebot, puis prévoyez un délai pour une nouvelle exploration et le traitement. Ne cherchez pas un robot Google-Extended distinct dans les journaux d’accès pour prouver que la préférence a fonctionné, car la documentation n’en décrit aucun.

Cloudflare décrit également une option dans un portail de recherche générative. La documentation de Google consultée ici ne confirme pas de manière indépendante l’existence de cette interface précise pour tous. Cette carte ne recommande donc pas son utilisation et ne considère pas la transparence promise sur les URL comme déjà disponible.

Apple : Applebot-Extended ne bloque pas le robot de recherche

Apple indique qu’Applebot-Extended n’explore pas les pages. Lui appliquer Disallow contrôle l’utilisation pour l’entraînement du contenu recueilli par Applebot ; les pages peuvent toujours rester accessibles via la recherche.

Apple documente séparément nosnippet pour certaines réponses génératives, avec des effets sur les descriptions et les réponses issues du Web. Examinez ces effets de présentation avant le déploiement, car ils concernent l’affichage du contenu et pas uniquement son utilisation pour l’entraînement. Cloudflare situe les travaux d’Apple sur l’inspection d’URL l’année prochaine, soit en 2027, sans donner de date de lancement.

Bing : une lacune dans la prise en charge des préférences ne justifie pas une recommandation de suppression

Tant que la prise en charge prévue par Bing pour début 2027 n’est pas disponible, Disallow AI Training ne transmet pas automatiquement une préférence de refus de l’entraînement via robots.txt. Consignez clairement cet état comme non résolu, et non comme mis en œuvre.

L’annonce de Microsoft de septembre 2023 indique que NOARCHIVE exclut le contenu des réponses de Bing Chat et de l’entraînement futur des modèles de fondation, tout en préservant son admissibilité dans les résultats de recherche. NOCACHE prévaut lorsque les deux directives sont présentes. Il s’agit du fonctionnement documenté à l’époque, et non d’une couverture vérifiée de manière indépendante pour tous les services actuels de Microsoft.

Cloudflare mentionne NOARCHIVE et des outils de suppression. N’utilisez pas la suppression comme substitut à un contrôle limité à l’entraînement, car ses conséquences sur l’indexation nécessitent une vérification distincte. Cet article ne recommande aucune procédure de suppression. Le contrôle unifié de Cloudflare sur la quantité de contenu dans les résumés est lui aussi un objectif pour début 2027, et non une fonctionnalité de septembre.

Utiliser la carte de migration selon les usages des robots

Consigner l’état initial et les résultats souhaités

La carte de migration selon les usages des robots est un modèle de travail présenté dans cet article, et non une fonctionnalité Cloudflare ni une méthode revendiquée comme utilisée chez des clients. Utilisez-la pour relier l’état consigné de la zone aux résultats souhaités. Pour chaque contrôle proposé, conservez l’état de sa prise en charge par le fournisseur et les preuves nécessaires pour accepter la modification. Incluez la procédure de retour arrière.

Exportez les réglages lorsque c’est possible ou consignez les valeurs exactes de Search, Training et Agent, l’état de Bot Preference Sync, la réponse publique de robots.txt et les règles WAF pertinentes. Horodatez ces éléments. Masquez les détails sensibles des règles avant de les transmettre hors de l’équipe opérationnelle.

Indiquez si la recherche doit rester autorisée, puis précisez la préférence d’entraînement. Prenez une décision distincte pour la politique relative aux résumés. Une préférence non prise en charge reste une lacune même si le tableau de bord semble configuré ; le réglage seul ne prouve ni la prise en charge par le fournisseur ni le respect de la préférence.

Choisissez des chemins indexables représentatifs, incluant, le cas échéant, des pages avec et sans publicité. Recueillez les observations disponibles sur l’exploration et l’indexation avant la modification. Convenez des refus inattendus qui déclencheront un retour arrière et désignez la personne capable de restaurer les réglages. Consignez les protections indépendantes qui doivent rester intactes.

flowchart TD A[Consigner l’état initial de la zone] --> B[Préciser les résultats souhaités pour la recherche, l’entraînement et les résumés] B --> C{Le fournisseur prend-il en charge la combinaison souhaitée ?} C -->|Non ou inconnu| D[Consigner la lacune ou reporter la modification] C -->|Oui| E[Consigner les contrôles proposés] E --> F[Inspecter robots.txt et l’accès des robots] F --> G{L’accès souhaité pour la recherche est-il préservé ?} G -->|Non| H[Restaurer l’état initial et examiner le problème] G -->|Oui| I[Observer les signaux d’exploration et d’indexation] I --> J[Conserver les preuves et les limites non résolues]

Cet exemple de fiche n’est ni un corps de requête de l’API Cloudflare ni une observation en production. Il propose de refuser l’entraînement tout en laissant la question des résumés en suspens.

{
  "zone": "example.com",
  "observedAt": null,
  "desiredOutcomes": {"search": "allow", "training": "decline", "summaries": "undecided"},
  "currentControls": "not_checked",
  "proposedControls": {"Search": "Allow", "Training": "Disallow AI Training", "Agent": "retain_recorded_baseline"},
  "providerSupport": {"bingRobotsTraining": "target_early_2027_not_shipped"},
  "evidence": {"robotsTxt": "not_checked", "verifiedCrawlerAccess": "not_checked"},
  "rollback": "restore_recorded_baseline_after_unintended_search_denial"
}

Inspecter robots.txt et l’accès des robots

Bot Preference Sync ajoute le contenu généré au début du contenu robots.txt existant. Inspectez la réponse entière, et pas uniquement les lignes ajoutées. Vérifiez les groupes user-agent applicables et la priorité des directives selon les règles de chaque opérateur de robot. L’ordre des lignes n’est pas un test d’acceptation. Cloudflare indique également que cette synchronisation par catégorie ne lit pas directement les règles personnalisées individuelles à la logique plus complexe. Ne supposez pas qu’une exception WAF personnalisée a été transposée dans robots.txt.

Test de migrationPreuvesCondition d’échecRéponse
État initial consignéContrôles, règles et robots.txtImpossible de reconstituer l’état précédentReporter la modification
Préférence expriméerobots.txt servi et identifiant du fournisseurDirective absente ou contradictoireRestaurer la configuration précédente ; examiner la synchronisation
Chemins de recherche accessiblesRequêtes vérifiées, chemins et codes de statutNouveau refus d’accès pour un robot de recherche que l’on souhaite autoriserRestaurer les contrôles modifiés ; identifier la règle
Redirections fonctionnellesChaînes de réponses et destinationsDestination inattendue ou inaccessibleAnnuler la modification responsable
Autres protections préservéesÉvénements WAF et éléments attestant les règlesNécessité inexpliquée d’un contournement généralArrêter ; éviter les exceptions globales
Lacune du fournisseur consignéeSource datée et état de la prise en chargePrise en charge promise marquée comme mise en œuvreCorriger la fiche ; reporter l’objectif non pris en charge

Une chaîne user-agent Googlebot copiée permet d’inspecter une réponse, mais ne prouve pas que le véritable Googlebot y a accès. Utilisez les procédures documentées de vérification d’identité lorsqu’elles existent. La documentation de gestion des robots de Cloudflare décrit une identification par user-agent dans l’offre gratuite et une détection plus approfondie dans les offres supérieures. Indiquez le niveau de confiance en conséquence.

La même documentation avertit que les requêtes infructueuses peuvent résulter d’autres règles ou d’erreurs de réponse. Identifiez le contrôle responsable avant de modifier la politique d’entraînement. Sinon, une équipe risque d’affaiblir la mauvaise règle sans résoudre le problème du robot.

Mesurer les résultats et conserver la possibilité d’un retour arrière

La chaîne de mesure de la recherche par IA présente un contexte de mesure plus large. Cette migration nécessite un suivi plus ciblé, qui relie chaque observation à la modification précise d’un réglage.

MesurePreuvesLimite d’interprétation
Transmission de la préférencerobots.txt horodaté et directives applicablesLa publication ne vaut pas respect de la préférence
Accessibilité pour la rechercheRequêtes vérifiées par fournisseur, chemin et code de statutL’état des chemins non testés reste inconnu
Comportement d’exploration et d’indexationObservations de Search Console et de Bing WebmasterLe calendrier des nouvelles visites et le délai des rapports comptent
Résultats de recherche et de résumésPerformances de recherche et observations distinctes de visibilitéUn changement n’établit pas de lien de causalité
Résultats commerciauxTrafic référent et conversions pertinentsLa demande et les autres mises à jour compliquent l’attribution

Google inclut AI Overviews et AI Mode dans les rapports Web globaux de Search Console. N’attribuez pas une variation agrégée à un effet isolé des résumés. Choisissez les périodes d’observation en fonction des visites réelles des robots et du traitement, sans supposer qu’un verdict immédiat est possible.

Si un accès souhaité pour la recherche est nouvellement refusé, restaurez les réglages consignés et vérifiez à nouveau les chemins concernés. La restauration ne garantit ni une nouvelle exploration immédiate ni le rétablissement immédiat de l’indexation. Le test de traçabilité des preuves de Cloudflare Radar fournit un contexte connexe sur la gestion des preuves pour un autre produit, et non pour le déploiement de ce contrôle.

Erreurs fréquentes lors de la séparation entre recherche et entraînement

L’erreur principale consiste à choisir Training Block tout en s’attendant à ce qu’un robot à usages mixtes continue ses activités de recherche. Inspectez les valeurs après migration au lieu de vous fier à l’ancien sens du libellé. Search Allow n’annule pas les restrictions indépendantes présentes ailleurs dans la configuration.

Les réglages Agent ne peuvent pas compenser l’absence d’un mécanisme de contrôle de l’entraînement. Une option Disallow limitée aux pages publicitaires ne le peut pas non plus, puisqu’aucune n’est proposée. Le statut Accountable ne comble pas la lacune de Bing, et une directive d’entraînement ne constitue pas un refus des résumés.

Examinez avec prudence ce que les preuves montrent réellement. Une chaîne user-agent copiée renseigne peu sur l’identité du robot, tandis que robots.txt consigne une préférence publiée sans établir que l’entraînement a cessé. Des positions stables dans les résultats peuvent aussi rassurer pour de mauvaises raisons : elles ne permettent pas de savoir si tous les chemins importants restent accessibles.

Évitez les recettes universelles de balises. L’interaction entre NOARCHIVE et NOCACHE chez Microsoft montre comment des directives combinées peuvent modifier le résultat. Vérifiez le périmètre des produits concernés avant le déploiement, en particulier avant d’utiliser des outils de suppression.

Limites : ce que cette carte ne peut pas prouver

Publier une préférence ne prouve pas qu’elle est respectée. Cela ne permet pas non plus de retirer du contenu des modèles existants ni d’établir comment les collectes antérieures ont été utilisées. Les preuves relatives à l’application des contrôles d’exploration ne peuvent pas, à elles seules, répondre aux questions d’identité ou d’utilisation ultérieure des données.

Prévoyez les efforts de mise en œuvre, l’évolution de la documentation, les réponses en cache, le calendrier des nouvelles visites et les journaux incomplets. Limitez la conservation des preuves et leur accès lorsque la confidentialité l’exige.

Aucun réglage ne garantit de positions dans les résultats, de trafic, de citations ou de conversions. Cet article repose sur l’examen de sources publiques, et non sur une modification réelle de configuration Cloudflare, un déploiement chez un client ou une expérience SEO contrôlée. Laissez apparaître les résultats non pris en charge au lieu de déclarer la migration terminée pour tous les sites.

Points clés

  • 1Disallow AI Training associe des préférences robots.txt pour les robots à usages mixtes désignés Accountable au blocage des autres robots d’entraînement.
  • 2Choisir Training Block peut refuser l’accès aux robots de recherche à usages mixtes, mais les réglages existants migrent généralement au lieu d’adopter automatiquement le nouveau comportement de blocage.
  • 3Accountable inclut des capacités et des engagements ; évaluez séparément chaque mécanisme des fournisseurs.
  • 4La prise en charge par Bing du refus de l’entraînement via robots.txt est prévue pour début 2027 ; Disallow AI Training ne transmet donc pas automatiquement cette préférence à Bing aujourd’hui.
  • 5Traitez les résumés séparément, vérifiez l’accès des robots et conservez les éléments nécessaires au retour arrière sans prétendre prouver l’absence d’utilisation pour l’entraînement.

Conclusion

Maintenez délibérément l’accès à la recherche, avec un état initial consigné et des critères clairs de retour arrière. Training Block peut refuser l’accès aux robots de recherche à usages mixtes ; la prise en charge par Bing du refus de l’entraînement via robots.txt reste prévue pour début 2027. Ni un libellé dans le tableau de bord ni un engagement du fournisseur ne comble cette lacune. Définissez séparément la politique relative aux résumés et conservez la mention « non résolu » pour les résultats non pris en charge. Si cela vous est utile, Optijara peut vous aider à définir le périmètre de la carte des réglages et les besoins de mesure avant la mise en œuvre.

Questions fréquentes

Que fait Cloudflare Disallow AI Training ?

Il publie les préférences d’entraînement applicables dans robots.txt via Bot Preference Sync pour les robots à usages mixtes désignés Accountable et bloque les autres robots d’entraînement. Des lacunes de prise en charge subsistent chez les fournisseurs ; la publication ne prouve pas que l’entraînement a cessé.

Training Block peut-il empêcher Googlebot ou Bingbot d’accéder aux pages ?

Oui. Le nouveau fonctionnement de Training Block inclut les robots à usages mixtes Googlebot, Bingbot et Applebot. Le blocage limité aux pages publicitaires peut affecter les pages où des publicités sont détectées. Les réglages existants migrent généralement ; cela ne signifie donc pas que les sites ont automatiquement perdu leur accessibilité pour la recherche.

Refuser Google-Extended ou Applebot-Extended bloque-t-il la recherche traditionnelle ?

Ces identifiants de contrôle d’utilisation sont distincts de Googlebot et d’Applebot. Google et Apple documentent les contrôles d’entraînement séparément de la recherche traditionnelle. Aucun de ces identifiants ne permet de refuser universellement les résumés générés par l’IA.

Disallow AI Training transmet-il aujourd’hui à Bing une préférence de refus de l’entraînement ?

Pas automatiquement via robots.txt. L’annonce de Cloudflare du 15 septembre 2026 prévoit la prise en charge par Bing pour début 2027. Les anciennes consignes NOARCHIVE nécessitent un examen de leur portée actuelle ; les outils de suppression ne remplacent pas les contrôles limités à l’entraînement.

Accountable signifie-t-il que tous les contrôles sont déjà disponibles ?

Non. Accountable inclut des capacités actuelles et des engagements assortis d’échéances. Vérifiez chaque mécanisme. Le contrôle unifié de Cloudflare sur la quantité de contenu des résumés est un objectif futur, et non une fonctionnalité livrée dans cette version. Consignez les lacunes des fournisseurs, vérifiez l’accès des robots dont l’identité est confirmée et définissez les critères de retour arrière au lieu de considérer cette désignation comme une preuve de mise en œuvre.

Sources

Partager cet article

Hamza Diaz

Rédigé par

Hamza Diaz

Hamza Diaz est le fondateur d’Optijara, où il conçoit des agents IA pratiques, des systèmes d’automatisation et des workflows Copilot pour les entreprises de services. Il écrit sur les opérations IA, la stratégie d’agents et la mise en œuvre concrète pour les équipes qui veulent des systèmes utiles plutôt que du battage médiatique.