Cloudflare Disallow AI Training : une carte de migration des robots pour les équipes de référencement
Cloudflare Disallow AI Training sépare les préférences d’entraînement de l’accès à la recherche, mais Training Block peut bloquer les robots de recherche à usages mixtes. Cartographiez la prise en charge par les fournisseurs, la lacune de Bing jusqu’à début 2027 et les vérifications de retour arrière sans confondre accès d’exploration et respect des préférences d’entraînement.
Ce qui a changé : Disallow AI Training n’a pas le même effet que Block
Cloudflare Disallow AI Training publie les préférences d’utilisation pour l’entraînement tout en maintenant l’autorisation des robots de recherche à usages mixtes désignés Accountable. Training Block peut bloquer ces mêmes robots. C’est la distinction pratique introduite par la version de Cloudflare du 15 septembre 2026. La prise en charge par Bing du refus de l’entraînement via robots.txt reste, quant à elle, prévue pour début 2027.
Commencez par le résultat souhaité. Maintenir les pages accessibles à la recherche ne détermine pas si leur contenu peut servir à l’entraînement, et aucune de ces décisions ne règle la question de leur inclusion dans les résumés générés par l’IA. Chacune nécessite un contrôle pris en charge. Un tableau de bord configuré ne suffit pas pour considérer le travail comme terminé. Vérifiez que le robot concerné peut toujours accéder aux pages importantes.
L’annonce décrit le fonctionnement des contrôles ; elle n’établit pas que des sites ont perdu des positions dans les résultats de recherche lors de cette mise à jour.
Trois résultats qui nécessitent des contrôles distincts
Avec Disallow AI Training, Bot Preference Sync publie les préférences d’entraînement applicables via robots.txt. Les robots à usages mixtes désignés Accountable restent autorisés pour la recherche. Les autres robots d’entraînement sont bloqués, y compris les accès réservés à l’entraînement d’Amazon, d’Anthropic, de Meta et d’OpenAI. Leurs robots de recherche distincts constituent d’autres cibles.
Google-Extended et Applebot-Extended sont des identifiants de contrôle d’utilisation, et non d’autres noms pour Googlebot et Applebot. Refuser l’utilisation pour l’entraînement ne revient pas automatiquement à refuser toute réponse générée. Le guide du SEO, de l’AEO et du GEO présente le contexte général ; cet article se concentre sur les décisions de migration et les preuves nécessaires pour les justifier.
Recenser les réglages Cloudflare existants avant de modifier l’accès à la recherche
Réglages et effets : Allow, Disallow et Block
Consignez les valeurs actuelles de la zone avant toute modification. Le choix Allow ne supplante pas un réglage distinct ni une règle WAF indépendante. Training Block et Block on pages with ads incluent désormais les robots à usages mixtes Applebot, Bingbot et Googlebot. Une hypothèse sur ce qui constitue du trafic d’IA peut donc entraîner un refus d’accès involontaire pour la recherche.
Les réglages et les résultats de migration suivants sont documentés dans l’annonce de Cloudflare de septembre.
| Réglage existant ou action proposée | Résultat documenté | Conséquence pour la recherche | Vérification restante |
|---|---|---|---|
| Ancien réglage Block AI désactivé | Search Allow, Training Allow, Agent Allow | Aucun blocage par catégorie ajouté par la migration | Règles existantes et robots.txt |
| Ancien réglage Block AI sur Block ou blocage limité aux pages publicitaires | Search Allow, Training Disallow AI Training, Agent Block on pages with ads | Ce choix pour l’entraînement maintient l’autorisation de la recherche à usages mixtes | Prise en charge par le fournisseur |
| Ancien réglage granulaire Training sur Block ou blocage limité aux pages publicitaires | Training passe à Disallow ; les choix Search et Agent restent inchangés | Les restrictions Search conservées restent déterminantes | Valeurs réellement obtenues après migration |
| Choisir Training Disallow AI Training | Préférences pour les robots à usages mixtes désignés Accountable ; autres robots d’entraînement bloqués | L’accès pour la recherche peut être maintenu | Lacune de Bing et WAF |
| Choisir Training Block | Tous les robots d’entraînement sont bloqués, y compris les robots à usages mixtes | Peut refuser l’accès pour la recherche | Caractère intentionnel du refus |
| Choisir Training Block on pages with ads | Robots d’entraînement bloqués sur les pages où des publicités sont détectées | Ces pages peuvent perdre leur accessibilité pour la recherche | Détection publicitaire et chemins concernés |
La migration automatique diffère des préréglages d’un nouveau domaine
Cloudflare indique que la plupart des réglages existants migrent automatiquement. Le nouveau sens de Block ne signifie pas que tous les sites auparavant protégés bloquent soudainement Googlebot. Vérifiez les valeurs après migration avant de décider si une modification est nécessaire.
Les recommandations pour les nouveaux domaines constituent un sujet distinct. Pour les sites financés par la publicité, le préréglage propose Search Allow, Training Disallow AI Training et Agent Block on pages with ads. Pour les sites qui ne sont pas financés par la publicité, il propose Allow pour les trois catégories. Bot Preference Sync est activé dans les deux cas, et les propriétaires peuvent modifier ces recommandations.
Les contrôles sont disponibles avec toutes les offres, à l’échelle du domaine ou de la zone. Il n’existe ni option Disallow AI Training limitée aux pages publicitaires, ni option Agent Disallow. Tester des chemins individuels ne transforme pas ces contrôles en réglages applicables à chaque chemin.
Lors de la vérification, la documentation de Block AI Bots présentait encore une formulation datant de juillet au sujet des valeurs par défaut de septembre. Lorsque les descriptions divergent, cet article attribue le comportement de migration le plus récent à l’annonce de septembre. Vérifiez le tableau de bord avant de suivre un parcours de clics supposé.
Vérifier les capacités des fournisseurs, notamment la lacune de Bing jusqu’à début 2027
Le statut Accountable ne couvre pas uniquement des mécanismes déjà disponibles. Il exige la possibilité de refuser l’entraînement et les résumés, une transparence au niveau de l’URL et l’assurance que le refus de l’entraînement n’affecte pas la recherche traditionnelle. Ces éléments peuvent être disponibles dès maintenant ou faire l’objet d’engagements. Chaque mécanisme nécessite encore sa propre vérification.
| Fournisseur | Distinction entre recherche et entraînement | Mécanisme relatif aux résumés | Engagement ou lacune |
|---|---|---|---|
| Googlebot gère la recherche ; Google-Extended contrôle certains usages d’entraînement et d’ancrage des réponses | La recherche dispose de contrôles des extraits et de l’indexation | Cloudflare annonce une transparence supplémentaire sur les URL pour Extended, attendue sous quelques semaines | |
| Apple | Applebot explore les pages ; Applebot-Extended contrôle leur utilisation pour l’entraînement des modèles de fondation | nosnippet couvre certaines réponses génératives | Cloudflare fait état de travaux sur l’inspection au niveau de l’URL pour 2027 |
| Bing | Bingbot reste autorisé avec Disallow ; la transmission automatique du refus de l’entraînement via robots.txt n’est pas prise en charge | Les contrôles historiques de Bing Chat associent certaines restrictions sur les réponses et sur l’entraînement | La prise en charge du refus de l’entraînement via robots.txt est prévue pour début 2027 |
Google : Google-Extended n’est pas Googlebot
La documentation des robots de Google décrit Google-Extended comme un identifiant de produit sans chaîne user-agent propre dans les requêtes HTTP. Il contrôle certains usages d’entraînement et d’ancrage des réponses de Gemini. Google indique qu’il n’affecte ni l’inclusion ni le classement dans la recherche.
Pour les AI Overviews et AI Mode de Google, les consignes relatives à l’IA dans la recherche désignent Googlebot comme le contrôle de l’accès d’exploration et citent nosnippet, data-nosnippet, max-snippet et noindex comme moyens de limiter les informations affichées. Ces contrôles ont des conséquences différentes. En particulier, noindex n’est pas une préférence limitée à l’entraînement et ne doit pas être traité comme telle.
Après avoir modifié les contrôles d’aperçu, utilisez l’inspection d’URL de Search Console pour consulter le HTML reçu par Googlebot, puis prévoyez un délai pour une nouvelle exploration et le traitement. Ne cherchez pas un robot Google-Extended distinct dans les journaux d’accès pour prouver que la préférence a fonctionné, car la documentation n’en décrit aucun.
Cloudflare décrit également une option dans un portail de recherche générative. La documentation de Google consultée ici ne confirme pas de manière indépendante l’existence de cette interface précise pour tous. Cette carte ne recommande donc pas son utilisation et ne considère pas la transparence promise sur les URL comme déjà disponible.
Apple : Applebot-Extended ne bloque pas le robot de recherche
Apple indique qu’Applebot-Extended n’explore pas les pages. Lui appliquer Disallow contrôle l’utilisation pour l’entraînement du contenu recueilli par Applebot ; les pages peuvent toujours rester accessibles via la recherche.
Apple documente séparément nosnippet pour certaines réponses génératives, avec des effets sur les descriptions et les réponses issues du Web. Examinez ces effets de présentation avant le déploiement, car ils concernent l’affichage du contenu et pas uniquement son utilisation pour l’entraînement. Cloudflare situe les travaux d’Apple sur l’inspection d’URL l’année prochaine, soit en 2027, sans donner de date de lancement.
Bing : une lacune dans la prise en charge des préférences ne justifie pas une recommandation de suppression
Tant que la prise en charge prévue par Bing pour début 2027 n’est pas disponible, Disallow AI Training ne transmet pas automatiquement une préférence de refus de l’entraînement via robots.txt. Consignez clairement cet état comme non résolu, et non comme mis en œuvre.
L’annonce de Microsoft de septembre 2023 indique que NOARCHIVE exclut le contenu des réponses de Bing Chat et de l’entraînement futur des modèles de fondation, tout en préservant son admissibilité dans les résultats de recherche. NOCACHE prévaut lorsque les deux directives sont présentes. Il s’agit du fonctionnement documenté à l’époque, et non d’une couverture vérifiée de manière indépendante pour tous les services actuels de Microsoft.
Cloudflare mentionne NOARCHIVE et des outils de suppression. N’utilisez pas la suppression comme substitut à un contrôle limité à l’entraînement, car ses conséquences sur l’indexation nécessitent une vérification distincte. Cet article ne recommande aucune procédure de suppression. Le contrôle unifié de Cloudflare sur la quantité de contenu dans les résumés est lui aussi un objectif pour début 2027, et non une fonctionnalité de septembre.
Utiliser la carte de migration selon les usages des robots
Consigner l’état initial et les résultats souhaités
La carte de migration selon les usages des robots est un modèle de travail présenté dans cet article, et non une fonctionnalité Cloudflare ni une méthode revendiquée comme utilisée chez des clients. Utilisez-la pour relier l’état consigné de la zone aux résultats souhaités. Pour chaque contrôle proposé, conservez l’état de sa prise en charge par le fournisseur et les preuves nécessaires pour accepter la modification. Incluez la procédure de retour arrière.
Exportez les réglages lorsque c’est possible ou consignez les valeurs exactes de Search, Training et Agent, l’état de Bot Preference Sync, la réponse publique de robots.txt et les règles WAF pertinentes. Horodatez ces éléments. Masquez les détails sensibles des règles avant de les transmettre hors de l’équipe opérationnelle.
Indiquez si la recherche doit rester autorisée, puis précisez la préférence d’entraînement. Prenez une décision distincte pour la politique relative aux résumés. Une préférence non prise en charge reste une lacune même si le tableau de bord semble configuré ; le réglage seul ne prouve ni la prise en charge par le fournisseur ni le respect de la préférence.
Choisissez des chemins indexables représentatifs, incluant, le cas échéant, des pages avec et sans publicité. Recueillez les observations disponibles sur l’exploration et l’indexation avant la modification. Convenez des refus inattendus qui déclencheront un retour arrière et désignez la personne capable de restaurer les réglages. Consignez les protections indépendantes qui doivent rester intactes.
Cet exemple de fiche n’est ni un corps de requête de l’API Cloudflare ni une observation en production. Il propose de refuser l’entraînement tout en laissant la question des résumés en suspens.
{
"zone": "example.com",
"observedAt": null,
"desiredOutcomes": {"search": "allow", "training": "decline", "summaries": "undecided"},
"currentControls": "not_checked",
"proposedControls": {"Search": "Allow", "Training": "Disallow AI Training", "Agent": "retain_recorded_baseline"},
"providerSupport": {"bingRobotsTraining": "target_early_2027_not_shipped"},
"evidence": {"robotsTxt": "not_checked", "verifiedCrawlerAccess": "not_checked"},
"rollback": "restore_recorded_baseline_after_unintended_search_denial"
}Inspecter robots.txt et l’accès des robots
Bot Preference Sync ajoute le contenu généré au début du contenu robots.txt existant. Inspectez la réponse entière, et pas uniquement les lignes ajoutées. Vérifiez les groupes user-agent applicables et la priorité des directives selon les règles de chaque opérateur de robot. L’ordre des lignes n’est pas un test d’acceptation. Cloudflare indique également que cette synchronisation par catégorie ne lit pas directement les règles personnalisées individuelles à la logique plus complexe. Ne supposez pas qu’une exception WAF personnalisée a été transposée dans robots.txt.
| Test de migration | Preuves | Condition d’échec | Réponse |
|---|---|---|---|
| État initial consigné | Contrôles, règles et robots.txt | Impossible de reconstituer l’état précédent | Reporter la modification |
| Préférence exprimée | robots.txt servi et identifiant du fournisseur | Directive absente ou contradictoire | Restaurer la configuration précédente ; examiner la synchronisation |
| Chemins de recherche accessibles | Requêtes vérifiées, chemins et codes de statut | Nouveau refus d’accès pour un robot de recherche que l’on souhaite autoriser | Restaurer les contrôles modifiés ; identifier la règle |
| Redirections fonctionnelles | Chaînes de réponses et destinations | Destination inattendue ou inaccessible | Annuler la modification responsable |
| Autres protections préservées | Événements WAF et éléments attestant les règles | Nécessité inexpliquée d’un contournement général | Arrêter ; éviter les exceptions globales |
| Lacune du fournisseur consignée | Source datée et état de la prise en charge | Prise en charge promise marquée comme mise en œuvre | Corriger la fiche ; reporter l’objectif non pris en charge |
Une chaîne user-agent Googlebot copiée permet d’inspecter une réponse, mais ne prouve pas que le véritable Googlebot y a accès. Utilisez les procédures documentées de vérification d’identité lorsqu’elles existent. La documentation de gestion des robots de Cloudflare décrit une identification par user-agent dans l’offre gratuite et une détection plus approfondie dans les offres supérieures. Indiquez le niveau de confiance en conséquence.
La même documentation avertit que les requêtes infructueuses peuvent résulter d’autres règles ou d’erreurs de réponse. Identifiez le contrôle responsable avant de modifier la politique d’entraînement. Sinon, une équipe risque d’affaiblir la mauvaise règle sans résoudre le problème du robot.
Mesurer les résultats et conserver la possibilité d’un retour arrière
La chaîne de mesure de la recherche par IA présente un contexte de mesure plus large. Cette migration nécessite un suivi plus ciblé, qui relie chaque observation à la modification précise d’un réglage.
| Mesure | Preuves | Limite d’interprétation |
|---|---|---|
| Transmission de la préférence | robots.txt horodaté et directives applicables | La publication ne vaut pas respect de la préférence |
| Accessibilité pour la recherche | Requêtes vérifiées par fournisseur, chemin et code de statut | L’état des chemins non testés reste inconnu |
| Comportement d’exploration et d’indexation | Observations de Search Console et de Bing Webmaster | Le calendrier des nouvelles visites et le délai des rapports comptent |
| Résultats de recherche et de résumés | Performances de recherche et observations distinctes de visibilité | Un changement n’établit pas de lien de causalité |
| Résultats commerciaux | Trafic référent et conversions pertinents | La demande et les autres mises à jour compliquent l’attribution |
Google inclut AI Overviews et AI Mode dans les rapports Web globaux de Search Console. N’attribuez pas une variation agrégée à un effet isolé des résumés. Choisissez les périodes d’observation en fonction des visites réelles des robots et du traitement, sans supposer qu’un verdict immédiat est possible.
Si un accès souhaité pour la recherche est nouvellement refusé, restaurez les réglages consignés et vérifiez à nouveau les chemins concernés. La restauration ne garantit ni une nouvelle exploration immédiate ni le rétablissement immédiat de l’indexation. Le test de traçabilité des preuves de Cloudflare Radar fournit un contexte connexe sur la gestion des preuves pour un autre produit, et non pour le déploiement de ce contrôle.
Erreurs fréquentes lors de la séparation entre recherche et entraînement
L’erreur principale consiste à choisir Training Block tout en s’attendant à ce qu’un robot à usages mixtes continue ses activités de recherche. Inspectez les valeurs après migration au lieu de vous fier à l’ancien sens du libellé. Search Allow n’annule pas les restrictions indépendantes présentes ailleurs dans la configuration.
Les réglages Agent ne peuvent pas compenser l’absence d’un mécanisme de contrôle de l’entraînement. Une option Disallow limitée aux pages publicitaires ne le peut pas non plus, puisqu’aucune n’est proposée. Le statut Accountable ne comble pas la lacune de Bing, et une directive d’entraînement ne constitue pas un refus des résumés.
Examinez avec prudence ce que les preuves montrent réellement. Une chaîne user-agent copiée renseigne peu sur l’identité du robot, tandis que robots.txt consigne une préférence publiée sans établir que l’entraînement a cessé. Des positions stables dans les résultats peuvent aussi rassurer pour de mauvaises raisons : elles ne permettent pas de savoir si tous les chemins importants restent accessibles.
Évitez les recettes universelles de balises. L’interaction entre NOARCHIVE et NOCACHE chez Microsoft montre comment des directives combinées peuvent modifier le résultat. Vérifiez le périmètre des produits concernés avant le déploiement, en particulier avant d’utiliser des outils de suppression.
Limites : ce que cette carte ne peut pas prouver
Publier une préférence ne prouve pas qu’elle est respectée. Cela ne permet pas non plus de retirer du contenu des modèles existants ni d’établir comment les collectes antérieures ont été utilisées. Les preuves relatives à l’application des contrôles d’exploration ne peuvent pas, à elles seules, répondre aux questions d’identité ou d’utilisation ultérieure des données.
Prévoyez les efforts de mise en œuvre, l’évolution de la documentation, les réponses en cache, le calendrier des nouvelles visites et les journaux incomplets. Limitez la conservation des preuves et leur accès lorsque la confidentialité l’exige.
Aucun réglage ne garantit de positions dans les résultats, de trafic, de citations ou de conversions. Cet article repose sur l’examen de sources publiques, et non sur une modification réelle de configuration Cloudflare, un déploiement chez un client ou une expérience SEO contrôlée. Laissez apparaître les résultats non pris en charge au lieu de déclarer la migration terminée pour tous les sites.
Points clés
- 1Disallow AI Training associe des préférences robots.txt pour les robots à usages mixtes désignés Accountable au blocage des autres robots d’entraînement.
- 2Choisir Training Block peut refuser l’accès aux robots de recherche à usages mixtes, mais les réglages existants migrent généralement au lieu d’adopter automatiquement le nouveau comportement de blocage.
- 3Accountable inclut des capacités et des engagements ; évaluez séparément chaque mécanisme des fournisseurs.
- 4La prise en charge par Bing du refus de l’entraînement via robots.txt est prévue pour début 2027 ; Disallow AI Training ne transmet donc pas automatiquement cette préférence à Bing aujourd’hui.
- 5Traitez les résumés séparément, vérifiez l’accès des robots et conservez les éléments nécessaires au retour arrière sans prétendre prouver l’absence d’utilisation pour l’entraînement.
Conclusion
Maintenez délibérément l’accès à la recherche, avec un état initial consigné et des critères clairs de retour arrière. Training Block peut refuser l’accès aux robots de recherche à usages mixtes ; la prise en charge par Bing du refus de l’entraînement via robots.txt reste prévue pour début 2027. Ni un libellé dans le tableau de bord ni un engagement du fournisseur ne comble cette lacune. Définissez séparément la politique relative aux résumés et conservez la mention « non résolu » pour les résultats non pris en charge. Si cela vous est utile, Optijara peut vous aider à définir le périmètre de la carte des réglages et les besoins de mesure avant la mise en œuvre.
Questions fréquentes
Que fait Cloudflare Disallow AI Training ?
Il publie les préférences d’entraînement applicables dans robots.txt via Bot Preference Sync pour les robots à usages mixtes désignés Accountable et bloque les autres robots d’entraînement. Des lacunes de prise en charge subsistent chez les fournisseurs ; la publication ne prouve pas que l’entraînement a cessé.
Training Block peut-il empêcher Googlebot ou Bingbot d’accéder aux pages ?
Oui. Le nouveau fonctionnement de Training Block inclut les robots à usages mixtes Googlebot, Bingbot et Applebot. Le blocage limité aux pages publicitaires peut affecter les pages où des publicités sont détectées. Les réglages existants migrent généralement ; cela ne signifie donc pas que les sites ont automatiquement perdu leur accessibilité pour la recherche.
Refuser Google-Extended ou Applebot-Extended bloque-t-il la recherche traditionnelle ?
Ces identifiants de contrôle d’utilisation sont distincts de Googlebot et d’Applebot. Google et Apple documentent les contrôles d’entraînement séparément de la recherche traditionnelle. Aucun de ces identifiants ne permet de refuser universellement les résumés générés par l’IA.
Disallow AI Training transmet-il aujourd’hui à Bing une préférence de refus de l’entraînement ?
Pas automatiquement via robots.txt. L’annonce de Cloudflare du 15 septembre 2026 prévoit la prise en charge par Bing pour début 2027. Les anciennes consignes NOARCHIVE nécessitent un examen de leur portée actuelle ; les outils de suppression ne remplacent pas les contrôles limités à l’entraînement.
Accountable signifie-t-il que tous les contrôles sont déjà disponibles ?
Non. Accountable inclut des capacités actuelles et des engagements assortis d’échéances. Vérifiez chaque mécanisme. Le contrôle unifié de Cloudflare sur la quantité de contenu des résumés est un objectif futur, et non une fonctionnalité livrée dans cette version. Consignez les lacunes des fournisseurs, vérifiez l’accès des robots dont l’identité est confirmée et définissez les critères de retour arrière au lieu de considérer cette désignation comme une preuve de mise en œuvre.
Sources
- https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/
- https://blog.cloudflare.com/bot-preference-sync/
- https://support.apple.com/en-us/119829
- https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers
- https://developers.google.com/search/docs/appearance/ai-features
- https://blogs.bing.com/webmaster/september-2023/Announcing-new-options-for-webmasters-to-control-usage-of-their-content-in-Bing-Chat
- https://developers.cloudflare.com/bots/additional-configurations/block-ai-bots/
- https://developers.cloudflare.com/ai-crawl-control/features/manage-ai-crawlers/
Rédigé par
Hamza DiazHamza Diaz est le fondateur d’Optijara, où il conçoit des agents IA pratiques, des systèmes d’automatisation et des workflows Copilot pour les entreprises de services. Il écrit sur les opérations IA, la stratégie d’agents et la mise en œuvre concrète pour les équipes qui veulent des systèmes utiles plutôt que du battage médiatique.
