Featured on SaaSBison Featured on Toolfio Listed on Bowora Featured on Uneed Featured on ToolPilot

Ce que robots.txt bloque réellement face aux crawlers IA

OpenAI exploite quatre crawlers, Anthropic trois, et Perplexity deux, chacun avec un rôle différent et sa propre règle robots.txt. Voici, bot par bot, ce que désactiver GPTBot, ClaudeBot ou PerplexityBot arrête réellement, et ce que cela laisse grand ouvert.

OpenAI exploite quatre crawlers distincts, sous quatre noms différents. Anthropic en fait tourner trois. Perplexity, deux. Désactiver l'un ne désactive pas les autres. Une simple ligne « Disallow: GPTBot » dans le fichier robots.txt arrête le crawler d'entraînement d'OpenAI, et rien d'autre : ni le bot de recherche de ChatGPT, ni son bot de vérification publicitaire, ni celui qui récupère une page dès qu'un utilisateur colle un lien dans une conversation. Beaucoup de responsables marketing ont configuré leurs règles pour les crawlers IA une bonne fois pour toutes, en 2024, et ne les ont jamais revues depuis. Voici, bot par bot, ce que fait réellement chaque crawler des principaux moteurs IA en 2026, et ce que robots.txt peut ou ne peut pas contrôler.

Pourquoi une seule règle robots.txt ne peut pas « bloquer l'IA »

robots.txt contrôle les crawlers un par un, par user-agent, et chaque grand acteur de l'IA en exploite désormais plusieurs. Bloquer le bot phare d'un laboratoire n'arrête que la fonction que ce bot remplit, généralement la collecte de données d'entraînement, pendant que son bot d'indexation et son bot de requête en direct continuent d'aspirer les pages sous des noms totalement différents.

Le rapport de force a lui aussi changé. Selon les données réseau de Cloudflare, les requêtes des crawlers d'entraînement IA représentaient 52 % de tout le trafic de crawlers en juin 2026, contre 22 % un an plus tôt, et le trafic non humain a franchi pour la première fois la barre des 50 % de tout ce que Cloudflare observe. Ce chiffre à lui seul explique pourquoi le vieux réflexe du « je bloque toute l'IA » en une seule règle n'a plus de sens : l'essentiel du trafic qui déclenche cette règle aujourd'hui n'a rien à voir avec la collecte de données d'entraînement.

Ce que font vraiment GPTBot, OAI-SearchBot et ChatGPT-User

OpenAI documente quatre crawlers distincts, chacun contrôlable séparément dans robots.txt. GPTBot collecte les données qui entraînent les modèles fondation d'OpenAI. OAI-SearchBot indexe les pages spécifiquement pour la fonction recherche de ChatGPT. OAI-AdsBot vérifie les pages de destination soumises avec des publicités. ChatGPT-User, lui, ne récupère qu'une seule page à la fois, uniquement quand un utilisateur demande à ChatGPT de l'ouvrir.

Désactiver GPTBot ne retire pas un site des réponses de recherche de ChatGPT. Cela nécessite une règle séparée pour OAI-SearchBot, selon la documentation développeur d'OpenAI elle-même. Et ChatGPT-User n'est pas vraiment un crawler au sens classique : la documentation d'OpenAI précise qu'il gère des « actions utilisateur » en direct, et un changement de règle d'accès peut mettre environ 24 heures à se propager après la mise à jour du fichier. Nous avons déjà détaillé comment ChatGPT choisit vraiment ses sources, notamment ce qui se passe une fois qu'une page a passé l'étape du crawl.

Anthropic a scindé ClaudeBot en trois bots, avec trois rôles différents

Anthropic a réorganisé sa documentation sur les crawlers en février 2026, transformant ce qui n'était qu'une seule entrée ClaudeBot en trois agents nommés séparément. ClaudeBot continue de collecter les données d'entraînement du modèle. Claude-User récupère une page dès qu'un utilisateur pose une question dessus à Claude. Claude-SearchBot indexe le contenu spécifiquement pour les réponses de type recherche de Claude, et le désactiver séparément peut nuire à la visibilité d'une marque à cet endroit précis, même si ClaudeBot reste bloqué par ailleurs.

C'est un renversement complet par rapport au réflexe de 2024, où la plupart des sites bloquaient « ClaudeBot » en bloc ou le laissaient grand ouvert, sans option intermédiaire. Search Engine Journal, qui a couvert la mise à jour de février 2026, a noté que ce changement rendait les décisions robots.txt « plus granulaires », ce qui signifie en pratique qu'un site peut désormais refuser les données d'entraînement d'Anthropic tout en gardant son contenu éligible aux réponses en direct de Claude. Notre guide pour être cité par Claude détaille ce qu'il faut autoriser quand l'objectif réel est la citation, pas l'exclusion de l'entraînement.

PerplexityBot respecte robots.txt. Perplexity-User n'y est pas obligé

Perplexity exploite deux crawlers aux obligations opposées. PerplexityBot, utilisé pour construire son index de recherche, respecte robots.txt, et la documentation de Perplexity demande explicitement aux sites de l'autoriser plutôt que de le bloquer. Perplexity-User, déclenché quand un utilisateur pose une question directe à Perplexity sur une page précise, n'est pas soumis à la même règle, car cette requête remplace celle d'un humain plutôt que de relever d'une indexation en masse.

Une règle robots.txt ne vaut que ce que vaut la bonne foi du crawler qui s'identifie. Toutes les entreprises ne considèrent pas cela comme acquis.

En août 2025, Cloudflare a publiquement accusé Perplexity d'utiliser un crawler non déclaré, se faisant passer pour Chrome, afin de continuer à récupérer des pages sur des sites qui avaient pourtant désactivé PerplexityBot. Matthew Prince, le PDG de Cloudflare, a écrit que certaines « entreprises d'IA se comportent davantage comme des hackers nord-coréens » que comme des crawlers légitimes. Perplexity a d'abord nié que ce bot lui appartienne, puis a expliqué que ce trafic provenait d'un service tiers, en soutenant qu'une requête déclenchée par un utilisateur diffère fondamentalement d'un crawl automatisé. Le litige a plus d'un an maintenant, mais il explique pourquoi la vérification par IP, et pas seulement par la chaîne user-agent, est devenue la recommandation standard ; OpenAI, par exemple, publie directement la liste de ses plages IP sur openai.com/gptbot.json, précisément pour cette raison. Notre guide sur Cloudflare qui bloque discrètement les crawlers IA et notre guide d'optimisation pour Perplexity détaillent tous les deux les mécanismes côté Perplexity.

Google-Extended bloque l'entraînement de l'IA, pas votre classement Google

Google-Extended est un jeton produit distinct de Googlebot, et le désactiver ne fait que retirer un site des données d'entraînement et de grounding pour Gemini et Vertex AI. La documentation de Google elle-même, mise à jour en avril 2025, indique clairement que Google-Extended « n'a pas d'impact sur l'inclusion d'un site dans Google Search et n'est pas utilisé comme signal de classement ».

Cette distinction compte, car elle va à l'inverse de ce que la plupart des propriétaires de sites supposent du fonctionnement de robots.txt. Bloquer Google-Extended ne coûte rien au classement organique dans Search ; cela ne fait qu'écarter une visibilité potentielle dans les réponses Gemini et les AI Overviews qui s'appuient sur le pipeline d'entraînement et de grounding de Google. Les sites qui pèsent cet arbitrage devraient lire notre guide d'optimisation pour Gemini avant de trancher dans un sens ou dans l'autre.

robots.txt devient une table de négociation, pas seulement un mur

Cloudflare commencera à bloquer par défaut les crawlers IA à « usage mixte » sur les pages financées par la publicité à partir du 15 septembre 2026. Cette politique oblige les entreprises d'IA à séparer clairement leurs crawlers d'entraînement, de recherche et d'agent en identités distinctes, sous peine de perdre l'accès par défaut sur tout site protégé par Cloudflare qui ne les aurait pas explicitement autorisés. La règle s'applique aux nouveaux clients Cloudflare, aux nouveaux sites sur des comptes existants, et à tous les sites du plan gratuit.

En parallèle de ce blocage par défaut, Cloudflare a lancé Pay Per Crawl et Pay Per Use, permettant à un site de facturer l'accès aux entreprises d'IA plutôt que de se contenter d'autoriser ou de refuser en bloc. robots.txt reste la première porte à franchir, mais pour un nombre croissant de sites, ce n'est plus le seul levier. Deux mécanismes sont faciles à confondre ici : robots.txt détermine si un bot peut récupérer une page, tandis que llms.txt est un fichier distinct, non contraignant, qui suggère comment un moteur devrait utiliser une page une fois qu'elle a déjà été récupérée. Bien régler les règles d'accès n'est que la moitié du travail. Des outils comme VizibleAI suivent si l'ouverture de l'accès à un crawler se traduit réellement par une augmentation des citations d'une marque dans ChatGPT, Claude, Gemini et Perplexity, un chiffre que les règles d'accès seules ne montrent jamais. Associer un audit des crawlers à un véritable audit GEO donne une vision plus complète de cet effet.

Questions fréquemment posées

Disallow: GPTBot empêche-t-il mon contenu d'apparaître dans les réponses de ChatGPT ?

Pas entièrement. GPTBot ne régit que la collecte de données d'entraînement. ChatGPT peut toujours faire apparaître vos pages via OAI-SearchBot, son crawler de recherche dédié, et via ChatGPT-User quand un utilisateur colle directement votre URL dans une conversation. Pour ne plus apparaître spécifiquement dans les résultats de recherche de ChatGPT, il faut une règle Disallow séparée pour OAI-SearchBot, selon la documentation crawler d'OpenAI elle-même.

Dois-je bloquer Claude-User si je bloque déjà ClaudeBot ?

Non, et la plupart des sites ne devraient pas le faire. ClaudeBot gère la collecte de données d'entraînement, tandis que Claude-User récupère une seule page uniquement quand un utilisateur interroge Claude à son sujet. Bloquer Claude-User retire à Claude la capacité de répondre à des questions précises sur votre site, ce qui va généralement à l'encontre de l'objectif d'une marque qui cherche à gagner en visibilité IA.

Bloquer Google-Extended nuit-il à mon classement Google Search ?

Non. La documentation de Google indique explicitement que Google-Extended n'est pas un signal de classement et n'affecte pas l'inclusion dans Google Search. Il contrôle uniquement si votre contenu entraîne ou alimente le grounding des modèles Gemini et Vertex AI. Googlebot, qui gère l'indexation pour Search, est un user-agent totalement distinct, non affecté par les règles Google-Extended.

Comment vérifier qu'un bot se présentant comme PerplexityBot est bien PerplexityBot ?

Vérifiez l'adresse IP de la requête par rapport aux plages publiées par chaque entreprise, plutôt que de faire confiance à la seule chaîne user-agent ; OpenAI, par exemple, publie sa liste d'IP sur openai.com/gptbot.json. Depuis l'accusation de Cloudflare en août 2025, selon laquelle un crawler non déclaré se faisait passer pour un navigateur afin de contourner les règles robots.txt de Perplexity, la vérification par IP est devenue une recommandation standard plutôt qu'un cas isolé.

Dois-je simplement bloquer tous les crawlers IA pour protéger mon contenu ?

Cela dépend de l'objectif. Bloquer les crawlers d'entraînement comme GPTBot ou ClaudeBot garde le contenu hors de l'entraînement des modèles, mais ne retire pas une marque des réponses IA, puisque des bots de recherche et de requête utilisateur distincts continuent d'opérer sous d'autres noms. Les sites qui optimisent leur visibilité IA autorisent généralement les bots de recherche et les bots orientés utilisateur, tout en tranchant au cas par cas pour les bots d'entraînement.

robots.txt aura-t-il encore de l'importance après le déploiement du pay-per-crawl de Cloudflare ?

Oui, il reste la première porte à franchir. La politique de Cloudflare de septembre 2026 bloque par défaut les crawlers « usage mixte » non différenciés sur les pages financées par la publicité, mais les sites ont toujours besoin de règles robots.txt pour indiquer quels bots nommés ils autorisent. Les outils de paiement à l'accès s'ajoutent par-dessus, comme couche de monétisation, pas comme remplacement.

Transformer l'accès crawler en vraie visibilité IA

Bien régler les règles robots.txt ne contrôle que qui peut récupérer vos pages. Cela ne dit rien sur le fait que ChatGPT, Claude, Gemini ou Perplexity citent réellement votre marque une fois l'accès ouvert. VizibleAI suit les mentions de marque, la position et la part de voix sur ces moteurs, pour qu'une marque puisse voir si l'ouverture de l'accès à un crawler a produit une citation réelle.