robots.txt GPTBot ClaudeBot : bloquer ou autoriser les robots d’IA
GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended : à quoi sert chaque robot, ce que son blocage change dans les réponses des moteurs d’IA, et ce que robots.txt ne peut pas empêcher.
En bref. Bloquer GPTBot ou ClaudeBot dans robots.txt concerne l’entraînement des modèles ; Google-Extended concerne l’entraînement de Gemini et l’ancrage dans Gemini et Vertex AI, sans effet sur Google Search. Votre présence dans les réponses dépend d’autres robots : OAI-SearchBot, Claude-SearchBot et Claude-User, PerplexityBot et Googlebot. Les visites demandées par une personne peuvent ignorer robots.txt (OpenAI et Perplexity l’écrivent). Selon la RFC 9309, robots.txt n’est pas un contrôle d’accès.
À retenir
- Chez OpenAI, GPTBot (entraînement) et OAI-SearchBot (recherche dans ChatGPT) se règlent indépendamment l’un de l’autre.
- Google-Extended n’a aucun effet sur l’inclusion dans Google Search ; pour les aperçus IA et AI Mode, le réglage « Search generative AI » existe dans Search Console depuis le 31 août 2026.
- ChatGPT-User et Perplexity-User visitent des pages à la demande d’un utilisateur, et robots.txt peut ne pas s’appliquer à ces visites.
- La RFC 9309 précise que robots.txt n’est pas une autorisation d’accès et que les chemins qu’il liste deviennent publics.
- Après une modification, OpenAI indique environ 24 heures et Perplexity jusqu’à 24 heures avant la prise en compte.
Quels robots d’IA lisent votre robots.txt, et que perdez-vous en bloquant chacun ?
Les robots d’IA se rangent en trois familles. Les robots de recherche font apparaître votre site dans les réponses, les robots d’entraînement collectent des contenus pour les futurs modèles, et les agents de visite ouvrent une page quand un utilisateur le demande. Chez OpenAI, le réglage de l’entraînement (GPTBot) est indépendant de celui de la recherche ; chez Anthropic, restreindre ClaudeBot exclut les futurs contenus des données d’entraînement, et la recherche passe par d’autres robots. Chez Google, le jeton Google-Extended couvre à la fois l’entraînement de Gemini et l’ancrage dans les applications Gemini et Vertex AI (voir section 3).
Un agent utilisateur (user agent, le nom sous lequel un robot se présente) est le nom à écrire après « User-agent: » dans le fichier. Google-Extended fait exception : c’est un jeton, c’est-à-dire un nom reconnu dans robots.txt, mais aucun robot ne visite votre site sous ce nom.
| Éditeur | Robot ou jeton | Rôle déclaré par l’éditeur | Ce qu’un blocage change selon l’éditeur |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Faire apparaître des sites dans les résultats de recherche de ChatGPT | Le site n’apparaît pas dans les réponses de recherche de ChatGPT, mais peut encore apparaître sous forme de lien de navigation |
| OpenAI | GPTBot | Explorer des contenus qui peuvent servir à l’entraînement des modèles d’OpenAI | L’exclusion indique que le contenu ne doit pas servir à cet entraînement |
| OpenAI | ChatGPT-User | Visiter des pages à la demande d’un utilisateur | Les règles de robots.txt peuvent ne pas s’appliquer ; cet agent ne décide pas de l’apparition dans la recherche |
| Anthropic | Claude-SearchBot | Améliorer les résultats de recherche | Peut réduire la visibilité du site dans les réponses de recherche de Claude |
| Anthropic | ClaudeBot | Collecter des contenus pouvant servir à l’entraînement des modèles | Les futurs contenus du site sont exclus des données d’entraînement |
| Anthropic | Claude-User | Visiter des pages à la demande d’un utilisateur de Claude | Même effet possible que pour Claude-SearchBot, selon Anthropic |
| Perplexity | PerplexityBot | Faire apparaître des sites dans les résultats de Perplexity ; non utilisé pour entraîner des modèles de fondation | Perplexity ne détaille pas cet effet ; c’est le robot qui sert à l’apparition dans ses résultats |
| Perplexity | Perplexity-User | Visiter des pages à la demande d’un utilisateur | Ignore en général les règles de robots.txt |
| Googlebot | Explorer les pages pour Google Search | Google cite un Googlebot non bloqué parmi les conditions techniques pour les aperçus IA et AI Mode | |
| Google-Extended | Jeton sans agent utilisateur distinct, lié à Gemini et Vertex AI | Aucun effet sur l’inclusion dans Google Search, et ce n’est pas un signal de classement |
Ces formulations viennent des pages des éditeurs consultées le 30 septembre 2026. La page d’Anthropic date du 7 avril 2026. Ces documentations changent souvent : relisez la page de l’éditeur avant de modifier votre fichier, et notez la date de votre lecture.
Peut-on refuser l’entraînement des modèles tout en restant dans les réponses ?
Oui, chez OpenAI et chez Anthropic, parce que l’entraînement et la recherche passent par des robots différents. OpenAI écrit que les réglages d’OAI-SearchBot et de GPTBot sont indépendants. Selon Anthropic, restreindre ClaudeBot exclut les futurs contenus du site des données d’entraînement, alors que désactiver Claude-SearchBot ou Claude-User peut réduire la visibilité du site dans les réponses de recherche de Claude.
Pour refuser l’entraînement sans toucher à la recherche, on écrit un bloc par robot d’entraînement et on ne mentionne pas les robots de recherche. Le fichier contient alors ces lignes :
- Pour GPTBot : la ligne User-agent: GPTBot, puis Disallow: /
- Pour ClaudeBot : la ligne User-agent: ClaudeBot, puis Disallow: /
- Pour Google-Extended : la ligne User-agent: Google-Extended, puis Disallow: /
La barre oblique seule désigne tout le site. Un piège possible est un bloc « User-agent: * » suivi de « Disallow: / », copié d’un ancien modèle ou laissé par un site en préproduction. Vous croyez avoir refusé l’entraînement, et vous avez en fait fermé la porte aux réponses.
Chez Perplexity, PerplexityBot n’est pas utilisé pour entraîner des modèles de fondation. Le bloquer ne sert donc pas à refuser ce type d’entraînement : cela touche le robot qui fait apparaître votre site dans Perplexity.
Il reste un cas particulier chez OpenAI. Une page que vous avez exclue d’OAI-SearchBot, mais que le système connaît par un autre moyen, peut apparaître avec son seul lien et son titre dans ChatGPT Atlas. Pour l’éviter, OpenAI indique la balise meta noindex, que le robot doit pouvoir lire. Le détail des autres conditions pour apparaître dans ChatGPT fait l’objet d’un article séparé.
Google-Extended ne retire pas votre site de Google Search ni des aperçus IA
Google-Extended décide seulement si le contenu exploré par Google peut servir à entraîner les futures générations des modèles Gemini et à l’ancrage dans les applications Gemini et Vertex AI. L’ancrage (grounding) désigne le fait d’appuyer une réponse générée sur des pages récupérées. Selon Google, ce jeton n’a aucun effet sur l’inclusion d’un site dans Google Search et n’est pas un signal de classement.
Pour agir sur Google Search et ses fonctions d’IA, il existe d’autres outils, et chacun a un effet précis.
- Bloquer Googlebot dans robots.txt agit sur l’exploration de Google Search.
- Le réglage « Search generative AI » de Search Console (menu Paramètres) est proposé à tous les sites depuis le 31 août 2026. Il décide si le site est inclus dans les aperçus IA, AI Mode et les fonctions d’IA générative de Discover. L’inclusion est le réglage par défaut. Un site exclu n’apparaît plus dans ces fonctions, ni sous forme de lien ni comme source servant à ancrer une réponse, et n’en reçoit ni impressions ni trafic. Selon Google, ce réglage ne joue pas sur le reste de Google Search et n’agit pas sur l’entraînement, qui relève de Google-Extended.
- Les balises nosnippet, data-nosnippet, max-snippet et noindex limitent ce qui est affiché. Pour retirer entièrement une page de Google Search, Google indique noindex.
Si vous voulez refuser l’entraînement de Gemini mais rester dans les aperçus IA, vous bloquez Google-Extended et laissez le réglage Search Console sur l’inclusion. Si vous voulez sortir des aperçus IA et d’AI Mode tout en restant dans les résultats classiques, c’est le réglage Search Console qu’il faut changer, pas robots.txt. Google indique qu’un changement de ce réglage prend en général quelques jours avant de s’appliquer.
Erreur à éviter : bloquer Google-Extended en pensant sortir des aperçus IA. Votre site y reste, puisque ce jeton ne concerne pas Google Search. Pour la démarche inverse, voyez comment apparaître dans les aperçus IA.
Les visites demandées par un utilisateur peuvent ignorer robots.txt
Selon OpenAI, quand ChatGPT-User ouvre une page parce qu’une personne le lui demande, ce n’est pas une exploration automatique. OpenAI et Perplexity écrivent que robots.txt peut alors ne pas s’appliquer. Un blocage dans robots.txt peut donc ne pas empêcher qu’une page publique soit lue sur demande d’une personne.
Pour votre présence dans la recherche de ChatGPT, c’est OAI-SearchBot qui compte : selon OpenAI, ChatGPT-User ne sert pas à décider si un contenu apparaît dans la recherche.
Perplexity est plus direct. Comme la visite est demandée par l’utilisateur, Perplexity-User ignore en général ce fichier.
Anthropic se distingue. L’éditeur écrit que ses robots respectent robots.txt.
Ce que cela change pour vous dépend de la page.
- Si la page est publique et que vous voulez y attirer des clients, ces visites ne posent pas de problème : elles répondent à une personne qui s’intéresse à votre offre.
- Si la page contient des tarifs réservés, des documents clients ou des informations internes, robots.txt ne suffit pas. Elle doit sortir de l’accès public : espace protégé par identifiant et mot de passe, ou retrait du site.
- Si vous voulez qu’une page ne figure pas dans les résultats des moteurs de réponse, agissez sur les robots de recherche et, chez OpenAI, sur la balise noindex (section 2). Chez OpenAI, l’agent de visite ChatGPT-User n’entre pas dans ce choix ; chez Anthropic, Claude-User peut en revanche peser sur la visibilité dans Claude.
robots.txt n’est pas un contrôle d’accès : ce que dit la RFC 9309
robots.txt est une consigne publique adressée aux robots qui acceptent de la suivre. Il ne protège rien. Le protocole d’exclusion des robots est normalisé par la RFC 9309 de l’IETF (l’organisme qui publie les normes techniques d’internet), publiée en septembre 2022. Le texte précise que ces règles ne sont pas une forme d’autorisation d’accès et ne remplacent pas de vraies mesures de sécurité.
Trois conséquences pour un site de PME :
- N’importe qui peut lire votre robots.txt en ajoutant /robots.txt à l’adresse de votre site. La RFC le dit : lister des chemins dans ce fichier les expose publiquement. Une ligne « Disallow: /espace-clients/ » ou « Disallow: /admin/ » indique donc à tout curieux où chercher.
- Un robot qui ne respecte pas le protocole n’en tient aucun compte. Le fichier n’a d’effet que sur les robots qui choisissent de le suivre. Les éditeurs cités dans cet article décrivent ce qu’ils font de vos règles, avec les exceptions des visites à la demande.
- Une page bloquée dans robots.txt reste accessible à quiconque connaît son adresse ; chez OpenAI, une page exclue d’OAI-SearchBot mais connue par un autre moyen peut apparaître avec son seul lien et son titre dans ChatGPT Atlas (section 2).
Pour un espace privé, la protection passe par le site lui-même : une authentification par identifiant et mot de passe, un espace client fermé, ou des documents qui ne sont pas publiés à une adresse publique. Ensuite, robots.txt peut servir à éviter que les robots perdent du temps sur ces pages, sans y lister de chemins sensibles.
La RFC fixe aussi deux limites techniques utiles. Un robot ne devrait pas utiliser une version en cache de robots.txt pendant plus de 24 heures, sauf si le fichier est inaccessible. La limite d’analyse qu’un robot impose doit être d’au moins 500 kibioctets.
Quelle décision prendre selon votre situation ?
La décision tient en deux questions. Voulez-vous être cité dans les réponses ? Acceptez-vous que vos contenus servent à entraîner des modèles ? La grille ci-dessous croise les trois situations les plus courantes.
| Situation | Robots de recherche (OAI-SearchBot, Claude-SearchBot, PerplexityBot) | Robots d’entraînement (GPTBot, ClaudeBot, Google-Extended) | Ce qui subsiste malgré le réglage |
|---|---|---|---|
| Commerce local qui veut être cité | Autorisés | Au choix de l’entreprise | Rien à retirer : le but est la présence |
| Éditeur de contenus qui refuse l’entraînement | Autorisés | Bloqués | Visites demandées par une personne |
| Entreprise qui veut sortir des réponses générées | Bloqués, Claude-User compris, plus réglage Search Console | Bloqués | Visites à la demande ; lien de navigation dans ChatGPT ; lien et titre dans ChatGPT Atlas sans noindex |
Un restaurant, un garage ou un cabinet qui cherche des clients
L’enjeu est d’être lisible. Vérifiez qu’aucun bloc général ne ferme le site aux robots de recherche. Côté Google, une page doit être indexée et pouvoir s’afficher dans Google Search avec un extrait pour figurer dans les fonctions d’IA générative, et le site doit être inclus dans le réglage Search Console, ce qui est le cas par défaut. Pour un tel profil, la méthode de référencement IA de Pixel-iA prévoit d’autoriser les robots des moteurs de réponse, à côté d’une page par question écrite dans les mots des clients et des données structurées de l’entreprise ; l’atelier ne garantit pour autant ni citation ni classement. Le détail de ce travail de référencement dans les moteurs de réponse est décrit sur une page dédiée.
Un éditeur qui publie des guides ou des fiches techniques
Il bloque GPTBot, ClaudeBot et Google-Extended, et garde OAI-SearchBot, Claude-SearchBot et PerplexityBot. Les lignes à écrire figurent en section 2.
Une entreprise qui veut sortir des réponses générées
Elle bloque aussi les robots de recherche, désactive l’inclusion dans l’option de Search Console consacrée à l’IA générative et pose noindex sur les pages qu’elle ne veut pas voir réapparaître par leur lien dans ChatGPT Atlas. Chez OpenAI et Perplexity, les visites demandées par un utilisateur peuvent ne pas suivre robots.txt.
Une fois le fichier modifié, chaque éditeur a son délai. OpenAI indique environ 24 heures pour que ses systèmes de recherche s’ajustent, Perplexity jusqu’à 24 heures, et Google quelques jours pour le réglage Search Console.
Comment mesurer l’effet de vos choix après la modification ?
Trois sources montrent une partie de votre présence dans les réponses IA : le paramètre ajouté par ChatGPT, lu dans votre outil d’analyse, Search Console pour Google et Bing Webmaster Tools pour Copilot. Aucune ne prédit ce qui se passera.
Côté ChatGPT, OpenAI ajoute automatiquement le paramètre utm_source=chatgpt.com aux liens qui mènent vers les sites. Si vous utilisez un outil d’analyse, filtrez sur cette source pour suivre les visites qui viennent de ChatGPT, avant et après votre modification. Attention : en Belgique comme en France, un outil d’analyse peut lui-même poser des cookies soumis à consentement, selon l’APD et la CNIL.
Côté Google, des rapports dédiés aux fonctions d’IA générative ont été lancés dans Search Console le 3 juin 2026, puis déployés pour tous les sites depuis le 31 août 2026. Ils montrent les impressions dans ces fonctions, les pages concernées, les pays, les appareils et l’évolution dans le temps. Selon Google, un site exclu de ces fonctions par le réglage de Search Console n’en reçoit plus d’impressions.
Côté Microsoft, le rapport AI Performance de Bing Webmaster Tools, en préversion publique depuis le 10 février 2026, montre combien de fois le contenu d’un site est cité comme source dans Microsoft Copilot, les résumés générés par IA de Bing et certaines intégrations partenaires, ainsi que les URL citées.
Pour relier une variation à une cause, tenez un journal simple : la date de chaque changement de robots.txt, les robots concernés, et la date d’un éventuel changement de réglage dans Search Console. Sans ce journal, une baisse observée plus tard est difficile à attribuer.
Microsoft écrit enfin qu’aucun outil ne peut garantir quand ni comment un contenu apparaîtra dans les résultats générés par IA. Google, de son côté, invite à se méfier des outils tiers qui promettent un succès de classement : selon lui, aucun outil tiers n’a accès à ses systèmes internes de classement ou d’IA.
Questions fréquentes
Bloquer GPTBot fait-il disparaître mon site de ChatGPT ?
Non. Selon OpenAI, GPTBot explore des contenus qui peuvent servir à l’entraînement de ses modèles, et l’exclure indique seulement que vos contenus ne doivent pas servir à cet entraînement. La présence dans la recherche de ChatGPT dépend d’OAI-SearchBot, dont le réglage est indépendant. Pour ne plus apparaître dans ces réponses, c’est OAI-SearchBot qu’il faut bloquer, et même dans ce cas le site peut encore apparaître sous forme de lien de navigation.
Bloquer Google-Extended retire-t-il mon site des aperçus IA de Google ?
Non. Selon Google, ce jeton sert à décider si le contenu peut entraîner les futurs modèles Gemini et ancrer les réponses de Gemini et Vertex AI ; il ne change rien à la présence du site dans Google Search. Pour sortir des aperçus IA, d’AI Mode et des fonctions d’IA générative de Discover, Google propose depuis le 31 août 2026, dans les paramètres de Search Console, le réglage « Search generative AI », où l’inclusion est le choix par défaut.
Combien de temps faut-il pour qu’un changement de robots.txt soit pris en compte par les robots d’IA ?
Cela dépend de l’éditeur. OpenAI indique qu’il faut compter environ 24 heures pour que ses systèmes de recherche s’ajustent après une modification de robots.txt. Perplexity indique jusqu’à 24 heures. Le réglage Search Console de Google prend en général quelques jours.
Mon hébergeur ou mon pare-feu peut-il bloquer les robots d’IA sans que je le sache ?
Oui, c’est possible. Un pare-feu applicatif, un CDN ou une règle de l’hébergeur peut refuser un robot que votre robots.txt autorise. Perplexity écrit qu’un pare-feu applicatif peut devoir autoriser explicitement ses robots, et Google conseille d’autoriser l’exploration aussi par le CDN ou l’hébergeur. Demandez à votre hébergeur quelles règles s’appliquent aux robots, et s’il utilise les plages d’adresses IP publiées par OpenAI pour reconnaître ses robots.
Peut-on bloquer les robots d’IA sur une partie du site seulement ?
Oui. Dans le bloc d’un robot, la ligne Disallow peut viser un dossier précis plutôt que tout le site, par exemple un répertoire de guides que vous ne voulez pas voir servir à l’entraînement. Deux limites restent. Le chemin listé devient public, puisque n’importe qui peut lire robots.txt. Et une page bloquée reste accessible à qui connaît son adresse : pour un contenu réellement privé, il faut une protection par identifiant.
Le fichier llms.txt remplace-t-il robots.txt pour les moteurs d’IA ?
Non, les deux fichiers n’ont pas le même rôle. robots.txt, normalisé par la RFC 9309, donne des consignes d’exploration aux robots. llms.txt est une proposition, pas une norme : un fichier en Markdown qui présente le site et renvoie vers des versions détaillées des pages pour les modèles de langage. Google écrit que Google Search ne l’utilise pas.
Faut-il un robots.txt sur chaque sous-domaine ?
Pour les robots d’Anthropic, oui : l’éditeur précise que le blocage de ses robots doit être posé sur chaque sous-domaine. Faites la liste de vos sous-domaines (boutique, blog, espace de réservation), puis vérifiez que chacun a son propre fichier, avec les mêmes règles ou des règles adaptées à son contenu. Cette consigne est écrite par Anthropic pour ses propres robots.
Sources
- OpenAI : Overview of OpenAI CrawlersÉtablit le rôle d’OAI-SearchBot, de GPTBot et de ChatGPT-User, leur indépendance et le délai d’environ 24 heures après une modification de robots.txt.
- Anthropic : Does Anthropic crawl data from the web, and how can site owners block the crawler?Décrit ClaudeBot, Claude-User et Claude-SearchBot, l’effet de leur blocage, le blocage par sous-domaine et les limites du blocage par IP (mise à jour du 7 avril 2026).
- Perplexity : Perplexity CrawlersÉtablit le rôle de PerplexityBot et de Perplexity-User, le délai de 24 heures au plus et le cas des pare-feu applicatifs.
- Google : Google’s common crawlers (Google-Extended)Établit que Google-Extended concerne Gemini et Vertex AI et n’a aucun effet sur l’inclusion dans Google Search.
- Aide Search Console : réglage Search generative AIDécrit le réglage d’inclusion dans les aperçus IA et AI Mode, disponible pour tous les sites depuis le 31 août 2026.
- RFC 9309 : Robots Exclusion ProtocolNorme IETF de septembre 2022 qui précise que robots.txt n’est pas une autorisation d’accès et fixe la durée maximale de cache.
Guide publié par l’atelier Pixel-iA (M&R Solutions SRL, Hannut), établi à partir des sources citées ci-dessus. Publié le 10 octobre 2026.
Comment écrire et vérifier votre robots.txt sans vous tromper ?
Le réglage tient en cinq étapes, et la plupart des échecs viennent de ce qui se trouve autour du fichier : sous-domaines, pare-feu, hébergeur. Avant de toucher à quoi que ce soit, gardez une copie du fichier actuel et notez la date.
robots.txt ne doit pas être confondu avec un autre fichier qui circule dans les conseils de GEO : le rôle du fichier llms.txt est différent, et Google Search écrit qu’il ne l’utilise pas.