Comment apparaître dans ChatGPT pour une entreprise : les conditions
Robots d’OpenAI, robots.txt, noindex, localisation, mesure des visites : ce qu’une PME peut régler pour être une source possible de ChatGPT, et ce qui ne dépend pas d’elle.
En bref. Pour qu’une entreprise puisse être citée par la recherche de ChatGPT, son site doit laisser passer OAI-SearchBot, le robot qu’OpenAI utilise pour ces résultats. Bloquer GPTBot, qui concerne l’entraînement des modèles, n’y change rien. Après une modification de robots.txt, comptez environ 24 heures. Écrivez ensuite en texte lisible ce que vos clients cherchent, et suivez les visites grâce au paramètre utm_source=chatgpt.com. Aucune citation par ChatGPT n’est garantie.
À retenir
- OAI-SearchBot est le robot d’OpenAI qui fait apparaître des sites dans la recherche de ChatGPT : s’il est exclu, le site n’apparaît pas dans les réponses de recherche.
- Les réglages de GPTBot (entraînement des modèles) et d’OAI-SearchBot sont indépendants : on peut refuser l’entraînement sans renoncer à la recherche.
- Pour écarter une page, OpenAI indique la balise meta noindex, que son robot doit pouvoir lire.
- ChatGPT ajoute utm_source=chatgpt.com aux liens vers les sites, ce qui permet de compter ces visites dans un outil d’analyse, dans le respect des règles de cookies du pays.
- Pixel-iA écrit dans sa FAQ que personne ne peut garantir honnêtement une citation par un moteur de réponse, et OpenAI reconnaît que ses citations peuvent être inexactes.
Qu’est-ce qui permet à un site d’apparaître dans la recherche de ChatGPT ?
Pour que votre site puisse servir de source à la recherche de ChatGPT, le robot OAI-SearchBot d’OpenAI doit pouvoir l’explorer. C’est la condition technique de départ : elle rend une citation possible, sans la rendre certaine.
ChatGPT peut chercher sur le web pour répondre avec des informations récentes et des liens vers ses sources. Cette recherche est ouverte aux comptes gratuits et aux visiteurs non connectés. Un client qui demande « quel fleuriste est ouvert le dimanche à Namur » peut donc recevoir une réponse accompagnée de liens, sans abonnement ni compte.
Pour trouver ces sources, OpenAI utilise un robot d’exploration, c’est-à-dire un programme qui parcourt les pages web pour les lire et les répertorier. Celui qui compte pour la recherche s’appelle OAI-SearchBot. Selon OpenAI, il sert à faire apparaître des sites dans les résultats de recherche de ChatGPT. Un site qui l’exclut n’apparaît pas dans les réponses de recherche de ChatGPT ; il peut encore apparaître sous forme de lien de navigation.
Il faut donc séparer deux niveaux. Le premier dépend de vous : votre site est-il lisible par ce robot, et vos pages contiennent-elles en texte les informations que vos clients cherchent (adresse, zone desservie, services, horaires) ? Le second ne dépend pas de vous : aucune citation n’est garantie, même quand le site est accessible au robot.
Commencez par le premier niveau. Si OAI-SearchBot est bloqué, aucun travail sur vos textes ne vous fera figurer dans la recherche de ChatGPT. S’il est autorisé, le contenu de vos pages devient le terrain sur lequel vous pouvez agir.
OAI-SearchBot, GPTBot, ChatGPT-User : à quoi sert chaque robot d’OpenAI ?
OpenAI distingue trois agents : OAI-SearchBot pour la recherche, GPTBot pour l’entraînement des modèles, ChatGPT-User pour les visites demandées par un utilisateur. Seul le premier conditionne votre présence quand ChatGPT cherche sur le web.
| Agent | Rôle selon OpenAI | Effet d’un blocage dans robots.txt | Décision pour une entreprise qui veut être citée |
|---|---|---|---|
| OAI-SearchBot | Faire apparaître des sites dans les résultats de recherche de ChatGPT | Le site disparaît des réponses que ChatGPT tire de sa recherche ; un lien de navigation reste possible | L’autoriser |
| GPTBot | Explorer des contenus qui peuvent servir à l’entraînement des modèles d’OpenAI | Indique que le contenu ne doit pas servir à cet entraînement | Choix libre, sans effet sur le réglage de la recherche |
| ChatGPT-User | Visiter des pages à la demande d’un utilisateur, sans exploration automatique | Les règles de robots.txt peuvent ne pas s’appliquer | Rien à régler pour la recherche : cet agent ne sert pas à décider si un contenu y apparaît |
OpenAI précise que les réglages d’OAI-SearchBot et de GPTBot sont indépendants. Vous pouvez donc refuser que vos textes servent à entraîner les modèles tout en laissant votre site accessible à la recherche. L’inverse est possible aussi. Cette décision sur l’entraînement relève du dirigeant : elle touche à l’usage de vos contenus, pas à votre présence dans les réponses.
Un blocage trop large peut aussi écarter ce robot. Vérifiez qu’aucune règle générale du fichier n’exclut OAI-SearchBot. Avant de bloquer un nom, demandez-vous à quoi il sert selon son éditeur.
Si vous voulez refuser l’entraînement sans toucher à la recherche, le fichier contiendra un bloc pour GPTBot avec Disallow: /, et aucun blocage visant OAI-SearchBot.
Pour éviter qu’une page apparaisse par son seul lien dans ChatGPT Atlas, OpenAI indique la balise noindex
Selon OpenAI, une page exclue d’OAI-SearchBot mais connue par un autre moyen (un lien depuis un autre site, par exemple) peut apparaître avec son seul lien et son titre dans ChatGPT Atlas. Pour l’éviter, OpenAI indique la balise meta noindex, une instruction placée dans le code de la page, sous la forme <meta name="robots" content="noindex">, qui demande de ne pas répertorier cette page.
Le piège tient dans la combinaison des deux. Si vous bloquez la page dans robots.txt et ajoutez noindex, le robot ne peut plus ouvrir la page, donc il ne voit jamais la balise. Pour une page à écarter, laissez-la accessible au robot et posez noindex.
Trois cas fréquents dans une PME
- Une page de promotion terminée reste en ligne parce que d’autres pages y renvoient. Si vous la gardez, ajoutez noindex ; si elle n’a plus d’utilité, supprimez-la pour qu’elle ne soit plus une source possible d’informations périmées.
- Une annonce de recrutement clôturée continue d’attirer des candidatures. Le noindex demande qu’elle ne soit plus répertoriée, et un bandeau « poste pourvu » informe ceux qui arrivent quand même.
- Un espace réservé à vos clients ou à vos partenaires ne doit pas apparaître du tout. Ni noindex ni robots.txt ne suffisent : il lui faut une connexion par mot de passe, puisque robots.txt n’est pas une mesure de sécurité.
Après chaque changement, ouvrez la page et affichez son code source (clic droit, « Afficher le code source ») pour vérifier que la balise noindex est bien présente dans la version en ligne.
Quelles pages écrire pour être une source utilisable par ChatGPT ?
Google et Microsoft recommandent, pour leurs propres moteurs, un contenu important en texte et des affirmations ancrées dans des faits mesurables ; les pistes ci-dessous indiquent chaque fois qui les recommande.
- Une page par vraie question de client. La méthode de référencement IA de Pixel-iA part d’un relevé des questions du métier et rédige une page par question, écrite dans les mots des clients. Vous pouvez faire ce relevé seul : notez pendant quelques semaines les questions reçues au comptoir, par téléphone et par courriel.
- Des informations essentielles en texte, visibles sans clic. Pour Copilot, Microsoft cite comme erreurs les réponses importantes cachées dans des onglets ou des menus dépliables, ainsi que les informations essentielles présentes seulement dans un PDF ou seulement dans une image. Ce conseil vise Copilot, mais il décrit un risque simple : un moteur qui ne lit pas l’image ne connaît pas vos horaires.
- Des faits mesurables. Microsoft conseille d’ancrer les affirmations dans des faits mesurables plutôt que dans des adjectifs vagues. « Intervention dans les communes de l’arrondissement, du lundi au samedi » renseigne ; « service rapide et de qualité » ne renseigne pas.
- Un code accessible. Selon OpenAI, l’agent de ChatGPT Atlas s’appuie sur les attributs ARIA, des indications ajoutées au code que lisent aussi les lecteurs d’écran, pour comprendre la structure et les éléments interactifs d’une page. OpenAI recommande de suivre les bonnes pratiques WAI-ARIA. Demandez à votre prestataire si vos boutons et formulaires sont correctement étiquetés.
Une limite s’impose, posée par Google pour son propre moteur : créer une page distincte pour chaque variante de requête principalement pour manipuler le classement ou les réponses génératives enfreint sa règle contre l’abus de contenu à grande échelle. Pour Google, cette règle vise la génération de nombreuses pages dans le but principal de manipuler le classement, quelle que soit la façon dont elles sont créées.
Commerce local : comment ChatGPT situe l’utilisateur et où il cherche
Pour une recherche locale, ChatGPT peut se fonder sur une localisation approximative et interroger d’autres fournisseurs de recherche. Votre ville, votre zone desservie et votre nom doivent donc être écrits clairement, et de la même façon, sur votre site et ailleurs.
OpenAI indique que ChatGPT peut utiliser une localisation approximative déduite de l’adresse IP pour les résultats locaux ; le partage de la position précise de l’appareil est facultatif et désactivé par défaut. Nommez sur la page la ville et les communes desservies au lieu d’un simple « près de chez vous » : c’est une précision pour le lecteur, sans effet garanti sur ChatGPT.
OpenAI précise aussi que ChatGPT fait parfois appel à d’autres fournisseurs de recherche : il réécrit la question en une ou plusieurs requêtes ciblées qu’il leur envoie. Votre présence ne se joue donc pas seulement sur votre site. Gardez la même adresse et le même nom sur toutes les fiches où figure votre entreprise, pour que toute source consultée décrive la même entreprise.
Pour le nom, la règle de la fiche d’établissement Google donne un bon étalon : il doit correspondre au nom réel de l’établissement, tel que les clients le connaissent et tel qu’il figure sur la devanture, le site web et les documents. Reprenez exactement ce nom partout, sans slogan ni mot clé ajouté. Côté Microsoft, Bing Places for Business est recommandé aux entreprises locales afin que l’adresse, les horaires et les coordonnées restent à jour et puissent figurer dans les réponses générées par IA de ses services.
Le cas d’un commerce de Hannut
Une quincaillerie installée à Hannut livre aussi dans les communes voisines. Sur sa page de contact, elle écrit son adresse complète en texte, puis la liste des communes livrées, chacune par son nom. Sur la page « Livraison », elle précise les jours de passage par commune. Elle vérifie que le nom, l’adresse et les horaires sont identiques sur son site, sa fiche Google et Bing Places. Si un utilisateur situé dans la région demande une quincaillerie qui livre, chaque source consultée décrit la même entreprise, au même endroit.
Comment mesurer les visites qui viennent de ChatGPT
ChatGPT ajoute automatiquement le paramètre utm_source=chatgpt.com aux liens qui mènent vers les sites. Il suffit de filtrer cette source dans votre outil d’analyse pour compter ces visites, à condition que l’outil respecte les règles de cookies de votre pays.
Un paramètre utm est une étiquette ajoutée à la fin d’une adresse web, qui indique à l’outil d’analyse d’où vient le visiteur. Quand quelqu’un clique sur un lien vers votre site depuis une réponse de ChatGPT, l’adresse porte la mention chatgpt.com comme source.
- Dans votre outil d’analyse, ouvrez le rapport des sources de trafic et filtrez sur la source « chatgpt.com ».
- Notez les pages d’arrivée de ces visiteurs : elles indiquent vers quelles pages ChatGPT a renvoyé des visiteurs.
- Comparez d’un mois à l’autre, en gardant la même période de référence, plutôt que de juger sur quelques jours.
- Rapprochez ces pages des questions de vos clients : une page de service qui ne reçoit jamais ce type de visite mérite d’être relue (informations en texte, faits précis).
Les règles de cookies selon le pays
En Belgique, l’Autorité de protection des données (APD) considère qu’un cookie à finalité analytique ne remplit en principe pas les conditions pour échapper au consentement : il sert à fournir des statistiques à l’éditeur, pas un service demandé par l’utilisateur. En principe, votre bandeau doit donc recueillir l’accord du visiteur avant de déposer ce cookie.
En France, la CNIL admet que des cookies de mesure d’audience peuvent être exemptés de consentement s’ils servent uniquement à mesurer l’audience du site pour le compte exclusif de l’éditeur et à produire des statistiques anonymes, sans recoupement avec d’autres traitements, sans transmission de données non anonymes à des tiers et sans suivi de la navigation sur d’autres sites. Vérifiez auprès de votre fournisseur d’outil si sa configuration répond à ces conditions.
Vos chiffres resteront partiels. Un visiteur qui refuse les cookies n’est pas compté par un outil soumis au consentement, et celui qui lit votre nom dans une réponse puis tape lui-même votre adresse arrive sans l’étiquette chatgpt.com.
Ce qu’aucune entreprise ne contrôle dans les réponses de ChatGPT
Vous réglez l’accès des robots et le contenu de vos pages. Le choix des sources citées, la formulation de la réponse et son exactitude restent du côté de ChatGPT.
OpenAI écrit lui-même que les résultats et citations de recherche peuvent être incomplets, périmés ou inexacts, et conseille d’ouvrir la source citée pour vérifier. Si ChatGPT attribue à votre commerce des horaires dépassés, corrigez d’abord la source : votre site, puis les fiches où ces horaires figurent.
Les visites de ChatGPT-User, faites à la demande d’un utilisateur, échappent aussi en partie à vos réglages : comme vu dans le tableau des robots, les règles de robots.txt peuvent ne pas s’y appliquer. Une page publique peut donc être lue à la demande d’un utilisateur même si vous avez tenté de l’écarter par ce fichier.
Aucune présence n’est garantie. Interrogé sur ce point dans la FAQ de son site, Pixel-iA répond : « Non, et personne ne peut le faire honnêtement. » Pour son propre moteur, Google invite aussi à se méfier des outils tiers qui promettent un succès de classement ou prétendent utiliser ses métriques internes.
Questions à poser à un prestataire qui promet une place dans ChatGPT
- Sur quelle documentation d’OpenAI vous appuyez-vous, et pouvez-vous me montrer la page ?
- Que vérifiez-vous dans mon robots.txt pour OAI-SearchBot et GPTBot, et pourquoi ?
- Comment mesurerez-vous les visites venues de ChatGPT, et avec quel outil conforme aux règles de cookies de mon pays ?
- Que se passe-t-il si mon entreprise n’est pas citée après votre travail : qu’est-ce qui est écrit dans le contrat ?
- Allez-vous créer de nombreuses pages quasi identiques, une par commune ou par variante de recherche ?
Une réponse qui promet une position, un délai de citation ou un résultat chiffré doit vous alerter.
Check-list : les vérifications à faire cette semaine
Ces vérifications se font seul ou avec votre hébergeur. Commencez par les trois premières, qui portent sur l’accès des robots.
- J’ai ouvert mon robots.txt et aucune règle n’exclut OAI-SearchBot, ni directement ni par un blocage général.
- J’ai décidé, en connaissance de cause, d’autoriser ou de bloquer GPTBot pour l’entraînement des modèles.
- Mon hébergeur m’a confirmé qu’aucun pare-feu ni filtrage d’adresses ne rejette les robots d’OpenAI.
- Les pages à écarter (offre terminée, annonce clôturée) portent noindex et restent lisibles par le robot ; les espaces privés sont protégés par mot de passe.
- Mon adresse, ma zone desservie, mes horaires et mes services figurent en texte sur des pages accessibles, pas seulement dans une image ou un PDF.
- Le nom de l’entreprise est identique sur le site, la fiche Google et Bing Places.
- Les questions fréquentes de mes clients ont chacune une page ou un passage qui y répond avec des faits précis.
- Un filtre sur la source chatgpt.com est en place dans mon outil d’analyse, et mon bandeau de cookies suit la règle de mon pays (APD en Belgique, CNIL en France).
- J’ai posé à ChatGPT, avec la recherche web, cinq questions que mes clients posent réellement, et j’ai ouvert chaque source citée.
Notez les réponses obtenues au dernier point, avec la date, et refaites le même test dans quelques semaines avec les mêmes questions : vous aurez une base de comparaison. Pour un indépendant qui préfère confier ce travail, le relevé Lite pour indépendants part de ce même principe : relever mot pour mot ce que répondent les moteurs aux questions du métier et de la zone.
Questions fréquentes
Bloquer GPTBot empêche-t-il mon entreprise d’apparaître dans ChatGPT ?
Non. Selon OpenAI, GPTBot explore des contenus qui peuvent servir à l’entraînement de ses modèles, et l’exclure indique seulement que votre contenu ne doit pas servir à cet entraînement. La présence dans les résultats que ChatGPT tire du web dépend d’un autre robot, OAI-SearchBot. OpenAI précise que les réglages des deux sont indépendants : vous pouvez bloquer GPTBot et laisser OAI-SearchBot explorer votre site.
Combien de temps après avoir débloqué OAI-SearchBot les choses changent-elles ?
OpenAI indique qu’après une modification de robots.txt, il faut compter environ 24 heures pour que ses systèmes de recherche s’ajustent. Ce délai concerne la prise en compte du fichier, pas une apparition dans les réponses : une fois le robot autorisé, rien ne garantit que ChatGPT citera votre site sur une question donnée. Revérifiez le fichier en ligne après ce délai pour confirmer que la correction est bien publiée.
Un fichier llms.txt aide-t-il à apparaître dans ChatGPT ?
llms.txt est une proposition, non une norme, publiée le 3 septembre 2024 par Jeremy Howard : un fichier en Markdown placé à la racine du site pour donner des informations de contexte aux agents et aux modèles de langage. Dans son guide sur les fonctions d’IA générative, Google écrit, dans une note ajoutée le 15 juin 2026, que Google Search n’utilise pas llms.txt. Pour la recherche de ChatGPT, OpenAI indique qu’OAI-SearchBot est le robot qui sert à ses résultats ; un site qui l’exclut n’apparaît pas dans les réponses de recherche.
Le réglage « Search generative AI » de Search Console concerne-t-il ChatGPT ?
Ce réglage, proposé par Google à tous les sites depuis le 31 août 2026, porte sur les fonctions d’IA générative de la recherche Google : aperçus IA, AI Mode et fonctions d’IA générative de Discover. Vérifiez donc séparément les deux points : le réglage dans Search Console pour Google, et votre fichier robots.txt pour OAI-SearchBot.
Comment savoir si ChatGPT cite déjà mon entreprise ?
Posez à ChatGPT, avec la recherche web, les questions que vos clients posent réellement, en précisant votre ville ou votre métier, et ouvrez chaque source citée. Notez les réponses avec leur date pour pouvoir comparer plus tard. En parallèle, filtrez la source chatgpt.com dans votre outil d’analyse : ChatGPT ajoute ce paramètre aux liens vers les sites, ce qui montre quelles pages reçoivent des visiteurs depuis ses réponses.
Mon hébergeur peut-il bloquer les robots d’OpenAI sans que je le sache ?
Un blocage peut se trouver ailleurs que dans robots.txt, par exemple dans un pare-feu ou un filtrage par adresses. OpenAI publie les plages d’adresses IP de ses robots : demandez à votre hébergeur de vérifier qu’elles ne sont pas rejetées. Pour ses propres robots, Perplexity signale d’ailleurs qu’un pare-feu applicatif peut devoir les autoriser explicitement. Une question écrite à l’hébergeur suffit à lever le doute.
ChatGPT connaît-il la position exacte de mes clients pour recommander un commerce proche ?
En général, non. OpenAI indique que ChatGPT peut utiliser une localisation approximative déduite de l’adresse IP pour les résultats locaux, et que le partage de la position précise de l’appareil est facultatif et désactivé par défaut. Pour être rattaché à la bonne zone, écrivez en texte sur votre site votre ville, votre adresse et les communes que vous desservez, chacune par son nom.
Sources
- OpenAI — Overview of OpenAI crawlersÉtablit le rôle d’OAI-SearchBot, GPTBot et ChatGPT-User, l’indépendance de leurs réglages, le délai d’environ 24 heures et la publication des plages d’IP.
- OpenAI — Publishers and developers FAQÉtablit le recours à noindex pour ChatGPT Atlas, le paramètre utm_source=chatgpt.com et l’usage des attributs ARIA.
- OpenAI — Searching the web with ChatGPTÉtablit la localisation approximative, le recours à d’autres fournisseurs de recherche et l’avertissement sur les citations inexactes.
- RFC 9309 — Robots Exclusion ProtocolNorme de robots.txt ; rappelle que ses règles ne sont pas une mesure de sécurité.
- Autorité de protection des données — CookiesRègle belge sur le consentement aux cookies analytiques.
- CNIL — Cookies : solutions pour les outils de mesure d’audienceConditions françaises d’exemption de consentement pour la mesure d’audience.
Guide publié par l’atelier Pixel-iA (M&R Solutions SRL, Hannut), établi à partir des sources citées ci-dessus. Publié le 4 octobre 2026.
Comment vérifier et corriger votre robots.txt pour ChatGPT
Ouvrez l’adresse de votre site suivie de /robots.txt et cherchez toute règle qui exclut OAI-SearchBot ou tous les robots. Si vous en trouvez une, faites-la corriger par la personne qui gère l’hébergement, puis revérifiez après environ 24 heures.
Le fichier robots.txt est un fichier texte placé à la racine du site, qui indique aux robots les parties qu’ils peuvent explorer. Son protocole est normalisé par la RFC 9309 de l’IETF, publiée en septembre 2022.
Prenons un commerce qui découvre un lundi que son robots.txt contient User-agent: * et Disallow: /, hérité d’une version de test du site. Le prestataire retire la ligne le jour même. Inutile de questionner ChatGPT dans l’heure : le délai d’OpenAI indiqué plus haut s’applique, et même ensuite, l’autorisation ne garantit aucune citation.
Ne vous servez pas de ce fichier pour cacher quoi que ce soit. La RFC précise que ses règles ne sont pas une forme d’autorisation d’accès et ne remplacent pas de vraies mesures de sécurité ; lister des chemins dans robots.txt les expose publiquement. Un répertoire d’administration ou de documents clients se protège par un mot de passe, pas par une ligne Disallow.