Aller au contenu
Pixel-iA
  1. Accueil
  2. Blog
  3. llms.txt : faut-il en créer un pour le site de votre PME

llms.txt : faut-il en créer un pour le site de votre PME

Le fichier llms.txt est une proposition, pas une norme. Google Search ne l’utilise pas. Voici dans quels cas une PME a intérêt à le créer, et les vérifications à faire d’abord.

En bref. llms.txt est une proposition, non une norme, publiée par Jeremy Howard le 3 septembre 2024 ; sa version 2 a été modifiée le 10 août 2026. Google écrit que Google Search ne l’utilise pas : le fichier ne nuit pas à la visibilité dans Google Search et ne l’aide pas. Pour ses fonctions d’IA générative, Google demande une page indexée et affichable avec un extrait, Googlebot non bloqué, et un site inclus dans ces fonctions dans Search Console (réglage par défaut).

À retenir

  • llms.txt est une proposition publiée le 3 septembre 2024 par Jeremy Howard, modifiée en version 2 le 10 août 2026, et non une norme comme robots.txt.
  • Google écrit, dans une note ajoutée le 15 juin 2026 à son guide, que Google Search n’utilise pas llms.txt et que le fichier ne nuit pas et n’aide pas sa visibilité.
  • Au 30 septembre 2026, les pages consultées d’OpenAI, d’Anthropic et de Perplexity décrivent leurs robots, et celle de Microsoft une structure de page.
  • Un llms.txt ne compense pas une information absente des pages : Google exige des pages indexées et conseille de proposer le contenu important sous forme de texte.
  • Avant de créer le fichier, vérifiez robots.txt, le pare-feu, le réglage de Search Console et vos fiches d’établissement.

Qu’est-ce que le fichier llms.txt, et qui l’a proposé ?

llms.txt est une proposition de Jeremy Howard, publiée le 3 septembre 2024 sur llmstxt.org, dont la version 2 a été modifiée le 10 août 2026. Elle consiste à placer à la racine d’un site (ou sous un chemin) un fichier /llms.txt écrit en Markdown, un format de texte brut où quelques signes simples (dièse, tiret, crochets) marquent les titres, les listes et les liens.

Ce fichier donne des informations de contexte sur le site et des liens vers des versions Markdown détaillées de ses pages. L’objectif affiché par la proposition est d’aider les agents et les modèles de langage à utiliser le site. Un modèle de langage est le programme qui rédige les réponses de ChatGPT, de Claude ou de Gemini ; un agent est un programme qui agit sur des sites pour le compte d’un utilisateur.

Le second volet, souvent oublié

La proposition ne se limite pas au fichier racine. Elle suggère aussi de publier une version Markdown propre de chaque page utile, à la même adresse, suffixée par .md ou avec l’extension remplacée par .md. Une page /horaires.html aurait ainsi une jumelle /horaires.md ou /horaires.html.md. Pour une PME, c’est ce volet qui pèse le plus : chaque page utile reçoit une copie qu’il faut tenir en parallèle de l’originale.

Une proposition, sans valeur de norme

Il faut distinguer llms.txt de robots.txt. Le protocole d’exclusion des robots (robots.txt) est normalisé par la RFC 9309 de l’IETF, publiée en septembre 2022. llms.txt reste une proposition, non une norme.

Pour une petite entreprise, un fichier conforme à l’esprit de la proposition pourrait se composer ainsi :

  1. Une ligne de titre précédée d’un dièse, avec le nom de l’entreprise tel qu’il figure sur la devanture et sur le site.
  2. Un résumé de quelques lignes : le métier, la zone servie, ce que l’entreprise ne fait pas.
  3. Une liste de liens vers les pages clés (prestations, zone, contact, questions fréquentes), chacun suivi d’une phrase qui dit ce que la page contient.

Rien dans ce fichier n’est nouveau pour le visiteur : il réorganise ce que le site publie déjà.

Google Search n’utilise pas llms.txt : ce que son guide écrit depuis juin 2026

Google Search n’utilise pas llms.txt. Son guide « Optimizing your website for generative AI features on Google Search », publié le 15 mai 2026, le précise dans une note ajoutée le 15 juin 2026 : les fichiers llms.txt et autres balisages « spéciaux » ne sont pas utilisés par Google Search ; les créer ne nuit pas et n’aide pas la visibilité dans Google Search, et reste permis pour d’autres services qui les lisent.

Cette note se trouve dans la rubrique « Mythbusting generative AI search: what you don’t need to do » (ce que vous n’avez pas besoin de faire), qui répond aux idées reçues circulant sous les noms AEO et GEO, deux sigles pour l’optimisation destinée aux moteurs de réponse. Google y écrit que beaucoup d’« astuces » suggérées ne sont ni efficaces ni prises en compte par Google Search.

Une autre page de Google, « AI features and your website » (dernière mise à jour le 10 décembre 2025), va dans le même sens pour les aperçus IA (AI Overviews) et AI Mode : aucun nouveau fichier lisible par machine, aucun fichier texte pour l’IA et aucun balisage particulier n’est nécessaire pour apparaître dans ces fonctions.

Ce que cette position couvre, et ce qu’elle ne couvre pas

Ce que Google écrit vaut pour Google Search, aperçus IA et AI Mode compris. Cela ne dit rien de la façon dont ChatGPT, Claude, Perplexity ou Copilot traitent le fichier. Ces règles évoluent : la note date de juin 2026, et Google peut modifier son guide.

  • Si votre clientèle vous trouve surtout par Google, le fichier n’apporte rien de documenté pour ce canal.
  • Si un llms.txt existe déjà sur votre site, Google ne donne aucune raison de le retirer, puisqu’il écrit que le fichier ne nuit pas.
  • Si un prestataire présente llms.txt comme un moyen de mieux paraître dans Google, demandez-lui comment il concilie cette promesse avec la documentation de Google.

ChatGPT, Claude, Perplexity, Copilot : ce que décrivent leurs pages d’aide

Les pages d’aide consultées le 30 septembre 2026 d’OpenAI, d’Anthropic et de Perplexity décrivent leurs robots et la façon de les régler dans robots.txt ; celles de Microsoft décrivent une structure de page.

Éditeur et serviceCe que la page consultée décritRéglage ou action vérifiable pour une PME
OpenAI (ChatGPT)OAI-SearchBot sert à faire apparaître des sites dans les résultats de recherche de ChatGPT ; un site qui l’exclut n’apparaît pas dans les réponses de recherche, mais peut encore apparaître sous forme de lien de navigation. GPTBot concerne l’entraînement des modèles ; les deux réglages sont indépendants.Autoriser OAI-SearchBot dans robots.txt ; décider séparément pour GPTBot.
Anthropic (Claude)Trois robots : ClaudeBot (entraînement), Claude-User (visites à la demande d’un utilisateur), Claude-SearchBot (résultats de recherche). Selon Anthropic, désactiver Claude-User ou Claude-SearchBot peut réduire la visibilité d’un site dans les réponses de recherche de Claude.Ne pas bloquer Claude-SearchBot ni Claude-User si vous voulez figurer dans ces réponses.
PerplexityPerplexityBot sert à faire apparaître des sites dans les résultats de Perplexity et n’est pas utilisé pour entraîner des modèles de fondation. Perplexity-User, déclenché par un utilisateur, ignore en général robots.txt.Autoriser PerplexityBot dans robots.txt et dans le pare-feu.
Microsoft (Copilot, Bing)Microsoft recommande des intertitres H2 et H3 précis, des paires question-réponse, des listes et des tableaux, et un balisage schema.org en JSON-LD (un format de données structurées inséré dans la page).Structurer chaque page clé ainsi, sur la page elle-même.

Pour le détail de leurs positions, l’article sur ce que disent Google, Bing et OpenAI les reprend éditeur par éditeur.

Si quelqu’un vous affirme que llms.txt améliore votre place dans ChatGPT ou Perplexity, demandez-lui la page de l’éditeur qui l’écrit. Sans cette page, l’affirmation n’est pas établie.

Pourquoi un llms.txt ne remplace pas des pages lisibles

Un llms.txt peut résumer un site ; il ne compense pas une information absente des pages ou difficile à lire. Les conditions que Google écrit portent sur les pages elles-mêmes.

Chez Google, la condition est écrite : pour figurer dans les fonctions d’IA générative, une page doit être indexée et pouvoir s’afficher dans Google Search avec un extrait, et le site doit être inclus dans ces fonctions dans Search Console (réglage par défaut) ; l’indexation et l’affichage ne sont jamais garantis. Le billet de Google du 21 mai 2025 rappelle les conditions techniques : Googlebot non bloqué, page qui renvoie un code HTTP 200 (la réponse « page trouvée » du serveur), contenu indexable. La page « AI features and your website » ajoute de proposer le contenu important sous forme de texte.

Chez Microsoft, le raisonnement passe par l’ancrage (grounding), que Microsoft définit comme le système qui relie une IA à des informations actuelles et faisant autorité. Dans un billet du 6 mai 2026, Microsoft écrit que l’unité de valeur passe de la page à l’information « ancrable » : des faits distincts, étayés, dont la provenance est claire.

Les erreurs que Microsoft cite

Le guide Microsoft Advertising du 8 octobre 2025 nomme les défauts qui gênent la reprise d’un contenu dans les réponses : longs murs de texte, réponses importantes cachées dans des onglets ou des menus dépliables (les systèmes d’IA peuvent ne pas afficher un contenu masqué), informations essentielles seulement dans un PDF ou seulement dans une image.

Prenons une boulangerie dont les horaires d’été figurent seulement sur une affiche scannée en image, et dont la liste des produits sans gluten est dans un PDF. Recopier ces informations dans un llms.txt ne règle rien pour Google Search, qui écrit ne pas utiliser le fichier. La correction utile tient en deux gestes :

  1. Écrire les horaires en texte sur la page d’accueil et la page de contact.
  2. Transformer le PDF en une page lisible, avec un intertitre par catégorie de produits.

Une fois ces pages en place, un llms.txt éventuel n’a plus qu’à pointer vers elles.

Ce que coûte l’entretien d’un llms.txt, en temps et en risques

Un llms.txt coûte surtout en suivi. Un fichier qui n’est pas mis à jour à chaque changement du site finit par contredire les pages.

Microsoft, dans son billet du 6 mai 2026, cite comme critères d’ancrage la fidélité factuelle, la qualité de l’attribution des sources, la fraîcheur (un fait périmé produit une réponse fausse) et la détection des contradictions entre sources. Un llms.txt oublié peut contredire votre page.

La charge se répartit ainsi :

  • Un changement d’horaires, de prestations, de zone servie ou de coordonnées se reporte sur la page, dans sa version .md si elle existe, et dans le résumé du fichier racine.
  • Ces mêmes informations figurent souvent déjà ailleurs, sur la fiche d’établissement Google ou sur Bing Places : chaque copie supplémentaire est un endroit de plus où une erreur peut rester.
  • Une page supprimée ou renommée laisse un lien mort dans le fichier si personne ne le corrige.
  • La tentation existe d’écrire dans le fichier des formules qui ne sont pas sur le site (promesses, comparaisons) ; elles créent un décalage entre ce que lit un programme et ce que lit un client.

Qui s’en charge

Désignez une personne, la même que celle qui modifie le site, et ajoutez une ligne à sa procédure : « mettre à jour llms.txt et les fichiers .md le jour même ». Si personne ne peut tenir cette ligne, ne créez pas le fichier.

Générer le fichier une fois, au lancement du site, puis l’oublier expose à un décalage : quelques modifications plus tard, il annonce un service arrêté ou d’anciens horaires. Relisez-le après chaque modification importante du site.

Dans quels cas le fichier vaut son entretien pour une PME

Pour la plupart des sites vitrines de PME, le fichier n’est pas une priorité : son effet n’est documenté par aucun moteur consulté, et d’autres réglages le sont. Il devient envisageable pour un site riche en documentation, à condition d’être produit à partir des pages.

Situation du siteDécision conseilléeCe qui passe avant
Site vitrine de quelques pages bien écritesPas prioritaire : gain non documenté, entretien réel.Une page claire par question fréquente, robots autorisés, fiche d’établissement à jour.
Site avec beaucoup de documentation, de notices ou de fiches techniquesEnvisageable pour les services qui lisent le fichier, s’il est généré automatiquement à partir des pages.Des pages HTML lisibles, avec intertitres précis, pour chaque document important.
Site construit avec un framework JavaScriptAttendre : vérifier d’abord le rendu des pages.Vérifier le HTML reçu par Googlebot avec l’outil d’inspection d’URL de Search Console.
Clients qui passent par des agents d’IA pour réserver ou commanderLe fichier n’est pas ce que Google et OpenAI décrivent pour ces agents.Structure de page propre et attributs d’accessibilité corrects.
Fichier déjà en ligneLe garder s’il est tenu à jour, sinon le retirer.Comparer son contenu, ligne par ligne, avec le site actuel.
Site en préparationDécider après la mise en ligne des pages.Les pages elles-mêmes.

Sur le JavaScript, Google écrit qu’il peut traiter le contenu en JavaScript s’il n’est pas bloqué, mais que le SEO d’un site construit avec un framework JavaScript est en général plus complexe. Si vous préparez un site, vous pouvez demander un site codé sur mesure en HTML, CSS et JavaScript, sans gabarit de type WordPress, Wix ou Webflow.

Sur les agents, le guide de Google du 15 mai 2026 évoque des agents qui analysent des captures d’écran, la structure DOM (l’arborescence de la page telle que le navigateur la construit) et l’arbre d’accessibilité. OpenAI écrit que l’agent de ChatGPT Atlas s’appuie sur les attributs ARIA, ceux qu’utilisent les lecteurs d’écran pour connaître le rôle d’un bouton ou d’un champ, et recommande de suivre les bonnes pratiques WAI-ARIA. Des attributs ARIA corrects servent à l’agent de ChatGPT Atlas comme aux lecteurs d’écran.

Les vérifications qui passent avant un llms.txt

Avant tout fichier optionnel, assurez-vous que les robots documentés peuvent lire votre site et que vos fiches d’établissement sont exactes. Ces réglages sont décrits par les éditeurs eux-mêmes, avec leurs délais.

  1. robots.txt. Si vous voulez figurer dans leurs réponses, n’interdisez pas OAI-SearchBot (ChatGPT), Claude-SearchBot et Claude-User (Claude), PerplexityBot (Perplexity). Les robots d’entraînement (GPTBot, ClaudeBot) relèvent d’un choix séparé.
  2. Sous-domaines. Anthropic précise que le blocage se pose sur chaque sous-domaine, et que bloquer des adresses IP peut ne pas fonctionner, car cela empêche la lecture de robots.txt. Vérifiez le fichier de chaque sous-domaine (boutique, réservation).
  3. Pare-feu et hébergeur. Perplexity indique qu’un pare-feu applicatif (WAF, un filtre placé devant le site) peut devoir autoriser explicitement ses robots. Google conseille d’autoriser l’exploration dans robots.txt et par le CDN ou l’hébergeur. Posez la question à votre hébergeur : quels robots sont filtrés aujourd’hui ?
  4. Search Console. Depuis le 31 août 2026, le réglage « Search generative AI » (menu Paramètres) décide si le site est inclus dans les aperçus IA, AI Mode et les fonctions d’IA générative de Discover. L’inclusion est le réglage par défaut ; vérifiez que personne ne l’a changé. L’outil d’inspection d’URL montre le HTML que Googlebot a reçu.
  5. Fiches locales. Pour les commerces locaux, Google cite les fiches d’établissement Google comme moyen d’être visible dans les réponses IA ; Microsoft recommande Bing Places for Business afin que l’adresse, les horaires et les coordonnées restent à jour.

Un cas daté

Un garage découvre un lundi que son robots.txt interdit OAI-SearchBot et PerplexityBot, et que le réglage de Search Console a été passé en exclusion. Il corrige les trois le jour même. OpenAI indique qu’il faut compter environ 24 heures pour que ses systèmes de recherche s’ajustent après une modification de robots.txt. Perplexity indique qu’une modification des réglages peut prendre jusqu’à 24 heures. Pour Search Console, Google écrit qu’un changement de réglage prend en général quelques jours avant de s’appliquer. Ces délais portent sur la prise en compte du réglage, pas sur l’apparition dans une réponse.

Si vous le créez : les étapes pour un fichier propre

Un llms.txt propre se construit à partir des pages publiques existantes et se met à jour avec elles. Il ne contient rien qu’un visiteur ne puisse lire sur le site.

  1. Listez les pages publiques utiles : accueil, prestations, zone servie, contact, questions fréquentes. Laissez de côté les pages de mentions légales et les pages vides.
  2. Écrivez le titre avec le nom de l’entreprise exactement comme sur le site et sur la fiche d’établissement.
  3. Rédigez le résumé avec des phrases reprises des pages validées : métier, zone, ce que vous ne faites pas. N’ajoutez ni adjectif ni promesse absents du site.
  4. Ajoutez un lien par page clé, suivi d’une phrase factuelle sur son contenu. Si vous publiez les versions .md, produisez-les à partir des pages, pas à la main.
  5. Publiez le fichier à la racine, puis ouvrez votre-domaine/llms.txt dans un navigateur pour vérifier qu’il s’affiche et que chaque lien fonctionne.
  6. Inscrivez la mise à jour du fichier dans la procédure de modification du site : même jour, même personne.

Un fichier racine est public : n’y placez ni tarif réservé, ni information interne, ni conditions que vous ne publiez pas ailleurs.

Sa place dans une démarche plus large

Dans la méthode de référencement IA de Pixel-iA, le fichier de présentation pour les modèles de langage figure dans une liste qui commence par le relevé des questions du métier et de ce que les moteurs y répondent, puis une page par question écrite dans les mots des clients, puis les données structurées de l’entreprise. Il vient ensuite, avec l’autorisation des robots des moteurs de réponse et un second relevé après la mise en ligne.

Si vous faites le travail seul, gardez cet ordre : les pages d’abord, le fichier ensuite.

Comment vérifier si le fichier sert à quelque chose

Vous pouvez constater qui demande le fichier ; les rapports des moteurs décrits dans leur documentation ne mentionnent pas llms.txt. Le suivi honnête consiste à observer les visites des robots, puis à décider de garder, simplifier ou retirer le fichier.

Ce que vous pouvez observer

Les journaux de votre serveur (le registre de chaque requête reçue ; demandez à votre hébergeur comment y accéder) indiquent quels agents demandent /llms.txt et les fichiers .md. Si personne ne les demande pendant plusieurs mois, vous entretenez un fichier qui n’est pas lu.

ChatGPT ajoute automatiquement le paramètre utm_source=chatgpt.com aux liens qui mènent vers les sites, ce qui permet de mesurer ce trafic dans un outil d’analyse. Côté Google, des rapports dédiés aux fonctions d’IA générative existent dans Search Console depuis le 3 juin 2026, déployés pour tous les sites depuis le 31 août 2026 : ils montrent les impressions, les pages concernées, les pays, les appareils et l’évolution dans le temps. Côté Microsoft, le rapport AI Performance de Bing Webmaster Tools, en préversion publique depuis le 10 février 2026, montre combien de fois le contenu d’un site est cité comme source dans Microsoft Copilot, les résumés générés par IA de Bing et certaines intégrations partenaires, quelles URL sont citées et avec quelles requêtes d’ancrage ; la fonction Citation Share s’y est ajoutée le 16 juin 2026.

Ce que ces outils ne disent pas

Ces rapports comptent des impressions ou des citations par page ; leur description ne mentionne pas llms.txt. Une hausse du trafic venant de ChatGPT après la création du fichier peut tenir à bien d’autres changements. Microsoft écrit qu’aucun outil ne peut garantir quand ni comment un contenu apparaîtra dans les résultats générés par IA, et OpenAI que les citations de recherche peuvent être incomplètes, périmées ou inexactes.

Une méthode plus directe consiste à poser vous-même aux moteurs les questions de vos clients et à noter les réponses telles quelles. Pour un indépendant, le relevé Pixel-iA Lite note mot pour mot ce que répondent les moteurs aux questions de son métier et de sa zone, puis un second relevé est remis quelques semaines plus tard, à titre de suivi. Si les réponses ne bougent pas et que les journaux montrent peu de visites du fichier, retirez-le ou réduisez-le à quelques liens.

Questions fréquentes

Un fichier llms.txt peut-il nuire à mon référencement Google ?

Non, selon Google. Dans son guide sur les fonctions d’IA générative, une note ajoutée le 15 juin 2026 indique que Google Search n’utilise pas les fichiers llms.txt, que les créer ne nuit pas et n’aide pas la visibilité dans Google Search, et que cela reste permis pour d’autres services qui les lisent. Le risque se situe ailleurs : un fichier non mis à jour peut contredire votre site auprès des services qui le lisent.

Est-ce que ChatGPT lit le fichier llms.txt de mon site ?

Les pages d’OpenAI consultées le 30 septembre 2026 ne le disent pas. Elles décrivent OAI-SearchBot, qui sert à faire apparaître des sites dans la recherche de ChatGPT, GPTBot pour l’entraînement, et ChatGPT-User, qui visite des pages à la demande d’un utilisateur. Le réglage documenté pour figurer dans les réponses de recherche de ChatGPT est donc d’autoriser OAI-SearchBot dans robots.txt, pas de publier un llms.txt.

Quelle différence entre llms.txt et robots.txt ?

robots.txt est normalisé par la RFC 9309 de l’IETF, publiée en septembre 2022 : il indique aux robots ce qu’ils peuvent explorer, et OpenAI, Anthropic et Perplexity documentent son usage pour leurs robots. llms.txt est une proposition de Jeremy Howard, sans valeur de norme : un fichier Markdown qui résume le site et renvoie vers des versions Markdown des pages. robots.txt ne remplace pas une vraie mesure de sécurité : les chemins qu’il liste deviennent publics.

Mon prestataire me facture un llms.txt : est-ce justifié ?

Demandez-lui trois choses : quel service lit le fichier selon sa documentation, qui le met à jour à chaque modification du site, et ce qu’il promet en échange. Google écrit que Google Search n’utilise pas llms.txt, et invite à se méfier des outils tiers qui promettent un succès de classement. Une prestation honnête présente le fichier comme un complément optionnel, jamais comme une garantie d’apparaître dans une réponse.

Peut-on générer un llms.txt automatiquement avec WordPress ou un outil en ligne ?

Un fichier produit automatiquement à partir des pages réduit la charge d’entretien, à condition d’être régénéré à chaque publication. Un fichier généré une seule fois par un outil en ligne vieillit dès la première modification du site. Dans les deux cas, ouvrez le résultat, vérifiez que le nom, la zone et les prestations correspondent aux pages, et supprimez toute phrase qui n’y figure pas.

Faut-il mettre des informations confidentielles ou des tarifs dans llms.txt ?

Non. Le fichier est placé à la racine du site et peut être ouvert par n’importe qui dans un navigateur. N’y placez que ce que vos pages publiques affichent déjà. Si vous ne publiez pas vos tarifs sur le site, ne les écrivez pas dans le fichier ; si vous les publiez, renvoyez vers la page qui les contient, ce qui évite d’avoir deux versions à tenir à jour.

llms.txt remplace-t-il les données structurées schema.org ?

Non, ce sont deux choses différentes. Google écrit que les données structurées ne sont pas requises pour la recherche générative, mais conseille de continuer à les utiliser pour l’éligibilité aux résultats enrichis, et demande qu’elles correspondent au texte visible. Microsoft recommande un balisage schema.org en JSON-LD. Pour une entreprise, le balisage Organization se place de préférence sur la page d’accueil.

Sources

  1. llms.txt, proposition de Jeremy HowardÉtablit le contenu de la proposition, son statut, sa date de publication (3 septembre 2024) et la version 2 (10 août 2026).
  2. Google Search Central, Optimizing your website for generative AI features on Google SearchÉtablit que Google Search n’utilise pas llms.txt et que le fichier ne nuit ni n’aide sa visibilité dans Google Search.
  3. Google Search Central, AI features and your websiteÉtablit qu’aucun fichier texte pour l’IA n’est nécessaire pour apparaître dans les aperçus IA et AI Mode.
  4. OpenAI, Overview of OpenAI crawlersDécrit OAI-SearchBot, GPTBot et ChatGPT-User, et le délai d’environ 24 heures après une modification de robots.txt.
  5. Anthropic, Does Anthropic crawl data from the webDécrit les trois robots d’Anthropic et l’effet de leur blocage sur la visibilité dans Claude.
  6. Microsoft Advertising, Optimizing your content for inclusion in AI search answersDécrit la structure de page recommandée pour Copilot et les erreurs à éviter (contenu masqué, PDF, images).

Guide publié par l’atelier Pixel-iA (M&R Solutions SRL, Hannut), établi à partir des sources citées ci-dessus. Publié le 6 octobre 2026.

À lire aussi