Ce que cette page vous donne, énoncé clairement
Il n’y a pas de formulaire sur cette page qui recrache un fichier robots.txt, et vous n’en avez pas besoin. Un fichier robots.txt est un court fichier en texte brut avec une grammaire réduite et stable ; chaque outil générateur sur internet produit la même poignée de schémas. Ce qui ne va vraiment pas avec robots.txt, ce n’est jamais la syntaxe. C’est bloquer un crawler dont vous aviez besoin, livrer une règle de préproduction en production, ou croire que le fichier fait quelque chose qu’il ne fait pas. Alors cette page vous donne les trois choses qu’un générateur ne peut pas : le comportement documenté de chaque token de crawler, des schémas à moindre privilège à copier et adapter, et un moyen de vérifier le fichier déployé. Cette dernière partie est en direct et gratuite : le scan de visibilité dans l’IA d’AEO Goal récupère votre vrai robots.txt et rapporte lesquels de 16 user agents de crawlers d’IA il autorise ou bloque actuellement, sans inscription.
Comment fonctionne réellement robots.txt
Le fichier vit à la racine de l’hôte : https://votredomaine.com/robots.txt. Il ne s’applique qu’à cet hôte. Un sous-domaine comme docs.votredomaine.com a besoin de son propre fichier, et http et https sont techniquement des hôtes distincts aussi. Il n’existe pas de robots.txt pour un sous-dossier.
Les règles sont groupées par User-agent. Un crawler trouve le groupe qui correspond le mieux à son propre token et n’obéit qu’à ce groupe ; si aucun groupe ne correspond, il se rabat sur User-agent: *. C’est le détail qui piège les équipes configurant l’accès de l’IA : dès l’instant où vous créez un groupe User-agent: GPTBot, GPTBot ignore entièrement votre groupe *, y compris ses lignes Disallow, à moins que vous ne les répétiez.
Au sein d’un groupe, les lignes Disallow et Allow nomment des préfixes de chemin. Quand des règles entrent en conflit, la règle la plus spécifique, c’est-à-dire le chemin correspondant le plus long, l’emporte. Les grands moteurs prennent aussi en charge * comme joker et $ pour ancrer la fin d’une URL. Une ligne Sitemap: peut apparaître n’importe où dans le fichier et s’applique globalement ; c’est ainsi que vous pointez chaque crawler vers votre sitemap XML sans attendre la découverte.
Deux propriétés comptent plus que n’importe quel détail de syntaxe. D’abord, robots.txt est indicatif. La conformité est volontaire ; les crawlers grand public listés ci-dessous documentent qu’ils y obéissent, mais le fichier est une requête, pas un contrôle d’accès. Tout ce qui est véritablement privé appartient derrière une authentification, pas derrière une ligne Disallow. Ensuite, robots.txt contrôle l’exploration, pas l’indexation. Google documente qu’une URL bloquée dans robots.txt peut toujours être indexée à partir des liens seuls, sans son contenu. La conséquence pratique est assez contre-intuitive pour être répétée : pour retirer une page indexée, vous devez laisser les crawlers la récupérer afin qu’ils puissent lire la directive noindex. Bloquer l’URL préserve la fiche obsolète.
Les tokens de crawlers d’IA et ce que chacun fait réellement
Chaque token ci-dessous est publié par son éditeur. Ce tableau dit ce que chaque éditeur documente, rien de plus.
| Token | Opérateur | Objet documenté |
|---|---|---|
GPTBot |
OpenAI | Explore le contenu qui peut être utilisé pour entraîner les modèles OpenAI. L’interdire retire votre site de cet usage d’entraînement. |
OAI-SearchBot |
OpenAI | Explore pour faire remonter et lier des sites dans les fonctionnalités de recherche de ChatGPT. OpenAI documente qu’il n’est pas utilisé pour entraîner les modèles. Le bloquer vous retire des résultats de recherche de ChatGPT. |
ChatGPT-User |
OpenAI | Récupère une page en direct quand la requête d’un utilisateur de ChatGPT l’exige. Pas un crawler de masse ; chaque récupération est initiée par l’utilisateur. |
ClaudeBot |
Anthropic | Le crawler web d’Anthropic pour collecter du contenu qui peut améliorer ses modèles. Anthropic documente séparément Claude-User pour les récupérations initiées par l’utilisateur et Claude-SearchBot pour l’indexation liée à la recherche. |
PerplexityBot |
Perplexity | Indexe les pages pour la recherche et les réponses de Perplexity. Le bloquer vous retire de l’index de Perplexity. Perplexity documente aussi Perplexity-User pour les récupérations faites pour le compte d’un utilisateur. |
Google-Extended |
Pas un crawler. Un token de contrôle, lu par Googlebot, qui régit si votre contenu est utilisé pour l’entraînement et l’ancrage des modèles Gemini. L’interdire n’affecte pas l’exploration, l’indexation ou le classement de Google Search. | |
Bingbot |
Microsoft | Le crawler de recherche de Bing. L’index Bing sous-tend aussi les résultats web de Microsoft Copilot, donc bloquer Bingbot a des conséquences au-delà des liens bleus classiques. |
CCBot |
Common Crawl | Construit le corpus Common Crawl, un jeu de données ouvert largement utilisé dans l’entraînement des modèles. L’interdire retire votre site de ce corpus pour l’avenir. |
Le schéma à intérioriser : ces tokens se répartissent en voies, et chaque voie a un coût différent lorsqu’elle est bloquée.
Bloquer la voie d’entraînement est une décision de politique légitime sur la façon dont votre contenu est réutilisé, et cela ne nuit pas à votre visibilité dans les réponses. Bloquer la voie de récupération tout en essayant d’obtenir des citations dans l’IA est un sabotage de soi : un moteur ne peut pas citer un corpus qu’on lui a dit de ne pas construire. Bloquer la voie initiée par l’utilisateur signifie qu’au moment exact où un acheteur demande à un assistant de lire votre page, l’assistant ne le peut pas.
Schémas à moindre privilège à copier
Le principe est le même qu’en contrôle d’accès : autorisez ce qui sert vos objectifs, refusez ce qui ne les sert pas, et soyez explicite sur les deux. Les pages marketing et de documentation publiques devraient être lisibles par chaque crawler de récupération ; les surfaces d’application, d’API et d’administration ne devraient l’être par aucun.
Schéma 1 : ouvert pour la visibilité, chemins privés protégés. C’est la forme qu’utilise le robots.txt de production d’AEO Goal lui-même, avec des groupes de crawlers d’IA explicites pour que la politique soit visible et délibérée :
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: PerplexityBot
User-agent: Bingbot
Allow: /
Disallow: /app
Disallow: /api
Disallow: /admin
User-agent: *
Allow: /
Disallow: /app
Disallow: /api
Disallow: /admin
Sitemap: https://yourdomain.com/sitemap.xml
Notez que les chemins privés sont répétés dans les deux groupes. C’est la règle de groupe nommé vue plus haut : un crawler correspondant au groupe IA ne lit jamais le groupe *, donc tout Disallow qui doit lier tout le monde doit apparaître dans chaque groupe.
Schéma 2 : refuser l’entraînement, rester récupérable. Pour les équipes dont la politique est « ne vous entraînez pas sur notre contenu, mais gardez-nous dans les réponses » :
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Google-Extended
Disallow: /
User-agent: *
Allow: /
Disallow: /app
Disallow: /api
Disallow: /admin
Sitemap: https://yourdomain.com/sitemap.xml
OAI-SearchBot, PerplexityBot, Bingbot et Googlebot se rabattent sur le groupe * et continuent d’explorer les pages publiques, de sorte que la visibilité dans la recherche et dans les réponses est préservée tandis que les crawlers d’entraînement documentés sont refusés.
Schéma 3 : refus total de l’IA. Ajoutez les tokens de récupération au groupe de refus du schéma 2. C’est une position cohérente pour certaines entreprises, mais nommez son coût honnêtement avant de la livrer : vos pages deviennent inéligibles aux réponses générées où se déroule une part croissante de la recherche des acheteurs, et votre visibilité dans l’IA tombe à zéro de votre propre main. Faites-en une décision documentée, pas un défaut copié d’un article de blog.
Erreurs courantes
- Traiter robots.txt comme de la sécurité. Le fichier est public et la conformité est volontaire.
/admindevrait être derrière une authentification qu’il soit aussi interdit ou non ; la ligne Disallow empêche simplement les crawlers bien élevés de gaspiller du budget sur des redirections vers votre page de connexion. - Bloquer une page que vous voulez désindexer. Traité ci-dessus, mais c’est l’erreur de robots.txt la plus courante : Disallow empêche le crawler de jamais voir votre noindex.
- Laisser une règle de préproduction atteindre la production.
Disallow: /sur un hôte de préproduction est correct ; les mêmes deux lignes déployées en production sont une panne de visibilité. Les fichiers robots spécifiques à l’environnement devraient être générés au build ou au serveur, pas édités à la main. - Oublier l’écrasement par groupe nommé. Ajouter
User-agent: GPTBot / Allow: /pour accueillir un crawler d’IA exempte silencieusement GPTBot de chaque règle de votre groupe*. Répétez les Disallow. - Bloquer les ressources. Interdire les répertoires de CSS et de JavaScript empêche les crawlers qui rendent les pages de voir la page comme le font les utilisateurs. Bloquez les routes d’application privées, pas les dossiers de ressources.
- Supposer qu’un seul fichier couvre tous les sous-domaines. Ce n’est pas le cas. Auditez
www, l’apex, docs, blog et tout sous-domaine régional séparément. - Se fier à Crawl-delay. Google l’ignore entièrement ; la prise en charge varie ailleurs. La limitation de débit appartient à votre CDN ou serveur, pas à robots.txt.
Vérifier le fichier que vous avez réellement livré
Un fichier robots.txt est sensible aux mises en production : une ligne inattentive retire des sections entières d’un site de la portée de chaque crawler, et rien ne casse visiblement. Alors la vérification, pas la génération, est l’étape qui mérite de l’outillage.
Pour la vue de Google, le rapport robots.txt de Search Console montre la version que Googlebot a récupérée en dernier et signale les problèmes d’analyse. Il ne vous dit rien sur la voie IA. Pour cela, lancez le scan gratuit de visibilité dans l’IA : il récupère en direct votre robots.txt et votre page d’accueil déployés et rapporte, agent par agent pour 16 user agents de crawlers d’IA, lesquels sont autorisés et lesquels sont bloqués, aux côtés de vérifications de votre llms.txt, JSON-LD, balises canoniques et métadonnées. C’est un scan sans inscription, sur une seule page, et comme robots.txt est un fichier à l’échelle du site, ses constats robots s’appliquent à tout votre domaine. Lancez-le avant un changement de robots pour établir une référence, et après le déploiement pour confirmer que rien n’a régressé.
C’est aussi la frontière honnête. Le scan gratuit vérifie l’accès depuis l’extérieur, à la demande. Attraper la régression que vous n’aviez pas pensé à vérifier, le préréglage de pare-feu qui a commencé à défier PerplexityBot, le modèle livré avec un noindex égaré, est un travail de surveillance : dans l’app, le crawler de site et les audits techniques récurrents revérifient selon un calendrier, et le suivi des citations dans l’IA montre si les moteurs que vous avez autorisés vous citent réellement, ce qui est le chiffre que le fichier robots existe pour servir.