// Tool

Générateur de robots.txt

Des schémas robots.txt prêts à copier pour les crawlers de recherche et d'IA : ce que font réellement GPTBot, OAI-SearchBot, Google-Extended et ClaudeBot, et comment vérifier l'accès gratuitement.

Ce que cette page vous donne, énoncé clairement

Il n’y a pas de formulaire sur cette page qui recrache un fichier robots.txt, et vous n’en avez pas besoin. Un fichier robots.txt est un court fichier en texte brut avec une grammaire réduite et stable ; chaque outil générateur sur internet produit la même poignée de schémas. Ce qui ne va vraiment pas avec robots.txt, ce n’est jamais la syntaxe. C’est bloquer un crawler dont vous aviez besoin, livrer une règle de préproduction en production, ou croire que le fichier fait quelque chose qu’il ne fait pas. Alors cette page vous donne les trois choses qu’un générateur ne peut pas : le comportement documenté de chaque token de crawler, des schémas à moindre privilège à copier et adapter, et un moyen de vérifier le fichier déployé. Cette dernière partie est en direct et gratuite : le scan de visibilité dans l’IA d’AEO Goal récupère votre vrai robots.txt et rapporte lesquels de 16 user agents de crawlers d’IA il autorise ou bloque actuellement, sans inscription.

Comment fonctionne réellement robots.txt

Le fichier vit à la racine de l’hôte : https://votredomaine.com/robots.txt. Il ne s’applique qu’à cet hôte. Un sous-domaine comme docs.votredomaine.com a besoin de son propre fichier, et http et https sont techniquement des hôtes distincts aussi. Il n’existe pas de robots.txt pour un sous-dossier.

Les règles sont groupées par User-agent. Un crawler trouve le groupe qui correspond le mieux à son propre token et n’obéit qu’à ce groupe ; si aucun groupe ne correspond, il se rabat sur User-agent: *. C’est le détail qui piège les équipes configurant l’accès de l’IA : dès l’instant où vous créez un groupe User-agent: GPTBot, GPTBot ignore entièrement votre groupe *, y compris ses lignes Disallow, à moins que vous ne les répétiez.

Au sein d’un groupe, les lignes Disallow et Allow nomment des préfixes de chemin. Quand des règles entrent en conflit, la règle la plus spécifique, c’est-à-dire le chemin correspondant le plus long, l’emporte. Les grands moteurs prennent aussi en charge * comme joker et $ pour ancrer la fin d’une URL. Une ligne Sitemap: peut apparaître n’importe où dans le fichier et s’applique globalement ; c’est ainsi que vous pointez chaque crawler vers votre sitemap XML sans attendre la découverte.

Deux propriétés comptent plus que n’importe quel détail de syntaxe. D’abord, robots.txt est indicatif. La conformité est volontaire ; les crawlers grand public listés ci-dessous documentent qu’ils y obéissent, mais le fichier est une requête, pas un contrôle d’accès. Tout ce qui est véritablement privé appartient derrière une authentification, pas derrière une ligne Disallow. Ensuite, robots.txt contrôle l’exploration, pas l’indexation. Google documente qu’une URL bloquée dans robots.txt peut toujours être indexée à partir des liens seuls, sans son contenu. La conséquence pratique est assez contre-intuitive pour être répétée : pour retirer une page indexée, vous devez laisser les crawlers la récupérer afin qu’ils puissent lire la directive noindex. Bloquer l’URL préserve la fiche obsolète.

Les tokens de crawlers d’IA et ce que chacun fait réellement

Chaque token ci-dessous est publié par son éditeur. Ce tableau dit ce que chaque éditeur documente, rien de plus.

Token Opérateur Objet documenté
GPTBot OpenAI Explore le contenu qui peut être utilisé pour entraîner les modèles OpenAI. L’interdire retire votre site de cet usage d’entraînement.
OAI-SearchBot OpenAI Explore pour faire remonter et lier des sites dans les fonctionnalités de recherche de ChatGPT. OpenAI documente qu’il n’est pas utilisé pour entraîner les modèles. Le bloquer vous retire des résultats de recherche de ChatGPT.
ChatGPT-User OpenAI Récupère une page en direct quand la requête d’un utilisateur de ChatGPT l’exige. Pas un crawler de masse ; chaque récupération est initiée par l’utilisateur.
ClaudeBot Anthropic Le crawler web d’Anthropic pour collecter du contenu qui peut améliorer ses modèles. Anthropic documente séparément Claude-User pour les récupérations initiées par l’utilisateur et Claude-SearchBot pour l’indexation liée à la recherche.
PerplexityBot Perplexity Indexe les pages pour la recherche et les réponses de Perplexity. Le bloquer vous retire de l’index de Perplexity. Perplexity documente aussi Perplexity-User pour les récupérations faites pour le compte d’un utilisateur.
Google-Extended Google Pas un crawler. Un token de contrôle, lu par Googlebot, qui régit si votre contenu est utilisé pour l’entraînement et l’ancrage des modèles Gemini. L’interdire n’affecte pas l’exploration, l’indexation ou le classement de Google Search.
Bingbot Microsoft Le crawler de recherche de Bing. L’index Bing sous-tend aussi les résultats web de Microsoft Copilot, donc bloquer Bingbot a des conséquences au-delà des liens bleus classiques.
CCBot Common Crawl Construit le corpus Common Crawl, un jeu de données ouvert largement utilisé dans l’entraînement des modèles. L’interdire retire votre site de ce corpus pour l’avenir.

Le schéma à intérioriser : ces tokens se répartissent en voies, et chaque voie a un coût différent lorsqu’elle est bloquée.

Un fichier robots.txt, trois types de lecteurs : les crawlers d’entraînement comme GPTBot et ClaudeBot, les crawlers de recherche et de récupération comme OAI-SearchBot et PerplexityBot, et les récupérateurs initiés par l’utilisateur comme ChatGPT-User, chacun avec un coût différent lorsqu’il est bloqué

Bloquer la voie d’entraînement est une décision de politique légitime sur la façon dont votre contenu est réutilisé, et cela ne nuit pas à votre visibilité dans les réponses. Bloquer la voie de récupération tout en essayant d’obtenir des citations dans l’IA est un sabotage de soi : un moteur ne peut pas citer un corpus qu’on lui a dit de ne pas construire. Bloquer la voie initiée par l’utilisateur signifie qu’au moment exact où un acheteur demande à un assistant de lire votre page, l’assistant ne le peut pas.

Schémas à moindre privilège à copier

Le principe est le même qu’en contrôle d’accès : autorisez ce qui sert vos objectifs, refusez ce qui ne les sert pas, et soyez explicite sur les deux. Les pages marketing et de documentation publiques devraient être lisibles par chaque crawler de récupération ; les surfaces d’application, d’API et d’administration ne devraient l’être par aucun.

Schéma 1 : ouvert pour la visibilité, chemins privés protégés. C’est la forme qu’utilise le robots.txt de production d’AEO Goal lui-même, avec des groupes de crawlers d’IA explicites pour que la politique soit visible et délibérée :

User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: PerplexityBot
User-agent: Bingbot
Allow: /
Disallow: /app
Disallow: /api
Disallow: /admin

User-agent: *
Allow: /
Disallow: /app
Disallow: /api
Disallow: /admin

Sitemap: https://yourdomain.com/sitemap.xml

Notez que les chemins privés sont répétés dans les deux groupes. C’est la règle de groupe nommé vue plus haut : un crawler correspondant au groupe IA ne lit jamais le groupe *, donc tout Disallow qui doit lier tout le monde doit apparaître dans chaque groupe.

Schéma 2 : refuser l’entraînement, rester récupérable. Pour les équipes dont la politique est « ne vous entraînez pas sur notre contenu, mais gardez-nous dans les réponses » :

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Google-Extended
Disallow: /

User-agent: *
Allow: /
Disallow: /app
Disallow: /api
Disallow: /admin

Sitemap: https://yourdomain.com/sitemap.xml

OAI-SearchBot, PerplexityBot, Bingbot et Googlebot se rabattent sur le groupe * et continuent d’explorer les pages publiques, de sorte que la visibilité dans la recherche et dans les réponses est préservée tandis que les crawlers d’entraînement documentés sont refusés.

Schéma 3 : refus total de l’IA. Ajoutez les tokens de récupération au groupe de refus du schéma 2. C’est une position cohérente pour certaines entreprises, mais nommez son coût honnêtement avant de la livrer : vos pages deviennent inéligibles aux réponses générées où se déroule une part croissante de la recherche des acheteurs, et votre visibilité dans l’IA tombe à zéro de votre propre main. Faites-en une décision documentée, pas un défaut copié d’un article de blog.

Erreurs courantes

  • Traiter robots.txt comme de la sécurité. Le fichier est public et la conformité est volontaire. /admin devrait être derrière une authentification qu’il soit aussi interdit ou non ; la ligne Disallow empêche simplement les crawlers bien élevés de gaspiller du budget sur des redirections vers votre page de connexion.
  • Bloquer une page que vous voulez désindexer. Traité ci-dessus, mais c’est l’erreur de robots.txt la plus courante : Disallow empêche le crawler de jamais voir votre noindex.
  • Laisser une règle de préproduction atteindre la production. Disallow: / sur un hôte de préproduction est correct ; les mêmes deux lignes déployées en production sont une panne de visibilité. Les fichiers robots spécifiques à l’environnement devraient être générés au build ou au serveur, pas édités à la main.
  • Oublier l’écrasement par groupe nommé. Ajouter User-agent: GPTBot / Allow: / pour accueillir un crawler d’IA exempte silencieusement GPTBot de chaque règle de votre groupe *. Répétez les Disallow.
  • Bloquer les ressources. Interdire les répertoires de CSS et de JavaScript empêche les crawlers qui rendent les pages de voir la page comme le font les utilisateurs. Bloquez les routes d’application privées, pas les dossiers de ressources.
  • Supposer qu’un seul fichier couvre tous les sous-domaines. Ce n’est pas le cas. Auditez www, l’apex, docs, blog et tout sous-domaine régional séparément.
  • Se fier à Crawl-delay. Google l’ignore entièrement ; la prise en charge varie ailleurs. La limitation de débit appartient à votre CDN ou serveur, pas à robots.txt.

Vérifier le fichier que vous avez réellement livré

Un fichier robots.txt est sensible aux mises en production : une ligne inattentive retire des sections entières d’un site de la portée de chaque crawler, et rien ne casse visiblement. Alors la vérification, pas la génération, est l’étape qui mérite de l’outillage.

Pour la vue de Google, le rapport robots.txt de Search Console montre la version que Googlebot a récupérée en dernier et signale les problèmes d’analyse. Il ne vous dit rien sur la voie IA. Pour cela, lancez le scan gratuit de visibilité dans l’IA : il récupère en direct votre robots.txt et votre page d’accueil déployés et rapporte, agent par agent pour 16 user agents de crawlers d’IA, lesquels sont autorisés et lesquels sont bloqués, aux côtés de vérifications de votre llms.txt, JSON-LD, balises canoniques et métadonnées. C’est un scan sans inscription, sur une seule page, et comme robots.txt est un fichier à l’échelle du site, ses constats robots s’appliquent à tout votre domaine. Lancez-le avant un changement de robots pour établir une référence, et après le déploiement pour confirmer que rien n’a régressé.

C’est aussi la frontière honnête. Le scan gratuit vérifie l’accès depuis l’extérieur, à la demande. Attraper la régression que vous n’aviez pas pensé à vérifier, le préréglage de pare-feu qui a commencé à défier PerplexityBot, le modèle livré avec un noindex égaré, est un travail de surveillance : dans l’app, le crawler de site et les audits techniques récurrents revérifient selon un calendrier, et le suivi des citations dans l’IA montre si les moteurs que vous avez autorisés vous citent réellement, ce qui est le chiffre que le fichier robots existe pour servir.

Frequently asked questions

Y a-t-il un générateur de robots.txt interactif sur cette page ?

Non. Cette page vous donne les schémas documentés à copier et adapter, ce que la plupart des outils générateurs produisent de toute façon. Ce qu'AEO Goal offre en direct, c'est la vérification : le scan gratuit de visibilité dans l'IA récupère votre vrai robots.txt et rapporte lesquels de 16 user agents de crawlers d'IA il bloque actuellement, sans inscription.

Devrais-je bloquer les crawlers d'IA dans robots.txt ?

Séparez d'abord les deux voies. Bloquer les crawlers d'entraînement comme GPTBot et ClaudeBot est un choix de politique défendable qui ne vous retire pas des réponses de l'IA. Bloquer les crawlers de récupération comme OAI-SearchBot, PerplexityBot et Bingbot retire vos pages des index que les réponses générées citent, donc si la visibilité dans l'IA est un objectif, laissez cette voie ouverte.

Bloquer une URL dans robots.txt la retire-t-il de l'index de Google ?

Non, et cela peut faire l'inverse. Une URL bloquée dans robots.txt peut toujours être indexée à partir des liens qui pointent vers elle, mais sans son contenu. Pour désindexer une page, les crawlers doivent pouvoir la récupérer et lire une directive noindex, ce qui signifie que l'URL ne doit pas être bloquée dans robots.txt.

Non. Google documente Google-Extended comme un token de contrôle, lu par Googlebot, qui régit si votre contenu est utilisé pour l'entraînement et l'ancrage de Gemini. Ce n'est pas un crawler distinct et l'interdire n'a aucun effet sur l'exploration, l'indexation ou le classement de Google Search.

Comment tester un changement de robots.txt avant et après le déploiement ?

Le rapport robots.txt de Google Search Console montre le fichier que Google a récupéré en dernier et toute erreur d'analyse pour les crawlers de Google. Pour la voie IA, lancez le scan gratuit d'AEO Goal avant et après le déploiement : il récupère en direct votre robots.txt et rapporte le statut autorisé face à bloqué pour 16 user agents d'IA, de sorte qu'une régression apparaît immédiatement.

Lancez votre analyse gratuite en 60 secondes

Lancez une analyse gratuite pour voir où vous vous situez sur ChatGPT, Claude, Gemini et Perplexity : quelles réponses vous citent, lesquelles citent des concurrents à votre place, et quoi corriger en premier.

Run a free scan