ToolZen ToolZen
SEO generator client

Robots.txt Generator

Create a robots.txt file to control search engine crawler access. Set allow and disallow rules per user-agent with live preview.

Advertisement (Top Banner)
Advertisement (Bottom)

robots.txt est un fichier texte simple à la racine de votre domaine qui indique aux robots d'exploration quels chemins laisser tranquilles. Assez simple à écrire à la main, et facile à rater catastrophiquement — surtout à cause d'un malentendu sur ce que fait réellement Disallow.

Disallow ne veut pas dire « hors de Google »

C'est l'idée fausse aux conséquences les plus lourdes du sujet. Disallow dit à un robot de ne pas récupérer une URL. Il ne dit pas à un moteur de recherche de ne pas la lister. Ce sont deux choses différentes, et les confondre produit exactement l'inverse de l'intention.

Si un autre site pointe vers votre page bloquée, Google peut indexer l'URL sans jamais l'avoir récupérée. Vous avez déjà vu le résultat : un résultat de recherche avec l'adresse et la ligne « Aucune information n'est disponible pour cette page. » La page est dans l'index. Vous avez seulement empêché Google de lire précisément ce qui l'aurait décrite.

D'où un vrai paradoxe qu'il vaut la peine d'intérioriser. Pour garder une page hors de l'index, il faut une directive noindex — une balise meta ou un en-tête HTTP sur la page elle-même. Mais Google ne peut voir cette directive qu'en récupérant la page. Si robots.txt bloque la récupération, le noindex n'est jamais lu. Disallow et noindex sur la même URL s'annulent, et la page reste indexée. Choisissez : Disallow pour économiser le budget d'exploration, ou noindex pour disparaître de la recherche — jamais les deux.

C'est un fichier public qui liste vos secrets

robots.txt est récupérable par quiconque à votredomaine.fr/robots.txt. C'est l'une des premières choses que lit un testeur d'intrusion, pour la raison évidente : un fichier dont le but entier est d'énumérer les chemins qu'on préférerait voir ignorés est un cadeau.

Écrire Disallow: /admin-backup-2019/ ne cache pas ce répertoire. Cela le publie, à tous, pour toujours, dans un fichier conçu pour être lu. Le respect est volontaire — les robots bien élevés l'honorent, tout ce qui est malveillant l'ignore complètement tout en sachant désormais exactement où chercher.

La règle qui en découle : robots.txt sert aux choses que vous ne voulez pas voir explorées, jamais aux choses que vous ne voulez pas voir trouvées. Tout ce qui est réellement sensible réclame une authentification. Si un chemin ne doit pas être atteint sans connexion, mettez-y une connexion — c'est le seul mécanisme qui ne soit pas une demande polie.

Bloquer les robots d'IA relève de la bonne foi

La section robots d'IA ici couvre ceux qui se déclarent actuellement : GPTBot, Google-Extended, CCBot, Claude-Web, anthropic-ai et Omgilibot. Les bloquer est un choix raisonnable et cela fonctionne exactement dans la mesure où leurs opérateurs le veulent bien.

Deux choses à savoir. Google-Extended n'est pas du tout un robot d'exploration — c'est un jeton qui contrôle si le contenu déjà récupéré par Googlebot peut servir à l'entraînement d'IA. Le bloquer n'affecte pas votre classement dans la recherche, une distinction que Google a tracée délibérément et que beaucoup de propriétaires de sites ont manquée dans les deux sens.

Et la liste vieillit. De nouveaux robots apparaissent constamment, choisissent eux-mêmes leur chaîne user-agent, et rien ne les oblige à s'annoncer. Un robots.txt écrit aujourd'hui bloque les robots qui existaient aujourd'hui. Si cela vous importe, c'est un fichier à revisiter plutôt qu'à écrire une fois pour toutes.

Les règles sur lesquelles on trébuche

Le fichier doit être à la racine, exactement à /robots.txt. Un fichier en /sousdossier/robots.txt est totalement ignoré, et les sous-domaines réclament le leur — un robots.txt sur exemple.fr ne dit rien de boutique.exemple.fr.

Les chemins sont sensibles à la casse : Disallow: /Admin ne bloque pas /admin. La correspondance est un préfixe : Disallow: /page bloque donc /page, /pages et /page-deux pareillement — une barre finale compte plus qu'il n'y paraît.

Quand une URL correspond à plusieurs règles, c'est la plus spécifique qui gagne, pas la première — d'où la possibilité pour Allow de tailler une exception dans un Disallow plus large. Et un Disallow: vide signifie « tout autoriser », tandis que Disallow: / bloque le site entier. Un caractère entre les deux, et c'est le caractère le plus susceptible de rester après un déploiement de préproduction.

Questions fréquentes

Quelque chose est-il envoyé à un serveur ?

Non. Cet outil porte la mention « client » : le fichier est assemblé dans votre onglet à partir de ce que vous saisissez. Rien n'est transmis.

J'ai bloqué une page et elle est toujours dans Google. Pourquoi ?

Parce que bloquer l'exploration ne supprime pas le résultat — voir plus haut. Si la page est déjà indexée, la solution est de retirer le Disallow pour que Google puisse la récupérer à nouveau, de lui servir un noindex, d'attendre une réexploration, et seulement ensuite de la bloquer si vous le souhaitez encore. Contre-intuitif, et c'est la seule séquence qui marche.

Ai-je seulement besoin d'un robots.txt ?

Pas pour un petit site sans rien à cacher — pas de fichier signifie « explore tout », ce qui est généralement ce qu'on veut. Il gagne sa place quand vous avez des chemins à tenir hors de l'exploration : pages de résultats de recherche générant des URL à l'infini, filtres à facettes, zones de préproduction. Un robots.txt absent renvoie un 404 et les robots s'en accommodent très bien — un fichier vide n'est donc pas à ajouter pour le principe.

Dois-je y déclarer mon sitemap ?

Oui, cela coûte une ligne et tous les grands moteurs la lisent. Cela ne remplace pas la soumission du sitemap dans la Search Console — c'est là que vous voyez si les URL ont vraiment été indexées — mais c'est ainsi que le trouvent les robots qui ne sont pas Google.

Crawl-delay fonctionne-t-il ?

Pas chez Google, qui l'ignore complètement ; la fréquence d'exploration se règle plutôt dans la Search Console. Bing et Yandex l'honorent. Si Googlebot surcharge réellement votre serveur, c'est plutôt le signe que quelque chose cloche côté serveur que côté robot — mais le réglage existe dans la Search Console si vous en avez besoin.