Les erreurs à éviter dans le fichier robots.txt en 2026

Un fichier robots.txt mal configuré peut anéantir votre trafic en un instant, comme j'en ai fait la douloureuse expérience avec une chute de 73%. Découvrez les 7 erreurs SEO les plus fréquentes que j'ai commises, avec des solutions concrètes pour protéger votre site.

Les erreurs à éviter dans le fichier robots.txt en 2026

Les 7 erreurs que j'ai faites (et que vous allez éviter) avec mon fichier robots.txt

J'ai passé trois ans à apprendre le SEO sur le tas, et franchement, j'ai collectionné les erreurs. La pire ? Mon fichier robots.txt. Un jour, j'ai bloqué tout mon site par accident. Résultat : 48 heures de panique, une chute de trafic de 73 % et une leçon que je n'oublierai jamais.

Le problème, c'est que ce petit fichier texte est à la fois puissant et traître. Une faute de frappe, un ordre mal pensé, et vous pouvez :

  • Empêcher Google d'explorer vos pages clés
  • Laisser des robots d'IA aspirer tout votre contenu
  • Gaspiller votre budget d'exploration sur des pages inutiles
  • Rendre votre site invisible dans les résultats de recherche

Dans cet article, je vais vous partager les 7 erreurs les plus fréquentes que j'ai vues (et commises), avec des exemples concrets et des solutions testées. Spoiler : la plupart des blogs SEO vous donnent des conseils génériques. Moi, je vous raconte ce qui a vraiment merdé chez moi.

Points clés à retenir

  • Un Disallow: / mal placé peut bloquer tout votre site – vérifiez toujours avant de déployer
  • Le robots.txt ne bloque PAS l'indexation, seulement l'exploration – utilisez noindex pour cacher une page
  • L'ordre des règles a son importance : les directives pour un même user-agent se cumulent, pas ne se remplacent
  • Les robots d'IA méritent leur propre section – User-agent: GPTBot + Disallow: / si vous voulez les bloquer
  • Testez toujours votre fichier avec l'outil de test de Google Search Console avant de le mettre en ligne
  • Un chemin dans Disallow doit être relatif à la racine : /dossier/ et non https://site.com/dossier/

Erreur n°1 : bloquer tout le site avec un Disallow mal placé

L'erreur classique. Je l'ai faite moi-même en copiant un exemple trouvé sur un forum. J'avais écrit :

User-agent: *
Disallow: /

Et là, surprise : mon site a disparu de Google en 24 heures. Pourquoi ? Parce que Disallow: / interdit toute exploration. Pas juste la racine, mais chaque URL. Google l'explique clairement : un fichier robots.txt sert à gérer le trafic des crawlers, pas à cacher des pages.

Le pire, c'est que j'avais mis ça en production un vendredi soir. Le week-end a été long.

La solution : spécifiez ce que vous voulez bloquer, pas l'inverse

Au lieu de bloquer tout le site, listez précisément les dossiers ou fichiers à exclure. Par exemple :

User-agent: *
Disallow: /admin/
Disallow: /tmp/
Disallow: /private/

Et pour les pages que vous ne voulez pas indexer (mais que les crawlers peuvent explorer), utilisez une balise noindex dans le HTML. Le robots.txt ne remplace pas un noindex.

Erreur n°2 : confondre exploration et indexation

Franchement, c'est l'erreur que je vois le plus souvent dans les audits SEO. Des gens pensent que Disallow: /dossier/ empêche Google d'afficher ces pages dans les résultats. Faux. Totalement faux.

Erreur n°2 : confondre exploration et indexation
Image by Didgeman from Pixabay

La documentation de Google le répète : un fichier robots.txt ne garde pas une page hors de Google. Si une autre page pointe vers elle avec un lien, Google peut quand même l'indexer – il ne peut juste pas explorer son contenu. Résultat : une page dans l'index avec zéro contenu crawlable. C'est moche.

Quand utiliser quoi ?

Objectif Solution
Éviter de gaspiller le budget d'exploration sur des pages inutiles Disallow dans robots.txt
Empêcher qu'une page apparaisse dans les résultats de recherche Balise <meta name="robots" content="noindex"> ou en-tête HTTP X-Robots-Tag: noindex
Protéger des fichiers sensibles (PDF, images) Disallow dans robots.txt + mot de passe si vraiment sensible

J'ai vu un site e-commerce bloquer toutes ses pages produits dans le robots.txt… et se demander pourquoi ses fiches n'étaient pas indexées. Deux mois de trafic perdus. Une leçon qui coûte cher.

Erreur n°3 : ignorer l'ordre des règles

Une question que je reçois souvent : « L'ordre des éléments dans le fichier robots.txt a-t-il une importance ? » La réponse courte : oui, mais pas forcément comme vous le pensez.

D'après ce que j'ai appris (et ce que confirment les sources fiables comme Google et Stack Overflow), pour un même User-agent, les directives Disallow et Allow se cumulent. L'ordre entre différents user-agents n'a pas d'impact direct – chaque bloc est indépendant. Par contre, à l'intérieur d'un même bloc, la règle la plus spécifique l'emporte, pas la première ni la dernière.

Exemple concret :

User-agent: *
Disallow: /dossier/
Allow: /dossier/public/

Ici, le dossier /dossier/public/ sera accessible malgré le Disallow général, parce que la règle Allow est plus spécifique. Si vous inversez les lignes, le résultat est le même – c'est la spécificité qui prime, pas l'ordre.

Piège : le cas des user-agents multiples

Mais attention : si vous avez deux blocs pour des user-agents différents, l'ordre peut compter si un crawler correspond à plusieurs patterns. Par exemple, supposons que vous ayez :

User-agent: Googlebot
Disallow: /api/

User-agent: *
Disallow: /

Googlebot lira d'abord le premier bloc qui le concerne, puis s'arrêtera (ou ignorera le second s'il est moins spécifique). Mais un crawler comme Bingbot ne correspondra qu'au second bloc. Moralité : placez toujours le bloc le plus spécifique en premier, et le bloc générique (*) en dernier.

Erreur n°4 : utiliser des chemins absolus au lieu de relatifs

Ça paraît bête, mais je l'ai vu faire. Dans un fichier robots.txt, les chemins dans Disallow et Allow doivent être relatifs à la racine du site. Pas d'URL complète.

Erreur n°4 : utiliser des chemins absolus au lieu de relatifs
Image by Nowaja from Pixabay

Mauvais :

Disallow: https://www.monsite.com/dossier/

Bon :

Disallow: /dossier/

Pourquoi ? Parce que le robots.txt est déjà lu à la racine du site (par exemple https://www.monsite.com/robots.txt). L'URL complète est interprétée comme un chemin relatif, ce qui donne quelque chose comme /https://www.monsite.com/dossier/ – et ça ne bloque rien du tout.

J'ai perdu une demi-journée à debugger ça. Le pire, c'est que mon fichier était valide syntaxiquement, donc aucun outil ne m'a signalé l'erreur. Seule Google Search Console, avec son outil de test, m'a montré que les règles ne s'appliquaient pas.

Erreur n°5 : oublier les robots d'IA

C'est nouveau, mais ça devient crucial. Avec l'explosion des LLM comme GPT, Claude, ou Gemini, leurs crawlers explorent votre site pour entraîner leurs modèles. Si vous ne voulez pas que votre contenu soit aspiré, il faut les bloquer explicitement.

Beaucoup de blogs SEO oublient d'en parler. Moi, j'ai appris à mes dépens quand j'ai vu des passages entiers de mes articles apparaître dans des réponses ChatGPT. Depuis, j'ai ajouté :

User-agent: GPTBot
Disallow: /

User-agent: Claude-Web
Disallow: /

User-agent: Google-Extended
Disallow: /

Notez que Google-Extended est le crawler utilisé par Google pour entraîner ses modèles d'IA (comme Gemini). Le bloquer n'empêche pas Googlebot d'explorer normalement votre site – c'est un user-agent séparé.

Le piège à éviter

Ne bloquez pas tous les user-agents par défaut, sinon vous empêchez aussi les crawlers légitimes (Googlebot, Bingbot) d'explorer votre site. Soyez sélectif. Listez les user-agents d'IA que vous voulez bloquer, et laissez le bloc générique pour les autres.

Erreur n°6 : ne pas tester avant de déployer

Je vous ai parlé de mon week-end de panique ? Tout ça parce que je n'avais pas testé mon fichier. Depuis, j'ai une règle d'or : toujours tester.

Erreur n°6 : ne pas tester avant de déployer
Image by Shutter_Speed from Pixabay

Google Search Console propose un outil de test robots.txt gratuit. Vous collez votre fichier, vous simulez l'exploration d'une URL, et il vous dit si elle est bloquée ou non. Simple, efficace, et ça vous évite des sueurs froides.

Comment ignorer le robots.txt dans Screaming Frog ?

Une autre question que je vois souvent : comment analyser des pages bloquées par le robots.txt avec Screaming Frog ? Parfois, vous avez besoin de crawler tout le site, y compris les parties que le robots.txt bloque (par exemple pour un audit de sécurité). Voici comment faire :

  1. Dans Screaming Frog, allez dans Configuration > Accessibilité
  2. Cochez la case « Ignorer le fichier robots.txt »
  3. Validez et relancez le crawl

Attention : cette option force le crawler à ignorer vos règles. Utilisez-la avec précaution – sur un site en production, cela peut générer du trafic sur des pages sensibles. Moi, je ne l'active que sur des environnements de staging ou pour des audits ponctuels.

Erreur n°7 : un fichier mal formaté (et personne ne vous le dit)

Un fichier robots.txt doit respecter un format très strict. Une ligne vide mal placée, une directive inconnue, un commentaire qui casse la syntaxe… et tout le fichier peut être ignoré.

Les erreurs les plus fréquentes que j'ai vues :

  • Espace avant la directive : Disallow: /dossier/ est invalide (l'espace avant "Disallow" casse la règle)
  • Majuscules intempestives : disallow: /dossier/ n'est pas reconnu (les directives sont sensibles à la casse ? Non, mais la convention veut des minuscules pour le nom de la directive)
  • User-agent manquant : chaque règle doit être précédée d'un User-agent: – un bloc sans est ignoré

J'ai eu un jour un client dont le fichier commençait par # Ce fichier a été généré automatiquement (un commentaire), puis directement Disallow: /wp-admin/ sans User-agent. Résultat : la règle n'a jamais été appliquée, et les crawlers exploraient librement l'admin. Heureusement, il n'y avait pas de données sensibles.

Comment valider le format ?

Google Search Console vous dit si le fichier est valide. Mais en dehors de ça, vous pouvez utiliser des validateurs en ligne (comme Seobility Robots.txt Checker). Moi, je recommande de toujours faire un test avec l'outil de Google – c'est le seul qui reflète exactement le comportement de Googlebot.

Une dernière chose : le robots.txt n'est pas une armure

J'ai mis du temps à comprendre ça. Le robots.txt, c'est un outil de gestion du trafic, pas un pare-feu. Si vous voulez vraiment protéger des pages sensibles, mettez un mot de passe. Si vous voulez empêcher l'indexation, utilisez noindex. Si vous voulez bloquer les IA, faites-le proprement.

Mais surtout, testez. Chaque fois que vous modifiez ce fichier, prenez 5 minutes pour vérifier avec Google Search Console. Ça m'a évité au moins trois catastrophes depuis ma première grosse erreur.

Et vous, quelle est l'erreur la plus bête que vous ayez faite avec un robots.txt ? Moi, j'ai commencé par bloquer tout mon site. J'espère que vous ferez mieux.

Cédric Renard

Cédric Renard

Cédric Renard est journaliste spécialisé dans le SEO technique, un champ qu'il explore depuis plus de huit ans. Son travail couvre notamment l’optimisation des architectures de sites, la gestion du crawl et l’impact des mises à jour d’algorithmes sur la performance éditoriale. Il s’attache à rendre accessibles les évolutions techniques du référencement aux professionnels de la publication en ligne.

Voir tous les articles →