Aller au contenu
Vos 9 agents IA
Composer mon équipe IA Ressources Tarifs Tester mon site Voir mon potentiel
Observatoire Rank Press
L'idée reçue du mois Publié le 25 juillet 2026 · sources vérifiées le 25 juillet 2026

Bloquer une page dans robots.txt ne l'empêche pas d'être dans Google

L'essentiel

  • Google l'écrit dès la première ligne de sa documentation : robots.txt « is not a mechanism for keeping a web page out of Google ».
  • Une page bloquée peut quand même apparaître dans les résultats si d'autres sites y font un lien. Simplement, sans description.
  • Le bon outil pour sortir de l'index, c'est noindex ou une protection par mot de passe. Pas robots.txt.
  • Le piège qui piège tout le monde : mettre noindex ET bloquer la page dans robots.txt. Le blocage empêche Google de lire le noindex. Vous obtenez l'inverse de ce que vous vouliez.
  • Ce n'est pas un détail de spécialiste : c'est la première cause de pages sensibles qui traînent dans Google alors que leur propriétaire croit les avoir cachées.
Wen Dasnois
Wen DasnoisFondateur de Rank Press. J'ai ouvert et lu chaque source citée ici le 25 juillet 2026. LinkedIn

Celle-ci n'est pas une idée reçue de marketing, c'est une erreur technique, et elle a des conséquences très concrètes : des pages de commande, des espaces de test, des documents internes qui se retrouvent listés dans Google alors que quelqu'un pensait sincèrement les avoir bloqués.

Le plus frappant, c'est que Google le dit dans la première phrase de la page concernée. Il suffit de la lire.

La phrase, mot pour mot

« A robots.txt file tells search engine crawlers which URLs the crawler can access on your site. This is used mainly to avoid overloading your site with requests; it is not a mechanism for keeping a web page out of Google. To keep a web page out of Google, block indexing with noindex or password-protect the page. »

Ma traduction : un fichier robots.txt indique aux robots d'exploration quelles adresses ils peuvent atteindre sur votre site. Il sert principalement à éviter de surcharger votre site de requêtes ; ce n'est pas un mécanisme pour tenir une page à l'écart de Google. Pour cela, bloquez l'indexation avec noindex ou protégez la page par mot de passe. Source : Google Search Central, « Introduction to robots.txt », dernière mise à jour affichée le 10 décembre 2025, developers.google.com, consultée le 25 juillet 2026.

La même page explique ensuite précisément ce qui se passe quand on essaie quand même :

« A page that's disallowed in robots.txt can still be indexed if linked to from other sites. While Google won't crawl or index the content blocked by a robots.txt file, we might still find and index a disallowed URL if it is linked from other places on the web. »

Ma traduction : une page interdite dans robots.txt peut quand même être indexée si d'autres sites y font un lien. Google n'explorera ni n'indexera le contenu bloqué, mais il peut découvrir et indexer l'adresse elle-même si elle est liée ailleurs sur le web. Même source.

Le résultat, dans les pages de résultats, est cette ligne sans description que tout le monde a déjà vue : l'adresse s'affiche, le titre parfois, et à la place du résumé une mention indiquant qu'aucune information n'est disponible. Google le formule ainsi : « its URL can still appear in search results, but the search result won't have a description ».

Ce que robots.txt fait vraiment

Il gère l'exploration, pas l'indexation. La distinction paraît académique, elle est en réalité toute la question :

Le gesteCe qu'il fait
Interdire dans robots.txt Google ne va pas lire la page. Il peut toujours en connaître l'existence, et l'afficher, par les liens qui pointent vers elle.
Balise noindex Google lit la page, y trouve l'instruction, et la retire des résultats. Il faut donc qu'il puisse y accéder.
Mot de passe Personne n'y accède, ni Google ni un visiteur. C'est le seul vrai verrou.
!

Le piège, et c'est le cœur de cet article. Beaucoup de gens, voulant faire les choses bien, mettent la balise noindex sur une page et la bloquent dans robots.txt. C'est contre-productif : le blocage empêche Google de venir lire la page, donc il ne voit jamais le noindex, donc il ne peut pas appliquer le retrait qu'on lui demande. On obtient exactement l'inverse de l'intention. Si vous voulez qu'une page sorte des résultats : laissez Google y accéder et posez le noindex. Le blocage vient éventuellement après, une fois le retrait constaté.

Deux limites qu'on oublie

Les robots ne sont pas obligés d'obéir. Google précise que chaque robot peut interpréter les règles différemment, et que la syntaxe pour s'adresser à tel ou tel n'est pas comprise partout de la même façon. Le protocole est une convention, pas une barrière.

Ce n'est pas non plus une mesure de sécurité. Un fichier robots.txt est public, lisible par n'importe qui à l'adresse de votre site. Y lister vos répertoires sensibles revient à publier leur inventaire. Une page qui ne doit pas être vue se protège par mot de passe, pas par une ligne dans un fichier ouvert à tous.

Ce que ça change pour vous

Ouvrez votre robots.txt maintenant et regardez ce que vous y avez bloqué en pensant le cacher. Tapez ensuite l'adresse d'une de ces pages dans Google, entre guillemets, pour voir si elle y figure quand même.

Vérifiez que vous ne cumulez pas noindex et blocage sur les mêmes pages. C'est l'erreur la plus fréquente, et elle est silencieuse : rien ne vous prévient.

Choisissez selon l'objectif, pas par habitude. Économiser des passages de robot sur des milliers d'adresses sans intérêt, c'est le rôle de robots.txt. Faire disparaître une page des résultats, c'est noindex. Empêcher un accès, c'est un mot de passe.

Comment j'ai travaillé

J'ai téléchargé et lu la page officielle le 25 juillet 2026. Les citations sont verbatim ; les traductions sont les miennes et sont présentées comme telles.

Je n'ai pas repris de statistique sur la fréquence de cette erreur : je n'en ai trouvé aucune que je puisse auditer. Ce que je décris ici est une mécanique documentée, pas une mesure.

Cet article ne contient aucune mesure de notre part et n'utilise aucune donnée d'aucun site utilisateur.

Sources

  1. Primaire Google Search Central, « Introduction to robots.txt » (robots.txt n'est pas un mécanisme pour tenir une page à l'écart de Google ; une page interdite peut être indexée si elle est liée ailleurs ; résultat sans description ; interprétation variable selon les robots). Dernière mise à jour affichée : 10 décembre 2025. developers.google.com. Consultée le 25 juillet 2026.

D'où je parle, et ce que ça vous coûte

Je dirige Rank Press, qui édite des agents IA pour WordPress. J'ai donc un intérêt direct dans les sujets traités ici, et le cacher serait malhonnête. C'est précisément pour ça que cette publication ne contient aucun argumentaire de vente : ce que vous venez de lire doit tenir debout même si vous n'achetez jamais rien chez nous.

Si le sujet vous concerne côté site, l'un de nos agents est gratuit et publié sur le répertoire officiel de WordPress : il pose les données structurées, la fiche de marque publique et les signaux destinés aux robots d'IA, sans compte ni clé API. Vous pouvez tout aussi bien refermer cette page sans rien installer, c'est le principe.

Une erreur dans cet article, une source qui contredit ce que j'écris, ou un point que j'aurais mal compris : écrivez-moi à contact@rankpress.com. Je corrige ce qui doit l'être.

Cet article fait partie de l'Observatoire Rank Press, une publication qui lit les documentations officielles pour vous.