J'ai déjà écrit ici que Google, OpenAI et Perplexity documentent tous les trois, noir sur blanc, que leurs récupérateurs déclenchés par un utilisateur ignorent généralement robots.txt. En relisant la page officielle des robots de Meta, mise à jour en mai 2026, j'ai trouvé la même mention, deux fois. Et deux autres choses que personne n'écrit en français.
« The Meta-ExternalFetcher crawler fetches individual links at a user's request and supports product functions such as evaluating and improving agentic AI capabilities [...]. Accordingly, this crawler may bypass robots.txt rules. »
Ma traduction : le robot Meta-ExternalFetcher récupère des liens individuels à la demande d'un utilisateur et sert des fonctions produit comme l'évaluation et l'amélioration des capacités d'IA agentique (la page cite l'exemple d'une IA qui navigue sur des sites pour accomplir des tâches pour l'utilisateur). En conséquence, ce robot peut passer outre les règles de robots.txt. Source : Meta, « Meta Web Crawlers », developers.facebook.com, mise à jour affichée le 21 mai 2026, consultée le 15 août 2026.
C'est désormais le quatrième éditeur majeur à l'écrire de lui-même, avec les mêmes mots ou presque. La logique est chaque fois la même : quand c'est un humain qui demande une page précise à son assistant, l'éditeur considère que la visite relève de l'utilisateur, pas de l'exploration automatique que robots.txt encadre.
« Note that the FacebookExternalHit crawler might bypass robots.txt when performing security or integrity checks, such as checking for malware or malicious content. »
Ma traduction : notez que le robot FacebookExternalHit peut passer outre robots.txt quand il effectue des contrôles de sécurité ou d'intégrité, comme la vérification de logiciels ou de contenus malveillants. Source : même page, consultée le 15 août 2026.
facebookexternalhit, c'est le robot des aperçus de liens : celui qui visite votre page quand quelqu'un la partage sur Facebook ou WhatsApp. Il est dans les journaux de tous les sites du monde. Et sa propre documentation dit qu'un blocage robots.txt ne garantit pas son absence.
« The Meta-WebIndexer crawler navigates the web to improve Meta AI search result quality for users. [...] Allowing Meta-WebIndexer in your robots.txt file helps us cite and link to your content in Meta AI's responses. »
Ma traduction : le robot Meta-WebIndexer parcourt le web pour améliorer la qualité des résultats de recherche de Meta AI. Autoriser Meta-WebIndexer dans votre fichier robots.txt nous aide à citer votre contenu et à créer des liens vers lui dans les réponses de Meta AI. Source : même page, consultée le 15 août 2026.
C'est exactement la mécanique que j'ai documentée chez OpenAI et Anthropic il y a deux jours : chaque éditeur nomme le robot qui conditionne la citation, et bloquer « tous les robots IA » d'un bloc, comme le proposent certaines listes toutes faites, coupe aussi ce canal-là. Chez Meta, l'entraînement des modèles, lui, passe par un autre agent, Meta-ExternalAgent, décrit comme servant « training foundation AI models ». Un robot par usage, et des conséquences différentes pour chacun.
La balise « NoAI » ne signale rien à Meta, et c'est Meta qui le dit. Des tutoriels francophones recommandent d'ajouter des balises « NoAI » dans ses pages pour se protéger des IA. La page officielle les balaie en une phrase : « We make it easy for site managers and content owners to indicate their preferences by using industry-standard practices like robots.txt rather than non-standard formats like NoAI tags » (nous permettons d'indiquer ses préférences par des pratiques standard comme robots.txt, plutôt que par des formats non standard comme les balises NoAI). Une balise NoAI sur vos pages n'est pas lue par les robots de Meta. Le levier documenté, c'est robots.txt, robot par robot.
Si vous avez bloqué « les robots IA » avec une liste toute faite : vérifiez ce qu'elle contient. Bloquer Meta-ExternalAgent est un choix légitime (c'est le robot d'entraînement). Bloquer Meta-WebIndexer, c'est renoncer à être cité dans les réponses de Meta AI, et la page le dit. Ce sont deux décisions différentes.
Si vous comptiez sur une balise NoAI : elle ne signale rien aux robots de Meta. Déplacez vos préférences dans robots.txt, le seul canal que cette documentation reconnaît.
Si vous voyez facebookexternalhit malgré un blocage : ce n'est pas forcément une usurpation. Sa propre documentation prévoit qu'il passe outre pour des contrôles de sécurité.
J'ai téléchargé la page officielle le 15 août 2026 et je l'ai analysée en texte intégral. Les citations sont reprises mot pour mot dans leur langue d'origine, avec ma traduction annoncée comme telle.
Un repérage automatisé m'a signalé cette page parmi d'autres ; conformément à la méthode de l'Observatoire, je l'ai rouverte et relue moi-même avant d'écrire, et seules les phrases que j'ai retrouvées dans le texte téléchargé sont citées ici.
Cet article ne contient aucune mesure de notre part et n'utilise aucune donnée d'aucun site utilisateur.
Je dirige Rank Press, qui édite des agents IA pour WordPress, dont un agent qui gère les signaux adressés aux robots d'IA. Un article qui montre que ces signaux demandent un réglage robot par robot sert donc notre discours. Ma défense est la même qu'à chaque fois : les citations sont verbatim, la source est publique, et vous pouvez régler votre robots.txt vous-même, sans nous.
Si le sujet vous concerne côté site, l'un de nos agents est gratuit et publié sur le répertoire officiel de WordPress, sans compte ni clé API. Vous pouvez tout aussi bien refermer cette page sans rien installer, c'est le principe.
Une erreur dans cet article, une source qui contredit ce que j'écris, ou un point que j'aurais mal compris : écrivez-moi à contact@rankpress.com. Je corrige ce qui doit l'être.
Cet article fait partie de l'Observatoire Rank Press, une publication qui lit les documentations officielles pour vous.