Aller au contenu
Vos 9 agents IA
Composer mon équipe IA Ressources Tarifs Tester mon site Voir mon potentiel
Observatoire Rank Press
Ce qui a changé Publié le 23 août 2026 · sources vérifiées le 15 août 2026

La vieille balise noarchive, enterrée avec le cache de Google, revient comme refus d'entraînement IA chez Amazon

L'essentiel

  • noarchive est une balise des années 2000 : elle demandait aux moteurs de ne pas montrer leur copie « en cache » d'une page. Google a retiré ce cache, la balise semblait morte.
  • La documentation d'Amazonbot lui donne une seconde vie, écrite entre parenthèses : noarchive y signifie « ne pas utiliser la page pour l'entraînement de modèle ».
  • C'est un refus d'entraînement page par page, là où robots.txt ne sait raisonner que par robot et par répertoire : une granularité que presque personne ne connaît.
  • La même ligne documente le respect de noindex, none, et du nofollow au niveau du lien : la famille des balises meta robots reste vivante chez Amazon.
  • ⚠ Comportement documenté chez UN éditeur : ne généralisez pas. Chaque opérateur donne son propre sens aux balises, c'est le fil rouge de cette série.
Wen Dasnois
Wen DasnoisFondateur de Rank Press. J'ai ouvert et lu chaque source citée ici le 15 août 2026. LinkedIn · Ma page auteur

Il y a des balises qu'on croyait pouvoir rayer des checklists. noarchive en faisait partie : née à l'époque où chaque résultat de recherche proposait sa copie « en cache », elle demandait aux moteurs de ne pas montrer cette copie. Google a retiré le lien de cache de ses résultats, la raison d'être de la balise semblait partie avec. Puis je suis tombé, dans la documentation d'Amazonbot, sur une parenthèse qui la ressuscite pour un tout autre usage.

La parenthèse qui change le sens

« When these user agents access web pages they respect the link-level rel=nofollow directive, and page level robots meta tags of noarchive (do not use the page for model training), noindex (do not index the page) and none (do not index the page). »

Ma traduction : quand ces agents accèdent à des pages web, ils respectent la directive rel=nofollow au niveau du lien, et les balises meta robots au niveau de la page : noarchive (ne pas utiliser la page pour l'entraînement de modèle), noindex (ne pas indexer la page) et none (ne pas indexer la page). Source : Amazon, « Amazonbot », developer.amazon.com, sans date de mise à jour affichée, consultée le 15 août 2026.

Relisez la parenthèse après noarchive : « do not use the page for model training ». Amazon a pris une balise dont le sens historique était « ne montre pas ta copie » et l'a réinterprétée en « n'utilise pas cette page pour entraîner de modèle ». Le glissement a une logique (dans les deux cas, on refuse une réutilisation de la page au-delà du résultat de recherche), mais c'est bien un sens NOUVEAU, donné par UN éditeur, dans SA documentation.

Pourquoi c'est plus intéressant qu'une curiosité

Parce que ça comble un vrai trou. Le refus d'entraînement, jusqu'ici, se jouait dans robots.txt : par robot, et par répertoire. Impossible d'y dire « entraîne-toi sur mon blog, mais pas sur cette page-ci ». Une balise meta, elle, vit DANS la page : le refus devient possible page par page, à l'unité. Pour un site qui veut laisser ses contenus généraux ouverts mais protéger quelques pages sensibles (une étude propriétaire, une grille tarifaire, un contenu premium), c'est exactement la granularité qui manquait, au moins chez cet opérateur.

Et notez le reste de la phrase : le nofollow au niveau du lien, noindex, none. Toute la vieille famille des balises meta robots est explicitement respectée. Les fondamentaux d'il y a vingt ans sont devenus l'interface de négociation avec les robots d'IA : personne n'a inventé de nouveau standard, on recycle l'ancien, chacun à sa façon.

!

La limite, et elle est structurelle : ce sens de noarchive n'engage qu'Amazon. Aucun standard ne définit « noarchive = pas d'entraînement » : c'est l'interprétation d'UN éditeur, dans SA documentation. Chez d'autres opérateurs, la balise peut ne rien faire du tout, ou autre chose. C'est exactement ce que cette série documente depuis deux semaines avec crawl-delay (quatre réponses pour une ligne) et les jetons « -Extended » : chaque signal adressé aux robots vaut ce que la documentation de CHAQUE opérateur dit qu'il vaut, ni plus, ni moins. Poser noarchive « pour se protéger des IA » en général serait refaire l'erreur des balises NoAI, que Meta qualifie lui-même de format non standard.

Ce que ça change pour vous

Si vous avez quelques pages à protéger de l'entraînement chez Amazon sans fermer tout le site : la balise meta robots noarchive sur ces pages est le levier documenté, à l'unité, sans toucher à robots.txt.

Si noarchive traîne déjà sur tout votre site (héritage d'un vieux réglage ou d'une extension) : sachez qu'elle a maintenant un effet de bord chez Amazon : vous refusez l'entraînement sans l'avoir décidé. Ce n'est pas forcément un mal, mais c'est désormais une décision, plus un fossile.

Et pour la méthode : avant de poser un signal « anti-IA », cherchez la phrase exacte de l'opérateur visé. Cette série a maintenant documenté les leviers de Google, OpenAI, Anthropic, Meta, Amazon, Apple, Mistral et Perplexity : aucun ne se règle comme le voisin.

Comment j'ai travaillé

J'ai téléchargé la page officielle d'Amazonbot le 15 août 2026 et je l'ai analysée en texte intégral. La citation est reprise mot pour mot, avec ma traduction annoncée comme telle. La page n'affiche pas de date de mise à jour : je le signale plutôt que d'en inventer une.

L'histoire de noarchive (le cache retiré des résultats de Google) est donnée comme contexte général ; le cœur vérifiable de l'article est la parenthèse d'Amazon, citée telle quelle. Des pistes suggèrent qu'un autre grand opérateur donne aussi un rôle IA à cette balise, mais leur source n'a pas pu être relue depuis mon environnement : elles attendent, non publiées, conformément à notre méthode.

Cet article ne contient aucune mesure de notre part et n'utilise aucune donnée d'aucun site utilisateur.

Sources

  1. Primaire Amazon, « Amazonbot » (le respect des balises meta robots, avec la redéfinition de noarchive en refus d'entraînement de modèle ; nofollow au niveau du lien ; noindex et none). Sans date de mise à jour affichée. developer.amazon.com. Consultée et analysée en texte intégral le 15 août 2026.

À lire ensuite

D'où je parle, et ce que ça vous coûte

Je dirige Rank Press, qui édite des agents IA pour WordPress, dont un agent qui gère les signaux adressés aux robots d'IA. Un article qui montre que ces signaux se règlent balise par balise et opérateur par opérateur sert notre discours, et vous devez le savoir en me lisant. La citation est verbatim, la source est publique : tout se revérifie sans moi. Nous n'avons aucun lien commercial avec Amazon.

Si le sujet vous concerne côté site, l'un de nos agents est gratuit et publié sur le répertoire officiel de WordPress, sans compte ni clé API. Vous pouvez tout aussi bien refermer cette page sans rien installer, c'est le principe.

Une erreur dans cet article, une source qui contredit ce que j'écris, ou un point que j'aurais mal compris : écrivez-moi à contact@rankpress.com. Je corrige ce qui doit l'être.

Cet article fait partie de l'Observatoire Rank Press, une publication qui lit les documentations officielles pour vous.