·
Aller au contenu principal

Le journal GEO5 min de lecture

Quels crawlers IA autoriser dans robots.txt, et lesquels bloquer

Pour la plupart des marques qui veulent être citées par les moteurs IA, autorisez dans robots.txt les crawlers de recherche (OAI-SearchBot, Claude-SearchBot, PerplexityBot) et traitez les contrôles d'entraînement (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended) comme une décision de licence distincte. robots.txt reste volontaire, et certains agents déclenchés par l'utilisateur, comme Perplexity-User, peuvent l'ignorer.

Trois familles de crawlers IA : recherche, entraînement et agents utilisateurs

robots.txt est un fichier texte, à la racine de chaque hôte, qui indique aux crawlers les chemins autorisés. Il formule une demande et ne bloque rien techniquement. Les crawlers de recherche récupèrent des pages que les moteurs pourront citer, ceux d'entraînement collectent du contenu pour les modèles, et les agents utilisateurs récupèrent la page qu'une personne demande à un assistant de lire.

Chaque agent se règle séparément. Selon la documentation d'OpenAI, vérifiée le 10 octobre 2026, un webmaster « peut autoriser OAI-SearchBot pour apparaître dans les résultats de recherche tout en interdisant GPTBot ».

Les user agents documentés par éditeur, en un tableau

ÉditeurUser agentRôleRespecte robots.txt (doc de l'éditeur)Vérifié le
OpenAIOAI-SearchBotRechercheOui, indépendamment de GPTBot2026-10-10
OpenAIGPTBotEntraînementOui, indépendamment d'OAI-SearchBot2026-10-10
OpenAIChatGPT-UserUtilisateurPeut ne pas s'appliquer aux requêtes d'utilisateurs2026-10-10
AnthropicClaude-SearchBotRechercheOui, tous les bots Anthropic2026-10-10
AnthropicClaudeBotEntraînementOui2026-10-10
AnthropicClaude-UserUtilisateurOui2026-10-10
PerplexityPerplexityBotRechercheNon précisé2026-10-10
PerplexityPerplexity-UserUtilisateurL'ignore en général2026-10-10
GoogleGoogle-ExtendedEntraînementOui ; sans effet sur Google Search2026-10-10
AppleApplebot-ExtendedEntraînementOui, opt-out documenté2026-10-10

Google-Extended et Applebot-Extended sont des tokens d'opt-out déclarés dans robots.txt, pas des crawlers distincts qui récupèrent des pages.

Autoriser la recherche IA, trancher l'entraînement à part : les règles robots.txt par objectif

Un crawler suit le groupe User-agent le plus spécifique qui le nomme et ignore alors *. Créer un groupe nommé pour un bot lui fait perdre les règles qu'il lisait sous * : répétez celles qu'il doit garder. Dans un groupe, le Robots Exclusion Protocol précise que « la correspondance la plus spécifique trouvée DOIT être utilisée » : le chemin le plus long l'emporte.

Refuser l'entraînement relève d'un choix de licence et d'usage des données ; OpenAI documente ses réglages de recherche et d'entraînement comme indépendants.

Apparaître dans la recherche IA, refuser l'entraînement

# Recherche : autorisée, chemin privé répété
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Disallow: /admin/

# Entraînement : refusé
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /

User-agent: *
Disallow: /admin/

Bloquer tous les crawlers IA

User-agent: OAI-SearchBot
User-agent: GPTBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: ClaudeBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /

Googlebot n'est pas concerné : Google Search reste intact.

Tout autoriser

User-agent: *
Allow: /

Ce modèle autorise aussi l'usage pour l'entraînement.

Les limites de robots.txt face aux crawlers IA

Respecter le fichier reste volontaire, et rien ne peut l'imposer. La documentation de Perplexity indique que son agent utilisateur « ignore en général les règles robots.txt ». Une URL bloquée peut encore apparaître comme simple lien si d'autres sites y renvoient. Pour exclure un contenu des résultats, utilisez noindex, X-Robots-Tag ou une authentification ; un crawler bloqué par robots.txt ne voit jamais le noindex.

Google-Extended et AI Overviews

Selon la documentation de Google, vérifiée le 10 octobre 2026, Google-Extended n'affecte ni l'inclusion ni le classement dans Google Search. Elle ne relie pas ce token aux AI Overviews, une fonctionnalité de Search : nous en déduisons que Googlebot les gouverne.

Contenu déjà collecté

Aucune documentation d'éditeur vérifiée le 10 octobre 2026 n'indique qu'une nouvelle règle Disallow supprime le contenu déjà collecté.

Sous-domaines, CDN et hôtes de préproduction

Chaque hôte, sous-domaines, sites de préproduction et noms d'hôte de CDN compris, exige son propre robots.txt. Selon la documentation de Cloudflare, vérifiée le 10 octobre 2026, son réglage géré « placera notre robots.txt géré avant votre robots.txt existant ».

Vérifier dans vos logs serveur que les crawlers IA suivent vos règles

Une chaîne user-agent ne prouve rien : n'importe qui peut l'envoyer.

  • Filtrez les logs sur les user agents documentés.
  • Comparez les IP sources aux plages publiées, comme openai.com/gptbot.json et openai.com/searchbot.json.
  • Utilisez le DNS inverse quand l'éditeur le documente.
  • Confrontez les chemins récupérés à vos règles Disallow, une fois le fichier relu par les crawlers.

Des requêtes vers des chemins interdits depuis des IP vérifiées signalent un non-respect ; depuis d'autres IP, une usurpation.

Autoriser les crawlers IA augmente-t-il les citations ?

Autoriser les crawlers de recherche est un préalable à la citation, pas une garantie. OpenAI relie l'autorisation d'OAI-SearchBot à l'apparition dans les résultats de recherche, mais aucune de nos sources ne mesure un gain de citations. Bloquer garde le contrôle et retire l'éligibilité ; autoriser donne l'éligibilité, rien de plus. Être cité dépend ensuite de la façon dont les moteurs IA choisissent les sources qu'ils citent.

Par où commencer cette semaine

  • Récupérez le robots.txt en ligne sur chaque hôte.
  • Listez les agents IA dotés d'un groupe nommé et ceux qui retombent sur *.
  • Choisissez avec le client l'un des trois objectifs, appliquez son modèle, puis poursuivez la checklist d'audit GEO, en commençant par l'accès des crawlers.
  • Après quelques jours, confrontez les logs aux fichiers d'IP.
  • Revérifiez la documentation des éditeurs chaque trimestre, car les noms d'agents changent.

Une fois votre robots.txt aligné sur l'objectif choisi, lancez un scan Namedrop gratuit pour voir quels moteurs citent aujourd'hui votre marque et quels concurrents ils citent à sa place.

Sources

Questions fréquentes

Bloquer Google-Extended retire-t-il mon site des AI Overviews ?
La documentation de Google sur ses crawlers, vérifiée le 10 octobre 2026, indique que Google-Extended n'affecte pas l'inclusion d'un site dans la recherche Google et ne sert pas de signal de classement. Le texte vérifié ne relie pas ce token aux AI Overviews. Comme les AI Overviews sont une fonctionnalité de la recherche, nous en déduisons que l'accès de Googlebot, et non Google-Extended, les gouverne. Consultez la page de Google avant de modifier l'une ou l'autre règle.
robots.txt est-il juridiquement contraignant pour les entreprises d'IA ?
Aucune source de cet article ne tranche la question. robots.txt est un protocole volontaire défini par l'IETF : il exprime vos préférences, les crawlers conformes les suivent, et rien n'empêche techniquement les autres de les ignorer. Toute portée juridique dépend de la juridiction, des contrats et des conditions d'utilisation, et cette réponse ne constitue pas un conseil juridique. Pour un contenu qui doit rester privé, utilisez une authentification plutôt que robots.txt.
Puis-je voir les visites des crawlers IA dans mes logs serveur ?
Oui. Filtrez vos logs d'accès sur les user agents documentés, comme GPTBot, OAI-SearchBot ou PerplexityBot. Comme n'importe qui peut envoyer une chaîne user-agent, comparez chaque IP source aux plages publiées par l'éditeur, comme openai.com/gptbot.json et openai.com/searchbot.json. Des requêtes interdites venant d'IP vérifiées traduisent un non-respect ; le même nom venant d'autres IP traduit une usurpation.
Ajouter une règle Disallow supprime-t-il le contenu déjà collecté par les entreprises d'IA ?
Pas d'après la documentation que nous avons consultée. Les pages d'éditeurs vérifiées le 10 octobre 2026 expliquent comment arrêter les collectes futures, et aucune n'indique qu'une nouvelle règle Disallow efface le contenu collecté auparavant. Considérez qu'un Disallow s'applique à partir de la prochaine lecture de votre fichier par un crawler, et contactez directement l'éditeur si vous devez faire supprimer des données déjà collectées.
llms.txt remplace-t-il robots.txt pour les crawlers IA ?
Non. llms.txt est une convention proposée, pas un standard de l'IETF, et il ne contrôle pas le crawl : il suggère des contenus à lire aux modèles de langage. Les règles qui autorisent ou bloquent un crawler restent dans robots.txt, selon le Robots Exclusion Protocol. Un site peut publier les deux fichiers, mais seul robots.txt porte les règles d'accès que vérifient les crawlers conformes.