Pour la plupart des marques qui veulent être citées par les moteurs IA, autorisez dans robots.txt les crawlers de recherche (OAI-SearchBot, Claude-SearchBot, PerplexityBot) et traitez les contrôles d'entraînement (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended) comme une décision de licence distincte. robots.txt reste volontaire, et certains agents déclenchés par l'utilisateur, comme Perplexity-User, peuvent l'ignorer.
Trois familles de crawlers IA : recherche, entraînement et agents utilisateurs
robots.txt est un fichier texte, à la racine de chaque hôte, qui indique aux crawlers les chemins autorisés. Il formule une demande et ne bloque rien techniquement. Les crawlers de recherche récupèrent des pages que les moteurs pourront citer, ceux d'entraînement collectent du contenu pour les modèles, et les agents utilisateurs récupèrent la page qu'une personne demande à un assistant de lire.
Chaque agent se règle séparément. Selon la documentation d'OpenAI, vérifiée le 10 octobre 2026, un webmaster « peut autoriser OAI-SearchBot pour apparaître dans les résultats de recherche tout en interdisant GPTBot ».
Les user agents documentés par éditeur, en un tableau
| Éditeur | User agent | Rôle | Respecte robots.txt (doc de l'éditeur) | Vérifié le |
|---|---|---|---|---|
| OpenAI | OAI-SearchBot | Recherche | Oui, indépendamment de GPTBot | 2026-10-10 |
| OpenAI | GPTBot | Entraînement | Oui, indépendamment d'OAI-SearchBot | 2026-10-10 |
| OpenAI | ChatGPT-User | Utilisateur | Peut ne pas s'appliquer aux requêtes d'utilisateurs | 2026-10-10 |
| Anthropic | Claude-SearchBot | Recherche | Oui, tous les bots Anthropic | 2026-10-10 |
| Anthropic | ClaudeBot | Entraînement | Oui | 2026-10-10 |
| Anthropic | Claude-User | Utilisateur | Oui | 2026-10-10 |
| Perplexity | PerplexityBot | Recherche | Non précisé | 2026-10-10 |
| Perplexity | Perplexity-User | Utilisateur | L'ignore en général | 2026-10-10 |
| Google-Extended | Entraînement | Oui ; sans effet sur Google Search | 2026-10-10 | |
| Apple | Applebot-Extended | Entraînement | Oui, opt-out documenté | 2026-10-10 |
Google-Extended et Applebot-Extended sont des tokens d'opt-out déclarés dans robots.txt, pas des crawlers distincts qui récupèrent des pages.
Autoriser la recherche IA, trancher l'entraînement à part : les règles robots.txt par objectif
Un crawler suit le groupe User-agent le plus spécifique qui le nomme et ignore alors *. Créer un groupe nommé pour un bot lui fait perdre les règles qu'il lisait sous * : répétez celles qu'il doit garder. Dans un groupe, le Robots Exclusion Protocol précise que « la correspondance la plus spécifique trouvée DOIT être utilisée » : le chemin le plus long l'emporte.
Refuser l'entraînement relève d'un choix de licence et d'usage des données ; OpenAI documente ses réglages de recherche et d'entraînement comme indépendants.
Apparaître dans la recherche IA, refuser l'entraînement
# Recherche : autorisée, chemin privé répété
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Disallow: /admin/
# Entraînement : refusé
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /
User-agent: *
Disallow: /admin/
Bloquer tous les crawlers IA
User-agent: OAI-SearchBot
User-agent: GPTBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: ClaudeBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /
Googlebot n'est pas concerné : Google Search reste intact.
Tout autoriser
User-agent: *
Allow: /
Ce modèle autorise aussi l'usage pour l'entraînement.
Les limites de robots.txt face aux crawlers IA
Respecter le fichier reste volontaire, et rien ne peut l'imposer. La documentation de Perplexity indique que son agent utilisateur « ignore en général les règles robots.txt ». Une URL bloquée peut encore apparaître comme simple lien si d'autres sites y renvoient. Pour exclure un contenu des résultats, utilisez noindex, X-Robots-Tag ou une authentification ; un crawler bloqué par robots.txt ne voit jamais le noindex.
Google-Extended et AI Overviews
Selon la documentation de Google, vérifiée le 10 octobre 2026, Google-Extended n'affecte ni l'inclusion ni le classement dans Google Search. Elle ne relie pas ce token aux AI Overviews, une fonctionnalité de Search : nous en déduisons que Googlebot les gouverne.
Contenu déjà collecté
Aucune documentation d'éditeur vérifiée le 10 octobre 2026 n'indique qu'une nouvelle règle Disallow supprime le contenu déjà collecté.
Sous-domaines, CDN et hôtes de préproduction
Chaque hôte, sous-domaines, sites de préproduction et noms d'hôte de CDN compris, exige son propre robots.txt. Selon la documentation de Cloudflare, vérifiée le 10 octobre 2026, son réglage géré « placera notre robots.txt géré avant votre robots.txt existant ».
Vérifier dans vos logs serveur que les crawlers IA suivent vos règles
Une chaîne user-agent ne prouve rien : n'importe qui peut l'envoyer.
- Filtrez les logs sur les user agents documentés.
- Comparez les IP sources aux plages publiées, comme openai.com/gptbot.json et openai.com/searchbot.json.
- Utilisez le DNS inverse quand l'éditeur le documente.
- Confrontez les chemins récupérés à vos règles Disallow, une fois le fichier relu par les crawlers.
Des requêtes vers des chemins interdits depuis des IP vérifiées signalent un non-respect ; depuis d'autres IP, une usurpation.
Autoriser les crawlers IA augmente-t-il les citations ?
Autoriser les crawlers de recherche est un préalable à la citation, pas une garantie. OpenAI relie l'autorisation d'OAI-SearchBot à l'apparition dans les résultats de recherche, mais aucune de nos sources ne mesure un gain de citations. Bloquer garde le contrôle et retire l'éligibilité ; autoriser donne l'éligibilité, rien de plus. Être cité dépend ensuite de la façon dont les moteurs IA choisissent les sources qu'ils citent.
Par où commencer cette semaine
- Récupérez le robots.txt en ligne sur chaque hôte.
- Listez les agents IA dotés d'un groupe nommé et ceux qui retombent sur
*. - Choisissez avec le client l'un des trois objectifs, appliquez son modèle, puis poursuivez la checklist d'audit GEO, en commençant par l'accès des crawlers.
- Après quelques jours, confrontez les logs aux fichiers d'IP.
- Revérifiez la documentation des éditeurs chaque trimestre, car les noms d'agents changent.
Une fois votre robots.txt aligné sur l'objectif choisi, lancez un scan Namedrop gratuit pour voir quels moteurs citent aujourd'hui votre marque et quels concurrents ils citent à sa place.
Sources
- OpenAI, Overview of OpenAI Crawlers, consulté le 2026-10-10
- Anthropic (Claude Help Center), Does Anthropic crawl data from the web, and how can site owners block the crawler?, consulté le 2026-10-10
- Perplexity, Perplexity Crawlers, consulté le 2026-10-10
- Apple, About Applebot - Apple Support, consulté le 2026-10-10
- IETF (RFC Editor), RFC 9309: Robots Exclusion Protocol, consulté le 2026-10-10
- Google, Google's common crawlers, consulté le 2026-10-10
- Cloudflare, robots.txt setting - Cloudflare bot solutions docs, consulté le 2026-10-10