# robots.txt — web-consulting.fr # # Les éditeurs d'IA séparent désormais les crawlers d'ENTRAÎNEMENT et les crawlers # de RECHERCHE. Ce sont des agents distincts, contrôlables indépendamment. # Bloquer GPTBot ne retire pas de ChatGPT Search : c'est OAI-SearchBot qui décide. # # Vérifier que la couche au-dessus (WAF, rate limit) ne bloque pas silencieusement : # curl -A "OAI-SearchBot" -I https://web-consulting.fr/ # ─── Moteurs classiques ────────────────────────────────────────────── User-agent: Googlebot Allow: / User-agent: Googlebot-Image Allow: / User-agent: Googlebot-Video Allow: / User-agent: Bingbot Allow: / # ─── Recherche IA : toujours autoriser ─────────────────────────────── # Ce sont eux qui décident de la présence dans les réponses. Les bloquer, # c'est disparaître des moteurs de réponse sans gagner quoi que ce soit. User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: Claude-SearchBot Allow: / User-agent: Claude-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: / User-agent: Applebot Allow: / User-agent: Amzn-SearchBot Allow: / # ─── Entraînement : décision assumée ───────────────────────────────── # Site commercial : autorisé. La présence dans le corpus construit la mémoire # de marque. Un éditeur qui vit de son audience arbitrerait autrement. User-agent: GPTBot Allow: / User-agent: ClaudeBot Allow: / # Jeton Google pour l'entraînement Gemini/Vertex et le grounding. # Le nom exact est « Google-Extended » — « Googlebot-Extended » n'existe pas # et la directive était donc sans effet. User-agent: Google-Extended Allow: / User-agent: Applebot-Extended Allow: / User-agent: meta-externalagent Allow: / User-agent: Meta-ExternalFetcher Allow: / User-agent: Amazonbot Allow: / User-agent: anthropic-ai Allow: / # ─── Aspirateurs sans contrepartie ─────────────────────────────────── # Ni recherche, ni citation, ni trafic. Rien à gagner à les servir. User-agent: CCBot Disallow: / User-agent: Bytespider Disallow: / # ─── Défaut ────────────────────────────────────────────────────────── # Pas de Crawl-delay ici : il ralentissait tous les agents non nommés, # y compris des moteurs de réponse, sans que le serveur en ait besoin. User-agent: * Allow: / Disallow: /*?*utm_ Disallow: /*?q= Sitemap: https://web-consulting.fr/sitemap-index.xml