Glossaire

Qu'est-ce que le fichier robots.txt ?

robots.txt est un fichier texte à la racine d'un site web qui indique aux robots quelles parties du site ils peuvent lire, selon le protocole d'exclusion des robots (RFC 9309) — et c'est là que l'accès des robots d'IA est accordé ou refusé.

Comment robots.txt contrôle-t-il la visibilité IA ?

Chaque grand robot d'IA — GPTBot, ClaudeBot, PerplexityBot, Google-Extended — consulte robots.txt avant de lire et honore ce qu'il y trouve. Un « Disallow: / » résiduel sous un user-agent joker, écrit il y a des années pour une autre raison, retire silencieusement un site des données d'entraînement, des index de recherche IA et de la récupération en direct d'un coup. Le fichier est minuscule ; son rayon d'action ne l'est pas.

# Autoriser un robot d'IA précis
User-agent: GPTBot
Allow: /

# En bloquer un, autoriser les autres
User-agent: CCBot
Disallow: /

Les lignes exactes de chaque robot

Que ne peut pas contrôler robots.txt ?

La couche réseau. Les CDN et pare-feux décident si la requête d'un robot atteint jamais votre serveur — Cloudflare bloque les robots d'IA par défaut pour de nombreux comptes — et aucune directive robots.txt ne peut passer outre une connexion bloquée. Auditer l'accès signifie vérifier les deux couches, c'est pourquoi SeeGeo teste l'accessibilité réelle de chaque robot au lieu de lire vos règles et de supposer.

Quelle est l'erreur robots.txt la plus courante ?

Le blocage global résiduel : un « User-agent: * / Disallow: / » écrit pour un site de préproduction et livré en production, ou une vieille règle bloquant un répertoire dont les robots modernes ont besoin. Comme le fichier échoue en silence — rien ne casse, vous disparaissez simplement — ces erreurs survivent des années. Revérifiez-le après chaque migration, et testez ce que les robots vivent réellement plutôt que ce que le fichier semble dire.

Questions fréquentes

Que signifie le fichier robots.txt ?

robots.txt est un fichier texte à la racine d'un site web qui indique aux robots quelles parties du site ils peuvent lire, selon le protocole d'exclusion des robots (RFC 9309) — et c'est là que l'accès des robots d'IA est accordé ou refusé.

Les entreprises d'IA respectent-elles vraiment robots.txt ?

Les grands opérateurs — OpenAI, Anthropic, Google, Perplexity — s'y engagent publiquement et s'y conforment de façon observable. Des cas limites existent parmi les petits scrapers, mais le problème dominant dans la réalité est l'inverse : des sites qui bloquent des robots légitimes par accident.

Que fait « User-agent: * » aux robots d'IA ?

Le joker s'applique à tout robot sans règle plus spécifique — y compris tous les robots d'IA. Un « Disallow: / » sous ce joker bloque tout pour tout le monde, ce qui est la façon accidentelle la plus courante de disparaître des réponses IA.

Où placer robots.txt ?

Exactement à la racine : votresite.com/robots.txt. Les robots ne regardent que là — un robots.txt dans un sous-répertoire est entièrement ignoré, et un fichier absent signifie aucune règle, ce qui autorise tout.

Votre site est-il lisible par l'IA aujourd'hui ? L'audit gratuit SeeGeo vérifie l'accès des robots (les 16), la structure et l'extractibilité du contenu en moins d'une demi-minute.

Lancer un audit gratuit

À lire aussi