---
title: "Qu'est-ce qu'un robot d'IA ?"
description: "Les robots d'IA lisent votre site pour l'entraînement, la recherche IA ou les réponses en direct. Les trois types, et pourquoi l'accès décide de tout."
canonical: https://see-geo.com/fr/glossary/ai-crawler
language: fr
published: 2026-09-08
updated: 2026-09-08
publisher: SeeGeo
alternates:
  en: https://see-geo.com/glossary/ai-crawler
  de: https://see-geo.com/de/glossary/ai-crawler
---

# Qu'est-ce qu'un robot d'IA ?

Un robot d'IA (AI crawler) est un programme automatisé qui lit des pages web pour le compte d'un système d'IA — pour les données d'entraînement (GPTBot, ClaudeBot), pour un index de recherche IA (OAI-SearchBot, PerplexityBot), ou en direct, en pleine conversation (ChatGPT-User, Claude-User).

## Quels sont les trois types de robots d'IA ?

Les robots d'entraînement (GPTBot, ClaudeBot, Google-Extended, CCBot) collectent le texte dont les futurs modèles apprennent — les bloquer échange la connaissance de votre entreprise par les futurs modèles contre l'exclusion du contenu des données d'entraînement. Les robots d'index (OAI-SearchBot, PerplexityBot) alimentent les produits de recherche IA ; les bloquer vous retire directement de ces réponses. Les récupérateurs en direct (ChatGPT-User, Claude-User, Perplexity-User) vont chercher une page à la demande quand un assistant en a besoin en pleine réponse.

[Les 16 robots, expliqués un par un](https://see-geo.com/fr/bots)

## Pourquoi le rendu JavaScript compte-t-il autant ?

Presque tous les robots d'IA lisent le HTML brut et n'exécutent pas JavaScript. Un site qui dessine son contenu côté client — courant avec React, Vue et les constructeurs de sites — sert à ces robots une page effectivement vide. C'est la conclusion la plus dommageable que produit l'audit SeeGeo, parce qu'elle annule silencieusement tous les autres efforts : pour une IA, le site ne dit rien du tout.

## Comment les sites bloquent-ils les robots d'IA par accident ?

De deux façons : des règles robots.txt résiduelles écrites pour un autre usage, et la protection anti-bot du CDN — Cloudflare en particulier bloque les robots d'IA par défaut pour de nombreux comptes, au niveau réseau, là où robots.txt ne peut rien. Des sites sont couramment invisibles pour l'IA sans que personne ne l'ait décidé. Un audit qui vérifie chaque robot individuellement est le moyen de le découvrir.

[Vérifier votre site gratuitement](https://see-geo.com/fr)

## Questions fréquentes

### Que signifie un robot d'IA ?

Un robot d'IA (AI crawler) est un programme automatisé qui lit des pages web pour le compte d'un système d'IA — pour les données d'entraînement (GPTBot, ClaudeBot), pour un index de recherche IA (OAI-SearchBot, PerplexityBot), ou en direct, en pleine conversation (ChatGPT-User, Claude-User).

### Dois-je bloquer les robots d'IA ?

C'est un vrai arbitrage, pas un défaut. Bloquer les robots d'entraînement garde le contenu hors des futurs modèles au prix de leur connaissance de votre existence ; bloquer les robots d'index et les récupérateurs en direct vous retire purement et simplement des réponses IA. Si être recommandé compte pour votre entreprise, la plupart des robots devraient rester autorisés.

### Les robots d'IA respectent-ils robots.txt ?

Les principaux — ceux d'OpenAI, Anthropic, Google, Perplexity — s'engagent publiquement à honorer robots.txt (RFC 9309) et le font en pratique. Le problème concret est généralement l'inverse : des sites qui bloquent des robots sans le vouloir, pas des robots qui ignorent les règles.

### Comment voir quels robots d'IA peuvent lire mon site ?

Vérifiez robots.txt pour le user agent de chaque robot, puis ce que fait votre CDN au niveau réseau — la partie que robots.txt ne montre pas. L'audit gratuit SeeGeo teste individuellement les seize principaux robots de recherche et d'IA et rapporte l'accès de chacun.

## Pages liées

- [Qu'est-ce que le fichier robots.txt ?](https://see-geo.com/fr/glossary/robots-txt)
- [Qu'est-ce que les données d'entraînement des LLM ?](https://see-geo.com/fr/glossary/llm-training-data)
- [Qu'est-ce que l'extractibilité du contenu ?](https://see-geo.com/fr/glossary/content-extractability)
