---
title: "Nous avons audité 107 sites de petites entreprises pour la visibilité IA. Le problème n'est pas celui qu'on croit"
description: "Notre moteur d'audit sur 107 vrais sites de petites entreprises dans 7 pays : seuls 2,8 % bloquent les crawlers IA. Les vraies failles sont ailleurs."
canonical: https://see-geo.com/fr/blog/how-many-websites-block-ai-crawlers
language: fr
published: 2026-08-17
author: "SeeGeo Team"
publisher: SeeGeo
alternates:
  en: https://see-geo.com/blog/how-many-websites-block-ai-crawlers
  de: https://see-geo.com/de/blog/how-many-websites-block-ai-crawlers
---

# Nous avons audité 107 sites de petites entreprises pour la visibilité IA. Le problème n'est pas celui qu'on croit

> Notre moteur d'audit sur 107 vrais sites de petites entreprises dans 7 pays : seuls 2,8 % bloquent les crawlers IA. Les vraies failles sont ailleurs.

**Réponse rapide : nous avons passé 107 vrais sites de petites entreprises au moteur d'audit SeeGeo — restaurants, artisans, cabinets, boutiques, services professionnels aux États-Unis, au Royaume-Uni, au Canada, en Australie, en Irlande, en France et en Allemagne. Seuls 3 sites sur 107 (2,8 %) bloquent explicitement un crawler IA majeur dans robots.txt : le récit populaire « votre site bloque l'IA sans que vous le sachiez » est l'exception dans cet échantillon. Les vraies failles sont plus silencieuses : 29 sur 107 (27,1 %) n'ont aucune donnée structurée, 69 sur 107 (64,5 %) ne disent jamais clairement ce que fait l'entreprise en haut de la page d'accueil, et 101 sur 107 obtiennent la note C ou pire en visibilité IA globale. Une vraie surprise : 27 sur 107 (25,2 %) ont déjà un fichier llms.txt — et presque aucun propriétaire ne l'y a mis lui-même.** Chaque chiffre ci-dessous provient des exécutions réelles ; la méthodologie complète est publiée en fin d'article.

## Combien de sites de petites entreprises bloquent les crawlers IA ?

3 sur 107 (2,8 %). Ces trois-là nomment explicitement des crawlers IA dans des groupes robots.txt écrits à la main et leur interdisent tout le site. En comptant aussi les règles génériques qui attraperaient des bots IA au passage, le chiffre reste 3 sur 107 — aucun site de l'échantillon n'est bloqué à la racine pour un crawler IA par accident d'une règle `User-agent: *`.

Ce chiffre mérite qu'on s'y arrête, parce que le récit du secteur — le nôtre compris, parfois — repose sur l'idée que les petites entreprises sont invisibles pour l'IA parce que quelque chose bloque les crawlers. Dans cet échantillon, c'est l'exception. Presque tout le monde laisse entrer l'IA. C'est après l'entrée du crawler que la visibilité se perd.

## Quel crawler IA est le plus bloqué ?

| Crawler | Blocage explicite robots.txt | Tout blocage racine |
|---|---|---|
| GPTBot (OpenAI, entraînement) | 3 sur 107 (2,8 %) | 3 sur 107 (2,8 %) |
| ClaudeBot (Anthropic) | 3 sur 107 (2,8 %) | 3 sur 107 (2,8 %) |
| Google-Extended (entraînement Gemini) | 2 sur 107 (1,9 %) | 2 sur 107 (1,9 %) |
| CCBot (Common Crawl) | 2 sur 107 (1,9 %) | 2 sur 107 (1,9 %) |
| PerplexityBot | 1 sur 107 (0,9 %) | 1 sur 107 (0,9 %) |
| OAI-SearchBot (citations ChatGPT) | 0 sur 107 (0,0 %) | 0 sur 107 (0,0 %) |
| Googlebot | 0 sur 107 (0,0 %) | 0 sur 107 (0,0 %) |
| Bingbot | 0 sur 107 (0,0 %) | 0 sur 107 (0,0 %) |

GPTBot et ClaudeBot sont à égalité en tête avec 3 sites chacun. Fait notable : OAI-SearchBot — le crawler qui décide si ChatGPT peut *citer* un site — n'est bloqué par personne dans cet échantillon.

## Qui les a bloqués, et était-ce délibéré ?

Parmi les 3 sites bloqueurs : 2 montrent des règles robots.txt écrites à la main sans aucun signal CDN ou pare-feu, et 1 associe ses règles robots.txt à une façade Cloudflare. Tous trois nomment explicitement les bots IA dans leurs propres groupes robots.txt — cela ressemble à des décisions, pas à des réglages par défaut. 0 site sur 107 (0,0 %) porte la signature du robots.txt géré de Cloudflare dans cet échantillon.

Une réserve honnête dans l'autre sens : 31 des 107 sites audités (29,0 %) sont derrière Cloudflare, et un blocage de bots au niveau CDN qui ne laisse aucune signature externe n'est pas mesurable de l'extérieur. Nos chiffres robots.txt sont exacts ; nos chiffres CDN sont un plancher. (Un reçu tiré de notre propre exécution : un site a servi un HTTP 403 à notre crawler d'audit honnêtement identifié tout en servant une page normale à un navigateur — le filtrage réseau des bots est réel, et c'est pourquoi les sites qui ont bloqué *notre* vérificateur ont été exclus de toutes les statistiques au lieu d'être comptés comme « bloque l'IA ».)

## Le problème JavaScript est plus petit qu'annoncé

3 sites sur 107 (2,8 %) servent une page d'accueil dont le contenu principal n'existe pas sans exécution de JavaScript — or c'est ainsi que la plupart des crawlers IA lisent le web, donc ces trois-là sont effectivement vides pour l'IA. Nous en attendions davantage. Les constructeurs de sites modernes semblent assez bien pré-rendre côté serveur pour que l'avertissement « votre beau site JS est invisible », bien que réel, soit lui aussi l'exception dans cet échantillon.

## Les données structurées : là où l'échantillon échoue vraiment

- Aucune donnée structurée JSON-LD nulle part sur les pages crawlées : **29 sur 107 (27,1 %)**
- JSON-LD sur la page d'accueil : 75 sur 107 (70,1 %)
- JSON-LD au-delà de la page d'accueil : 69 sur 107 (64,5 %)
- Une déclaration claire « ce que nous faisons » en haut de la page d'accueil : seulement **38 sur 107 (35,5 %)** — autrement dit 69 sur 107 (64,5 %) laissent humains et machines deviner ce qu'est l'entreprise
- Notes globales du moteur d'audit : B 6 · C 38 · D 38 · F 25 — 101 sur 107 (94,4 %) notés C ou pire

Voilà la vraie forme du problème de visibilité IA des petites entreprises dans nos données : la porte est ouverte, mais la pièce n'a pas d'étiquette.

## La surprise llms.txt : une adoption par défaut

27 sites sur 107 (25,2 %) ont un fichier llms.txt — un chiffre qui suggérerait une adoption remarquable d'un jeune standard contesté. Il n'en est rien. Nous avons re-téléchargé et classé chacun d'eux :

- Chaque boutique Shopify de l'échantillon (8 sur 8) porte le llms.txt « Agent Instructions » auto-généré par Shopify.
- Chaque site Wix concerné porte le fichier markdown auto-généré par Wix.
- Plusieurs sites WordPress ont un fichier généré par le plugin All in One SEO, qui y appose sa propre signature.

Autrement dit : **les plateformes adoptent llms.txt au nom de leurs clients.** La plupart de ces propriétaires ignorent très probablement que le fichier existe. Que le standard compte ou non est une autre question — [notre verdict honnête sur llms.txt](https://see-geo.com/fr/blog/llms-txt-honest-verdict) reste inchangé — mais « qui adopte llms.txt » a désormais une réponse fondée sur des données : les éditeurs de logiciels, pas les propriétaires de sites.

## Que doit faire un chef d'entreprise ?

L'ordre pratique des opérations, au vu de ce qui a réellement échoué :

1. **Dites ce que vous faites, en mots simples, en haut de votre page d'accueil.** Le contrôle le plus échoué (64,5 %) et la correction la moins chère de cette liste.
2. **Ajoutez des données structurées** — au minimum un bloc Organization ou LocalBusiness, plus un balisage FAQ là où vous répondez vraiment à des questions. Un quart de l'échantillon n'en a aucune.
3. **Ne vous inquiétez de l'accès des crawlers qu'ensuite.** Vérifiez-le — cela prend quelques secondes et l'échec, rare, est grave — mais dans 97 % des cas de cet échantillon, la porte était déjà ouverte.

[L'audit gratuit SeeGeo](https://see-geo.com/fr#audit) exécute tous ces contrôles sur votre site en 30 secondes environ, sans inscription. Pour aller plus loin : [faut-il bloquer les crawlers IA ?](https://see-geo.com/fr/blog/should-you-block-ai-crawlers), [votre site est-il visible pour ChatGPT ?](https://see-geo.com/fr/blog/is-your-website-visible-to-chatgpt) et [le glossaire de la visibilité IA](https://see-geo.com/fr/blog/ai-visibility-glossary).

## Questions fréquentes

**Bloquer GPTBot retire-t-il un site de ChatGPT ?**
Bloquer GPTBot arrête le crawler d'entraînement d'OpenAI. Les citations de la recherche ChatGPT dépendent d'OAI-SearchBot — bloqué par 0 site sur 107 ici. Bloquer les deux rend la citation pratiquement impossible ; ne bloquer que GPTBot affecte surtout ce que les futurs modèles apprennent.

**robots.txt est-il le seul moyen de bloquer les crawlers IA ?**
Non. Les CDN et pare-feux peuvent bloquer au niveau réseau sans aucune trace dans robots.txt. Nous rapportons séparément les signaux CDN détectés (32 sites sur 107 montrent une signature WAF/CDN), et nous traitons nos chiffres CDN comme un plancher, car un blocage sans signature est invisible de l'extérieur.

**Les trois sites bloqueurs ont-ils choisi de bloquer l'IA ?**
Tout l'indique : les trois nomment explicitement des bots IA dans des groupes robots.txt écrits à la main, et aucun ne porte la signature d'un robots.txt géré par un CDN. Dans cet échantillon, le blocage était rare mais délibéré.

**Pourquoi votre chiffre llms.txt est-il si supérieur à l'adoption rapportée ?**
Parce que les plateformes le livrent désormais par défaut. Shopify auto-génère un llms.txt pour chaque boutique, Wix en génère un, et des plugins SEO WordPress populaires en émettent un. L'adoption à l'initiative du propriétaire ne représente qu'une petite fraction des 25,2 %.

**Puis-je voir les données ?**
Oui — les données agrégées, les constats, la méthodologie et la classification llms.txt sont publiés sur GitHub : [github.com/Tunisian-Aaron/ai-visibility-study-2026](https://github.com/Tunisian-Aaron/ai-visibility-study-2026) (CC BY 4.0). La liste des domaines et les résultats par site ne sont volontairement pas publiés — cette étude est une statistique, pas un mur de la honte.

## Méthodologie complète

*Publiée telle quelle ; exécutions du 2026-08-17.*

**Échantillon.** 120 domaines candidats ont été collectés à partir de classements publics « les meilleurs », de pages d'annuaires locaux et de listes de membres d'associations professionnelles, sur 12 catégories d'activité (restaurants/cafés, artisans, cabinets médicaux, salons/fitness, commerce indépendant, services professionnels, réparation auto, producteurs artisanaux) et 7 pays (États-Unis, Royaume-Uni, Irlande, Canada, Australie, France, Allemagne). Règles de sélection : petites entreprises uniquement ; chaînes nationales, franchises et entreprises d'envergure exclues à la collecte (43 exclusions consignées avec motifs) ; domaines d'agrégateurs/annuaires exclus ; uniquement le site propre de l'entreprise ; aucun site appartenant à SeeGeo ni à quiconque avec qui nous avons une relation. C'est un échantillon de commodité — ni aléatoire ni représentatif du web. Les constats décrivent cet échantillon seulement, et nous ne nommons pas les entreprises auditées.

**Exécutions.** Chaque site a été crawlé une fois le 2026-08-17 par le moteur qui alimente l'audit public de SeeGeo : page d'accueil, jusqu'à ~8 pages du site, robots.txt, sitemap et une sonde llms.txt. User-agent : `SeeGeoAudit/1.0 (+https://see-geo.com/bots)` — honnêtement identifié, avec une page d'explication. Les requêtes vers un même domaine étaient espacées d'au moins 1 seconde ; une visite par site, avec une seule relance après échec réseau. 13 des 120 candidats ont été exclus à l'exécution (8 injoignables, 3 domaines déplacés, 2 ont bloqué notre vérificateur) ; ils n'apparaissent dans aucun dénominateur. Un site qui bloque ou défie notre vérificateur est consigné « non vérifiable » — jamais compté comme « bloque les crawlers IA ».

**Définitions.** *Bloque le bot X (explicite)* : robots.txt contient un groupe user-agent correspondant explicitement à X, et l'évaluation de X sur la racine du site donne interdit ; les interdictions par joker seul sont comptées à part et jamais fusionnées avec le chiffre explicite. *Signaux CDN/WAF* : signatures d'en-têtes de réponse uniquement (p. ex. `server: cloudflare`) ; un blocage CDN sans signature n'est pas mesurable de l'extérieur, les chiffres CDN sont donc un plancher. *Contenu principal absent sans JavaScript* : le verdict déterministe du moteur selon lequel le HTML crawlé — sans exécution JS, soit ce que voient la plupart des crawlers IA — ne contient aucun contenu principal utilisable. *Données structurées* : JSON-LD analysable ; « au-delà de la page d'accueil » signifie qu'au moins une page crawlée hors accueil en porte. *llms.txt présent* : HTTP 200 sur /llms.txt avec un corps non-HTML ; les soft-404 servant la coquille du site comptent comme absents, et un positif initial a été corrigé en absent après re-vérification (consigné). Chaque fichier présent a été re-téléchargé et classé par signature (auto-généré Shopify, auto-généré Wix, sortie de plugin SEO, autre). *Déclaration « ce que nous faisons »* : l'heuristique livrée du moteur — motifs anglais, français et allemands sur les 1 200 premiers caractères du texte d'accueil plus la méta-description.

**Limites.** Échantillon de commodité ; les résultats décrivent ces 107 sites à cette date, rien de plus. Le blocage au niveau CDN n'est que partiellement détectable. Les listes de bots évoluent ; nous avons évalué la liste du moteur à la date d'exécution. Certaines exclusions « injoignable » peuvent elles-mêmes être des blocages réseau de notre vérificateur — indiscernables de l'extérieur, raison de plus pour que les sites exclus n'entrent dans aucun dénominateur. Les statistiques de sous-groupes ne sont rapportées que si n ≥ 20. Les données agrégées sont publiées sur [github.com/Tunisian-Aaron/ai-visibility-study-2026](https://github.com/Tunisian-Aaron/ai-visibility-study-2026).
