---
title: "Wir haben 107 Websites kleiner Unternehmen auf KI-Sichtbarkeit geprüft. Das Problem ist nicht das, was alle sagen"
description: "Unser Audit-Engine über 107 echte Kleinunternehmens-Websites in 7 Ländern: Nur 2,8 % blockieren KI-Crawler — die echten Lücken liegen woanders."
canonical: https://see-geo.com/de/blog/how-many-websites-block-ai-crawlers
language: de
published: 2026-08-17
author: "SeeGeo Team"
publisher: SeeGeo
alternates:
  en: https://see-geo.com/blog/how-many-websites-block-ai-crawlers
  fr: https://see-geo.com/fr/blog/how-many-websites-block-ai-crawlers
---

# Wir haben 107 Websites kleiner Unternehmen auf KI-Sichtbarkeit geprüft. Das Problem ist nicht das, was alle sagen

> Unser Audit-Engine über 107 echte Kleinunternehmens-Websites in 7 Ländern: Nur 2,8 % blockieren KI-Crawler — die echten Lücken liegen woanders.

**Kurze Antwort: Wir haben 107 echte Websites kleiner Unternehmen durch SeeGeos Audit-Engine laufen lassen — Restaurants, Handwerker, Praxen, Läden, Dienstleister in den USA, Großbritannien, Kanada, Australien, Irland, Frankreich und Deutschland. Nur 3 von 107 (2,8 %) blockieren in der robots.txt explizit einen großen KI-Crawler — die populäre Geschichte „Ihre Website blockiert KI, ohne dass Sie es wissen" ist in dieser Stichprobe die Ausnahme. Die echten Lücken sind leiser: 29 von 107 (27,1 %) haben nirgendwo strukturierte Daten, 69 von 107 (64,5 %) sagen oben auf der Startseite nie klar, was das Unternehmen tut, und 101 von 107 erhalten in der Gesamt-KI-Sichtbarkeit die Note C oder schlechter. Eine echte Überraschung: 27 von 107 (25,2 %) haben bereits eine llms.txt-Datei — und fast keiner der Betreiber hat sie selbst dort abgelegt.** Jede Zahl unten stammt aus den tatsächlichen Läufen; die vollständige Methodik steht am Ende dieses Artikels.

## Wie viele Kleinunternehmens-Websites blockieren KI-Crawler?

3 von 107 (2,8 %). Diese drei nennen KI-Crawler explizit in handgeschriebenen robots.txt-Gruppen und sperren sie von der gesamten Website aus. Zählt man auch Wildcard-Regeln mit, die KI-Bots beiläufig erfassen würden, bleibt es bei 3 von 107 — keine Website der Stichprobe ist durch einen `User-agent: *`-Zufall an der Wurzel für einen KI-Crawler gesperrt.

Diese Zahl verdient einen Moment, denn das Branchennarrativ — zeitweise auch unseres — lehnt sich an die Idee, kleine Unternehmen seien für KI unsichtbar, weil irgendetwas die Crawler blockiert. In dieser Stichprobe ist das die Ausnahme. Fast alle lassen die KI herein. Die Sichtbarkeit geht danach verloren — nachdem der Crawler drin ist.

## Welcher KI-Crawler wird am häufigsten blockiert?

| Crawler | Explizite robots.txt-Sperre | Jede Wurzel-Sperre |
|---|---|---|
| GPTBot (OpenAI, Training) | 3 von 107 (2,8 %) | 3 von 107 (2,8 %) |
| ClaudeBot (Anthropic) | 3 von 107 (2,8 %) | 3 von 107 (2,8 %) |
| Google-Extended (Gemini-Training) | 2 von 107 (1,9 %) | 2 von 107 (1,9 %) |
| CCBot (Common Crawl) | 2 von 107 (1,9 %) | 2 von 107 (1,9 %) |
| PerplexityBot | 1 von 107 (0,9 %) | 1 von 107 (0,9 %) |
| OAI-SearchBot (ChatGPT-Zitate) | 0 von 107 (0,0 %) | 0 von 107 (0,0 %) |
| Googlebot | 0 von 107 (0,0 %) | 0 von 107 (0,0 %) |
| Bingbot | 0 von 107 (0,0 %) | 0 von 107 (0,0 %) |

GPTBot und ClaudeBot liegen mit je 3 Websites gleichauf an der Spitze. Bemerkenswert: OAI-SearchBot — der Crawler, der entscheidet, ob ChatGPT eine Website *zitieren* kann — wird in dieser Stichprobe von niemandem blockiert.

## Wer hat blockiert, und war es Absicht?

Unter den 3 blockierenden Websites: 2 zeigen handgeschriebene robots.txt-Regeln ohne CDN- oder Firewall-Signale, und 1 kombiniert ihre robots.txt-Regeln mit einer Cloudflare-Front. Alle drei nennen die KI-Bots explizit in eigenen robots.txt-Gruppen — das sieht nach Entscheidungen aus, nicht nach Voreinstellungen. 0 von 107 Websites (0,0 %) tragen in dieser Stichprobe die Signatur von Cloudflares verwalteter robots.txt.

Ein ehrlicher Vorbehalt in die andere Richtung: 31 der 107 geprüften Websites (29,0 %) stehen hinter Cloudflare, und CDN-seitiges Bot-Blocking, das keine externe Signatur hinterlässt, ist von außen nicht messbar. Unsere robots.txt-Zahlen sind exakt; unsere CDN-Zahlen sind eine Untergrenze. (Ein Beleg aus unserem eigenen Lauf: Eine Website lieferte unserem ehrlich identifizierten Audit-Crawler HTTP 403, einem Browser aber eine normale Seite — Bot-Filterung auf Netzwerkebene ist real. Genau deshalb wurden Websites, die *unseren* Prüfer blockierten, aus jeder Statistik ausgeschlossen statt als „blockiert KI" gezählt.)

## Das JavaScript-Problem ist kleiner als beworben

3 von 107 Websites (2,8 %) liefern eine Startseite, deren Hauptinhalt ohne JavaScript-Ausführung nicht existiert — und genau so lesen die meisten KI-Crawler das Web, diese drei sind für KI also faktisch leer. Wir hatten mehr erwartet. Moderne Website-Baukästen rendern offenbar gut genug serverseitig, dass die Warnung „Ihre schöne JS-Website ist unsichtbar" zwar real, aber in dieser Stichprobe ebenfalls die Ausnahme ist.

## Strukturierte Daten: wo die Stichprobe wirklich durchfällt

- Nirgendwo JSON-LD auf den gecrawlten Seiten: **29 von 107 (27,1 %)**
- JSON-LD auf der Startseite: 75 von 107 (70,1 %)
- JSON-LD jenseits der Startseite: 69 von 107 (64,5 %)
- Eine klare „Was wir tun"-Aussage oben auf der Startseite: nur **38 von 107 (35,5 %)** — 69 von 107 (64,5 %) lassen also Menschen wie Maschinen raten, was das Unternehmen ist
- Gesamtnoten der Audit-Engine: B 6 · C 38 · D 38 · F 25 — 101 von 107 (94,4 %) mit C oder schlechter

Das ist die tatsächliche Gestalt des KI-Sichtbarkeitsproblems kleiner Unternehmen in unseren Daten: Die Tür steht offen, aber der Raum ist unbeschriftet.

## Die llms.txt-Überraschung: Adoption per Voreinstellung

27 von 107 Websites (25,2 %) haben eine llms.txt-Datei — eine Zahl, die auf bemerkenswerte Verbreitung eines umstrittenen jungen Standards hindeuten würde. Tut sie nicht. Wir haben jede einzelne erneut abgerufen und klassifiziert:

- Jeder Shopify-Shop der Stichprobe (8 von 8) trägt Shopifys auto-generierte „Agent Instructions"-llms.txt.
- Jeder Wix-Treffer trägt Wix' auto-generierte Markdown-Datei.
- Mehrere WordPress-Treffer stammen vom Plugin All in One SEO, das seine eigene Signatur in die Datei stempelt.

Mit anderen Worten: **Plattformen adoptieren llms.txt im Namen ihrer Kunden.** Die meisten dieser Betreiber wissen mit ziemlicher Sicherheit nicht, dass die Datei existiert. Ob der Standard etwas bringt, ist eine andere Frage — [unser ehrliches Urteil zu llms.txt](https://see-geo.com/de/blog/llms-txt-honest-verdict) bleibt unverändert — aber „wer adoptiert llms.txt" hat jetzt eine datengestützte Antwort: Softwareanbieter, nicht Website-Betreiber.

## Was sollte ein Unternehmer tun?

Die praktische Reihenfolge, gemessen an dem, was tatsächlich durchfiel:

1. **Sagen Sie oben auf Ihrer Startseite in einfachen Worten, was Sie tun.** Der am häufigsten verfehlte Check (64,5 %) und die billigste Korrektur dieser Liste.
2. **Ergänzen Sie strukturierte Daten** — mindestens einen Organization- oder LocalBusiness-Block, plus FAQ-Markup dort, wo Sie wirklich Fragen beantworten. Ein Viertel der Stichprobe hat gar keine.
3. **Kümmern Sie sich erst danach um Crawler-Zugang.** Prüfen Sie ihn — es dauert Sekunden, und der seltene Fehlerfall ist gravierend — aber in 97 % der Fälle dieser Stichprobe stand die Tür bereits offen.

[SeeGeos kostenloser Audit](https://see-geo.com/de#audit) führt all diese Prüfungen in etwa 30 Sekunden auf Ihrer Website aus, ohne Anmeldung. Zum Vertiefen: [Sollten Sie KI-Crawler blockieren?](https://see-geo.com/de/blog/should-you-block-ai-crawlers), [Ist Ihre Website für ChatGPT sichtbar?](https://see-geo.com/de/blog/is-your-website-visible-to-chatgpt) und [das KI-Sichtbarkeits-Glossar](https://see-geo.com/de/blog/ai-visibility-glossary).

## Häufige Fragen

**Entfernt das Blockieren von GPTBot eine Website aus ChatGPT?**
GPTBot zu blockieren stoppt OpenAIs Trainings-Crawler. ChatGPTs Suchzitate hängen von OAI-SearchBot ab — hier von 0 von 107 Websites blockiert. Beide zu blockieren macht Zitate praktisch unmöglich; nur GPTBot zu blockieren betrifft vor allem, was künftige Modelle lernen.

**Ist robots.txt der einzige Weg, KI-Crawler zu blockieren?**
Nein. CDNs und Firewalls können auf Netzwerkebene blockieren, ohne Spur in der robots.txt. Erkannte CDN-Signale berichten wir separat (32 von 107 Websites zeigen eine WAF/CDN-Signatur), und wir behandeln unsere CDN-Zahlen als Untergrenze, weil signaturloses Blockieren von außen unsichtbar ist.

**Haben die drei blockierenden Websites die KI absichtlich ausgesperrt?**
Es sieht so aus: Alle drei nennen KI-Bots explizit in handgeschriebenen robots.txt-Gruppen, und keine trägt die Signatur einer CDN-verwalteten robots.txt. In dieser Stichprobe war Blockieren selten, aber absichtlich.

**Warum liegt Ihre llms.txt-Zahl so weit über der berichteten Verbreitung?**
Weil Plattformen die Datei inzwischen standardmäßig ausliefern. Shopify generiert für jeden Shop automatisch eine llms.txt, Wix ebenfalls, und beliebte WordPress-SEO-Plugins geben eine aus. Vom Betreiber selbst initiierte Adoption ist nur ein kleiner Bruchteil der 25,2 %.

**Kann ich die Daten sehen?**
Ja — Aggregatdaten, Befunde, Methodik und die llms.txt-Klassifikation sind auf GitHub veröffentlicht: [github.com/Tunisian-Aaron/ai-visibility-study-2026](https://github.com/Tunisian-Aaron/ai-visibility-study-2026) (CC BY 4.0). Die Domainliste und Ergebnisse pro Website werden bewusst nicht veröffentlicht — diese Studie ist Statistik, kein Pranger.

## Vollständige Methodik

*Wörtlich veröffentlicht; Läufe vom 2026-08-17.*

**Stichprobe.** 120 Kandidaten-Domains wurden aus öffentlichen „Die besten…"-Listen, lokalen Verzeichnisseiten und Mitgliederlisten von Branchenverbänden gesammelt, über 12 Geschäftskategorien (Restaurants/Cafés, Handwerk, Praxen, Salons/Fitness, unabhängiger Einzelhandel, professionelle Dienstleistungen, Autowerkstätten, handwerkliche Hersteller) und 7 Länder (USA, Großbritannien, Irland, Kanada, Australien, Frankreich, Deutschland). Auswahlregeln: nur kleine Unternehmen; nationale Ketten, Franchises und Unternehmen mit Konzerngröße bei der Sammlung ausgeschlossen (43 Ausschlüsse mit Gründen protokolliert); Aggregator-/Verzeichnisdomains ausgeschlossen; nur die eigene Website des Unternehmens; keine Website von SeeGeo oder von jemandem, mit dem wir eine Beziehung haben. Dies ist eine Gelegenheitsstichprobe — weder zufällig noch repräsentativ für das Web. Die Befunde beschreiben nur diese Stichprobe, und wir nennen die geprüften Unternehmen nicht.

**Läufe.** Jede Website wurde am 2026-08-17 einmal von derselben Engine gecrawlt, die SeeGeos öffentlichen Audit antreibt: Startseite, bis zu ~8 Seiten, robots.txt, Sitemap und eine llms.txt-Sonde. User-Agent: `SeeGeoAudit/1.0 (+https://see-geo.com/bots)` — ehrlich identifiziert, mit Erklärungsseite. Anfragen an dieselbe Domain waren mindestens 1 Sekunde voneinander getrennt; ein Besuch pro Website, mit einem einzigen erneuten Versuch nach Netzwerkfehler. 13 der 120 Kandidaten wurden zur Laufzeit ausgeschlossen (8 unerreichbar, 3 Domains umgezogen, 2 blockierten unseren Prüfer); sie erscheinen in keinem Nenner. Eine Website, die unseren Prüfer blockiert oder herausfordert, wird als „nicht verifizierbar" protokolliert — nie als „blockiert KI-Crawler" gezählt.

**Definitionen.** *Blockiert Bot X (explizit)*: Die robots.txt enthält eine User-Agent-Gruppe, die X explizit entspricht, und die Auswertung von X gegen die Website-Wurzel ergibt verboten; reine Wildcard-Verbote werden separat gezählt und nie mit der expliziten Zahl verschmolzen. *CDN/WAF-Signale*: nur Antwort-Header-Signaturen (z. B. `server: cloudflare`); CDN-Blocking ohne Signatur ist von außen nicht messbar, CDN-Zahlen sind daher eine Untergrenze. *Hauptinhalt ohne JavaScript fehlend*: das deterministische Urteil der Engine, dass das gecrawlte HTML — ohne JS-Ausführung, also das, was die meisten KI-Crawler sehen — keinen nutzbaren Hauptinhalt enthält. *Strukturierte Daten*: parsebares JSON-LD; „jenseits der Startseite" heißt, mindestens eine gecrawlte Nicht-Startseite trägt welches. *llms.txt vorhanden*: HTTP 200 auf /llms.txt mit Nicht-HTML-Inhalt; Soft-404s, die die Website-Hülle liefern, zählen als abwesend, und ein anfänglicher Treffer wurde nach erneuter Prüfung auf abwesend korrigiert (protokolliert). Jede vorhandene Datei wurde erneut abgerufen und nach Signatur klassifiziert (Shopify-generiert, Wix-generiert, SEO-Plugin-Ausgabe, Sonstiges). *„Was wir tun"-Aussage*: die ausgelieferte Heuristik der Engine — englische, französische und deutsche Muster über die ersten 1 200 Zeichen des Startseitentexts plus die Meta-Beschreibung.

**Grenzen.** Gelegenheitsstichprobe; die Ergebnisse beschreiben diese 107 Websites an diesem Datum, nicht mehr. CDN-seitiges Blocking ist bestenfalls teilweise erkennbar. Bot-Listen ändern sich; wir haben die Liste der Engine zum Laufdatum ausgewertet. Manche „unerreichbar"-Ausschlüsse können selbst Netzwerk-Blockaden unseres Prüfers sein — von außen nicht unterscheidbar, ein Grund mehr, warum ausgeschlossene Websites in keinen Nenner eingehen. Untergruppen-Statistiken werden nur bei n ≥ 20 berichtet. Die Aggregatdaten sind veröffentlicht auf [github.com/Tunisian-Aaron/ai-visibility-study-2026](https://github.com/Tunisian-Aaron/ai-visibility-study-2026).
