Glossar

Was ist robots.txt?

robots.txt ist eine Textdatei im Stammverzeichnis einer Website, die Crawlern nach dem Robots Exclusion Protocol (RFC 9309) sagt, welche Teile der Website sie lesen dürfen — und es ist der Ort, an dem KI-Crawlern der Zugang gewährt oder verweigert wird.

Wie steuert robots.txt die KI-Sichtbarkeit?

Jeder große KI-Crawler — GPTBot, ClaudeBot, PerplexityBot, Google-Extended — prüft robots.txt vor dem Lesen und beachtet, was er findet. Ein übrig gebliebenes „Disallow: /“ unter einem Wildcard-User-Agent, vor Jahren aus einem anderen Grund geschrieben, entfernt eine Website stillschweigend aus KI-Trainingsdaten, KI-Suchindizes und Live-Abruf auf einmal. Die Datei ist winzig; ihr Wirkungsradius nicht.

# Einen bestimmten KI-Crawler erlauben
User-agent: GPTBot
Allow: /

# Einen sperren, den Rest erlauben
User-agent: CCBot
Disallow: /

Die exakten Zeilen jedes Crawlers

Was kann robots.txt nicht steuern?

Die Netzwerkebene. CDNs und Firewalls entscheiden, ob die Anfrage eines Crawlers Ihren Server überhaupt erreicht — Cloudflare sperrt KI-Crawler für viele Konten standardmäßig —, und keine robots.txt-Direktive kann eine blockierte Verbindung übersteuern. Zugang zu auditieren heißt, beide Ebenen zu prüfen, weshalb SeeGeo die tatsächliche Erreichbarkeit jedes Crawlers testet, statt Ihre Regeln zu lesen und anzunehmen.

Was ist der häufigste robots.txt-Fehler?

Die übrig gebliebene Komplettsperre: ein „User-agent: * / Disallow: /“, für eine Staging-Site geschrieben und in die Produktion ausgeliefert, oder eine alte Regel, die ein Verzeichnis sperrt, das moderne Crawler brauchen. Weil die Datei lautlos versagt — nichts geht kaputt, Sie verschwinden nur leise —, überleben diese Fehler jahrelang. Prüfen Sie sie nach jeder Migration erneut und testen Sie, was Crawler tatsächlich erleben, statt was die Datei zu sagen scheint.

Häufige Fragen

Was bedeutet robots.txt?

robots.txt ist eine Textdatei im Stammverzeichnis einer Website, die Crawlern nach dem Robots Exclusion Protocol (RFC 9309) sagt, welche Teile der Website sie lesen dürfen — und es ist der Ort, an dem KI-Crawlern der Zugang gewährt oder verweigert wird.

Halten sich KI-Unternehmen tatsächlich an robots.txt?

Die großen Betreiber — OpenAI, Anthropic, Google, Perplexity — verpflichten sich öffentlich dazu und halten sich nachweislich daran. Grenzfälle gibt es bei kleineren Scrapern, aber das dominierende Problem in der Praxis ist das Gegenteil: Websites, die legitime Crawler versehentlich sperren.

Was bewirkt „User-agent: *“ bei KI-Crawlern?

Die Wildcard gilt für jeden Crawler ohne speziellere Regel — einschließlich aller KI-Crawler. Ein „Disallow: /“ darunter sperrt alles für alle, was der häufigste versehentliche Weg ist, aus KI-Antworten zu verschwinden.

Wo lege ich robots.txt ab?

Genau im Stammverzeichnis: ihresite.de/robots.txt. Crawler schauen nur dort — eine robots.txt in einem Unterverzeichnis wird vollständig ignoriert, und eine fehlende Datei bedeutet keine Regeln, was alles erlaubt.

Ist Ihre Website für KI gerade lesbar? Der kostenlose SeeGeo-Audit prüft Crawler-Zugang (alle 16 Bots), Struktur und Extrahierbarkeit der Inhalte in unter einer halben Minute.

Kostenlosen Audit starten

Verwandte Seiten