Playbook · Methodik
KI-Crawler-Zugang beheben
Wenn KI-Crawler Ihre Seiten nicht abrufen oder lesen können, hilft keine Content-Strategie. Dieses Playbook führt zuerst die technischen Prüfungen durch, behebt, was KI-Engines blockiert, und verifiziert das Ergebnis mit echten Crawler-Besuchen.
- Ziel
- KI-Crawler können Ihre wichtigsten Seiten abrufen und lesen
- Für
- SEO-, Web- und Plattform-Teams
- Ausgangsmessung
- Ein Crawlability-Check plus 7 Tage Tracking
- Erneut messen
- Nach jedem Fix und jedem Release
Ziel
Stellen Sie sicher, dass die Crawler hinter KI-Suche und Assistenten – etwa OAI-SearchBot, ChatGPT-User, Claude-SearchBot, PerplexityBot und Googlebot – dort zugelassen sind, wo Sie es wollen, dieselben Inhalte wie Browser erhalten und Ihre wichtigen Seiten finden. Das ist die Voraussetzung für alle anderen Playbooks.
Crawler haben unterschiedliche Zwecke: Such-Crawler indexieren Seiten für die KI-Suche, User-Agents rufen eine Seite ab, wenn jemand danach fragt, und Trainings-Crawler wie GPTBot und ClaudeBot sammeln Daten für künftige Modelle. Sie können jede Gruppe unterschiedlich behandeln.
Für wen
- SEO-Teams, die technische Ursachen für geringe KI-Sichtbarkeit vermuten
- Web- und Plattform-Teams, die CDNs, Firewalls oder Bot-Schutz betreiben
- Websites, die als JavaScript-Single-Page-Apps gebaut sind
- Alle, die robots.txt oder Bot-Einstellungen geändert haben und die Wirkung prüfen wollen
Prompt-Set
Zehn Abruf-Prompts: Faktenfragen, die Engines nur dann richtig beantworten können, wenn sie Ihre Seiten lesen können. Sie sind der Praxistest für den Crawler-Zugang.
Importieren Sie es in AutoSEO unter AI Visibility → Tracker → Import CSV (Text einfügen oder Datei hochladen).
Ersetzen Sie diese Platzhalter vor dem Import und passen Sie Artikel und Endungen an – der Import übernimmt jede Zeile wörtlich:
[Marke]– Ihr Markenname[Produkt]– ein Produkt oder Tarif[Funktion]– eine Funktion, die auf Ihrer Website beschrieben ist[Domain]– Ihre Domain, z. B. „beispiel.de“
prompt,tags"Was kostet [Marke]?","Abruf|Preise""Bietet [Marke] [Funktion] an?","Abruf|Produkt""Was ist [Produkt] von [Marke]?","Abruf|Produkt""Welche Integrationen unterstützt [Marke]?","Abruf|Produkt""Für wen ist [Marke] gedacht?","Abruf|Positionierung""Wie sind die Rückgabe- oder Kündigungsbedingungen von [Marke]?","Abruf|Richtlinien""Wie erreiche ich den Support von [Marke]?","Abruf|Support""Was steht auf der Preisseite von [Domain]?","Abruf|Preise""Was gibt es Neues bei [Marke]?","Abruf|Aktualität""Wo sitzt [Marke] und wer steht dahinter?","Abruf|Unternehmen"Zu trackende Engines
Tracken Sie die Engines, deren Crawler Sie freischalten, damit sich die Wirkung in den Antworten zeigen kann.
| Engine | Beteiligte Crawler |
|---|---|
| ChatGPT | OAI-SearchBot indexiert für die Suche, ChatGPT-User ruft Seiten auf Anfrage ab, GPTBot sammelt Trainingsdaten. |
| Claude | Claude-SearchBot, Claude-User und ClaudeBot (Training) – jeder lässt sich einzeln zulassen oder sperren. |
| Perplexity | PerplexityBot indexiert Seiten; Perplexity-User ruft sie ab, wenn jemand danach fragt. |
| Google AI Overviews, AI Mode und Gemini | Stützen sich auf den Index des Googlebot. Google-Extended ist ein robots.txt-Token ohne eigenen Crawler, das die Nutzung für Gemini-Modelle regelt; aus den AI Overviews entfernt es Sie nicht. |
Ausgangsmessung in AutoSEO
- 1
Crawlability-Check ausführen
Optimizations → Crawlability prüft robots.txt-Regeln je KI-Crawler, Crawl-Delay, ob Crawler-User-Agents dieselben Seiten wie Browser erhalten, serverseitiges Rendering, Meta Robots und X-Robots-Tag, Sitemaps, llms.txt, strukturierte Daten und Canonicals.
- 2
Crawler-Richtlinie festlegen
Entscheiden Sie je Zweck – Suche, Nutzeranfragen, Training –, welche Crawler Sie zulassen. Halten Sie die Entscheidung schriftlich fest, bevor Sie etwas ändern.
- 3
Bot-Traffic anbinden
Verbinden Sie unter Analytics → Bot Traffic Cloudflare oder Akamai, laden Sie Server-Logs hoch oder senden Sie sie per Webhook. Besuche werden mit den IP-Bereichen abgeglichen, die die Crawler-Betreiber veröffentlichen.
- 4
Abruf-Prompts tracken
Importieren Sie das Prompt-Set und tracken Sie es eine Woche lang täglich. Notieren Sie, welche Fragen jede Engine anhand Ihrer Seiten richtig beantwortet.
Maßnahmen
- 01
Gewünschte Crawler freischalten
Entfernen Sie Disallow-Regeln für die KI-Such- und User-Crawler, die Sie zulassen wollen. Achten Sie auf pauschale Regeln wie
User-agent: *mitDisallow: /und auf Überbleibsel aus der Staging-Umgebung. - 02
CDN- und Firewall-Regeln prüfen
Bot-Schutz und WAF-Regeln blockieren KI-Crawler oft, bevor robots.txt überhaupt greift. Lassen Sie verifizierte Crawler ausdrücklich zu und führen Sie den Check danach erneut aus.
- 03
Inhalte im HTML ausliefern
Viele Crawler führen kein JavaScript aus und sehen nur das rohe HTML. Rendern Sie wichtige Texte, Überschriften und Links auf dem Server.
- 04
Versehentliches noindex und noai entfernen
Prüfen Sie Meta Robots und X-Robots-Tag auf wichtigen Seiten. noindex, noai oder nosnippet können Inhalte aus Antworten heraushalten.
- 05
Sitemaps und eine llms.txt veröffentlichen
Eine vollständige XML-Sitemap hilft Crawlern, Seiten zu finden. llms.txt ist optional und wird nicht von jeder Engine genutzt, kostet aber wenig.
- 06
Strukturierte Daten und saubere Canonicals ergänzen
JSON-LD auf der Startseite und wichtigen Seiten sowie eindeutige Canonical-URLs machen klar, welche Seite welchen Fakt nennt.
Veränderung messen
- Behobene Crawlability-Befunde, nach jedem Fix erneut geprüft
- Verifizierte Besuche je KI-Crawler unter Bot Traffic, Woche für Woche verglichen
- Anteil der Abruf-Prompts, die je Engine richtig beantwortet werden
- Zitate Ihrer eigenen Seiten in den Antworten auf die Abruf-Prompts
- Ein neuer Check nach jedem Release, weil Deployments Blockaden oft wieder einführen
Rechnen Sie mit Verzögerung
Crawler kommen nach ihrem eigenen Zeitplan wieder. Es kann Tage oder Wochen dauern, bis eine freigeschaltete Seite abgerufen wird, und länger, bis sie in Antworten auftaucht.
Erwartbare Schwankung
Die technischen Prüfungen sind deterministisch: Eine robots.txt-Regel blockiert einen Crawler oder eben nicht. Die Wirkung auf Antworten ist es nicht. Ob eine Engine Ihre Seite für eine Frage abruft, hängt von ihrem Abrufverfahren ab, und Trainings-Crawler beeinflussen nur künftige Modellversionen.
Auch Crawler-Besuche schwanken – mit dem Crawl-Budget und Ihrer eigenen Veröffentlichungsaktivität. Vergleichen Sie Wochensummen, keine einzelnen Tage.
Grenzen
- Crawler zuzulassen macht Sie berechtigt, nicht sichtbar. Ob Engines Ihre Seiten nutzen, entscheiden weiterhin Inhalt und Autorität.
- robots.txt ist eine Bitte, keine Zugriffskontrolle. Crawler, die sie ignorieren, müssen im CDN oder in der Firewall gestoppt werden.
- Besuche von Crawlern, deren Betreiber keine IP-Bereiche veröffentlichen, lassen sich nicht verifizieren.
- Wer Trainings-Crawler heute sperrt, entfernt seine Inhalte nicht aus Modellen, die es bereits gibt.
Fragen zu diesem Playbook
Sollte ich KI-Trainings-Crawler sperren?
Das ist eine geschäftliche Entscheidung, keine technische. Wer Trainings-Crawler wie GPTBot oder ClaudeBot sperrt, hält seine Inhalte aus künftigen Trainingsdaten heraus, ändert aber nichts an bereits genutzten Inhalten. Such- und User-Crawler wie OAI-SearchBot, ChatGPT-User, Claude-SearchBot und PerplexityBot erlauben Engines, Ihre Seiten abzurufen, um Fragen zu beantworten – sie zu sperren kostet in der Regel Sichtbarkeit.
Verbessert eine llms.txt die KI-Sichtbarkeit?
Keine große Engine hat bestätigt, llms.txt für Ranking oder Zitate zu nutzen. Die Datei kostet wenig und hilft manchen KI-Agenten bei der Navigation auf Ihrer Website, deshalb prüft AutoSEO sie – beheben Sie aber zuerst robots.txt, Rendering und Meta-Direktiven.
Warum sollten Crawler andere Seiten erhalten als Browser?
Meist wegen Bot-Schutz: CDNs und Firewalls liefern unbekannten Bots Challenges, Sperren oder abgespeckte Seiten aus. AutoSEO ruft Ihre Seiten mit echten Crawler-User-Agents ab und vergleicht das Ergebnis mit einer Browser-Anfrage, sodass Sie den Unterschied sehen.
Woher weiß ich, dass ein Besuch wirklich von OpenAI oder Anthropic kam?
User-Agents lassen sich fälschen. AutoSEO gleicht Crawler-Besuche mit den IP-Bereichen ab, die OpenAI, Anthropic, Perplexity, Google und andere Betreiber veröffentlichen, und trennt verifizierte von nicht verifizierten Besuchen.
Brauche ich für diese Fixes einen Entwickler?
Für robots.txt und CDN-Einstellungen oft nicht. Rendering-Probleme, Meta-Direktiven und strukturierte Daten brauchen meist Ihr Web-Team. Machen Sie aus den Befunden Aufgaben und übertragen Sie sie aus Optimizations → Tasks nach Jira, Linear oder in Ihr Projekttool.
Dieses Playbook in AutoSEO umsetzen
Alle Funktionen sind in der kostenlosen Self-Hosting-Version und in AutoSEO Cloud enthalten.