Technik

Technische KI-Sichtbarkeit: Warum KI-Crawler deine Website nicht verstehen

Deine IT hat GPTBot blockiert und du wunderst dich, warum ChatGPT dich nicht kennt. Hier sind die technischen Grundlagen, die darüber entscheiden, ob KI deine Website lesen, verstehen und zitieren kann.

Autor
Vadim Shchepin, AI SEO Specialist
Veröffentlicht
Aktualisiert
Inhalt, 13 Abschnitte
Technisches Dashboard mit KI-Crawler-Pfaden, Server-Logs, robots.txt, llms.txt und Schema-Markup für maschinenlesbare Websites
Crawlbarkeit, semantisches HTML, Schema und serverseitig gerenderte Inhalte entscheiden, ob KI-Systeme deine Website überhaupt verstehen.

1.Das Problem: Deine Website spricht kein KI

KI-Crawler lesen Websites fundamental anders als der Googlebot. Sie führen kein JavaScript aus, sie rendern keine CSS-Layouts, sie sehen keine Bilder. Was sie sehen: rohes HTML, strukturierte Daten und Textinhalt. Stimmt das nicht, existierst du für sie nicht.

Seit dem 1. Juli 2025 blockiert Cloudflare KI-Crawler bei neuen Domains standardmäßig. Wer nie eine Entscheidung getroffen hat, hat sie damit ausgesperrt.

Dein CMS rendert JavaScript. Die meisten KI-Crawler können kein JavaScript. Das ist der ganze Konflikt in zwei Sätzen.

Aus berechtigter Angst vor Datenklau haben viele Unternehmen 2024 alle KI-Crawler ausgesperrt. Jetzt stellen sie fest, dass sie sich aus dem Zukunftsmarkt zensiert haben.

Viele Security-Plugins und WAFs blockieren GPTBot, PerplexityBot und ClaudeBot pauschal, oft schon in der Standardkonfiguration. Dein IT-Team hat vermutlich keine böse Absicht, aber das Ergebnis ist dasselbe: deine Website ist für KI unsichtbar. Was KI-Sichtbarkeit inhaltlich bedeutet, steht im Grundlagen-Guide. Diese Seite behandelt nur die Technik darunter.

Die Reihenfolge der Diagnose ist immer dieselbe: Kommt der Bot überhaupt an, im Server-Log nachsehen. Bekommt er HTML mit Text, in den Quelltext schauen statt in den Inspector. Versteht er die Entität, Schema prüfen. Findet er eine abgrenzbare Passage, Struktur prüfen. Wer bei Schritt vier anfängt, obwohl Schritt eins fehlschlägt, optimiert für ein System, das die Seite nie gesehen hat.

robots.txt blockiert KI-BotsSecurity-Plugins setzen pauschal Disallow für alle unbekannten User-Agents.Der Abruf findet nie statt. Keine Daten, keine Zitate.
JavaScript-Only-RenderingSPAs ohne SSR liefern KI-Crawlern eine leere HTML-Hülle.Abruf erfolgreich, Inhalt leer. Der Crawler sieht ein Grundgerüst.
Fehlende strukturierte DatenOhne Schema.org kann KI dein Unternehmen nicht als Entität einordnen.Text ohne Einordnung. Name, Ort und Leistung bleiben Vermutung.
Keine semantische HTML-StrukturDiv-Suppe statt sauberer Heading-Hierarchie macht Inhalte unextrahierbar.Keine abgrenzbare Passage, die zitiert werden könnte.
Vier Fehler an vier verschiedenen Stellen der Kette. Der erste verhindert den Abruf, die anderen drei verhindern das Verstehen.

2.KI-Crawler: Wer ist wer?

Sechs Crawler entscheiden über deine KI-Sichtbarkeit. Blockierst du einen, bist du auf der jeweiligen Plattform unsichtbar.

User-Agents lassen sich fälschen, und ein Teil der angeblichen KI-Zugriffe im Log kommt von Scrapern, die sich als GPTBot ausgeben. Die Betreiber veröffentlichen deshalb ihre IP-Bereiche, und ein Reverse-DNS-Check auf die abrufende IP trennt echte Crawler von Nachahmern. Das gehört gemacht, bevor du aus Log-Zahlen ableitest, wie oft KI-Systeme dich wirklich lesen.

GPTBotTrainingsdaten für GPT-ModelleOpenAIGPTBot/1.0User-agent: GPTBot
OAI-SearchBotLive-Suche in ChatGPT (SearchGPT)OpenAIOAI-SearchBot/1.0User-agent: OAI-SearchBot
PerplexityBotEchtzeit-Index für Perplexity-AntwortenPerplexityPerplexityBotUser-agent: PerplexityBot
ClaudeBotTrainingsdaten und Web-Suche für ClaudeAnthropicClaudeBot/1.0User-agent: ClaudeBot
GooglebotIndexierung und AI OverviewsGoogleGooglebot/2.1User-agent: Googlebot
BingbotIndexierung, speist ChatGPT und PerplexityMicrosoftbingbot/2.0User-agent: Bingbot
Die Direktive gehört in die robots.txt. Der User-Agent ist der String, nach dem du im Server-Log suchst, wenn du prüfen willst, ob der Crawler wirklich vorbeikommt.Google-Extended und Applebot-Extended sind keine Crawler, sondern reine Trainings-Opt-outs. Sie rufen keine Seite ab. Wer sie sperrt, bleibt in Google AI Overviews und in Apple Intelligence sichtbar, verbietet aber die Nutzung der Inhalte als Trainingsdaten. Das ist eine Lizenzentscheidung, keine Sichtbarkeitsentscheidung.
Bingbot ist der stille Multiplikator: Er speist sowohl ChatGPT als auch Perplexity mit Daten. Blockierst du Bingbot, verlierst du gleich zwei Plattformen.

3.robots.txt für KI-Sichtbarkeit

Die robots.txt ist die erste Tür, die KI-Crawler öffnen. Ist sie zu, gehen sie weiter. Keine zweite Chance.

Viele Unternehmen haben nach dem KI-Hype 2024 pauschal alle KI-Bots blockiert. Das war nachvollziehbar, aber strategisch ein Fehler. Du kannst selektiv erlauben, was du öffentlich machen willst, und den Rest schützen.

Wichtig ist die Reihenfolge der Prüfung: erst robots.txt, dann WAF, dann CDN. Eine erlaubende robots.txt hilft nichts, wenn eine Firewall-Regel oder ein Bot-Schutz denselben User-Agent zwei Schichten tiefer mit 403 abweist. Der Crawler meldet dir das nicht, im Server-Log steht es trotzdem.

Zwei Direktiven werden regelmäßig übersehen, weil sie nicht in der robots.txt stehen, sondern im Meta-Robots-Tag: nosnippet und max-snippet. Google verwendet für AI Overviews nur Text, der auch als Snippet erlaubt ist. Wer nosnippet setzt oder max-snippet klein hält, bleibt indexiert und verschwindet trotzdem aus den KI-Antworten. Das ist der leiseste Weg, sich selbst unsichtbar zu machen.

robots.txt, KI-optimiert

# Alle KI-Crawler explizit erlauben.
# Mehrere User-agent-Zeilen vor einem Regelblock sind erlaubt
# und halten die Regeln für alle Bots identisch.
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: PerplexityBot
User-agent: ClaudeBot
User-agent: Googlebot
User-agent: Bingbot
Allow: /
Disallow: /intern/
Disallow: /api/

# Standard-Crawler
User-agent: *
Allow: /
Disallow: /intern/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml
InhalteService-Seiten, Case Studies, Blog-Artikel und FAQ-SeitenProprietäre Inhalte hinter Login-Bereichen
EntitätImpressum und Kontaktseite, das sind deine Entity-SignaleInterne Dashboards, Admin-Bereiche und API-Endpunkte
TechnikStrukturierte Daten und Schema.org-MarkupStaging-Umgebungen und Test-Seiten
Die mittlere Spalte ist der Teil, den fast alle versehentlich mitsperren. Impressum und Kontaktseite wirken unwichtig, sind aber die Belege für Name, Ort und Rechtsform.

Die robots.txt ist nicht die einzige Tür

Der Test dauert eine Zeile: Ruf eine echte Inhaltsseite mit curl und dem User-Agent GPTBot ab und schau auf Statuscode und Antwortlänge. 200 mit vollständigem HTML ist das Ziel. Ein 403, eine Challenge-Seite oder ein leeres Grundgerüst bedeuten, dass eine Schicht unter der robots.txt widerspricht. Dann hilft dir keine Direktive, sondern nur eine Ausnahme in der Firewall.

4.llms.txt: Der neue Standard für LLM-Sichtbarkeit

llms.txt ist ein Vorschlag für eine standardisierte Datei im Root-Verzeichnis deiner Website, die LLMs eine kompakte, maschinenlesbare Zusammenfassung deines Unternehmens liefert. Ähnlich wie robots.txt für Crawler oder humans.txt für Menschen.

Der Unterschied: robots.txt sagt Crawlern, was sie dürfen. llms.txt sagt LLMs, wer du bist und was du anbietest. Es ist dein Elevator Pitch für Maschinen.

Erwartungswert für 2026, damit du nicht enttäuscht wirst: Google hat für die eigenen KI-Funktionen ausdrücklich klargestellt, dass llms.txt nicht ausgewertet wird (mehr dazu im Begriffsvergleich). Für ChatGPT, Claude und Perplexity ist die Datei ein zusätzlicher, sehr leicht abrufbarer Einstiegspunkt. Eine Stunde Aufwand, überschaubarer Nutzen, kein Ersatz für saubere Seiten.

Was llms.txt nicht kann: Sie verschafft dir keine Zitate, wenn die verlinkten Seiten dünn sind. Sie ist ein Inhaltsverzeichnis, kein Inhalt. Ihr Wert liegt darin, dass ein Modell in einem einzigen Abruf versteht, was du anbietest, statt es aus einer Navigation zu rekonstruieren. Wer sie mit Marketingtext füllt, verschenkt genau diesen Vorteil.

llms.txt, Beispiel

# llms.txt - [Firmenname]

## Unternehmen
[Firmenname] ist ein [Branche]-Unternehmen in [Stadt].
Wir bieten [Kernleistungen].

## Leistungen
- [Leistung 1]: [Kurzbeschreibung]
- [Leistung 2]: [Kurzbeschreibung]

## Zielgruppe
[Wer sind eure Kunden? Branche, Größe, Region]

## Kontakt
- Website: https://example.com
- E-Mail: kontakt@example.com
- Standort: [Stadt, Region]

## Wichtige Seiten
- /leistungen - Übersicht aller Leistungen
- /ueber-uns - Über das Unternehmen
- /blog - Fachartikel und Insights
- /kontakt - Kontaktformular
  1. 4.1

    Implementierung: Datei im Root anlegen

    Erstelle eine Datei llms.txt im Root deiner Domain, also unter https://example.com/llms.txt. Kein Unterverzeichnis, kein anderer Dateiname, Content-Type text/plain.

  2. 4.2

    Zusammenfassung in Markdown schreiben

    Schreibe eine klare, strukturierte Zusammenfassung deines Unternehmens in Markdown. Überschriften, kurze Sätze, Zahlen statt Adjektive. Marketingsprache wird hier nicht belohnt, weil niemand sie liest, der sie glauben könnte.

  3. 4.3

    Datei aktuell halten

    Halte die Datei aktuell, veraltete Informationen schaden mehr als keine. Ein falscher Preis oder ein alter Firmenname wandert von hier direkt in eine Antwort. Setz dir einen festen Termin pro Quartal.

  4. 4.4

    Wichtigste Seiten mit Kontext verlinken

    Verlinke die wichtigsten Seiten deiner Website und schreibe hinter jeden Link einen Satz, was dort steht. Der Satz ist der eigentliche Wert, nicht die URL.

5.Schema.org Markup für LLMs

Strukturierte Daten sind für KI-Systeme das, was ein Organigramm für einen neuen Mitarbeiter ist: Kontext, Einordnung, Beziehungen. Ohne Schema.org bist du für LLMs ein unbekannter Textblock.

Zwei Details entscheiden, ob aus Markup eine Entität wird. Erstens dieselben Angaben zu Name, Adresse und Telefonnummer auf jeder Seite, im Impressum und in externen Verzeichnissen, ohne Abweichung. Zweitens verknüpfte Objekte statt isolierter Schnipsel, also eine @id für die Organisation, auf die Article, Product und FAQPage verweisen. Ein Modell, das drei leicht verschiedene Firmennamen findet, nennt am Ende keinen davon.

JSON-LD im head: LocalBusiness und FAQPage

<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "LocalBusiness",
  "name": "Firmenname",
  "description": "Kurzbeschreibung der Leistungen",
  "url": "https://example.com",
  "telephone": "+49-40-1234567",
  "address": {
    "@type": "PostalAddress",
    "streetAddress": "Musterstraße 1",
    "addressLocality": "Hamburg",
    "postalCode": "20095",
    "addressCountry": "DE"
  },
  "areaServed": "Hamburg",
  "sameAs": [
    "https://linkedin.com/company/firmenname",
    "https://instagram.com/firmenname"
  ]
}
</script>

<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "name": "Was kostet Leistung X?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Leistung X kostet ab 500 Euro..."
      }
    }
  ]
}
</script>

5.1

Organization / LocalBusiness

Die Entitäts-Identität: Wer bist du? Ohne dieses Schema kann KI dich nicht als Entität erkennen. Name, Adresse und sameAs-Profile verhindern die Verwechslung mit einer ähnlich benannten Firma.

5.2

FAQPage

Direkte Antworten auf Nutzerfragen. Hochrelevant für KI, weil LLMs FAQ-Strukturen bevorzugt extrahieren. Frage und Antwort stehen darin schon getrennt, das Modell muss nichts zerlegen.

5.3

HowTo

Schritt-für-Schritt-Anleitungen. Ideal für prozessbasierte Inhalte, die KI als Handlungsanweisung weitergeben kann. Jeder Schritt braucht ein eigenes name-Feld, sonst bleibt es ein Textblock mit Auszeichnung.

5.4

Article mit Author

E-E-A-T-Signal: Wer hat den Inhalt geschrieben? Echte Autoren mit Expertise werden von KI bevorzugt zitiert. Der Author verweist idealerweise auf eine Personenseite, die es wirklich gibt.

5.5

Product

Für kommerzielle Inhalte: Preis, Verfügbarkeit, Bewertungen. Wird von KI für Kaufempfehlungen herangezogen. Ausgedachte Bewertungen sind hier riskanter als gar keine.

Schema.org liefert KI den Kontext. Ohne Kontext bist du ein anonymer Textblock unter Millionen.

6.Semantisches HTML: Warum Struktur alles ist

KI-Crawler sehen kein Design, sie sehen DOM-Struktur. Ein perfekt gestalteter Abschnitt in einem div ohne semantische Bedeutung ist für LLMs unsichtbar. Ein klar strukturiertes article mit sauberer Heading-Hierarchie wird extrahiert und zitiert.

Ein Prinzip trägt die vier Regeln: eine Frage pro Abschnitt, und der Abschnitt muss ohne die Seite um ihn herum verständlich bleiben. Zitiert wird nie die Seite, zitiert wird der Absatz. Steht darin "wie oben beschrieben" oder "das Tool", ist die Passage aus dem Zusammenhang gerissen wertlos und fällt aus der Antwort heraus.

Semantisches HTML, falsch und richtig

<!-- FALSCH: Div-Suppe -->
<div class="section">
  <div class="title">Unsere Leistungen</div>
  <div class="text">Wir bieten X, Y und Z an.</div>
</div>

<!-- RICHTIG: Semantisches HTML -->
<article>
  <h2>Unsere Leistungen</h2>
  <p>Wir bieten X, Y und Z an. [Antwort zuerst]</p>
  <ul>
    <li>Leistung X: Beschreibung</li>
    <li>Leistung Y: Beschreibung</li>
    <li>Leistung Z: Beschreibung</li>
  </ul>
</article>
Heading-HierarchieGenau ein H1 pro Seite, H2 für Hauptabschnitte, H3 für Unterabschnitte, keine Sprünge von H1 auf H4.Die Heading-Struktur ist das Werkzeug, mit dem Inhalte thematisch gruppiert werden.
Answer-first-Absätze, 40 bis 60 WörterDer erste Satz beantwortet die Frage, danach kommt der Kontext.Extrahiert werden bevorzugt die ersten 40 bis 60 Wörter eines Abschnitts. Steht die Antwort im dritten Satz, wird sie abgeschnitten.
Tabellen für Vergleichsdatentable, thead und tbody mit sauberen Headern, nicht Spalten aus Divs.Strukturierte Vergleiche werden bevorzugt extrahiert, weil Zeile und Spalte die Bedeutung schon tragen.
Listen für scannbare InhalteGeordnete Listen (ol) für Schrittfolgen, ungeordnete (ul) für Aufzählungen.Listenpunkte werden als eigenständige Informationseinheiten erkannt, ideal für Checklisten.
Die vier Regeln kosten kein Redesign. Sie betreffen nur, welches Element den Text umschließt.

7.Core Web Vitals & Page Speed für KI

KI-Crawler haben Timeout-Limits. Antwortet deine Seite zu langsam, bricht der Crawler ab und indexiert nichts. Schnelle Seiten werden häufiger gecrawlt und vollständiger indexiert.

TTFB ist die kritischste Metrik für KI-Crawler. Wenn dein Server länger als 800ms braucht, um zu antworten, wird der Crawl-Versuch möglicherweise abgebrochen. CDNs, Edge-Caching und Server-Side Rendering sind deine Werkzeuge.

Der zweite Effekt wird oft übersehen: Schnelle Seiten werden häufiger neu abgeholt. Bei Perplexity, das zum Zeitpunkt der Frage abruft, entscheidet die Antwortzeit mit darüber, ob die aktuelle Fassung deiner Seite in die Antwort kommt oder die zuletzt indexierte. Serverseitiges Caching ist damit kein reines Performance-Thema, sondern Teil der Aktualität deiner Sichtbarkeit.

LCP (Largest Contentful Paint)bis 2,5 sCrawler brechen bei langsamer Antwort ab
CLS (Cumulative Layout Shift)bis 0,1Indirekt: Google-Ranking beeinflusst KI-Datenquellen
INP (Interaction to Next Paint)bis 200 msIndirekt: Nutzererfahrung beeinflusst Engagement-Signale
TTFB (Time to First Byte)bis 800 msDirekt: Crawler-Timeout-Schwelle
Zielwerte nach den offiziellen Core-Web-Vitals-Schwellen. TTFB ist der einzige Wert, den ein KI-Crawler unmittelbar selbst erlebt, die anderen drei wirken über die klassische Suche.

8.JavaScript Rendering: Das unsichtbare Problem

Die meisten KI-Crawler führen kein JavaScript aus. Ist deine Website eine Single-Page-Application, die Content erst nach dem Laden per JavaScript rendert, sehen KI-Crawler eine leere Seite. Buchstäblich.

Googlebot kann JavaScript rendern, mit Verzögerung. GPTBot, PerplexityBot und ClaudeBot können es nicht. Das heißt: Du kannst bei Google auf Platz 1 ranken und für ChatGPT gleichzeitig unsichtbar sein.

Der Test dauert zehn Sekunden. Lade die Seite mit deaktiviertem JavaScript, oder schau in den Quelltext statt in den Inspector. Was dort an Text steht, ist alles, was ein KI-Crawler von dir hat.

SSR (Server-Side Rendering)Vollständigen ContentEmpfohlen
SSG (Static Site Generation)Vollständigen ContentEmpfohlen
CSR (Client-Side Rendering)Leere HTML-HülleVermeiden
ISR (Incremental Static Regen.)Vollständigen ContentEmpfohlen
Nur eine der vier Varianten ist ein echtes Problem. Wer sie erwischt hat, merkt es ohne Test nicht, weil im Browser alles korrekt aussieht.

Die Mischform ist der häufigere Fall

Häufiger als die reine SPA ist die halb gerenderte Seite: Das Layout kommt serverseitig, aber der wichtigste Text steckt in einem Tab, einem Akkordeon oder einem Karussell, das seinen Inhalt erst beim Klick nachlädt. Im Quelltext fehlt dann genau die Passage, die zitiert werden soll. Alles, was zitierfähig sein soll, muss im ersten HTML stehen, auch wenn es visuell eingeklappt ist.

9.Frameworks mit SSR/SSG-Support

Die Framework-Wahl entscheidet die Rendering-Frage, bevor sie zum Problem wird. Alle fünf hier liefern serverseitiges HTML, nur die Stolperstellen unterscheiden sich.

Der Test gehört in den Deploy, nicht in ein Quartalsritual. Ein Skript, das nach jedem Release den Quelltext einer Kernseite abruft und nach drei Pflichtsätzen sucht, findet ein Rendering-Problem am selben Tag. Ohne diesen Schritt fällt es beim nächsten Framework-Update auf, im schlechteren Fall Monate später über fehlende Zitate.

Next.js (React)SSR, SSG, ISR out of the boxClient-Komponenten liefern kein HTML. Inhalt gehört in Server-Komponenten.
Nuxt (Vue)SSR und SSGDer Standardmodus rendert serverseitig. Den reinen SPA-Modus nicht aktivieren.
AstroStatic-first, partial hydrationIslands bleiben im HTML leer. Text gehört nicht in ein Island.
SvelteKitSSR und SSGPrerender-Option pro Route setzen, sonst bleibt es beim Client-Rendering.
WordPressnativ serverseitig gerendertAchtung bei Headless-Setups: dann entscheidet das Frontend, nicht WordPress.
Kein Framework hier ist per se ein Risiko. Das Risiko sitzt in der Konfiguration, und zwar immer an der Stelle, an der Inhalt in eine Client-Komponente rutscht.

10.Technische Checkliste: Ist deine Website KI-ready?

Fünfzehn Punkte, jeder in unter einer Stunde prüfbar. Die ersten drei entscheiden, ob die übrigen zwölf überhaupt eine Wirkung haben.

Arbeite die Liste von oben nach unten ab, nicht nach Aufwand sortiert. Punkt eins bis drei sind Zugang und Identität, sie entscheiden über die Wirkung aller weiteren. Punkt vier bis zehn sind Extraktion, dort entstehen die Zitate. Der Rest ist Hygiene: richtet keinen Schaden an, bewegt allein aber auch nichts.

robots.txt erlaubt GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBotdeine-domain.de/robots.txtBrowser, danach curl mit dem Bot-User-Agent gegen eine Inhaltsseite
llms.txt im Root-Verzeichnis mit aktuellen Unternehmensdatendeine-domain.de/llms.txtBrowser, Inhalt gegen die Website gegenlesen
Schema.org LocalBusiness/Organization auf allen SeitenJSON-LD im head, QuelltextRich Results Test oder ein Schema-Validator
FAQPage-Schema auf FAQ-SeitenQuelltext der FAQ-SeitenRich Results Test
Article-Schema mit Author auf Blog-/WissensseitenQuelltext der ArtikelRich Results Test, danach die Author-URL anklicken
Saubere Heading-Hierarchie (H1 > H2 > H3, keine Sprünge)gerenderte SeiteHeading-Outline im Accessibility-Baum des Browsers
Answer-first-Absätze: Kernaussage in den ersten 40-60 Wörternjeder einzelne Abschnittersten Satz allein lesen, beantwortet er die Frage?
Server-Side Rendering oder Static Site Generation aktivQuelltext, nicht InspectorJavaScript deaktivieren, ist der Text noch da?
TTFB unter 800ms, LCP unter 2,5sNetzwerk-Tab und FelddatenPageSpeed Insights, Core-Web-Vitals-Bericht
Sitemap.xml aktuell und in robots.txt verlinktrobots.txt und /sitemap.xmlletzte lastmod-Daten auf Plausibilität prüfen
Keine WAF/Security-Plugin-Blockade für KI-User-AgentsFirewall- und CDN-Logscurl mit Bot-User-Agent, auf den Statuscode achten
Canonical Tags korrekt gesetzthead jeder Seitezeigt der Canonical auf die Seite selbst?
Hreflang-Tags bei mehrsprachigen Websiteshead aller SprachversionenRückverweis jeder Variante prüfen
Open Graph und Twitter Card Markup vorhandenheadLink in einem Messenger einfügen, Vorschau ansehen
Interne Verlinkung mit beschreibenden AnkertextenFließtext der SeitenAnkertexte auflisten, nach "hier klicken" suchen
Fünfzehn Prüfpunkte mit Ort und Werkzeug. Für keinen davon brauchst du ein bezahltes Tool.

Häufig gestellte Fragen

01

Welche KI-Crawler muss ich in robots.txt erlauben?

Mindestens GPTBot und OAI-SearchBot (OpenAI/ChatGPT), PerplexityBot (Perplexity), ClaudeBot (Anthropic) und Googlebot (Google AI Overviews). Bingbot ist ebenfalls wichtig, weil er Daten an ChatGPT und Perplexity liefert. Blockierst du einen davon, bist du auf der jeweiligen Plattform unsichtbar.

02

Was ist llms.txt und brauche ich das?

llms.txt ist eine maschinenlesbare Zusammenfassung deiner Website im Root-Verzeichnis. Es ist kein offizieller Standard, und Google hat klargestellt, dass die eigenen KI-Funktionen die Datei nicht auswerten. Für ChatGPT, Claude und Perplexity ist sie ein leicht abrufbarer Einstiegspunkt. Der Aufwand liegt bei rund einer Stunde, also lohnt sie sich, aber nur zusätzlich zu sauberen Seiten, nie an deren Stelle.

03

Reicht Schema.org Markup allein für KI-Sichtbarkeit?

Nein. Schema.org ist eine von drei technischen Säulen (neben Crawlbarkeit und semantischem HTML). Aber ohne Schema.org fehlt LLMs der Kontext, um deine Inhalte korrekt einzuordnen. Es ist notwendig, aber nicht hinreichend.

04

Können JavaScript-Websites in KI sichtbar sein?

Nur wenn sie Server-Side Rendering (SSR) oder Static Site Generation (SSG) verwenden. Reine Client-Side-Rendered SPAs sind für die meisten KI-Crawler unsichtbar, weil diese kein JavaScript ausführen. Next.js, Nuxt oder Astro lösen das Problem durch SSR/SSG.

05

Wie teste ich, ob KI-Crawler meine Website lesen können?

Drei Methoden: 1) Server-Logs auf GPTBot, PerplexityBot und ClaudeBot prüfen. 2) Die Seite gezielt mit dem User-Agent eines KI-Crawlers abrufen und prüfen, ob Content zurückkommt. 3) In der Google Search Console unter "Crawling-Statistiken" nach KI-Bot-Zugriffen suchen. Alternativ die Seite mit deaktiviertem JavaScript im Browser laden: Was du siehst, sieht auch der KI-Crawler.

06

Wie schnell wirken technische Optimierungen auf KI-Sichtbarkeit?

Perplexity crawlt in Echtzeit, Änderungen können innerhalb von Tagen wirken. ChatGPT und Claude trainieren in Zyklen, hier dauert es 4 bis 12 Wochen. Google AI Overviews reagieren ähnlich schnell wie die klassische Google-Suche, also Tage bis wenige Wochen.

Quellen

  1. [1]OpenAI, Stand August 2026: GPTBot Dokumentation, User-Agent-Spezifikation und robots.txt-Richtlinien für GPTBot und OAI-SearchBot. Quelle
  2. [2]Anthropic, Stand August 2026: ClaudeBot Web Crawling, technische Dokumentation zum ClaudeBot-Crawler und Opt-out-Möglichkeiten.
  3. [3]llmstxt.org, Stand August 2026: llms.txt Spezifikation, Vorschlag für einen Standard zur maschinenlesbaren Website-Zusammenfassung. Quelle
  4. [4]Google Search Central, Stand August 2026: Structured Data Guidelines, Dokumentation zu Google-Extended und die offizielle Aussage zu den KI-Funktionen der Suche. Quelle
  5. [5]Perplexity, Stand August 2026: PerplexityBot Dokumentation, Crawler-Verhalten und robots.txt-Unterstützung.
  6. [6]Cloudflare, 1. Juli 2025: Cloudflare blockiert KI-Crawler bei neu angemeldeten Domains standardmäßig und fragt beim Setup ab, welche KI-Bots erlaubt sein sollen. Deshalb kann eine Website KI-Crawler aussperren, ohne dass jemand im Unternehmen das entschieden hat. Quelle
  7. [7]Web.dev, Stand August 2026: Core Web Vitals, LCP, CLS, INP und TTFB Schwellenwerte und Optimierungsstrategien. Quelle

Ist deine Website KI-ready?

Finde heraus, ob KI-Crawler deine Website lesen können, oder ob du unbewusst blockierst. Kostenlose technische Kurzanalyse in 48 Stunden.

Kostenlose KI-Analyse anfragen