Kann ChatGPT meine Webseite lesen? Was belegt ist und was nicht
Kann ChatGPT meine Webseite lesen? ChatGPT, Claude, Perplexity und Google AI Overviews können eine Webseite lesen, wenn vier Bedingungen erfüllt sind: Die robots.txt lässt ihre Such- und Nutzer-Bots herein, der Text steht ohne JavaScript im HTML, die Seite antwortet ohne Anmeldung mit Status 200, und keine Sperr-Anweisung wie noindex oder nosnippet steht im Weg. Für llms.txt, Schema.org und HTTPS gibt es keinen Beleg, dass sie das Lesen durch KI-Systeme ermöglichen oder verbessern. Eine lesbare Webseite ist Voraussetzung dafür, in KI-Antworten genannt zu werden, aber keine Garantie.
Quellenstand: 02.10.2026, Liste mit Datum am Artikelende.
Welche Faktoren für die KI-Lesbarkeit sind belegt?
Vier Faktoren sind durch die Anbieter oder durch Messungen belegt, drei verbreitete Tipps nicht.
| Faktor | Belegt? | Quelle |
|---|---|---|
| robots.txt erlaubt Such- und Nutzer-Bots | ja | Anbieter-Dokus; Vercel/MERJ 2024 |
| Text ohne JavaScript im HTML | ja, gemessen | Vercel/MERJ 2024; searchVIU 2025; Edgecomet |
| Status 200, keine Anmeldung | ja für Google | Google 2025 |
| Kein noindex, nosnippet, max-snippet | ja | Google, Bing, OpenAI |
| Keine Sperre durch Firewall oder CDN | ja, Häufigkeit unbekannt | Google, OpenAI, Perplexity, Cloudflare |
| Antwortzeit unter 5 s, HTML unter 2 MB | teilweise | Google 2026; Edgecomet |
| Titel und Überschriften | nur Empfehlung | Bing, Google |
| Kein noarchive | Google: ignoriert; Bing: ja (2023), Stand offen | Google 2026; Bing 2023 |
| llms.txt | nein | Google, Ahrefs, EZY Research 2026 |
| Schema.org | nicht nötig | Google, Bing; searchVIU |
| HTTPS | nein | keine Anbieter-Doku |
Welche Bots muss die robots.txt hereinlassen?
Für KI-Antworten zählen die Such- und Nutzer-Bots in der robots.txt, die Trainings-Bots nicht. Die robots.txt ist eine Textdatei unter /robots.txt, die KI-Crawlern (Programmen, die Webseiten automatisch abrufen) Bereiche erlaubt oder verbietet. Die Namen: bei OpenAI OAI-SearchBot (füllt den Suchindex), ChatGPT-User (holt Seiten live für eine Chatfrage) und GPTBot (sammelt Trainingstexte); bei Anthropic Claude-SearchBot, Claude-User und ClaudeBot; bei Perplexity PerplexityBot und Perplexity-User; bei Google Googlebot und für das Training der Eintrag Google-Extended; bei Microsoft Copilot der Bingbot.
Laut OpenAI erscheinen Seiten, die OAI-SearchBot aussperren, nicht in den Suchantworten von ChatGPT, höchstens als bloßer Link. Perplexity empfiehlt, PerplexityBot zuzulassen, Google nennt die Regeln für Googlebot als Steuerung des Abrufs zur Suche. Vercel und MERJ maßen im Dezember 2024, dass die robots.txt bei allen gemessenen Crawlern wirkt. Bei Nutzer-Bots gehen die Anbieter auseinander: Laut Anthropic ruft Claude keine Seite ab, die Claude-User sperrt; für ChatGPT-User gelten die Regeln laut OpenAI eventuell nicht, Perplexity-User ignoriert sie laut Perplexity meist.
Überholt ist die Annahme, wer GPTBot sperre, verschwinde aus ChatGPT: GPTBot dient laut OpenAI nur dem Training. Ebenso steuert Google-Extended laut Google nur Training und Grounding (Stützen von Antworten auf Webquellen) in der Gemini-App, nicht die Google-Suche, aus der Google AI Overviews schöpfen.
Warum muss der Text ohne JavaScript im HTML stehen?
Die Crawler von OpenAI, Anthropic und Perplexity führen nach allen vorliegenden Messungen kein JavaScript aus; Text, den erst JavaScript im Browser erzeugt, sehen sie nicht. Vercel und MERJ werteten im Dezember 2024 einen Monat Datenverkehr auf nextjs.org, im Vercel-Netz und auf zwei Jobportalen aus: OAI-SearchBot, ChatGPT-User, GPTBot, ClaudeBot und PerplexityBot führten kein JavaScript aus, Gemini über die Technik von Googlebot schon. Copilot fehlt, weil es keinen eigenen User-Agent (Kennung des Abrufprogramms) hat. Die Messung wurde nicht wiederholt.
Bei searchVIU (eine Testseite, 30.10.2025) fanden ChatGPT und Claude einen nur per JavaScript eingefügten Preis nicht, Gemini schon; Claude fand dort allerdings gar nichts, was eher auf einen gescheiterten Abruf deutet. Edgecomet, ein Anbieter von Prerendering (vorab erzeugtem HTML), sah ChatGPT-User nach dem HTML aufhören. Google schreibt, nicht alle Bots könnten JavaScript ausführen (Stand 04.03.2026). Ein Cookie-Banner allein ist als Hindernis nicht belegt.
Muss die Seite mit Status 200 und ohne Anmeldung erreichbar sein?
Für Google ja: AI Overviews und AI Mode nutzen nur indexierte Seiten, und Google indexiert nur Seiten mit Status 200 (Antwortcode „in Ordnung“) ohne Anmeldung (Stand 18.12.2025). Weitere technische Anforderungen außer einem erlaubten Snippet (Textauszug) nennt Google nicht (Stand 10.12.2025). OpenAI, Anthropic und Perplexity äußern sich zu Statuscodes nicht.
Kurze Weiterleitungsketten stören nicht: Google folgt bis zu zehn (Stand 04.02.2026), und laut Vercel und MERJ entfallen 14,36 Prozent der Abrufe von ChatGPT auf Weiterleitungen. Die oft genannte Höchstzahl „3 bis 5“ für KI-Crawler stammt aus einem Blog ohne Methode.
Welche Sperr-Anweisungen halten KI-Systeme fern?
noindex, nosnippet und max-snippet im Meta-Tag robots oder im Header X-Robots-Tag halten Inhalte nach Angaben von Google, Bing und OpenAI aus KI-Antworten heraus. Mit noindex markierte Adressen erscheinen laut Bing weder in der Bing-Suche noch in Copilot; OpenAI empfiehlt noindex für Seiten, die in ChatGPT nicht einmal als Link auftauchen sollen. nosnippet verhindert laut Google, dass der Inhalt direkt in AI Overviews und AI Mode einfließt, max-snippet begrenzt die Menge. Laut OpenAI liest der Crawler ein Meta-Tag nur, wenn er die Seite abrufen darf; eine per robots.txt gesperrte Seite übermittelt ihr noindex also nicht.
Wie schnell und wie groß darf eine Seite für KI-Crawler sein?
Eine offizielle Grenze nennt nur Google: Googlebot liest von jeder Adresse die ersten 2 MB, PDFs ausgenommen (Google-Blog, 31.03.2026). OpenAI, Anthropic und Perplexity veröffentlichen weder Größen- noch Zeitgrenzen. Im Einzeltest von Edgecomet, das Beschleunigung verkauft, brach ChatGPT-User nach fünf Sekunden ab, GPTBot nach bis zu neun. Ratgeber-Angaben wie „1 bis 5 Sekunden“ beruhen auf keiner eigenen Messung.
Helfen Titel und Überschriften KI-Crawlern beim Lesen?
Titel und Überschriften werden empfohlen, ihre Wirkung auf den Abruf ist nicht gemessen. Bing rät zu <title>, Meta-Beschreibung, Überschriften von H1 bis H6 und semantischem HTML (Elementen wie <article>, die ihre Bedeutung benennen). Google nennt semantisches HTML nicht nötig, aber „im Allgemeinen eine gute Idee“. Bei Edgecomet verarbeitete ChatGPT-User nur reinen Text.
Kann eine Firewall eine Seite sperren, die die robots.txt freigibt?
Ja, ein CDN (Servernetz, das Webseiten ausliefert und schützt) oder eine Firewall kann KI-Bots abweisen, die die robots.txt erlaubt. Google verlangt, dass auch CDN und Hosting den Abruf zulassen. Cloudflare kündigte am 01.07.2025 an, KI-Crawler ohne Erlaubnis standardmäßig zu blockieren, und laut Doku (Stand 01.07.2026) ab 15.09.2026 bei neuen Domains auch Agenten-Bots wie ChatGPT-User auf Seiten mit Werbung. Wie oft das kleine Webseiten trifft, ist nicht gemessen und von außen nicht sicher prüfbar.
Welche verbreiteten Tipps zur KI-Lesbarkeit sind nicht belegt?
Diese vier Tipps sind unbelegt oder wirken anders als oft behauptet.
Hilft eine llms.txt, damit KI-Systeme eine Seite lesen?
Nein, die großen KI-Crawler holen die llms.txt (eine Markdown-Datei mit Seitenübersicht, laut llmstxt.org vor allem für Software-Dokumentation) kaum ab, und Google nutzt sie nicht. Google schreibt im Leitfaden zur KI-Optimierung, die Suche nutze solche Dateien nicht und sie wirkten weder positiv noch negativ (Ergänzung vom 15.06.2026). OpenAI, Anthropic, Perplexity und Microsoft sagen nicht zu, sie zu lesen. Googles Prüfwerkzeug Lighthouse wertet ihr Fehlen als „nicht anwendbar“ (Stand 05.05.2026).
Ahrefs fand bei 137.210 Domains, dass 97 Prozent der llms.txt-Dateien im Mai 2026 keinen Abruf bekamen (veröffentlicht 15.06.2026). EZY Research (verkauft llms.txt-Dateien) zählte vom 27.04. bis 19.07.2026 auf 83 Seiten bei OpenAI 3.990 robots.txt- gegen 7 llms.txt-Abrufe, bei Anthropic 3.120 gegen 9, bei PerplexityBot 775 gegen 0; nur Meta-ExternalAgent holte die llms.txt öfter. Dries Buytaert zählte 2026 auf der Acquia-Hosting-Flotte etwa 5.000 llms.txt-Abrufe unter 400 Millionen Anfragen, fast alle von SEO-Werkzeugen.
Brauchen KI-Systeme Schema.org-Daten?
Nein, laut Google sind strukturierte Daten wie Schema.org (maschinenlesbare Angaben zu Firma, Adresse oder Preis, meist als JSON-LD im Quelltext) für die generative KI-Suche nicht nötig. Laut Bing können sie das Grounding unterstützen, garantieren aber nichts; beide Anbieter verlangen, dass sie dem sichtbaren Text entsprechen. Bei searchVIU fand kein System einen Preis, der nur im JSON-LD stand, und laut Edgecomet ignoriert ChatGPT-User das Markup.
Ist HTTPS eine Bedingung für KI-Crawler?
Nein, in den Crawler- und KI-Dokus von OpenAI, Anthropic, Perplexity, Google und Bing kommt HTTPS nicht als Bedingung vor. Eine Weiterleitung von http auf https stört nicht, weil Google und ChatGPT Weiterleitungen folgen. Dass ein abgelaufenes Zertifikat den Abruf scheitern lässt, ist naheliegend, für KI-Crawler aber nicht belegt.
Schließt noarchive eine Seite aus Microsoft Copilot aus?
Bei Google ist noarchive wirkungslos, bei Microsoft Copilot kann es nach einer Bing-Angabe von 2023 einen Ausschluss bedeuten. Googles Seite zum Robots-Meta-Tag (Stand 24.03.2026) sagt: „The noarchive rule is no longer used by Google Search to control whether a cached link is shown in search results, as the cached link feature no longer exists.“ (Die Google-Suche nutzt noarchive nicht mehr, weil es den Link zur gespeicherten Kopie nicht mehr gibt.) Bing schrieb im September 2023, mit NOARCHIVE markierte Inhalte erschienen nicht in Bing-Chat-Antworten. Ob das heute gilt, war nicht prüfbar, weil die aktuelle Bing-Hilfeseite nur als Suchauszug lesbar war.
Welche Fehler machen quelloffene Prüfwerkzeuge für KI-Lesbarkeit?
Mehrere Prüfwerkzeuge auf GitHub widersprechen den Anbietern (Stand 02.10.2026). geo-seo-claude zieht für eine GPTBot-Sperre 15 Punkte ab, obwohl GPTBot laut OpenAI nur dem Training dient, und nennt für die „ideale“ Abschnittslänge von 134 bis 167 Wörtern keine Quelle. geo-optimizer-skill belohnt unbelegte Dateien wie /ai/summary.json, afdocs deckelt das Ergebnis ohne llms.txt bei 59 Punkten. geoscore und claude-seo werten llms.txt mit null.
Wie lässt sich prüfen, ob ChatGPT eine Webseite lesen kann?
Wer eine Webseite für KI lesbar machen will, kann fünf Faktoren im Browser selbst prüfen.
- robots.txt:
https://domain.de/robots.txtöffnen.User-agent: OAI-SearchBot(oder ein anderer Such-Bot) mitDisallow: /darunter sperrt diesen Bot,User-agent: *mitDisallow: /sperrt alle. Fehlt die Datei (Fehler 404), ist nach dem Standard RFC 9309 alles erlaubt. - Text ohne JavaScript: Rechtsklick, „Seitenquelltext anzeigen“, mit Strg+F einen sichtbaren Satz suchen. Fehlt er, entsteht er per JavaScript.
- Sperr-Anweisungen: im Quelltext nach
noindex,nosnippetundmax-snippetsuchen; den Header X-Robots-Tag zeigen die Entwicklerwerkzeuge unter „Netzwerk“. - Anmeldung: die Seite in einem privaten Fenster öffnen. Verlangt sie ein Login, kommt zumindest Googlebot nicht weiter.
- Firewall: beim Hoster oder CDN prüfen, ob ein Bot-Schutz oder eine KI-Sperre aktiv ist.
Der kostenlose LLM-Checker auf codeback.de/llm-checker misst sechs dieser Faktoren mit zusammen 100 Punkten (Bewertung vom 03.10.2026). HTTPS, llms.txt, Schema.org, Trainings-Bots und noarchive zeigt er nur als Information; Firewall-Sperren misst er nicht.
Garantiert eine lesbare Webseite, dass ChatGPT oder Google sie zitiert?
Nein, Lesbarkeit entscheidet nur, ob ein KI-System eine Seite abrufen und lesen kann, nicht, ob es sie auswählt oder zitiert. Eine Princeton-Studie (Aggarwal u. a., KDD 2024) maß bis zu 40 Prozent mehr Sichtbarkeit in generativen Suchmaschinen durch Textänderungen wie Quellenangaben und Statistiken. Offen ist eine Google-Bedingung: Laut Leitfaden zur KI-Optimierung (Stand 10.07.2026) muss eine Seite in der Search Console für die generativen KI-Funktionen „eingeschlossen“ sein; was das heißt, erklärt Google nicht.
Häufige Fragen
Sollte man GPTBot sperren, wenn die Inhalte nicht ins KI-Training sollen?
GPTBot dient laut OpenAI nur dem Training; wer ihn sperrt und OAI-SearchBot erlaubt, bleibt für die ChatGPT-Suche erreichbar.
Braucht eine Webseite eine llms.txt?
Für die Lesbarkeit durch ChatGPT, Claude, Perplexity oder Google nicht. Google nutzt sie nicht, und laut Ahrefs (Juni 2026) und EZY Research (Juli 2026) rufen die Bots von OpenAI, Anthropic und Perplexity sie kaum ab.
Verschwindet eine Seite aus den Google AI Overviews, wenn Google-Extended gesperrt ist?
Nein. Google-Extended betrifft laut Google nur Training und Grounding in der Gemini-App; für AI Overviews zählt Googlebot.
Hält sich jeder KI-Bot an die robots.txt?
Nein. ChatGPT-User und Perplexity-User halten sich laut OpenAI und Perplexity nicht unbedingt daran, weil ein Nutzer den Abruf auslöst. Anthropic schreibt, seine Bots befolgten die robots.txt.
Quellen
Alle abgerufen am 02.10.2026. Das Datum in Klammern ist der Stand, den die Seite selbst nennt.
Anbieter (Primärquellen):
- OpenAI, Overview of OpenAI Crawlers: https://developers.openai.com/api/docs/bots
- OpenAI, Hilfeartikel für Seitenbetreiber: https://help.openai.com/en/articles/12627856
- Anthropic, Crawler: https://support.claude.com/en/articles/8896518
- Perplexity, Crawler: https://docs.perplexity.ai/docs/resources/perplexity-crawlers
- Google, AI features and your website (10.12.2025): https://developers.google.com/search/docs/appearance/ai-features
- Google, Leitfaden zur KI-Optimierung (10.07.2026): https://developers.google.com/search/docs/fundamentals/ai-optimization-guide
- Google, Änderungsprotokoll der Search-Doku (Eintrag 15.06.2026): https://developers.google.com/search/updates
- Google, technische Anforderungen (18.12.2025): https://developers.google.com/search/docs/essentials/technical
- Google, Weiterleitungen und HTTP-Fehler (04.02.2026): https://developers.google.com/search/docs/crawling-indexing/http-network-errors
- Google, Robots-Meta-Tag (24.03.2026): https://developers.google.com/search/docs/crawling-indexing/robots-meta-tag
- Google, JavaScript-SEO-Grundlagen (04.03.2026): https://developers.google.com/search/docs/crawling-indexing/javascript/javascript-seo-basics
- Google, Crawler-Blog (31.03.2026): https://developers.google.com/search/blog/2026/03/crawler-blog-post
- Google Chrome, Lighthouse-Prüfung llms.txt (05.05.2026): https://developer.chrome.com/docs/lighthouse/agentic-browsing/llms-txt
- Bing, Webmaster-Richtlinien: https://www.bing.com/webmasters/help/webmaster-guidelines-30fba23a
- Bing, Blog zu Bing Chat (September 2023): https://blogs.bing.com/webmaster/2023/9/Announcing-new-options-for-webmasters-to-control-usage-of-their-content-in-Bing-Chat/
- Cloudflare, Pressemitteilung (01.07.2025): https://www.cloudflare.com/press/press-releases/2025/cloudflare-just-changed-how-ai-crawlers-scrape-the-internet-at-large/
- Cloudflare, Block AI bots (01.07.2026): https://developers.cloudflare.com/bots/additional-configurations/block-ai-bots/
Spezifikation und Standard:
- llms.txt-Spezifikation: https://llmstxt.org/
- RFC 9309, Robots Exclusion Protocol: https://www.rfc-editor.org/rfc/rfc9309
Messungen, Einzeltests und Studien:
- Vercel und MERJ, Messung der KI-Crawler (Dezember 2024): https://vercel.com/blog/the-rise-of-the-ai-crawler
- searchVIU, Einzeltest mit einer Seite (Test 30.10.2025, veröffentlicht 02.12.2025): https://www.searchviu.com/en/schema-markup-and-ai-in-2025-what-chatgpt-claude-perplexity-gemini-really-see/
- Edgecomet, Einzeltest mit GPTBot und ChatGPT-User (ohne Datum; der Anbieter verkauft Prerendering): https://edgecomet.com/blog/openseotest-how-gptbot-and-chatgpt-user-handle-javascript/
- Ahrefs, llms.txt-Studie (15.06.2026): https://ahrefs.com/blog/llmstxt-study/
- EZY Research, Abrufe von llms.txt (27.04. bis 19.07.2026; der Anbieter verkauft llms.txt-Erzeugung): https://www.ezy.ai/research/do-ai-bots-read-llms-txt
- Dries Buytaert, Markdown, llms.txt und KI-Crawler (2026): https://dri.es/markdown-llms-txt-and-ai-crawlers
- Aggarwal u. a., Generative Engine Optimization (KDD 2024): https://arxiv.org/abs/2311.09735
Prüfwerkzeuge (Stand 02.10.2026): https://github.com/zubair-trabzada/geo-seo-claude, https://github.com/Auriti-Labs/geo-optimizer-skill, https://github.com/agent-ecosystem/afdocs, https://github.com/Amiyadesi/geoscore, https://github.com/AgriciDaniel/claude-seo