Woher nehmen ChatGPT & Perplexity ihre Antworten?
Aus zwei getrennten Quellen: Modellwissen — Milliarden von Texten aus dem Training, eingefroren zu einem Stichtag — und Live-Websuche, bei der das System aktuelle Webseiten abruft und daraus die Antwort baut (Retrieval-Augmented Generation, RAG). Perplexity sucht bei praktisch jeder Frage live und zitiert seine Quellen; ChatGPT kombiniert beides und schaltet die Websuche zu, wenn Aktualität gefragt ist. Für Unternehmen heißt das: Es gibt zwei Wege in die Antworten — und beide lassen sich gezielt bespielen.
Wer verstehen will, warum eine KI den Wettbewerber empfiehlt und die eigene Website ignoriert, muss eine Frage beantworten können: Woher hat das System diese Antwort überhaupt? Die meisten Erklärungen bleiben bei „die KI durchsucht das Internet“ — das ist ungefähr so präzise wie „das Auto fährt mit Energie“. Dieser Artikel zeigt die Mechanik dahinter: die zwei Quellen, die Unterschiede zwischen ChatGPT und Perplexity, die Crawler dahinter — und was das konkret für deine Website bedeutet.
| Quelle 1: Modellwissen | Trainingsdaten bis zu einem Stichtag (Knowledge Cutoff) — breit, aber nicht aktuell und nicht korrigierbar |
| Quelle 2: Live-Websuche | Retrieval-Augmented Generation (RAG): Suchindex abfragen, Seiten laden, Antwort aus den Passagen bauen, Quellen verlinken |
| Perplexity | sucht bei praktisch jeder Anfrage live, zitiert konsequent; eigener Index + PerplexityBot |
| ChatGPT | antwortet aus Modellwissen und schaltet ChatGPT Search bei Aktualitätsbedarf zu; Quellenangaben bei Suchantworten |
| OpenAI-Crawler | GPTBot (Training), OAI-SearchBot (Suchindex), ChatGPT-User (Live-Abruf durch Nutzeranfrage) — drei Bots, drei Aufgaben |
| Weg 1 in die Antworten | Erwähnungen im Web (Presse, Verzeichnisse, Fachartikel) → Modellwissen — langfristig |
| Weg 2 in die Antworten | crawlbare, zitierfähig strukturierte Website → Live-Suche — kurzfristig wirksam |
| Anbieter | Deine SEO Agentur, Herten (NRW) — deine-seo-agentur.de |
Die zwei Quellen: Gedächtnis und Recherche
Die beste Analogie ist ein Berater im Kundengespräch: Manches beantwortet er aus dem Gedächtnis — sein über Jahre angesammeltes Wissen. Für anderes greift er zum Laptop und recherchiert live. KI-Assistenten arbeiten genauso, und beide Quellen haben völlig unterschiedliche Eigenschaften:
Beim Training liest das Modell riesige Mengen an Webseiten, Büchern und Artikeln — bis zu einem Stichtag, dem Knowledge Cutoff. Dieses Wissen steckt danach fest in den Modellparametern.
Eigenschaften: enorm breit, aber nie aktueller als der Stichtag. Nicht direkt korrigierbar — steht etwas Falsches über dein Unternehmen „im Gedächtnis“, bleibt es dort bis zur nächsten Modellgeneration.
Wie du reinkommst: durch konsistente Präsenz im offenen Web über Jahre — Fachartikel, Presse, Verzeichnisse, Branchenportale. Je öfter und widerspruchsfreier deine Marke im Trainingsmaterial vorkommt, desto eher „kennt“ dich das Modell.
Bei aktuellen oder spezifischen Fragen recherchiert das System live: Suchindex abfragen, passende Seiten laden, die besten Passagen auswählen und daraus die Antwort formulieren — mit Quellenlinks. Das Verfahren heißt Retrieval-Augmented Generation (RAG).
Eigenschaften: tagesaktuell, quellenbasiert, überprüfbar — und der Bereich, den du direkt steuern kannst.
Wie du reinkommst: crawlbare Website, gute Auffindbarkeit für das Thema und zitierfähig strukturierte Inhalte — kompakte Antworten, Faktendichte, klare Struktur. Änderungen wirken hier in Wochen, nicht in Modellgenerationen.
Modellwissen ist Reputation, Live-Suche ist Auffindbarkeit. Am Gedächtnis der Modelle arbeitest du über Jahre mit Erwähnungen im Web — an der Recherche arbeitest du ab heute mit deiner eigenen Website. GEO bespielt beide Wege, aber der schnelle Hebel ist immer die Live-Suche.
ChatGPT vs. Perplexity: zwei Philosophien, dieselben Bausteine
Beide Systeme nutzen beide Quellen — aber mit unterschiedlicher Gewichtung, und das verändert, wie du dort sichtbar wirst:
| Kriterium | ChatGPT | Perplexity |
|---|---|---|
| Grundprinzip | Antwortet bevorzugt aus Modellwissen; schaltet die Websuche zu, wenn Aktualität oder Fakten gefragt sind | „Answer Engine“: sucht bei praktisch jeder Anfrage live im Web |
| Quellenangaben | Bei Suchantworten verlinkte Quellen; bei reinen Modellwissen-Antworten keine | Konsequente Zitate mit nummerierten Quellenlinks bei nahezu jeder Antwort |
| Suchgrundlage | Eigener Suchindex, aufgebaut u. a. über OAI-SearchBot, ergänzt durch Partnerdaten | Eigener Index über PerplexityBot, auf schnelle Aktualisierung ausgelegt |
| Konsequenz für dich | Beide Wege zählen: Markenpräsenz im Web (Gedächtnis) und crawlbare, zitierfähige Inhalte (Suche) | Fast alles entscheidet sich über die Live-Suche — der direkteste Hebel für schnelle Sichtbarkeit |
Die Auswahl-Logik innerhalb der Live-Suche ist bei beiden ähnlich — und sie ist dieselbe Dreier-Mechanik, die auch Google AI Overviews antreibt: Anfrage in Teilfragen zerlegen, je Teilfrage die beste Passage finden, Antwort zusammensetzen. Bevorzugt werden Passagen, die in sich geschlossen sind: eine Definition in zwei Sätzen, ein FAQ-Eintrag, eine Tabelle. Genau deshalb funktioniert das Answer-Capsule-Prinzip aus „Was ist GEO?“ systemübergreifend.
Die Crawler dahinter: drei Bots, drei Aufgaben — Verwechslung teuer
„KI-Crawler blockieren oder zulassen?“ lässt sich nur beantworten, wenn klar ist, welcher Bot welchen Job hat. Allein OpenAI betreibt drei verschiedene:
| Crawler | Aufgabe | Wenn du ihn blockierst … |
|---|---|---|
GPTBot | Sammelt Trainingsdaten für künftige OpenAI-Modelle | … fließen deine Inhalte nicht ins Modellwissen künftiger Generationen ein — die Live-Suche bleibt davon unberührt |
OAI-SearchBot | Baut den Suchindex für ChatGPT Search auf | … verschwindest du aus den ChatGPT-Suchantworten — der teuerste Fehler für die Sichtbarkeit |
ChatGPT-User | Ruft Seiten live ab, wenn ein Nutzer konkret danach fragt oder einen Link teilt | … können Nutzeranfragen zu deiner Seite nicht beantwortet werden; als nutzerausgelöster Abruf wird er zudem anders behandelt als klassische Crawler |
PerplexityBot | Baut und aktualisiert den Perplexity-Suchindex | … fehlst du in Perplexity-Antworten — dem System mit der konsequentesten Quellen-Zitierung |
Der in der Praxis häufigste Fehler ist dabei gar keine bewusste Entscheidung: Bot-Schutz auf Firewall- oder CDN-Ebene weist die KI-Crawler pauschal ab, während die robots.txt vorbildlich aussieht. Ob du betroffen bist, zeigt der 3-Fragen-Selbsttest — wirst du trotz guter Rankings nirgends zitiert, gehört der Crawler-Zugang ganz oben auf die Prüfliste.
Was das für deine Website bedeutet: beide Wege bespielen
- Crawler-Zugang prüfen — alle, nicht nur Googlebot robots.txt und Bot-Schutz (Firewall/CDN) auf OAI-SearchBot, PerplexityBot & Co. kontrollieren. Ohne Zugang existiert deine Seite für die Live-Suche nicht.
- Zitierfähige Passagen bauen Kompakte Antworten unter Frage-Überschriften, Definitionen, Tabellen, FAQ-Blöcke — die Bausteine, die RAG-Systeme ausschneiden und verwenden können.
- Faktendichte erhöhen Konkrete Zahlen, Orte, Zeiträume, Preise. Systeme, die Quellen verlinken, bevorzugen Aussagen, die sich belegen lassen.
- Erwähnungen außerhalb der eigenen Website aufbauen Branchenverzeichnisse, Fachbeiträge, Presse, Portale — konsistente Unternehmensdaten (Name, Ort, Leistungen) überall. Das füttert das Modellwissen der nächsten Generationen und stützt zugleich die Autoritätsbewertung in der Live-Suche.
- Beide Wege messen Mit einem festen Frage-Set in ChatGPT und Perplexity prüfen: Wirst du genannt (Modellwissen)? Wirst du zitiert (Live-Suche)? Stimmen die Angaben? Die Methodik steht im Artikel „AI Share of Voice“.
Häufige Fragen zu KI-Antwortquellen
Woher nimmt ChatGPT seine Antworten?
Aus zwei Quellen: dem Modellwissen aus dem Training (Texte bis zum Knowledge Cutoff, gespeichert in den Modellparametern) und der Live-Websuche über ChatGPT Search, die bei aktuellen oder faktenlastigen Fragen zugeschaltet wird und Quellen verlinkt.
Woher nimmt Perplexity seine Antworten?
Perplexity arbeitet als „Answer Engine“ fast ausschließlich mit Live-Websuche: Es fragt bei praktisch jeder Anfrage seinen eigenen Suchindex ab, lädt passende Seiten, baut die Antwort aus deren Passagen und zitiert die Quellen mit nummerierten Links.
Was ist Retrieval-Augmented Generation (RAG)?
RAG ist das Verfahren hinter KI-Suchantworten: Statt nur aus dem Trainingsgedächtnis zu antworten, ruft das System zuerst aktuelle Dokumente ab (Retrieval) und formuliert die Antwort dann auf Basis dieser Dokumente (Generation). Vorteil: aktuelle, quellenbasierte, überprüfbare Antworten.
Was ist der Unterschied zwischen GPTBot und OAI-SearchBot?
GPTBot sammelt Trainingsdaten für künftige OpenAI-Modelle; OAI-SearchBot baut den Suchindex für ChatGPT Search auf. Wer GPTBot blockiert, hält seine Inhalte aus dem Modelltraining heraus — wer OAI-SearchBot blockiert, verschwindet aus den ChatGPT-Suchantworten. Für die Sichtbarkeit ist der zweite Fall der teurere.
Die KI erzählt Falsches über mein Unternehmen — wie korrigiere ich das?
Falsches Modellwissen lässt sich nicht direkt löschen — aber überschreiben: Die Live-Suche schlägt das Gedächtnis. Sorge dafür, dass die korrekten Angaben crawlbar, strukturiert und konsistent auf deiner Website und in Verzeichnissen stehen; sobald das System live recherchiert, gewinnen die aktuellen Quellen. Langfristig korrigieren konsistente Web-Erwähnungen auch das Wissen künftiger Modellgenerationen.
Reicht es, nur für Google zu optimieren?
Nein — aber die Überschneidung ist groß. ChatGPT und Perplexity betreiben eigene Crawler und Indizes, deshalb muss der Zugang für diese Bots separat geprüft werden. Die Content-Prinzipien dagegen sind identisch: Was für Google AI Overviews zitierfähig ist, ist es auch für ChatGPT und Perplexity.
Kennt die KI dein Unternehmen — und stimmt, was sie erzählt?
Ich prüfe kostenlos, ob ChatGPT und Perplexity dich finden, zitieren und korrekt beschreiben — auf beiden Wegen: Modellwissen und Live-Suche. Trag deine E-Mail ein, ich melde mich persönlich.
Kein Newsletter, kein Spam — eine persönliche Antwort von Andreas Böhm.
