ChatGPT-Sichtbarkeit messen heißt: eine feste Liste von Fragen mehrfach abfragen, jede Nennung protokollieren und daneben den Traffic auswerten, der aus KI-Antworten auf die Website kommt. Eine einzelne Abfrage reicht dafür nicht. Dasselbe Modell antwortet auf dieselbe Frage nicht zweimal identisch, und wer nur einmal fragt, misst Zufall.
Dieser Artikel geht die drei Bausteine im Detail durch: den Prompt-Test mit Wiederholungen, die Auswertung von Referrern und Server-Log, und die Frage, welchen Teil davon Tracking-Tools abnehmen können. Wie das Ganze in die Gesamtstrategie passt, steht in unserem Überblick zu Generative Engine Optimization.
Warum ChatGPT-Sichtbarkeit ein eigenes KPI wird
Klassische SEO-Kennzahlen wie Position, Klicks und Impressionen sagen nichts darüber aus, ob eine KI Ihre Marke kennt und empfiehlt. Das sind zwei getrennte Sichtbarkeitswelten. Eine Website kann bei Google auf Platz 1 stehen und in ChatGPT trotzdem nie genannt werden, und umgekehrt.
Der Grund liegt im Mechanismus. ChatGPT beantwortet Fragen aus dem Trainingswissen des Modells und, wenn die Websuche aktiv ist, zusätzlich aus Seiten, die es im Moment der Anfrage abruft. Es zählt nicht der Rang in den blauen Links, sondern ob die Marke im Fließtext der Antwort als passende Empfehlung auftaucht. Deshalb braucht KI-Sichtbarkeit eine eigene Messgröße neben den gewohnten Google-Reports.
Für Agenturen und Unternehmen heißt das: Wer ChatGPT-Nennungen nicht misst, hat einen blinden Fleck. Wie groß der ist, lässt sich vorher nicht sagen. Deshalb steht am Anfang die Messung und nicht die Maßnahme.
Prompt-Tests: wie viele, wie formuliert, wie oft
Der Prompt-Test ist die einzige Methode, die direkt misst, was ein Interessent zu sehen bekommt. Sie kostet nichts außer Zeit, und sie steht und fällt mit der Disziplin beim Aufbau.
Wie viele Fragen, und welche
Zwölf bis fünfzehn Fragen reichen. Eine längere Liste klingt gründlicher, wird aber nach zwei Runden nicht mehr durchgehalten. Wichtig ist die Mischung, denn verschiedene Fragetypen messen verschiedene Dinge:
- Kategoriefragen ohne Marke. „Welche SEO-Agentur in Nürnberg ist empfehlenswert?“ Das ist der eigentliche Sichtbarkeitstest, weil hier nichts vorgegeben wird.
- Problemfragen. „Meine Website wird bei Google nicht gefunden, was kann ich tun?“ Hier zeigt sich, ob die Marke auch dann auftaucht, wenn jemand ein Problem schildert statt nach einer Firma zu fragen.
- Vergleichsfragen. „Was ist der Unterschied zwischen einer SEO-Agentur und einem Freelancer?“ Solche Antworten nennen gern Beispiele und liefern das Material für den Wettbewerbsvergleich.
- Markenfragen. „Was macht SEOFX?“ Das misst keine Sichtbarkeit, sondern Entitätswissen: Kennt das Modell die Firma überhaupt, und stimmt, was es erzählt.
Formulieren Sie die Fragen so, wie ein Kunde sie tippt, nicht wie ein Keyword-Tool sie ausgibt. „Welche SEO-Agentur in Nürnberg ist empfehlenswert?“ liefert andere Antworten als „beste SEO-Agentur Bayern“. Wer eine größere Sammlung als Ausgangsmaterial sucht, findet in unserer Übersicht zu ChatGPT-Prompts für SEO Vorlagen samt Einschätzung, wo sie an ihre Grenzen kommen.
Wie oft wiederholt wird
An dieser Stelle scheitern die meisten Messungen. Ein Sprachmodell würfelt bei jeder Antwort mit, also fragt man nicht einmal, sondern fünfmal je Prompt. Bei fünfzehn Fragen sind das 75 Abfragen pro Messrunde und rund zwei Stunden Arbeit.
Aus den fünf Läufen wird die Nennungsquote je Frage: drei Treffer von fünf sind 60 Prozent, kein schlichtes Ja. Damit wird die Schwankung selbst zur Kennzahl, statt die Auswertung zu stören. Und sie zeigt, wie vorsichtig man Veränderungen deuten muss. Ein Prompt, der von zwei auf drei Nennungen springt, hat sich bei dieser Stichprobengröße rechnerisch noch gar nicht bewegt. Erst wenn sich dieselbe Frage über zwei Runden in dieselbe Richtung schiebt, ist es ein Trend.
Vier Regeln, ohne die die Zahlen nicht vergleichbar sind:
- Jede Abfrage in einem neuen Chat. Im selben Thread übernimmt das Modell den Kontext der vorherigen Frage und antwortet danach anders.
- Abgemeldet oder ohne Memory. Ein eingeloggtes Konto personalisiert und erinnert sich an frühere Gespräche über die eigene Firma. Genau das verfälscht das Ergebnis.
- Websuche getrennt protokollieren. Mit aktiver Websuche messen Sie, ob Ihre Seiten live gefunden werden. Ohne Websuche messen Sie das Trainingswissen. Das sind zwei Kennzahlen, nicht eine.
- Modellversion notieren. Nach einem Modellwechsel beginnt die Zeitreihe faktisch neu. Das gehört als Fußnote in den Report, sonst erklärt später niemand mehr den Sprung in der Kurve.
Protokolliert wird pro Zeile: Datum, Modellversion, Nummer der Frage, Nummer des Laufs, genannt ja oder nein, Position innerhalb der Aufzählung, mitgenannte Wettbewerber und ob die Antwort eine Quelle verlinkt hat. Die letzte Spalte ist die wertvollste. Sie sagt Ihnen, welche fremde Seite ChatGPT gerade anstelle Ihrer zitiert, und daraus wird die Liste der Seiten, auf denen Sie vorkommen sollten.
Praxis-Tipp: Nutzen Sie für die Tests ein abgemeldetes Browserfenster ohne Verlauf, und zwar für jede der 75 Abfragen dasselbe. So messen Sie, was ein neuer Interessent zu sehen bekommt, und nicht, woran sich Ihr eigenes Konto erinnert.
Referer-Analyse: was in Analytics ankommt und was nicht
Sobald jemand aus einer ChatGPT-Antwort auf Ihre Website klickt, hinterlässt das eine Spur. Nur eben keine vollständige. Diese Hostnamen tauchen in der Praxis als Verweisquelle auf:
chatgpt.comfür Klicks aus ChatGPT, dazuchat.openai.comaus älteren Linksperplexity.aiundwww.perplexity.aigemini.google.com, in Altdaten auchbard.google.comcopilot.microsoft.comfür Microsoft Copilot
ChatGPT hängt an ausgehende Links zusätzlich utm_source=chatgpt.com an. Das hilft, weil der Parameter in der aufgerufenen URL steht und damit auch dann ankommt, wenn der Referrer unterwegs verloren geht. Bauen Sie Ihr Segment in GA4 deshalb auf beides, Verweisquelle und Parameter, sonst fehlt Ihnen genau der Anteil, bei dem nur eines von beidem übrig bleibt.
Jetzt der Teil, den fast alle Auswertungen unterschlagen: Ein erheblicher Anteil der KI-getriebenen Besuche trägt überhaupt keinen Referrer.
- Die ChatGPT-Apps für iOS, Android und Desktop öffnen Links teils im eigenen Fenster. Der Referrer geht dabei verloren, der Besuch landet in GA4 unter „Direkt“.
- Viele Menschen klicken den Link gar nicht. Sie lesen den Firmennamen in der Antwort und tippen ihn anschließend bei Google ein. Dieser Weg erscheint als Markensuche in der Search Console, nie als KI-Verweis.
- Google AI Overviews verweisen mit google.com als Quelle. Solche Klicks sind von normaler organischer Suche nicht zu trennen.
Die Referrer-Zahl ist damit eine Untergrenze, kein Gesamtwert. Wer sie einem Kunden als vollständigen KI-Beitrag präsentiert, untertreibt um einen unbekannten Faktor. Ein brauchbarer Gegencheck ist die Entwicklung der Markensuchanfragen in der Search Console. Steigen sie, während die Nennungsquote im Prompt-Test steigt, passt das Bild zusammen.
Die zweite Spur liegt im Server-Log und ist verlässlicher als jeder Referrer. OpenAI schickt drei unterschiedliche Bots mit klar getrennten Aufgaben: GPTBot holt Material fürs Training, OAI-SearchBot pflegt den Suchindex, ChatGPT-User ruft eine Seite in dem Moment ab, in dem ein Nutzer eine Frage stellt. Der dritte ist der interessante. Taucht ChatGPT-User regelmäßig auf bestimmten URLs auf, werden diese Seiten gerade für Antworten gelesen. Wenn Ihr Hoster keine Rohlogs herausgibt, sehen Sie diesen Teil nicht, und das ist ein guter Grund, danach zu fragen.
Gut zu wissen: Ein Bot-Besuch ist noch keine Nennung. ChatGPT-User ruft auch Seiten ab, die anschließend nicht in der Antwort landen. Die Log-Auswertung sagt, dass Sie im Rennen sind, nicht dass Sie gewonnen haben.
Tools: was sie messen und was nicht
Profound, Otterly, Peec AI und die KI-Module von Semrush und Ahrefs machen im Kern dasselbe wie der manuelle Test. Sie stellen Fragen und zählen Nennungen, nur häufiger und über mehrere Modelle parallel. Die Preise beginnen der Größenordnung nach im unteren dreistelligen Bereich pro Monat.
Vier Punkte klären Sie besser vor dem Vertragsabschluss:
- Wie viele Läufe je Frage und Tag? Ein Werkzeug, das dieselbe Frage einmal täglich stellt, erzeugt eine Zickzacklinie aus Zufall. Wer daraus einen Wochenverlauf liest, liest Rauschen.
- API oder Oberfläche? Die meisten Anbieter messen über die API. Das Produkt ChatGPT bringt aber eine eigene Systemvorgabe mit und schaltet die Websuche oft von selbst dazu. Über die API gemessene Sichtbarkeit ist deshalb nicht dieselbe wie die im Chatfenster.
- Welche Modellversion, welches Land? Antworten unterscheiden sich nach Sprache und Region. Ein Dienst, der aus den USA heraus auf Deutsch fragt, misst nicht Ihren Markt.
- Wird die Streuung ausgewiesen? Ein Anbieter, der neben dem Mittelwert die Spannweite zeigt, hat das Problem verstanden. Wer nur eine glatte Kurve liefert, verkauft Ihnen eine Sicherheit, die es nicht gibt.
Daneben gehört ein Werkzeug in den Kasten, das etwas anderes misst: Erwähnungen im offenen Web. Was Foren, Fachmedien, Branchenverzeichnisse und Vergleichsartikel über eine Marke schreiben, ist das Material, aus dem Modelle ihr Bild bauen. Ein Vergleich der gängigen Werkzeuge für Marken-Erwähnungen steht in einem eigenen Beitrag. Diese Erwähnungen sind der Frühindikator, die ChatGPT-Antwort ist das Ergebnis Monate später.
Für den Einstieg reicht das manuelle Setup. Ein bezahltes Werkzeug lohnt sich, wenn Sie mehrere Marken oder mehrere Märkte parallel beobachten, oder wenn die zwei Stunden pro Runde im Alltag regelmäßig ausfallen.
Stellhebel zum Steigern der Nennungen
Messen allein bewegt nichts. Diese Hebel verbessern erfahrungsgemäß die Chance, in Antworten aufzutauchen:
- Zitierbarkeit. Beantworten Sie die Kernfrage eines Artikels in den ersten beiden Absätzen, ohne Anlauf und mit Zahlen. Die ersten 200 bis 300 Wörter einer Seite werden beim Abruf mit der höchsten Priorität gelesen.
- Brand-Konsistenz. Schreiben Sie den Firmennamen überall identisch, auf der Website, im Google-Unternehmensprofil, in Verzeichnissen und in Pressetexten. Modelle erkennen Marken über Wiederholung, uneinheitliche Schreibweisen verwässern die Entität.
- Strukturierte Daten.
Organization,ArticleundFAQPagehelfen beim Zuordnen. Echte Kundenfragen als FAQ wirken dabei besser als Marketingsätze in Frageform. - Fremde Seiten. Vergleichslisten, Fachbeiträge und Branchenportale Dritter zahlen stärker ein als jede weitere Unterseite auf der eigenen Domain. Die Quellenspalte aus Ihrem Protokoll sagt Ihnen, welche das im konkreten Fall sind.
Welche Maßnahmen im Einzelnen greifen, von der llms.txt bis zur sauberen Quellenangabe im Text, steht in unserem Beitrag zu den vier Hebeln für Zitate in ChatGPT.
Dazu gehört eine ehrliche Erwartung. Ein Google-Ranking bewegt sich oft innerhalb von Wochen. Ein Teil der KI-Nennungen speist sich dagegen aus dem Trainingswissen, und das wird nur in größeren Abständen aktualisiert. Über die Websuche wirken strukturelle Änderungen schneller, über das Trainingswissen erst mit dem nächsten Modellstand. In der Praxis zeigt sich erste Bewegung nach vier bis acht Wochen. Wer einen festen Termin nennt, an dem die Marke in ChatGPT erscheint, verspricht zu viel.
Bevor die Hebel greifen, sollte klar sein, wo die Website strukturell steht. Diese einmalige Bestandsaufnahme leistet der GEO-Audit der eigenen Website. Der Prompt-Test aus diesem Artikel übernimmt danach das laufende Messen.
Reporting für Kunden
Damit der Aufwand sich auszahlt, muss die Messung in einem verständlichen Bericht landen. Bewährt hat sich ein monatlicher Einseiter mit vier Blöcken:
- Nennungsquote. Über alle Fragen gemittelt, daneben der Vormonat. Ein Wert wie „37 von 75 Läufen“ versteht jeder Kunde ohne Erklärung.
- Fragen mit Bewegung. Nur die zwei oder drei Prompts, die sich über zwei Runden in eine Richtung entwickelt haben. Der Rest ist Schwankung und gehört nicht auf die Seite.
- Wettbewerbsvergleich. Wer taucht in denselben Antworten auf, und über welche Quelle wird derjenige zitiert.
- KI-Traffic. Sitzungen aus ChatGPT, Perplexity und Copilot laut GA4, ausdrücklich als Untergrenze beschriftet.
Erklären Sie die Schwankung im Bericht, statt jeden Ausschlag zu deuten. Ein Trend über drei Monate sagt mehr als ein einzelner Spitzenwert, und ein ehrlich beschrifteter Rückgang kostet weniger Vertrauen als eine geglättete Kurve, die beim nächsten Modellwechsel zusammenbricht. Welche Kennzahlen in so einen Bericht gehören und welche nur Platz kosten, zeigt unser Leitfaden zum GEO-Reporting mit festen Kennzahlen.
Fazit
ChatGPT-Sichtbarkeit messen ist Handarbeit: feste Fragen, fünf Läufe je Frage, ein Protokoll mit Quellenspalte, dazu Referrer und Server-Log als zweite Spur. Der Aufwand liegt bei rund zwei Stunden im Monat. Wer ihn investiert, kennt seine Ausgangslage und erkennt echte Bewegung, während andere einzelne Abfragen noch für Ergebnisse halten.