Zum Hauptinhalt springen
KI & SEO

GEO-KPIs: was sich in KI-Antworten messen lässt

06. Oktober 2026 · 11 Min. Lesezeit

Belastbar messen lassen sich in der KI-Suche genau zwei Dinge: die Zugriffe der KI-Crawler in Ihrem Server-Log und die Verweise, die aus KI-Oberflächen auf Ihrer Website ankommen. Beides sind harte Daten aus Ihrem eigenen Haus. Alles Weitere ist entweder eine Quote aus wiederholten Stichproben oder eine Zahl, die ein Werkzeug ohne offengelegte Methode ausgibt.

Dieser Beitrag sortiert die gängigen GEO-Kennzahlen danach, wie viel sie aushalten. Nicht, wie man sie erhebt, und auch nicht, wie man sie präsentiert, sondern welche davon überhaupt in einen Bericht gehören. Am Ende steht ein kurzer Satz zu der Frage, die in jedem zweiten Kundengespräch kommt: Was davon lässt sich mit Umsatz verbinden.

Warum es in der KI-Suche keine Position gibt

In der klassischen Suche hängt alles an einer Zahl. Platz 4 für ein Keyword, gemessen an einem Tag, an einem Ort, in einem Index, den man abfragen kann. Diese Zahl ist reproduzierbar: Wer dieselbe Abfrage am selben Ort wiederholt, bekommt fast dasselbe Ergebnis. Genau darauf ist die gesamte SEO-Werkzeugkiste gebaut.

In ChatGPT, Perplexity oder Claude fehlt jede dieser Voraussetzungen. Es gibt keinen abfragbaren Rangindex, keine öffentliche Schnittstelle, die Ihnen Ihren Stand meldet, und keine Konsole wie die Search Console. Vor allem gibt es keine Liste, in der man einen Platz belegen könnte. Es gibt einen Fließtext, in dem Ihre Marke vorkommt oder nicht, an einer Stelle, die sich beim nächsten Durchlauf verschiebt. Deshalb gilt für alles, was Sie an Kennzahlen aufbauen: Es gibt keine Position, und jede Zahl, die eine behauptet, ist erfunden.

Bei Google AI Overviews ist die Lage etwas anders, aber auch nicht besser. Impressionen und Klicks aus AI Overviews stecken in den normalen Websuche-Zahlen der Search Console, ohne eigenen Filter. Sie sehen also, dass etwas passiert, aber nicht, was. Was Sie sehen: die Klickrate sackt ab. Sistrix hat für den deutschen Markt gemessen, dass Position 1 ohne AI Overview 27 Prozent der Klicks holt und mit einem AI Overview darüber nur noch rund 11 Prozent (Sistrix, AI Overviews in Deutschland). Die alte Kennzahl misst also weiterhin sauber, sie beschreibt nur immer weniger von dem, was tatsächlich passiert.

GEO-KPIs nach Belastbarkeit sortiert

Statt die Kennzahlen thematisch zu gruppieren, sortieren wir sie nach der Frage: Wie sehr können Sie sich auf die Zahl verlassen, wenn ein Kunde nachhakt? Vier Stufen reichen dafür.

StufeKennzahlHerkunft der ZahlWas sie belegt
BelastbarZugriffe der KI-Crawlereigenes Server-Logdass die Bots Ihre Seiten holen
BelastbarVerweise aus KI-Oberflächeneigene Webanalysedass Menschen aus KI-Antworten klicken
HalbwegsNennungsquote im Prompt-Testeigene Stichprobe, viele LäufeTendenz über Wochen
HalbwegsShare of Voice in den Antwortendieselbe StichprobeVerhältnis zum Wettbewerb
SchwachVisibility Score aus einem Werkzeugfremde Blackboxnichts Nachprüfbares
UnbrauchbarPosition oder Rang in ChatGPTerfundennichts

Die Trennlinie verläuft zwischen Zeile zwei und drei. Oberhalb liegen Daten, die auf Ihrem eigenen Server entstanden sind und die Sie im Zweifel Zeile für Zeile vorzeigen können. Darunter liegen Schätzungen, die mit ausreichend vielen Wiederholungen brauchbar werden, aber Schätzungen bleiben.

Bevor Sie laufend messen, brauchen Sie einen Startwert für den Zustand der Website selbst. Den liefert die einmalige Bestandsaufnahme mit Punktwertung, die technische Freigabe, Schema und Zitierbarkeit einmal komplett durchgeht. Die KPIs aus diesem Beitrag setzen darauf auf und beobachten, was sich danach bewegt.

Belastbar: die zwei Zahlen aus Ihren eigenen Daten

Diese beiden Kennzahlen haben eine Eigenschaft, die keine andere in dieser Liste hat: Sie entstehen auf Ihrer Infrastruktur. Niemand muss Ihnen glauben, Sie können die Rohdaten zeigen. Und beide kosten kein Geld, nur etwas Einrichtung.

Zugriffe der KI-Crawler im Protokoll

Das ist die Kennzahl, über die es nichts zu diskutieren gibt. Jeder Abruf eines KI-Bots steht in Ihrem Zugriffsprotokoll, mit Datum, URL und Statuscode. Bei All-Inkl, Hetzner oder jedem eigenen Server holen Sie sich die Datei per SFTP und zählen durch:

grep -oiE "GPTBot|OAI-SearchBot|ChatGPT-User|PerplexityBot|Perplexity-User|ClaudeBot|Claude-User|Google-Extended" access.log | sort | uniq -c | sort -rn

Sie bekommen eine Liste mit Anzahl je Bot. Das ist Ihr Ausgangswert. Wiederholen Sie den Befehl monatlich mit dem jeweils neuen Log, und Sie haben nach einem Quartal einen Verlauf, den kein Werkzeug der Welt besser kennt als Sie.

Wichtiger als die Gesamtzahl ist die Unterscheidung zweier Gruppen. GPTBot, ClaudeBot und Google-Extended holen Inhalte für das Training und den Index ein, unabhängig von einer konkreten Nutzerfrage. ChatGPT-User, Claude-User und Perplexity-User dagegen greifen live zu, während jemand gerade eine Frage stellt. Ein Anstieg in der zweiten Gruppe heißt: Ihre Seite wird beim Beantworten echter Fragen aufgerufen. Das ist der interessantere Wert, und er ist deutlich näher an Sichtbarkeit als jede Zitierrate aus einer Stichprobe.

Ein zweiter Blick lohnt sich auf die URLs. Wenn ein Bot ausschließlich Ihre Startseite und die Sitemap abholt, aber keine der Inhaltsseiten, dann liegt das selten am Bot. Meist zeigt die interne Verlinkung nicht dorthin, oder die betreffenden Seiten sind erst kürzlich entstanden. Diese Auswertung bekommen Sie mit demselben Log und awk, ohne zusätzliches Werkzeug.

Prüfen Sie im selben Durchgang die Statuscodes. Eine Seite, die dem Crawler 403 oder 500 liefert, taucht in keiner Antwort auf, egal wie gut der Text ist. Das kommt öfter vor als gedacht, weil manche Firewalls unbekannte User-Agents pauschal abweisen.

Praxis-Tipp: Legen Sie die monatlichen Zählungen in einer einzigen Tabelle mit einer Zeile je Monat und einer Spalte je Bot ab. Nach vier Zeilen sehen Sie Trends, die in einer Einzelabfrage unsichtbar bleiben.

Verweise aus KI-Oberflächen in der Webanalyse

Der zweite harte Wert steht in Ihrer Webanalyse. Filtern Sie die Verweisquellen auf chatgpt.com, perplexity.ai, gemini.google.com und copilot.microsoft.com, und Sie haben die Zugriffe, die aus einer KI-Antwort kommen. In Matomo geht das über einen Segmentfilter, in Google Analytics 4 über eine eigene Kanalgruppe. Beides ist in einer Viertelstunde eingerichtet und danach dauerhaft da.

Diese Zahl hat einen Haken, den Sie kennen und auch aussprechen sollten: Sie ist eine Untergrenze. Zugriffe aus den mobilen Apps kommen häufig ohne Verweisquelle an und landen bei den Direktzugriffen. Wer die Zahl als vollständige Erfassung des KI-Verkehrs verkauft, misst falsch nach unten. Als Trendlinie taugt sie trotzdem, weil der Anteil der nicht erfassten Zugriffe sich nicht sprunghaft ändert.

Rechnen Sie mit kleinen absoluten Zahlen. Bei den meisten mittelständischen Websites bewegt sich dieser Verkehr derzeit im niedrigen einstelligen Prozentbereich aller Sitzungen, bei manchen darunter. Das ist kein Grund, die Messung zu lassen: Eine Zahl, die von zwölf auf vierzig Sitzungen im Monat steigt, ist als Verlauf aussagekräftig, auch wenn sie absolut klein bleibt.

Der große Vorteil dieser Kennzahl: Sie hängt an Ihrem normalen Analyse-Werkzeug und damit an allem, was dort schon konfiguriert ist. Verweildauer, aufgerufene Seiten, ausgelöste Formulare. Damit ist sie der einzige GEO-Wert, der ohne Umweg an Ihren bestehenden Zielen hängt.

Halbwegs belastbar: die Nennungsquote aus wiederholten Prompt-Tests

Jetzt wird es weicher. Die Nennungsquote beantwortet die Frage, in wie viel Prozent der Antworten auf einen festen Fragensatz Ihre Marke oder Domain vorkommt. Sie ist die einzige Kennzahl, die überhaupt etwas über die Antwort selbst aussagt, und deshalb wird sie gebraucht. Sie ist nur eben keine Messung im strengen Sinn.

Ein Sprachmodell antwortet auf dieselbe Frage nicht zweimal identisch. Zwei Läufe hintereinander können „Anbieter A, B und C" und „Anbieter B, D und E" ergeben, ohne dass sich irgendetwas an Ihrer Website geändert hätte. Ein einzelnes Ergebnis ist deshalb wertlos, und zwar nicht als Vorsichtsformel, sondern buchstäblich. Der KPI ist die Quote über viele Läufe, nie das Einzelergebnis.

Praktisch heißt das: 20 Fragen, fünf Durchläufe je Frage, macht 100 Abfragen pro Erhebung. Wortlaut der Fragen unverändert lassen, Datum und Modellversion mitschreiben, jeden Durchlauf in einer neuen Sitzung starten. Ändern Sie eine Frage, beginnt die Zeitreihe von vorn. Als Faustregel aus der Praxis: Unterschiede von weniger als zehn Prozentpunkten zwischen zwei Monaten sind bei dieser Stichprobengröße Rauschen und gehören nicht kommentiert. Wie ein solcher Prompt-Test im Detail abläuft, welche Fragetypen gemischt gehören und was die Referer-Auswertung dazu beisteuert, steht in unserer Anleitung, wie Sie Ihre Nennungen in ChatGPT messen.

Der Share of Voice ist die Ableitung aus derselben Stichprobe: Von allen genannten Anbietern, welcher Anteil entfällt auf Sie. Er erbt sämtliche Schwächen der Nennungsquote und bringt eine eigene dazu, weil die Zahl der genannten Anbieter je Antwort schwankt. Als Zusatzinformation neben der Quote ist er nützlich, als führende Kennzahl nicht.

Schwach und unbrauchbar: Scores, Ränge und was dazwischenliegt

Ein „GEO Visibility Score" von 62 sagt Ihnen genau so lange etwas, wie Sie wissen, woraus er entsteht. Fünf Angaben entscheiden darüber: welches Modell, welche Modellversion, wie viele Läufe je Frage, welcher Standort und welcher Fragensatz. Fehlt eine davon, ist der Wert nicht nachrechenbar, und eine Veränderung von 62 auf 71 kann genauso gut ein stilles Modell-Update beim Anbieter sein wie ein Erfolg Ihrer Arbeit.

Meine Meinung dazu, offen gesagt: Ein Score ohne offengelegte Methode gehört nicht in einen Kundenbericht, auch nicht als Ergänzung. Er sieht nach Präzision aus, die es nicht gibt, und er verdrängt in der Wahrnehmung genau die zwei Zahlen, die wirklich etwas taugen. Wir tragen solche Werte deshalb nicht in Berichte ein, sondern nennen sie höchstens im Gespräch als Beobachtung.

Eine Stufe darunter liegen Kennzahlen, die eine Rangfolge behaupten. „Platz 2 in ChatGPT" gibt es nicht, weil es keine Plätze gibt. Was manche Werkzeuge so darstellen, ist die Reihenfolge der Nennungen innerhalb eines Antworttextes, gemittelt über ein paar Läufe. Das ist eine Beobachtung über Satzstellung, keine Rangposition, und die Umbenennung macht sie nicht besser.

Ein Sonderfall sind Marken-Erwähnungen im Web. Sie sind kein Messwert für KI-Sichtbarkeit, sondern ein Frühindikator dafür: Modelle kennen Marken aus dem, was über sie geschrieben steht. Steigende Erwähnungen gehen einer steigenden Nennungsquote meist voraus, beweisen sie aber nicht. Führen Sie ihn als Hilfsgröße mit und beschriften Sie ihn auch so. Ein eigenständiger GEO-KPI ist er nicht. Welche Werkzeuge Erwähnungen zuverlässig einsammeln, haben wir im Vergleich der Monitoring-Dienste für Marken durchgesehen.

Gut zu wissen: Die meisten Anbieter von GEO-Werkzeugen fahren dieselben Prompt-Tests, die Sie auch von Hand fahren könnten, nur automatisiert und über mehr Fragen. Das ist ein Zeitgewinn, kein Erkenntnisgewinn. Wer die Methode offenlegt, ist deshalb seriös, auch wenn die Zahl dieselbe Unschärfe hat.

Was davon mit Umsatz zu tun hat

Die ehrliche Antwort ist unbequem: Von allen genannten Kennzahlen lässt sich genau eine direkt mit Geld verbinden, nämlich der Verkehr aus KI-Oberflächen. Diese Zugriffe laufen durch Ihre normale Zielmessung, füllen Formulare aus oder eben nicht, und ergeben eine Zahl, die man in Euro umrechnen kann. Alles andere hat keine Verbindung zum Umsatz, die einer Prüfung standhält.

Widerstehen Sie der Versuchung, eine zu bauen. Eine Nennungsquote mit einem geschätzten Suchvolumen und einer geschätzten Klickrate zu multiplizieren, ergibt eine Zahl mit drei Unsicherheiten übereinander. Sie wirkt überzeugend, weil sie präzise aussieht, und sie fällt in dem Moment auseinander, in dem jemand die Annahmen prüft. In der KI-Suche gibt es zur Attribution derzeit schlicht keine belastbare Methode, und das zu sagen ist besser, als eine zu erfinden.

Zwei Dinge helfen trotzdem weiter. Erstens die Frage „Wie sind Sie auf uns aufmerksam geworden?" im Kontaktformular, mit einer Antwortmöglichkeit für ChatGPT und ähnliche Dienste. Das ist unsauber, freiwillig und lückenhaft, aber es ist die einzige direkte Auskunft, die Sie bekommen. Zweitens die Entwicklung der Markensuchen in der Search Console: Wenn Ihr Name in KI-Antworten häufiger fällt, suchen mehr Leute danach bei Google. Ein Beweis ist das nicht, ein brauchbares Nebensignal schon. Wie Sie diese Mischung aus harten Zahlen und deklarierten Schätzungen so darstellen, dass ein Kunde sie versteht und nicht überinterpretiert, behandelt der Beitrag zum Aufbau des Kundenberichts für KI-Sichtbarkeit.

Fazit

Zwei Kennzahlen halten jeder Nachfrage stand, weil sie aus Ihren eigenen Daten stammen: Crawler-Zugriffe im Log und Verweise aus KI-Oberflächen. Die Nennungsquote kommt dazu, wenn sie über viele Läufe erhoben und als Tendenz gelesen wird. Alles, was darüber hinaus eine Punktzahl oder einen Rang verspricht, kostet Aufmerksamkeit und liefert nichts zurück. Fangen Sie mit dem grep-Befehl von oben an, das dauert zehn Minuten und Sie haben ab heute einen Verlauf.

Welche Zahlen bei Ihnen wirklich etwas aussagen

Wir richten Ihre KI-Messung so ein, dass sie aus Ihren eigenen Daten kommt: Log-Auswertung, Kanalgruppe in der Webanalyse und ein Fragensatz, der zu Ihrem Geschäft passt.

GEO-Beratung anfragen
09 · Kontakt

Reden wir über
Platz 1 für Ihre Firma.

Wählen Sie kurz aus, was Sie brauchen. Wir melden uns mit einer ehrlichen Einschätzung in 24 Stunden. Kein Verkaufs­gespräch, keine Werbung.

09129 1439894
20+ Jahre Nürnberg Keine Vertragsbindung Mo-Fr 9-18 · kein Call-Center