Eine Logfile-Analyse zeigt Ihnen schwarz auf weiß, welche Seiten Googlebot tatsächlich besucht, wie oft und in welcher Reihenfolge. Anders als jedes SEO-Tool, das Crawler-Verhalten nur schätzt, lesen Sie hier die echten Zugriffe aus den Server-Protokollen Ihrer Website. Genau das macht Logfiles zum verlässlichsten Datensatz, den Sie über das Verhalten von Suchmaschinen besitzen.
Wer wissen will, ob Google die wichtigen Seiten crawlt oder das Budget an Filter-URLs und 404-Fehlern verschwendet, kommt an einer Logfile-Analyse nicht vorbei. Dieser Artikel zeigt Ihnen Schritt für Schritt, was in einem Logfile steht, wo Sie es finden, wie Sie die Googlebot-Verteilung lesen und welche konkreten Erkenntnisse Sie für Ihr Crawl-Budget gewinnen.
Warum Logfiles der unterschätzte SEO-Datenschatz sind
Die meisten SEO-Verantwortlichen arbeiten mit der Google Search Console, mit Screaming Frog oder mit Ahrefs. Das sind gute Werkzeuge, aber sie alle haben eine Schwäche: Sie zeigen, was crawlbar wäre oder was Google laut Search Console gemeldet hat. Sie zeigen nicht, was der Bot in den letzten 30 Tagen wirklich getan hat.
Genau diese Lücke schließt das Logfile. Jeder einzelne Zugriff auf Ihren Server - egal ob durch einen Besucher, Googlebot oder einen anderen Crawler - wird mit Zeitstempel, URL, Statuscode und User-Agent protokolliert. Das ist die einzige Quelle, die nicht schätzt, sondern dokumentiert.
In der Praxis zeigt sich der Wert sofort. Bei Shops mit Filternavigation entfällt regelmäßig der Großteil des Crawl-Budgets auf parametrisierte Filter-URLs, die gar nicht indexiert werden sollten. Die wichtigen Kategorieseiten werden dagegen nur alle paar Wochen besucht. Ohne Logfile-Analyse fällt dieses Leck nicht auf - in der Search Console sieht alles unauffällig aus.
Die Search Console liefert zwar einen Crawling-Statistik-Bericht, aber dieser ist aggregiert und auf 90 Tage begrenzt. Welche einzelne URL wann besucht wurde, erfahren Sie dort nicht. Das rohe Logfile dagegen kennt jede Anfrage.
Hinzu kommt: Googlebot ist nicht der einzige Crawler, der Sie besucht. Bingbot, der GPTBot von OpenAI, ClaudeBot, PerplexityBot und Dutzende weniger bekannte Bots klopfen täglich an. Im Logfile sehen Sie genau, wer wie oft vorbeischaut. Gerade für die wachsende KI-Sichtbarkeit ist das ein wertvolles Frühwarnsystem - lange bevor irgendein Standard-Tool diese Zugriffe abbildet.
Was in einem Server-Logfile steht
Ein Logfile ist eine simple Textdatei, in der der Webserver jede Anfrage in einer Zeile festhält. Das Standardformat (Combined Log Format bei Apache, ähnlich bei Nginx) sieht in etwa so aus:
66.249.66.1 - - [01/Jun/2026:08:14:22 +0000] "GET /seo-audit-nuernberg/ HTTP/1.1" 200 18342 "-" "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)"
Diese eine Zeile enthält alles, was Sie für SEO brauchen:
- IP-Adresse. Hier
66.249.66.1- ein Bereich, der zu Google gehört. Wichtig, um echte Bots von gefälschten User-Agents zu unterscheiden. - Zeitstempel. Datum und Uhrzeit des Zugriffs, inklusive Zeitzone. So sehen Sie die Crawl-Frequenz pro Tag.
- Methode und URL.
GET /seo-audit-nuernberg/- welche Seite wurde wie abgerufen. - Statuscode. Hier
200(erfolgreich). 301, 404 oder 500 verraten Weiterleitungen, Fehler und Serverprobleme. - Antwortgröße.
18342Bytes - hilft, ungewöhnlich große oder leere Antworten zu erkennen. - User-Agent. Der Identifikationsstring, hier Googlebot. Daran erkennen Sie, welcher Crawler unterwegs war.
Sie brauchen kein Programmierwissen, um das zu verstehen. Wer den Aufbau einer Zeile einmal verinnerlicht hat, kann ein Logfile lesen wie eine Tabelle. Die Kunst liegt nicht im Entziffern einzelner Zeilen, sondern im Aggregieren von Millionen davon.
Wo Sie Ihre Logfiles finden
Bevor Sie analysieren können, brauchen Sie die Rohdaten. Wo diese liegen, hängt von Ihrem Hosting ab. Hier die häufigsten Fälle:
- Apache (klassisches Webhosting). Die Logs liegen meist unter
/var/log/apache2/access.logoder im Verzeichnislogs/Ihres Webspace. Bei Shared Hosting finden Sie sie oft im Kundenmenü unter "Logfiles" oder "Statistiken". - Nginx. Standardpfad ist
/var/log/nginx/access.log. Auf vielen vServern und Cloud-Setups ist Nginx der Standard. - Cloudways. Im Plattform-Dashboard unter "Application Management" finden Sie pro Anwendung Zugriff auf die Access-Logs, teilweise auch per SSH oder SFTP.
- all-inkl. Im KAS (Kunden-Administrations-System) lassen sich Logfiles aktivieren und herunterladen. Sie liegen dann komprimiert pro Tag bereit.
Ein wichtiger Punkt vorweg: Aktivieren Sie die Logspeicherung rechtzeitig. Viele Hoster löschen Logs nach wenigen Tagen oder schreiben sie gar nicht erst auf die Platte. Für eine aussagekräftige Analyse brauchen Sie mindestens 30, besser 90 Tage am Stück.
Praxis-Tipp: Prüfen Sie heute, ob Ihr Hoster die Access-Logs überhaupt aufbewahrt - und wie lange. Wenn Sie erst bei Bedarf danach suchen, sind die spannenden Crawl-Daten oft schon gelöscht.
Steht hinter Ihrer Seite ein CDN wie Cloudflare, gibt es eine Tücke: Ein Teil der Anfragen wird vom CDN beantwortet und erreicht den Ursprungsserver nie. Für eine vollständige Sicht brauchen Sie dann die CDN-Logs zusätzlich zu den Server-Logs.
Echte Googlebot-Zugriffe von Fälschungen trennen
Ein User-Agent lässt sich fälschen. Jeder kann sich als Googlebot ausgeben - Spam-Bots tun das ständig, um Schutzmechanismen zu umgehen. Bevor Sie also Crawl-Verteilungen interpretieren, müssen Sie sicherstellen, dass es wirklich Google war.
Die zuverlässige Methode ist die Reverse-DNS-Prüfung. Sie lösen die IP-Adresse zurück in einen Hostnamen auf. Echter Googlebot stammt immer aus Domains wie googlebot.com oder google.com. Eine IP, die sich als Googlebot ausgibt, aber zu einem Hosting-Anbieter in einem anderen Land auflöst, ist eine Fälschung und gehört herausgefiltert.
Google veröffentlicht außerdem die offiziellen IP-Bereiche seiner Crawler als JSON-Datei. Gute Log-Analyse-Tools nehmen diese Verifizierung automatisch vor, sodass Sie sich auf saubere Daten verlassen können.
Warum das so wichtig ist: Rechnen Sie gefälschte Bots in Ihre Crawl-Statistik mit ein, ziehen Sie falsche Schlüsse. Sie glauben dann, Google besuche eine Seite häufig, obwohl in Wahrheit ein Scraper am Werk war.
Praktisch heißt das: Filtern Sie zuerst nach dem User-Agent, der "Googlebot" enthält, und verifizieren Sie anschließend die zugehörigen IP-Adressen. Erst die Schnittmenge aus beidem ergibt saubere Daten. Bei einem Kunden im Handwerksbereich stellte sich heraus, dass fast ein Drittel der vermeintlichen Googlebot-Hits von einem Scraper aus einem Rechenzentrum kam - die echte Crawl-Aktivität war also deutlich geringer als gedacht.
Die Googlebot-Crawl-Verteilung lesen
Jetzt wird es spannend. Sobald Sie die verifizierten Googlebot-Zugriffe isoliert haben, können Sie Muster erkennen, die Ihnen kein anderes Tool liefert. Diese Fragen sollten Sie stellen:
- Welche Seiten werden am häufigsten gecrawlt? Idealerweise sind das Ihre wichtigsten Geld- und Kategorieseiten. Stehen stattdessen Impressum, Tag-Archive oder Filter-URLs oben, verschwenden Sie Budget.
- Welche wichtigen Seiten werden selten oder nie besucht? Eine Seite, die Googlebot in 90 Tagen nicht angefasst hat, kann nicht aktuell indexiert sein. Das ist ein klares Warnsignal.
- Wie verteilen sich die Statuscodes? Ein hoher Anteil an 404- oder 301-Antworten bedeutet, dass der Bot in Sackgassen und Ketten landet, statt echte Inhalte zu crawlen.
- Wie tief crawlt der Bot? Erreicht Googlebot nur die obersten zwei Ebenen oder auch tiefere Unterseiten? Das verrät viel über Ihre interne Verlinkung.
Bei einer typischen Unternehmensseite sollten Bilder, CSS und JavaScript zusammen nur einen kleinen Teil der Crawl-Hits ausmachen. Wenn statische Ressourcen plötzlich über 40 % der Anfragen verschlingen, lohnt ein Blick auf das Caching - hier lässt sich Budget zurückgewinnen.
Wie eng diese Auswertung mit dem Thema Steuerung zusammenhängt, zeigen wir im Detail in unserem Leitfaden zur Crawl-Budget-Optimierung. Logfiles sind die Datengrundlage, das Crawl-Budget ist der Hebel.
Tools für die Logfile-Analyse
Logfiles von Hand zu lesen, ist bei mehr als ein paar tausend Zeilen unmöglich. Sie brauchen ein Werkzeug, das aggregiert, filtert und visualisiert. Diese drei haben sich bewährt:
- Screaming Frog Log File Analyser. Der Klassiker für SEO. Sie ziehen Ihre Logdateien hinein, das Tool verifiziert Googlebot automatisch und zeigt Crawl-Frequenz, Statuscodes und ungenutzte URLs übersichtlich an. Ideal für kleine bis mittlere Websites und die günstigste Einstiegslösung.
- GoAccess. Ein kostenloses Open-Source-Tool fürs Terminal, das Logs in Echtzeit auswertet und einen HTML-Report erzeugt. Schnell, ressourcenschonend und perfekt für alle, die SSH-Zugriff haben und keine Lizenzkosten wollen.
- Splunk. Die Enterprise-Lösung für sehr große Datenmengen. Wenn Sie täglich Millionen von Logzeilen verarbeiten und Dashboards für mehrere Teams brauchen, ist Splunk mächtig - aber auch teuer und komplex.
Für die meisten mittelständischen Websites ist der Screaming Frog Log File Analyser die richtige Wahl. Erst bei sehr großen Shops oder Portalen mit zig Millionen URLs lohnt der Sprung zu einer Enterprise-Plattform.
Wenn Sie tiefer in die methodische Auswertung einsteigen möchten, etwa in das Verknüpfen von Logdaten mit Crawl-Exports, haben wir das in unserem Beitrag zur Crawl-Log-Analyse ausführlich beschrieben.
Konkrete Erkenntnisse für Ihr Crawl-Budget
Die Analyse ist kein Selbstzweck. Aus den Mustern leiten Sie Maßnahmen ab, die direkt auf Ihre Sichtbarkeit einzahlen. Diese fünf Erkenntnisse holen Sie regelmäßig aus Logfiles:
Budget-Lecks. URLs, die häufig gecrawlt werden, aber keinen SEO-Wert haben - etwa Filter, Sortierungen, interne Suchergebnisse oder Session-IDs. Diese sperren Sie gezielt in der robots.txt oder per Canonical, damit Google sich auf das Wesentliche konzentriert.
Verwaiste Seiten. URLs, die Googlebot crawlt, aber die in Ihrer XML-Sitemap und internen Verlinkung gar nicht vorkommen. Oft sind das alte Seiten, die längst gelöscht gehören oder Weiterleitungen brauchen.
Nie gecrawlte Seiten. Der umgekehrte Fall - wichtige Seiten, die im Logfile fehlen. Hier hapert es meist an der internen Verlinkung oder der Sitemap. Wie Sie das systematisch lösen, lesen Sie in unserem Guide zu Indexierung, Sitemap und robots.txt.
Fehler-Cluster. Häufungen von 404- oder 5xx-Codes zeigen kaputte Links oder Serverprobleme. Jeder dieser Hits ist verschwendetes Budget und ein negatives Qualitätssignal.
Crawl-Frequenz nach Seitentyp. Wenn neue Produkte oder Artikel tagelang ungecrawlt bleiben, dauert auch ihre Indexierung länger. Mit besserer interner Verlinkung und aktuellen Sitemaps beschleunigen Sie das messbar.
Nach dem Sperren der Filter-Parameter verschiebt sich das Bild im Logfile typischerweise binnen ein bis zwei Wochen: Googlebot besucht die wichtigen Kategorieseiten spürbar häufiger, weil das Budget vorher schlicht am falschen Ort gebunden war. Eine feste Steigerungsrate lässt sich dafür nicht angeben, sie hängt an der Größe des Parameter-Problems.
Praxis-Checkliste für Ihre erste Logfile-Analyse
Damit Sie sofort loslegen können, hier der konkrete Ablauf in der richtigen Reihenfolge:
- Logs beschaffen. Mindestens 30 Tage Access-Logs von Ihrem Hoster herunterladen, idealerweise 90 Tage am Stück.
- Googlebot verifizieren. Per Reverse-DNS oder mit einem Tool, das die offiziellen Google-IP-Bereiche kennt. Fälschungen herausfiltern.
- Crawl-Verteilung prüfen. Top-gecrawlte URLs mit Ihren wichtigsten Seiten abgleichen. Stimmt die Priorität?
- Statuscodes auswerten. Anteil von 200 gegen 301, 404 und 5xx. Fehlerquellen identifizieren und beheben.
- Budget-Lecks schließen. Wertlose URLs per robots.txt oder Canonical aussortieren.
- Verwaiste und ungecrawlte Seiten finden. Logdaten mit Sitemap und Crawl-Export verknüpfen.
- Maßnahmen umsetzen und nachmessen. Nach vier bis sechs Wochen erneut analysieren und die Verschiebung dokumentieren.
Eine Logfile-Analyse ist keine einmalige Aktion. Sie ist ein laufender Prozess, der Ihnen bei jedem größeren Website-Umbau, Relaunch oder Wachstumsschub verrät, wie Suchmaschinen mit Ihren Änderungen umgehen.
Wer technisches SEO ernst nimmt, kommt an den Server-Logs nicht vorbei. Sie sind die einzige Quelle, die nicht interpretiert, sondern protokolliert - und damit der ehrlichste Spiegel dessen, was Crawler auf Ihrer Website wirklich tun.