Logfile-Tools liefern schnell schöne Diagramme. Die Zahlen stimmen aber nur, wenn die Daten richtig gelesen werden. Zwei typische Fallen:
- Load Balancer und CDNs: Steht vor dem Webserver ein Load Balancer, taucht in der Standardspalte oft dessen IP-Adresse auf und nicht die des Crawlers. Die echte Adresse steckt dann in einem Zusatzfeld. Wer das übersieht, kann keinen einzigen Bot korrekt verifizieren.
- Nutzer-Agenten sind keine Nutzer: Abrufe durch ChatGPT-User und ähnliche Agenten entstehen, wenn jemand eine Frage stellt, aber auch durch Monitoring-Tools, die Prompts automatisiert abfragen. Wir weisen diese Zahlen deshalb als Obergrenze aus.
Außerdem prüfen wir, ob die Daten vollständig sind. In der oben beschriebenen Analyse fehlten zum Beispiel an sechs Tagen einzelne Stunden, weil der Export begrenzt war. Solche Lücken benennen wir, statt sie zu verschweigen.