BOT GÖZLEMLENEBİLİRLİĞİ · LOG, DOĞRULAMA VE KARAR

AI botları sunucu loglarından nasıl analiz edilir?

Sunucu logunda “GPTBot” veya “Googlebot” yazması, isteğin gerçekten o kuruma ait olduğunu kanıtlamaz. Sağlıklı analiz; ham logların korunması, kullanıcı ajanının yalnız ilk sinyal sayılması, IP veya doğrulama mekanizmasıyla bot kimliğinin teyit edilmesi, davranışın amacına göre sınıflandırılması ve erişim kararının robots.txt, güvenlik ve ticari hedeflerle birlikte değerlendirilmesiyle yapılır.

KISA CEVAP

AI botlarını loglardan analiz etmek için zaman, IP, kullanıcı ajanı, istek yöntemi, URL, durum kodu, bayt, referer, gecikme, WAF kararı ve bot doğrulama alanlarını birlikte toplayın. User-agent adını tek başına güvenilir kabul etmeyin; Google ve Bing için ters/ileri DNS veya resmî IP listeleri, OpenAI için yayımlanan IP aralıkları, CDN/WAF için verified bot sinyalleri kullanın. Sonuçları bot adı değil amaç, doğrulanmış kimlik, erişilen içerik ve iş etkisiyle raporlayın.

Önce hangi kararı desteklemek için log topladığınızı belirleyin

Bot logları; “AI bot geldi mi?” merakından daha fazlasını cevaplayabilir. Kurum, arama ve AI görünürlüğü için hangi içeriklerin tarandığını, kritik sayfaların hata verip vermediğini, robots değişikliklerinin etkisini, bant genişliği maliyetini, sahte bot veya agresif tarama riskini ve yayın sonrası keşif hızını izleyebilir. Amaç tanımlanmadan toplanan milyarlarca log satırı karar üretmez.

KararGerekli kanıtYanlış yorum
Görünürlük hazırlığıDoğrulanmış bot, erişilen URL, 2xx oranıTek ziyaretin kaynak gösterimi garantisi sayılması
Erişim politikasıBot amacı, robots kuralı, WAF sonucuBütün AI botlarını tek sınıf saymak
Teknik sağlık4xx/5xx, gecikme, yönlendirme zinciriUser-agent toplamını kalite metriği yapmak
GüvenlikKimlik doğrulama, hız, yöntem, hedefBot adına güvenerek allowlist açmak

Ham erişim logları bot davranışını yeniden kuracak alanları içermelidir

Asgari veri; UTC zaman damgası, kaynak IP, HTTP yöntemi, host, URI, sorgu dizgesi, durum kodu, gönderilen bayt, kullanıcı ajanı, referer, yanıt süresi ve mümkünse TLS, cache, WAF ve bot doğrulama sinyalidir. Kişisel veri ve güvenlik kayıtları için saklama süresi, erişim ve maskeleme politikası uygulanmalıdır.

  • Origin ve CDN loglarının saat ve istek kimliğiyle eşlenebilmesi.
  • Yönlendirme öncesi ve sonrası host bilgisinin korunması.
  • HEAD, GET ve diğer yöntemlerin ayrı raporlanması.
  • Query string içinde hassas veri varsa maskeleme.
  • WAF engeli, challenge ve rate-limit sonucunun kaydı.
  • Log örneklemesinin düşük hacimli botları görünmez yapmadığının kontrolü.
Veri sınırı: Sunucu logu yalnız isteğin geldiğini gösterir. İçeriğin indekslendiğini, AI cevabında kullanıldığını veya ticari değer ürettiğini tek başına kanıtlamaz.

Kullanıcı ajanı iddiadır; kimlik ayrıca doğrulanmalıdır

Her istemci user-agent başlığına istediği metni yazabilir. Google, isteklerin Googlebot’tan geldiğini doğrulamak için yayımlanan IP listeleri veya ters DNS ve ileri DNS doğrulamasını önerir. Bing de ters DNS ve ileri IP kontrolü sunar. OpenAI, OAI-SearchBot ve GPTBot için resmî kullanıcı ajanlarıyla birlikte yayımlanan IP aralıklarının allowlist edilmesini önerir. CDN veya WAF verified bot alanı sağlıyorsa bunun kapsamı ve güncelliği kontrol edilmelidir.

  1. User-agent desenini aday bot olarak sınıflandırın.
  2. Kaynak IP’yi resmî IP listesi veya doğrulama yöntemiyle kontrol edin.
  3. Doğrulama zamanını ve kullanılan kaynak sürümünü kaydedin.
  4. Sonucu “doğrulanmış”, “doğrulanamadı” veya “sahte/uyumsuz” olarak işaretleyin.
  5. Allowlist ve güvenlik kuralını doğrulanmış kimliğe bağlayın.
  6. IP listesi değişikliklerini düzenli yenileyin.
SinyalGüven düzeyiKullanım
User-agent metniDüşükİlk aday sınıflandırması
Ters + ileri DNSOrta/yüksekGoogle/Bing gibi destekleyen botlar
Resmî IP aralığıYüksek, güncelseOpenAI ve yayımlayan sağlayıcılar
Verified bot alanıSağlayıcı kapsamına bağlıCDN/WAF üzerinde filtre ve analiz
Web Bot AuthKriptografik doğrulamaDestekleyen ajan ve altyapılar

Botları marka adıyla değil davranış ve amaçla sınıflandırın

Aynı kurumun arama, model geliştirme ve kullanıcı tarafından başlatılan istekler için farklı botları olabilir. OpenAI, OAI-SearchBot’u ChatGPT arama sonuçları, GPTBot’u model geliştirme tercihi ve ChatGPT-User’ı kullanıcı tarafından başlatılan erişim için ayrı tanımlar. Bir bot farklı davranışları da aynı altyapıda gösterebilir.

ARAMA

Keşif ve kaynaklama

İçerik arama sonuçlarında gösterilmek üzere taranır.

MODEL

Model geliştirme

İçerik eğitim veya model iyileştirme tercihi kapsamında taranır.

KULLANICI

İstek üzerine erişim

Bir kullanıcının talebiyle belirli URL alınır.

ARAÇ

İzleme veya doğrulama

Uptime, link, güvenlik veya performans kontrolü yapılır.

Erişim politikası, “AI botlarını aç/kapat” ikiliğinden çıkarılıp davranış bazında kurulmalıdır.

Robots kuralı ile gerçek log davranışı birlikte incelenmelidir

Robots.txt bir erişim kontrolü veya kimlik doğrulama sistemi değildir; uyumlu botlara tarama tercihini bildirir. Hassas içerik robots ile korunmaz. Log analizi, kural değişiminden sonra ilgili botun hangi URL’lere erişmeye devam ettiğini, 24 saat veya daha uzun uyum gecikmesini, CDN cache’ini ve farklı hostlardaki robots dosyalarını gösterebilir.

  • Her host ve protokol için robots.txt durumunu kaydedin.
  • User-agent özel kuralı ile genel yıldız kuralını birlikte çözümleyin.
  • Allow/Disallow sonucunu istek anındaki dosya sürümüyle eşleyin.
  • Engellenen URL’nin yine dış bağlantı veya navigasyon sonucu görünebileceğini unutmayın.
  • Hassas içeriği kimlik doğrulama ve yetkilendirmeyle koruyun.
  • WAF engelini robots tercihiyle karıştırmayın.

URL kapsamı, durum kodu, sıklık ve tazelik temel analizlerdir

Doğrulanmış botlar için günlük/haftalık istek sayısı, benzersiz URL, klasör dağılımı, durum kodu, yanıt süresi, bayt, cache hit, son tarama ve ilk keşif zamanı raporlanmalıdır. Yeni yayınlanan sayfaların ne kadar sürede tarandığı; eski sayfalara gereksiz yoğunluk; 404, 429 ve 5xx kümeleri; yönlendirme zincirleri ve büyük dosyalar ayrı incelenir.

AnalizSoruKarar
KapsamHangi konu ve dosya türleri taranıyor?İç bağlantı veya erişim sorunu
Sağlık2xx, 3xx, 4xx, 5xx oranı nedir?Teknik hata kuyruğu
TazelikYeni/güncel URL ne zaman tekrar tarandı?Yayın ve keşif akışı
KaynakEn çok bant ve CPU kullanan bot hangisi?Rate limit veya cache
BoşlukÖnemli hangi URL hiç görünmüyor?Sitemap, link veya robots kontrolü

Sahte bot, agresif tarama ve güvenlik taraması birbirinden ayrılmalıdır

Doğrulanmamış bir istemci kendisini bilinen bot gibi göstererek rate limit veya WAF kurallarını aşmaya çalışabilir. Çok yüksek istek hızı, login veya arama uçlarına yönelme, POST denemeleri, bilinen açıklara ait path’ler ve robots dışı hassas hedefler güvenlik kuyruğuna alınmalıdır. Ancak bilinmeyen her otomasyon kötü niyetli değildir; davranış ve etki değerlendirilmelidir.

  • Doğrulanmamış bot adlarına otomatik güven vermeyin.
  • Public içerik ile yönetim, login ve API yüzeylerinde farklı politika uygulayın.
  • Rate limit’i bot adına değil kaynak, davranış ve maliyete bağlayın.
  • Yanlış pozitifleri ve doğrulanmış bot engellerini ayrı raporlayın.
  • Güvenlik logları ile erişim loglarını ortak istek kimliğiyle eşleyin.
  • İnsan kullanıcı veya erişilebilirlik aracını yanlışlıkla engellemediğinizi test edin.

Bot sayısı değil erişim kalitesi ve iş etkisi raporlanmalıdır

Yüksek istek sayısı başarı göstergesi değildir. Rapor; doğrulanmış bot oranı, önemli URL kapsamı, başarılı yanıt, keşif gecikmesi, hata kuyruğu, robots uyumu, bant maliyeti ve AI/search referral sonuçları gibi birlikte yorumlanan göstergeler içermelidir.

KPITanımSınır
Doğrulanmış bot oranıKimliği teyit edilen istek / aday istekKimlik yöntemi kapsamına bağlı
Önemli URL kapsamıTaranan kritik URL / beklenen kritik URLTarama indeksleme değildir
Başarılı yanıt2xx istek / doğrulanmış istekİçerik kalitesini göstermez
Keşif gecikmesiYayın ile ilk doğrulanmış tarama arasıBot ve site ölçeğine göre değişir
Kaynak maliyetiBayt, CPU, cache miss ve origin yüküTicari faydayla birlikte yorumlanır

Log analizi günlük alarm ve aylık yönetişim döngüsüne bağlanmalıdır

Günlük otomasyon; yeni bot, doğrulama başarısızlığı, yüksek 4xx/5xx, anormal hız, kritik URL tarama boşluğu ve robots değişikliği için alarm üretebilir. Aylık kurul; güvenlik, web, SEO/GEO, altyapı ve içerik ekipleriyle erişim politikasını, maliyeti ve ticari sonucu birlikte değerlendirmelidir.

  1. Bot envanteri ve amaç sınıflarını oluşturun.
  2. Ham log saklama, maskeleme ve erişim süresini belirleyin.
  3. Doğrulama kaynağını otomatik ve sürümlü güncelleyin.
  4. Kritik URL ve beklenen bot matrisini tanımlayın.
  5. Anomali ve hata eşiklerini yayın öncesinde yazın.
  6. Politika değişikliklerini tarih, gerekçe ve sonuçla kaydedin.

Kaynaklar ve gözden geçirme notu

Bu rehberde değişebilir veya teknik iddialar için öncelikle resmî kurum, ürün geliştiricisi ve birincil araştırma kaynakları kullanılmıştır. Bağlantılar 27 Temmuz 2026 tarihinde gözden geçirilmiştir.

  1. 01
    OpenAI — Overview of OpenAI Crawlers

    OAI-SearchBot, GPTBot, ChatGPT-User amaçları ve yayımlanan IP aralıklarını açıklar.

  2. 02
    Google Search Central — Googlebot Verification

    Googlebot isteklerini IP listesi veya DNS ile doğrulama yöntemlerini açıklar.

  3. 03
    Bing Webmaster Tools — Verify Bingbot

    Bingbot kimliğini ters DNS ve ileri IP kontrolüyle doğrulama yöntemidir.

  4. 04
    Cloudflare — Verified Bots

    Verified bot kavramını ve doğrulanmış otomasyon sınıflarını açıklar.

  5. 05
    Cloudflare — Bot Management

    Bot Analytics ve loglar üzerinden davranış ve bot skorlarının izlenmesini açıklar.

Yayın sorumluluğu: Bu içerik kişisel yazar profili kullanılmadan Vatansever Bilişim Anonim Şirketi kurumsal yayın sorumluluğunda hazırlanmıştır. Genel bilgilendirme niteliğindedir; belirli bir kurum için hukuki görüş, yatırım tavsiyesi, güvenlik veya sonuç garantisi değildir.
İLGİLİ HİZMET

AI ve arama botlarını tahminle değil doğrulanmış log kanıtıyla yönetin.

Bot kimliği, erişim amacı, URL kapsamı, hata, maliyet ve referral etkisini ortak gözlemlenebilirlik modelinde izleyin.