AI botlarını loglardan analiz etmek için zaman, IP, kullanıcı ajanı, istek yöntemi, URL, durum kodu, bayt, referer, gecikme, WAF kararı ve bot doğrulama alanlarını birlikte toplayın. User-agent adını tek başına güvenilir kabul etmeyin; Google ve Bing için ters/ileri DNS veya resmî IP listeleri, OpenAI için yayımlanan IP aralıkları, CDN/WAF için verified bot sinyalleri kullanın. Sonuçları bot adı değil amaç, doğrulanmış kimlik, erişilen içerik ve iş etkisiyle raporlayın.
Önce hangi kararı desteklemek için log topladığınızı belirleyin
Bot logları; “AI bot geldi mi?” merakından daha fazlasını cevaplayabilir. Kurum, arama ve AI görünürlüğü için hangi içeriklerin tarandığını, kritik sayfaların hata verip vermediğini, robots değişikliklerinin etkisini, bant genişliği maliyetini, sahte bot veya agresif tarama riskini ve yayın sonrası keşif hızını izleyebilir. Amaç tanımlanmadan toplanan milyarlarca log satırı karar üretmez.
| Karar | Gerekli kanıt | Yanlış yorum |
|---|---|---|
| Görünürlük hazırlığı | Doğrulanmış bot, erişilen URL, 2xx oranı | Tek ziyaretin kaynak gösterimi garantisi sayılması |
| Erişim politikası | Bot amacı, robots kuralı, WAF sonucu | Bütün AI botlarını tek sınıf saymak |
| Teknik sağlık | 4xx/5xx, gecikme, yönlendirme zinciri | User-agent toplamını kalite metriği yapmak |
| Güvenlik | Kimlik doğrulama, hız, yöntem, hedef | Bot adına güvenerek allowlist açmak |
Ham erişim logları bot davranışını yeniden kuracak alanları içermelidir
Asgari veri; UTC zaman damgası, kaynak IP, HTTP yöntemi, host, URI, sorgu dizgesi, durum kodu, gönderilen bayt, kullanıcı ajanı, referer, yanıt süresi ve mümkünse TLS, cache, WAF ve bot doğrulama sinyalidir. Kişisel veri ve güvenlik kayıtları için saklama süresi, erişim ve maskeleme politikası uygulanmalıdır.
- Origin ve CDN loglarının saat ve istek kimliğiyle eşlenebilmesi.
- Yönlendirme öncesi ve sonrası host bilgisinin korunması.
- HEAD, GET ve diğer yöntemlerin ayrı raporlanması.
- Query string içinde hassas veri varsa maskeleme.
- WAF engeli, challenge ve rate-limit sonucunun kaydı.
- Log örneklemesinin düşük hacimli botları görünmez yapmadığının kontrolü.
Kullanıcı ajanı iddiadır; kimlik ayrıca doğrulanmalıdır
Her istemci user-agent başlığına istediği metni yazabilir. Google, isteklerin Googlebot’tan geldiğini doğrulamak için yayımlanan IP listeleri veya ters DNS ve ileri DNS doğrulamasını önerir. Bing de ters DNS ve ileri IP kontrolü sunar. OpenAI, OAI-SearchBot ve GPTBot için resmî kullanıcı ajanlarıyla birlikte yayımlanan IP aralıklarının allowlist edilmesini önerir. CDN veya WAF verified bot alanı sağlıyorsa bunun kapsamı ve güncelliği kontrol edilmelidir.
- User-agent desenini aday bot olarak sınıflandırın.
- Kaynak IP’yi resmî IP listesi veya doğrulama yöntemiyle kontrol edin.
- Doğrulama zamanını ve kullanılan kaynak sürümünü kaydedin.
- Sonucu “doğrulanmış”, “doğrulanamadı” veya “sahte/uyumsuz” olarak işaretleyin.
- Allowlist ve güvenlik kuralını doğrulanmış kimliğe bağlayın.
- IP listesi değişikliklerini düzenli yenileyin.
| Sinyal | Güven düzeyi | Kullanım |
|---|---|---|
| User-agent metni | Düşük | İlk aday sınıflandırması |
| Ters + ileri DNS | Orta/yüksek | Google/Bing gibi destekleyen botlar |
| Resmî IP aralığı | Yüksek, güncelse | OpenAI ve yayımlayan sağlayıcılar |
| Verified bot alanı | Sağlayıcı kapsamına bağlı | CDN/WAF üzerinde filtre ve analiz |
| Web Bot Auth | Kriptografik doğrulama | Destekleyen ajan ve altyapılar |
Botları marka adıyla değil davranış ve amaçla sınıflandırın
Aynı kurumun arama, model geliştirme ve kullanıcı tarafından başlatılan istekler için farklı botları olabilir. OpenAI, OAI-SearchBot’u ChatGPT arama sonuçları, GPTBot’u model geliştirme tercihi ve ChatGPT-User’ı kullanıcı tarafından başlatılan erişim için ayrı tanımlar. Bir bot farklı davranışları da aynı altyapıda gösterebilir.
Keşif ve kaynaklama
İçerik arama sonuçlarında gösterilmek üzere taranır.
Model geliştirme
İçerik eğitim veya model iyileştirme tercihi kapsamında taranır.
İstek üzerine erişim
Bir kullanıcının talebiyle belirli URL alınır.
İzleme veya doğrulama
Uptime, link, güvenlik veya performans kontrolü yapılır.
Erişim politikası, “AI botlarını aç/kapat” ikiliğinden çıkarılıp davranış bazında kurulmalıdır.
Robots kuralı ile gerçek log davranışı birlikte incelenmelidir
Robots.txt bir erişim kontrolü veya kimlik doğrulama sistemi değildir; uyumlu botlara tarama tercihini bildirir. Hassas içerik robots ile korunmaz. Log analizi, kural değişiminden sonra ilgili botun hangi URL’lere erişmeye devam ettiğini, 24 saat veya daha uzun uyum gecikmesini, CDN cache’ini ve farklı hostlardaki robots dosyalarını gösterebilir.
- Her host ve protokol için robots.txt durumunu kaydedin.
- User-agent özel kuralı ile genel yıldız kuralını birlikte çözümleyin.
- Allow/Disallow sonucunu istek anındaki dosya sürümüyle eşleyin.
- Engellenen URL’nin yine dış bağlantı veya navigasyon sonucu görünebileceğini unutmayın.
- Hassas içeriği kimlik doğrulama ve yetkilendirmeyle koruyun.
- WAF engelini robots tercihiyle karıştırmayın.
URL kapsamı, durum kodu, sıklık ve tazelik temel analizlerdir
Doğrulanmış botlar için günlük/haftalık istek sayısı, benzersiz URL, klasör dağılımı, durum kodu, yanıt süresi, bayt, cache hit, son tarama ve ilk keşif zamanı raporlanmalıdır. Yeni yayınlanan sayfaların ne kadar sürede tarandığı; eski sayfalara gereksiz yoğunluk; 404, 429 ve 5xx kümeleri; yönlendirme zincirleri ve büyük dosyalar ayrı incelenir.
| Analiz | Soru | Karar |
|---|---|---|
| Kapsam | Hangi konu ve dosya türleri taranıyor? | İç bağlantı veya erişim sorunu |
| Sağlık | 2xx, 3xx, 4xx, 5xx oranı nedir? | Teknik hata kuyruğu |
| Tazelik | Yeni/güncel URL ne zaman tekrar tarandı? | Yayın ve keşif akışı |
| Kaynak | En çok bant ve CPU kullanan bot hangisi? | Rate limit veya cache |
| Boşluk | Önemli hangi URL hiç görünmüyor? | Sitemap, link veya robots kontrolü |
Sahte bot, agresif tarama ve güvenlik taraması birbirinden ayrılmalıdır
Doğrulanmamış bir istemci kendisini bilinen bot gibi göstererek rate limit veya WAF kurallarını aşmaya çalışabilir. Çok yüksek istek hızı, login veya arama uçlarına yönelme, POST denemeleri, bilinen açıklara ait path’ler ve robots dışı hassas hedefler güvenlik kuyruğuna alınmalıdır. Ancak bilinmeyen her otomasyon kötü niyetli değildir; davranış ve etki değerlendirilmelidir.
- Doğrulanmamış bot adlarına otomatik güven vermeyin.
- Public içerik ile yönetim, login ve API yüzeylerinde farklı politika uygulayın.
- Rate limit’i bot adına değil kaynak, davranış ve maliyete bağlayın.
- Yanlış pozitifleri ve doğrulanmış bot engellerini ayrı raporlayın.
- Güvenlik logları ile erişim loglarını ortak istek kimliğiyle eşleyin.
- İnsan kullanıcı veya erişilebilirlik aracını yanlışlıkla engellemediğinizi test edin.
Bot sayısı değil erişim kalitesi ve iş etkisi raporlanmalıdır
Yüksek istek sayısı başarı göstergesi değildir. Rapor; doğrulanmış bot oranı, önemli URL kapsamı, başarılı yanıt, keşif gecikmesi, hata kuyruğu, robots uyumu, bant maliyeti ve AI/search referral sonuçları gibi birlikte yorumlanan göstergeler içermelidir.
| KPI | Tanım | Sınır |
|---|---|---|
| Doğrulanmış bot oranı | Kimliği teyit edilen istek / aday istek | Kimlik yöntemi kapsamına bağlı |
| Önemli URL kapsamı | Taranan kritik URL / beklenen kritik URL | Tarama indeksleme değildir |
| Başarılı yanıt | 2xx istek / doğrulanmış istek | İçerik kalitesini göstermez |
| Keşif gecikmesi | Yayın ile ilk doğrulanmış tarama arası | Bot ve site ölçeğine göre değişir |
| Kaynak maliyeti | Bayt, CPU, cache miss ve origin yükü | Ticari faydayla birlikte yorumlanır |
Log analizi günlük alarm ve aylık yönetişim döngüsüne bağlanmalıdır
Günlük otomasyon; yeni bot, doğrulama başarısızlığı, yüksek 4xx/5xx, anormal hız, kritik URL tarama boşluğu ve robots değişikliği için alarm üretebilir. Aylık kurul; güvenlik, web, SEO/GEO, altyapı ve içerik ekipleriyle erişim politikasını, maliyeti ve ticari sonucu birlikte değerlendirmelidir.
- Bot envanteri ve amaç sınıflarını oluşturun.
- Ham log saklama, maskeleme ve erişim süresini belirleyin.
- Doğrulama kaynağını otomatik ve sürümlü güncelleyin.
- Kritik URL ve beklenen bot matrisini tanımlayın.
- Anomali ve hata eşiklerini yayın öncesinde yazın.
- Politika değişikliklerini tarih, gerekçe ve sonuçla kaydedin.
Kaynaklar ve gözden geçirme notu
Bu rehberde değişebilir veya teknik iddialar için öncelikle resmî kurum, ürün geliştiricisi ve birincil araştırma kaynakları kullanılmıştır. Bağlantılar 27 Temmuz 2026 tarihinde gözden geçirilmiştir.
- 01OpenAI — Overview of OpenAI Crawlers
OAI-SearchBot, GPTBot, ChatGPT-User amaçları ve yayımlanan IP aralıklarını açıklar.
- 02Google Search Central — Googlebot Verification
Googlebot isteklerini IP listesi veya DNS ile doğrulama yöntemlerini açıklar.
- 03Bing Webmaster Tools — Verify Bingbot
Bingbot kimliğini ters DNS ve ileri IP kontrolüyle doğrulama yöntemidir.
- 04Cloudflare — Verified Bots
Verified bot kavramını ve doğrulanmış otomasyon sınıflarını açıklar.
- 05Cloudflare — Bot Management
Bot Analytics ve loglar üzerinden davranış ve bot skorlarının izlenmesini açıklar.