robots.txt, belirli botların hangi URL’leri tarayabileceğini bildiren gönüllü bir erişim kuralıdır; gizli bilgiyi korumaz ve bir URL’nin indekslenmemesini tek başına garanti etmez. OAI-SearchBot ChatGPT arama sonuçları, GPTBot model geliştirme amacıyla kullanılan içerik taraması için ayrı tercihler sunar. llms.txt ise topluluk tarafından önerilmiş bir içerik sunum formatıdır; Google görünürlüğü için gerekli değildir.
Tarama, indeksleme, kaynak gösterimi ve eğitim aynı şey değildir
Tarama
Botun URL’ye erişip içeriği alabilmesidir. robots.txt bu erişim için kural bildirebilir.
İndeksleme
İçeriğin arama sisteminin dizinine alınmasıdır. Tarama izni indekslenme garantisi değildir.
Kaynak gösterimi
Arama veya AI cevabında sayfanın bağlantı ya da citation olarak kullanılmasıdır.
Model geliştirme
İçeriğin üretken model sistemlerini geliştirmek için kullanılabilmesine ilişkin ayrı tercihtir.
Aynı bot sağlayıcısının bu amaçlar için farklı user-agent kullanması mümkündür. Bu nedenle “AI botlarını açtık” veya “AI’dan çıktık” gibi tek cümlelik kararlar yeterli değildir; amaç bazında bot, URL ve veri sınıfı belirlenmelidir.
robots.txt erişim bildirir; güvenlik ve gizlilik sağlamaz
Google Search Central, robots.txt dosyasını esas olarak tarayıcı trafiğini yönetme aracı olarak tanımlar. Bir URL robots.txt ile engellense bile başka sayfalardan bağlantı alıyorsa URL adresi indeks sonuçlarında görünebilir. Gizli içerik için kimlik doğrulama, sunucu yetkilendirmesi veya gerektiğinde kaldırma gerekir.
| Hedef | Uygun kontrol | Not |
|---|---|---|
| Botun yolu taramaması | robots.txt Disallow | Saygın botların gönüllü uyumuna dayanır. |
| Sayfanın Google’da görünmemesi | noindex meta veya X-Robots-Tag | Botun kuralı görebilmesi için sayfa taranabilir olmalıdır. |
| Özel içeriğin korunması | Kimlik doğrulama ve sunucu erişim kontrolü | robots.txt dosyası yolları kamuya açık biçimde listeler. |
| Silinmiş URL’nin kaldırılması | 404/410, yönlendirme ve arama kaldırma süreçleri | Amaç ve URL geçmişine göre planlanır. |
| Crawl yükünün azaltılması | robots kuralları, mimari ve sunucu optimizasyonu | Önemli CSS/JS kaynaklarını engellemek sayfanın anlaşılmasını bozabilir. |
robots.txt içinde noindex satırı kullanmak standart bir indeksleme yöntemi değildir. Ayrıca robots ile engellenen bir sayfadaki meta noindex kuralı bot tarafından görülemeyebilir.
OAI-SearchBot ve GPTBot ayrı amaçlara sahiptir
OpenAI’nin resmî bot dokümantasyonuna göre OAI-SearchBot, web sitelerinin ChatGPT arama özelliklerindeki sonuçlarda gösterilmesi için kullanılır. GPTBot ise OpenAI’nin üretken AI temel modellerini geliştirmede kullanılabilecek içeriği tarar. Site sahibi birini açıp diğerini kapatabilir; bu tercihler bağımsızdır.
| User-agent | Amaç | Karar sorusu |
|---|---|---|
OAI-SearchBot | ChatGPT arama cevaplarında web kaynaklarını yüzeye çıkarma. | Kamusal içeriğin ChatGPT aramasında kaynak olmasını istiyor muyuz? |
GPTBot | Üretken AI temel modellerinin daha yararlı ve güvenli hâle getirilmesine yönelik tarama. | Kamusal içeriğin bu model geliştirme kullanımına açık olmasını istiyor muyuz? |
ChatGPT-User | Kullanıcının açık isteği üzerine bir sayfayı ziyaret eden user-agent. | Kullanıcı tarafından başlatılan erişim için hangi sunucu ve güvenlik kuralları geçerli? |
Bot adıyla gelen her isteğe güvenilmemelidir. User-agent kolayca taklit edilebilir; yüksek güven gerektiren kontrollerde sağlayıcının yayımladığı IP aralıkları ve sunucu günlükleri birlikte değerlendirilmelidir.
Google için temel SEO ve görünür içerik hâlâ ana zemindir
Google’ın üretken AI arama rehberi; taranabilir teknik yapı, özgün ve yararlı içerik, açık iç bağlantılar, erişilebilir metin ve görünür içerikle eşleşen yapılandırılmış verinin önemini vurgular. Özel AI metin dosyaları veya yeni bir schema türü Google’ın üretken AI özelliklerinde görünmek için gerekli değildir.
- Önemli sayfalar robots.txt, CDN veya güvenlik katmanı tarafından yanlışlıkla engellenmemeli.
- Ana içerik JavaScript hatasına bağlı kalmadan erişilebilir metin biçiminde bulunmalı.
- İç bağlantılar konu merkezleri ve rehberler arasındaki ilişkiyi açıklamalı.
- Yapılandırılmış veri sayfada görünen bilgiyle aynı olmalı.
- Sitemap güncel URL’leri taşımalı; ancak sitemap indeksleme garantisi sayılmamalı.
- Performans Search Console ve sunucu kanıtlarıyla izlenmeli.
llms.txt bir öneridir; evrensel bot kontrol standardı değildir
llms.txt, sitenin önemli içeriklerini Markdown benzeri sade bir listede AI sistemlerine sunmayı öneren topluluk kökenli bir formattır. robots.txt yerine geçmez; erişim yetkisi tanımlamaz; bir sağlayıcının dosyayı okuyacağını veya arama sonuçlarında avantaj sağlayacağını garanti etmez.
Buna rağmen site, farklı sistemler veya dokümantasyon tüketicileri için düşük maliyetli bir içerik haritası olarak llms.txt tutabilir. Bu durumda dosya otomatik üretilebilmeli, canonical URL’lerle eşleşmeli, eski sayfaları taşımamalı ve “AI görünürlüğü garantisi” olarak pazarlanmamalıdır.
Amaç bazlı bot ve dosya karar matrisi
| Amaç | Birincil kontrol | Destekleyici kontrol | Garanti etmeyeceği şey |
|---|---|---|---|
| Google taranabilirliği | Googlebot robots ve sunucu erişimi | Sitemap, iç bağlantı, URL Inspection | Sıralama veya indekslenme |
| ChatGPT arama kaynağı olma | OAI-SearchBot izni ve IP erişimi | Kaliteli kamusal içerik ve ölçüm | Her sorguda citation veya trafik |
| Model geliştirme tercihi | GPTBot kuralı | Hukuki/veri politikası değerlendirmesi | İnternetteki diğer kopyaların kontrolü |
| Özel sayfanın korunması | Kimlik doğrulama | Yetkilendirme, noindex, ağ politikası | Paylaşılmış kopyaların silinmesi |
| Sade içerik haritası | Opsiyonel llms.txt | Sitemap ve HTML navigasyon | Google veya başka sağlayıcıda görünürlük |
Canlı ortamda nasıl doğrulanır?
- Dosya erişimi:
/robots.txt, sitemap ve varsa llms.txt doğru host ve HTTPS üzerinde yanıt veriyor mu? - Kural testi: Önemli botlar için Allow/Disallow sonucu beklenen URL’lerde kontrol edilir.
- Sunucu logu: User-agent, IP, durum kodu, istek yolu ve tarih birlikte incelenir.
- Arama araçları: Search Console URL Inspection ve Bing Webmaster Tools tarama raporları kullanılır.
- Değişiklik kaydı: Kuralın nedeni, sahibi, tarihi ve geri alma planı yazılır.
- Periyodik kontrol: Yeni botlar, sağlayıcı belgeleri ve IP listeleri takip edilir.
Örnek: arama ve eğitim tercihlerini ayırmak
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Googlebot
Allow: /
Sitemap: https://ornek.com/sitemap.xml
Bu yalnız açıklayıcı örnektir. Gerçek dosyada yönetim klasörleri, geçici çıktılar, arama sayfaları veya özel URL desenleri sitenin mimarisine göre değerlendirilmelidir. robots.txt özel verinin güvenlik kontrolü olarak kullanılmamalıdır.
Yaygın yanlışlar
- robots.txt ile engellenen sayfanın kesinlikle arama sonuçlarından silineceğini varsaymak.
- Bütün AI botlarını tek user-agent veya tek amaç saymak.
- llms.txt dosyasını Google sıralama faktörü ya da GEO garantisi olarak sunmak.
- Bot user-agent adını kimlik doğrulaması kabul etmek.
- Önemli CSS ve JavaScript kaynaklarını engelleyip sayfanın anlaşılmasını bozmak.
- Bot kuralı değişikliğini canlı log ve arama araçlarıyla doğrulamamak.
Kaynaklar ve gözden geçirme notu
Bu rehberde değişebilir veya teknik iddialar için öncelikle resmî kurum, ürün geliştiricisi ve birincil araştırma kaynakları kullanılmıştır. Bağlantılar 27 Temmuz 2026 tarihinde gözden geçirilmiştir.
- 01OpenAI Developers — Overview of OpenAI Crawlers
OAI-SearchBot, GPTBot ve ChatGPT-User rollerini ve bağımsız robots tercihlerini açıklar.
- 02Google Search Central — Introduction to robots.txt
robots.txt kullanım amacını, sınırlarını ve güvenlik kontrolü olmadığını açıklar.
- 03Google Search Central — Robots meta tag specifications
noindex ve X-Robots-Tag kuralları ile robots.txt etkileşimini tanımlar.
- 04Google Search Central — Generative AI optimization guide
Google için llms.txt gereksinimi olmadığını ve temel SEO yaklaşımını açıklar.
- 05llms.txt proposal
llms.txt dosyasının önerilen formatını ve amaçlanan kullanımını tanımlayan proje kaynağı.