robots.txt dosyası 1994’te tek tür ziyaretçi için tasarlandı: arama tarayıcısı. 2023’te ziyaretçi listesi bir anda kalabalıklaştı. OpenAI Ağustos 2023’te GPTBot’u duyurdu, Google Eylül 2023’te Google-Extended kontrolünü ekledi ve o günden beri her cevap motoru kendi user-agent’ıyla geldi. Site sahipleri artık üç ayrı bot sınıfını, incelik tanımayan tek bir dosyayla yönetiyor ve en yaygın yapılandırma hataları tamamen yanlış sınıfı engelliyor.
Üç bot sınıfı, üç ayrı anlaşma
GPTBot ve CCBot gibi eğitim tarayıcıları model eğitimi için metin toplar; onları engellemek bugünkü görünürlüğünüzü etkilemeyen saf bir politika tercihidir. Arama sınıfı ajanlar — OAI-SearchBot, PerplexityBot ve benzerleri — sayfaları cevap motorlarının alıntılayabilmesi için indeksler; bunları engellemek sizi yapay-zekâ cevaplarından, Googlebot’u engellemenin sizi aramadan sildiği gibi siler. Kullanıcı tetikli çekimler tek bir insanın tek bir URL isteğiyle çalışır ve sağlayıcılar bu sınıfı belgelerinde ayrı tutar, çünkü her çekimin arkasında bir insan vardır.
Gerçekten istediğiniz anlaşmayı yazın. Bir yayıncı eğitimi reddedip aramayı ağırlayabilir: GPTBot ve CCBot’a disallow, OAI-SearchBot ve PerplexityBot’a allow. İki karar birbirinden bağımsızdır ve ikisini karıştırmak son üç yılın en pahalı robots.txt hatasıdır.
Google-Extended yanılgısı
Google-Extended bir tarayıcı değildir. O user-agent ile hiçbir istek gelmez; Googlebot’un robots.txt’te okuyup sayfalarınızın Gemini eğitimine girip girmeyeceğine karar verdiği bir kontrol anahtarıdır. Google bunu tarayıcı belgelerinde açıkça yazar. Google-Extended’i engellemek taramayı, indekslemeyi ve sıralamayı değiştirmez — izin vermek de aramaya bir şey kazandırmaz. Googlebot’a dokunmadan Google-Extended’i engelleyerek "Google yapay zekâsını kestik" diyen siteler bir erişim kararı değil, bir eğitim-politikası beyanı vermiştir.
5xx tuzağı ve öteki sessiz arızalar
RFC 9309’un 2.3.1 bölümü kuralı koyar: sunucu hatası dönen bir robots.txt, tarayıcı için tüm sitenin yasak sayılması demektir. /robots.txt’e 500 döndüren yanlış yapılandırılmış bir CDN, sayfa tarayıcıda sorunsuz açılırken sizi uyumlu her bottan — arama ve yapay zekâ birlikte — tek seferde siler. Aynı RFC ayrıştırıcılara en az 500 KiB robots.txt kabul etme yükümlülüğü getirir, yol kurallarında en-uzun-eşleşme önceliğini tanımlar ve boş Disallow satırının her şeye izin anlamına geldiğini söyler.
Dosyayı kod gibi denetleyin, çünkü koddur. Ağınızın dışından çekin ve durumun 200 ya da 404 olduğunu doğrulayın. Yol kurallarının gerçek URL yapınızla eşleştiğini kontrol edin — Disallow: /report, /en/report’u kapsamaz; eşleşme, yolun düz metin öneki üzerinden yapılır. Önem verdiğiniz user-agent’ları, alıntı kazandıran somut yollara karşı tek tek test edin.
Üretimle temasta hayatta kalan bir kontrol listesi
Dört değişmezi koruyun, dosya dürüst kalır: robots.txt bir saniyenin altında 200 ya da 404 ile yanıtlar; adını andığınız her ajan sınıfının açık ve kasıtlı bir kuralı vardır; eğitim politikası ile arama politikası ayrı ayrı kararlaştırılır; her kural değişikliği, gerçekten alıntı kazandıran üç-dört URL’ye karşı test edilir. Bu dört çizgiyi tutan siteler, sağlayıcı listeleri değiştikçe acil müdahale yaşamaz — yeni bot adları yeniden düşünmeye zorlamak yerine mevcut bir sınıfın içine oturur.
Kaynaklar
Bağlayıcı metin RFC’dir; üç sağlayıcı sayfası ise user-agent’ları ve sınıflarını tanımlar. Sağlayıcı bot listeleri yılda birkaç kez değişir; özetlerini değil sayfaların kendisini yer imine alın.