Detaylı tanım
GEO başarısı için robots.txt'te bu botlara izin verilmesi gerekir. Bot listesi: GPTBot (OpenAI), ClaudeBot + anthropic-ai (Anthropic), PerplexityBot + Perplexity-User (Perplexity), Google-Extended (Google AI Overviews), Applebot-Extended (Apple Intelligence), CCBot (Common Crawl), cohere-ai (Cohere), meta-externalagent (Meta AI), OAI-SearchBot + ChatGPT-User (OpenAI search). Disallow tüm bu botları, AI motorlarında görünmemenize neden olur.
AI Crawler (GPTBot, ClaudeBot, PerplexityBot) nasıl çalışır?
AI crawler'lar teknik olarak klasik arama motoru botlarıyla aynı yoldan çalışır: HTTP isteği gönderir, User-Agent başlığında kendilerini tanıtır ve alan adının kökündeki robots.txt dosyasında kendi adlarına yazılmış kuralı ararlar. Amaçları ise birbirinden ayrışır. Bir grup bot model eğitimi için toplu içerik toplar; ikinci grup kullanıcı o anda soru sorduğu için tek bir sayfayı canlı çeker; üçüncü grup ise arama dizini besler. Bu ayrım pratikte karar değiştirir, çünkü eğitim botunu kapatıp canlı getirme botunu açık bırakmak, içeriğinizin eğitim setine girmesini sınırlarken sohbet cevabı içinde kaynak olarak gösterilmenizi sürdürebilir. Tek bir toptan izin veya toptan yasak kararı yerine bot ailelerini ayrı ayrı ele almak bu yüzden anlamlıdır.
robots.txt eşleşmesi bot adı üzerinden ve tek blok bazında yapılır. Bir bot kendi adına yazılmış bloğu bulursa genel yıldız bloğunu tamamen yok sayar; dolayısıyla yıldız bloğuna eklediğiniz izin satırları, aşağıda o bot için ayrı bir blok varsa geçerli olmaz. İkinci teknik nokta render tarafındadır: eğitim ve getirme ajanlarının çoğu JavaScript çalıştırmaz, bu yüzden yalnızca istemcide oluşturulan metin onlara boş sayfa gibi görünür. Sunucu tarafı render veya statik HTML burada doğrudan görünürlük meselesidir. Üçüncü nokta CDN katmanıdır: güvenlik duvarı ve bot yönetimi ürünleri, robots.txt ne derse desin bu ajanları erişim reddi koduyla geri çevirebilir, yani izin verdiğinizi sandığınız bot aslında hiç içeri girmemiş olabilir.
Gerçek durumu ölçmenin yolu tahmin değil sunucu erişim kayıtlarıdır. Log dosyasında User-Agent alanına göre filtre alıp hangi botun hangi adresleri hangi HTTP durum koduyla çektiğini görebilirsiniz; erişim reddi ve hız sınırı kodlarının yığılması engellendiğinizin somut kanıtıdır. Kimlik doğrulaması için sağlayıcıların yayımladığı IP aralıkları veya ters DNS sorgusu kullanılır, çünkü User-Agent başlığı taklit edilebilir bir metindir. İkinci ölçüm kanalı yönlendirme trafiğidir: analitikte sohbet ve cevap motorlarının alan adlarından gelen oturumlar, içeriğinizin cevaplarda kaynak gösterildiğine dair dolaylı işaret verir. Bu iki veriyi birlikte okumak, robots.txt üzerinde yaptığınız değişikliğin işe yarayıp yaramadığını görmenin en doğrudan yoludur.
Hangi terimlerle karıştırılıyor?
| Karıştırılan terim | Aradaki fark |
|---|---|
| Googlebot | Googlebot klasik arama dizini için tarar. Google-Extended ise dizinlemeyi etkilemez, yalnızca içeriğin yapay zeka ürünlerinde kullanımını yönetir; ikisi ayrı satırlarla kontrol edilir. |
| Canlı getirme ajanı (ChatGPT-User, Perplexity-User) | Kullanıcı o anda soru sorduğu için tek bir adresi çeker. Toplu tarama veya dizin oluşturma yapmaz, bu yüzden trafiği düşük ama cevaba etkisi doğrudandır. |
| llms.txt | Öneri niteliğinde bir dosya biçimidir, botların uymak zorunda olduğu bir protokol değildir. Erişim kararını fiilen robots.txt ve sunucu tarafındaki kurallar belirler. |
| noindex etiketi | Sayfayı arama dizininden çıkarmak için kullanılır ve botun sayfayı okumasını gerektirir. AI botlarının erişimini yönetmenin yolu ise robots.txt ve sunucu kurallarıdır. |
Sık yapılan hatalar
robots.txt'i tek blok gibi okumak
Yıldız bloğuna izin yazıp aşağıda aynı bot için ayrı bir blok bırakmak sık görülen kurgu hatasıdır. Bot kendi adını taşıyan bloğu bulduğu anda genel bloğu tamamen yok sayar, yani genel blokta verdiğiniz izin o bot için hiç uygulanmaz ve tarama sessizce engellenmiş olur.
İzni robots.txt'te verip CDN'de unutmak
Güvenlik duvarı, bot koruma modu veya hız sınırı kuralları robots.txt'ten bağımsız çalışır. Dosyada izin verilmiş bir ajan, CDN katmanında erişim reddi kodu alarak geri çevrilebilir. Kural değişikliğinden sonra erişim kayıtlarında o botun gerçekten iki yüz kodu aldığını doğrulamadan işi bitmiş saymayın.
İçeriği yalnızca JavaScript ile yüklemek
Eğitim ve canlı getirme ajanlarının çoğu tarayıcı gibi kod çalıştırmaz. Sekmelerin arkasında, açılır panellerde veya kaydırdıkça yüklenen bölümlerde duran metin bu botlara ulaşmaz. Sayfanın kaynak HTML çıktısında görünmeyen bilgi, izin verilmiş olsa bile alıntılanamaz durumdadır.
Tarama iznini kaynak gösterilmekle eşitlemek
İzin gerek şarttır ama yeter şart değildir. Cevap üretirken alıntılanabilmek için sayfanın soruya doğrudan yanıt veren, tarih ve kaynak bilgisi taşıyan, kendi başına anlaşılır bölümler içermesi gerekir. Yalnızca robots.txt satırı ekleyip içeriğe dokunmamak ölçülebilir bir değişiklik üretmez.
AI Crawler (GPTBot, ClaudeBot, PerplexityBot) ne zaman kritik hâle gelir?
Kendi kategorinizle ilgili sorular sohbet asistanlarında cevaplanırken rakipler kaynak gösterilip siz görünmüyorsanız, ilk bakılacak yer robots.txt ve sunucu erişim kayıtlarıdır. Aynı kontrol site yenileme, alan adı taşıma veya yeni bir CDN kurulumundan sonra da kritik hale gelir; bu geçişlerde bot kuralları çoğu zaman varsayılan ayarla geri gelir ve içerik farkında olmadan taramaya kapanır.
Örnekler
- User-agent: GPTBot\nAllow: / → ChatGPT'nin markanızı taramasına izin verir.