Robots.txt and AI crawlers GPTBot ClaudeBot PerplexityBot web scraping 2026
  • Published:
  • Last Updated:
  • Genel
  • 7 min read

Robots.txt, tarayıcılara bir sitenin hangi bölümlerini getirebileceklerini söyleyen 30 yıllık metin dosyasıdır. 2026’da, hiç tasarlanmadığı bir işi yapıyor: modelleri eğitmek ve soruları gerçek zamanlı yanıtlamak için içerik çeken GPTBot, ClaudeBot, PerplexityBot, Google-Extended ve daha birçok tarayıcının bulunduğu AI web’ine hakemlik etmek. Bu rehber, AI çağında robots.txt’in neler yapıp yapamayacağını, tarayıcı ekosistemini, AI botlarının buna gerçekten uyup uymadığını, yeni sinyalleri (llms.txt, Cloudflare kontrolleri) ve web scraping yapıyorsanız veya scraping yapılan bir siteyi işletiyorsanız bunun ne anlama geldiğini ele alır.

Ben, her gün web verisi işlem hatları ve AI arama görünürlüğüyle çalışan AI odaklı kısmi zamanlı pazarlama direktörü Andrii Byzov’um. Aşağıda, açık sınırlamalarıyla birlikte 2026’ya güncel, pratik bir bakış bulacaksınız. Hukuki taraf için web scraping yasal mı rehberimize; AI görünürlüğü için AI arama sıralaması takibi yazımıza bakın.


Temel Bilgiler

  • robots.txt gönüllülük esasına dayanır, yasa değildir. Bu, iyi niyetli uyumla ve sunucular/CDN’ler tarafından uygulanan, RFC 9309 olarak resmileştirilmiş bir taleptir, kanunla değil.
  • Eğitim ve arama artık ayrı tarayıcılardır. AI eğitimini (GPTBot, Google-Extended, ClaudeBot) engellerken AI arama alıntılarına (OAI-SearchBot, Claude-SearchBot, PerplexityBot) uygun kalabilirsiniz.
  • Gerçek zamanlı ajan getirmeleri çoğu zaman robots.txt mantığını atlar. Bir kullanıcı AI’dan bir sayfayı okumasını istediğinde, bu getirme tartışmalı olarak bir “tarayıcı” değildir, bu yüzden robots.txt bunu durduramayabilir.
  • Uyum bota göre değişir. Büyük tarayıcılar (Googlebot, GPTBot, ClaudeBot) genel olarak robots.txt’e uyar; bazıları tarihsel olarak uymamıştır ve bir yönerge yalnızca bot onu okumayı seçerse işe yarar.
  • Yeni sinyaller mevcuttur: llms.txt (AI’yı en iyi içeriğinize yönlendirir, yaklaşık %10 benimsenme), ayrıca CDN katmanında Cloudflare’in AI engelleme ve tarama başına ödeme kontrolleri.

2026’da robots.txt nedir ve ne değildir?

robots.txt, bir alan adının kökünde bulunan (/robots.txt) ve kullanıcı aracılarını, getirmemeleri istenen yollarla birlikte listeleyen düz metin dosyasıdır. 2022’de RFC 9309 olarak standartlaştırıldı, ancak temel fikir 1994’ten beri değişmedi: bu, nazik bir taleptir. Kimsenin kimliğini doğrulamaz, ağ düzeyinde erişimi engellemez ve tek başına hukuki güç taşımaz. Kurallara uyan bir tarayıcı dosyayı okur ve uyum sağlar; görmezden gelen bir tarayıcının ise dosyanın kendisinden kaynaklanan teknik bir engeli yoktur.

AI çağındaki bütün mesele bu ayrımdır. robots.txt, uyumlu botların yapmamayı kabul ettiği şeyleri düzenler, bir kilit değildir. Gerçek uygulama (hız sınırlama, engelleme, ödeme duvarları) metin dosyasında değil, sunucuda veya CDN’de gerçekleşir.

AI tarayıcı ekosistemi

AI web’i büyüyen bir grup tarafından taranıyor ve önemli değişim şu: her büyük sağlayıcı artık eğitim ile arama/yanıt trafiğini farklı kullanıcı aracılarına ayırıyor:

Kullanıcı aracısı İşletmeci Amaç robots.txt’e uyuyor mu?
GPTBot OpenAI Model eğitimi Evet (belgelenmiş)
OAI-SearchBot OpenAI ChatGPT araması / alıntılar Evet
ClaudeBot Anthropic Model eğitimi Evet
Claude-SearchBot Anthropic Arama / alıntılar Evet
Google-Extended Google Gemini eğitimi devre dışı bırakma belirteci Evet (yalnızca belirteç)
PerplexityBot Perplexity Arama / yanıtlar Evet (belgelenmiş)
CCBot Common Crawl Açık veri kümesi (birçok modeli besler) Evet
Meta-ExternalAgent Meta Eğitim / AI özellikleri Evet

Eğitim ve arama ayrı ajanlar olduğundan, bir site ayrıntılı bir tercih yapabilir: AI yanıtlarında alıntılanmaya uygun kalırken modellerin eğitimi için kullanılmayı reddedebilir. Örneğin GPTBot’u engelleyip OAI-SearchBot’a izin verebilir.

AI tarayıcıları robots.txt’e gerçekten uyuyor mu?

Çoğunlukla büyük olanlar uyuyor ve bunu kendi sunucu günlüklerinizden kolayca doğrulayabilirsiniz. Googlebot, GPTBot, ClaudeBot ve PerplexityBot kullanıcı aracılarını belgeler ve standart yönergelere uyar. Ancak üç önemli sınırlama vardır:

  • Uyum isteğe bağlıdır. Bir yönerge yalnızca bot onu okuyup uyarsa çalışır. Bazı tarayıcılar robots.txt’i tarihsel olarak görmezden gelmiştir ve sahte bir kullanıcı aracısı herhangi biri olduğunu iddia edebilir, bu nedenle dosya bir normdur, garanti değil.
  • Gerçek zamanlı ajan getirmeleri gri bir alandır. Bir kişi ChatGPT veya Perplexity’den belirli bir URL’yi özetlemesini istediğinde araç, o sayfayı kullanıcı adına getirir. Sağlayıcılar bunu çoğu zaman tarama yerine kullanıcı yönlendirmeli erişim olarak değerlendirir; dolayısıyla robots.txt eğitim/tarama kuralları site sahiplerinin beklediği şekilde geçerli olmayabilir.
  • CDN katmanı sizi geçersiz kılabilir. Cloudflare’in ağı üzerine yapılan araştırma, sitelerin anlamlı bir bölümünün robots.txt dosyaları “allow” derken büyük AI tarayıcılarını CDN’de kazara engellediğini ortaya koydu. İki katmanın birbiriyle uyumlu olması gerekir.

robots.txt’in ötesinde: llms.txt, ai.txt ve tarama başına ödeme

robots.txt erişimi düzenler; daha yeni bir dosya olan llms.txt ise gezinmeyi düzenler ve AI sistemlerini en yüksek değerli, en temiz içeriğinize yönlendirir. Benimsenme hâlâ erken aşamada (alan adlarının kabaca %10’u), ancak düşük riskli bir sinyaldir. Buna ek olarak CDN’ler de devreye girdi: Cloudflare, AI tarayıcılarını tek tıklamayla engelleme ve yayıncıların AI şirketlerinden erişim için ücret almasını sağlayan bir tarama başına ödeme modeli sunuyor. Bu, tartışmayı “izin ver/engelle” yaklaşımından “lisansla” yaklaşımına taşıyor. 2026 için sonuç şudur: robots.txt artık llms.txt, CDN kontrolleri ve gelişmekte olan ticari koşulları da içeren bir yığındaki katmanlardan biridir.


Web scraping yapıyorsanız bunun anlamı

Herkese açık web verisi topluyorsanız robots.txt’i etrafından dolaşılacak bir engel olarak değil, mesleki bir norm olarak ele alın. Savunulabilir ve sürdürülebilir yaklaşım şöyledir:

  • robots.txt’i okuyun ve ona uyun; temas ettiğiniz yollar için bunu yapın ve tanımlanmışsa crawl-delay’e uyun. Bu, iyi niyetli ve etik veri toplamanın temelidir.
  • Herkese açık, salt okunur verileri toplayın; oturum açma işlemlerini aşmayın veya kişisel verileri scraping yapmayın ve hedef siteyi olumsuz etkilememek için makul hızlarda kalın. (Hukuki çerçeve için web scraping yasal mı yazısına bakın.)
  • Etik biçimde tedarik edilmiş proxy’ler kullanın. Meşru veri toplama, kötüye kullanılan trafiği gizleyen ağlardan değil, temiz, rızası alınmış residential IP’lerden ve makul döngüden geçer. Bu nedenle web scraping için proxy’lerin ne olduğu ve nasıl tedarik edildiği önemlidir.

robots.txt’in “yalnızca bir talep” olması, onu görmezden gelme izni vermez. Agresif scraping’in pratik riskleri arasında IP engellemeleri, CDN kontrolleri, itibar ve sözleşme kaynaklı sorunlar bulunur; iyi uygulamalar bunların tümünü önler.

Bir site işletiyorsanız bunun anlamı

Bilinçli bir karar verin, ardından robots.txt ile CDN’nizin uyumlu olmasını sağlayın:

  • AI arama görünürlüğü mü istiyorsunuz? Arama/yanıt ajanlarına (OAI-SearchBot, Claude-SearchBot, PerplexityBot) izin verin; böylece alıntılanmaya uygun kalırsınız. AI yönlendirmeli ziyaretçiler hızla büyüyen ve yüksek niyetli bir kanaldır.
  • Eğitimi beslemek istemiyor musunuz? Arama ajanlarına izin verirken eğitim tarayıcılarını (GPTBot, Google-Extended, ClaudeBot) engelleyin.
  • Her iki katmanı da doğrulayın. CDN’nizin robots.txt’inizin amaçladığı şeyleri sessizce engellemediğini veya açığa çıkarmadığını kontrol edin ve ajanları en iyi sayfalarınıza yönlendirmek için bir llms.txt düşünün.
  • Ajanların gerçekte ne gördüğünü test edin. AI yanıtları ve taramaları coğrafi konuma göre kişiselleştirildiğinden, sitenizi ve AI görünürlüğünü farklı ülkelerdeki IP’lerden (residential proxy’ler aracılığıyla) kontrol etmek, yalnızca kendi bulunduğunuz yerden gördüğünüz değil gerçek tabloyu gösterir.

SSS

robots.txt hukuken bağlayıcı mıdır?

Hayır. robots.txt (RFC 9309 olarak standartlaştırılmıştır), kurallara uyan tarayıcıların dikkate aldığı gönüllü bir taleptir. Tek başına hukuki güç taşımaz ve erişimi teknik olarak engellemez; gerçek uygulama sunucuda veya CDN’de gerçekleşir.

AI’ın sitemden alıntı yapmasına izin verip onu eğitmek için kullanılmasını engelleyebilir miyim?

Evet. Sağlayıcılar artık eğitim ve arama tarayıcılarını ayırıyor. Böylece eğitim ajanlarını (GPTBot, Google-Extended, ClaudeBot) engellerken, sizi AI yanıtlarındaki alıntılara uygun kılan arama ajanlarına (OAI-SearchBot, Claude-SearchBot, PerplexityBot) izin verebilirsiniz.

AI tarayıcıları robots.txt’i gerçekten takip ediyor mu?

Büyük ve belgelenmiş tarayıcılar (Googlebot, GPTBot, ClaudeBot, PerplexityBot) genellikle takip eder; bunu sunucu günlüklerinde doğrulayabilirsiniz. Ancak uyum isteğe bağlıdır, kullanıcının tetiklediği gerçek zamanlı getirmeler gri bir alandır ve sahte kullanıcı aracıları vardır. Dolayısıyla bu bir normdur, garanti değil.

llms.txt nedir ve buna ihtiyacım var mı?

llms.txt, AI sistemlerini en değerli içeriğinize yönlendiren daha yeni bir dosyadır. robots.txt erişimi, llms.txt ise gezinmeyi düzenler. Benimsenme hâlâ erken aşamada (alan adlarının yaklaşık %10’u), ancak eklemeye değer, az çaba gerektiren ve düşük riskli bir sinyaldir.

Web scraping yaparken robots.txt’e uymak önemli mi?

Evet. Hukuken bağlayıcı olmasa da robots.txt’e ve crawl-delay’e uymak, etik ve sürdürülebilir scraping’in temelidir. Sizi savunulabilir sınırlar içinde tutar; engellemeleri, CDN kontrollerini ve itibar riskini önler.


Herkese açık web verilerini doğru şekilde toplayın

İster bir AI veri işlem hattı oluşturuyor ister AI’ın markanızı nasıl temsil ettiğini izliyor olun, etik veri toplama site sinyallerine uymakla ve temiz, rızası alınmış IP’ler kullanmakla başlar. $1/GB’den etik biçimde tedarik edilmiş residential proxy’ler edinin. Kullandıkça ödeyin, 190’dan fazla ülkeye erişin ve sorumlu biçimde test etmek ve veri toplamak için coğrafi konum kontrolünü kullanın.

Share article: