İçeriğe geç
Approvalens

Okuma odası · 5 dk okuma

robots.txt ile Yapay Zekâ Botlarına İzin Verme (ChatGPT, Claude, Perplexity)

OpenAI, Anthropic, Perplexity, Google ve Apple botlarının robots.txt adları; yapay zekâ aramasına açık kalıp eğitimi engellemek ve seni gizleyen hatalar.

Approvalens ekibi

Şu rapor bulgularını düzeltir

  • Yapay zekâ arama botlarına robots.txt izni
  • robots.txt'te yapay zekâ eğitim botları
  • Site haritasındaki sayfalar yapay zekâ botlarına açık

Yapay zekâ asistanlarının sayfalarını bulup kaynak göstermesini istiyorsan, robots.txt dosyan onların arama botlarını engellememeli: OAI-SearchBot (ChatGPT araması), Claude-SearchBot (Claude), PerplexityBot (Perplexity) ve Google'ın yapay zekâ özellikleri için doğrudan Googlebot. GPTBot, ClaudeBot, CCBot gibi eğitim botları ve Google-Extended, Applebot-Extended belirteçleri ayrı anahtarlar. Bunları engelleyip yapay zekâ aramasında görünmeye devam edebilirsin; aşağıdaki şirketlerin hepsi arama ile eğitimi birbirinden bağımsız ayarlar olarak belgeliyor.

Bilmen gereken bot adları

Her şirket User-agent: satırına yazılacak adı kendi belgesinde yayımlıyor. Tablodaki adlar bu sayfanın tarihinde o belgelerden kontrol edildi.

Ad Şirket Neyi kontrol eder Kaynak
OAI-SearchBot OpenAI Sayfalarının ChatGPT arama cevaplarında gösterilip gösterilmeyeceğini OpenAI botları
GPTBot OpenAI İçeriğin OpenAI'nin temel modellerini eğitmekte kullanılıp kullanılmayacağını aynı
ChatGPT-User OpenAI Bir ChatGPT kullanıcısı istediğinde yapılan ziyaretleri; OpenAI'ye göre robots.txt kuralları bunlara uygulanmayabilir aynı
Claude-SearchBot Anthropic Claude'un arama sonuçları için dizine eklemeyi Anthropic botları
ClaudeBot Anthropic Model eğitiminde kullanılabilecek içerik toplamayı aynı
Claude-User Anthropic Bir Claude kullanıcısı soru sorduğunda yapılan ziyaretleri aynı
PerplexityBot Perplexity Siteleri Perplexity aramasında göstermeyi ve linklemeyi; Perplexity'ye göre temel model eğitimi için kullanılmıyor Perplexity botları
Perplexity-User Perplexity Kullanıcı isteğiyle yapılan ziyaretleri; Perplexity'ye göre robots.txt kurallarını genellikle yok sayıyor aynı
Googlebot Google Google Arama'yı, AI Overviews (Yapay Zekâ Genel Bakışları) ve AI Mode dahil Yapay zekâ özellikleri ve siten
Google-Extended Google İçeriğin Gemini eğitimi ve grounding için kullanımını; ayrı bir tarayıcı değil Google'ın genel tarayıcıları
Applebot-Extended Apple Applebot verisinin Apple'ın temel modellerini eğitmekte kullanımını; kendisi tarama yapmıyor Applebot hakkında
CCBot Common Crawl Common Crawl'ın açık web arşivini CCBot

Adlar büyük-küçük harf duyarsız eşleşiyor (RFC 9309); gptbot ile GPTBot aynı grup. Önemli olan yazım: Claude-SearchBot çalışır, Claude Search Bot çalışmaz.

Yapay zekâ aramasına izin ver, eğitimi engelle

İçerik sitelerinin çoğunun istediği kurulum bu: yapay zekâ cevaplarında kaynak gösterilmek, içeriği eğitim verisine vermemek.

# Yapay zekâ araması ve asistanlar: izinli
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Allow: /

# Yapay zekâ eğitimi: izinsiz
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /

# Diğer herkes
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://ornek.com/sitemap.xml

Bir grup birden fazla User-agent: satırıyla başlayabiliyor; altındaki kurallar hepsine uygulanıyor (RFC 9309, bölüm 2.1). OpenAI de bu ayrımın çalıştığını açıkça yazıyor: arama sonuçlarında görünmek için OAI-SearchBot'a izin verip GPTBot'u engelleyebilirsin. Perplexity ve Amazon da botlarını birbirinden bağımsız ayarlar olarak tanımlıyor.

Arama grubundaki Allow: / satırları, bu botları başka bir şey engellemiyorsa şart değil. Ama niyetini belgeliyor ve biri ileride geniş bir engel eklerse seni koruyor.

Her şeye izin ver

İçeriğinin hem arama hem eğitim için kullanılmasında sorun görmüyorsan, en kısa doğru robots.txt hiçbir yapay zekâ botunun adını anmıyor:

User-agent: *
Disallow: /wp-admin/

Sitemap: https://ornek.com/sitemap.xml

Kendi grubu olmayan her bot * grubuna düşüyor. Sorun, * grubu kısıtlayıcı olduğunda başlıyor; yapay zekâ botları da onu miras alıyor. Test sitesinden kalan bir User-agent: * + Disallow: /, seni bütün yapay zekâ arama botlarından aynı anda gizliyor. Düşme kurallarının ayrıntısı robots.txt öncelik rehberinde.

Seni yapay zekâ aramasından gizleyen hatalar

Hata Etkisi Çözüm
İçinde OAI-SearchBot ya da PerplexityBot olan hazır bir "tüm yapay zekâ botlarını engelle" listesini kopyalamak ChatGPT aramasından ya da Perplexity cevaplarından çıkarsın. OpenAI'ye göre OAI-SearchBot'u engelleyen siteler ChatGPT arama cevaplarında gösterilmiyor, yalnızca gezinme linki olarak çıkabiliyor Arama botlarını engel listesinden çıkar
GPTBot'u engelleyince ChatGPT aramasından çıkacağını sanmak Çıkmazsın; GPTBot yalnızca eğitim için Arama için OAI-SearchBot kullan
İçeriği Gemini'den uzak tutmak için Googlebot'u engellemek Google Arama'dan, AI Overviews dahil, çıkarsın Gemini eğitimi ve grounding için Google-Extended kullan
User-agent: * altında Disallow: / Kendi grubu olmayan her yapay zekâ botu engellenir Canlı siteden kaldır
/sitemap.xml ya da bulunduğu klasörü engellemek Botlar adreslerini oradan bulamaz Site haritası yolunu arama botlarına açık bırak
robots.txt'nin 5xx hatası dönmesi RFC 9309'a göre bot bu durumda tüm sitenin yasak olduğunu varsaymak zorunda Her zaman 200 dönen statik bir dosya sun
Botu robots.txt yerine güvenlik duvarında IP ile engellemek Anthropic, IP engelinin robots.txt'yi okumasını engellediği için tercih bildirme yolu olarak düzgün çalışmayabileceğini söylüyor Tercih için robots.txt, kötüye kullanım için güvenlik duvarı

robots.txt önbellekte de tutuluyor. OpenAI arama sistemlerinin değişikliği görmesinin yaklaşık 24 saat sürebileceğini, Perplexity 24 saate kadar sürebileceğini söylüyor; Amazon 30 güne kadar eski bir kopya kullanabiliyor (Amazonbot). Bir değişikliği bir saat sonra değerlendirme.

robots.txt hikâyenin tamamı değil

İstek sunucuna hiç ulaşmıyorsa kusursuz bir robots.txt da işe yaramıyor. Cloudflare, Vercel, Netlify ve birçok güvenlik eklentisi, robots.txt'ye bakılmadan önce yapay zekâ kullanıcı aracılarını güvenlik duvarında engelleyebiliyor. robots.txt açık olduğu hâlde yapay zekâ araçları sayfalarını okuyamıyorsa Cloudflare yapay zekâ bot ayarlarına ve diğer sunucu ve eklenti kurallarına bak. Ana metninin JavaScript'le sonradan eklenmeyip HTML'de olduğunu da kontrol et: JavaScript içerik ve yapay zekâ botları.

Yapay zekâ botları ve AdSense ayrı konular

Bu adların hiçbiri AdSense botu değil. AdSense, yalnızca kendi adını doğrudan anan gruplara uyan Mediapartners-Google botunu kullanıyor. GPTBot, ClaudeBot ya da Google-Extended'a izin vermek veya onları engellemek AdSense'in neyi tarayabildiğini değiştirmiyor. AdSense tarafı robots.txt ve AdSense rehberinde, artılar ve eksiler yapay zekâ botlarını engellemeli miyim rehberinde.

robots.txt'ni yapay zekâ botları için kontrol et

Ücretsiz yapay zekâ bot kontrolü, robots.txt dosyanı her yapay zekâ botunun okuyacağı gibi okuyor; hangi arama ve eğitim botlarının izinli ya da engelli olduğunu gösteriyor ve sayfanı onların kullanıcı aracılarıyla istiyor. Bu istekler OpenAI'nin ya da Anthropic'in IP aralıklarından değil, bizim sunucumuzdan gidiyor; yani IP ile bot doğrulayan bir güvenlik duvarı gerçek bota farklı davranabilir. Temiz sonucu güçlü bir işaret say, kanıt değil. Aynı dosyanın AdSense tarafı için robots.txt test aracını kullan ya da ücretsiz taramayı başlat.

Sık sorulan sorular

İzin vermek için her yapay zekâ botunu tek tek yazmam gerekir mi?

Hayır. Kendi grubu olmayan bot User-agent: * grubuna uyuyor. Adıyla grup yalnızca bir botun diğerlerinden farklı davranmasını istediğinde gerekiyor.

GPTBot'u engellersem sitem ChatGPT'den çıkar mı?

ChatGPT aramasından çıkmaz. OpenAI, GPTBot'u eğitim botu, OAI-SearchBot'u arama botu olarak tanımlıyor ve ayarların bağımsız olduğunu söylüyor.

robots.txt ChatGPT-User, Claude-User ya da Perplexity-User'ı durdurur mu?

En fazla kısmen. OpenAI, kullanıcının başlattığı ChatGPT-User ziyaretlerine robots.txt'nin uygulanmayabileceğini; Perplexity, Perplexity-User'ın robots.txt kurallarını genellikle yok saydığını söylüyor. Anthropic ise Claude-User'ı kapatmanın, kullanıcı sorularında içeriğinin alınmasını engellediğini söylüyor.

Yapay zekâ aramasına izin verip tüm eğitimi engelleyen tek bir satır var mı?

Yok. Eğitimden çıkma her şirket için ayrı, o yüzden her adı yazıyorsun. Cloudflare'in yönetilen robots.txt'si bir de Content-signal: search=yes, ai-train=no satırı ekliyor; ama bu Cloudflare'in kendi sinyali, her botun okuduğu bir standart değil.

Eskimiş ya da yanlış bir şey mi gördün? Bize yaz, düzeltelim.

Bu rehberi İngilizce oku →

Kendi sitende kontrol et. Ücretsiz, kayıt yok.

Bunun için ücretsiz araçlar

Ücretsiz tarama

Kendi siteni kontrol et

Ücretsiz tarama: uygunluk puanı ve tüm sorunlar, genelde birkaç dakikada.

Ücretsiz tarama · puan ve bulunan tüm sorunlar · üyelik yok

Tüm rehberler →