YazılarRehber
AI botları için robots.txt: kime izin verilir
Rues tarafından · Yayın: · Güncelleme:
Bir AI şirketinin siteye gönderdiği bot artık tek değil. Biri arama dizini kurar, biri eğitim verisi toplar, biri de kullanıcı soru sorduğunda sayfayı o an açar. robots.txt'te her birine ayrı ayrı izin verilebilir ya da kapı kapatılabilir. Bu rehberde bugün önemli olan botları, sahiplerinin belgelerinde yazdığı işleriyle ve sık verilen üç karar için yazacağımız robots.txt örnekleriyle topladık.
Hangi AI botu ne iş yapar?
Tablo yalnız şirketlerin kendi belgelerine dayanıyor (7 Ekim 2026'da okundu). Belgede yazmayan bir şey için "yazmıyor" dedik.
| Şirket | robots.txt adı | İşi | robots.txt'e uyar mı? |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Siteleri ChatGPT arama sonuçlarında gösterir | Evet; OpenAI'ye göre değişiklik yaklaşık 24 saatte yansır |
| OpenAI | GPTBot | Temel modellerin eğitiminde kullanılabilecek içeriği tarar | Evet; engellemek eğitimden çıkmak demek |
| OpenAI | ChatGPT-User | ChatGPT'de kullanıcının başlattığı işlerde sayfayı açar | OpenAI: "robots.txt kuralları geçerli olmayabilir" |
| Anthropic | Claude-SearchBot | Arama sonuçlarını iyileştirmek için içeriği dizine alır | Evet |
| Anthropic | ClaudeBot | Eğitimde kullanılabilecek içeriği toplar | Evet |
| Anthropic | Claude-User | Kullanıcı Claude'a soru sorunca sayfayı açar | Evet |
| Perplexity | PerplexityBot | Siteleri Perplexity aramasında gösterir ve bağlantı verir; eğitimde kullanılmaz | Evet; Perplexity robots.txt ile yönetildiğini yazıyor ve izin vermeyi öneriyor |
| Perplexity | Perplexity-User | Kullanıcının sorusunu cevaplamak için sayfayı ziyaret eder | Perplexity: "genelde robots.txt kurallarını yok sayar" |
Googlebot | Google Arama'nın ana tarayıcısı | Evet | |
Google-Extended | İçeriğin Gemini eğitiminde ve grounding'de kullanımını yönetir | Yalnız robots.txt adı; ayrı bir tarayıcısı yok |
OpenAI bu ayarların birbirinden bağımsız olduğunu yazıyor: OAI-SearchBot'a izin verip GPTBot'u kapatabilirsiniz. Anthropic de üç botunu ayrı işler ve ayrı adlarla anlatıyor. Claude-SearchBot kapatılırsa içerik arama için dizine alınmıyor; Claude-User kapatılırsa Claude, kullanıcı sorduğunda sayfanızı açamıyor.
Arama botu ile eğitim botu arasındaki fark ne?
Arama botu, sayfanızın bir AI cevabında bağlantısıyla birlikte görünüp görünemeyeceğini belirler. Eğitim botu ise ileride bir modelin öğreneceği veriye girebilecek sayfaları toplar. Birincisi bugün kaynak gösterilip gösterilmeyeceğinizi etkiler. İkincisi içeriğinizin nasıl kullanılacağına dair bir tercihtir.
Google-Extended ayrıca anlatılmalı. Google'a göre bu adın kendine ait bir user agent'ı yok. Google her zamanki tarayıcılarıyla gezer; robots.txt'teki bu satır yalnız içeriğin Gemini eğitiminde ve Gemini Apps ile Vertex AI'daki grounding'de (modelin cevap anında arama dizininden içerik alması) kullanılıp kullanılmayacağını söyler. Google, Google-Extended'ın sitenin Google Arama'ya girmesini etkilemediğini ve sıralama sinyali olmadığını da yazıyor. Aynı sayfa AI Özeti'nden ya da AI Mode'dan söz etmiyor; biz de bu konuda bir şey iddia etmiyoruz.
Kullanıcı isteğiyle gelen botlar ne yapar?
ChatGPT-User, Claude-User ve Perplexity-User sitenize biri soru sorduğu için gelir. OpenAI, ChatGPT-User için robots.txt kurallarının "geçerli olmayabileceğini" yazıyor. Perplexity, Perplexity-User'ın robots.txt'i "genelde yok saydığını" söylüyor. Anthropic ise botlarının, Claude-User dahil, robots.txt'e uyduğunu belirtiyor.
Bu yüzden robots.txt bu ziyaretlerin hepsini durdurmaz. Gizli kalması gereken sayfa giriş ekranının arkasında olmalı.
Tuzak: bota kendi satırını açınca genel yasak düşer
Bir tarayıcı robots.txt'te tek bir kural grubuna uyar. Google'ın belgesine göre tarayıcı, kendi adına en çok uyan grubu seçer; özel gruplar ile * grubu birleştirilmez. robots.txt standardı RFC 9309 da aynı şeyi söyler: * grubu yalnız tarayıcıya uyan başka grup yoksa geçerlidir.
Bu dosya yönetim panelini GPTBot'a açar:
User-agent: *
Disallow: /panel/
User-agent: GPTBot
Allow: /
GPTBot artık yalnız kendi grubunu okur; Disallow: /panel/ onun için yok hükmündedir. Ortak kuralları her özel grupta tekrar yazın ya da birkaç user agent'ı aynı kuralların üstüne alt alta dizin.
Üç karar için örnek robots.txt
1. Arama da eğitim de açık. ruesandora.com için 7 Ekim 2026'da bunu seçtik: eğitim botları dahil bütün tarayıcılara izin var. Sitemizde gizli alan olmadığı için dosyamız yalnız User-agent: *, Allow: / ve site haritası satırından oluşuyor. Yönetim paneli olan bir sitede şöyle olur:
User-agent: *
Disallow: /panel/
Sitemap: https://example.com/sitemap.xml
2. Arama açık, eğitim kapalı. Arama botları ve Googlebot * grubuna düşer, eğitim botlarına ayrı grup yazılır.
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
Disallow: /
User-agent: *
Disallow: /panel/
Sitemap: https://example.com/sitemap.xml
3. AI araması ve eğitim kapalı, Google Arama açık.
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
User-agent: Google-Extended
Disallow: /
User-agent: *
Disallow: /panel/
Üçüncü dosya, yukarıda anlattığımız nedenle ChatGPT-User ve Perplexity-User'ı durdurmaz. Üstelik sizi bu şirketlerin AI aramasından da çıkarır; orada kaynak olarak anılmazsınız.
Değişiklik hemen yansımaz. OpenAI arama için yaklaşık 24 saat, Perplexity en fazla 24 saat diyor; RFC 9309 da tarayıcıların önbellekteki robots.txt'i 24 saatten uzun kullanmamasını istiyor.
robots.txt neden her şeyi anlatmaz?
robots.txt bir ricadır. Cloudflare bunu kendi belgesinde açıkça yazıyor: robots.txt tarayıcının içeriğe teknik olarak erişmesini engellemez. Tersi de geçerli. CDN, robots.txt'te izin verdiğiniz bir botu kapıda durdurabilir; bot dosyanıza hiç ulaşmaz.
Cloudflare'de bakılacak üç yer var:
- AI Crawl Control. Her AI tarayıcısına ayrı izin ya da engel verilir. Engel, alan adınızda bir WAF özel kuralı oluşturur; engellenen tarayıcı
403 Forbiddenya da402 Payment Requiredcevabı alır. - Yönetilen robots.txt. Açıksa Cloudflare kendi kurallarını sizin dosyanızın önüne ekler ve ikisini tek dosya olarak sunar. Bu kurallar
GPTBot,ClaudeBot,Google-Extendedve birkaç başka botu kapatır. Yani botların okuduğu dosya, repodaki dosyanızdan farklı olabilir. - AI bot politikaları ve yeni varsayılanlar. Cloudflare eski "Block AI bots" ayarını 15 Eylül 2026'da kaldırdı. O tarihten beri açılan alan adlarında varsayılan şu: Training ya da Agent sınıfındaki botlar reklam gösteren sayfalarda engellenir, Search sınıfı açık kalır.
Kendi bilgisayarınızdan sahte bir user agent ile atılan istek, gerçek botun yayınlanmış IP aralıklarından gelirken ne cevap aldığını göstermez. OpenAI, Anthropic ve Perplexity botlarının IP listelerini yayımlıyor.
Kısa kontrol listesi
- Önce kararı yazın: arama açık mı, eğitim açık mı?
- robots.txt gruplarını bu karara göre yazın; ortak
Disallowsatırlarını her özel grupta tekrarlayın. - Tarayıcıda
https://siteniz.com/robots.txtadresini açın ve gerçekte sunulan dosyayı okuyun. - CDN'in bot ayarlarına bakın; yönetilen robots.txt ve varsayılan politikalar dahil.
- Birkaç gün sonra sunucu ya da CDN kayıtlarında izin verdiğiniz botların gelip gelmediğine bakın.
Bot ayarlarınıza ikinci bir göz isterseniz bize yazabilirsiniz.
Kaynaklar
- OpenAI, tarayıcı belgesi: developers.openai.com/api/docs/bots
- Anthropic, web taraması ve botu engelleme: support.claude.com
- OpenAI bot IP listeleri: openai.com/searchbot.json, openai.com/gptbot.json, openai.com/chatgpt-user.json
- Anthropic bot IP listesi: claude.com/crawling/bots.json
- Perplexity, tarayıcı belgesi: docs.perplexity.ai/guides/bots
- Google, genel tarayıcılar (Googlebot, Google-Extended): developers.google.com
- Google, robots.txt'in yorumlanışı: developers.google.com
- IETF, RFC 9309 Robots Exclusion Protocol: rfc-editor.org/rfc/rfc9309
- Cloudflare, AI Crawl Control, AI tarayıcılarını yönetme: developers.cloudflare.com
- Cloudflare, yönetilen robots.txt: developers.cloudflare.com
- Cloudflare, Block AI bots ve AI bot politikaları: developers.cloudflare.com