Yapay zekâ botu nedir, robots.txt ile ilişkisi ne?
- Yapay zekâ botu (AI crawler)
- Bir yapay zekâ şirketinin web sayfalarını okumak için çalıştırdığı otomatik tarayıcıdır. Amacına göre üç türe ayrılır: model eğitimi için toplama, arama dizini kurma ve kullanıcı isteğiyle anlık sayfa getirme.
- robots.txt
- Sitenin kök dizininde duran düz metin dosyasıdır. Hangi botun (User-agent) hangi yollara girebileceğini Allow ve Disallow satırlarıyla bildirir. Bağlayıcı bir yasa değil, saygın botların uyduğu bir protokoldür.
robots.txt'te adı geçmeyen bot, genel kural (User-agent: *) ile yönetilir. Sorun şu: birçok güvenlik eklentisi ve şablon, genel kuralı kısıtlar ya da “bilinmeyen botları” engeller. Yapay zekâ botları yenidir ve bu listelerde çoğunlukla engelli tarafta kalır.
Yapay zekâ aramasında görünmenin ilk şartı, aracın botunun siteyi okuyabilmesidir; okunmayan site önerilemez. Bu yüzden bot izinleri, içerik ve yapısal veri çalışmasından önce gelir. Bütünü Yapay Zekâ Aramasında Görünmek rehberinde anlatıyoruz.
Hangi yapay zekâ botları var, ne yapar?
| User-agent | Şirket | Amaç |
|---|---|---|
| GPTBot | OpenAI | Model eğitimi için içerik toplama |
| OAI-SearchBot | OpenAI | ChatGPT arama dizini; arama sonuçlarında görünmek için gerekli |
| ChatGPT-User | OpenAI | Kullanıcı ChatGPT'de bir sayfa istediğinde anlık getirme |
| ClaudeBot | Anthropic | Tarama ve model eğitimi; güncel ana bot |
| Claude-Web / anthropic-ai | Anthropic | Eski kullanıcı aracı adları; geriye dönük uyumluluk için listelenir |
| PerplexityBot | Perplexity | Perplexity arama dizini |
| Perplexity-User | Perplexity | Kullanıcı sorusu üzerine anlık sayfa getirme |
| Google-Extended | Gemini eğitimi ve bağlantılı kullanım kontrolü; Googlebot'tan ayrı | |
| Applebot-Extended | Apple | Apple Intelligence modelleri için eğitim kontrolü; Applebot'tan ayrı |
| CCBot | Common Crawl | Açık web arşivi; birçok modelin eğitim verisi buradan türetilir |
| Bytespider | ByteDance | TikTok sahibinin modelleri için toplama |
| meta-externalagent | Meta | Meta modelleri için eğitim verisi toplama |
| Amazonbot | Amazon | Alexa ve Amazon servisleri için tarama |
| DuckAssistBot | DuckDuckGo | DuckAssist yapay zekâ cevapları için kaynak getirme |
| MistralAI-User | Mistral | Le Chat kullanıcı istekleri için anlık sayfa getirme |
Üç tür birbirinden ayrı düşünülmelidir. Arama botları (OAI-SearchBot, PerplexityBot) engellenirse firma o araçta hiç görünmez. Kullanıcı tetikli botlar (ChatGPT-User, Perplexity-User, MistralAI-User) engellenirse kullanıcı sitenizi araca verdiğinde araç okuyamaz. Eğitim botları (GPTBot, ClaudeBot, CCBot, Google-Extended) engellenirse bugünkü arama etkilenmez, ama gelecek modeller firmayı öğrenmez.
Google-Extended ile Googlebot arasındaki fark nedir?
Googlebot, Google aramasının tarayıcısıdır; dizin, klasik sonuçlar, AI Bakışı ve AI Mode onunla çalışır. Google-Extended ise ayrı bir bot değil, robots.txt'te tanınan bir kontrol belirtecidir: Gemini modellerinin eğitiminde ve bağlantılı üretimde sitenin içeriğinin kullanılıp kullanılmayacağını belirler.
Google-Extended'ı engellemek sizi Google aramasından ya da AI Bakışı'ndan çıkarmaz; yalnızca Gemini'nin eğitim ve bağlantılı kullanımını kapatır. AI Bakışı'nda görünmeyi sınırlamak isteyen site, bunu nosnippet ve max-snippet gibi snippet kontrolleriyle yapar. Ayrıntı için Google AI Overview rehberine bakabilirsiniz.
Applebot ve Applebot-Extended için mantık aynıdır: Applebot Siri ve Spotlight aramasını besler, Applebot-Extended ise Apple'ın model eğitimi için kontrol sağlar. CCBot ise farklı bir konumdadır: Common Crawl'un açık arşivini kurar ve bu arşiv, birçok yapay zekâ modelinin eğitim verisinde kaynak olarak kullanılır. CCBot'u engellemek bugünkü aramayı etkilemez; geleceğin modellerini etkiler.
Örnek robots.txt nasıl görünür?
Bir hizmet işletmesi için tipik dosya, yapay zekâ botlarına açıkça izin verir ve yalnızca gerçekten gizli kalması gereken yolları kapatır. Her bot için ayrı blok yazmak, genel kuralın eklenti tarafından değiştirilmesine karşı güvence sağlar.
- User-agent: * → Allow: / → Disallow: /admin/ (genel kural; yalnızca gizli yollar kapalı)
- User-agent: GPTBot → Allow: /
- User-agent: OAI-SearchBot → Allow: /
- User-agent: ChatGPT-User → Allow: /
- User-agent: ClaudeBot → Allow: /
- User-agent: PerplexityBot → Allow: /
- User-agent: Perplexity-User → Allow: /
- User-agent: Google-Extended → Allow: /
- User-agent: Applebot-Extended → Allow: /
- User-agent: CCBot → Allow: /
- Aynı kalıpla: Claude-Web, anthropic-ai, Bytespider, meta-externalagent, Amazonbot, DuckAssistBot, MistralAI-User
- Sitemap: https://site.com/sitemap.xml (dosyanın sonunda)
Dosyayı yazmak yetmez; botun gerçekten geçtiğini doğrulamak gerekir. Üç kontrol yapılmalıdır: Google Search Console'daki robots.txt raporu, CDN ya da güvenlik panelindeki bot kuralları ve sunucu erişim günlüklerinde bot adlarının görünüp görünmediği. Özellikle bazı CDN sağlayıcıları yapay zekâ botlarını panelden varsayılan olarak engelleyebilir; robots.txt açık olsa bile istek sunucuya ulaşmaz.
Bot geçtikten sonra siteyi araçlara tanıtmanın yolu llms.txt'dir; bkz. llms.txt nedir. İçeriğin botun okuyabildiği HTML'de olması da ayrı bir şarttır; yapay zekâ botlarının çoğu JavaScript çalıştırmaz.
“Yapay zekâ içeriğimi çalıyor” itirazı haklı mı?
Kısmen haklıdır ve ciddiye alınmalıdır. Eğitim botları içeriği alır, model onu öğrenir ve kullanıcıya kaynak göstermeden cevap verebilir. Özgün araştırma, uzun dokümantasyon ya da abonelikle satılan içerik üreten bir yayıncı için bu gerçek bir kayıp olabilir. Bu yayıncıların eğitim botlarını engellemesi anlaşılır bir tercihtir.
Bir hizmet işletmesinin durumu farklıdır. Hizmet sitesindeki içerik, firmanın bulunması için yazılır; asıl ürün içerik değil hizmettir. Model firmayı öğrenirse, kullanıcı “bu bölgede bu hizmeti kim verir” diye sorduğunda firmayı önerebilir. Bu durumda içeriğin modele girmesi kayıp değil, görünürlüktür.
Orta yol mümkündür: arama ve kullanıcı tetikli botlara (OAI-SearchBot, ChatGPT-User, PerplexityBot, Perplexity-User) izin verip yalnızca saf eğitim botlarını (GPTBot, CCBot, Bytespider) kısıtlamak. Böylece bugünkü görünürlük korunur, içerik toptan eğitim havuzuna girmez. Bu seçim işletmenin türüne göre verilmelidir; tek doğru cevap yoktur.
Yapay zekâ botlarını engellemenin maliyeti nedir?
- 1Arama botu engeli: firma o araçta hiç görünmez. ChatGPT araması, Perplexity ve DuckAssist için bu doğrudan kayıptır; rakip önerilir, siz önerilmezsiniz.
- 2Kullanıcı tetikli bot engeli: kullanıcı sitenizin adresini araca verdiğinde araç “erişemiyorum” der. Bu, satın alma anında güven kaybıdır.
- 3Eğitim botu engeli: bugün görünür bir kayıp yoktur; ancak gelecek model sürümleri firmayı, sektördeki yerini ve hizmetlerini öğrenmemiş olur. Maliyet ertelenmiştir, sıfır değildir.
- 4Yanlış yapılandırma maliyeti: genel kuralla tüm botları engellemek, Googlebot ve Bingbot'u da kapsayabilir. Bu, klasik arama görünürlüğünü de bitirir ve en sık rastlanan kazadır.
Karar kişisel bir tercih olsa da bilinçli verilmelidir. “robots.txt'e hiç bakmadım” cevabı, aslında bir güvenlik eklentisinin verdiği kararı kabul etmek demektir. Firmanız yapay zekâ araçlarında önerilmiyorsa ilk kontrol burasıdır; tanı listesi için ChatGPT firmamı neden önermiyor rehberine bakın.
Bot izinleri, SEO / GEO / AEO hizmetinin ilk adımıdır; diğer adımlar rehber merkezinde.
Sık sorulan sorular
robots.txt'te izin verdim, bot yine de gelmiyor; neden?
Üç yer kontrol edilmelidir. Birincisi CDN ya da güvenlik katmanı: bazı sağlayıcılar yapay zekâ botlarını panelden varsayılan olarak engeller ve istek sunucuya hiç ulaşmaz. İkincisi sunucu tarafı kurallar: .htaccess ya da WAF kuralları kullanıcı aracısına göre engelleyebilir. Üçüncüsü hız sınırı: çok agresif rate-limit, botun birkaç istekten sonra vazgeçmesine yol açar.
Tüm botlara izin vermek sunucuyu yorar mı?
Çoğu hizmet sitesi için hissedilir bir yük oluşturmaz; sayfa sayısı azdır ve botlar aralıklı gelir. Büyük, binlerce sayfalı sitelerde eğitim botları trafiği artırabilir. O durumda seçenek toptan engellemek değil, Crawl-delay desteği olan botlarda tarama hızını düşürmek ve gereksiz yolları (arama sonuç sayfaları, filtre kombinasyonları) Disallow ile kapatmaktır.
robots.txt'teki izin, botların uymasını garanti eder mi?
robots.txt tavsiye niteliğindedir; yasal bağlayıcılığı yoktur. Tabloda adı geçen büyük şirketlerin botları kurallara uyduklarını belgelerinde açıklar ve kullanıcı aracılarını doğrulanabilir IP aralıklarıyla yayımlar. Kurallara uymayan kötü niyetli tarayıcılar için çözüm robots.txt değil, sunucu ya da CDN seviyesinde engellemedir.
Eğitim botlarına izin verirsem içeriğim kaynak gösterilmeden kullanılır mı?
Olabilir; eğitim verisi olarak kullanılan içerik, modelin genel bilgisine karışır ve cevaplarda kaynak gösterilmeyebilir. Bu, arama botlarından farklıdır: arama ürünleri cevabın yanında kaynak bağlantısı gösterir. İçeriğinizin kendisi ürünse eğitim botlarını kısıtlamak mantıklıdır; hizmet satıyorsanız modelin firmayı öğrenmesi çoğunlukla lehinizedir.
Ana rehber
Yapay Zekâ Aramasında Görünmek
İlgili hizmet
SEO / GEO / AEO
İlgili rehberler
Bunu sizin siteniz için kuralım mı?
Kısa bir keşif görüşmesinde mevcut durumu birlikte bakar, ne gerektiğini yazılı söyleriz.