Claude ve Diğer AI Asistanlar Web İçeriğine Nasıl Erişir?

Yazar: Uğur DoğanYayın: 20 Ağu 2026Güncelleme: 20 Ağu 202620 dk Okuma

Yapay zeka asistanları web içeriklerine özel tarayıcı botları, API bağlantıları ve veri kazıma sistemleriyle erişim sağlar. Süreç, robots.txt kurallarıyla yönetilebilir.

Claude ve Diğer AI Asistanlar Web İçeriğine Nasıl Erişir? için öne çıkan görsel
Claude ve Diğer AI Asistanlar Web İçeriğine Nasıl Erişir? için öne çıkan görsel

Yapay zeka asistanları web içeriklerine özel tarayıcı botları, API bağlantıları ve veri kazıma sistemleriyle erişim sağlar. Süreç, robots.txt kurallarıyla yönetilebilir.

Claude ve Diğer AI Asistanlar Web İçeriğine Nasıl Erişir? sorusu, dijital varlıklarını korumak, arama motoru görünürlüğünü sürdürülebilir kılmak ve fikri mülkiyet haklarını yönetmek isteyen teknik karar vericiler ile işletme sahipleri için kritik bir operasyonel başlıktır. Büyük dil modelleri (LLM) ve üretken yapay zeka arama sistemleri; web sayfalarını model eğitimi için arşivlemek, kullanıcılara gerçek zamanlı cevap üretmek ve RAG (Retrieval-Augmented Generation) mimarilerini beslemek amacıyla farklı veri toplama protokolleri işletir. Bu rehber; ClaudeBot, GPTBot, Google-Extended ve PerplexityBot gibi botların çalışma prensiplerini, altyapı maliyetlerine etkilerini, robots.txt üzerinden erişim denetimini ve kurumsal içerik güvenliği stratejilerini tüm teknik boyutlarıyla ele almaktadır.

Yapay Zeka Botlarının Web Verilerine Erişim Mekanizmaları

Yapay zeka veri toplama mimarisi ve web bağlantı ağları illüstrasyonu
Yapay zeka asistanlarının web içeriklerine erişiminde kullanılan çok katmanlı veri transfer kanalları.

Büyük dil modellerinin web içeriklerini işleme yeteneği, geleneksel arama motoru indekslemesinden temelde farklı hedeflere ve teknik süreçlere dayanır. Geleneksel arama motorları (Googlebot, Bingbot vb.) web sayfalarını dizine ekleyip kullanıcıyı kaynak URL'ye yönlendirmeyi amaçlarken, yapay zeka sistemleri metinleri semantik vektörlere dönüştürmek, ağırlık parametrelerini güncellemek veya anlık sentez yaparak doğrudan cevap üretmek amacıyla tüketir. Bu ayrım, sunucu kaynak tüketiminden veri telifine kadar uzanan bir dizi teknik değişkeni beraberinde getirir.

AI botlarının veri toplama süreçleri temelde iki farklı zaman diliminde gerçekleşir: Çevrimdışı ön eğitim (pre-training) ve çıkarım anında canlı erişim (inference-time retrieval). Ön eğitim aşamasında milyarlarca sayfa taranarak devasa veri kümeleri (örneğin Common Crawl) oluşturulur. Canlı erişim aşamasında ise kullanıcının girdiği bir istem doğrultusunda ilgili web sayfasına milisaniyeler içinde HTTP GET isteği gönderilir, sayfa içeriği parse edilir ve RAG mimarisi üzerinden dil modelinin bağlam penceresine (context window) enjekte edilir.

Aşağıdaki mimari tablo, geleneksel arama tarayıcıları ile yapay zeka erişim sistemleri arasındaki temel yapısal farkları özetlemektedir:

KriterGeleneksel Arama Botları (Googlebot, Bingbot)Yapay Zeka Eğitim Botları (GPTBot, ClaudeBot)Canlı AI Arama Botları (PerplexityBot, OAI-SearchBot)
Temel AmaçSayfayı dizine eklemek ve arama sonucunda link listelemekLLM ağırlıklarını eğitmek için veri kümesi oluşturmakAnlık kullanıcı sorgusuna kaynak sentezleyerek yanıt vermek
Ziyaret SıklığıPeriyodik ve tarama bütçesine (crawl budget) dayalıGeniş zaman aralıklı, toplu (bulk) taramalarAnlık, kullanıcı sorgusuna bağlı tetiklemeli (On-demand)
Kullanıcı Trafiği YönlendirmeYüksek oranda organik yönlendirme (referral traffic)Doğrudan yönlendirme trafiği sıfırdırDüşük-orta düzeyde kaynak alıntı linki yönlendirmesi
Robots.txt UyumuW3C ve robots.txt standartlarına tam uyumÇoğunlukla uyumlu (Resmi duyurulan botlar)Çoğunlukla uyumlu, ancak istisnai proxy kullanımı görülebilir
JavaScript Yürütme (Rendering)Gelişmiş headless tarayıcılarla tam renderGenellikle yalnızca ham HTML ve metin ayrıştırmaDinamik sayfalarda headless browser, statik sayfalarda ham HTML

Temel Amaç

Geleneksel Arama Botları (Googlebot, Bingbot)

Sayfayı dizine eklemek ve arama sonucunda link listelemek

Yapay Zeka Eğitim Botları (GPTBot, ClaudeBot)

LLM ağırlıklarını eğitmek için veri kümesi oluşturmak

Canlı AI Arama Botları (PerplexityBot, OAI-SearchBot)

Anlık kullanıcı sorgusuna kaynak sentezleyerek yanıt vermek

Ziyaret Sıklığı

Geleneksel Arama Botları (Googlebot, Bingbot)

Periyodik ve tarama bütçesine (crawl budget) dayalı

Yapay Zeka Eğitim Botları (GPTBot, ClaudeBot)

Geniş zaman aralıklı, toplu (bulk) taramalar

Canlı AI Arama Botları (PerplexityBot, OAI-SearchBot)

Anlık, kullanıcı sorgusuna bağlı tetiklemeli (On-demand)

Kullanıcı Trafiği Yönlendirme

Geleneksel Arama Botları (Googlebot, Bingbot)

Yüksek oranda organik yönlendirme (referral traffic)

Yapay Zeka Eğitim Botları (GPTBot, ClaudeBot)

Doğrudan yönlendirme trafiği sıfırdır

Canlı AI Arama Botları (PerplexityBot, OAI-SearchBot)

Düşük-orta düzeyde kaynak alıntı linki yönlendirmesi

Robots.txt Uyumu

Geleneksel Arama Botları (Googlebot, Bingbot)

W3C ve robots.txt standartlarına tam uyum

Yapay Zeka Eğitim Botları (GPTBot, ClaudeBot)

Çoğunlukla uyumlu (Resmi duyurulan botlar)

Canlı AI Arama Botları (PerplexityBot, OAI-SearchBot)

Çoğunlukla uyumlu, ancak istisnai proxy kullanımı görülebilir

JavaScript Yürütme (Rendering)

Geleneksel Arama Botları (Googlebot, Bingbot)

Gelişmiş headless tarayıcılarla tam render

Yapay Zeka Eğitim Botları (GPTBot, ClaudeBot)

Genellikle yalnızca ham HTML ve metin ayrıştırma

Canlı AI Arama Botları (PerplexityBot, OAI-SearchBot)

Dinamik sayfalarda headless browser, statik sayfalarda ham HTML

Özel Tarayıcı Botlar (Web Crawlers) ve User-Agent Kavramı

Her web tarayıcısı, hedef sunucuya HTTP isteği gönderirken HTTP başlığında (header) kendisini tanımlayan bir @@CODE0@@ dizesi iletir. Bu dize; tarayıcının adını, ait olduğu şirketi, işletim sistemi çekirdeğini ve genellikle botun yönergelerini içeren resmi bir dokümantasyon URL'sini barındırır. Web sunucuları, gelen bu başlık bilgisini okuyarak isteğe izin verme, isteği reddetme (@@CODE1@@) veya istek hızını sınırlama (429 Too Many Requests) kararlarını alır.

Yapay zeka şirketleri, eğitim amaçlı botları ile anlık sorgu botlarını farklı User-Agent dizeleriyle ayırmaktadır. Örneğin OpenAI, genel eğitim botu için @@CODE0@@ dizesini kullanırken, anlık web araması ve ChatGPT içindeki gezinme eylemleri için @@CODE1@@ ve @@CODE2@@ kimliklerini kullanır. Anthropic ise benzer şekilde @@CODE3@@ ve canlı gezinme işlemleri için Claude-Web ayrımına gitmektedir. Bu ayrım, web yöneticilerinin eğitim için veri kullanımını engellerken, anlık arama motoru görünürlüğünü açık bırakabilmelerine olanak tanır.

Tarayıcı botlar, DNS çözümlemesi ile başlayan, ardından robots.txt kontrolü, TCP/TLS el sıkışması ve HTTP GET talebi ile devam eden bir veri çekme döngüsü izler. Sunucudan dönen HTML yanıtı içerisindeki <a href="..."> etiketleri ayıklanarak bir tarama kuyruğuna (frontier queue) eklenir. Bot, politikasında belirtilen istek sıklığı sınırlarına (crawl-delay veya saniye başına istek sayısı) bağlı kalarak sitenin derinliklerine doğru ilerler.

API Entegrasyonları ve Üçüncü Taraf Veri Ortaklıkları

Yapay zeka asistanları yalnızca doğrudan web taraması ile bilgi toplamaz. Özellikle gerçek zamanlı finansal veriler, hava durumu, e-ticaret stok durumları, güncel haber akışları ve akademik yayınlar için doğrudan üçüncü taraf veri sağlayıcıları ve ticari API ortaklıkları devreye girer. Bu modelde dil modeli geliştiricileri, veritabanı sağlayıcıları veya arama motoru altyapıları (örneğin Bing Web Search API, Google Search API veya özel içerik lisanslama anlaşmaları) ile doğrudan entegrasyon kurar.

API tabanlı veri transferi, botların hedef web sitesini doğrudan tarama ihtiyacını ortadan kaldırır. Örneğin bir AI asistanı, kullanıcının bir uçuş fiyatı sorgusunu yanıtlarken ilgili seyahat platformunun API'sine yapılandırılmış JSON formatında istek atar ve yanıtı anında doğal dil formatına dönüştürür. Büyük ölçekli medya kuruluşları (Axel Springer, News Corp, Reddit vb.) ile AI laboratuvarları arasında imzalanan veri lisanslama anlaşmaları da doğrudan API beslemeleri ve özel veritabanı kopyaları üzerinden yürütülmektedir [1, 2].

Bu durum, web sitenizin robots.txt dosyasında bir AI botunu engellemiş olsanız dahi, içeriğiniz lisanslı bir aracı platformda, RSS dağıtım ağında veya API havuzunda yer alıyorsa, yapay zeka modellerinin bu dolaylı kanallar üzerinden içeriğe erişebileceği anlamına gelir. Bu nedenle kurumsal veri mimarisi planlanırken yalnızca uç nokta (endpoint) düzeyindeki botlar değil, veri dağıtım sözleşmeleri ve sendikasyon ağları da hesaba katılmalıdır.

Veri Kazıma (Web Scraping) Teknolojileri ve Riskleri

Veri kazıma (web scraping), bot kurallarına veya resmi API standartlarına uymayan, çoğunlukla kimliğini gizleyen otomatik yazılımlar aracılığıyla web sayfalarından hedeflenmiş verilerin çıkarılması işlemidir. Standart tarayıcılar (crawlers) bağlantıları izleyip genel sayfa yapısını okurken, kazıyıcılar (scrapers) doğrudan belirli CSS seçicilerini (selectors), XPath sorgularını, fiyat tablolarını veya makale metinlerini hedef alır.

Yapay zeka veri toplama ekosisteminde bazı üçüncü taraf veri simsarları ve yetkisiz girişimler, standart User-Agent tanımlarını kullanmak yerine tarayıcı kimliklerini standart masaüstü tarayıcılar (örneğin Mozilla/5.0 Chrome/...) gibi taklit eden rotasyonel proxy ağları (residential proxies) ve headless browser altyapıları (Puppeteer, Playwright, Selenium) kullanmaktadır. Bu durum aşağıdaki operasyonel riskleri doğurur:

  • Sunucu Kaynak Tüketimi: Optimize edilmemiş kazıma botları, sitenize saniyede yüzlerce eşzamanlı istek göndererek CPU, RAM ve bant genişliği limitlerinizi tüketebilir; bu da gerçek kullanıcılar için yavaşlamaya veya 503 Service Unavailable hatalarına yol açar.

  • Fikri Mülkiyet Kaybı: Özgün araştırma raporları, tescilli ürün açıklamaları ve özel veritabanları izinsiz kopyalanarak rakip modellerin eğitimine veya otomatik içerik çiftliklerine dahil edilebilir.

  • Analitik Veri Bozulması: Kimliğini gizleyen botların oluşturduğu sahte sayfa görüntülemeleri (pageviews), hemen çıkma oranları (bounce rate) ve oturum süreleri, Google Analytics ve kurumsal CRM metriklerini yanıltabilir.

Sektörü Domine Eden Yapay Zeka Tarayıcıları Hangileridir?

Yapay zeka tarayıcı botlarının dijital ekosistem temsilini gösteren illüstrasyon
Dijital ağları tarayan ve veri toplayan önde gelen kurumsal yapay zeka botları.

Üretken yapay zeka pazarının büyümesiyle birlikte, internet trafiğinde bot payı dramatik biçimde artış göstermiştir. Web yöneticilerinin ve teknik ekiplerin sitelerine gelen trafiği doğru analiz edebilmesi için hangi şirketin hangi bot ailesini işlettiğini bilmesi şarttır. Her yapay zeka şirketi, tarama faaliyetlerini belirli kurallara bağladığını resmi dokümantasyonlarıyla ilan etmiştir.

Bu botların taranan sayfalardaki davranış biçimleri, IP aralıkları ve robots.txt yönergelerine verdikleri tepkiler farklılık gösterir. Kurumsal düzeyde bir trafik yönetimi gerçekleştirmek için bu botların kimlik yapılarını detaylı incelemek gerekir.

# Popüler AI Botlarının User-Agent Tanımları (Özet Liste)
User-agent: ClaudeBot          # Anthropic - Model Eğitimi
User-agent: Claude-Web         # Anthropic - Canlı Kullanıcı Sorguları
User-agent: GPTBot             # OpenAI - Model Eğitimi
User-agent: OAI-SearchBot      # OpenAI - Arama ve Prototip İndeksleme
User-agent: ChatGPT-User       # OpenAI - ChatGPT Canlı Web Gezinmesi
User-agent: Google-Extended    # Google - Gemini ve Vertex AI Eğitimi
User-agent: PerplexityBot      # Perplexity - Canlı Dizinleme ve Arama
User-agent: CCBot              # Common Crawl - Açık Kaynak Veri Havuzu
User-agent: Amazonbot          # Amazon - Alexa ve Bedrock AI Eğitimi
User-agent: Bytespider         # ByteDance - LLM ve Algoritma Eğitimi
User-agent: Applebot-Extended  # Apple - Apple Intelligence Eğitimi

Anthropic ve ClaudeBot: Çalışma Prensibi

Anthropic, geliştirdiği Claude dil modeli ailesi için web verilerini toplarken temel olarak @@CODE0@@ ve @@CODE1@@ User-Agent kimliklerini kullanır. Anthropic'in resmi beyanlarına göre ClaudeBot, şirketin temel modellerini eğitmek ve gelecekteki LLM sürümlerinin genel dünya bilgisini artırmak amacıyla geniş çaplı taramalar gerçekleştirir.

@@CODE0@@, standart bir web tarayıcısı gibi çalışarak robots.txt dosyasındaki kuralları en yüksek öncelikle işler. Eğer bir web sitesi @@CODE1@@ için @@CODE2@@ kuralı tanımlamışsa, bot ilgili etki alanındaki (domain) hiçbir sayfayı taramaz ve önbelleğe almaz. Öte yandan, Claude sohbet arayüzü içerisinden bir kullanıcının doğrudan bir web sitesi bağlantısı vererek "Bu sayfayı özetle" talimatı vermesi durumunda tetiklenen bot genellikle @@CODE3@@ (veya benzeri bir çıkarım zamanı istemcisi) olur. Anthropic, IP bloklarını periyodik olarak güncellemekte ve kurumsal güvenlik duvarlarının doğrulaması için resmi JSON formatında IP listeleri yayımlamaktadır.

Claude'un veri toplama prensiplerinde gizlilik odaklı filtreler bulunur. Şirket, kişisel olarak tanımlanabilir bilgileri (PII), telif hakkı korumalı paywall içeriklerini ve şifreyle korunan alanları tarama dışı bıraktığını bildirmektedir. Ancak genel web sayfalarındaki teknik makaleler, rehberler ve kamuya açık dokümanlar ClaudeBot'un birincil veri havuzunu oluşturur.

OpenAI Ekosistemi: GPTBot ve OAI-SearchBot

OpenAI, yapay zeka arama ve model eğitimi operasyonlarını net çizgilerle birbirinden ayrılmış bot kümeleri üzerinden yönetir. Bu ayrım, web yöneticilerine hangi kullanım senaryosuna izin verip hangisini engelleyecekleri konusunda esneklik sağlar:

  1. GPTBot: OpenAI'ın temel modellerini (GPT-4o, o1, o3 vb.) eğitmek amacıyla internet genelinde büyük ölçekli veri toplayan ana eğitim botudur. GPTBot, kullanıcı etkileşimlerinden bağımsız olarak periyodik web taraması yapar. Bu botu engellemek, sitenizin gelecekteki OpenAI modellerinin temel eğitim setine dahil edilmesini önler.

  2. OAI-SearchBot: OpenAI'ın arama motoru özellikleri (SearchGPT altyapısı) için web sayfalarını dizine ekleyen ve kaynak gösterimi sağlayan bottur. OAI-SearchBot kesinlikle model eğitimi için veri toplamaz; amacı kullanıcı arama sorgularında sitenizi bir kaynak olarak listelemek ve doğrudan trafik yönlendirmektir.

  3. ChatGPT-User: ChatGPT arayüzünde bir kullanıcı doğrudan web araması gerektiren bir soru sorduğunda veya bir URL paylaştığında tetiklenen kullanıcı aracılı (user-triggered) anlık çekme istemcisidir.

Bu üçlü ayrım sayesinde, bir e-ticaret veya haber platformu @@CODE0@@'u engelleyerek içeriklerinin izinsiz model eğitiminde tüketilmesini durdurabilirken, @@CODE1@@'a izin vererek ChatGPT arama sonuçlarından organik ziyaretçi çekmeye devam edebilir.

Google Yapay Zeka Botları: Google-Extended

Google ekosisteminde yapay zeka veri toplama stratejisi, geleneksel arama motoru botu olan @@CODE0@@ ile yapay zeka eğitim denetleyicisi olan @@CODE1@@ arasında bölünmüştür. Bu mimari, Google'ın geleneksel web arama tekeli ile üretken yapay zeka ürünleri (Gemini, Vertex AI API'leri) arasındaki hassas dengenin bir sonucudur.

@@CODE0@@, web sitesi yöneticilerine sitelerinin Gemini modellerinin ve Google Cloud yapay zeka servislerinin eğitiminde kullanılıp kullanılamayacağını belirleme yetkisi veren özel bir User-Agent belirtecidir. Kritik nokta şudur: @@CODE1@@'ı robots.txt üzerinden engellemek, sitenizin Google Web Arama dizinindeki konumunu, sıralamasını veya Google AI Overviews içerisindeki görünürlüğünü etkilemez. Google, geleneksel arama dizinine ekleme ve snippet çıkarma işlemleri için Googlebot'u kullanmaya devam eder.

Dolayısıyla Google ekosisteminde, arama görünürlüğünü koruyup yapay zeka modellerinin içeriği yutmasını engellemek isteyen bir işletmenin izlemesi gereken yol, @@CODE0@@'a tam izin verirken @@CODE1@@ belirtecine Disallow: / kuralı uygulamaktır.

Açık Kaynak Veri Toplayıcılar: Common Crawl (CCBot)

Common Crawl, kâr amacı gütmeyen bir kuruluş tarafından işletilen ve 2008 yılından bu yana internetin devasa kopyalarını düzenli olarak arşivleyen açık kaynaklı bir veri ambarıdır. Common Crawl'un tarayıcısı olan CCBot, her ay petabaytlarca web verisini toplayarak kamuya açık veri kümeleri (WARC/WAT/WET formatlarında) halinde yayımlar.

Yapay zeka sektöründeki birçok açık kaynaklı (Meta Llama, Mistral, Falcon) ve kapalı kaynaklı model, ilk ön eğitim aşamalarında sıfırdan tüm interneti taramak yerine maliyet avantajı sağlayan Common Crawl veri setlerini temel alır. Dolayısıyla, doğrudan Anthropic veya OpenAI botlarını engellemiş olsanız bile, eğer CCBot'u engellemediyseniz, web içerikleriniz Common Crawl arşivine girecek ve bu arşivi kullanan yüzlerce farklı yapay zeka şirketi tarafından modellerine dahil edilecektir.

@@CODE0@@, robots.txt kurallarına titizlikle uyar. Kapsamlı bir içerik koruma stratejisi yürüten işletmelerin robots.txt yapılandırmalarında mutlaka @@CODE1@@ kuralını da tanımlamaları önerilir.

Aşağıdaki tablo, sektördeki başlıca botların görevlerini ve izin verilip engellenmesi durumundaki stratejik sonuçları karşılaştırmaktadır:

Bot AdıSahip KuruluşAna GöreviEngellenirse Ne Olur?İzin Verilirse Ne Olur?
ClaudeBotAnthropicLLM EğitimiClaude modelleri sitenizin verileriyle eğitilmez.İçeriğiniz Claude bilgi tabanına entegre edilir.
Claude-WebAnthropicCanlı Sayfa OkumaClaude kullanıcıları sitenizin URL'sini anlık analiz ettiremez.Claude anlık istemlerde sayfayı özetleyip kaynak gösterebilir.
GPTBotOpenAILLM EğitimiGPT serisi modeller sitenizden eğitim verisi çekemez.GPT modelleri sitenizin sektörel uzmanlığını öğrenir.
OAI-SearchBotOpenAIAI Arama İndeksiChatGPT Arama ve SearchGPT'de kaynak olarak listelenemezsiniz.OpenAI arama arayüzünden doğrudan referans trafiği alınır.
Google-ExtendedGoogleGemini EğitimiGemini modelleri içeriklerinizle eğitilmez (Google SEO etkilenmez).Gemini modelleri kurumsal verilerinizden beslenir.
PerplexityBotPerplexity AIAI Arama & RAGPerplexity cevaplarında kaynak gösterilme şansı düşer/kaybolur.Yapay zeka cevaplarında alıntılanma ve linkleme sağlanır.
CCBotCommon CrawlAçık Veri ArşiviAçık kaynaklı yapay zeka veri setlerine dahil edilmezsiniz.Llama, Mistral ve diğer modeller içeriğinizi arşivden öğrenir.

ClaudeBot

Sahip Kuruluş

Anthropic

Ana Görevi

LLM Eğitimi

Engellenirse Ne Olur?

Claude modelleri sitenizin verileriyle eğitilmez.

İzin Verilirse Ne Olur?

İçeriğiniz Claude bilgi tabanına entegre edilir.

Claude-Web

Sahip Kuruluş

Anthropic

Ana Görevi

Canlı Sayfa Okuma

Engellenirse Ne Olur?

Claude kullanıcıları sitenizin URL'sini anlık analiz ettiremez.

İzin Verilirse Ne Olur?

Claude anlık istemlerde sayfayı özetleyip kaynak gösterebilir.

GPTBot

Sahip Kuruluş

OpenAI

Ana Görevi

LLM Eğitimi

Engellenirse Ne Olur?

GPT serisi modeller sitenizden eğitim verisi çekemez.

İzin Verilirse Ne Olur?

GPT modelleri sitenizin sektörel uzmanlığını öğrenir.

OAI-SearchBot

Sahip Kuruluş

OpenAI

Ana Görevi

AI Arama İndeksi

Engellenirse Ne Olur?

ChatGPT Arama ve SearchGPT'de kaynak olarak listelenemezsiniz.

İzin Verilirse Ne Olur?

OpenAI arama arayüzünden doğrudan referans trafiği alınır.

Google-Extended

Sahip Kuruluş

Google

Ana Görevi

Gemini Eğitimi

Engellenirse Ne Olur?

Gemini modelleri içeriklerinizle eğitilmez (Google SEO etkilenmez).

İzin Verilirse Ne Olur?

Gemini modelleri kurumsal verilerinizden beslenir.

PerplexityBot

Sahip Kuruluş

Perplexity AI

Ana Görevi

AI Arama & RAG

Engellenirse Ne Olur?

Perplexity cevaplarında kaynak gösterilme şansı düşer/kaybolur.

İzin Verilirse Ne Olur?

Yapay zeka cevaplarında alıntılanma ve linkleme sağlanır.

CCBot

Sahip Kuruluş

Common Crawl

Ana Görevi

Açık Veri Arşivi

Engellenirse Ne Olur?

Açık kaynaklı yapay zeka veri setlerine dahil edilmezsiniz.

İzin Verilirse Ne Olur?

Llama, Mistral ve diğer modeller içeriğinizi arşivden öğrenir.

Kurumsal Verilerinizi ve Web İçeriklerinizi Nasıl Korursunuz?

Kurumsal web varlıklarının izinsiz yapay zeka taramalarına karşı korunması tek bir yöntemle sağlanamaz. Güvenlik mimarisi; standart protokollere saygı duyan meşru botlar için politika düzeyinde (robots.txt), kuralları ihlal eden veya kimliğini gizleyen agresif kazıyıcılar için ise altyapı düzeyinde (WAF, Rate Limiting, IP engelleme) katmanlı olarak inşa edilmelidir.

İşletmelerin ilk olarak belirlemesi gereken unsur "Erişim Matrisi"dir. Hangi verilerin arama motorlarına ve AI arama sistemlerine açık bırakılacağı, hangi teknik dokümantasyon veya tescilli bilginin tamamen kapatılacağı kararlaştırılmalıdır. GEO (Generative Engine Optimization) çağında her şeyi tamamen kapatmak dijital görünürlüğü sıfırlayabileceği gibi, her şeyi denetimsiz açmak da telif ve sunucu maliyeti riskleri yaratır.

Robots.txt Protokolü ile Erişim İzinlerini Yönetmek

Robots Exclusion Protocol (robots.txt), web sunucunuzun kök dizininde (example.com/robots.txt) yer alan ve tarayıcı botlara hangi sayfaları tarayıp hangilerini taramayacaklarını bildiren düz metin (plain text) dosyasıdır. Meşru yapay zeka şirketlerinin botları (Anthropic, OpenAI, Google vb.) bu standartlara riayet eder.

Aşağıda, kurumsal bir web sitesinde AI eğitim botlarını engellerken arama motoru ve kaynak gösterici AI botlarına izin veren optimize edilmiş bir robots.txt örneği yer almaktadır:

# Tüm arama motorlarına (Google, Bing vb.) genel izin
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /private/
Disallow: /api/

# OpenAI Eğitim Botunu Engelle (Eğitime Hayır)
User-agent: GPTBot
Disallow: /

# OpenAI Arama Botuna İzin Ver (Trafiğe Evet)
User-agent: OAI-SearchBot
Allow: /

# Anthropic Eğitim Botunu Engelle
User-agent: ClaudeBot
Disallow: /

# Anthropic Canlı Web Okuyucusuna İzin Ver
User-agent: Claude-Web
Allow: /

# Google Yapay Zeka Eğitimini Engelle (Arama Etkilenmez)
User-agent: Google-Extended
Disallow: /

# Açık Kaynak Veri Toplayıcıyı Engelle
User-agent: CCBot
Disallow: /

# ByteDance LLM Botunu Engelle
User-agent: Bytespider
Disallow: /

# Perplexity AI Arama Botuna İzin Ver
User-agent: PerplexityBot
Allow: /

# Sitemap Bildirimi
Sitemap: https://www.example.com/sitemap.xml

Robots.txt yapılandırmasında dikkat edilmesi gereken en önemli kural, @@CODE0@@ bloğunun altına yazılan genel @@CODE1@@ kuralının sitenizi Google arama dizininden de tamamen sileceğidir. Bu nedenle kurallar her zaman spesifik User-Agent adlarıyla ayrıştırılmalıdır.

Güvenlik Duvarı (WAF) ve IP Bazlı Kısıtlamalar

Robots.txt dosyası yasal veya şifreleme tabanlı bir engelleyici değil, yalnızca centilmenlik anlaşmasına dayalı bir direktiftir. Kötü niyetli veya kimliğini gizleyen botlar robots.txt yönergelerini tamamen görmezden gelebilir. Bu noktada devreye Cloudflare, AWS WAF, Akamai veya Fastly gibi Web Uygulama Güvenlik Duvarları (WAF) girer.

WAF sistemleri, gelen trafiğin davranışsal paternlerini analiz ederek yapay zeka botlarını tespit eder ve engeller:

  • Managed Bot Protection: Cloudflare gibi modern WAF sağlayıcıları, tek bir anahtarla bilinen tüm yapay zeka tarayıcılarını (AI Scrapers and Crawlers) engelleyen hazır kurallar sunar. Bu kurallar, botun HTTP başlıklarındaki anomalileri, TLS parmak izlerini (JA3/JA4 fingerprints) ve bilinen veri merkezi IP bloklarını analiz ederek tespit yapar.

  • Rate Limiting (İstek Sınırlama): Aynı IP adresinden veya ASN'den saniyede gelen istek sayısı sınırlandırılarak (örneğin dakikada maksimum 60 istek) sunucunun kazıma botları tarafından kilitlenmesi engellenir.

  • JavaScript Challenge & CAPTCHA: WAF, şüpheli görünen isteklerde tarayıcıya arka planda görünmez bir JavaScript hesaplaması (Turnstile veya Managed Challenge) gönderir. Gerçek kullanıcılar bu testi milisaniyeler içinde geçerken, basit kazıma scriptleri ve otomasyon botları takılarak elenir.

# Örnek NGINX Düzeyinde Agresif AI Bot Engelleme Konfigürasyonu
map $http_user_agent $bad_ai_bot {
    default 0;
    ~*(Bytespider|CCBot|GPTBot|ClaudeBot) 1;
}

server {
    listen 443 ssl http2;
    server_name example.com;

    if ($bad_ai_bot) {
        return 403 "Erişim yapay zeka bot koruma politikası nedeniyle engellenmiştir.";
    }

    location / {
        try_files $uri $uri/ /index.php?$args;
    }
}

Arama Motoru Botları ve AI Eğitim Botları Arasındaki Stratejik Fark

Teknik karar vericilerin en sık düştüğü yanılgı, tüm botları tek bir torbaya koyarak ya tamamen engellemek ya da tamamen serbest bırakmaktır. Oysa arama motoru botları ile AI eğitim botları şirketiniz için taban tabana zıt ticari sonuçlar üretir.

Geleneksel arama motoru botlarına (@@CODE0@@, @@CODE1@@) izin vermek, sitenizin organik arama sonuçlarında (SERP) üst sıralarda çıkmasını sağlar ve sitenize ölçülebilir, dönüşüm potansiyeli yüksek ziyaretçi akışı getirir. Benzer şekilde AI arama botlarına (@@CODE2@@, @@CODE3@@) izin vermek, üretken arama motorlarında markanızın alıntılanmasını ve GEO kapsamında referans gösterilmesini sağlar.

Buna karşılık genel AI eğitim botları (@@CODE0@@, @@CODE1@@, GPTBot), sitenizdeki verileri alıp modellerini eğitmekte kullanır. Bu modeller eğitildikten sonra kullanıcılara yanıt üretirken sitenize herhangi bir referans linki veya trafik sağlamayabilir. Dolayısıyla stratejik ayrım şu şekilde formüle edilmelidir: "Trafik getiren ve kaynak gösteren botlara izin ver, yalnızca modeli eğitip sıfır trafik yönlendiren agresif veri toplayıcıları sınırla."

Şirketler İçin Veri Gizliliği ve Telif Hakkı İhlali Önlemleri

Yapay zeka modellerinin web sitelerinden topladığı veriler, yalnızca teknik bir bant genişliği meselesi değil; doğrudan KVKK (Kişisel Verilerin Korunması Kanunu), GDPR (General Data Protection Regulation) ve fikri mülkiyet hukuku kapsamında yasal riskler barındırır. Web sitenizde yayınlanan kullanıcı yorumları, çalışan profilleri, tescilli araştırma verileri veya telifli yayınlar izinsiz olarak dil modellerinin eğitim setlerine girdiğinde, bu verilerin model hafızasından silinmesi (machine unlearning) teknik olarak neredeyse imkansızdır.

Avrupa Birliği Yapay Zeka Yasası (EU AI Act) ve küresel regülasyonlar, yapay zeka sağlayıcılarına eğitimde kullandıkları telifli materyalleri şeffaf bir şekilde açıklama ve hak sahiplerinin "Opt-Out" (Kullanım Dışı Kalma) taleplerine saygı gösterme yükümlülüğü getirmektedir. İşletmelerin hem hukuki metinlerini hem de teknik altyapılarını bu yeni yasal paradigmaya göre güncellemesi zorunludur.

Hizmet Şartları (Terms of Service) Güncellemeleri

Bir web sitesinin robots.txt dosyası teknik bir sinyal üretirken, sitenin Kullanım Koşulları (Terms of Service - ToS) ve Gizlilik Politikası metinleri yasal zemini oluşturur. Bir botun robots.txt kuralını delerek veri kazıması durumunda, mahkemeler ve yasal merciler öncelikle sitenin ToS metninde açık bir "Yapay Zeka Eğitimi ve Kazıma Yasağı" bulunup bulunmadığına bakar.

Kurumsal sitelerin hizmet şartlarına eklemesi gereken temel yasal koruma maddeleri şunları içerir:

  1. Açık Kazıma Yasağı (No-Scraping Clause): Sitedeki metin, görsel, ses, kod ve veritabanı yapılarının herhangi bir otomatik yazılım, bot, web kazıyıcı veya veri madenciliği aracıyla kopyalanmasının kesin olarak yasaklandığının belirtilmesi.

  2. Yapay Zeka ve LLM Eğitimi Sınırlandırması: Sitedeki hiçbir içeriğin, doğrudan veya dolaylı olarak makine öğrenimi modellerinin, büyük dil modellerinin (LLM) veya üretken yapay zeka algoritmalarının eğitimi, ince ayarı (fine-tuning) veya doğrulanması amacıyla kullanılamayacağının açıkça yazılması (TDM - Text and Data Mining istisnaları için AB Yönergesi Madde 4(3) kapsamında hak çekincesi bildirimi) [3].

  3. Müeyyide ve Tazminat Hükümleri: İhlal durumunda sunucu kaynak tüketim bedelleri, telif tazminatları ve adli masrafların talep edileceğine dair yasal bağlayıcılık maddesi.

Bu maddelerin yalnızca sitenin altbilgisinde (footer) bir link olarak kalmaması, üyelik gerektiren platformlarda kullanıcı sözleşmesi olarak onaylatılması hukuki geçerliliği artırır.

Özel Verilerin Korunması İçin En İyi Uygulamalar

Kurumsal verilerin izinsiz yapay zeka erişiminden korunması, teknik ve operasyonel katmanların bir arada yürütülmesini gerektirir. Hassas müşteri verilerinin, kurum içi dokümanların ve tescilli yazılım kodlarının kamuya açık alanlara sızmasını önlemek için aşağıdaki pratik adımlar uygulanmalıdır:

  • Kimlik Doğrulama Duvarları (Paywall & Auth Walls): Kamuoyuna açık olması gerekmeyen raporlar, araştırma çıktıları ve müşteri portalları mutlaka güçlü kimlik doğrulama (OAuth 2.0, SAML, JWT) arkasına alınmalıdır. Hiçbir arama botu veya AI tarayıcısı oturum açma (login) formunu aşarak içeriğe erişemez.

  • Hassas Veri Maskeleme ve Tokenizasyon: Müşteri yorumları veya topluluk forumları gibi kullanıcı kaynaklı içerik (UGC) alanlarında e-posta, telefon numarası veya T.C. Kimlik Numarası gibi PII verileri otomatik DLP (Data Loss Prevention) filtreleri ile maskelenmelidir.

  • Noindex ve Nofollow Direktifleri: Arama motorlarının dizine eklemesini istemediğiniz sayfaların HTML @@CODE0@@ bölümüne @@CODE1@@ etiketi eklenmelidir.

  • HTTP Güvenlik Başlıkları: Sunucu yanıtlarında X-Robots-Tag: noindex, noarchive, nosnippet başlıkları kullanılarak PDF, CSV veya DOCX gibi belge dosyalarının dahi yapay zeka tarafından arşivlenmesi engellenmelidir.

Yapay Zeka Tarama Dinamiklerine Yönelik Kritik Teknik Hususlar

Veri işleme hızı ve sunucu mimarisi dinamikleri görseli
Yapay zeka sistemlerinin anlık veri işleme döngüsü ve sunucu altyapısı üzerindeki teknik etkileri.

Yapay zeka asistanlarının web üzerindeki davranış biçimleri, statik indeksleme yapan geleneksel tarayıcılardan çok daha dinamik ve anlıktır. Özellikle RAG (Retrieval-Augmented Generation) altyapıları, bir kullanıcının sorduğu soruya göre milisaniyeler içinde web araması yapıp birden fazla sayfayı eşzamanlı olarak indirir, metinleri parçalar (chunking), anlamsal olarak en yakın kısımları vektör veritabanından çeker ve dil modeline verir.

Bu operasyonel dinamizm, web yöneticilerinin altyapı performanslarını, sunucu yanıt sürelerini (TTFB - Time to First Byte) ve içerik formatlarını yeniden değerlendirmelerini zorunlu kılar.

Gerçek Zamanlı Arama ve RAG Mimarilerinde Claude'un Rolü

Claude (Anthropic), özellikle uzun bağlam pencereleri (context window) ve karmaşık mantık yürütme yetenekleriyle öne çıkan bir modeldir. Kullanıcılar Claude'a bir URL ilettiğinde veya Claude canlı web arama yeteneğiyle donatıldığında, bot sayfadaki gereksiz CSS, JavaScript ve reklam kodlarını eleyerek doğrudan anlamsal metin bloğunu (DOM ağacındaki @@CODE0@@, @@CODE1@@ etiketleri) çeker.

Bu noktada web sitenizin HTML anlambilimi (Semantic HTML) büyük önem kazanır. Düzensiz @@CODE0@@ karmaşası yerine semantik @@CODE1@@, @@CODE2@@, @@CODE3@@, @@CODE4@@-@@CODE5@@ hiyerarşisiyle inşa edilmiş sayfalar, Claude ve diğer AI asistanlar tarafından çok daha düşük token maliyetiyle ve hatasız ayrıştırılır. Yapay zekanın sitenizden doğru bilgi alıntılayabilmesi için içeriğin yapılandırılmış veri (Schema.org) işaretlemeleriyle (Article, Organization, FAQPage) desteklenmesi GEO başarısının temel şartıdır.

Sunucu Yükü, Trafik Maliyetleri ve CDN Yönetimi

Yapay zeka tarayıcıları, geleneksel Googlebot'a kıyasla sunucu üzerinde çok daha ani ve yoğun yük oluşturabilir. Özellikle yeni bir modelin eğitim dönemi başladığında, @@CODE0@@ veya @@CODE1@@ gibi sistemler sitenize saniyeler içinde binlerce istek gönderebilir. Eğer sitenizde statik önbellekleme (caching) veya CDN (Content Delivery Network) katmanı bulunmuyorsa, bu istekler doğrudan kaynak sunucunuzdaki (origin server) PHP/Node.js süreçlerini ve SQL veritabanınızı tüketir.

Sunucu maliyetlerini kontrol altında tutmak için:

  1. Edge Caching Kullanımı: HTML sayfalarının Cloudflare, Fastly veya CloudFront CDN uçlarında (edge) önbelleğe alınması, bot isteklerinin kaynak sunucuya ulaşmadan doğrudan CDN üzerinden karşılanmasını sağlar.

  2. Crawl-Delay Direktifi: Robots.txt dosyasında botların istekleri arasına bekleme süresi koymak için Crawl-delay: 2 (2 saniye bekle) direktifi tanımlanabilir. Ancak bazı modern AI botlarının bu direktifi dikkate almadığı, bunun yerine WAF üzerinden hız sınırlaması yapılmasının daha güvenilir olduğu unutulmamalıdır.

  3. HTTP 304 Not Modified Optimizasyonu: Botların her ziyarette sayfayı yeniden indirmesini engellemek için doğru @@CODE0@@ ve @@CODE1@@ başlıkları sunulmalıdır. Sayfa değişmediyse sunucu @@CODE2@@ yerine @@CODE3@@ dönerek bant genişliğinden tasarruf etmelidir.

Dijital Varlık Yöneticileri İçin Stratejik Yol Haritası

Yapay zeka asistanlarının web içeriklerine erişim mekanizmaları, geleneksel arama motoru optimizasyonu (SEO) ile üretken yapay zeka optimizasyonunun (GEO) kesiştiği yeni bir dijital çağ başlatmıştır. Dijital karar vericiler için başarı; yapay zekayı tamamen reddetmek veya kontrolsüzce teslim olmak yerine, bilinçli ve segmentlere ayrılmış bir erişim politikası yürütmekten geçer.

Gelecek projeksiyonunda web yöneticilerinin uygulaması gereken dört aşamalı stratejik çerçeve şu şekilde yapılandırılmalıdır:

  1. Denetim ve Keşif (Audit): Sunucu erişim logları incelenerek sitenizi hangi AI botlarının, ne sıklıkla ve hangi sayfalarda taradığı netleştirilmelidir. Sunucu kaynaklarını sömüren kimliği belirsiz kazıyıcılar tespit edilmelidir.

  2. Politika ve Segmentasyon (Policy): Şirketin hangi içeriklerinin kamuya açık marka bilinirliği aracı, hangilerinin ise korunması gereken tescilli ticari sır olduğu sınıflandırılmalıdır. Marka bilinirliği sağlayan bloglar ve rehberler AI arama botlarına (@@CODE0@@, @@CODE1@@) açık tutulurken; tescilli veri havuzları ve genel eğitim botları (@@CODE2@@, @@CODE3@@) robots.txt ve WAF seviyesinde filtrelenmelidir.

  3. Altyapı Güçlendirme (Infrastructure): CDN üzerinde Edge Caching kuralları devreye alınmalı, şüpheli bot trafiği için davranışsal WAF filtreleri kurulmalı ve robots.txt dosyası en güncel User-Agent standartlarına göre güncellenmelidir.

  4. GEO Optimizasyonu ve Semantik Netlik: Yapay zekaya açık bırakılan içeriklerin alıntılanabilirlik (citability) değerini artırmak için semantik netlik, doğrudan cevap odaklı paragraflar, yapılandırılmış veri şemaları (Schema.org) ve güçlü E-E-A-T (Deneyim, Uzmanlık, Otoriterlik, Güvenilirlik) sinyalleri inşa edilmelidir.

Yapay zeka arama ekosistemi durağan değildir; algoritmalar, bot kimlikleri ve yasal düzenlemeler sürekli evrilmektedir. Kurumsal varlıklarınızı korurken dijital pazar payınızı büyütmenin tek yolu, bu teknik değişimleri proaktif olarak takip etmek ve altyapınızı esnek tutmaktır.

Sıkça Sorulan Sorular

Yapay zeka asistanları şifre korumalı sayfalara erişebilir mi?

Hayır, standart AI tarayıcı botları veya arama asistanları şifre korumalı (paywall veya login arkasındaki) alanlara erişemez. Bu sistemler kimlik doğrulama oturumlarını aşamaz ve HTTP 401/403 yanıtı alarak sayfayı tarama dışı bırakır.

AI botlarını engellemek sitemin Google SEO performansını düşürür mü?

GPTBot, ClaudeBot veya CCBot gibi yapay zeka eğitim botlarını engellemek Google arama sıralamalarınızı etkilemez. Ancak Google-Extended yerine yanlışlıkla standart Googlebot'u engellerseniz siteniz Google arama dizininden tamamen silinir.

Claude gerçek zamanlı olarak internetteki makaleleri okuyabilir mi?

Evet, Claude kendisine doğrudan bir web sayfası URL'si iletildiğinde veya entegre canlı web arama özelliği devrede olduğunda sayfadaki ham metin verilerini çekip özetleyebilir. Ancak robots.txt dosyasında Claude-Web veya ClaudeBot engellenmişse ilgili sayfayı okuyamaz.

Robots.txt dosyasında bir botu engellemek kesin koruma sağlar mı?

Robots.txt dosyası yalnızca Anthropic, OpenAI ve Google gibi kurallara uyan meşru şirketlerin botlarını durdurur. Kötü niyetli veya kimliğini gizleyen kazıyıcıları (scrapers) durdurmak için WAF (Web Application Firewall), IP filtreleme ve CAPTCHA gibi teknik güvenlik önlemleri şarttır.

GPTBot ile OAI-SearchBot arasındaki fark nedir?

GPTBot, OpenAI'ın dil modellerini eğitmek amacıyla genel web verilerini toplayan eğitim botudur. OAI-SearchBot ise SearchGPT ve ChatGPT Arama özelliklerinde kullanıcılara kaynak linkleri sunmak için çalışan ve model eğitimi yapmayan arama dizini botudur.

Web kazıma (scraping) faaliyetlerine karşı hizmet şartları (ToS) nasıl güncellenmelidir?

Hizmet şartları metnine içeriklerin otomatik botlar, web kazıyıcılar veya yapay zeka eğitim algoritmaları tarafından izinsiz toplanamayacağını belirten açık bir "Metin ve Veri Madenciliği Yasağı" (TDM Opt-out) maddesi eklenmelidir.

AI botlarının sunucuma aşırı yük bindirmesini nasıl engellerim?

Cloudflare veya AWS WAF gibi CDN/WAF altyapıları üzerinden botlara yönelik Rate Limiting (istek sınırlama) kuralları tanımlayabilir, Edge Caching ile HTML sayfalarını önbelleğe alabilir ve aşırı istek atan şüpheli ASN/IP bloklarını engelleyebilirsiniz.

Google-Extended botunu engellemek AI Overviews görünürlüğünü engeller mi?

Hayır, Google-Extended direktifi yalnızca Gemini ve Vertex AI modellerinin eğitimini engeller. Google Arama sonuçlarındaki AI Overviews özetleri standart Googlebot tarafından taranan dizin verileri üzerinden oluşturulduğu için görünürlüğü etkilemez.

Son Adım

Dijital projenizi bugün planlayalım

Web, yazılım, e-ticaret, mobil uygulama, entegrasyon, SEO veya GEO ihtiyacınızı net bir kapsama dönüştürelim.

Claude ve Diğer AI Asistanlar Web İçeriğine Nasıl Erişir? | Webizm