Dil seçin

Yapay Zeka Botları için Robots.txt Oluşturucu

Yapay zeka modellerinin sitenizi taramasını engelleyin. GPTBot, ClaudeBot ve 50'den fazla bot için Content-Signal ve özel robots.txt kuralları oluşturun.

Yapay Zeka Robots.txt OluşturucuNasıl çalışır? ↓
Sayfayı dizine ekleme ve kısa alıntılarla bağlantı gösterme
Sayfayı üretilen yanıtlar için kaynak materyal olarak kullanma
Sayfayı yapay zeka modellerini eğitmek veya ince ayar yapmak için kullanma
Cloudflare uzantısı: botun alınan içerikle ne kadar ileri gidebileceği
Sinyallere AB telif hakkı kuralları kapsamında yasal geçerlilik kazandıran metin
Bunları engellemenin arama görünürlüğüne etkisi yoktur
Bunları engellemek sizi yapay zeka arama yanıtlarından ve alıntılardan çıkarır
Bunları engellemek asistanların istek üzerine sayfalarınızı açmasını durdurur
Kullanıcı adına tıklayan ve form dolduran aracılar
Tüm site için / veya /makaleler/ gibi bir klasör belirtin
Yalnızca Sitemap ve llms.txt referansları için gereklidir
Yorum olarak eklendi; robots.txt içinde llms.txt direktifi bulunmaz

robots.txt ve Content-Signal tercihleri belirtir; tek başlarına erişimi engellemezler. Kurallara uyan botlar bu yönergelere uyar, diğerleri yok sayabilir ve Google Content-Signal yönergelerine göre işlem yapmadığını belirtmiştir. Kesin engelleme için sunucu taraflı bot kuralları uygulayın.

Mehmet Demiray Yayınlandı Güncellendi
Paylaş

Dört Farklı Yapay Zeka Botu Türü

Web sitenizi ziyaret eden yapay zeka botları tek bir amaca hizmet etmez. Yapay Zeka Robots.txt Oluşturucu, katalogdaki 50 adetten fazla botu temel olarak dört ana grupta sınıflandırır:

  1. Model Eğitimi Botları: GPTBot, ClaudeBot, Google-Extended ve CCBot gibi aracılar, büyük dil modellerini (LLM) sıfırdan eğitmek veya mevcut modelleri güncellemek için web genelinde toplu veri toplar. Bu botlar sitenizden içerik çeker fakat doğrudan trafik sağlamaz.
  1. Yapay Zeka Arama Dizinleyicileri: OAI-SearchBot veya PerplexityBot gibi araçlar, kullanıcıların yapay zeka tabanlı arama motorlarında sorduğu sorulara güncel yanıtlar vermek için sayfaları dizine ekler. Bu botlara izin vermek, sitenizin kaynak olarak gösterilmesini ve doğrudan ziyaretçi kazanmasını sağlar.
  1. Kullanıcı Tetiklemeli Getiriciler: ChatGPT-User gibi aracılar, bir kullanıcının sohbet penceresine doğrudan sitenizin bağlantısını yapıştırması durumunda sayfayı anlık olarak okur. Bu botları engellemek, kullanıcıların içeriğinizi yapay zeka arayüzleri içinde özetletmesini veya analiz etmesini zorlaştırır.
  1. Gezinme Ajanları: Kullanıcı adına belirli görevleri tamamlamak için web sitelerinde dolaşan otonom yapay zeka ajanlarıdır.

Her bot türünün engellenmesi farklı bir görünürlük bedeli getirir. Eğitim botlarını engellemek telif haklarınızı korurken, arama dizinleyicilerini engellemek yapay zeka kaynaklı organik trafiğinizi sıfırlayabilir.

Oluşturulan Robots.txt Dosyasının Yapısı

Yapay Zeka Robots.txt Oluşturucu tarafından üretilen dosya, tarayıcıları kontrol etmek için iki katmanlı bir mimari kullanır. Dosyanın en başında genel User-agent: * grubu yer alır. Bu blok içerisine Content-Signal yönergeleri ve standart tarayıcılar için Allow: / kuralı yazılır.

Genel grubun ardından, engellenmesi seçilen her bir yapay zeka botu için ayrı bir User-agent ve Disallow satırı tanımlanır. Örneğin GPTBot ve ClaudeBot seçildiğinde, her birinin tanımlayıcı adı dosyaya ayrı ayrı işlenir:

User-agent: GPTBot Disallow: /

User-agent: ClaudeBot Disallow: /

Varsayılan engelleme yolu kök dizin olan / işaretidir, ancak özel bir klasör yolu girilirse her engellenen bota aynı kural uygulanır. Dosyanın son kısmına, girilen site adresine bağlı olarak Sitemap: satırı ve yapay zeka bağlam dosyalarını işaret eden # llms.txt: yorum satırı eklenir. Dosya tamamen tarayıcı üzerinde derlenir ve sunucuya yüklenmeye hazır şekilde sunulur.

Content-Signal Yönergeleri ve Telif Hakkı Bildirimi

Geleneksel robots.txt kuralları yalnızca tarama eylemini kısıtlar; toplanan verinin nasıl işleneceğini denetlemez. Content Signals standardı, içerik üreticilerinin verilerinin kullanım biçimini netleştirmesine olanak tanıyan modern bir yaklaşımdır.

Bu standart üç temel sinyal sunar:

  • search: İçeriğin arama dizinine eklenmesi ve sonuçlarda özetlenmesi izni.
  • ai-input: Yapay zekanın çıkarım, anlık yanıt oluşturma ve sorgu bağlamında içeriği kullanma izni.
  • ai-train: İçeriğin temel yapay zeka modellerinin eğitim veri setine dahil edilmesi izni.

Her sinyal için allow veya disallow değeri belirlenebilir. Tercih belirtilmediğinde ilgili alan satırdan tamamen çıkarılır. Cloudflare use uzantısı ise içeriğin kullanım kapsamını immediate, reference veya full olarak daraltabilir.

Yapay Zeka Robots.txt Oluşturucu, dosyanın başına isteğe bağlı olarak Avrupa Birliği 2019/790 sayılı Telif Hakları Direktifi Madde 4 kapsamında metin ve veri madenciliği haklarının saklı tutulduğunu bildiren yasal bir yorum bloğu ekler. Bu bildirim, makine tarafından okunabilir bir çekince beyanı işlevi görür.

Hangi Botları Engellemek Gerekir

Siteniz için doğru bot kuralını belirlemek, içerik hedeflerinize ve iş modelinize bağlıdır. Yapay Zeka Robots.txt Oluşturucu bu süreci kolaylaştırmak için hazır profiller içerir:

  1. Yalnızca Eğitim Botlarını Engelleme: Haber siteleri, blog yazarları ve sektörel yayıncılar için en dengeli seçenektir. Bu hazır ayar GPTBot, ClaudeBot ve Google-Extended gibi eğitim toplayıcılarını engellerken OAI-SearchBot veya ChatGPT-User gibi arama ve getirme araçlarını açık bırakır. Böylece içeriğiniz yapay zeka eğitimine aktarılmaz fakat arama yanıtlarında kaynak gösterilmeye devam eder.
  1. Tüm Yapay Zeka Botlarını Engelleme: Gizliliğin ön planda olduğu siteler veya özel veritabanları için uygundur. Tüm yapay zeka tarayıcılarını engeller, ancak yapay zeka arama motorlarındaki görünürlüğü tamamen sonlandırır.
  1. Yalnızca Sinyaller: Standart bot engellemesi yapmadan sadece Content-Signal satırları ile tercih belirtmek isteyenler içindir.

Google arama sıralamalarınızı etkilemeden Gemini eğitiminden çıkmak isterseniz, Googlebot yerine yalnızca Google-Extended aracısını engellemeniz gerekir.

Robots.txt Sınırları ve Doğrulama

Robots.txt dosyası teknik bir güvenlik duvarı değil, arama motorları ve botlar için gönüllü bir protokol standardıdır. Saygın yapay zeka şirketleri dosyadaki Disallow kurallarına uyar, ancak kötü niyetli veri toplayıcılar bu kuralları yok sayabilir.

Dosyaya yeni bir engelleme kuralı eklemek, geçmişte toplanmış ve eğitilmiş modellerden verinizin silinmesini sağlamaz; yalnızca gelecekteki taramaları durdurur. Kesin koruma gerektiren durumlarda robots.txt kurallarını Cloudflare gibi CDN düzeyinde bot engelleme sistemleri veya sunucu tarafı IP filtreleme kuralları ile desteklemek gerekir.

Yapılandırdığınız dosyanın arama motorları tarafından doğru yorumlandığından emin olmak için robots.txt test aracı üzerinden sözdizimi kontrolü yapabilirsiniz. Bu kontrol, arama motorlarının sitenizde beklenmedik erişim engelleriyle karşılaşmasını önler.

Robots.txt ile llms.txt Arasındaki Fark

Robots.txt ve llms.txt dosyaları yapay zeka sistemleriyle iletişim kurar, ancak amaçları birbirinin zıddıdır. Robots.txt bir kısıtlama ve erişim sınırlandırma belgesidir; botların hangi klasörlere giremeyeceğini ve hangi verileri kullanamayacağını belirler.

Buna karşılık llms.txt, yapay zeka modellerine siteniz hakkında temiz, iyi yapılandırılmış ve Markdown formatında bilgi sunan bir kılavuzdur. Robots.txt protokol standardında resmi bir llms.txt: yönergesi bulunmadığı için, Yapay Zeka Robots.txt Oluşturucu bu bağlantıyı dosya içine standart bir yorum satırı # llms.txt: olarak ekler.

Sitenizi yapay zeka sistemlerine en doğru şekilde tanıtmak ve içeriklerinizi modellerin okuyabileceği formatta yapılandırmak için bir llms.txt oluşturucu kullanarak kök dizininize ilgili dosyayı ekleyebilirsiniz. Bu iki dosya birlikte çalıştığında sitenizin hem veri güvenliği hem de yapay zeka görünürlüğü eksiksiz yönetilir.

En çok yanıtladıklarımız.

Yapay zeka botlarını web sitemden nasıl engellerim?

Yapay Zeka Robots.txt Oluşturucu üzerinden sitenize uygun bir ön ayar seçip oluşturulan kuralları kopyalayarak web sitenizin kök dizinindeki robots.txt dosyasına eklemeniz yeterlidir. Araç, GPTBot, ClaudeBot ve CCBot dahil olmak üzere 50 adetten fazla yapay zeka tarayıcısını doğrudan hedef alır. Dosyanızı sunucuya yükledikten sonra kuralların doğruluğunu robots.txt test aracı ile kontrol edebilirsiniz.

GPTBot, OAI-SearchBot ve ChatGPT-User arasındaki fark nedir?

OpenAI bu botları farklı görevler için görevlendirir. GPTBot, gelecekteki yapay zeka modellerini eğitmek amacıyla genel web verilerini toplar. OAI-SearchBot, SearchGPT ve yapay zeka tabanlı arama sonuçları için siteleri dizine ekler. ChatGPT-User ise bir kullanıcı sohbet esnasında doğrudan bir web sayfası bağlantısı paylaştığında ilgili sayfayı canlı getirmek için çalışır. Eğitim verisi toplanmasını engellerken arama trafiği almaya devam etmek için yalnızca GPTBot engellenebilir.

Yapay zeka botlarını engellemek Google arama sıralamamı düşürür mü?

Hayır, yapay zeka eğitim botlarını engellemek klasik Google arama sıralamalarınızı etkilemez. Google, Gemini modellerinin eğitimi için Google-Extended botunu kullanırken, arama dizini için Googlebot botunu ayrı tutar. robots.txt dosyanızda Google-Extended botunu engellediğinizde web sitenizin Google arama sonuçlarındaki konumu ve dizin durumu korunur.

Content-Signal direktifi ne işe yarar?

Content-Signal, içerik haklarınızı yapay zeka çağında korumak için geliştirilen yeni bir web standardıdır. Standart Disallow komutlarının ötesine geçerek içeriğinizin arama, girdi işleme (ai-input) veya model eğitimi (ai-train) için kullanılıp kullanılamayacağını ayrı ayrı belirtmenize imkan tanır. Bu sayede bir botun sayfayı teknik olarak görmesine izin verirken içeriğin model eğitiminde kullanılmasını kısıtlayabilirsiniz.

robots.txt ile llms.txt arasındaki fark nedir?

robots.txt dosyası hangi tarayıcıların sitenizin hangi bölümlerine erişebileceğini denetleyen kısıtlama protokolüdür. llms.txt ise sitenize erişen yapay zeka modellerine temiz, yapılandırılmış ve özetlenmiş içerik sunan bir rehber dosyasıdır. Web siteniz için özel bir yapay zeka rehberi hazırlamak istiyorsanız llms.txt oluşturucu aracını kullanabilirsiniz.

robots.txt dosyası yapay zeka kazımalarını kesin olarak durdurur mu?

robots.txt kuralları teknik bir şifreleme veya güvenlik duvarı değil, botların uyması beklenen standart bir protokoldür. OpenAI, Anthropic ve Google gibi büyük yapay zeka geliştiricileri bu kurallara uyar. Standartlara uymayan kötü niyetli veri kazıma botlarını engellemek için robots.txt kurallarını Cloudflare veya sunucu düzeyindeki güvenlik duvarı (WAF) filtreleriyle desteklemeniz önerilir.

Yapay zeka botlarını yalnızca belirli bir klasörde engellemek mümkün mü?

Evet, Yapay Zeka Robots.txt Oluşturucu üzerindeki engelleme yolu alanını varsayılan kök dizin yerine özel bir dizin yoluyla değiştirebilirsiniz. Örneğin bu alana /taslaklar/ veya /arsiv/ yazdığınızda oluşturulan tüm yapay zeka engelleme kuralları yalnızca belirtilen klasör için geçerli olur ve sitenizin geri kalanı taranabilir durumda kalır.