Dil seçin

Robots.txt Test ve URL Erişim Kontrolü

Robots.txt kurallarını tarayıcıda analiz edin. Googlebot ve yapay zeka botları için URL izin ve engelleme durumlarını satır bazında denetleyin.

Robots.txt Test AracıNasıl çalışır? ↓
/robots.txt konumundaki içeriği yapıştırın. Değerlendirme tarayıcınızda yapılır, hiçbir veri sunucuya yüklenmez.
Googlebot, GPTBot veya ClaudeBot gibi bir ürün belirteci ya da tam User-Agent dizesi
Her satıra bir tane. Tam URL adresleri yol ve sorgu parametrelerine indirgenir.

RFC 9309 standardına uyar, buna * joker karakteri ve $ bitiş çıpası da dahildir: Tarayıcının kendi grubu * grubuna göre önceliklidir, en uzun eşleşen kural geçerli olur ve eşitlik durumunda Allow kazanır. Gerçek tarayıcılar uç durumlarda farklılık gösterebilir.

Mehmet Demiray Yayınlandı Güncellendi
Paylaş

Robots.txt Eşleşme Mantığı Nasıl Çalışır?

Arama motoru ve yapay zeka botları bir web sitesini ziyaret ettiğinde ilk olarak kök dizindeki robots.txt dosyasını talep eder. Bu dosya, RFC 9309 standardına göre yapılandırılmış direktif gruplarından oluşur. Her grup bir veya birden fazla User-agent satırı ile başlar ve ardından gelen Allow ile Disallow kurallarını tanımlar.

Bir tarayıcı bot robots.txt dosyasını ayrıştırırken kendine en uygun tek bir grubu seçer:

  1. Kendi özel belirtecini (örneğin Googlebot veya GPTBot) arar.
  2. Özel belirteç bulamazsa tire ile ayrılmış üst belirtece bakar (örneğin Googlebot-Image için Googlebot).
  3. Özel bir grup tanımlı değilse genel User-agent: * grubundaki kuralları uygular.
  4. Dosyada hiçbir grup botla eşleşmiyorsa veya dosya boşsa tüm URL adreslerine erişim serbest kabul edilir.

Önemli bir ayrıntı, özel bir bot grubunun genel * grubundaki kuralları miras almamasıdır. Googlebot için özel bir blok açtığınızda, genel bloktaki kurallar bu bot için tamamen geçersiz kalır. Robots.txt Test Aracı, yapıştırdığınız içerikte seçilen bot belirtecinin hangi gruba girdiğini tam olarak tespit eder ve kararları bu öncelik hiyerarşisine göre üretir.

En Uzun Kural Önceliği ve Karar Mekanizması

Robots.txt kuralları arasında çakışma olduğunda karar mekanizması en uzun eşleşen karakter dizisi kuralına dayanır. Satır sırasının bir önemi yoktur; URL yolu ile en çok karakteri örtüşen direktif kazanır.

Aşağıdaki tabloda standart eşleşme mantığı örneklenmiştir:

Kural Test Edilen URL Karar Neden
Disallow: /urunler/ /urunler/ayakkabi Engellendi 10 karakter Disallow eşleşmesi
Allow: /urunler/ayakkabi /urunler/ayakkabi İzin Verildi 19 karakter Allow eşleşmesi daha uzun
Disallow: /kategori + Allow: /kategori /kategori İzin Verildi Eşit uzunlukta Allow kuralı önceliklidir
Disallow: /*.pdf$ /belgeler/rapor.pdf Engellendi $ son ek karakteriyle tam eşleşme
Disallow: /her-yer İzin Verildi Boş Disallow tüm siteye izin verir

Joker karakter * sıfır veya daha fazla karakteri temsil ederken, $ işareti yolun sonunu belirtir. Örneğin /*.pdf$ kuralı PDF uzantısıyla biten adresleri engellerken /dosya.pdf?v=1 gibi parametreli adresleri kapsamaz. Karakter sayısı eşit olan çakışmalarda standart gereği her zaman Allow direktifi geçerli sayılır.

Yapay Zeka Botları ve Content-Signal Direktifi

Güncel web ekosisteminde arama motoru botlarının yanı sıra büyük dil modellerini besleyen yapay zeka tarayıcıları da yaygınlaşmaktadır. OpenAI tarafından işletilen GPTBot, Anthropic bünyesindeki ClaudeBot veya Google kaynaklı Google-Extended belirteçleri robots.txt üzerinden yönetilebilir. Bu botlara yönelik kuralları oluşturmak için Yapay Zeka Botları Robots.txt Oluşturucu sayfasından yararlanabilirsiniz.

Yapay zeka alanındaki yeni standartlardan biri Content-Signal direktifidir. Bu satır içerik sahiplerinin verilerini üç temel boyutta nasıl lisansladığını makine tarafından okunabilir biçimde ifade eder:

  • search: Arama sonuçlarında özetleme izni
  • ai-input: RAG veya anlık çıkarım modellerinde bağlam olarak kullanım
  • ai-train: Yapay zeka temel model eğitiminde veri seti olarak kullanım

Robots.txt Test Aracı, ayrıştırdığı blok içerisinde Content-Signal tanımı varsa bu değeri raporlar. Bu direktif teknik bir HTTP engellemesi yaratmaz; botlara içeriğin hangi amaçlarla işlenebileceğini bildiren bir hak beyanıdır. Bot kimliklerini sunucu seviyesinde doğrulamak adına Web Botu Kimlik Doğrulama Anahtarı Oluşturucu aracını inceleyebilirsiniz.

En Sık Yapılan Robots.txt Hataları

Robots.txt dosyasında yapılan küçük bir yazım yanlışı sayfaların arama dizininden düşmesine veya istenmeyen içeriklerin taranmasına yol açabilir. Sözdizimi ayrıştırıcıların en sık tespit ettiği uyarılar şunlardır:

  1. İlk User-agent öncesinde kural yazmak: Dosyanın en başında herhangi bir bot grubu tanımlanmadan yazılan Allow veya Disallow satırları standart dışıdır ve tarayıcılar tarafından yok sayılır.
  2. Yolların / ile başlamaması: Disallow: admin şeklindeki bir kural geçersizdir. Doğru kullanım Disallow: /admin olmalıdır.
  3. Crawl-delay kullanımı: Yandex gibi bazı tarayıcılar desteklese de bu direktif RFC 9309 standardında yer almaz ve Google tarafından dikkate alınmaz.
  4. Robots.txt içine Noindex eklemek: Google dahil ana akım arama motorları robots.txt içerisindeki Noindex satırını tanımaz. İndekslenmeyi engellemek için HTTP yanıt başlığında veya HTML kaynak kodunda noindex meta etiketi kullanılmalıdır.
  5. Büyük/küçük harf duyarlılığı: URL yolları büyük ve küçük harfe duyarlıdır. /Urunler için tanımlanan kural /urunler yolunu kapsamaz.

Robots.txt sadece tarama faaliyetini engeller. Engellenen bir sayfa başka sitelerden bağlantı alıyorsa arama motoru sayfanın içeriğini okuyamasa bile URL adresini arama sonuçlarında gösterebilir.

Robots.txt Test Aracının Kapsamı ve Güvenlik Avantajı

Robots.txt Test Aracı tamamen tarayıcınızın yerel belleğinde çalışan bir simülatördür. Harici bir web sitesine canlı istek göndermez, yapıştırdığınız taslak kuralları uzak sunuculara kaydetmez. Bu yapı geliştirme aşamasındaki veya henüz yayına alınmamış kapalı ağ projelerindeki robots.txt dosyalarını güvenle test etmenize olanak tanır.

Aracın kapsam sınırlarını bilmek doğru analiz yapmanıza yardımcı olur:

  • Araç canlı URL indeksleme durumunu veya arama konsolu kapsam verilerini kontrol etmez.
  • Yüzde kodlaması içeren URL adreslerinde karakter standardizasyonu yapmaz; kuralları doğrudan girilen metin üzerinden karşılaştırır.
  • Site haritası satırlarını (Sitemap:) listeler ancak harita içerisindeki bağlantıların geçerliliğini denetlemez.

Yapay zeka modellerine siteniz hakkında daha temiz bağlam sağlamak istiyorsanız kök dizininize llms.txt Dosyası Oluşturucu ile yapılandırılmış bir rehber dosya ekleyebilirsiniz. Robots.txt Test Aracı üzerinden elde ettiğiniz kararları CSV veya görsel formatında dışa aktararak teknik denetim raporlarınıza ekleyebilirsiniz.

En çok yanıtladıklarımız.

Bir URL adresinin robots.txt kuralları tarafından engellenip engellenmediğini nasıl test edebilirim?

Robots.txt Test Aracı içerisine dosyanızın metnini yapıştırıp test etmek istediğiniz tarayıcıyı (örneğin Googlebot veya GPTBot) belirlemeniz yeterlidir. Ardından kontrol etmek istediğiniz URL yollarını alt alta girdiğinizde, araç her bağlantı için izin veya engelleme durumunu ve karara kaynaklık eden satır numarasını gösterir.

Test yapmak için web sitemin yayında olması veya üyelik açmam gerekir mi?

Herhangi bir kayıt işlemi veya yayında olan bir web sitesi gerekmez. Henüz sunucunuza yüklemediğiniz taslak robots.txt metinlerini doğrudan yapıştırarak deneyebilirsiniz. Tüm ayrıştırma ve kontrol işlemleri tarayıcınızda yerel olarak yürütülür, dosya verileriniz dışarı aktarılmaz.

Aynı URL için hem Allow hem de Disallow kuralı eşleşirse hangisi geçerli olur?

RFC 9309 standardı uyarınca en uzun ve en ayrıntılı kural eşleşmesi öncelik kazanır. Örneğin Disallow kuralı /kategori/ yolunu, Allow kuralı ise /kategori/detay/ yolunu hedefliyorsa, karakter sayısı daha uzun olan Allow kuralı uygulanır. Kural uzunluklarının eşit olduğu durumlarda ise Allow kuralı geçerli kabul edilir.

GPTBot veya ClaudeBot gibi yapay zeka tarayıcılarını nasıl test edebilirim?

İlgili botun adını kullanıcı aracısı alanına girerek kurallarınızı sınayabilirsiniz. Yapay zeka botlarına yönelik özel direktifler hazırlamak için yapay zeka robots.txt oluşturucu aracımızdan faydalanabilirsiniz. Dosyanızdaki Content-Signal tanımları ve botlara özel izinler bu test aracında ayrıntılı şekilde raporlanır.

Bir sayfayı robots.txt ile engellemek o sayfanın arama sonuçlarından silinmesini sağlar mı?

Hayır, robots.txt dosyası arama motorlarının sayfayı taramasını kısıtlar fakat dizine eklenmesini tamamen engellemez. Harici sitelerden engellenmiş sayfaya bağlantı veriliyorsa Google bu sayfayı içeriğini okumadan arama dizininde tutabilir. Sayfayı dizinden bütünüyle kaldırmak için noindex meta etiketinin kullanılması ve botun bu etiketi okuyabilmesi için tarama izninin bulunması gerekir.

Kurallarda yer alan yıldız ve dolar işaretleri ne anlama gelir?

Yıldız işareti sıfır veya daha fazla sayıda herhangi bir karakteri temsil eden joker bir belirteçtir. Dolar işareti ise URL adresinin tam olarak o karakterle bittiğini ifade eder. Örneğin /*.pdf$ kuralı yalnızca PDF uzantısı ile sonlanan tüm dosya yollarını hedefler.

Bu aracın Google Search Console robots.txt raporundan farkı nedir?

Google Search Console yalnızca sitenizde yayında olan ve doğrulanmış mülklerdeki Googlebot davranışını gösterir. Robots.txt Test Aracı ise henüz canlıya alınmamış taslakları, Bingbot, Yandexbot veya yapay zeka botları gibi farklı tüm kullanıcı aracılarına karşı anında ve mülk doğrulaması gerekmeksizin test etmenize olanak tanır.