Robots.txt Eşleşme Mantığı Nasıl Çalışır?
Arama motoru ve yapay zeka botları bir web sitesini ziyaret ettiğinde ilk olarak kök dizindeki robots.txt dosyasını talep eder. Bu dosya, RFC 9309 standardına göre yapılandırılmış direktif gruplarından oluşur. Her grup bir veya birden fazla User-agent satırı ile başlar ve ardından gelen Allow ile Disallow kurallarını tanımlar.
Bir tarayıcı bot robots.txt dosyasını ayrıştırırken kendine en uygun tek bir grubu seçer:
- Kendi özel belirtecini (örneğin
Googlebot veya GPTBot) arar.
- Özel belirteç bulamazsa tire ile ayrılmış üst belirtece bakar (örneğin
Googlebot-Image için Googlebot).
- Özel bir grup tanımlı değilse genel
User-agent: * grubundaki kuralları uygular.
- Dosyada hiçbir grup botla eşleşmiyorsa veya dosya boşsa tüm URL adreslerine erişim serbest kabul edilir.
Önemli bir ayrıntı, özel bir bot grubunun genel * grubundaki kuralları miras almamasıdır. Googlebot için özel bir blok açtığınızda, genel bloktaki kurallar bu bot için tamamen geçersiz kalır. Robots.txt Test Aracı, yapıştırdığınız içerikte seçilen bot belirtecinin hangi gruba girdiğini tam olarak tespit eder ve kararları bu öncelik hiyerarşisine göre üretir.
En Uzun Kural Önceliği ve Karar Mekanizması
Robots.txt kuralları arasında çakışma olduğunda karar mekanizması en uzun eşleşen karakter dizisi kuralına dayanır. Satır sırasının bir önemi yoktur; URL yolu ile en çok karakteri örtüşen direktif kazanır.
Aşağıdaki tabloda standart eşleşme mantığı örneklenmiştir:
| Kural |
Test Edilen URL |
Karar |
Neden |
Disallow: /urunler/ |
/urunler/ayakkabi |
Engellendi |
10 karakter Disallow eşleşmesi |
Allow: /urunler/ayakkabi |
/urunler/ayakkabi |
İzin Verildi |
19 karakter Allow eşleşmesi daha uzun |
Disallow: /kategori + Allow: /kategori |
/kategori |
İzin Verildi |
Eşit uzunlukta Allow kuralı önceliklidir |
Disallow: /*.pdf$ |
/belgeler/rapor.pdf |
Engellendi |
$ son ek karakteriyle tam eşleşme |
Disallow: |
/her-yer |
İzin Verildi |
Boş Disallow tüm siteye izin verir |
Joker karakter * sıfır veya daha fazla karakteri temsil ederken, $ işareti yolun sonunu belirtir. Örneğin /*.pdf$ kuralı PDF uzantısıyla biten adresleri engellerken /dosya.pdf?v=1 gibi parametreli adresleri kapsamaz. Karakter sayısı eşit olan çakışmalarda standart gereği her zaman Allow direktifi geçerli sayılır.
Yapay Zeka Botları ve Content-Signal Direktifi
Güncel web ekosisteminde arama motoru botlarının yanı sıra büyük dil modellerini besleyen yapay zeka tarayıcıları da yaygınlaşmaktadır. OpenAI tarafından işletilen GPTBot, Anthropic bünyesindeki ClaudeBot veya Google kaynaklı Google-Extended belirteçleri robots.txt üzerinden yönetilebilir. Bu botlara yönelik kuralları oluşturmak için Yapay Zeka Botları Robots.txt Oluşturucu sayfasından yararlanabilirsiniz.
Yapay zeka alanındaki yeni standartlardan biri Content-Signal direktifidir. Bu satır içerik sahiplerinin verilerini üç temel boyutta nasıl lisansladığını makine tarafından okunabilir biçimde ifade eder:
search: Arama sonuçlarında özetleme izni
ai-input: RAG veya anlık çıkarım modellerinde bağlam olarak kullanım
ai-train: Yapay zeka temel model eğitiminde veri seti olarak kullanım
Robots.txt Test Aracı, ayrıştırdığı blok içerisinde Content-Signal tanımı varsa bu değeri raporlar. Bu direktif teknik bir HTTP engellemesi yaratmaz; botlara içeriğin hangi amaçlarla işlenebileceğini bildiren bir hak beyanıdır. Bot kimliklerini sunucu seviyesinde doğrulamak adına Web Botu Kimlik Doğrulama Anahtarı Oluşturucu aracını inceleyebilirsiniz.
Robots.txt Test Aracının Kapsamı ve Güvenlik Avantajı
Robots.txt Test Aracı tamamen tarayıcınızın yerel belleğinde çalışan bir simülatördür. Harici bir web sitesine canlı istek göndermez, yapıştırdığınız taslak kuralları uzak sunuculara kaydetmez. Bu yapı geliştirme aşamasındaki veya henüz yayına alınmamış kapalı ağ projelerindeki robots.txt dosyalarını güvenle test etmenize olanak tanır.
Aracın kapsam sınırlarını bilmek doğru analiz yapmanıza yardımcı olur:
- Araç canlı URL indeksleme durumunu veya arama konsolu kapsam verilerini kontrol etmez.
- Yüzde kodlaması içeren URL adreslerinde karakter standardizasyonu yapmaz; kuralları doğrudan girilen metin üzerinden karşılaştırır.
- Site haritası satırlarını (
Sitemap:) listeler ancak harita içerisindeki bağlantıların geçerliliğini denetlemez.
Yapay zeka modellerine siteniz hakkında daha temiz bağlam sağlamak istiyorsanız kök dizininize llms.txt Dosyası Oluşturucu ile yapılandırılmış bir rehber dosya ekleyebilirsiniz. Robots.txt Test Aracı üzerinden elde ettiğiniz kararları CSV veya görsel formatında dışa aktararak teknik denetim raporlarınıza ekleyebilirsiniz.