Wybierz język

Tester i walidator plików robots.txt

Sprawdź reguły robots.txt dla Googlebot, GPTBot i innych crawlerów. Weryfikuj blokady URL, priorytety dyrektyw oraz poprawność składni RFC 9309.

Tester robots.txtJak to działa ↓
Wklej plik udostępniany pod adresem /robots.txt. Analiza odbywa się w przeglądarce, dane nie są nigdzie przesyłane.
Identyfikator bota, np. Googlebot, GPTBot, ClaudeBot, lub pełny ciąg User-Agent
Jeden na wiersz. Pełne adresy URL są skracane do ścieżki i parametrów zapytania.

Działa zgodnie z RFC 9309, uwzględniając symbol wieloznaczny * oraz znacznik końca linii $: własna grupa crawlera ma pierwszeństwo przed grupą *, decyduje najdłuższa pasująca reguła, a w przypadku remisu wygrywa Allow. Prawdziwe crawlery mogą w skrajnych przypadkach zachowywać się inaczej.

Mehmet Demiray Opublikowano Zaktualizowano
Udostępnij

Jak działa dopasowywanie reguł w robots.txt

Plik robots.txt organizuje instrukcje w grupy zaczynające się od co najmniej jednej linii User-agent. Każdy robot indeksujący, który odwiedza witrynę, szuka sekcji przypisanej bezpośrednio do jego identyfikatora. Zgodnie ze standardem RFC 9309 crawler najpierw sprawdza, czy istnieje grupa z jego dokładną nazwą (na przykład Googlebot lub GPTBot). Jeśli jej nie znajdzie, szuka tokenu nadrzędnego (na przykład Googlebot-Image przechodzi do reguł dla Googlebot). Dopiero przy braku dedykowanej grupy bot stosuje ogólną grupę oznaczoną gwiazdką User-agent: *.

Kluczową zasadą jest to, że znalezienie dopasowanej grupy zastępuje reguły ogólne, zamiast się z nimi łączyć. Jeżeli w pliku zdefiniowano reguły dla * oraz osobną grupę dla GPTBot, robot ten odczyta wyłącznie instrukcje ze swojej sekcji i całkowicie zignoruje dyrektywy z grupy *. Tester robots.txt pozwala sprawdzić, która grupa zostanie przypisana do wybranego crawlera i jakie reguły faktycznie wpłyną na jego zachowanie podczas pobierania podstron.

Zasada najdłuższego dopasowania i pierwszeństwo reguł

Gdy robot przypisze się do odpowiedniej grupy, analizuje zawarte w niej dyrektywy Allow oraz Disallow. W przypadku konfliktu, gdy pod dany adres URL pasuje więcej niż jedna reguła, wygrywa zasada najdłuższego dopasowania (ang. longest match). Liczy się długość ścieżki podanej w dyrektywie, mierzona w znakach. Jeśli długości dopasowanych reguł są identyczne, priorytet otrzymuje reguła zezwalająca Allow.

Dyrektywa Ścieżka URL Wynik dopasowania Uzasadnienie
Disallow: /katalog/ /katalog/produkt Blokada Dopasowanie o długości 9 znaków
Allow: /katalog/produkt /katalog/produkt Zezwolenie Dłuższa reguła wygrywa (16 znaków)
Disallow: / oraz Allow: / /kontakt Zezwolenie Remis długości, wygrywa Allow
Pusty Disallow: /dowolna-strona Zezwolenie Pusta dyrektywa czyści wcześniejsze blokady

Większość nowoczesnych crawlerów obsługuje również znaki specjalne, które nie były częścią pierwotnego standardu: gwiazdkę * oznaczającą dowolny ciąg znaków oraz znak dolara $ oznaczający koniec adresu URL. Przykładowo reguła Disallow: /*.pdf$ zablokuje wyłącznie pliki kończące się rozszerzeniem PDF, pozwalając na pobieranie adresów z parametrami takimi jak /plik.pdf?wersja=2.

Testowanie botów AI i dyrektywa Content-Signal

Rozwój generatywnej sztucznej inteligencji wprowadził do sieci nową klasę crawlerów, takich jak GPTBot, ClaudeBot, CCBot czy Google-Extended. Właściciele stron internetowych coraz częściej decydują o selektywnym blokowaniu pobierania treści na potrzeby trenowania modeli przy jednoczesnym zachowaniu widoczności w tradycyjnych wynikach wyszukiwania. Aby poprawnie skonstruować zestaw reguł dla tych botów, warto wykorzystać generator reguł robots.txt dla botów AI, a następnie przetestować wynikowy plik w narzędziu diagnostycznym.

Niektóre pliki wprowadzają dyrektywę Content-Signal, która służy do deklarowania preferencji dotyczących wykorzystania materiałów w modelach maszynowych (wartości takie jak search, ai-input czy ai-train). Tester robots.txt odczytuje tę linię i raportuje jej obecność dla testowanego agenta. Należy pamiętać, że Content-Signal jest deklaracją intencji wydawcy, a nie techniczną blokadą protokołu HTTP. Do weryfikacji tożsamości robotów i potwierdzenia, czy dany agent faktycznie reprezentuje deklarowaną organizację, służy z kolei generator kluczy autoryzacyjnych.

Najczęstsze błędy składniowe w plikach robots.txt

Nawet drobny błąd w formacie pliku może sprawić, że wyszukiwarki zinterpretują instrukcje niezgodnie z intencją administratora. Tester robots.txt automatycznie analizuje strukturę tekstu i oznacza potencjalne nieprawidłowości:

  1. Dyrektywy umieszczone przed pierwszym nagłówkiem User-agent: reguły Allow lub Disallow znajdujące się na samym początku pliku bez przypisanego robota są ignorowane.
  2. Ścieżki względne bez początkowego ukośnika: zapis Disallow: panel/ jest niepoprawny, każda ścieżka musi zaczynać się od znaku /, na przykład Disallow: /panel/.
  3. Stosowanie dyrektyw specyficznych dla wybranych wyszukiwarek: komendy Host czy Clean-param są interpretowane jedynie przez niektóre systemy regionalne (na przykład Yandex), a pozostałe boty traktują je jako nieznane linie.
  4. Użycie Crawl-delay: dyrektywa opóźnienia pobierania nie jest częścią specyfikacji RFC 9309 i Google całkowicie ją ignoruje.
  5. Próba ukrycia strony przed indeksowaniem przez Disallow: plik robots.txt kontroluje jedynie pobieranie zasobów (crawling). Zablokowany adres URL może nadal pojawić się w wynikach wyszukiwania, jeśli prowadzą do niego odnośniki z innych witryn.

Zakres działania i środowisko uruchomieniowe testera

Tester robots.txt działa w całości w przeglądarce internetowej użytkownika. Narzędzie nie wysyła zapytań sieciowych po pliki z serwera ani nie wymaga podawania danych uwierzytelniających. Oznacza to, że można w nim bezpiecznie testować robocze wersje plików, środowiska stagingowe oraz prywatne konfiguracje bez ryzyka wycieku danych poza urządzenie.

Narzędzie skupia się na symulacji parsera zgodnego ze standardem RFC 9309. Z wklejonych pełnych adresów URL wyodrębniana jest ścieżka wraz z parametrami zapytania (query string). Tester nie pobiera kodu HTML sprawdzanych podstron, nie bada nagłówków HTTP X-Robots-Tag ani tagów meta robots w sekcji nagłówkowej witryny. Do kompletnego opisu struktury treści dla nowoczesnych systemów uczących się oprócz standardowych dyrektyw indeksowania warto wdrożyć również dedykowany plik llms.txt, który wspiera komunikację z modelami językowymi.

Najczęściej zadawane pytania.

Jak sprawdzić, czy dany adres URL jest blokowany przez robots.txt?

Wklej treść pliku do pola tekstowego w narzędziu Tester robots.txt, wybierz lub wpisz nazwę bota, na przykład Googlebot lub GPTBot, a następnie podaj listę adresów URL lub ścieżek, po jednym na wiersz. Narzędzie przeanalizuje reguły zgodnie ze standardem RFC 9309 i wskaże dokładny wiersz oraz dyrektywę decydującą o zezwoleniu lub blokadzie.

Co się dzieje, gdy do jednego adresu pasują reguły Allow oraz Disallow?

Zgodnie ze standardem RFC 9309 o pierwszeństwie decyduje długość pasującego wzorca ścieżki. Zawsze wygrywa reguła bardziej szczegółowa z dłuższym ciągiem znaków. W przypadku remisu, gdy obie dyrektywy mają dokładnie taką samą długość, pierwszeństwo ma dyrektywa Allow.

Do czego służy dyrektywa Content-Signal i czy blokuje roboty AI?

Dyrektywa Content-Signal przekazuje deklarację wydawcy dotyczącą wykorzystania treści przez modele sztucznej inteligencji, na przykład do celów wyszukiwania lub trenowania modeli. Tester robots.txt odczytuje tę wartość i informuje o jej obecności w danej grupie, jednak sam parametr stanowi deklarację dla botów, a nie techniczną blokadę pobierania. Do przygotowania kompletnego zestawu reguł możesz wykorzystać generator robots.txt dla AI.

Jak parser traktuje bota, którego nazwa nie występuje w pliku?

Jeśli dany robot nie ma dedykowanej sekcji User-agent, parser przypisuje go automatycznie do grupy ogólnej oznaczonej gwiazdką User-agent: *. W sytuacji, gdy w pliku brakuje także sekcji ogólnej, robot ma domyślnie pełny dostęp do wszystkich zasobów witryny.

Czy zablokowanie adresu w pliku robots.txt usuwa go z indeksu Google?

Zablokowanie ścieżki przez Disallow powstrzymuje robota przed pobraniem zawartości strony, ale nie zapobiega jej indeksowaniu. Jeśli do zablokowanego adresu prowadzą odnośniki z innych witryn, wyszukiwarka może umieścić sam adres URL w wynikach wyszukiwania bez opisu i fragmentu treści.

Czym Tester robots.txt różni się od raportu w Google Search Console?

Raport w Google Search Console sprawdza wyłącznie plik opublikowany na zweryfikowanej domenie i ogranicza się głównie do robotów Google. Tester robots.txt działa lokalnie w przeglądarce, nie wymaga posiadania konta ani weryfikacji witryny i pozwala testować robocze wersje plików dla dowolnych robotów, w tym crawlerów AI takich jak ClaudeBot czy GPTBot.

Dlaczego narzędzie oznacza regułę Crawl-delay jako ostrzeżenie?

Dyrektywa Crawl-delay nie wchodzi w skład oficjalnego standardu RFC 9309. Googlebot całkowicie ją ignoruje, a pozostałe wyszukiwarki interpretują jej wartości w odmienny sposób, dlatego Tester robots.txt klasyfikuje ten wiersz jako niestandardowe rozszerzenie.

Czy wklejana treść pliku robots.txt jest wysyłana na zewnętrzny serwer?

Weryfikacja składni i dopasowywanie ścieżek odbywa się w całości w Twojej przeglądarce. Narzędzie nie przesyła wklejonych reguł ani testowanych adresów na żaden serwer, co gwarantuje pełną prywatność podczas przygotowywania wersji roboczych przed wdrożeniem produkcyjnym.