Pilih bahasa

Uji Aturan Robots.txt dan Akses Bot Peramban

Simulasikan aturan robots.txt langsung di peramban. Cek izin akses URL untuk Googlebot atau bot AI lengkap dengan baris penyebab dan sintaks RFC 9309.

Penguji Robots.txtCara kerja ↓
Tempel file seperti yang disajikan pada /robots.txt. Diproses langsung di browser Anda tanpa mengunggah data.
Token produk seperti Googlebot, GPTBot, atau ClaudeBot, atau string User-Agent lengkap
Satu per baris. URL lengkap dipersingkat menjadi jalur dan kueri.

Mengikuti RFC 9309, termasuk karakter pengganti * dan jangkar akhir $: grup milik crawler diprioritaskan di atas grup *, aturan yang cocok paling panjang menjadi pemenang, dan jika ada hasil imbang maka Allow yang berlaku. Crawler sebenarnya mungkin memiliki perilaku berbeda pada kasus khusus.

Mehmet Demiray Diterbitkan Diperbarui
Bagikan

Cara Kerja Pengelompokan dan Pencocokan Robots.txt

Berkas robots.txt bekerja berdasarkan pembagian kelompok aturan yang ditujukan untuk perayap web tertentu. Setiap kelompok diawali oleh satu atau beberapa baris User-agent. Berdasarkan standar RFC 9309, perayap web akan mencari kelompok yang paling spesifik sesuai dengan identitas produknya sebelum membaca direktif perizinan.

Saat bot seperti Googlebot memproses berkas, urutan pencarian kelompok berlangsung sebagai berikut:

  1. Pencocokan langsung dengan nama token bot, misalnya User-agent: Googlebot.
  2. Pencocokan token induk jika token bot memiliki tanda hubung, misalnya Googlebot-Image akan beralih ke kelompok Googlebot jika kelompok khususnya tidak ditemukan.
  3. Pencocokan kelompok umum yaitu User-agent: *.

Jika perayap menemukan kelompok khusus untuk dirinya, bot tersebut hanya akan menjalankan aturan di dalam kelompok tersebut dan mengabaikan seluruh kelompok *. Aturan dari kelompok umum tidak digabungkan ke kelompok khusus. Jika bot tidak menemukan kelompok yang cocok sama sekali dan tidak ada kelompok bintang, seluruh jalur situs dianggap diizinkan secara penuh. Penguji Robots.txt mensimulasikan hierarki pemilihan kelompok ini secara persis agar hasil evaluasi sesuai dengan perilaku bot sebenarnya.

Prinsip Jalur Terpanjang dan Penyelesaian Konflik Aturan

Ketika beberapa baris direktif cocok dengan sebuah tautan URL, standar RFC 9309 menetapkan bahwa aturan dengan pola karakter terpanjang yang akan menang. Panjang pola dihitung berdasarkan jumlah karakter pada jalur yang ditulis setelah direktif Allow atau Disallow.

Direktif Jalur Pola Panjang Karakter Hasil untuk /katalog/buku/
Disallow /katalog/ 9 Kalah (lebih pendek)
Allow /katalog/buku/ 14 Menang (diizinkan)

Jika aturan Allow dan Disallow memiliki panjang karakter yang sama persis untuk suatu URL, maka aturan Allow yang diprioritaskan. Karakter khusus juga mengubah cara pencocokan pola:

  • Tanda bintang * mewakili nol atau deretan karakter apa pun.
  • Tanda dolar $ menandai akhir dari jalur URL, seperti /*.pdf$ yang hanya memblokir tautan dengan akhiran berkas dokumen tersebut.
  • Direktif Disallow: tanpa jalur dianggap membatalkan seluruh pemblokiran sebelumnya dan mengizinkan perayapan.

Penguji Robots.txt memeriksa seluruh baris aturan, menghitung bobot karakter, dan menampilkan baris spesifik yang menjadi penentu akhir status URL.

Evaluasi Akses Perayap AI dan Baris Content-Signal

Pengelolaan bot kecerdasan buatan kini menjadi kebutuhan penting bagi pemilik situs web dan penerbit konten daring. Berbagai sistem AI menggunakan token perayap khusus seperti GPTBot, ClaudeBot, PerplexityBot, serta Google-Extended untuk mengumpulkan data pelatihan maupun penelusuran langsung.

Anda dapat merancang pemisahan akses yang jelas pada berkas pengaturan. Anda dapat mengizinkan mesin pencari konvensional sembari membatasi bot pengumpul data AI. Untuk menyusun struktur aturan tersebut sebelum diuji, Anda bisa memanfaatkan alat pembuat robots.txt perayap AI.

Standar modern juga mulai memperkenalkan direktif Content-Signal untuk menyatakan preferensi penggunaan konten secara terstruktur:

  • search: penggunaan konten untuk keperluan indeks penelusuran.
  • ai-input: pemanfaatan konten sebagai rujukan konteks langsung pada kueri AI.
  • ai-train: izin atau larangan pelatihan model pembelajaran mesin dengan data situs.

Penguji Robots.txt mendeteksi keberadaan direktif Content-Signal di dalam kelompok yang aktif dan melaporkan nilainya kepada pengguna, sehingga Anda dapat memastikan deklarasi hak cipta digital Anda terbaca dengan tepat.

Kesalahan Sintaksis Umum yang Sering Terjadi

Kesalahan kecil dalam penulisan robots.txt dapat menyebabkan halaman penting tidak terindeks atau sebaliknya, area privat terbuka bagi perayap. Penguji Robots.txt memindai struktur berkas dan memberikan peringatan otomatis terhadap kekeliruan sintaksis.

Beberapa kesalahan yang paling sering ditemukan meliputi:

  1. Menuliskan aturan Allow atau Disallow sebelum mendeklarasikan baris User-agent. Setiap aturan wajib berada di bawah kepala kelompok.
  2. Jalur yang tidak diawali garis miring /. Format Disallow: admin tidak valid menurut standar dan harus ditulis menjadi Disallow: /admin.
  3. Menggunakan direktif non-standar seperti Crawl-delay. Mesin perayap utama seperti Googlebot mengabaikan baris ini.
  4. Memasukkan direktif Noindex ke dalam robots.txt. Mesin pencari telah menghentikan dukungan terhadap perintah ini di dalam berkas perayapan.
  5. Mengabaikan sifat peka huruf besar-kecil (case-sensitive). Jalur /Produk/ tidak sama dengan /produk/.

Perlu dipahami bahwa memblokir URL pada robots.txt hanya mencegah bot mengunduh isi halaman. Halaman yang diblokir masih bisa muncul di hasil pencarian jika terdapat tautan dari situs luar yang mengarah ke alamat tersebut.

Keamanan Pengujian Lokal dan Batasan Fungsional

Penguji Robots.txt beroperasi sepenuhnya di dalam peramban web tanpa mengirimkan teks atau draf Anda ke server eksternal. Anda dapat menguji rancangan berkas konfigurasi untuk lingkungan pengujian internal sebelum berkas tersebut dipublikasikan ke server produksi.

Alat ini bekerja berdasarkan teks mentah yang ditempelkan langsung. Karena tidak melakukan penarikan data jaringan secara langsung (live fetch), pengujian ini murni mengevaluasi logika pola dan kesesuaian sintaksis terhadap standar RFC 9309. URL lengkap yang dimasukkan pada daftar pengujian akan otomatis dipotong menjadi bagian jalur dan parameter kueri saja.

Untuk melengkapi tata kelola situs secara menyeluruh, Anda dapat memadukan pengelolaan izin bot dengan berkas ringkasan konteks melalui pembuat berkas llms.txt. Untuk lapisan keamanan teknis tingkat lanjut, verifikasi identitas bot dapat diperkuat dengan generator kunci autentikasi bot web guna memastikan bahwa perayap yang mengunjungi server benar-benar entitas resmi.

Yang paling sering kami jawab.

Bagaimana cara menguji aturan perayapan URL menggunakan Penguji Robots.txt?

Tempelkan isi draf berkas robots.txt ke kolom teks, tentukan nama bot perayap seperti Googlebot atau GPTBot, lalu masukkan daftar path atau URL yang ingin dievaluasi. Penguji Robots.txt akan langsung menampilkan status izin akses setiap URL beserta nomor baris aturan penentunya.

Apa yang terjadi jika aturan Allow dan Disallow memiliki pola yang sama-sama cocok?

Sesuai standar RFC 9309, aturan dengan pola pencocokan karakter terpanjang yang akan berlaku. Jika kedua aturan memiliki panjang karakter yang persis sama, aturan Allow akan diprioritaskan mengalahkan Disallow.

Mengapa perayap khusus seperti Googlebot-Image tetap terpengaruh oleh aturan Googlebot?

Token perayap bertanda hubung menerapkan mekanisme fallback ke token induk. Jika berkas robots.txt tidak menyediakan grup aturan khusus untuk Googlebot-Image, bot tersebut secara otomatis menggunakan grup aturan Googlebot sebelum akhirnya beralih ke grup wildcard.

Apakah memblokir halaman di robots.txt akan menghapus halaman tersebut dari hasil pencarian Google?

Tidak. Berkas robots.txt hanya mengatur izin pengambilan data (crawling), bukan pengindeksan (indexing). URL yang diblokir perayapannya tetap dapat muncul di hasil pencarian jika URL tersebut memiliki tautan dari situs web lain.

Bagaimana cara memeriksa izin perayapan untuk bot kecerdasan buatan seperti GPTBot?

Ketik token bot seperti GPTBot atau ClaudeBot pada kolom perayap untuk melihat apakah bot tersebut diblokir atau diizinkan. Jika Anda ingin menyusun aturan perayapan kecerdasan buatan terlebih dahulu sebelum mengujinya, gunakan generator robots.txt untuk bot AI.

Apa perbedaan Penguji Robots.txt dengan alat uji di Google Search Console?

Penguji Robots.txt memproses pengujian sepenuhnya di peramban tanpa memerlukan verifikasi kepemilikan domain atau berkas yang sudah daring di server. Anda dapat menguji draf berkas secara bebas untuk puluhan jenis bot perayap sekaligus sebelum diterapkan ke situs produksi.

Mengapa direktif Crawl-delay ditandai sebagai peringatan oleh sistem?

Direktif Crawl-delay bukan merupakan bagian resmi dari spesifikasi RFC 9309 dan diabaikan oleh mesin pencari modern seperti Google. Alat uji menandai baris tersebut untuk menginformasikan bahwa sebagian besar perayap web tidak akan mematuhi pembatasan jeda waktu tersebut.