Pilih bahasa

Generator robots.txt untuk Bot AI dan Crawler

Atur crawler pelatihan AI, bot pencarian, dan direktif Content-Signal dengan aturan User-agent khusus langsung dari peramban web Anda.

Generator robots.txt Bot AICara kerja ↓
Indeks halaman dan tampilkan tautan dengan cuplikan singkat
Gunakan halaman sebagai materi sumber untuk jawaban yang dihasilkan
Gunakan halaman untuk melatih atau menyempurnakan model AI
Ekstensi Cloudflare: batasan penggunaan konten yang diambil oleh bot
Rumusan hukum yang memberi kekuatan sinyal di bawah aturan hak cipta Uni Eropa
Memblokir ini tidak memengaruhi visibilitas pencarian
Memblokir ini akan menghapus situs Anda dari jawaban pencarian AI dan kutipannya
Memblokir ini menghentikan asisten membuka halaman Anda saat diminta
Agen yang mengklik dan mengisi formulir atas nama pengguna
Gunakan / untuk seluruh situs atau folder seperti /artikel/
Hanya diperlukan untuk rujukan Sitemap dan llms.txt
Ditambahkan sebagai komentar; robots.txt tidak memiliki direktif llms.txt

robots.txt dan Content-Signal hanya menyatakan preferensi; keduanya tidak memblokir apa pun secara mandiri. Crawler yang patuh akan menghormatinya, yang lain mengabaikannya, dan Google menyatakan tidak bertindak berdasarkan Content-Signal. Terapkan aturan bot di tingkat server jika memerlukan pemblokiran mutlak.

Mehmet Demiray Diterbitkan Diperbarui
Bagikan

Mengenal Empat Jenis Bot AI dan Dampak Pemblokirannya

Bot AI di internet tidak semuanya menjalankan tugas yang sama. Memahami klasifikasi perayap sangat penting sebelum Anda menentukan aturan pemblokiran. Katalog perayap AI modern umumnya terbagi ke dalam empat kategori operasional:

  1. Pengumpul Data Pelatihan (Training Collectors): Bot seperti GPTBot, ClaudeBot, CCBot, dan Google-Extended merayapi jutaan halaman untuk mengumpulkan materi pelatihan model AI generasi berikutnya. Memblokir kelompok ini mencegah karya tulis Anda diserap ke dalam korpus data tanpa izin kompensasi.
  2. Pengindeks Pencarian AI (AI Search Indexers): Bot seperti OAI-SearchBot dan PerplexityBot bertugas mengindeks konten web secara langsung untuk menyajikan jawaban mesin pencari percakapan berbasis kutipan sumber.
  3. Pemanggil Atas Permintaan Pengguna (User-Triggered Fetchers): Bot seperti ChatGPT-User bergerak hanya ketika seorang pengguna memasukkan tautan spesifik ke dalam antarmuka obrolan dan meminta ringkasan atau analisis instan.
  4. Agen Penjelajah Interaktif (Browsing Agents): Bot peramban mandiri yang membaca halaman guna mengeksekusi tugas khusus yang diperintahkan pengguna secara langsung.

Generator robots.txt Bot AI memetakan lebih dari 50 token agen pengguna ke dalam kategori tersebut. Memblokir seluruh bot secara total membuat situs Anda bersih dari konsumsi mesin, tetapi memiliki konsekuensi langsung berupa hilangnya peluang rujukan dan tautan kutipan dalam pencarian percakapan AI.

Struktur Berkas robots.txt yang Dihasilkan Generator

Generator robots.txt Bot AI menyusun berkas konfigurasi dengan memadukan dua lapis instruksi: deklarasi sinyal konten global dan pembatasan agen perayap individual.

Pada bagian awal, generator membentuk grup umum bertanda bintang:

User-agent: * Content-Signal: search=yes, ai-train=no Allow: /

Baris Content-Signal menetapkan izin penggunaan data pada tingkat abstrak, sementara Allow: / memastikan perayap web biasa tetap dapat merayapi situs tanpa gangguan. Di bawah blok umum, generator menyusun blok pembatasan terpisah untuk setiap bot yang Anda pilih untuk diblokir. Setiap bot memiliki deklarasi User-agent sendiri yang diikuti direktif Disallow.

Jalur pemblokiran standar diatur ke seluruh domain dengan simbol /. Jika Anda hanya ingin mengunci bagian tertentu dari situs web, Anda cukup mengisi jalur direktori khusus pada generator. Generator juga menyertakan baris direktif Sitemap otomatis serta tautan komentar menuju berkas deskripsi konten jika Anda memasukkan URL situs.

Memahami Protokol Content-Signal dan Reservasi Hak Cipta

Standar Content-Signal adalah protokol berbasis teks yang dirancang oleh komunitas web dan Cloudflare untuk memberikan instruksi eksplisit mengenai pemanfaatan materi digital. Terdapat tiga parameter inti dalam sinyal ini:

  • search: Menentukan apakah konten diizinkan masuk ke indeks pencarian biasa maupun pencarian berbasis AI.
  • ai-input: Menentukan apakah halaman boleh diolah sebagai data rujukan instan dalam penalaran AI.
  • ai-train: Menentukan apakah materi boleh dipakai sebagai bobot pelatihan model pembelajaran mesin.

Nilai setiap parameter dapat disetel menjadi yes untuk mengizinkan atau no untuk menolak. Jika Anda tidak memiliki preferensi tertentu, parameter tersebut diabaikan dari baris perintah. Cloudflare juga mendukung ekstensi parameter use dengan opsi seperti immediate, reference, atau full guna mengatur tingkat retensi data pada peladen perantara.

Generator robots.txt Bot AI juga menyediakan opsi penambahan blok komentar reservasi hak cipta penambangan teks dan data (TDM) sesuai Pasal 4 Arahan Uni Eropa 2019/790. Deklarasi ini menegaskan hak kepemilikan materi secara hukum formal, meskipun pemilik situs perlu mengingat bahwa beberapa penyedia mesin pencari seperti Google menyatakan mereka belum menggunakan baris sinyal ini sebagai pengendali utama perayapan.

Panduan Memilih Preset Blokir Sesuai Kebutuhan Situs

Strategi pemblokiran bot AI harus diselaraskan dengan model distribusi konten dan tujuan trafik situs Anda. Generator robots.txt Bot AI menyediakan beberapa preset praktis:

Preset Cakupan Aturan Tujuan Penggunaan
Hanya Bot Pelatihan Memblokir bot pengumpul korpus data Melindungi hak cipta tanpa kehilangan kutipan AI Search
Semua Bot AI Memblokir seluruh kategori bot kecerdasan buatan Isolasi total konten dari ekosistem AI
Hanya Sinyal Tidak memblokir agen perayap, hanya menyetel Content-Signal Pendekatan deklaratif tanpa aturan Disallow agresif
Kustom Pemilihan manual per bot dan penyesuaian jalur direktori Kebutuhan teknis spesifik atau folder tertentu

Bagi pemilik blog personal, media massa, atau portal publikasi di Indonesia, preset pemblokir pelatihan adalah pilihan paling rasional. Dengan konfigurasi ini, bot seperti GPTBot dan CCBot ditolak, namun bot seperti OAI-SearchBot tetap diizinkan agar artikel Anda dapat direferensikan saat pengguna mencari rekomendasi produk atau informasi lokal.

Bagi berkas privat atau halaman pra-rilis, Anda dapat menetapkan jalur pemblokiran khusus seperti /drafts/ atau /internal/ tanpa harus menutup akses ke beranda utama.

Batasan Teknis robots.txt dan Cara Pengujian Berkas

Direktif dalam berkas robots.txt merupakan permintaan standar publik yang bekerja berdasarkan kepatuhan sukarela dari pihak pengembang bot. Perusahaan pengembang AI berskala besar umumnya mematuhi berkas ini secara konsisten, namun bot pemulung data tanpa identitas resmi dapat mengabaikannya.

Poin penting yang perlu dipahami adalah bahwa robots.txt hanya mengontrol perayapan di masa depan. Menambahkan direktif pemblokiran hari ini tidak akan menghapus data yang telah diunduh oleh pengembang AI pada bulan atau tahun sebelumnya. Untuk perlindungan tingkat lanjut terhadap bot liar yang memalsukan agen pengguna, Anda dapat menerapkan aturan pemblokiran alamat IP di tingkat CDN atau memanfaatkan alat pembuat kunci autentikasi bot web guna memverifikasi identitas penjelajah secara kriptografis.

Setelah membuat berkas melalui Generator robots.txt Bot AI, unggah berkas tersebut ke direktori utama domain web Anda. Selanjutnya, gunakan alat penguji robots.txt untuk memeriksa apakah sintaks yang ditulis sudah bebas dari galat tata bahasa dan benar-benar membatasi bot yang Anda targetkan.

Hubungan Antara robots.txt dan llms.txt untuk Ekosistem AI

Berkas robots.txt dan berkas llms.txt menjalankan dua fungsi yang bertolak belakang namun saling melengkapi dalam tata kelola situs modern.

  • robots.txt: Bertindak sebagai pintu gerbang perizinan. Fungsinya adalah membatasi area mana yang boleh dan tidak boleh diakses oleh perayap mesin.
  • llms.txt: Bertindak sebagai kurasi informasi terstruktur. Fungsinya adalah menyajikan ringkasan teks bersih dalam format Markdown agar model bahasa dapat membaca konteks situs secara efisien tanpa gangguan tata letak grafis.

Spesifikasi protokol robots.txt resmi tidak memiliki direktif penunjuk berkas seperti Llms: /llms.txt. Oleh karena itu, Generator robots.txt Bot AI menyertakan lokasi berkas tersebut dalam bentuk baris komentar petunjuk pada akhir dokumen.

Apabila Anda memilih untuk tetap mengizinkan bot pencarian AI merayapi web Anda, menyediakan berkas ringkasan yang dibuat lewat generator llms.txt sangat membantu mesin AI dalam memahami esensi halaman web Anda secara presisi tanpa membebani kapasitas peladen.

Yang paling sering kami jawab.

Bagaimana cara memblokir bot AI dari website saya menggunakan Generator robots.txt Bot AI?

Pilih preset pemblokiran yang sesuai dengan kebutuhan Anda, tentukan jalur direktori yang ingin dibatasi, lalu salin atau unduh file yang dihasilkan. Unggah file tersebut langsung ke direktori root domain web Anda, misalnya di example.com/robots.txt. Anda juga dapat memeriksa file hasil konfigurasi menggunakan alat penguji robots.txt sebelum mengaktifkannya di server.

Di mana file robots.txt yang dihasilkan harus ditempatkan?

File robots.txt wajib diletakkan pada direktori root tertinggi domain web Anda. Mesin perayap web hanya mencari file konfigurasi pada alamat domain utama, seperti https://namadomain.com/robots.txt. Meletakkan file ini di dalam subfolder tidak akan dibaca oleh bot perayap.

Apa perbedaan peran antara GPTBot, OAI-SearchBot, dan ChatGPT-User?

Ketiga bot ini berasal dari penyedia yang sama tetapi menjalankan tugas berbeda. GPTBot mengumpulkan data publik untuk melatih model AI. OAI-SearchBot mengindeks konten agar artikel web Anda dapat dikutip dalam hasil pencarian SearchGPT. Sementara itu, ChatGPT-User hanya mengambil konten halaman web saat seorang pengguna meminta ChatGPT membuka tautan secara langsung.

Apakah memblokir Google-Extended akan menurunkan peringkat website di Google Search?

Tidak. Google-Extended hanya mengatur izin pengumpulan data untuk pelatihan model AI Google seperti Gemini dan Vertex AI. Mesin pencari Google Search menggunakan agen terpisah bernama Googlebot, sehingga memblokir Google-Extended tidak memengaruhi perayapan, pengindeksan, maupun posisi peringkat pencarian web Anda.

Apa perbedaan antara instruksi Disallow dan Content-Signal?

Instruksi Disallow meminta bot secara langsung agar tidak merayapi atau mengunduh URL tertentu. Content-Signal menyatakan izin pemanfaatan data secara spesifik, seperti apakah teks boleh dipakai untuk pelatihan AI (ai-train) atau pencarian AI (search). Content-Signal memberikan panduan penggunaan konten tanpa harus memutus akses perayapan teknis.

Apakah file robots.txt menjamin bot AI tidak mengambil data situs web?

File robots.txt bersifat permohonan sukarela yang dipatuhi oleh penyedia bot resmi. Pengikis data ilegal atau bot yang tidak patuh masih bisa mengabaikan aturan ini. Jika Anda memerlukan perlindungan mutlak, kombinasikan robots.txt dengan proteksi firewall aplikasi web (WAF) atau pembatasan akses di tingkat server.

Mengapa baris Sitemap dan llms.txt tidak muncul pada hasil konfigurasi?

Baris tersebut membutuhkan alamat website yang valid agar dapat menghasilkan URL absolut. Masukkan URL lengkap situs Anda pada kolom input yang tersedia. Tautan llms.txt yang disematkan sebagai komentar dapat mempermudah agen AI membaca ringkasan situs yang dibuat melalui generator llms.txt.