Scegli lingua

Generatore di robots.txt per bloccare i crawler AI

Crea un robots.txt per i crawler AI: blocca i bot di addestramento, gestisci i segnali di contenuto, aggiungi sitemap o llms.txt. Tutto nel browser.

Generatore robots.txt per crawler AICome funziona ↓
Indicizza la pagina e mostra link con brevi estratti
Usa la pagina come materiale di origine per risposte generate
Usa la pagina per addestrare o ottimizzare modelli di IA
Estensione Cloudflare: fino a che punto un bot può utilizzare il contenuto recuperato
Formulazione legale che dà effetto ai segnali secondo le norme UE sul copyright
Bloccarli non influisce sulla visibilità nelle ricerche
Bloccarli ti esclude dalle risposte di ricerca IA e dalle loro citazioni
Bloccarli impedisce agli assistenti di aprire le tue pagine su richiesta
Agenti che cliccano e compilano moduli per conto di un utente
Usa / per l'intero sito o una cartella come /articoli/
Necessario solo per i puntatori Sitemap e llms.txt
Aggiunto come commento; robots.txt non ha una direttiva llms.txt

robots.txt e Content-Signal esprimono preferenze; non bloccano nulla da soli. I crawler ben intenzionati le rispettano, altri le ignorano e Google ha dichiarato di non agire su Content-Signal. Combinali con regole lato server per i bot se hai bisogno di farle rispettare.

Mehmet Demiray Pubblicato Aggiornato
Condividi

Quattro tipi di crawler AI: cosa fanno e perché bloccarli (o no)

Quando si parla di crawler AI, non tutti svolgono la stessa funzione. Il Generatore robots.txt per crawler AI li organizza in quattro categorie, ognuna con un impatto diverso sulla visibilità del tuo sito. Capire queste differenze è fondamentale per decidere quali bloccare e quali lasciare passare.

La prima categoria è quella dei collettori di dati per l’addestramento (26 bot nella lista del tool). Questi crawler, come GPTBot (OpenAI), CCBot (Common Crawl) o Google-Extended, raccolgono contenuti per alimentare i modelli di intelligenza artificiale. Se li blocchi, il tuo sito non verrà usato per addestrare nuovi LLM, ma perderai anche la possibilità di essere citato in risposte generate da AI che si basano su dati più recenti. Per molti editori italiani, soprattutto quelli che producono contenuti originali come ricette regionali o analisi di mercato, questa è la scelta più equilibrata: proteggere il proprio lavoro senza sparire completamente dai risultati AI.

La seconda categoria è quella degli indicizzatori di ricerca AI (11 bot). Questi crawler, come OAI-SearchBot o PerplexityBot, costruiscono indici usati da motori di ricerca basati su AI. Bloccandoli, il tuo sito non apparirà nelle risposte di questi motori, ma rimarrà visibile sui tradizionali come Google. Per un sito di e-commerce italiano che vende prodotti artigianali, ad esempio, potrebbe essere utile mantenere questa visibilità per raggiungere nuovi clienti attraverso strumenti come Perplexity o You.com.

La terza categoria è quella dei fetchers attivati dagli utenti (10 bot), come ChatGPT-User o Bard-User. Questi crawler accedono al tuo sito solo quando un utente chiede esplicitamente di includere una pagina in una risposta AI. Bloccandoli, impedisci che il tuo contenuto venga mostrato in tempo reale, ma non influisci sull’addestramento dei modelli. Per un blog personale o un sito di notizie locali, potrebbe essere una scelta eccessiva, a meno che non si voglia evitare del tutto l’uso del proprio contenuto in contesti AI.

L’ultima categoria è quella degli agenti di navigazione (6 bot), come quelli usati da browser o assistenti vocali per pre-caricare pagine. Questi crawler non raccolgono dati per l’addestramento, ma possono influire sul traffico del sito. Bloccandoli, si rischia di ridurre l’esperienza utente, soprattutto per chi usa strumenti come Siri o Google Assistant per accedere ai contenuti.

Il Generatore robots.txt per crawler AI ti permette di scegliere quali categorie bloccare con un semplice clic. Il preset predefinito, ad esempio, blocca solo i collettori di dati per l’addestramento, mantenendo la visibilità nelle risposte AI e nei motori di ricerca. Questa scelta è particolarmente adatta per i siti che vogliono proteggere i propri contenuti senza rinunciare del tutto alla presenza online.

Come funziona il file robots.txt generato: struttura e direttive

Il file robots.txt generato dal tool è composto da due parti principali: un gruppo di direttive per tutti i crawler (con i segnali di contenuto) e gruppi specifici per i bot AI che vuoi bloccare. La struttura è semplice, ma ogni riga ha un ruolo preciso.

La prima parte del file è il gruppo User-agent: *, che si applica a tutti i crawler. Qui trovi le direttive Content-Signal, che comunicano le tue preferenze sull’uso del contenuto. Ad esempio, se hai scelto di bloccare solo i crawler di addestramento, il file includerà:

User-agent: *
Content-Signal: search=allow, ai-input=allow, ai-train=disallow
Allow: /

Questo significa che permetti ai motori di ricerca tradizionali (search=allow) e ai crawler che accedono al contenuto su richiesta degli utenti (ai-input=allow) di accedere al sito, ma vieti l’uso per l’addestramento dei modelli AI (ai-train=disallow). Il parametro Allow: / garantisce che i crawler non bloccati possano accedere a tutte le pagine.

La seconda parte del file contiene i gruppi User-agent specifici per i bot AI che hai scelto di bloccare. Ogni gruppo ha una direttiva Disallow che applica lo stesso percorso a tutti i bot selezionati. Ad esempio, se hai scelto di bloccare GPTBot e CCBot, il file includerà:

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

Il percorso di blocco predefinito è /, che impedisce l’accesso a tutto il sito. Puoi modificarlo manualmente nel file scaricato per bloccare solo una cartella specifica, come /bozze/ o /privato/. Questo è utile per i siti che vogliono proteggere solo alcune sezioni, come un’area riservata ai membri o contenuti in fase di revisione.

Il file può includere anche due righe opzionali: una per il Sitemap e un commento che punta a llms.txt. Entrambe richiedono l’inserimento di un URL valido del tuo sito. Ad esempio:

Sitemap: https://tusito.it/sitemap.xml
# Per ulteriori preferenze sull’uso dell’AI, vedi https://tusito.it/llms.txt

Il Generatore robots.txt per crawler AI non aggiunge queste righe automaticamente perché richiedono un URL personalizzato. Puoi inserirle manualmente nel file scaricato o usare strumenti come il Generatore llms.txt per creare un file complementare.

Infine, il tool include un blocco di commenti con la formulazione prevista dall’Articolo 4 della Direttiva UE 2019/790, che riserva i diritti di text and data mining. Questo è particolarmente rilevante per i siti europei, ma non ha valore legale: è solo una dichiarazione di intenti.

Cosa sono i Content-Signal e come influenzano i crawler AI

I Content-Signal sono una novità nel mondo dei file robots.txt, introdotta per dare ai proprietari dei siti un controllo più granulare sull’uso dei loro contenuti da parte dei crawler AI. A differenza delle tradizionali direttive Disallow, che bloccano completamente l’accesso, i Content-Signal esprimono una preferenza su come il contenuto può essere usato, lasciando ai crawler la libertà di rispettarla o meno.

Il Generatore robots.txt per crawler AI supporta tre segnali principali:

  1. search: Indica se il contenuto può essere usato dai motori di ricerca tradizionali. Il valore predefinito è allow, perché bloccare questo segnale significherebbe escludere il sito da Google, Bing e altri motori. Per un sito italiano che vende prodotti online, mantenere search=allow è essenziale per la visibilità.
  1. ai-input: Specifica se il contenuto può essere usato come input per risposte generate da AI in tempo reale, ad esempio quando un utente chiede a ChatGPT di includere una pagina specifica. Anche qui, il valore predefinito è allow, perché bloccare questo segnale impedirebbe al tuo contenuto di essere citato in risposte AI, riducendo la visibilità.
  1. ai-train: Questo è il segnale più rilevante per chi vuole proteggere i propri contenuti dall’addestramento dei modelli AI. Il valore predefinito nel tool è disallow, che indica ai crawler di non usare il contenuto per addestrare nuovi LLM. Per un editore che pubblica articoli originali o un fotografo che condivide le proprie immagini, questa è una scelta importante per tutelare il proprio lavoro.

Oltre a questi tre segnali, il tool supporta anche il parametro use di Cloudflare, che può assumere tre valori: - immediate: Il contenuto può essere usato subito, senza restrizioni. - reference: Il contenuto può essere usato solo come riferimento, ad esempio per citazioni brevi. - full: Il contenuto può essere usato liberamente, anche per l’addestramento.

Il valore predefinito è reference, che offre un equilibrio tra protezione e visibilità. Ad esempio, un sito di ricette potrebbe permettere l’uso delle proprie ricette come riferimento in risposte AI, ma non per addestrare nuovi modelli.

I Content-Signal sono inclusi nel gruppo User-agent: *, quindi si applicano a tutti i crawler. Tuttavia, non tutti i crawler li rispettano: Google, ad esempio, ha dichiarato di non agire su questi segnali. Per questo motivo, il Generatore robots.txt per crawler AI combina i Content-Signal con le tradizionali direttive Disallow per i bot specifici, offrendo una protezione più efficace.

Infine, il tool include un blocco di commenti che fa riferimento all’Articolo 4 della Direttiva UE 2019/790, che riserva i diritti di text and data mining. Questo è particolarmente rilevante per i siti europei, ma non ha valore legale: serve solo a dichiarare le proprie intenzioni in modo formale.

Quali crawler AI bloccare? Scenari pratici per il tuo sito

La scelta di quali crawler AI bloccare dipende dagli obiettivi del tuo sito e dal tipo di contenuto che pubblichi. Il Generatore robots.txt per crawler AI offre quattro preset che coprono le esigenze più comuni, ma puoi anche personalizzare la selezione in base alle tue necessità.

Scenario 1: Editore che vuole proteggere i contenuti ma rimanere citabile Se gestisci un sito di notizie, un blog o una rivista online, probabilmente vuoi evitare che i tuoi articoli vengano usati per addestrare modelli AI senza compenso, ma non vuoi sparire dalle risposte generate da strumenti come ChatGPT o Perplexity. In questo caso, il preset predefinito del tool è la scelta ideale: blocca solo i crawler di addestramento (come GPTBot o Google-Extended) ma lascia passare quelli di ricerca AI e i fetchers attivati dagli utenti. Così, i tuoi articoli potranno ancora essere citati in risposte AI, ma non verranno usati per addestrare nuovi modelli.

Scenario 2: Sito che vuole optare completamente fuori dall’AI Se il tuo sito contiene contenuti sensibili, come dati personali, informazioni riservate o materiale protetto da copyright, potresti voler bloccare tutti i crawler AI. In questo caso, scegli il preset "Tutti i crawler AI". Questo bloccherà anche i crawler di ricerca AI, il che significa che il tuo sito non apparirà nelle risposte di strumenti come Perplexity o You.com. Per un sito aziendale che tratta dati di clienti o un archivio di documenti riservati, questa potrebbe essere la scelta più sicura.

Scenario 3: Sito con contenuti pubblici ma aree riservate Se il tuo sito ha una sezione pubblica e una riservata (ad esempio, un’area membri o una cartella con bozze), puoi usare il Generatore robots.txt per crawler AI per bloccare i crawler solo nelle aree sensibili. Dopo aver generato il file, modifica manualmente il percorso di Disallow da / a /privato/ o /bozze/. In questo modo, i crawler potranno accedere alla parte pubblica del sito ma non alle sezioni riservate. Questo è utile per siti di associazioni, scuole o aziende che vogliono proteggere solo alcune pagine.

Scenario 4: Sito che vuole massimizzare la visibilità Se il tuo obiettivo è raggiungere il maggior numero possibile di utenti, anche attraverso strumenti AI, puoi scegliere il preset "Nessun crawler AI". Questo lascerà passare tutti i crawler, ma includerà comunque i Content-Signal per esprimere le tue preferenze sull’uso del contenuto. Ad esempio, un sito di e-commerce che vende prodotti artigianali potrebbe voler apparire sia nei risultati di ricerca tradizionali che in quelli generati da AI, senza limitazioni.

Indipendentemente dallo scenario, ricorda che il file robots.txt è solo una richiesta: i crawler possono scegliere di ignorarlo. Per una protezione più efficace, puoi combinare il robots.txt con regole lato server o CDN, come quelle offerte da Cloudflare. Inoltre, dopo aver caricato il file, puoi verificarlo con il Tester robots.txt per assicurarti che i bot giusti siano bloccati.

Limiti del robots.txt: cosa può e non può fare contro i crawler AI

Il file robots.txt è uno strumento utile per comunicare le proprie preferenze ai crawler, ma ha dei limiti importanti che è bene conoscere prima di affidarsi esclusivamente a esso per proteggere i propri contenuti dagli usi indesiderati da parte delle AI.

1. È solo una richiesta, non un blocco assoluto Le direttive del robots.txt sono volontarie: i crawler possono scegliere di rispettarle o ignorarle. Ad esempio, un crawler malintenzionato potrebbe ignorare completamente il file e accedere comunque al sito. Anche alcuni crawler legittimi, come quelli di Google, hanno dichiarato di non agire sui Content-Signal. Questo significa che, anche se imposti ai-train=disallow, non c’è garanzia che i tuoi contenuti non vengano usati per l’addestramento.

2. Non rimuove i contenuti già raccolti Il robots.txt agisce solo sui nuovi accessi: se un crawler ha già raccolto i tuoi contenuti prima che tu aggiungessi le direttive di blocco, quei dati rimarranno nei loro dataset. Ad esempio, se hai pubblicato un articolo nel 2023 e aggiungi il blocco per GPTBot nel 2024, l’articolo potrebbe essere già stato usato per addestrare modelli come GPT-4. Per questo motivo, è importante agire tempestivamente se vuoi proteggere i tuoi contenuti.

3. Non protegge da accessi diretti Se qualcuno conosce l’URL esatto di una pagina del tuo sito, può accedervi direttamente anche se è bloccata nel robots.txt. Questo vale anche per i crawler: se un bot conosce già l’URL di una pagina, può bypassare il robots.txt. Per questo motivo, il robots.txt è più efficace quando combinato con altre misure, come l’autenticazione o le regole lato server.

4. Alcuni crawler non lo leggono Non tutti i crawler AI rispettano il robots.txt. Ad esempio, alcuni crawler meno conosciuti potrebbero non seguire le direttive standard. Inoltre, i crawler che accedono al sito tramite proxy o VPN potrebbero non vedere il file robots.txt corretto. Per una protezione più robusta, puoi usare strumenti come il Generatore di chiavi di autenticazione per bot web, che verifica l’identità dei crawler tramite chiavi crittografiche.

5. Non sostituisce le regole lato server Per un controllo più efficace, puoi combinare il robots.txt con regole lato server o CDN. Ad esempio, Cloudflare offre un’opzione per bloccare automaticamente i crawler AI noti, mentre Apache e Nginx permettono di bloccare gli accessi in base allo user-agent. Queste soluzioni sono più difficili da bypassare rispetto al robots.txt, ma richiedono competenze tecniche per essere implementate correttamente.

6. Non influisce sui motori di ricerca tradizionali Se blocchi solo i crawler AI, i motori di ricerca tradizionali come Google o Bing continueranno a indicizzare il tuo sito normalmente. Ad esempio, bloccare Google-Extended non influisce su Googlebot, quindi il tuo sito rimarrà visibile nei risultati di ricerca di Google. Tuttavia, se blocchi anche i crawler di ricerca AI, il tuo sito potrebbe non apparire nelle risposte generate da strumenti come Perplexity o You.com.

In sintesi, il robots.txt è uno strumento utile per comunicare le proprie preferenze, ma non è una soluzione definitiva. Per una protezione completa, è consigliabile combinare il robots.txt con altre misure, come regole lato server, autenticazione e monitoraggio degli accessi. Dopo aver generato il file con il Generatore robots.txt per crawler AI, puoi verificarlo con il Tester robots.txt per assicurarti che funzioni come previsto.

Robots.txt e llms.txt: due file, due scopi diversi

Il Generatore robots.txt per crawler AI include un commento che punta a un file llms.txt, ma i due file hanno scopi e funzionalità molto diverse. Capire la differenza è importante per decidere come gestire le preferenze del tuo sito nei confronti delle AI.

Robots.txt: le regole di accesso Il file robots.txt è uno standard consolidato che comunica ai crawler quali parti del sito possono o non possono essere visitate. È supportato da tutti i motori di ricerca tradizionali e da molti crawler AI, anche se non tutti lo rispettano. Il Generatore robots.txt per crawler AI ti permette di creare un file che: - Blocca specifici crawler AI (come GPTBot o CCBot) tramite direttive Disallow. - Esprime preferenze sull’uso del contenuto tramite i Content-Signal (search, ai-input, ai-train). - Include un riferimento al file llms.txt tramite un commento.

Il robots.txt è utile per controllare l’accesso al sito, ma non può esprimere preferenze dettagliate sull’uso dei contenuti. Ad esempio, non puoi specificare che un articolo può essere usato solo per citazioni brevi o che un’immagine non può essere modificata. Per questo, esiste il file llms.txt.

Llms.txt: le preferenze sull’uso dei contenuti Il file llms.txt è una proposta più recente, pensata specificamente per le AI. A differenza del robots.txt, non è uno standard ufficiale e non è supportato da tutti i crawler, ma permette di esprimere preferenze più dettagliate sull’uso dei contenuti. Ad esempio, puoi specificare: - Se i tuoi contenuti possono essere usati per l’addestramento dei modelli AI. - Se possono essere modificati o solo citati. - Se richiedi un’attribuzione o un compenso per l’uso.

Il Generatore robots.txt per crawler AI include solo un commento che punta a llms.txt, perché il robots.txt non può contenere direttive per questo file. Per creare un llms.txt, puoi usare il Generatore llms.txt, che ti guida nella definizione delle tue preferenze.

Quando usare l’uno o l’altro Se vuoi controllare quali crawler possono accedere al tuo sito, il robots.txt è lo strumento giusto. Ad esempio, se gestisci un sito di ricette e vuoi bloccare i crawler che raccolgono dati per l’addestramento, il robots.txt ti permette di farlo in modo semplice.

Se invece vuoi esprimere preferenze dettagliate sull’uso dei tuoi contenuti da parte delle AI, il llms.txt è la scelta migliore. Ad esempio, se sei un fotografo e vuoi permettere l’uso delle tue immagini solo per citazioni non modificate, puoi specificarlo nel llms.txt.

Come usarli insieme I due file possono essere usati in modo complementare. Ad esempio: - Usa il robots.txt per bloccare i crawler di addestramento e permettere quelli di ricerca AI. - Usa il llms.txt per specificare che i tuoi contenuti possono essere usati solo per citazioni e richiedere un’attribuzione.

In questo modo, hai un controllo più granulare sull’accesso e sull’uso dei tuoi contenuti. Ricorda però che, come il robots.txt, anche il llms.txt è solo una richiesta: i crawler possono scegliere di rispettarlo o ignorarlo.

Come caricare e verificare il file robots.txt sul tuo sito

Dopo aver generato il file robots.txt con il Generatore robots.txt per crawler AI, il passaggio successivo è caricarlo sul tuo sito e verificare che funzioni correttamente. Ecco come procedere, passo dopo passo.

1. Dove caricare il file Il file robots.txt deve essere posizionato nella root del tuo dominio, cioè all’indirizzo https://tuosito.it/robots.txt. Non può essere in una sottocartella (ad esempio, https://tuosito.it/cartella/robots.txt non funzionerà). Se il tuo sito ha più sottodomini (ad esempio, blog.tuosito.it), ogni sottodominio deve avere il proprio file robots.txt.

Per caricare il file, puoi usare uno di questi metodi: - FTP/SFTP: Accedi al server tramite un client come FileZilla e carica il file nella root del sito. - Pannello di controllo del hosting: Molti provider, come Aruba, SiteGround o Register, offrono un file manager integrato nel pannello di controllo (ad esempio, cPanel o Plesk). Usalo per caricare il file nella root. - CMS: Se usi WordPress, puoi caricare il file tramite plugin come Yoast SEO o All in One SEO, che includono un editor per il robots.txt. Per altri CMS, come Joomla o Drupal, puoi usare estensioni simili o caricare il file manualmente via FTP.

2. Verificare che il file sia accessibile Dopo aver caricato il file, verifica che sia raggiungibile digitando https://tuosito.it/robots.txt nel browser. Dovresti vedere il contenuto del file che hai generato. Se ricevi un errore 404, significa che il file non è stato caricato correttamente o non è nella root del sito.

3. Controllare le direttive con un tester Per assicurarti che il file blocchi i crawler giusti, puoi usare il Tester robots.txt. Questo strumento ti permette di inserire l’URL del tuo robots.txt e verificare quali bot sono bloccati e quali no. Ad esempio, se hai scelto di bloccare GPTBot, il tester dovrebbe mostrarti che questo crawler è bloccato, mentre Googlebot dovrebbe essere permesso.

4. Monitorare gli accessi Dopo aver caricato il file, monitora i log del server per verificare che i crawler AI rispettino le direttive. Ad esempio, se hai bloccato CCBot, non dovresti vedere accessi da questo user-agent nei log. Se noti che alcuni crawler ignorano il robots.txt, puoi aggiungere regole lato server per bloccarli. Ad esempio, in Apache puoi aggiungere queste righe al file .htaccess:

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} ^GPTBot [OR]
RewriteCond %{HTTP_USER_AGENT} ^CCBot
RewriteRule ^ - [F,L]

Questo bloccherà l’accesso a GPTBot e CCBot anche se ignorano il robots.txt.

5. Aggiornare il file quando necessario Se cambi idea su quali crawler bloccare, puoi generare un nuovo file con il Generatore robots.txt per crawler AI e caricarlo sul sito. Ricorda che le modifiche non sono immediate: i crawler potrebbero impiegare alcuni giorni per rileggere il file e aggiornare le loro regole. Se vuoi forzare un aggiornamento, puoi usare strumenti come il Invio URL con IndexNow, che notifica ai motori di ricerca le modifiche al sito.

6. Cosa fare se il file non funziona Se dopo aver caricato il file noti che i crawler AI continuano ad accedere al sito, ci possono essere diverse cause: - Il file non è nella root del sito. - Il file contiene errori di sintassi (ad esempio, spazi extra o caratteri non validi). - I crawler ignorano il robots.txt.

In questi casi, puoi: - Verificare la posizione del file digitando https://tuosito.it/robots.txt. - Usare il Tester robots.txt per controllare la sintassi. - Aggiungere regole lato server per bloccare i crawler che ignorano il robots.txt.

Ricorda che il robots.txt è solo una parte della strategia di protezione dei tuoi contenuti. Per una sicurezza maggiore, combina il robots.txt con altre misure, come l’autenticazione o le regole lato server.

Le più frequenti.

Come posso bloccare i crawler AI dal mio sito con il Generatore robots.txt per crawler AI?

Seleziona un preset (ad esempio "solo crawler di addestramento", impostazione predefinita), genera il file robots.txt e caricalo nella root del tuo sito. Il tool crea automaticamente le regole per bloccare oltre 50 bot AI, mantenendo però visibili i crawler di ricerca e quelli attivati dagli utenti, così il tuo contenuto resta citabile nelle risposte AI.

Dove devo posizionare il file robots.txt generato?

Il file robots.txt deve essere caricato nella directory principale del tuo dominio (ad esempio, tuosito.it/robots.txt). Funziona solo se posizionato lì: non viene letto se inserito in sottocartelle o su sottodomini diversi.

Che differenza c'è tra GPTBot, OAI-SearchBot e ChatGPT-User?

GPTBot raccoglie dati per l’addestramento dei modelli (bloccarlo esclude il tuo sito dai dataset), OAI-SearchBot indicizza i contenuti per le risposte AI (bloccarlo riduce le citazioni), mentre ChatGPT-User recupera pagine solo su richiesta diretta dell’utente (bloccarlo impedisce la visualizzazione in tempo reale).

Cosa sono i Content-Signal e perché compaiono nel robots.txt?

I Content-Signal sono tre segnali (search, ai-input, ai-train) che comunicano le tue preferenze sull’uso dei contenuti da parte dei crawler. Ad esempio, puoi impostare ai-train: disallow per vietare l’uso per l’addestramento, pur consentendo la ricerca. Il tool li inserisce nel gruppo User-agent: * per applicarli a tutti i bot, non solo a quelli AI.

Bloccare i crawler AI influisce sul posizionamento su Google?

No, se blocchi solo i bot di addestramento (come GPTBot o Google-Extended). Googlebot e il ranking tradizionale non vengono toccati. Attenzione però: se blocchi anche i crawler di ricerca AI (come OAI-SearchBot), il tuo sito potrebbe non comparire nelle risposte generate da modelli come ChatGPT o Gemini.

Posso bloccare i crawler AI solo per una cartella specifica?

Sì. Nel tool, imposta il percorso di Disallow (ad esempio /bozze/) e questo verrà applicato a tutti i bot selezionati. Utile per proteggere contenuti in fase di revisione o aree riservate senza influire sul resto del sito.

Perché nel file generato mancano le righe Sitemap e llms.txt?

Queste righe richiedono un URL valido del tuo sito. Puoi aggiungerle manualmente nel tool inserendo l’indirizzo completo (ad esempio *Sitemap: https://tuosito.it/sitemap.xml). Il commento per llms.txt serve solo come promemoria: quel file va creato separatamente con il Generatore di llms.txt.

Il robots.txt blocca davvero i crawler AI o è solo una richiesta?

È una richiesta, non un blocco tecnico. I crawler beneducati la rispettano, ma alcuni (soprattutto quelli meno trasparenti) potrebbero ignorarla. Per una protezione più efficace, abbinala a regole lato server o a strumenti come il Generatore chiavi Web Bot Auth per autenticare i bot.

Che vantaggio ha usare questo tool rispetto al robots.txt gestito da Cloudflare?

Il Generatore robots.txt per crawler AI ti permette di scegliere esattamente quali bot bloccare (ad esempio, solo quelli di addestramento) e funziona su qualsiasi hosting, non solo su Cloudflare. Inoltre, include i Content-Signal e la clausola di riserva TDM per l’UE, opzioni non sempre disponibili nei tool gestiti automaticamente.

Posso aggiungere un bot AI non presente nell’elenco?

Il tool non supporta l’aggiunta manuale di bot, ma puoi modificare il file robots.txt scaricato inserendo manualmente il User-agent e il Disallow per il bot desiderato. Assicurati di usare il token esatto (ad esempio ClaudeBot), che puoi verificare con il Tester robots.txt.