Robots.txt: come questo file controlla i crawler e i bot basati sull’intelligenza artificiale
Il file robots.txt è uno dei file di controllo più antichi del web e, ciononostante, è spesso configurato in modo errato. Esso stabilisce quali aree di un sito web possono essere visitate dai crawler dei motori di ricerca e, sempre più spesso, determina anche se i sistemi di intelligenza artificiale utilizzano i contenuti come dati di addestramento o per fornire risposte in tempo reale. Il nostro articolo sul
Cosa fa esattamente il file robots.txt
Il file si trova nella directory principale di un dominio ed è costituito da semplici regole di testo. Ogni regola, tramite la voce «User-agent», è rivolta a un determinato crawler e, tramite «Disallow» o «Allow», stabilisce quali percorsi questo può visitare. Google, Bing e altri motori di ricerca leggono questo file prima di ogni operazione di crawling e, di norma, ne rispettano le indicazioni in modo affidabile.
Basta una sola voce “Disallow” errata nella directory principale per far sì che l’intero dominio venga escluso dall’indice di Google.
Per questo motivo, il file è uno degli elementi tecnici più delicati di un sito web. Basta una barra dimenticata o un percorso troppo ampio per rendere inaccessibili sezioni che dovrebbero invece essere visibili. Chi modifica il file dovrebbe sempre testarne il risultato prima di pubblicare la nuova versione.
- Consentire l’accesso mirato a singoli bot
- Escludere intere directory dalla scansione
- Inserire il percorso della mappa del sito
- Concentrare il crawl budget sulle pagine più importanti
- Proteggere i contenuti duplicati dall’indicizzazione
Gestire i crawler dei motori di ricerca tradizionali
Googlebot, Bingbot e i crawler dei motori di ricerca simili rileggono il file robots.txt ad ogni visita. Tramite righe specifiche relative all’user-agent è possibile definire una regola separata per ogni bot, ad esempio per consentire a Bing di visualizzare sezioni diverse rispetto a Google. Google Search Console offre a tal fine uno strumento di test dedicato, con cui è possibile verificare i singoli URL rispetto al file attuale prima che una modifica abbia effettivamente effetto. Soprattutto nei grandi negozi online con pagine di filtro o percorsi del carrello, una configurazione accurata impedisce che il prezioso budget di scansione venga sprecato in pagine irrilevanti.
- Impostare regole specifiche per ciascun motore di ricerca
- Escludere le pagine dei filtri e del carrello
- Utilizzare lo strumento di test prima di ogni modifica
- Definire il ritardo di scansione se necessario
I crawler basati sull’intelligenza artificiale e il nuovo panorama dei bot
Oltre ai motori di ricerca tradizionali, oggi un numero crescente di crawler basati sull’intelligenza artificiale legge il file robots.txt, tra cui GPTBot, ClaudeBot, Google-Extended o CCBot. Tramite le voci personalizzate dell’user-agent è possibile stabilire se questi sistemi possano raccogliere contenuti per i dati di addestramento o utilizzarli per fornire risposte in tempo reale. Questo controllo è ormai parte integrante di una strategia di visibilità tecnica ben strutturata, come quella verificata anche nel nostro
- Autorizzare in modo mirato GPTBot e ClaudeBot
- Regolare separatamente Google Extended per l’addestramento dell’IA
- Verificare le regole prima di ogni rilancio
- Verificare periodicamente la visibilità tecnica
Gestire e testare correttamente il file robots.txt
Il file non è un’operazione da eseguire una tantum, ma deve essere aggiornato ogni volta che viene apportata una modifica significativa alla struttura del sito. Nuove directory, percorsi rinominati o un cambio del sistema di gestione dei contenuti modificano spesso le aree che devono effettivamente essere sottoposte a scansione. Un controllo regolare nella Search Console mostra se Google incontra blocchi che in realtà non sono più desiderati o se aree importanti rimangono accidentalmente bloccate. Anche gli strumenti esterni di analisi tecnica aiutano a evidenziare le differenze tra la versione attuale e una precedente del file, prima che queste si trasformino in un vero e proprio problema di visibilità.
- Verifica del file dopo ogni modifica della struttura
- Controllare regolarmente gli avvisi di Search Console
- Verificare l’attualità dei vecchi blocchi
- Documentare le modifiche prima della messa in produzione
Robots.txt: errori comuni nella pratica
L’errore più comune è una voce “Disallow” formulata in modo troppo generico, che blocca inavvertitamente intere sezioni di un sito web, sebbene fosse intesa solo per una singola directory. Anche le regole contraddittorie, in cui una riga successiva revoca un’autorizzazione precedente, causano spesso un comportamento di scansione poco chiaro. Soprattutto in caso di cambio del sistema di gestione dei contenuti, il file viene spesso ripreso senza modifiche, nonostante la struttura dei percorsi sia completamente cambiata.
Un altro problema classico riguarda le strutture degli URL, che cambiano nel tempo: le vecchie regole “Disallow” rimandano quindi a percorsi che non esistono più da tempo, mentre le nuove aree, effettivamente sensibili, rimangono prive di protezione.
- Non definire le voci “Disallow” in modo troppo generico
- Risolvere in modo coerente le incongruenze nelle regole
- Verificare nuovamente il file dopo il cambio di sistema
- Eliminare regolarmente i percorsi obsoleti
Il file robots.txt in combinazione con la gestione dei tag
Strumenti come
In caso di configurazioni più complesse con più servizi integrati, vale quindi la pena effettuare un inventario periodico di tutti i domini coinvolti, non solo del proprio dominio principale.
- Gli script esterni hanno regole proprie
- Non concentrarsi solo sul dominio principale
- Elencare regolarmente i domini interessati
- Aggiornare la configurazione per i nuovi servizi
Chi considera il file robots.txt, la Sitemap e la struttura tecnica come un sistema integrato anziché come singole attività separate, individua più rapidamente gli errori ed evita che una modifica apportata in un punto provochi, senza che ce ne si accorga, effetti collaterali in un altro punto, che si notano solo settimane dopo.

Più visitatori per il sito web: canali, leve e indicatori chiave

Storia del marketing: dalla pubblicità di un tempo alle campagne moderne

Il linguaggio del marketing: come i marchi comunicano, convincono e suscitano reazioni

Singles Day: il più grande evento di shopping al mondo e cosa possono imparare i marchi da esso
















4.9 / 5.0