Il tuo robots.txt decide se ChatGPT, Perplexity e Gemini possono leggere il tuo sito. Sembra banale, ma il 40% dei siti WordPress che gestiamo ha direttive che bloccano accidentalmente i bot AI di retrieval. Risultato: il sito scompare dalle risposte di ChatGPT e Perplexity, e nessuno se ne accorge per mesi. In questa guida spieghiamo esattamente come configurare robots.txt per i bot AI, quali user-agent permettere, quali bloccare, e come verificare che tutto funzioni.
Cosa sono i bot AI e perché il robots.txt conta
I motori AI come ChatGPT, Perplexity, Claude e Gemini usano crawler dedicati per recuperare contenuti dal web. Questi bot leggono il tuo robots.txt per capire se possono accedere al tuo sito. A differenza di Googlebot, che esiste da vent’anni, i bot AI sono nuovi e hanno regole specifiche che cambiano ogni pochi mesi.
La regola fondamentale: i bot AI non sono bloccati di default. Se non scrivi nulla, tutti i bot compliant possono crawlare il tuo sito. Il problema è che molti siti WordPress hanno regole scritte anni fa che, senza saperlo, bloccano bot come GPTBot o ClaudeBot.
Se gestisci siti per clienti, devi sapere che GEO (Generative Engine Optimization) inizia dal robots.txt. Se il bot non può leggerti, non può citarti. E non esiste ottimizzazione SEO che tenga: la visibilità AI parte dall’accesso.
La lista completa dei bot AI nel 2026
Per configurare correttamente il robots.txt, devi conoscere ogni bot attivo. Ecco la mappa aggiornata a luglio 2026:
| Provider | User-Agent | Tipo | Cosa fa |
|---|---|---|---|
| OpenAI | GPTBot |
Training | Addestra i modelli generativi di OpenAI |
| OpenAI | OAI-SearchBot |
Retrieval | Recupera contenuti per i risultati di ricerca in ChatGPT |
| OpenAI | ChatGPT-User |
Retrieval | Visita pagine quando un utente ChatGPT fa una domanda |
| Anthropic | ClaudeBot |
Training | Addestra i modelli Claude |
| Anthropic | Claude-User |
Retrieval | Recupera contenuti quando un utente Claude fa una domanda |
| Anthropic | Claude-SearchBot |
Retrieval | Indicizza contenuti per migliorare i risultati di ricerca |
| Perplexity | PerplexityBot |
Retrieval | Recupera e linka siti nei risultati di ricerca Perplexity |
| Perplexity | Perplexity-User |
Retrieval | Visita pagine su richiesta dell’utente (ignora robots.txt) |
Google-Extended |
Controllo | Controlla l’uso dei contenuti per Gemini e AI Overviews | |
| Common Crawl | CCBot |
Training | Dataset open source usato da molti modelli AI |
| ByteDance | Bytespider |
Training | Addestra i modelli di ByteDance |
| Apple | Applebot-Extended |
Training | Addestra Apple Intelligence |
Distinguere training e retrieval è critico. I bot di retrieval (OAI-SearchBot, ChatGPT-User, Claude-User, Claude-SearchBot, PerplexityBot) sono quelli che possono citarti nelle risposte AI. I bot di training (GPTBot, ClaudeBot, CCBot) raccolgono contenuti per addestrare modelli. Puoi permettere i primi e bloccare i secondi, se vuoi essere citato ma non contribuire al training.
La trappola OpenAI: tre bot diversi
L’errore più comune che vediamo nei siti dei nostri clienti è bloccare GPTBot pensando di aver bloccato ChatGPT. OpenAI opera tre crawler separati, ognuno con funzioni diverse:
- GPTBot — solo training. Bloccarlo significa: “non usate i miei contenuti per addestrare i vostri modelli”.
- OAI-SearchBot — solo ricerca. Bloccarlo significa: il tuo sito non appare nei risultati di ricerca di ChatGPT.
- ChatGPT-User — retrieval on-demand. Quando un utente fa una domanda a ChatGPT, questo bot visita la pagina. Bloccarlo significa ChatGPT non può leggere il tuo sito per rispondere.
Se scrivi User-agent: GPTBot e Disallow: /, blocchi solo il training. ChatGPT può ancora citarti tramite OAI-SearchBot e ChatGPT-User. Ma se blocchi tutti e tre, il tuo sito scompare completamente da ChatGPT.
Secondo la documentazione ufficiale OpenAI, ogni impostazione è indipendente. Puoi permettere OAI-SearchBot per apparire nei risultati di ricerca e bloccare GPTBot per non contribuire al training.
Template robots.txt: permettere i bot di retrieval, bloccare training
Questa è la configurazione che usiamo su tutti i siti dei nostri clienti che vogliono massima visibilità AI. Permette a tutti i bot di retrieval di accedere e blocca i bot di training:
# === AI Retrieval Bots - ALLOW ===
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
# === AI Training Bots - BLOCK ===
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: Applebot-Extended
Disallow: /
# === Sitemap ===
Sitemap: https://tuosito.it/sitemap_index.xml
Questa configurazione dice: “potete citarmi nelle risposte AI, ma non usate i miei contenuti per addestrare modelli”. È la strategia che raccomandiamo alla maggior parte delle agenzie: massimizza la visibilità AI senza rinunciare al controllo sui dati.
Template robots.txt: massima visibilità
Se il tuo cliente vuole essere visibile ovunque, anche nei dataset di training, usa questa versione minimalista:
# Tutti i bot AI sono allow di default
# Non serve scrivere Allow espliciti
# === Sitemap ===
Sitemap: https://tuosito.it/sitemap_index.xml
Il robots.txt non blocca nulla di default. Se non scrivi direttive Disallow, tutti i bot — inclusi quelli AI — possono accedere. Questa è la configurazione più semplice e funziona per la maggior parte dei siti che puntano alla massima visibilità.
Template robots.txt: bloccare tutti i bot AI
Se il tuo cliente non vuole comparire nelle risposte AI (settori sensibili, contenuti premium, paywall), usa:
# === AI Bots - BLOCK ALL ===
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-User
Disallow: /
User-agent: Claude-SearchBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: Applebot-Extended
Disallow: /
# === Sitemap ===
Sitemap: https://tuosito.it/sitemap_index.xml
Attenzione: bloccare tutti i bot AI non significa che il sito sparirà da Google. I bot AI sono separati da Googlebot. Il sito rimarrà nei risultati di ricerca tradizionali, ma non apparirà in ChatGPT, Perplexity, Claude e AI Overviews di Google.
Case-sensitive: l’errore silenzioso che blocca tutto
I token user-agent nel robots.txt sono case-sensitive. Questo significa che:
User-agent: GPTBot→ corretto, il bot legge la regolaUser-agent: gptbot→ sbagliato, il bot ignora la regolaUser-agent: claudebot→ sbagliato, ClaudeBot non vede il DisallowUser-agent: Perplexitybot→ sbagliato, la P maiuscola è obbligatoria
Nella nostra esperienza, il 30% dei robots.txt che auditiamo ha almeno un errore di casing. Copia sempre l’esatto user-agent dalla documentazione ufficiale del provider.
Cloudflare e WAF: quando robots.txt non basta
Il robots.txt è solo il primo livello di controllo. Se usi Cloudflare o un WAF, devi verificare che non stia bloccando i bot AI a livello di edge:
- Cloudflare Super Bot Fight Mode — può bloccare automaticamente i bot “verificati” che includono GPTBot e ClaudeBot. Verifica in Security → Bots che i bot AI non siano in blocklist.
- Cloudflare Managed robots.txt — sovrascrive il tuo
robots.txtpersonalizzato. Se attivo, le tue regole manuali vengono ignorate. - WAF rules personalizzate — regole che bloccano per user-agent possono intercettare bot AI anche se il
robots.txtli permette.
Per verificare: apri il tuo sito con curl -A "GPTBot" https://tuosito.it/ e controlla che la risposta sia 200 OK. Se ricevi un 403 o una challenge Cloudflare, il WAF sta bloccando il bot.
Come verificare che il robots.txt funzioni
Dopo aver aggiornato il robots.txt, segui questi 4 controlli:
- Apri
/robots.txtnel browser e verifica che le regole siano presenti con il casing corretto. - Testa con curl simulando i bot AI:
curl -A "GPTBot" -I https://tuosito.it/deve restituire 200. - Controlla Cloudflare/WAF — disattiva temporaneamente le bot fight mode e testa di nuovo.
- Verifica la sitemap — la riga
Sitemap:deve puntare a un URL raggiungibile (risponde 200).
Per automazione, puoi integrare questo check nella pipeline CI/CD con script WP-CLI o strumenti come GEO Optimizer, che verifica automaticamente l’accessibilità dei bot AI.
Google-Extended: il caso speciale
Google-Extended è diverso dagli altri bot: non è un user-agent HTTP separato. Google crawl con i suoi user-agent standard (Googlebot, Googlebot-Image) e usa il token Google-Extended solo come segnale di controllo nel robots.txt. Questo significa:
- Non vedrai traffico “Google-Extended” nei log del server
- Il token controlla se i contenuti crawlati da Google possono essere usati per Gemini e AI Overviews
- Bloccare
Google-Extendednon influisce sul ranking Google tradizionale - Permettere
Google-Extendedabilita il tuo sito per le AI Overviews di Google
Perplexity-User: il bot che ignora robots.txt
Un dettaglio importante: Perplexity-User (il bot che Perplexity usa quando un utente fa una domanda diretta) ignora il robots.txt. Secondo la documentazione ufficiale Perplexity: “Since a user requested the fetch, this fetcher generally ignores robots.txt rules.”
Questo significa che anche se blocchi tutti i bot AI nel robots.txt, Perplexity può comunque leggere il tuo sito se un utente fa una domanda specifica. È un comportamento simile a un browser: l’utente ha richiesto esplicitamente di visitare la pagina.
5 errori comuni con robots.txt e bot AI
- Bloccare GPTBot pensando di bloccare ChatGPT — ChatGPT usa OAI-SearchBot e ChatGPT-User per il retrieval, non GPTBot.
- Casing sbagliato —
gptbotnon èGPTBot. Case-sensitive, sempre. - Wildcard Disallow troppo aggressivi —
Disallow: *può intercettare bot AI per errore. - Dimenticare la Sitemap — senza la direttiva
Sitemap:, i bot AI devono scoprire gli URL crawling, invece di leggere la mappa direttamente. - Cloudflare che sovrascrive tutto — il tuo
robots.txtdice Allow, ma il WAF blocca il bot a livello di edge. Verifica sempre entrambi i livelli.
FAQ: robots.txt e bot AI
Se permetto GPTBot, il mio sito apparirà in ChatGPT?
No, non automaticamente. Permettere GPTBot significa che OpenAI può crawlare il tuo sito per il training. Per apparire nei risultati di ricerca di ChatGPT devi permettere OAI-SearchBot. Per essere leggibile quando un utente fa una domanda, devi permettere ChatGPT-User. Allow è necessario ma non sufficiente: la qualità e la struttura dei contenuti determina se vieni citato.
Bloccare i bot AI danneggia la SEO tradizionale?
No. I bot AI sono separati da Googlebot e Bingbot. Bloccare GPTBot, ClaudeBot o PerplexityBot non influisce sul ranking Google o Bing. L’unica eccezione è Google-Extended, che controlla l’uso dei contenuti per AI Overviews ma non per la ricerca tradizionale.
Perplexity-User ignora davvero il robots.txt?
Sì. Secondo la documentazione ufficiale Perplexity, Perplexity-User recupera pagine su richiesta dell’utente e generalmente ignora le regole del robots.txt. È simile al comportamento di un browser: l’utente ha esplicitamente richiesto di visitare quella pagina.
Quanto tempo serve perché i bot AI rispettino le nuove regole?
Dipende dal provider. OpenAI indica circa 24 ore dall’aggiornamento del robots.txt perché i sistemi si adeguino. Anthropic e Perplexity non specificano un timing esatto, ma nella nostra esperienza i cambiamenti si riflettono entro 48-72 ore.
Posso bloccare solo i bot di training e permettere quelli di retrieval?
Sì, è la configurazione che raccomandiamo per la maggior parte dei siti. Permetti OAI-SearchBot, ChatGPT-User, Claude-User, Claude-SearchBot, PerplexityBot e Google-Extended. Blocca GPTBot, ClaudeBot, CCBot, Bytespider e Applebot-Extended. In questo modo rimani citabile nelle risposte AI senza contribuire al training dei modelli.