robots.txt per AI Bot: Guida Completa a GPTBot, ClaudeBot e PerplexityBot [2026]

2 settembre 20269 minSEO

Il tuo robots.txt decide se ChatGPT, Perplexity e Gemini possono leggere il tuo sito. Sembra banale, ma il 40% dei siti WordPress che gestiamo ha direttive che bloccano accidentalmente i bot AI di retrieval. Risultato: il sito scompare dalle risposte di ChatGPT e Perplexity, e nessuno se ne accorge per mesi. In questa guida spieghiamo esattamente come configurare robots.txt per i bot AI, quali user-agent permettere, quali bloccare, e come verificare che tutto funzioni.

Cosa sono i bot AI e perché il robots.txt conta

I motori AI come ChatGPT, Perplexity, Claude e Gemini usano crawler dedicati per recuperare contenuti dal web. Questi bot leggono il tuo robots.txt per capire se possono accedere al tuo sito. A differenza di Googlebot, che esiste da vent’anni, i bot AI sono nuovi e hanno regole specifiche che cambiano ogni pochi mesi.

La regola fondamentale: i bot AI non sono bloccati di default. Se non scrivi nulla, tutti i bot compliant possono crawlare il tuo sito. Il problema è che molti siti WordPress hanno regole scritte anni fa che, senza saperlo, bloccano bot come GPTBot o ClaudeBot.

Se gestisci siti per clienti, devi sapere che GEO (Generative Engine Optimization) inizia dal robots.txt. Se il bot non può leggerti, non può citarti. E non esiste ottimizzazione SEO che tenga: la visibilità AI parte dall’accesso.

La lista completa dei bot AI nel 2026

Per configurare correttamente il robots.txt, devi conoscere ogni bot attivo. Ecco la mappa aggiornata a luglio 2026:

Provider User-Agent Tipo Cosa fa
OpenAI GPTBot Training Addestra i modelli generativi di OpenAI
OpenAI OAI-SearchBot Retrieval Recupera contenuti per i risultati di ricerca in ChatGPT
OpenAI ChatGPT-User Retrieval Visita pagine quando un utente ChatGPT fa una domanda
Anthropic ClaudeBot Training Addestra i modelli Claude
Anthropic Claude-User Retrieval Recupera contenuti quando un utente Claude fa una domanda
Anthropic Claude-SearchBot Retrieval Indicizza contenuti per migliorare i risultati di ricerca
Perplexity PerplexityBot Retrieval Recupera e linka siti nei risultati di ricerca Perplexity
Perplexity Perplexity-User Retrieval Visita pagine su richiesta dell’utente (ignora robots.txt)
Google Google-Extended Controllo Controlla l’uso dei contenuti per Gemini e AI Overviews
Common Crawl CCBot Training Dataset open source usato da molti modelli AI
ByteDance Bytespider Training Addestra i modelli di ByteDance
Apple Applebot-Extended Training Addestra Apple Intelligence

Distinguere training e retrieval è critico. I bot di retrieval (OAI-SearchBot, ChatGPT-User, Claude-User, Claude-SearchBot, PerplexityBot) sono quelli che possono citarti nelle risposte AI. I bot di training (GPTBot, ClaudeBot, CCBot) raccolgono contenuti per addestrare modelli. Puoi permettere i primi e bloccare i secondi, se vuoi essere citato ma non contribuire al training.

La trappola OpenAI: tre bot diversi

L’errore più comune che vediamo nei siti dei nostri clienti è bloccare GPTBot pensando di aver bloccato ChatGPT. OpenAI opera tre crawler separati, ognuno con funzioni diverse:

  • GPTBot — solo training. Bloccarlo significa: “non usate i miei contenuti per addestrare i vostri modelli”.
  • OAI-SearchBot — solo ricerca. Bloccarlo significa: il tuo sito non appare nei risultati di ricerca di ChatGPT.
  • ChatGPT-User — retrieval on-demand. Quando un utente fa una domanda a ChatGPT, questo bot visita la pagina. Bloccarlo significa ChatGPT non può leggere il tuo sito per rispondere.

Se scrivi User-agent: GPTBot e Disallow: /, blocchi solo il training. ChatGPT può ancora citarti tramite OAI-SearchBot e ChatGPT-User. Ma se blocchi tutti e tre, il tuo sito scompare completamente da ChatGPT.

Secondo la documentazione ufficiale OpenAI, ogni impostazione è indipendente. Puoi permettere OAI-SearchBot per apparire nei risultati di ricerca e bloccare GPTBot per non contribuire al training.

Template robots.txt: permettere i bot di retrieval, bloccare training

Questa è la configurazione che usiamo su tutti i siti dei nostri clienti che vogliono massima visibilità AI. Permette a tutti i bot di retrieval di accedere e blocca i bot di training:

# === AI Retrieval Bots - ALLOW ===
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

# === AI Training Bots - BLOCK ===
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Applebot-Extended
Disallow: /

# === Sitemap ===
Sitemap: https://tuosito.it/sitemap_index.xml

Questa configurazione dice: “potete citarmi nelle risposte AI, ma non usate i miei contenuti per addestrare modelli”. È la strategia che raccomandiamo alla maggior parte delle agenzie: massimizza la visibilità AI senza rinunciare al controllo sui dati.

Template robots.txt: massima visibilità

Se il tuo cliente vuole essere visibile ovunque, anche nei dataset di training, usa questa versione minimalista:

# Tutti i bot AI sono allow di default
# Non serve scrivere Allow espliciti

# === Sitemap ===
Sitemap: https://tuosito.it/sitemap_index.xml

Il robots.txt non blocca nulla di default. Se non scrivi direttive Disallow, tutti i bot — inclusi quelli AI — possono accedere. Questa è la configurazione più semplice e funziona per la maggior parte dei siti che puntano alla massima visibilità.

Template robots.txt: bloccare tutti i bot AI

Se il tuo cliente non vuole comparire nelle risposte AI (settori sensibili, contenuti premium, paywall), usa:

# === AI Bots - BLOCK ALL ===
User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-User
Disallow: /

User-agent: Claude-SearchBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Applebot-Extended
Disallow: /

# === Sitemap ===
Sitemap: https://tuosito.it/sitemap_index.xml

Attenzione: bloccare tutti i bot AI non significa che il sito sparirà da Google. I bot AI sono separati da Googlebot. Il sito rimarrà nei risultati di ricerca tradizionali, ma non apparirà in ChatGPT, Perplexity, Claude e AI Overviews di Google.

Case-sensitive: l’errore silenzioso che blocca tutto

I token user-agent nel robots.txt sono case-sensitive. Questo significa che:

  • User-agent: GPTBot → corretto, il bot legge la regola
  • User-agent: gptbot → sbagliato, il bot ignora la regola
  • User-agent: claudebot → sbagliato, ClaudeBot non vede il Disallow
  • User-agent: Perplexitybot → sbagliato, la P maiuscola è obbligatoria

Nella nostra esperienza, il 30% dei robots.txt che auditiamo ha almeno un errore di casing. Copia sempre l’esatto user-agent dalla documentazione ufficiale del provider.

Cloudflare e WAF: quando robots.txt non basta

Il robots.txt è solo il primo livello di controllo. Se usi Cloudflare o un WAF, devi verificare che non stia bloccando i bot AI a livello di edge:

  1. Cloudflare Super Bot Fight Mode — può bloccare automaticamente i bot “verificati” che includono GPTBot e ClaudeBot. Verifica in Security → Bots che i bot AI non siano in blocklist.
  2. Cloudflare Managed robots.txt — sovrascrive il tuo robots.txt personalizzato. Se attivo, le tue regole manuali vengono ignorate.
  3. WAF rules personalizzate — regole che bloccano per user-agent possono intercettare bot AI anche se il robots.txt li permette.

Per verificare: apri il tuo sito con curl -A "GPTBot" https://tuosito.it/ e controlla che la risposta sia 200 OK. Se ricevi un 403 o una challenge Cloudflare, il WAF sta bloccando il bot.

Come verificare che il robots.txt funzioni

Dopo aver aggiornato il robots.txt, segui questi 4 controlli:

  1. Apri /robots.txt nel browser e verifica che le regole siano presenti con il casing corretto.
  2. Testa con curl simulando i bot AI: curl -A "GPTBot" -I https://tuosito.it/ deve restituire 200.
  3. Controlla Cloudflare/WAF — disattiva temporaneamente le bot fight mode e testa di nuovo.
  4. Verifica la sitemap — la riga Sitemap: deve puntare a un URL raggiungibile (risponde 200).

Per automazione, puoi integrare questo check nella pipeline CI/CD con script WP-CLI o strumenti come GEO Optimizer, che verifica automaticamente l’accessibilità dei bot AI.

Google-Extended: il caso speciale

Google-Extended è diverso dagli altri bot: non è un user-agent HTTP separato. Google crawl con i suoi user-agent standard (Googlebot, Googlebot-Image) e usa il token Google-Extended solo come segnale di controllo nel robots.txt. Questo significa:

  • Non vedrai traffico “Google-Extended” nei log del server
  • Il token controlla se i contenuti crawlati da Google possono essere usati per Gemini e AI Overviews
  • Bloccare Google-Extended non influisce sul ranking Google tradizionale
  • Permettere Google-Extended abilita il tuo sito per le AI Overviews di Google

Perplexity-User: il bot che ignora robots.txt

Un dettaglio importante: Perplexity-User (il bot che Perplexity usa quando un utente fa una domanda diretta) ignora il robots.txt. Secondo la documentazione ufficiale Perplexity: “Since a user requested the fetch, this fetcher generally ignores robots.txt rules.”

Questo significa che anche se blocchi tutti i bot AI nel robots.txt, Perplexity può comunque leggere il tuo sito se un utente fa una domanda specifica. È un comportamento simile a un browser: l’utente ha richiesto esplicitamente di visitare la pagina.

5 errori comuni con robots.txt e bot AI

  1. Bloccare GPTBot pensando di bloccare ChatGPT — ChatGPT usa OAI-SearchBot e ChatGPT-User per il retrieval, non GPTBot.
  2. Casing sbagliato — gptbot non è GPTBot. Case-sensitive, sempre.
  3. Wildcard Disallow troppo aggressivi — Disallow: * può intercettare bot AI per errore.
  4. Dimenticare la Sitemap — senza la direttiva Sitemap:, i bot AI devono scoprire gli URL crawling, invece di leggere la mappa direttamente.
  5. Cloudflare che sovrascrive tutto — il tuo robots.txt dice Allow, ma il WAF blocca il bot a livello di edge. Verifica sempre entrambi i livelli.

FAQ: robots.txt e bot AI

Se permetto GPTBot, il mio sito apparirà in ChatGPT?

No, non automaticamente. Permettere GPTBot significa che OpenAI può crawlare il tuo sito per il training. Per apparire nei risultati di ricerca di ChatGPT devi permettere OAI-SearchBot. Per essere leggibile quando un utente fa una domanda, devi permettere ChatGPT-User. Allow è necessario ma non sufficiente: la qualità e la struttura dei contenuti determina se vieni citato.

Bloccare i bot AI danneggia la SEO tradizionale?

No. I bot AI sono separati da Googlebot e Bingbot. Bloccare GPTBot, ClaudeBot o PerplexityBot non influisce sul ranking Google o Bing. L’unica eccezione è Google-Extended, che controlla l’uso dei contenuti per AI Overviews ma non per la ricerca tradizionale.

Perplexity-User ignora davvero il robots.txt?

Sì. Secondo la documentazione ufficiale Perplexity, Perplexity-User recupera pagine su richiesta dell’utente e generalmente ignora le regole del robots.txt. È simile al comportamento di un browser: l’utente ha esplicitamente richiesto di visitare quella pagina.

Quanto tempo serve perché i bot AI rispettino le nuove regole?

Dipende dal provider. OpenAI indica circa 24 ore dall’aggiornamento del robots.txt perché i sistemi si adeguino. Anthropic e Perplexity non specificano un timing esatto, ma nella nostra esperienza i cambiamenti si riflettono entro 48-72 ore.

Posso bloccare solo i bot di training e permettere quelli di retrieval?

Sì, è la configurazione che raccomandiamo per la maggior parte dei siti. Permetti OAI-SearchBot, ChatGPT-User, Claude-User, Claude-SearchBot, PerplexityBot e Google-Extended. Blocca GPTBot, ClaudeBot, CCBot, Bytespider e Applebot-Extended. In questo modo rimani citabile nelle risposte AI senza contribuire al training dei modelli.

Gestisci i siti WordPress dei tuoi clienti?

AgencyPilot ti dà report AI, uptime monitoring, backup e portale clienti in un’unica dashboard. Gratis per 3 siti.

Prova gratis
Leggi anche
Tutti gli articoli
Tutti gli articoli