Verificatore di crawler AI
Scopri quali crawler AI possono raggiungere il tuo sito, e quali vengono respinti.
| Bot | robots.txt | Scansionabilità |
|---|
robots.txt così come scaricato
Cosa controlla
Due cose distinte decidono se un crawler AI raggiunge la tua pagina, e falliscono in modo indipendente.
La prima è il robots.txt, il portiere educato. È una richiesta e non un lucchetto, e non tutti gli agenti in questa lista lo rispettano. La seconda è ciò che fa il tuo server quando la richiesta arriva davvero. È il livello del firewall, ed è lì che vive la maggior parte dei blocchi accidentali, perché quasi nessuno li imposta di proposito. Una regola scritta per fermare gli scraper non distingue uno scraper da PerplexityBot.
Questo verificatore guarda entrambe. Legge il tuo robots.txt e ricava cosa è permesso a ciascun bot, poi scarica la pagina con il vero User-Agent di quel bot e confronta la risposta con quella che riceve un browser normale. Quando i due livelli non concordano, lo scopri adesso e non mesi dopo, quando ti accorgi che nessuno ti cita.
Una cosa da dire chiaramente. La prova parte dai nostri server con la stringa User-Agent di ciascun bot. I crawler veri arrivano dai propri intervalli IP, quindi un firewall che verifica gli indirizzi IP può trattarli in modo diverso. Se qui vedi un blocco, è reale. Un risultato consentito è un segnale forte e non una garanzia, e i bot che di solito vengono verificati tramite IP sono segnalati come tali nei risultati.
I crawler AI che controlliamo
Non tutti gli user agent in questa lista fanno lo stesso lavoro. Alcuni raccolgono pagine per l'addestramento. Alcuni costruiscono l'indice dietro la ricerca di un assistente. Altri compaiono solo quando una persona chiede all'assistente di aprire un link. Bloccarne uno è una decisione diversa dal bloccarne un altro, e i risultati non sono intercambiabili.
| User agent | Operatore | Cosa fa | Se lo blocchi |
|---|---|---|---|
GPTBot | OpenAI | Raccoglie pagine per l'addestramento dei modelli | I tuoi contenuti restano fuori dall'addestramento |
OAI-SearchBot | OpenAI | Costruisce l'indice dietro la ricerca di ChatGPT | La ricerca di ChatGPT smette di mostrarti |
ChatGPT-User | OpenAI | Scarica una pagina quando qualcuno chiede a ChatGPT di aprirla | ChatGPT non può leggere un link incollato da un utente |
ClaudeBot | Anthropic | Raccoglie pagine per l'addestramento dei modelli | I tuoi contenuti restano fuori dall'addestramento |
Claude-SearchBot | Anthropic | Indicizza pagine per i risultati di ricerca di Claude | Claude smette di citarti nelle risposte |
Claude-User | Anthropic | Scarica una pagina quando qualcuno chiede a Claude di aprirla | Claude non può leggere un link incollato da un utente |
PerplexityBot | Perplexity | Indicizza pagine per le risposte di Perplexity | Perplexity smette di citarti |
Perplexity-User | Perplexity | Scarica una pagina in risposta a una domanda | Perplexity non può aprire una pagina chiesta da un utente |
Googlebot | L'indice di ricerca, che alimenta anche AI Overviews | Scompari dalla ricerca Google | |
Bingbot | Microsoft | L'indice di Bing, che alimenta Copilot | Scompari da Bing e da Copilot |
Applebot | Apple | Alimenta la ricerca in Siri, Spotlight e Safari | Gli assistenti di Apple non ti trovano più |
Meta-ExternalAgent | Meta | Raccoglie pagine per i modelli di Meta e indicizza direttamente alcuni contenuti | I tuoi contenuti restano fuori dall'addestramento di Meta |
Meta-WebIndexer | Meta | Indicizza pagine per i risultati di ricerca di Meta AI | Meta AI smette di citarti e di linkarti |
DuckAssistBot | DuckDuckGo | Alimenta le risposte dell'assistente di DuckDuckGo e non viene usato per l'addestramento | DuckAssist smette di usare le tue pagine |
MistralAI-Training | Mistral | Raccoglie pagine per l'addestramento dei modelli | I tuoi contenuti restano fuori dall'addestramento di Mistral |
MistralAI-Index | Mistral | Indicizza pagine per la ricerca dietro l'assistente di Mistral | L'assistente di Mistral smette di mostrarti |
MistralAI-User | Mistral | Scarica una pagina quando qualcuno chiede all'assistente di Mistral di aprirla | L'assistente non può leggere un link incollato da un utente |
CCBot | Common Crawl | Costruisce l'archivio aperto di scansione su cui si addestrano molti modelli | Resti fuori da un set di dati usato in tutto il settore |
Google-Extended | Una direttiva robots.txt, non un crawler. Decide se Google può usare le tue pagine per Gemini | Le tue pagine restano nella ricerca Google e in AI Overviews, ma Google non può usarle per addestrare o alimentare Gemini | |
Applebot-Extended | Apple | Una direttiva robots.txt, non un crawler. Decide se Apple può addestrarsi sulle tue pagine | Siri, Spotlight e Safari continuano a usare le tue pagine, Apple smette di addestrarci i suoi modelli |
Addestramento e ricerca sono decisioni separate
Bloccare GPTBot e consentire OAI-SearchBot ti tiene fuori dai dati di addestramento e ti tiene nei risultati di ricerca di ChatGPT. Anthropic separa ClaudeBot e Claude-SearchBot allo stesso modo, Meta separa Meta-ExternalAgent e Meta-WebIndexer, e Mistral usa un agente distinto per addestramento, ricerca e richieste degli utenti. Molti siti finiscono per bloccare tutto per sbaglio quando volevano solo uscire dall'addestramento.
Gli agenti che finiscono in User non sono crawler
ChatGPT-User, Claude-User, Perplexity-User e MistralAI-User si attivano solo quando qualcuno ha già incollato il tuo link e ha chiesto all'assistente di leggerlo. Bloccarli non protegge nulla dall'addestramento. Non ferma nulla, tranne la persona che stava cercando di leggere la tua pagina.
Che bloccarli nel robots.txt funzioni o no dipende dall'operatore. Anthropic e Mistral rispettano il file per questi agenti. OpenAI dice che le regole potrebbero non applicarsi, perché la richiesta è arrivata da una persona e non da una scansione. Perplexity dice che il suo sistema di recupero in genere le ignora. Un blocco che deve reggere va nel firewall.
Gli ultimi due sono direttive, non crawler
Google-Extended e Applebot-Extended non inviano mai una richiesta. Stanno nel robots.txt e dicono a Google e ad Apple cosa si può fare con le pagine che i loro crawler ordinari hanno già scaricato. Non c'è un crawler da simulare, quindi il verificatore valuta queste direttive solo in base al robots.txt e li segna come senza richiesta live.
Google-Extended merita una seconda lettura. Bloccarlo non tocca il tuo posizionamento su Google e non ti toglie da AI Overviews, perché entrambi funzionano con Googlebot. Ciò che impedisce è che Gemini usi i tuoi contenuti.
Apple ripiega su Googlebot
Se il tuo robots.txt non nomina mai Applebot ma nomina Googlebot, Apple segue le regole di Googlebot. Il report lo indica su quella riga quando succede. Vale la pena saperlo, perché un Disallow scritto pensando a Google si applica in silenzio anche a Siri, Spotlight e Safari, e nulla nel tuo file lo dice ad alta voce.
Uno user agent è una dichiarazione, non un'identità
La maggior parte degli operatori in questa lista dice di rispettare il robots.txt, con le eccezioni indicate sopra, e chiunque può dichiarare qualsiasi cosa in una stringa User-Agent. Se hai bisogno di certezza e non di collaborazione, verifica tramite intervallo IP o DNS inverso. I grandi operatori pubblicano i propri intervalli IP o i dati per la verifica tramite DNS inverso.
Perché il robots.txt è solo metà della risposta
Leggere il robots.txt ti dice cosa hai chiesto. Non ti mostra mai cosa è successo davvero.
La protezione anti-bot di una CDN, un limitatore di richieste, un blocco per paese o una pagina di verifica possono tutti respingere un crawler AI mentre il tuo robots.txt continua a invitarlo a entrare. Nulla di tutto questo è scritto nel file, e il più delle volte nulla arriva nemmeno ai tuoi log, perché la richiesta viene tagliata prima di raggiungere il tuo sito.
Lo schema è facile da riconoscere una volta che l'hai visto. Il tuo robots.txt consente GPTBot, e GPTBot riceve comunque un 403. Quando robots.txt e realtà non concordano, il 403 è ciò che è reale.
È anche il motivo per cui una pagina può mancare dalle risposte di un assistente mentre tutti i controlli tecnici del sito si concludono senza rilevare problemi. Usa il nostro strumento di visibilità AI per scoprire se gli assistenti citano davvero il tuo brand.
Cosa significa ogni risultato
La tabella dei risultati ha due colonne che rispondono a domande diverse, quindi la legenda è divisa allo stesso modo. Leggere un'etichetta di Scansionabilità con la scala del robots.txt è il modo più rapido per fraintendere tutto il report.
La colonna robots.txt: cosa permette il tuo file
| Risultato | Cosa significa |
|---|---|
| Consentito | Il tuo robots.txt lascia che questo bot scansioni la pagina che hai testato |
| Bloccato | Una regola nel robots.txt chiude questa pagina a questo bot. La riga mostra quale regola l'ha fatto, e la soluzione è nel file |
| Parzialmente bloccato | La pagina che hai testato è aperta a questo bot, ma il robots.txt ha regole rivolte a lui altrove nel sito. La riga mostra quali regole e da quale gruppo vengono, così puoi controllare che volessi davvero tenerle chiuse |
La colonna Scansionabilità: cosa ha fatto davvero il tuo server
| Risultato | Cosa significa |
|---|---|
| Scansionabile (con lo stato HTTP) | La richiesta del bot è passata e il tuo server ha risposto normalmente |
| Bloccato (con lo stato HTTP) | La richiesta è stata rifiutata. Il robots.txt non è la causa, quindi guarda le regole del tuo firewall, WAF o CDN |
| Da verificare | Un bot che di norma viene verificato tramite indirizzo IP è stato rifiutato. La nostra prova non arriva dall'intervallo IP di quel bot, quindi può essere il tuo firewall che funziona correttamente e non un problema |
| Errore (con lo stato HTTP) | La pagina ha restituito un errore e non un blocco. Un 404 di solito significa che l'URL è sbagliato, un 500 che qualcosa sul tuo sito non funziona. Nessuno dei due è un problema di crawler |
| Nessuna risposta | Non è tornato proprio nulla. Un timeout o una connessione caduta, che punta alla rete o a un blocco molto aggressivo |
| Nessuna richiesta live | Una direttiva robots.txt e non un crawler, quindi non c'è nulla a cui inviare una richiesta. Il verdetto del robots.txt è tutta la risposta |
| Non testato | Non hai selezionato questo bot, quindi non è stata fatta alcuna richiesta live. Il suo verdetto robots.txt resta valido |
Come sbloccare un crawler
Una regola nel robots.txt. Rimuovi il Disallow, o aggiungi un Allow più specifico per quello user agent. Vince la regola corrispondente più specifica, quindi un Allow esplicito per un bot batte un Disallow: / generico rivolto a tutti.
Una regola del firewall o della CDN. Nulla nei file del tuo sito risolverà questa. Su Cloudflare sta nella gestione dei bot. Su altri host cerca sotto WAF o protezione anti-bot. Consenti lì lo user agent, e verifica tramite intervallo IP se vuoi stare attento agli impostori.
Una pagina di verifica. Esenta lo user agent dalla verifica. Un crawler non può risolverla.
Un noindex in un meta tag o un header X-Robots-Tag. Il crawler può raggiungere la pagina e gli è stato detto di non conservarla. Vale la pena confermare che fosse voluto, perché un plugin o un'impostazione di staging dimenticata lo fanno in silenzio.
Gli stessi passaggi funzionano al contrario. Se vuoi bloccare GPTBot o qualsiasi altro crawler AI, un Disallow per quello user agent nel robots.txt è il modo educato, e una regola del firewall è quello che lo impone davvero.
Domande frequenti
Che cos'è la scansionabilità AI?
La possibilità per i crawler AI di raggiungere e leggere le tue pagine. Comprende il robots.txt e tutto ciò che si trova tra un bot e i tuoi contenuti, ed è il primo requisito per qualsiasi altra cosa. Scansionabilità LLM è la stessa idea con un altro nome.
I crawler AI rispettano il robots.txt?
Per i crawler che scaricano le pagine in automatico, i grandi operatori dicono di sì. Gli agenti che aprono una pagina perché una persona l'ha chiesto sono un altro caso, e sia OpenAI sia Perplexity dicono che il robots.txt potrebbe non fermarli. Nessun meccanismo impone il rispetto di queste regole. Il robots.txt è una richiesta, non un lucchetto.
Posso bloccare l'addestramento delle AI e restare nei risultati di ricerca AI?
Sì, ed è ciò che la maggior parte dei proprietari di siti vuole davvero. Blocca GPTBot e ClaudeBot per restare fuori dall'addestramento, e consenti OAI-SearchBot e Claude-SearchBot così che gli assistenti possano ancora trovarti e citarti.
Bloccare i crawler AI danneggia il mio SEO?
No. GPTBot, ClaudeBot e gli altri crawler AI non hanno nulla a che fare con il posizionamento su Google, e bloccarli non cambia la tua posizione nei risultati di ricerca. Bloccare Googlebot è tutta un'altra faccenda.
Perché il mio sito supera i controlli del robots.txt e viene comunque bloccato?
Perché il robots.txt è solo il primo livello. Una regola del firewall, del WAF o della CDN può rifiutare la richiesta prima che raggiunga il tuo server, e quel blocco è invisibile sia nel tuo robots.txt sia nei tuoi log.
GPTBot è la stessa cosa di OAI-SearchBot?
No. GPTBot raccoglie pagine per l'addestramento. OAI-SearchBot costruisce l'indice dietro la ricerca di ChatGPT. Puoi consentire l'uno e bloccare l'altro.
Perché ChatGPT non cita il mio sito o il mio brand?
Essere raggiungibili è il primo requisito, quindi inizia controllando che OAI-SearchBot non sia bloccato. Se l'accesso è a posto, il motivo di solito è che ChatGPT trova la risposta altrove e non ha motivo di rivolgersi a te.
Come faccio a far comparire il mio sito in ChatGPT?
Assicurati che i crawler possano leggerti, poi lavora per meritare la citazione. Gli assistenti si appoggiano a fonti che hanno già visto citate altrove, quindi le menzioni su siti di cui già si fidano contano più di qualsiasi cosa sulle tue pagine.
Essere raggiungibili è la prima domanda. Se gli assistenti ti nominano davvero è un'altra.