Verificatore di crawler AI

Scopri quali crawler AI possono raggiungere il tuo sito, e quali vengono respinti.

Bot da testare live

È gratis

Cosa controlla

Due cose distinte decidono se un crawler AI raggiunge la tua pagina, e falliscono in modo indipendente.

La prima è il robots.txt, il portiere educato. È una richiesta e non un lucchetto, e non tutti gli agenti in questa lista lo rispettano. La seconda è ciò che fa il tuo server quando la richiesta arriva davvero. È il livello del firewall, ed è lì che vive la maggior parte dei blocchi accidentali, perché quasi nessuno li imposta di proposito. Una regola scritta per fermare gli scraper non distingue uno scraper da PerplexityBot.

Questo verificatore guarda entrambe. Legge il tuo robots.txt e ricava cosa è permesso a ciascun bot, poi scarica la pagina con il vero User-Agent di quel bot e confronta la risposta con quella che riceve un browser normale. Quando i due livelli non concordano, lo scopri adesso e non mesi dopo, quando ti accorgi che nessuno ti cita.

Una cosa da dire chiaramente. La prova parte dai nostri server con la stringa User-Agent di ciascun bot. I crawler veri arrivano dai propri intervalli IP, quindi un firewall che verifica gli indirizzi IP può trattarli in modo diverso. Se qui vedi un blocco, è reale. Un risultato consentito è un segnale forte e non una garanzia, e i bot che di solito vengono verificati tramite IP sono segnalati come tali nei risultati.

I crawler AI che controlliamo

Non tutti gli user agent in questa lista fanno lo stesso lavoro. Alcuni raccolgono pagine per l'addestramento. Alcuni costruiscono l'indice dietro la ricerca di un assistente. Altri compaiono solo quando una persona chiede all'assistente di aprire un link. Bloccarne uno è una decisione diversa dal bloccarne un altro, e i risultati non sono intercambiabili.

User agentOperatoreCosa faSe lo blocchi
GPTBotOpenAIRaccoglie pagine per l'addestramento dei modelliI tuoi contenuti restano fuori dall'addestramento
OAI-SearchBotOpenAICostruisce l'indice dietro la ricerca di ChatGPTLa ricerca di ChatGPT smette di mostrarti
ChatGPT-UserOpenAIScarica una pagina quando qualcuno chiede a ChatGPT di aprirlaChatGPT non può leggere un link incollato da un utente
ClaudeBotAnthropicRaccoglie pagine per l'addestramento dei modelliI tuoi contenuti restano fuori dall'addestramento
Claude-SearchBotAnthropicIndicizza pagine per i risultati di ricerca di ClaudeClaude smette di citarti nelle risposte
Claude-UserAnthropicScarica una pagina quando qualcuno chiede a Claude di aprirlaClaude non può leggere un link incollato da un utente
PerplexityBotPerplexityIndicizza pagine per le risposte di PerplexityPerplexity smette di citarti
Perplexity-UserPerplexityScarica una pagina in risposta a una domandaPerplexity non può aprire una pagina chiesta da un utente
GooglebotGoogleL'indice di ricerca, che alimenta anche AI OverviewsScompari dalla ricerca Google
BingbotMicrosoftL'indice di Bing, che alimenta CopilotScompari da Bing e da Copilot
ApplebotAppleAlimenta la ricerca in Siri, Spotlight e SafariGli assistenti di Apple non ti trovano più
Meta-ExternalAgentMetaRaccoglie pagine per i modelli di Meta e indicizza direttamente alcuni contenutiI tuoi contenuti restano fuori dall'addestramento di Meta
Meta-WebIndexerMetaIndicizza pagine per i risultati di ricerca di Meta AIMeta AI smette di citarti e di linkarti
DuckAssistBotDuckDuckGoAlimenta le risposte dell'assistente di DuckDuckGo e non viene usato per l'addestramentoDuckAssist smette di usare le tue pagine
MistralAI-TrainingMistralRaccoglie pagine per l'addestramento dei modelliI tuoi contenuti restano fuori dall'addestramento di Mistral
MistralAI-IndexMistralIndicizza pagine per la ricerca dietro l'assistente di MistralL'assistente di Mistral smette di mostrarti
MistralAI-UserMistralScarica una pagina quando qualcuno chiede all'assistente di Mistral di aprirlaL'assistente non può leggere un link incollato da un utente
CCBotCommon CrawlCostruisce l'archivio aperto di scansione su cui si addestrano molti modelliResti fuori da un set di dati usato in tutto il settore
Google-ExtendedGoogleUna direttiva robots.txt, non un crawler. Decide se Google può usare le tue pagine per GeminiLe tue pagine restano nella ricerca Google e in AI Overviews, ma Google non può usarle per addestrare o alimentare Gemini
Applebot-ExtendedAppleUna direttiva robots.txt, non un crawler. Decide se Apple può addestrarsi sulle tue pagineSiri, Spotlight e Safari continuano a usare le tue pagine, Apple smette di addestrarci i suoi modelli

Addestramento e ricerca sono decisioni separate

Bloccare GPTBot e consentire OAI-SearchBot ti tiene fuori dai dati di addestramento e ti tiene nei risultati di ricerca di ChatGPT. Anthropic separa ClaudeBot e Claude-SearchBot allo stesso modo, Meta separa Meta-ExternalAgent e Meta-WebIndexer, e Mistral usa un agente distinto per addestramento, ricerca e richieste degli utenti. Molti siti finiscono per bloccare tutto per sbaglio quando volevano solo uscire dall'addestramento.

Gli agenti che finiscono in User non sono crawler

ChatGPT-User, Claude-User, Perplexity-User e MistralAI-User si attivano solo quando qualcuno ha già incollato il tuo link e ha chiesto all'assistente di leggerlo. Bloccarli non protegge nulla dall'addestramento. Non ferma nulla, tranne la persona che stava cercando di leggere la tua pagina.

Che bloccarli nel robots.txt funzioni o no dipende dall'operatore. Anthropic e Mistral rispettano il file per questi agenti. OpenAI dice che le regole potrebbero non applicarsi, perché la richiesta è arrivata da una persona e non da una scansione. Perplexity dice che il suo sistema di recupero in genere le ignora. Un blocco che deve reggere va nel firewall.

Gli ultimi due sono direttive, non crawler

Google-Extended e Applebot-Extended non inviano mai una richiesta. Stanno nel robots.txt e dicono a Google e ad Apple cosa si può fare con le pagine che i loro crawler ordinari hanno già scaricato. Non c'è un crawler da simulare, quindi il verificatore valuta queste direttive solo in base al robots.txt e li segna come senza richiesta live.

Google-Extended merita una seconda lettura. Bloccarlo non tocca il tuo posizionamento su Google e non ti toglie da AI Overviews, perché entrambi funzionano con Googlebot. Ciò che impedisce è che Gemini usi i tuoi contenuti.

Apple ripiega su Googlebot

Se il tuo robots.txt non nomina mai Applebot ma nomina Googlebot, Apple segue le regole di Googlebot. Il report lo indica su quella riga quando succede. Vale la pena saperlo, perché un Disallow scritto pensando a Google si applica in silenzio anche a Siri, Spotlight e Safari, e nulla nel tuo file lo dice ad alta voce.

Uno user agent è una dichiarazione, non un'identità

La maggior parte degli operatori in questa lista dice di rispettare il robots.txt, con le eccezioni indicate sopra, e chiunque può dichiarare qualsiasi cosa in una stringa User-Agent. Se hai bisogno di certezza e non di collaborazione, verifica tramite intervallo IP o DNS inverso. I grandi operatori pubblicano i propri intervalli IP o i dati per la verifica tramite DNS inverso.

Perché il robots.txt è solo metà della risposta

Leggere il robots.txt ti dice cosa hai chiesto. Non ti mostra mai cosa è successo davvero.

La protezione anti-bot di una CDN, un limitatore di richieste, un blocco per paese o una pagina di verifica possono tutti respingere un crawler AI mentre il tuo robots.txt continua a invitarlo a entrare. Nulla di tutto questo è scritto nel file, e il più delle volte nulla arriva nemmeno ai tuoi log, perché la richiesta viene tagliata prima di raggiungere il tuo sito.

Lo schema è facile da riconoscere una volta che l'hai visto. Il tuo robots.txt consente GPTBot, e GPTBot riceve comunque un 403. Quando robots.txt e realtà non concordano, il 403 è ciò che è reale.

È anche il motivo per cui una pagina può mancare dalle risposte di un assistente mentre tutti i controlli tecnici del sito si concludono senza rilevare problemi. Usa il nostro strumento di visibilità AI per scoprire se gli assistenti citano davvero il tuo brand.

Cosa significa ogni risultato

La tabella dei risultati ha due colonne che rispondono a domande diverse, quindi la legenda è divisa allo stesso modo. Leggere un'etichetta di Scansionabilità con la scala del robots.txt è il modo più rapido per fraintendere tutto il report.

La colonna robots.txt: cosa permette il tuo file

RisultatoCosa significa
ConsentitoIl tuo robots.txt lascia che questo bot scansioni la pagina che hai testato
BloccatoUna regola nel robots.txt chiude questa pagina a questo bot. La riga mostra quale regola l'ha fatto, e la soluzione è nel file
Parzialmente bloccatoLa pagina che hai testato è aperta a questo bot, ma il robots.txt ha regole rivolte a lui altrove nel sito. La riga mostra quali regole e da quale gruppo vengono, così puoi controllare che volessi davvero tenerle chiuse

La colonna Scansionabilità: cosa ha fatto davvero il tuo server

RisultatoCosa significa
Scansionabile (con lo stato HTTP)La richiesta del bot è passata e il tuo server ha risposto normalmente
Bloccato (con lo stato HTTP)La richiesta è stata rifiutata. Il robots.txt non è la causa, quindi guarda le regole del tuo firewall, WAF o CDN
Da verificareUn bot che di norma viene verificato tramite indirizzo IP è stato rifiutato. La nostra prova non arriva dall'intervallo IP di quel bot, quindi può essere il tuo firewall che funziona correttamente e non un problema
Errore (con lo stato HTTP)La pagina ha restituito un errore e non un blocco. Un 404 di solito significa che l'URL è sbagliato, un 500 che qualcosa sul tuo sito non funziona. Nessuno dei due è un problema di crawler
Nessuna rispostaNon è tornato proprio nulla. Un timeout o una connessione caduta, che punta alla rete o a un blocco molto aggressivo
Nessuna richiesta liveUna direttiva robots.txt e non un crawler, quindi non c'è nulla a cui inviare una richiesta. Il verdetto del robots.txt è tutta la risposta
Non testatoNon hai selezionato questo bot, quindi non è stata fatta alcuna richiesta live. Il suo verdetto robots.txt resta valido

Come sbloccare un crawler

Una regola nel robots.txt. Rimuovi il Disallow, o aggiungi un Allow più specifico per quello user agent. Vince la regola corrispondente più specifica, quindi un Allow esplicito per un bot batte un Disallow: / generico rivolto a tutti.

Una regola del firewall o della CDN. Nulla nei file del tuo sito risolverà questa. Su Cloudflare sta nella gestione dei bot. Su altri host cerca sotto WAF o protezione anti-bot. Consenti lì lo user agent, e verifica tramite intervallo IP se vuoi stare attento agli impostori.

Una pagina di verifica. Esenta lo user agent dalla verifica. Un crawler non può risolverla.

Un noindex in un meta tag o un header X-Robots-Tag. Il crawler può raggiungere la pagina e gli è stato detto di non conservarla. Vale la pena confermare che fosse voluto, perché un plugin o un'impostazione di staging dimenticata lo fanno in silenzio.

Gli stessi passaggi funzionano al contrario. Se vuoi bloccare GPTBot o qualsiasi altro crawler AI, un Disallow per quello user agent nel robots.txt è il modo educato, e una regola del firewall è quello che lo impone davvero.

Domande frequenti

Che cos'è la scansionabilità AI?

La possibilità per i crawler AI di raggiungere e leggere le tue pagine. Comprende il robots.txt e tutto ciò che si trova tra un bot e i tuoi contenuti, ed è il primo requisito per qualsiasi altra cosa. Scansionabilità LLM è la stessa idea con un altro nome.

I crawler AI rispettano il robots.txt?

Per i crawler che scaricano le pagine in automatico, i grandi operatori dicono di sì. Gli agenti che aprono una pagina perché una persona l'ha chiesto sono un altro caso, e sia OpenAI sia Perplexity dicono che il robots.txt potrebbe non fermarli. Nessun meccanismo impone il rispetto di queste regole. Il robots.txt è una richiesta, non un lucchetto.

Posso bloccare l'addestramento delle AI e restare nei risultati di ricerca AI?

Sì, ed è ciò che la maggior parte dei proprietari di siti vuole davvero. Blocca GPTBot e ClaudeBot per restare fuori dall'addestramento, e consenti OAI-SearchBot e Claude-SearchBot così che gli assistenti possano ancora trovarti e citarti.

Bloccare i crawler AI danneggia il mio SEO?

No. GPTBot, ClaudeBot e gli altri crawler AI non hanno nulla a che fare con il posizionamento su Google, e bloccarli non cambia la tua posizione nei risultati di ricerca. Bloccare Googlebot è tutta un'altra faccenda.

Perché il mio sito supera i controlli del robots.txt e viene comunque bloccato?

Perché il robots.txt è solo il primo livello. Una regola del firewall, del WAF o della CDN può rifiutare la richiesta prima che raggiunga il tuo server, e quel blocco è invisibile sia nel tuo robots.txt sia nei tuoi log.

GPTBot è la stessa cosa di OAI-SearchBot?

No. GPTBot raccoglie pagine per l'addestramento. OAI-SearchBot costruisce l'indice dietro la ricerca di ChatGPT. Puoi consentire l'uno e bloccare l'altro.

Perché ChatGPT non cita il mio sito o il mio brand?

Essere raggiungibili è il primo requisito, quindi inizia controllando che OAI-SearchBot non sia bloccato. Se l'accesso è a posto, il motivo di solito è che ChatGPT trova la risposta altrove e non ha motivo di rivolgersi a te.

Come faccio a far comparire il mio sito in ChatGPT?

Assicurati che i crawler possano leggerti, poi lavora per meritare la citazione. Gli assistenti si appoggiano a fonti che hanno già visto citate altrove, quindi le menzioni su siti di cui già si fidano contano più di qualsiasi cosa sulle tue pagine.

Essere raggiungibili è la prima domanda. Se gli assistenti ti nominano davvero è un'altra.

Verifica la tua visibilità AI