Verificador de rastreadores de IA

Veja quais rastreadores de IA conseguem chegar ao seu site, e quais são barrados.

Bots para testar ao vivo

É grátis

O que a ferramenta verifica

Duas coisas separadas decidem se um rastreador de IA chega à sua página, e elas falham de forma independente.

A primeira é o robots.txt, o porteiro educado. É um pedido e não uma tranca, e nem todo agente desta lista o respeita. A segunda é o que o seu servidor faz quando a requisição de fato chega. Essa é a camada do firewall, e é onde mora a maioria dos bloqueios acidentais, porque quase ninguém os configura de propósito. Uma regra escrita para barrar scrapers não distingue um scraper do PerplexityBot.

Este verificador olha para as duas. Ele lê o seu robots.txt e deduz o que cada bot pode fazer, depois busca a página com o User-Agent real desse bot e compara a resposta com a que um navegador comum recebe. Quando as duas camadas discordam, você descobre agora em vez de meses depois, quando perceber que nada está citando você.

Uma coisa precisa ser dita com clareza. O teste sai dos nossos servidores com a string User-Agent de cada bot. Os rastreadores reais chegam dos próprios intervalos de IP, então um firewall que verifica endereços IP pode tratá-los de outra forma. Se você vê um bloqueio aqui, ele é real. Um resultado permitido é um sinal forte e não uma garantia, e os bots que costumam ser verificados por IP aparecem marcados como tal nos resultados.

Os rastreadores de IA que verificamos

Nem todo user agent desta lista faz o mesmo trabalho. Alguns coletam páginas para treinamento. Alguns constroem o índice por trás da busca de um assistente. Outros só aparecem quando uma pessoa pede ao assistente para abrir um link. Bloquear um é uma decisão diferente de bloquear outro, e os resultados não são intercambiáveis.

User agentOperadorO que fazSe você bloquear
GPTBotOpenAIColeta páginas para o treinamento de modelosSeu conteúdo fica fora do treinamento
OAI-SearchBotOpenAIConstrói o índice por trás da busca do ChatGPTA busca do ChatGPT deixa de mostrar você
ChatGPT-UserOpenAIBusca uma página quando alguém pede ao ChatGPT para abri-laO ChatGPT não consegue ler um link que um usuário colou
ClaudeBotAnthropicColeta páginas para o treinamento de modelosSeu conteúdo fica fora do treinamento
Claude-SearchBotAnthropicIndexa páginas para os resultados de busca do ClaudeO Claude deixa de citar você nas respostas
Claude-UserAnthropicBusca uma página quando alguém pede ao Claude para abri-laO Claude não consegue ler um link que um usuário colou
PerplexityBotPerplexityIndexa páginas para as respostas da PerplexityA Perplexity deixa de citar você
Perplexity-UserPerplexityBusca uma página em resposta a uma perguntaA Perplexity não consegue abrir uma página sobre a qual um usuário perguntou
GooglebotGoogleO índice de busca, que também alimenta o AI OverviewsVocê desaparece da busca do Google
BingbotMicrosoftO índice do Bing, que alimenta o CopilotVocê desaparece do Bing e do Copilot
ApplebotAppleAlimenta a busca na Siri, no Spotlight e no SafariOs assistentes da Apple deixam de encontrar você
Meta-ExternalAgentMetaColeta páginas para os modelos da Meta e indexa parte do conteúdo diretamenteSeu conteúdo fica fora do treinamento da Meta
Meta-WebIndexerMetaIndexa páginas para os resultados de busca da Meta AIA Meta AI deixa de citar e de linkar você
DuckAssistBotDuckDuckGoAlimenta as respostas do assistente do DuckDuckGo e não é usado para treinamentoO DuckAssist deixa de usar suas páginas
MistralAI-TrainingMistralColeta páginas para o treinamento de modelosSeu conteúdo fica fora do treinamento da Mistral
MistralAI-IndexMistralIndexa páginas para a busca por trás do assistente da MistralO assistente da Mistral deixa de mostrar você
MistralAI-UserMistralBusca uma página quando alguém pede ao assistente da Mistral para abri-laO assistente não consegue ler um link que um usuário colou
CCBotCommon CrawlConstrói o arquivo aberto de rastreamento com o qual muitos modelos treinamVocê fica fora de um conjunto de dados usado em todo o setor
Google-ExtendedGoogleUma diretiva do robots.txt, não um rastreador. Decide se o Google pode usar suas páginas para o GeminiSuas páginas continuam na busca do Google e no AI Overviews, mas o Google não pode usá-las para treinar ou embasar o Gemini
Applebot-ExtendedAppleUma diretiva do robots.txt, não um rastreador. Decide se a Apple pode treinar com suas páginasSiri, Spotlight e Safari continuam usando suas páginas, a Apple deixa de treinar seus modelos com elas

Treinamento e busca são decisões separadas

Bloquear o GPTBot e permitir o OAI-SearchBot mantém você fora dos dados de treinamento e dentro dos resultados de busca do ChatGPT. A Anthropic separa ClaudeBot e Claude-SearchBot do mesmo jeito, a Meta separa Meta-ExternalAgent e Meta-WebIndexer, e a Mistral usa um agente separado para treinamento, busca e requisições de usuários. Muitos sites acabam bloqueando tudo por acidente quando só queriam sair do treinamento.

Os agentes terminados em User não são rastreadores

ChatGPT-User, Claude-User, Perplexity-User e MistralAI-User só entram em ação quando alguém já colou o seu link e pediu ao assistente para lê-lo. Bloqueá-los não protege nada do treinamento. Não impede nada, exceto a pessoa que estava tentando ler a sua página.

Se bloqueá-los no robots.txt sequer funciona depende do operador. Anthropic e Mistral respeitam o arquivo para esses agentes. A OpenAI diz que as regras podem não se aplicar, porque a requisição veio de uma pessoa e não de um rastreamento. A Perplexity diz que o seu mecanismo de busca de páginas geralmente as ignora. Um bloqueio que precisa se sustentar pertence ao firewall.

Os dois últimos são diretivas, não rastreadores

Google-Extended e Applebot-Extended nunca enviam uma requisição. Eles ficam no robots.txt e dizem ao Google e à Apple o que pode ser feito com as páginas que seus rastreadores comuns já buscaram. Não há um rastreador para simular, então o verificador avalia essas diretivas apenas a partir do robots.txt e os marca como sem requisição ao vivo.

O Google-Extended merece uma segunda leitura. Bloqueá-lo não mexe no seu ranking do Google nem tira você do AI Overviews, porque ambos rodam no Googlebot. O que ele impede é o Gemini usar o seu conteúdo.

A Apple recorre ao Googlebot

Se o seu robots.txt nunca menciona o Applebot mas menciona o Googlebot, a Apple segue as regras do Googlebot. O relatório informa isso naquela linha quando acontece. Vale saber, porque um Disallow que você escreveu pensando no Google se aplica em silêncio também à Siri, ao Spotlight e ao Safari, e nada no seu arquivo diz isso em voz alta.

Um user agent é uma alegação, não uma identidade

A maioria dos operadores desta lista diz respeitar o robots.txt, com as exceções apontadas acima, e qualquer um pode alegar qualquer coisa em uma string User-Agent. Se você precisa de certeza em vez de cooperação, verifique por intervalo de IP ou DNS reverso. Os grandes operadores publicam seus intervalos de IP ou os dados necessários para a verificação por DNS reverso.

Por que o robots.txt é só metade da resposta

Ler o robots.txt diz o que você pediu. Nunca mostra o que de fato aconteceu.

A proteção contra bots de uma CDN, um limitador de requisições, um bloqueio por país ou uma página de desafio podem barrar um rastreador de IA enquanto o seu robots.txt continua convidando-o a entrar. Nada disso está escrito no arquivo, e na maior parte das vezes nada disso chega aos seus logs também, porque a requisição é cortada antes de chegar ao seu site.

O padrão é fácil de reconhecer depois que você o vê uma vez. Seu robots.txt permite o GPTBot, e o GPTBot recebe um 403 mesmo assim. Quando o robots.txt e a realidade discordam, o 403 é o que é real.

É também por isso que uma página pode faltar nas respostas de um assistente enquanto todas as verificações técnicas do site terminam sem detectar problemas. Use o nosso verificador de visibilidade em IA para ver se os assistentes realmente mencionam a sua marca.

O que cada resultado significa

A tabela de resultados tem duas colunas que respondem a perguntas diferentes, então a legenda está dividida do mesmo jeito. Ler um rótulo de Rastreabilidade na escala do robots.txt é o jeito mais rápido de entender errado o relatório inteiro.

A coluna robots.txt: o que o seu arquivo permite

ResultadoO que significa
PermitidoSeu robots.txt deixa este bot rastrear a página que você testou
BloqueadoUma regra no robots.txt fecha esta página para este bot. A linha mostra qual regra fez isso, e a correção está no arquivo
Parcialmente bloqueadoA página que você testou está aberta para este bot, mas o robots.txt tem regras voltadas para ele em outras partes do site. A linha mostra quais regras e de qual grupo elas vieram, para você conferir se queria mesmo mantê-las fechadas

A coluna Rastreabilidade: o que o seu servidor realmente fez

ResultadoO que significa
Rastreável (com o status HTTP)A requisição do bot passou e o seu servidor respondeu normalmente
Bloqueado (com o status HTTP)A requisição foi recusada. O robots.txt não é a causa, então olhe as regras do seu firewall, WAF ou CDN
VerificarUm bot que normalmente é verificado por endereço IP foi recusado. Nosso teste não vem do intervalo de IP desse bot, então isso pode ser o seu firewall funcionando corretamente e não um problema
Erro (com o status HTTP)A página devolveu um erro e não um bloqueio. Um 404 geralmente significa que a URL está errada, um 500 que algo no seu site está falhando. Nenhum dos dois é um problema de rastreador
Sem respostaNada voltou. Um tempo esgotado ou uma conexão derrubada, o que aponta para a rede ou para um bloqueio muito agressivo
Sem requisição ao vivoUma diretiva do robots.txt e não um rastreador, então não há para quem enviar uma requisição. O veredito do robots.txt é a resposta inteira
Não testadoVocê não selecionou este bot, então nenhuma requisição ao vivo foi feita. O veredito do robots.txt continua valendo

Como desbloquear um rastreador

Uma regra no robots.txt. Remova o Disallow ou adicione um Allow mais específico para esse user agent. A regra correspondente mais específica vence, então um Allow explícito para um bot ganha de um Disallow: / genérico voltado para todos.

Uma regra de firewall ou CDN. Nada nos arquivos do seu site resolve essa. Na Cloudflare ela fica no gerenciamento de bots. Em outros provedores procure em WAF ou proteção contra bots. Permita o user agent ali, e verifique por intervalo de IP se quiser se proteger de impostores.

Uma página de desafio. Isente o user agent do desafio. Um rastreador não consegue resolvê-lo.

Um noindex em uma meta tag ou um cabeçalho X-Robots-Tag. O rastreador consegue chegar à página e recebeu a instrução de não guardá-la. Vale confirmar que foi de propósito, porque um plugin ou uma configuração esquecida do ambiente de testes faz isso em silêncio.

Os mesmos passos funcionam ao contrário. Se você quer bloquear o GPTBot ou qualquer outro rastreador de IA, um Disallow para esse user agent no robots.txt é o jeito educado, e uma regra de firewall é o que de fato impõe o bloqueio.

Perguntas frequentes

O que é rastreabilidade para IA?

Se os rastreadores de IA conseguem chegar às suas páginas e lê-las. Inclui o robots.txt e tudo o mais que fica entre um bot e o seu conteúdo, e é o primeiro requisito para qualquer outra coisa. Rastreabilidade para LLM é a mesma ideia com outro nome.

Os rastreadores de IA respeitam o robots.txt?

Para os rastreadores que buscam páginas automaticamente, os grandes operadores dizem que sim. Os agentes que buscam uma página porque uma pessoa pediu são outro caso, e tanto a OpenAI quanto a Perplexity dizem que o robots.txt pode não detê-los. Não há um mecanismo que obrigue ao cumprimento dessas regras. O robots.txt é um pedido, não uma tranca.

Posso bloquear o treinamento de IA e continuar aparecendo nas buscas com IA?

Sim, e essa é a opção que a maioria dos donos de sites realmente quer. Bloqueie GPTBot e ClaudeBot para ficar fora do treinamento, e permita OAI-SearchBot e Claude-SearchBot para que os assistentes continuem encontrando e citando você.

Bloquear rastreadores de IA prejudica meu SEO?

Não. GPTBot, ClaudeBot e os outros rastreadores de IA não têm nada a ver com o ranking no Google, e bloqueá-los não afeta a sua posição na busca. Bloquear o Googlebot é uma questão completamente diferente.

Por que meu site passa nas verificações do robots.txt e ainda assim é bloqueado?

Porque o robots.txt é só a primeira camada. Uma regra de firewall, WAF ou CDN pode recusar a requisição antes que ela chegue ao seu servidor, e esse bloqueio é invisível tanto no seu robots.txt quanto nos seus logs.

GPTBot é a mesma coisa que OAI-SearchBot?

Não. O GPTBot coleta páginas para treinamento. O OAI-SearchBot constrói o índice por trás da busca do ChatGPT. Você pode permitir um e bloquear o outro.

Por que o ChatGPT não cita meu site ou minha marca?

Estar acessível é o primeiro requisito, então comece verificando se o OAI-SearchBot não está bloqueado. Se o acesso está em ordem, o motivo costuma ser que o ChatGPT encontra a resposta em outro lugar e não tem razão para recorrer a você.

Como faço meu site aparecer no ChatGPT?

Garanta que os rastreadores conseguem ler você e depois trabalhe para merecer a citação. Os assistentes se apoiam em fontes que já viram citadas em outros lugares, então menções em sites nos quais eles já confiam valem mais do que qualquer coisa nas suas próprias páginas.

Estar acessível é a primeira pergunta. Se os assistentes realmente citam você é outra.

Verifique sua visibilidade em IA