Verificador de rastreadores de IA
Veja quais rastreadores de IA conseguem chegar ao seu site, e quais são barrados.
| Bot | robots.txt | Rastreabilidade |
|---|
robots.txt como foi baixado
O que a ferramenta verifica
Duas coisas separadas decidem se um rastreador de IA chega à sua página, e elas falham de forma independente.
A primeira é o robots.txt, o porteiro educado. É um pedido e não uma tranca, e nem todo agente desta lista o respeita. A segunda é o que o seu servidor faz quando a requisição de fato chega. Essa é a camada do firewall, e é onde mora a maioria dos bloqueios acidentais, porque quase ninguém os configura de propósito. Uma regra escrita para barrar scrapers não distingue um scraper do PerplexityBot.
Este verificador olha para as duas. Ele lê o seu robots.txt e deduz o que cada bot pode fazer, depois busca a página com o User-Agent real desse bot e compara a resposta com a que um navegador comum recebe. Quando as duas camadas discordam, você descobre agora em vez de meses depois, quando perceber que nada está citando você.
Uma coisa precisa ser dita com clareza. O teste sai dos nossos servidores com a string User-Agent de cada bot. Os rastreadores reais chegam dos próprios intervalos de IP, então um firewall que verifica endereços IP pode tratá-los de outra forma. Se você vê um bloqueio aqui, ele é real. Um resultado permitido é um sinal forte e não uma garantia, e os bots que costumam ser verificados por IP aparecem marcados como tal nos resultados.
Os rastreadores de IA que verificamos
Nem todo user agent desta lista faz o mesmo trabalho. Alguns coletam páginas para treinamento. Alguns constroem o índice por trás da busca de um assistente. Outros só aparecem quando uma pessoa pede ao assistente para abrir um link. Bloquear um é uma decisão diferente de bloquear outro, e os resultados não são intercambiáveis.
| User agent | Operador | O que faz | Se você bloquear |
|---|---|---|---|
GPTBot | OpenAI | Coleta páginas para o treinamento de modelos | Seu conteúdo fica fora do treinamento |
OAI-SearchBot | OpenAI | Constrói o índice por trás da busca do ChatGPT | A busca do ChatGPT deixa de mostrar você |
ChatGPT-User | OpenAI | Busca uma página quando alguém pede ao ChatGPT para abri-la | O ChatGPT não consegue ler um link que um usuário colou |
ClaudeBot | Anthropic | Coleta páginas para o treinamento de modelos | Seu conteúdo fica fora do treinamento |
Claude-SearchBot | Anthropic | Indexa páginas para os resultados de busca do Claude | O Claude deixa de citar você nas respostas |
Claude-User | Anthropic | Busca uma página quando alguém pede ao Claude para abri-la | O Claude não consegue ler um link que um usuário colou |
PerplexityBot | Perplexity | Indexa páginas para as respostas da Perplexity | A Perplexity deixa de citar você |
Perplexity-User | Perplexity | Busca uma página em resposta a uma pergunta | A Perplexity não consegue abrir uma página sobre a qual um usuário perguntou |
Googlebot | O índice de busca, que também alimenta o AI Overviews | Você desaparece da busca do Google | |
Bingbot | Microsoft | O índice do Bing, que alimenta o Copilot | Você desaparece do Bing e do Copilot |
Applebot | Apple | Alimenta a busca na Siri, no Spotlight e no Safari | Os assistentes da Apple deixam de encontrar você |
Meta-ExternalAgent | Meta | Coleta páginas para os modelos da Meta e indexa parte do conteúdo diretamente | Seu conteúdo fica fora do treinamento da Meta |
Meta-WebIndexer | Meta | Indexa páginas para os resultados de busca da Meta AI | A Meta AI deixa de citar e de linkar você |
DuckAssistBot | DuckDuckGo | Alimenta as respostas do assistente do DuckDuckGo e não é usado para treinamento | O DuckAssist deixa de usar suas páginas |
MistralAI-Training | Mistral | Coleta páginas para o treinamento de modelos | Seu conteúdo fica fora do treinamento da Mistral |
MistralAI-Index | Mistral | Indexa páginas para a busca por trás do assistente da Mistral | O assistente da Mistral deixa de mostrar você |
MistralAI-User | Mistral | Busca uma página quando alguém pede ao assistente da Mistral para abri-la | O assistente não consegue ler um link que um usuário colou |
CCBot | Common Crawl | Constrói o arquivo aberto de rastreamento com o qual muitos modelos treinam | Você fica fora de um conjunto de dados usado em todo o setor |
Google-Extended | Uma diretiva do robots.txt, não um rastreador. Decide se o Google pode usar suas páginas para o Gemini | Suas páginas continuam na busca do Google e no AI Overviews, mas o Google não pode usá-las para treinar ou embasar o Gemini | |
Applebot-Extended | Apple | Uma diretiva do robots.txt, não um rastreador. Decide se a Apple pode treinar com suas páginas | Siri, Spotlight e Safari continuam usando suas páginas, a Apple deixa de treinar seus modelos com elas |
Treinamento e busca são decisões separadas
Bloquear o GPTBot e permitir o OAI-SearchBot mantém você fora dos dados de treinamento e dentro dos resultados de busca do ChatGPT. A Anthropic separa ClaudeBot e Claude-SearchBot do mesmo jeito, a Meta separa Meta-ExternalAgent e Meta-WebIndexer, e a Mistral usa um agente separado para treinamento, busca e requisições de usuários. Muitos sites acabam bloqueando tudo por acidente quando só queriam sair do treinamento.
Os agentes terminados em User não são rastreadores
ChatGPT-User, Claude-User, Perplexity-User e MistralAI-User só entram em ação quando alguém já colou o seu link e pediu ao assistente para lê-lo. Bloqueá-los não protege nada do treinamento. Não impede nada, exceto a pessoa que estava tentando ler a sua página.
Se bloqueá-los no robots.txt sequer funciona depende do operador. Anthropic e Mistral respeitam o arquivo para esses agentes. A OpenAI diz que as regras podem não se aplicar, porque a requisição veio de uma pessoa e não de um rastreamento. A Perplexity diz que o seu mecanismo de busca de páginas geralmente as ignora. Um bloqueio que precisa se sustentar pertence ao firewall.
Os dois últimos são diretivas, não rastreadores
Google-Extended e Applebot-Extended nunca enviam uma requisição. Eles ficam no robots.txt e dizem ao Google e à Apple o que pode ser feito com as páginas que seus rastreadores comuns já buscaram. Não há um rastreador para simular, então o verificador avalia essas diretivas apenas a partir do robots.txt e os marca como sem requisição ao vivo.
O Google-Extended merece uma segunda leitura. Bloqueá-lo não mexe no seu ranking do Google nem tira você do AI Overviews, porque ambos rodam no Googlebot. O que ele impede é o Gemini usar o seu conteúdo.
A Apple recorre ao Googlebot
Se o seu robots.txt nunca menciona o Applebot mas menciona o Googlebot, a Apple segue as regras do Googlebot. O relatório informa isso naquela linha quando acontece. Vale saber, porque um Disallow que você escreveu pensando no Google se aplica em silêncio também à Siri, ao Spotlight e ao Safari, e nada no seu arquivo diz isso em voz alta.
Um user agent é uma alegação, não uma identidade
A maioria dos operadores desta lista diz respeitar o robots.txt, com as exceções apontadas acima, e qualquer um pode alegar qualquer coisa em uma string User-Agent. Se você precisa de certeza em vez de cooperação, verifique por intervalo de IP ou DNS reverso. Os grandes operadores publicam seus intervalos de IP ou os dados necessários para a verificação por DNS reverso.
Por que o robots.txt é só metade da resposta
Ler o robots.txt diz o que você pediu. Nunca mostra o que de fato aconteceu.
A proteção contra bots de uma CDN, um limitador de requisições, um bloqueio por país ou uma página de desafio podem barrar um rastreador de IA enquanto o seu robots.txt continua convidando-o a entrar. Nada disso está escrito no arquivo, e na maior parte das vezes nada disso chega aos seus logs também, porque a requisição é cortada antes de chegar ao seu site.
O padrão é fácil de reconhecer depois que você o vê uma vez. Seu robots.txt permite o GPTBot, e o GPTBot recebe um 403 mesmo assim. Quando o robots.txt e a realidade discordam, o 403 é o que é real.
É também por isso que uma página pode faltar nas respostas de um assistente enquanto todas as verificações técnicas do site terminam sem detectar problemas. Use o nosso verificador de visibilidade em IA para ver se os assistentes realmente mencionam a sua marca.
O que cada resultado significa
A tabela de resultados tem duas colunas que respondem a perguntas diferentes, então a legenda está dividida do mesmo jeito. Ler um rótulo de Rastreabilidade na escala do robots.txt é o jeito mais rápido de entender errado o relatório inteiro.
A coluna robots.txt: o que o seu arquivo permite
| Resultado | O que significa |
|---|---|
| Permitido | Seu robots.txt deixa este bot rastrear a página que você testou |
| Bloqueado | Uma regra no robots.txt fecha esta página para este bot. A linha mostra qual regra fez isso, e a correção está no arquivo |
| Parcialmente bloqueado | A página que você testou está aberta para este bot, mas o robots.txt tem regras voltadas para ele em outras partes do site. A linha mostra quais regras e de qual grupo elas vieram, para você conferir se queria mesmo mantê-las fechadas |
A coluna Rastreabilidade: o que o seu servidor realmente fez
| Resultado | O que significa |
|---|---|
| Rastreável (com o status HTTP) | A requisição do bot passou e o seu servidor respondeu normalmente |
| Bloqueado (com o status HTTP) | A requisição foi recusada. O robots.txt não é a causa, então olhe as regras do seu firewall, WAF ou CDN |
| Verificar | Um bot que normalmente é verificado por endereço IP foi recusado. Nosso teste não vem do intervalo de IP desse bot, então isso pode ser o seu firewall funcionando corretamente e não um problema |
| Erro (com o status HTTP) | A página devolveu um erro e não um bloqueio. Um 404 geralmente significa que a URL está errada, um 500 que algo no seu site está falhando. Nenhum dos dois é um problema de rastreador |
| Sem resposta | Nada voltou. Um tempo esgotado ou uma conexão derrubada, o que aponta para a rede ou para um bloqueio muito agressivo |
| Sem requisição ao vivo | Uma diretiva do robots.txt e não um rastreador, então não há para quem enviar uma requisição. O veredito do robots.txt é a resposta inteira |
| Não testado | Você não selecionou este bot, então nenhuma requisição ao vivo foi feita. O veredito do robots.txt continua valendo |
Como desbloquear um rastreador
Uma regra no robots.txt. Remova o Disallow ou adicione um Allow mais específico para esse user agent. A regra correspondente mais específica vence, então um Allow explícito para um bot ganha de um Disallow: / genérico voltado para todos.
Uma regra de firewall ou CDN. Nada nos arquivos do seu site resolve essa. Na Cloudflare ela fica no gerenciamento de bots. Em outros provedores procure em WAF ou proteção contra bots. Permita o user agent ali, e verifique por intervalo de IP se quiser se proteger de impostores.
Uma página de desafio. Isente o user agent do desafio. Um rastreador não consegue resolvê-lo.
Um noindex em uma meta tag ou um cabeçalho X-Robots-Tag. O rastreador consegue chegar à página e recebeu a instrução de não guardá-la. Vale confirmar que foi de propósito, porque um plugin ou uma configuração esquecida do ambiente de testes faz isso em silêncio.
Os mesmos passos funcionam ao contrário. Se você quer bloquear o GPTBot ou qualquer outro rastreador de IA, um Disallow para esse user agent no robots.txt é o jeito educado, e uma regra de firewall é o que de fato impõe o bloqueio.
Perguntas frequentes
O que é rastreabilidade para IA?
Se os rastreadores de IA conseguem chegar às suas páginas e lê-las. Inclui o robots.txt e tudo o mais que fica entre um bot e o seu conteúdo, e é o primeiro requisito para qualquer outra coisa. Rastreabilidade para LLM é a mesma ideia com outro nome.
Os rastreadores de IA respeitam o robots.txt?
Para os rastreadores que buscam páginas automaticamente, os grandes operadores dizem que sim. Os agentes que buscam uma página porque uma pessoa pediu são outro caso, e tanto a OpenAI quanto a Perplexity dizem que o robots.txt pode não detê-los. Não há um mecanismo que obrigue ao cumprimento dessas regras. O robots.txt é um pedido, não uma tranca.
Posso bloquear o treinamento de IA e continuar aparecendo nas buscas com IA?
Sim, e essa é a opção que a maioria dos donos de sites realmente quer. Bloqueie GPTBot e ClaudeBot para ficar fora do treinamento, e permita OAI-SearchBot e Claude-SearchBot para que os assistentes continuem encontrando e citando você.
Bloquear rastreadores de IA prejudica meu SEO?
Não. GPTBot, ClaudeBot e os outros rastreadores de IA não têm nada a ver com o ranking no Google, e bloqueá-los não afeta a sua posição na busca. Bloquear o Googlebot é uma questão completamente diferente.
Por que meu site passa nas verificações do robots.txt e ainda assim é bloqueado?
Porque o robots.txt é só a primeira camada. Uma regra de firewall, WAF ou CDN pode recusar a requisição antes que ela chegue ao seu servidor, e esse bloqueio é invisível tanto no seu robots.txt quanto nos seus logs.
GPTBot é a mesma coisa que OAI-SearchBot?
Não. O GPTBot coleta páginas para treinamento. O OAI-SearchBot constrói o índice por trás da busca do ChatGPT. Você pode permitir um e bloquear o outro.
Por que o ChatGPT não cita meu site ou minha marca?
Estar acessível é o primeiro requisito, então comece verificando se o OAI-SearchBot não está bloqueado. Se o acesso está em ordem, o motivo costuma ser que o ChatGPT encontra a resposta em outro lugar e não tem razão para recorrer a você.
Como faço meu site aparecer no ChatGPT?
Garanta que os rastreadores conseguem ler você e depois trabalhe para merecer a citação. Os assistentes se apoiam em fontes que já viram citadas em outros lugares, então menções em sites nos quais eles já confiam valem mais do que qualquer coisa nas suas próprias páginas.
Estar acessível é a primeira pergunta. Se os assistentes realmente citam você é outra.