Verificador de rastreadores de IA

Mira qué rastreadores de IA pueden llegar a tu sitio, y cuáles se quedan fuera.

Bots para probar en vivo

Es gratis

Qué comprueba

Dos cosas distintas deciden si un rastreador de IA llega a tu página, y fallan por separado.

La primera es robots.txt, el portero educado. Es una petición y no un candado, y no todos los agentes de esta lista lo respetan. La segunda es lo que hace tu servidor cuando la petición llega de verdad. Esa es la capa del firewall, y ahí viven la mayoría de los bloqueos accidentales, porque casi nadie los configura a propósito. Una regla escrita para frenar scrapers no distingue un scraper de PerplexityBot.

Este verificador mira las dos. Lee tu robots.txt y deduce qué tiene permitido cada bot, después descarga la página con el User-Agent real de ese bot y compara la respuesta con la que recibe un navegador normal. Cuando las dos capas no coinciden, te enteras ahora y no meses después, cuando notes que nadie te cita.

Una cosa que conviene decir con claridad. La prueba se lanza desde nuestros servidores con la cadena User-Agent de cada bot. Los rastreadores reales llegan desde sus propios rangos de IP, así que un firewall que verifica direcciones IP puede tratarlos de otra forma. Si aquí ves un bloqueo, es real. Un resultado permitido es una señal fuerte y no una garantía, y los bots que suelen verificarse por IP aparecen marcados como tales en los resultados.

Los rastreadores de IA que comprobamos

No todos los user agents de esta lista hacen lo mismo. Algunos recopilan páginas para el entrenamiento. Otros construyen el índice que hay detrás de la búsqueda de un asistente. Otros solo aparecen cuando una persona pide al asistente que abra un enlace. Bloquear uno es una decisión distinta de bloquear otro, y los resultados no son intercambiables.

User agentOperadorQué haceSi lo bloqueas
GPTBotOpenAIRecopila páginas para entrenar modelosTu contenido queda fuera del entrenamiento
OAI-SearchBotOpenAIConstruye el índice detrás de la búsqueda de ChatGPTLa búsqueda de ChatGPT deja de mostrarte
ChatGPT-UserOpenAIDescarga una página cuando alguien pide a ChatGPT que la abraChatGPT no puede leer un enlace que pegó un usuario
ClaudeBotAnthropicRecopila páginas para entrenar modelosTu contenido queda fuera del entrenamiento
Claude-SearchBotAnthropicIndexa páginas para los resultados de búsqueda de ClaudeClaude deja de citarte en sus respuestas
Claude-UserAnthropicDescarga una página cuando alguien pide a Claude que la abraClaude no puede leer un enlace que pegó un usuario
PerplexityBotPerplexityIndexa páginas para las respuestas de PerplexityPerplexity deja de citarte
Perplexity-UserPerplexityDescarga una página en respuesta a una preguntaPerplexity no puede abrir una página por la que preguntó un usuario
GooglebotGoogleEl índice de búsqueda, que también alimenta AI OverviewsDesapareces de la búsqueda de Google
BingbotMicrosoftEl índice de Bing, que alimenta CopilotDesapareces de Bing y de Copilot
ApplebotAppleImpulsa la búsqueda en Siri, Spotlight y SafariLos asistentes de Apple dejan de encontrarte
Meta-ExternalAgentMetaRecopila páginas para los modelos de Meta, e indexa parte del contenido directamenteTu contenido queda fuera del entrenamiento de Meta
Meta-WebIndexerMetaIndexa páginas para los resultados de búsqueda de Meta AIMeta AI deja de citarte y de enlazarte
DuckAssistBotDuckDuckGoAlimenta las respuestas del asistente de DuckDuckGo, y no se usa para entrenamientoDuckAssist deja de usar tus páginas
MistralAI-TrainingMistralRecopila páginas para entrenar modelosTu contenido queda fuera del entrenamiento de Mistral
MistralAI-IndexMistralIndexa páginas para la búsqueda detrás del asistente de MistralEl asistente de Mistral deja de mostrarte
MistralAI-UserMistralDescarga una página cuando alguien pide al asistente de Mistral que la abraEl asistente no puede leer un enlace que pegó un usuario
CCBotCommon CrawlConstruye el archivo abierto de rastreo con el que entrenan muchos modelosQuedas fuera de un conjunto de datos que se usa en todo el sector
Google-ExtendedGoogleUna directiva de robots.txt, no un rastreador. Decide si Google puede usar tus páginas para GeminiTus páginas siguen en la búsqueda de Google y en AI Overviews, pero Google no puede usarlas para entrenar ni para fundamentar Gemini
Applebot-ExtendedAppleUna directiva de robots.txt, no un rastreador. Decide si Apple puede entrenar con tus páginasSiri, Spotlight y Safari siguen usando tus páginas, Apple deja de entrenar sus modelos con ellas

Entrenamiento y búsqueda son decisiones separadas

Bloquear GPTBot y permitir OAI-SearchBot te deja fuera de los datos de entrenamiento y te mantiene en los resultados de búsqueda de ChatGPT. Anthropic separa ClaudeBot y Claude-SearchBot de la misma manera, Meta separa Meta-ExternalAgent y Meta-WebIndexer, y Mistral usa un agente distinto para entrenamiento, búsqueda y peticiones de usuarios. Muchos sitios acaban bloqueándolo todo por accidente cuando lo único que querían era quedarse fuera del entrenamiento.

Los agentes que terminan en User no son rastreadores

ChatGPT-User, Claude-User, Perplexity-User y MistralAI-User solo se activan cuando alguien ya ha pegado tu enlace y ha pedido al asistente que lo lea. Bloquearlos no protege nada del entrenamiento. No detiene nada salvo a la persona que intentaba leer tu página.

Que bloquearlos en robots.txt funcione siquiera depende del operador. Anthropic y Mistral respetan el archivo para estos agentes. OpenAI dice que las reglas pueden no aplicarse, porque la petición vino de una persona y no de un rastreo. Perplexity dice que su descargador generalmente las ignora. Un bloqueo que tenga que aguantar va en el firewall.

Los dos últimos son directivas, no rastreadores

Google-Extended y Applebot-Extended nunca envían una petición. Están en robots.txt y le dicen a Google y a Apple qué se puede hacer con las páginas que sus rastreadores normales ya descargaron. No hay ningún rastreador que simular, así que el verificador los evalúa solo a partir de robots.txt y los marca como sin petición en vivo.

Google-Extended merece una segunda lectura. Bloquearlo no toca tu posicionamiento en Google ni te saca de AI Overviews, porque ambos funcionan con Googlebot. Lo que impide es que Gemini use tu contenido.

Apple recurre a Googlebot

Si tu robots.txt nunca nombra a Applebot pero sí a Googlebot, Apple sigue las reglas de Googlebot. El informe lo indica en esa fila cuando ocurre. Conviene saberlo, porque un Disallow que escribiste pensando en Google se aplica en silencio también a Siri, Spotlight y Safari, y nada en tu archivo lo dice en voz alta.

Un user agent es una afirmación, no una identidad

La mayoría de los operadores de esta lista dicen respetar robots.txt, con las excepciones señaladas arriba, y cualquiera puede afirmar cualquier cosa en una cadena User-Agent. Si necesitas certeza y no cooperación, verifica por rango de IP o por DNS inverso. Los grandes operadores publican sus rangos de IP o los datos para la verificación por DNS inverso.

Por qué robots.txt es solo la mitad de la respuesta

Leer robots.txt te dice lo que pediste. Nunca te muestra lo que pasó de verdad.

La protección contra bots de un CDN, un limitador de peticiones, un bloqueo por país o una página de desafío pueden rechazar a un rastreador de IA mientras tu robots.txt sigue invitándolo a entrar. Nada de eso está escrito en el archivo, y la mayoría de las veces tampoco llega a tus registros, porque la petición se corta antes de llegar a tu sitio.

El patrón es fácil de reconocer una vez que lo has visto. Tu robots.txt permite GPTBot, y GPTBot recibe un 403 de todas formas. Cuando robots.txt y la realidad no coinciden, el 403 es lo real.

Por eso mismo una página puede faltar en las respuestas de un asistente mientras todas las comprobaciones técnicas del sitio se completan sin detectar problemas. Usa nuestro verificador de visibilidad en IA para ver si los asistentes mencionan tu marca.

Qué significa cada resultado

La tabla de resultados tiene dos columnas y responden a preguntas distintas, así que la leyenda está dividida igual. Leer una etiqueta de Rastreabilidad con la escala de robots.txt es la forma más rápida de malinterpretar todo el informe.

La columna robots.txt: lo que permite tu archivo

ResultadoQué significa
PermitidoTu robots.txt deja que este bot rastree la página que probaste
BloqueadoUna regla de robots.txt cierra esta página a este bot. La fila muestra qué regla lo hizo, y la solución está en el archivo
Bloqueado en parteLa página que probaste está abierta para este bot, pero robots.txt tiene reglas dirigidas a él en otras partes del sitio. La fila muestra qué reglas y de qué grupo vienen, para que compruebes que querías mantenerlas cerradas

La columna Rastreabilidad: lo que hizo tu servidor de verdad

ResultadoQué significa
Rastreable (con el estado HTTP)La petición del bot pasó y tu servidor respondió con normalidad
Bloqueado (con el estado HTTP)La petición fue rechazada. robots.txt no es la causa, así que mira las reglas de tu firewall, WAF o CDN
RevisarUn bot que normalmente se verifica por dirección IP fue rechazado. Nuestra prueba no viene del rango de IP propio de ese bot, así que puede ser tu firewall funcionando bien y no un problema
Error (con el estado HTTP)La página devolvió un error y no un bloqueo. Un 404 suele significar que la URL está mal, un 500 que algo en tu sitio está fallando. Ninguno es un problema de rastreadores
Sin respuestaNo volvió nada en absoluto. Un tiempo de espera agotado o una conexión cortada, lo que apunta a la red o a un bloqueo muy agresivo
Sin petición en vivoUna directiva de robots.txt y no un rastreador, así que no hay a quién enviar una petición. El veredicto de robots.txt es toda la respuesta
No probadoNo seleccionaste este bot, así que no se hizo ninguna petición en vivo. Su veredicto de robots.txt sigue valiendo

Cómo desbloquear un rastreador

Una regla en robots.txt. Quita el Disallow, o añade un Allow más específico para ese user agent. Gana la regla coincidente más específica, así que un Allow explícito para un bot vence a un Disallow: / genérico dirigido a todos.

Una regla del firewall o del CDN. Nada en los archivos de tu sitio arregla esto. En Cloudflare está en la gestión de bots. En otros proveedores busca en WAF o en protección contra bots. Permite ahí el user agent, y verifica por rango de IP si quieres cuidarte de los impostores.

Una página de desafío. Exime al user agent del desafío. Un rastreador no puede resolverlo.

Un noindex en una etiqueta meta o en una cabecera X-Robots-Tag. El rastreador puede llegar a la página y se le ha dicho que no la conserve. Conviene confirmar que fue a propósito, porque un plugin o un ajuste olvidado del entorno de pruebas hacen esto sin avisar.

Los mismos pasos funcionan al revés. Si quieres bloquear GPTBot o cualquier otro rastreador de IA, un Disallow para ese user agent en robots.txt es la forma educada, y una regla del firewall es la que de verdad lo impone.

Preguntas frecuentes

¿Qué es la rastreabilidad para la IA?

Si los rastreadores de IA pueden llegar a tus páginas y leerlas. Abarca robots.txt y todo lo demás que se interpone entre un bot y tu contenido, y es el primer requisito para cualquier otra cosa. Rastreabilidad para LLM es la misma idea con otro nombre.

¿Los rastreadores de IA respetan robots.txt?

En el caso de los rastreadores que descargan páginas de forma automática, los grandes operadores dicen que sí. Los agentes que abren una página porque una persona lo pidió son otro caso, y tanto OpenAI como Perplexity dicen que robots.txt puede no detenerlos. No hay ningún mecanismo que obligue a cumplir estas reglas. robots.txt es una petición, no un candado.

¿Puedo bloquear el entrenamiento de IA y seguir apareciendo en las búsquedas con IA?

Sí, y es la opción que la mayoría de los dueños de sitios quiere en realidad. Bloquea GPTBot y ClaudeBot para quedarte fuera del entrenamiento, y permite OAI-SearchBot y Claude-SearchBot para que los asistentes puedan seguir encontrándote y citándote.

¿Bloquear los rastreadores de IA perjudica mi SEO?

No. GPTBot, ClaudeBot y los demás rastreadores de IA no tienen nada que ver con el posicionamiento en Google, y bloquearlos no afecta a tu posición en las búsquedas. Bloquear Googlebot es un asunto completamente distinto.

¿Por qué mi sitio pasa las comprobaciones de robots.txt y aun así lo bloquean?

Porque robots.txt es solo la primera capa. Una regla del firewall, del WAF o del CDN puede rechazar la petición antes de que llegue a tu servidor, y ese bloqueo es invisible tanto en tu robots.txt como en tus registros.

¿GPTBot es lo mismo que OAI-SearchBot?

No. GPTBot recopila páginas para el entrenamiento. OAI-SearchBot construye el índice que hay detrás de la búsqueda de ChatGPT. Puedes permitir uno y bloquear el otro.

¿Por qué ChatGPT no cita mi sitio web ni mi marca?

Ser accesible es el primer requisito, así que empieza por comprobar que OAI-SearchBot no está bloqueado. Si el acceso está bien, el motivo suele ser que ChatGPT encuentra la respuesta en otro sitio y no tiene motivos para acudir a ti.

¿Cómo consigo que mi sitio web aparezca en ChatGPT?

Asegúrate de que los rastreadores pueden leerte y luego trabaja en merecer la cita. Los asistentes se apoyan en fuentes que ya han visto citadas en otros lugares, así que las menciones en sitios en los que ya confían importan más que cualquier cosa en tus propias páginas.

Ser accesible es la primera pregunta. Que los asistentes te nombren de verdad es otra distinta.

Comprueba tu visibilidad en IA