Verificador de rastreadores de IA
Mira qué rastreadores de IA pueden llegar a tu sitio, y cuáles se quedan fuera.
| Bot | robots.txt | Rastreabilidad |
|---|
robots.txt tal como se descargó
Qué comprueba
Dos cosas distintas deciden si un rastreador de IA llega a tu página, y fallan por separado.
La primera es robots.txt, el portero educado. Es una petición y no un candado, y no todos los agentes de esta lista lo respetan. La segunda es lo que hace tu servidor cuando la petición llega de verdad. Esa es la capa del firewall, y ahí viven la mayoría de los bloqueos accidentales, porque casi nadie los configura a propósito. Una regla escrita para frenar scrapers no distingue un scraper de PerplexityBot.
Este verificador mira las dos. Lee tu robots.txt y deduce qué tiene permitido cada bot, después descarga la página con el User-Agent real de ese bot y compara la respuesta con la que recibe un navegador normal. Cuando las dos capas no coinciden, te enteras ahora y no meses después, cuando notes que nadie te cita.
Una cosa que conviene decir con claridad. La prueba se lanza desde nuestros servidores con la cadena User-Agent de cada bot. Los rastreadores reales llegan desde sus propios rangos de IP, así que un firewall que verifica direcciones IP puede tratarlos de otra forma. Si aquí ves un bloqueo, es real. Un resultado permitido es una señal fuerte y no una garantía, y los bots que suelen verificarse por IP aparecen marcados como tales en los resultados.
Los rastreadores de IA que comprobamos
No todos los user agents de esta lista hacen lo mismo. Algunos recopilan páginas para el entrenamiento. Otros construyen el índice que hay detrás de la búsqueda de un asistente. Otros solo aparecen cuando una persona pide al asistente que abra un enlace. Bloquear uno es una decisión distinta de bloquear otro, y los resultados no son intercambiables.
| User agent | Operador | Qué hace | Si lo bloqueas |
|---|---|---|---|
GPTBot | OpenAI | Recopila páginas para entrenar modelos | Tu contenido queda fuera del entrenamiento |
OAI-SearchBot | OpenAI | Construye el índice detrás de la búsqueda de ChatGPT | La búsqueda de ChatGPT deja de mostrarte |
ChatGPT-User | OpenAI | Descarga una página cuando alguien pide a ChatGPT que la abra | ChatGPT no puede leer un enlace que pegó un usuario |
ClaudeBot | Anthropic | Recopila páginas para entrenar modelos | Tu contenido queda fuera del entrenamiento |
Claude-SearchBot | Anthropic | Indexa páginas para los resultados de búsqueda de Claude | Claude deja de citarte en sus respuestas |
Claude-User | Anthropic | Descarga una página cuando alguien pide a Claude que la abra | Claude no puede leer un enlace que pegó un usuario |
PerplexityBot | Perplexity | Indexa páginas para las respuestas de Perplexity | Perplexity deja de citarte |
Perplexity-User | Perplexity | Descarga una página en respuesta a una pregunta | Perplexity no puede abrir una página por la que preguntó un usuario |
Googlebot | El índice de búsqueda, que también alimenta AI Overviews | Desapareces de la búsqueda de Google | |
Bingbot | Microsoft | El índice de Bing, que alimenta Copilot | Desapareces de Bing y de Copilot |
Applebot | Apple | Impulsa la búsqueda en Siri, Spotlight y Safari | Los asistentes de Apple dejan de encontrarte |
Meta-ExternalAgent | Meta | Recopila páginas para los modelos de Meta, e indexa parte del contenido directamente | Tu contenido queda fuera del entrenamiento de Meta |
Meta-WebIndexer | Meta | Indexa páginas para los resultados de búsqueda de Meta AI | Meta AI deja de citarte y de enlazarte |
DuckAssistBot | DuckDuckGo | Alimenta las respuestas del asistente de DuckDuckGo, y no se usa para entrenamiento | DuckAssist deja de usar tus páginas |
MistralAI-Training | Mistral | Recopila páginas para entrenar modelos | Tu contenido queda fuera del entrenamiento de Mistral |
MistralAI-Index | Mistral | Indexa páginas para la búsqueda detrás del asistente de Mistral | El asistente de Mistral deja de mostrarte |
MistralAI-User | Mistral | Descarga una página cuando alguien pide al asistente de Mistral que la abra | El asistente no puede leer un enlace que pegó un usuario |
CCBot | Common Crawl | Construye el archivo abierto de rastreo con el que entrenan muchos modelos | Quedas fuera de un conjunto de datos que se usa en todo el sector |
Google-Extended | Una directiva de robots.txt, no un rastreador. Decide si Google puede usar tus páginas para Gemini | Tus páginas siguen en la búsqueda de Google y en AI Overviews, pero Google no puede usarlas para entrenar ni para fundamentar Gemini | |
Applebot-Extended | Apple | Una directiva de robots.txt, no un rastreador. Decide si Apple puede entrenar con tus páginas | Siri, Spotlight y Safari siguen usando tus páginas, Apple deja de entrenar sus modelos con ellas |
Entrenamiento y búsqueda son decisiones separadas
Bloquear GPTBot y permitir OAI-SearchBot te deja fuera de los datos de entrenamiento y te mantiene en los resultados de búsqueda de ChatGPT. Anthropic separa ClaudeBot y Claude-SearchBot de la misma manera, Meta separa Meta-ExternalAgent y Meta-WebIndexer, y Mistral usa un agente distinto para entrenamiento, búsqueda y peticiones de usuarios. Muchos sitios acaban bloqueándolo todo por accidente cuando lo único que querían era quedarse fuera del entrenamiento.
Los agentes que terminan en User no son rastreadores
ChatGPT-User, Claude-User, Perplexity-User y MistralAI-User solo se activan cuando alguien ya ha pegado tu enlace y ha pedido al asistente que lo lea. Bloquearlos no protege nada del entrenamiento. No detiene nada salvo a la persona que intentaba leer tu página.
Que bloquearlos en robots.txt funcione siquiera depende del operador. Anthropic y Mistral respetan el archivo para estos agentes. OpenAI dice que las reglas pueden no aplicarse, porque la petición vino de una persona y no de un rastreo. Perplexity dice que su descargador generalmente las ignora. Un bloqueo que tenga que aguantar va en el firewall.
Los dos últimos son directivas, no rastreadores
Google-Extended y Applebot-Extended nunca envían una petición. Están en robots.txt y le dicen a Google y a Apple qué se puede hacer con las páginas que sus rastreadores normales ya descargaron. No hay ningún rastreador que simular, así que el verificador los evalúa solo a partir de robots.txt y los marca como sin petición en vivo.
Google-Extended merece una segunda lectura. Bloquearlo no toca tu posicionamiento en Google ni te saca de AI Overviews, porque ambos funcionan con Googlebot. Lo que impide es que Gemini use tu contenido.
Apple recurre a Googlebot
Si tu robots.txt nunca nombra a Applebot pero sí a Googlebot, Apple sigue las reglas de Googlebot. El informe lo indica en esa fila cuando ocurre. Conviene saberlo, porque un Disallow que escribiste pensando en Google se aplica en silencio también a Siri, Spotlight y Safari, y nada en tu archivo lo dice en voz alta.
Un user agent es una afirmación, no una identidad
La mayoría de los operadores de esta lista dicen respetar robots.txt, con las excepciones señaladas arriba, y cualquiera puede afirmar cualquier cosa en una cadena User-Agent. Si necesitas certeza y no cooperación, verifica por rango de IP o por DNS inverso. Los grandes operadores publican sus rangos de IP o los datos para la verificación por DNS inverso.
Por qué robots.txt es solo la mitad de la respuesta
Leer robots.txt te dice lo que pediste. Nunca te muestra lo que pasó de verdad.
La protección contra bots de un CDN, un limitador de peticiones, un bloqueo por país o una página de desafío pueden rechazar a un rastreador de IA mientras tu robots.txt sigue invitándolo a entrar. Nada de eso está escrito en el archivo, y la mayoría de las veces tampoco llega a tus registros, porque la petición se corta antes de llegar a tu sitio.
El patrón es fácil de reconocer una vez que lo has visto. Tu robots.txt permite GPTBot, y GPTBot recibe un 403 de todas formas. Cuando robots.txt y la realidad no coinciden, el 403 es lo real.
Por eso mismo una página puede faltar en las respuestas de un asistente mientras todas las comprobaciones técnicas del sitio se completan sin detectar problemas. Usa nuestro verificador de visibilidad en IA para ver si los asistentes mencionan tu marca.
Qué significa cada resultado
La tabla de resultados tiene dos columnas y responden a preguntas distintas, así que la leyenda está dividida igual. Leer una etiqueta de Rastreabilidad con la escala de robots.txt es la forma más rápida de malinterpretar todo el informe.
La columna robots.txt: lo que permite tu archivo
| Resultado | Qué significa |
|---|---|
| Permitido | Tu robots.txt deja que este bot rastree la página que probaste |
| Bloqueado | Una regla de robots.txt cierra esta página a este bot. La fila muestra qué regla lo hizo, y la solución está en el archivo |
| Bloqueado en parte | La página que probaste está abierta para este bot, pero robots.txt tiene reglas dirigidas a él en otras partes del sitio. La fila muestra qué reglas y de qué grupo vienen, para que compruebes que querías mantenerlas cerradas |
La columna Rastreabilidad: lo que hizo tu servidor de verdad
| Resultado | Qué significa |
|---|---|
| Rastreable (con el estado HTTP) | La petición del bot pasó y tu servidor respondió con normalidad |
| Bloqueado (con el estado HTTP) | La petición fue rechazada. robots.txt no es la causa, así que mira las reglas de tu firewall, WAF o CDN |
| Revisar | Un bot que normalmente se verifica por dirección IP fue rechazado. Nuestra prueba no viene del rango de IP propio de ese bot, así que puede ser tu firewall funcionando bien y no un problema |
| Error (con el estado HTTP) | La página devolvió un error y no un bloqueo. Un 404 suele significar que la URL está mal, un 500 que algo en tu sitio está fallando. Ninguno es un problema de rastreadores |
| Sin respuesta | No volvió nada en absoluto. Un tiempo de espera agotado o una conexión cortada, lo que apunta a la red o a un bloqueo muy agresivo |
| Sin petición en vivo | Una directiva de robots.txt y no un rastreador, así que no hay a quién enviar una petición. El veredicto de robots.txt es toda la respuesta |
| No probado | No seleccionaste este bot, así que no se hizo ninguna petición en vivo. Su veredicto de robots.txt sigue valiendo |
Cómo desbloquear un rastreador
Una regla en robots.txt. Quita el Disallow, o añade un Allow más específico para ese user agent. Gana la regla coincidente más específica, así que un Allow explícito para un bot vence a un Disallow: / genérico dirigido a todos.
Una regla del firewall o del CDN. Nada en los archivos de tu sitio arregla esto. En Cloudflare está en la gestión de bots. En otros proveedores busca en WAF o en protección contra bots. Permite ahí el user agent, y verifica por rango de IP si quieres cuidarte de los impostores.
Una página de desafío. Exime al user agent del desafío. Un rastreador no puede resolverlo.
Un noindex en una etiqueta meta o en una cabecera X-Robots-Tag. El rastreador puede llegar a la página y se le ha dicho que no la conserve. Conviene confirmar que fue a propósito, porque un plugin o un ajuste olvidado del entorno de pruebas hacen esto sin avisar.
Los mismos pasos funcionan al revés. Si quieres bloquear GPTBot o cualquier otro rastreador de IA, un Disallow para ese user agent en robots.txt es la forma educada, y una regla del firewall es la que de verdad lo impone.
Preguntas frecuentes
¿Qué es la rastreabilidad para la IA?
Si los rastreadores de IA pueden llegar a tus páginas y leerlas. Abarca robots.txt y todo lo demás que se interpone entre un bot y tu contenido, y es el primer requisito para cualquier otra cosa. Rastreabilidad para LLM es la misma idea con otro nombre.
¿Los rastreadores de IA respetan robots.txt?
En el caso de los rastreadores que descargan páginas de forma automática, los grandes operadores dicen que sí. Los agentes que abren una página porque una persona lo pidió son otro caso, y tanto OpenAI como Perplexity dicen que robots.txt puede no detenerlos. No hay ningún mecanismo que obligue a cumplir estas reglas. robots.txt es una petición, no un candado.
¿Puedo bloquear el entrenamiento de IA y seguir apareciendo en las búsquedas con IA?
Sí, y es la opción que la mayoría de los dueños de sitios quiere en realidad. Bloquea GPTBot y ClaudeBot para quedarte fuera del entrenamiento, y permite OAI-SearchBot y Claude-SearchBot para que los asistentes puedan seguir encontrándote y citándote.
¿Bloquear los rastreadores de IA perjudica mi SEO?
No. GPTBot, ClaudeBot y los demás rastreadores de IA no tienen nada que ver con el posicionamiento en Google, y bloquearlos no afecta a tu posición en las búsquedas. Bloquear Googlebot es un asunto completamente distinto.
¿Por qué mi sitio pasa las comprobaciones de robots.txt y aun así lo bloquean?
Porque robots.txt es solo la primera capa. Una regla del firewall, del WAF o del CDN puede rechazar la petición antes de que llegue a tu servidor, y ese bloqueo es invisible tanto en tu robots.txt como en tus registros.
¿GPTBot es lo mismo que OAI-SearchBot?
No. GPTBot recopila páginas para el entrenamiento. OAI-SearchBot construye el índice que hay detrás de la búsqueda de ChatGPT. Puedes permitir uno y bloquear el otro.
¿Por qué ChatGPT no cita mi sitio web ni mi marca?
Ser accesible es el primer requisito, así que empieza por comprobar que OAI-SearchBot no está bloqueado. Si el acceso está bien, el motivo suele ser que ChatGPT encuentra la respuesta en otro sitio y no tiene motivos para acudir a ti.
¿Cómo consigo que mi sitio web aparezca en ChatGPT?
Asegúrate de que los rastreadores pueden leerte y luego trabaja en merecer la cita. Los asistentes se apoyan en fuentes que ya han visto citadas en otros lugares, así que las menciones en sitios en los que ya confían importan más que cualquier cosa en tus propias páginas.
Ser accesible es la primera pregunta. Que los asistentes te nombren de verdad es otra distinta.