Vérificateur de crawlers IA
Voyez quels crawlers IA peuvent atteindre votre site, et lesquels sont refoulés.
| Robot | robots.txt | Crawlabilité |
|---|
robots.txt tel que récupéré
Ce que l’outil vérifie
Deux choses distinctes décident si un crawler IA atteint votre page, et elles échouent indépendamment l’une de l’autre.
La première est le robots.txt, le portier poli. C’est une demande plutôt qu’un verrou, et tous les agents présents ici ne le respectent pas. La seconde est ce que fait votre serveur quand la requête arrive réellement. C’est la couche du pare-feu, et c’est là que vivent la plupart des blocages accidentels, parce que presque personne ne les met en place volontairement. Une règle écrite pour arrêter les scrapers ne fait pas la différence entre un scraper et PerplexityBot.
Ce vérificateur regarde les deux. Il lit votre robots.txt et détermine ce que chaque robot a le droit de faire, puis récupère la page avec le vrai User-Agent de ce robot et compare la réponse à celle que reçoit un navigateur ordinaire. Quand les deux couches ne sont pas d’accord, vous le découvrez maintenant plutôt que des mois plus tard, quand vous remarquez que rien ne vous cite.
Une chose à dire franchement. Le test part de nos serveurs avec la chaîne User-Agent de chaque robot. Les vrais crawlers arrivent depuis leurs propres plages d’adresses IP, donc un pare-feu qui vérifie les adresses IP peut les traiter différemment. Si vous voyez un blocage ici, il est réel. Un résultat autorisé est un signal fort plutôt qu’une garantie, et les robots habituellement vérifiés par IP sont signalés comme tels dans les résultats.
Les crawlers IA que nous vérifions
Tous les user agents présents ici ne font pas le même travail. Certains collectent des pages pour l’entraînement. Certains construisent l’index derrière la recherche d’un assistant. D’autres n’apparaissent que lorsqu’une personne demande à l’assistant d’ouvrir un lien. Bloquer l’un est une décision différente de bloquer l’autre, et les résultats ne sont pas interchangeables.
| User agent | Opérateur | Ce qu’il fait | Si vous le bloquez |
|---|---|---|---|
GPTBot | OpenAI | Collecte des pages pour l’entraînement des modèles | Votre contenu reste hors de l’entraînement |
OAI-SearchBot | OpenAI | Construit l’index derrière la recherche ChatGPT | La recherche ChatGPT cesse de vous afficher |
ChatGPT-User | OpenAI | Récupère une page quand quelqu’un demande à ChatGPT de l’ouvrir | ChatGPT ne peut pas lire un lien collé par un utilisateur |
ClaudeBot | Anthropic | Collecte des pages pour l’entraînement des modèles | Votre contenu reste hors de l’entraînement |
Claude-SearchBot | Anthropic | Indexe des pages pour les résultats de recherche de Claude | Claude cesse de vous citer dans ses réponses |
Claude-User | Anthropic | Récupère une page quand quelqu’un demande à Claude de l’ouvrir | Claude ne peut pas lire un lien collé par un utilisateur |
PerplexityBot | Perplexity | Indexe des pages pour les réponses de Perplexity | Perplexity cesse de vous citer |
Perplexity-User | Perplexity | Récupère une page en réponse à une question | Perplexity ne peut pas ouvrir une page demandée par un utilisateur |
Googlebot | L’index de recherche, qui alimente aussi AI Overviews | Vous disparaissez de la recherche Google | |
Bingbot | Microsoft | L’index Bing, qui alimente Copilot | Vous disparaissez de Bing et de Copilot |
Applebot | Apple | Alimente la recherche dans Siri, Spotlight et Safari | Les assistants d’Apple ne vous trouvent plus |
Meta-ExternalAgent | Meta | Collecte des pages pour les modèles de Meta, et indexe directement certains contenus | Votre contenu reste hors de l’entraînement de Meta |
Meta-WebIndexer | Meta | Indexe des pages pour les résultats de recherche de Meta AI | Meta AI cesse de vous citer et de faire un lien vers vous |
DuckAssistBot | DuckDuckGo | Alimente les réponses de l’assistant de DuckDuckGo, et ne sert pas à l’entraînement | DuckAssist cesse d’utiliser vos pages |
MistralAI-Training | Mistral | Collecte des pages pour l’entraînement des modèles | Votre contenu reste hors de l’entraînement de Mistral |
MistralAI-Index | Mistral | Indexe des pages pour la recherche derrière l’assistant de Mistral | L’assistant de Mistral cesse de vous afficher |
MistralAI-User | Mistral | Récupère une page quand quelqu’un demande à l’assistant de Mistral de l’ouvrir | L’assistant ne peut pas lire un lien collé par un utilisateur |
CCBot | Common Crawl | Construit l’archive de crawl ouverte sur laquelle s’entraînent de nombreux modèles | Vous êtes absent d’un jeu de données utilisé dans tout le secteur |
Google-Extended | Une directive robots.txt, pas un crawler. Décide si Google peut utiliser vos pages pour Gemini | Vos pages restent dans la recherche Google et dans AI Overviews, mais Google ne peut pas les utiliser pour entraîner ou alimenter Gemini | |
Applebot-Extended | Apple | Une directive robots.txt, pas un crawler. Décide si Apple peut s’entraîner sur vos pages | Siri, Spotlight et Safari continuent d’utiliser vos pages, Apple cesse d’entraîner ses modèles dessus |
Entraînement et recherche sont deux décisions distinctes
Bloquer GPTBot tout en autorisant OAI-SearchBot vous garde hors des données d’entraînement et vous garde dans les résultats de recherche de ChatGPT. Anthropic sépare ClaudeBot et Claude-SearchBot de la même façon, Meta sépare Meta-ExternalAgent et Meta-WebIndexer, et Mistral utilise un agent distinct pour l’entraînement, la recherche et les requêtes des utilisateurs. Beaucoup de sites finissent par tout bloquer par accident alors qu’ils voulaient seulement se retirer de l’entraînement.
Les agents qui se terminent par User ne sont pas des crawlers
ChatGPT-User, Claude-User, Perplexity-User et MistralAI-User ne s’activent que lorsque quelqu’un a déjà collé votre lien et demandé à l’assistant de le lire. Les bloquer ne protège rien de l’entraînement. Cela n’arrête rien, sauf la personne qui essayait de lire votre page.
Que les bloquer dans le robots.txt fonctionne ou non dépend de l’opérateur. Anthropic et Mistral respectent le fichier pour ces agents. OpenAI dit que les règles peuvent ne pas s’appliquer, parce que la requête vient d’une personne et non d’un crawl. Perplexity dit que son outil de récupération les ignore généralement. Un blocage qui doit tenir a sa place dans le pare-feu.
Les deux derniers sont des directives, pas des crawlers
Google-Extended et Applebot-Extended n’envoient jamais de requête. Ils se trouvent dans le robots.txt et indiquent à Google et à Apple ce qui peut être fait des pages que leurs crawlers ordinaires ont déjà récupérées. Il n’y a aucun crawler à simuler, donc le vérificateur évalue ces directives uniquement à partir du robots.txt et les signale comme sans requête en direct.
Google-Extended mérite une seconde lecture. Le bloquer ne touche pas à votre classement Google et ne vous retire pas d’AI Overviews, parce que les deux fonctionnent avec Googlebot. Ce qu’il empêche, c’est que Gemini utilise votre contenu.
Apple se rabat sur Googlebot
Si votre robots.txt ne nomme jamais Applebot mais nomme Googlebot, Apple suit les règles de Googlebot. Le rapport le signale sur cette ligne quand cela se produit. C’est bon à savoir, parce qu’un Disallow écrit en pensant à Google s’applique en silence à Siri, Spotlight et Safari aussi, et rien dans votre fichier ne le dit tout haut.
Un user agent est une affirmation, pas une identité
La plupart des opérateurs présents ici disent respecter le robots.txt, avec les exceptions notées plus haut, et n’importe qui peut affirmer n’importe quoi dans une chaîne User-Agent. Si vous avez besoin de certitude plutôt que de coopération, vérifiez par plage d’adresses IP ou par DNS inversé. Les grands opérateurs publient leurs plages d’adresses IP ou les informations nécessaires à la vérification par DNS inversé.
Pourquoi le robots.txt n’est que la moitié de la réponse
Lire le robots.txt vous dit ce que vous avez demandé. Il ne vous montre jamais ce qui s’est réellement passé.
Une protection anti-bots sur un CDN, un limiteur de débit, un blocage par pays ou une page de défi peuvent tous refouler un crawler IA pendant que votre robots.txt continue de l’inviter à entrer. Rien de cela n’est écrit dans le fichier, et la plupart du temps rien de cela n’atteint vos journaux non plus, parce que la requête est coupée avant d’arriver à votre site.
Le schéma est facile à reconnaître une fois qu’on l’a vu. Votre robots.txt autorise GPTBot, et GPTBot reçoit quand même un 403. Quand le robots.txt et la réalité ne sont pas d’accord, c’est le 403 qui est réel.
C’est aussi pour cela qu’une page peut manquer dans les réponses d’un assistant alors que toutes les vérifications techniques du site ne détectent aucun problème. Utilisez notre test de visibilité IA pour voir si les assistants citent réellement votre marque.
Ce que signifie chaque résultat
Le tableau des résultats a deux colonnes qui répondent à des questions différentes, la légende est donc découpée de la même façon. Lire une étiquette de Crawlabilité avec l’échelle du robots.txt est le moyen le plus rapide de mal comprendre tout le rapport.
La colonne robots.txt : ce que votre fichier autorise
| Résultat | Ce que cela signifie |
|---|---|
| Autorisé | Votre robots.txt laisse ce robot explorer la page que vous avez testée |
| Bloqué | Une règle du robots.txt ferme cette page à ce robot. La ligne indique quelle règle en est la cause, et la solution se trouve dans le fichier |
| Partiellement bloqué | La page que vous avez testée est ouverte à ce robot, mais le robots.txt contient des règles qui le visent ailleurs sur le site. La ligne indique quelles règles et de quel groupe elles viennent, pour que vous puissiez vérifier que vous vouliez bien les garder fermées |
La colonne Crawlabilité : ce que votre serveur a réellement fait
| Résultat | Ce que cela signifie |
|---|---|
| Explorable (avec le statut HTTP) | La requête du robot est passée et votre serveur a répondu normalement |
| Bloqué (avec le statut HTTP) | La requête a été refusée. Le robots.txt n’en est pas la cause, regardez donc les règles de votre pare-feu, de votre WAF ou de votre CDN |
| À vérifier | Un robot normalement vérifié par adresse IP a été refusé. Notre test ne vient pas de la plage d’adresses IP de ce robot, donc il peut s’agir de votre pare-feu qui fonctionne correctement plutôt que d’un problème |
| Erreur (avec le statut HTTP) | La page a renvoyé une erreur plutôt qu’un blocage. Un 404 signifie généralement que l’URL est fausse, un 500 que quelque chose sur votre site ne fonctionne pas. Ni l’un ni l’autre n’est un problème de crawler |
| Aucune réponse | Rien n’est revenu du tout. Un délai dépassé ou une connexion coupée, ce qui pointe vers le réseau ou vers un blocage très agressif |
| Pas de requête en direct | Une directive robots.txt plutôt qu’un crawler, il n’y a donc rien à qui envoyer une requête. Le verdict du robots.txt est toute la réponse |
| Non testé | Vous n’avez pas sélectionné ce robot, aucune requête en direct n’a donc été envoyée. Son verdict robots.txt reste valable |
Comment débloquer un crawler
Une règle dans le robots.txt. Retirez le Disallow, ou ajoutez un Allow plus spécifique pour ce user agent. La règle correspondante la plus spécifique l’emporte, donc un Allow explicite pour un robot bat un Disallow: / général visant tout le monde.
Une règle de pare-feu ou de CDN. Rien dans les fichiers de votre site ne réglera celle-là. Sur Cloudflare, elle se trouve dans la gestion des bots. Chez d’autres hébergeurs, cherchez sous WAF ou protection anti-bots. Autorisez le user agent à cet endroit, et vérifiez par plage d’adresses IP si vous voulez vous prémunir contre les imposteurs.
Une page de défi. Exemptez le user agent du défi. Un crawler ne peut pas le résoudre.
Un noindex dans une balise meta ou un en-tête X-Robots-Tag. Le crawler peut atteindre la page et on lui a dit de ne pas la garder. Il vaut la peine de confirmer que c’était voulu, parce qu’un plugin ou un réglage de préproduction oublié fait cela en silence.
Les mêmes étapes fonctionnent à l’envers. Si vous voulez bloquer GPTBot ou tout autre crawler IA, un Disallow pour ce user agent dans le robots.txt est la manière polie, et une règle de pare-feu est celle qui l’impose vraiment.
Questions fréquentes
Qu’est-ce que la crawlabilité IA ?
La possibilité pour les crawlers IA d’atteindre et de lire vos pages. Cela couvre le robots.txt et tout ce qui se trouve entre un robot et votre contenu, et c’est la première condition de tout le reste. La crawlabilité LLM est la même idée sous un autre nom.
Les crawlers IA respectent-ils le robots.txt ?
Pour les crawlers qui récupèrent des pages automatiquement, les grands opérateurs disent que oui. Les agents qui ouvrent une page parce qu’une personne l’a demandé sont un autre cas, et OpenAI comme Perplexity disent que le robots.txt ne les arrête pas forcément. Aucun mécanisme ne force le respect de ces règles. Le robots.txt est une demande, pas un verrou.
Puis-je bloquer l’entraînement des IA tout en restant dans les résultats de recherche IA ?
Oui, et c’est ce que la plupart des propriétaires de sites veulent vraiment. Bloquez GPTBot et ClaudeBot pour rester hors de l’entraînement, et autorisez OAI-SearchBot et Claude-SearchBot pour que les assistants puissent toujours vous trouver et vous citer.
Bloquer les crawlers IA nuit-il à mon SEO ?
Non. GPTBot, ClaudeBot et les autres crawlers IA n’ont rien à voir avec le classement Google, et les bloquer ne change rien à votre position dans les résultats de recherche. Bloquer Googlebot est une tout autre affaire.
Pourquoi mon site passe-t-il les vérifications du robots.txt tout en étant bloqué ?
Parce que le robots.txt n’est que la première couche. Une règle de pare-feu, de WAF ou de CDN peut refuser la requête avant qu’elle n’atteigne votre serveur, et ce blocage est invisible aussi bien dans votre robots.txt que dans vos journaux.
GPTBot est-il la même chose qu’OAI-SearchBot ?
Non. GPTBot collecte des pages pour l’entraînement. OAI-SearchBot construit l’index derrière la recherche ChatGPT. Vous pouvez autoriser l’un et bloquer l’autre.
Pourquoi ChatGPT ne cite-t-il pas mon site ou ma marque ?
Être accessible est la première condition, alors commencez par vérifier qu’OAI-SearchBot n’est pas bloqué. Si l’accès est bon, la raison est généralement que ChatGPT trouve la réponse ailleurs et n’a aucune raison de venir vous chercher.
Comment faire apparaître mon site dans ChatGPT ?
Assurez-vous que les crawlers peuvent vous lire, puis travaillez à mériter la citation. Les assistants s’appuient sur des sources qu’ils ont déjà vues citées ailleurs, donc les mentions sur des sites auxquels ils font déjà confiance comptent plus que tout ce qui se trouve sur vos propres pages.
Être accessible est la première question. Que les assistants vous nomment vraiment en est une autre.