Kontrola AI crawlerů

Zjistěte, které AI crawlery se na váš web dostanou, a které jsou odmítnuty.

Roboti k živému testu

Je to zdarma

Co nástroj kontroluje

O tom, zda se AI crawler dostane na vaši stránku, rozhodují dvě oddělené věci a selhávají nezávisle na sobě.

První je robots.txt, zdvořilý vrátný. Je to žádost, ne zámek, a ne každý agent v tomto seznamu ji respektuje. Druhá je to, co udělá váš server, když požadavek skutečně dorazí. To je vrstva firewallu a právě tam sídlí většina nechtěných blokací, protože je téměř nikdo nenastavuje záměrně. Pravidlo napsané proti scraperům nerozezná scraper od PerplexityBota.

Tento nástroj kontroluje obě vrstvy. Přečte váš robots.txt a zjistí, co má každý robot povoleno, potom stáhne stránku se skutečným User-Agentem daného robota a porovná odpověď s tím, co dostane běžný prohlížeč. Když se obě vrstvy neshodují, dozvíte se to teď, a ne za několik měsíců, až si všimnete, že vás nikdo necituje.

Jednu věc je třeba říct na rovinu. Test běží z našich serverů s řetězcem User-Agent každého robota. Skuteční crawleři přicházejí z vlastních rozsahů IP adres, takže firewall, který IP adresy ověřuje, s nimi může zacházet jinak. Pokud tu vidíte blokaci, je skutečná. Povolený výsledek je silný signál, ne záruka, a roboti, kteří se běžně ověřují podle IP, jsou ve výsledcích takto označeni.

AI crawlery, které kontrolujeme

Ne každý user agent v tomto seznamu dělá totéž. Někteří sbírají stránky pro trénování. Někteří staví index, na kterém běží vyhledávání asistenta. Jiní se objeví jen tehdy, když člověk požádá asistenta o otevření odkazu. Blokovat jednoho je jiné rozhodnutí než blokovat druhého a výsledky nejsou zaměnitelné.

User agentProvozovatelCo děláKdyž ho zablokujete
GPTBotOpenAISbírá stránky pro trénování modelůVáš obsah zůstane mimo trénování
OAI-SearchBotOpenAIStaví index, na kterém běží vyhledávání v ChatGPTVyhledávání v ChatGPT vás přestane zobrazovat
ChatGPT-UserOpenAIStáhne stránku, když někdo požádá ChatGPT o její otevřeníChatGPT nedokáže přečíst odkaz, který uživatel vložil
ClaudeBotAnthropicSbírá stránky pro trénování modelůVáš obsah zůstane mimo trénování
Claude-SearchBotAnthropicIndexuje stránky pro výsledky vyhledávání ClaudeClaude vás přestane citovat v odpovědích
Claude-UserAnthropicStáhne stránku, když někdo požádá Claude o její otevřeníClaude nedokáže přečíst odkaz, který uživatel vložil
PerplexityBotPerplexityIndexuje stránky pro odpovědi PerplexityPerplexity vás přestane citovat
Perplexity-UserPerplexityStáhne stránku jako odpověď na dotazPerplexity nedokáže otevřít stránku, na kterou se uživatel ptal
GooglebotGoogleIndex vyhledávače, který zásobuje i AI OverviewsZmizíte z vyhledávání Google
BingbotMicrosoftIndex Bingu, který zásobuje CopilotZmizíte z Bingu i z Copilotu
ApplebotApplePohání vyhledávání v Siri, Spotlightu a SafariAsistenti Applu vás přestanou nacházet
Meta-ExternalAgentMetaSbírá stránky pro modely Mety a část obsahu indexuje přímoVáš obsah zůstane mimo trénování Mety
Meta-WebIndexerMetaIndexuje stránky pro výsledky vyhledávání Meta AIMeta AI vás přestane citovat a odkazovat na vás
DuckAssistBotDuckDuckGoZásobuje odpovědi asistenta DuckDuckGo a nepoužívá se k trénováníDuckAssist přestane používat vaše stránky
MistralAI-TrainingMistralSbírá stránky pro trénování modelůVáš obsah zůstane mimo trénování Mistralu
MistralAI-IndexMistralIndexuje stránky pro vyhledávání, na kterém běží asistent MistraluAsistent Mistralu vás přestane zobrazovat
MistralAI-UserMistralStáhne stránku, když někdo požádá asistenta Mistralu o její otevřeníAsistent nedokáže přečíst odkaz, který uživatel vložil
CCBotCommon CrawlStaví otevřený archiv procházení, na kterém se trénuje mnoho modelůChybíte v datové sadě používané napříč oborem
Google-ExtendedGoogleDirektiva v robots.txt, ne crawler. Rozhoduje, zda Google může používat vaše stránky pro GeminiVaše stránky zůstanou ve vyhledávání Google i v AI Overviews, ale Google je nesmí použít k trénování Gemini ani jako podklady pro jeho odpovědi
Applebot-ExtendedAppleDirektiva v robots.txt, ne crawler. Rozhoduje, zda Apple může trénovat na vašich stránkáchSiri, Spotlight a Safari vaše stránky dál používají, Apple na nich přestane trénovat své modely

Trénování a vyhledávání jsou oddělená rozhodnutí

Blokování GPTBot při povolení OAI-SearchBot vás drží mimo trénovací data a zároveň ve výsledcích vyhledávání ChatGPT. Anthropic odděluje ClaudeBot a Claude-SearchBot stejně, Meta odděluje Meta-ExternalAgent a Meta-WebIndexer a Mistral provozuje samostatného agenta pro trénování, vyhledávání i uživatelské požadavky. Spousta webů nakonec omylem zablokuje všechno, i když jejich provozovatelé chtěli jen vyloučit obsah z trénování.

Agenti končící na User nejsou crawleři

ChatGPT-User, Claude-User, Perplexity-User a MistralAI-User se spustí jen tehdy, když už někdo vložil váš odkaz a požádal asistenta, aby si ho přečetl. Jejich blokování nechrání nic před trénováním. Nezastaví nic kromě člověka, který si chtěl přečíst vaši stránku.

Zda jejich blokování v robots.txt vůbec funguje, záleží na provozovateli. Anthropic a Mistral soubor u těchto agentů respektují. OpenAI říká, že pravidla se nemusí uplatnit, protože požadavek přišel od člověka, a ne z procházení. Perplexity říká, že její stahovač je obecně ignoruje. Blokace, která má držet, patří do firewallu.

Poslední dva jsou direktivy, ne crawleři

Google-Extended a Applebot-Extended nikdy nepošlou požadavek. Sedí v robots.txt a říkají Googlu a Applu, co se smí dělat se stránkami, které jejich běžní crawleři už stáhli. Není tu crawler, jehož požadavek by se dal simulovat, takže nástroj tyto direktivy vyhodnocuje jen podle robots.txt a označí je jako bez živého dotazu.

Google-Extended stojí za to přečíst si dvakrát. Jeho blokování nesáhne na vaše pozice v Googlu a nevyřadí vás z AI Overviews, protože obojí běží na Googlebot. Zabrání jen tomu, aby váš obsah používalo Gemini.

Apple se řídí pravidly pro Googlebota

Pokud váš robots.txt nikde nejmenuje Applebot, ale jmenuje Googlebot, Apple se řídí pravidly pro Googlebota. Zpráva to na daném řádku uvede, když k tomu dojde. Stojí za to to vědět, protože Disallow, který jste napsali s myšlenkou na Google, se potichu vztahuje i na Siri, Spotlight a Safari, a nic ve vašem souboru to neříká nahlas.

User agent je tvrzení, ne identita

Většina provozovatelů v tomto seznamu říká, že robots.txt respektuje, s výjimkami uvedenými výše, a v řetězci User-Agent může kdokoli tvrdit cokoli. Pokud potřebujete jistotu, a ne spolupráci, ověřujte podle rozsahu IP adres nebo reverzního DNS. Velcí provozovatelé své rozsahy zveřejňují.

Proč je robots.txt jen polovina odpovědi

Čtení robots.txt vám řekne, o co jste požádali. Nikdy vám neukáže, co se skutečně stalo.

Ochrana proti botům na CDN, omezovač požadavků, blokace podle země nebo stránka s ověřením mohou AI crawler odmítnout, zatímco váš robots.txt ho dál zve dovnitř. Nic z toho v souboru není napsáno a většinou se nic z toho nedostane ani do vašich logů, protože požadavek je odříznut dřív, než dorazí na váš web.

Ten vzor je snadné rozpoznat, jakmile ho jednou uvidíte. Váš robots.txt povoluje GPTBot, a GPTBot přesto dostane 403. Když se robots.txt a realita neshodují, skutečná je ta 403.

Právě proto může stránka chybět v odpovědích asistenta, zatímco všechny technické kontroly webu proběhnou bez zjištění problémů. Ověřte svou viditelnost v AI a zjistěte, zda asistenti vaši značku skutečně zmiňují.

Co znamená každý výsledek

Tabulka výsledků má dva sloupce a odpovídají na různé otázky, proto je i legenda rozdělená stejně. Číst štítek ze sloupce Živý přístup podle stupnice robots.txt je nejrychlejší způsob, jak celou zprávu pochopit špatně.

Sloupec robots.txt: co povoluje váš soubor

VýsledekCo znamená
PovolenoVáš robots.txt tomuto robotu dovoluje procházet testovanou stránku
BlokovánoPravidlo v robots.txt tuto stránku tomuto robotu zavírá. Řádek ukazuje, které pravidlo to způsobilo, a oprava je v souboru
Částečně blokovánoTestovaná stránka je pro tohoto robota otevřená, ale robots.txt má pravidla namířená na něj jinde na webu. Řádek ukazuje, která pravidla a z jaké skupiny pocházejí, abyste mohli ověřit, že tyto části webu chcete ponechat zablokované

Sloupec Živý přístup: co váš server skutečně udělal

VýsledekCo znamená
Dostupné (se stavem HTTP)Požadavek robota prošel a váš server odpověděl normálně
Blokováno (se stavem HTTP)Požadavek byl odmítnut. robots.txt není příčina, podívejte se tedy na pravidla firewallu, WAF nebo CDN
OvěřitRobot, který se běžně ověřuje podle IP adresy, byl odmítnut. Náš test nepřichází z vlastního rozsahu IP tohoto robota, takže může jít o správně fungující firewall, ne o problém
Chyba (se stavem HTTP)Stránka vrátila chybu, ne blokaci. 404 obvykle znamená špatnou URL, 500 to, že něco na vašem webu selhává. Ani jedno není problém crawlerů
Bez odpovědiNevrátilo se vůbec nic. Vypršení časového limitu nebo přerušené spojení, což ukazuje na síť nebo na velmi agresivní blokaci
Bez živého dotazuDirektiva v robots.txt, ne crawler, takže není komu poslat požadavek. Verdikt z robots.txt je celá odpověď
NetestovánoTohoto robota jste nevybrali, takže žádný živý požadavek neproběhl. Jeho verdikt z robots.txt dál platí

Jak crawler odblokovat

Pravidlo v robots.txt. Odstraňte Disallow, nebo přidejte konkrétnější Allow pro daného user agenta. Vítězí nejkonkrétnější odpovídající pravidlo, takže výslovné Allow pro jednoho robota přebije plošné Disallow: / namířené na všechny.

Pravidlo firewallu nebo CDN. Tohle nic v souborech vašeho webu neopraví. Na Cloudflare to sídlí ve správě botů. U jiných poskytovatelů hledejte pod WAF nebo ochranou proti botům. Povolte tam user agenta a pokud chcete být opatrní vůči podvodníkům, ověřujte podle rozsahu IP.

Stránka s ověřením. Vyjměte user agenta z ověřování. Crawler ho nedokáže vyřešit.

noindex v meta tagu nebo hlavička X-Robots-Tag. Crawler se na stránku dostane a dostal pokyn, aby si ji nenechával. Stojí za to potvrdit, že to bylo záměrné, protože plugin nebo zapomenuté nastavení z testovacího prostředí to dělají potichu.

Stejné kroky fungují i obráceně. Pokud chcete blokovat GPTBot nebo jakýkoli jiný AI crawler, Disallow pro daného user agenta v robots.txt je zdvořilá cesta a pravidlo firewallu je ta, která to skutečně vynutí.

Časté dotazy

Co je dostupnost webu pro AI crawlery?

To, zda se AI crawlery dostanou na vaše stránky a dokážou je přečíst. Zahrnuje robots.txt i všechno ostatní, co stojí mezi robotem a vaším obsahem, a je to první podmínka všeho dalšího. Anglicky se tomu říká AI crawlability a LLM crawlability je stejná myšlenka pod jiným názvem.

Respektují AI crawlery robots.txt?

U crawlerů, které stahují stránky automaticky, velcí provozovatelé říkají, že ano. Agenti, kteří stránku stahují, protože o to požádal člověk, jsou jiný případ, a OpenAI i Perplexity říkají, že robots.txt je zastavit nemusí. Nic z toho nikdo nevynucuje. robots.txt je žádost, ne zámek.

Mohu blokovat trénování AI a přitom zůstat ve výsledcích AI vyhledávání?

Ano, a právě to většina majitelů webů skutečně chce. Zablokujte GPTBot a ClaudeBot, abyste zůstali mimo trénování, a povolte OAI-SearchBot a Claude-SearchBot, aby vás asistenti dál našli a citovali.

Poškodí blokování AI crawlerů moje SEO?

Ne. GPTBot, ClaudeBot a ostatní AI crawlery nemají s pozicemi v Googlu nic společného a jejich blokování vaši pozici ve vyhledávání neovlivní. Blokování robota Googlebot je úplně jiná věc.

Proč můj web projde kontrolou robots.txt, a přesto je blokován?

Protože robots.txt je jen první vrstva. Pravidlo firewallu, WAF nebo CDN může požadavek odmítnout dřív, než dorazí na váš server, a taková blokace není vidět ani v robots.txt, ani ve vašich protokolech.

Je GPTBot to samé jako OAI-SearchBot?

Ne. GPTBot sbírá stránky pro trénování. OAI-SearchBot staví index, na kterém běží vyhledávání v ChatGPT. Jednoho můžete povolit a druhého zablokovat.

Proč ChatGPT necituje můj web ani značku?

Dostupnost je první podmínka, začněte tedy kontrolou, že OAI-SearchBot není blokován. Pokud je přístup v pořádku, důvod obvykle bývá, že ChatGPT najde odpověď jinde a nemá důvod sáhnout po vás.

Jak dosáhnout toho, aby se můj web objevoval v ChatGPT?

Ujistěte se, že vás crawlery dokážou přečíst, a pak pracujte na tom, abyste stáli za citaci. Asistenti se opírají o zdroje, které už viděli citované jinde, takže zmínky na webech, kterým už důvěřují, znamenají víc než cokoli na vašich vlastních stránkách.

Dostupnost je první otázka. Zda vás asistenti skutečně jmenují, je otázka jiná.

Ověřte svou viditelnost v AI