Kontrola AI crawlerů
Zjistěte, které AI crawlery se na váš web dostanou, a které jsou odmítnuty.
| Robot | robots.txt | Živý přístup |
|---|
robots.txt tak, jak byl stažen
Co nástroj kontroluje
O tom, zda se AI crawler dostane na vaši stránku, rozhodují dvě oddělené věci a selhávají nezávisle na sobě.
První je robots.txt, zdvořilý vrátný. Je to žádost, ne zámek, a ne každý agent v tomto seznamu ji respektuje. Druhá je to, co udělá váš server, když požadavek skutečně dorazí. To je vrstva firewallu a právě tam sídlí většina nechtěných blokací, protože je téměř nikdo nenastavuje záměrně. Pravidlo napsané proti scraperům nerozezná scraper od PerplexityBota.
Tento nástroj kontroluje obě vrstvy. Přečte váš robots.txt a zjistí, co má každý robot povoleno, potom stáhne stránku se skutečným User-Agentem daného robota a porovná odpověď s tím, co dostane běžný prohlížeč. Když se obě vrstvy neshodují, dozvíte se to teď, a ne za několik měsíců, až si všimnete, že vás nikdo necituje.
Jednu věc je třeba říct na rovinu. Test běží z našich serverů s řetězcem User-Agent každého robota. Skuteční crawleři přicházejí z vlastních rozsahů IP adres, takže firewall, který IP adresy ověřuje, s nimi může zacházet jinak. Pokud tu vidíte blokaci, je skutečná. Povolený výsledek je silný signál, ne záruka, a roboti, kteří se běžně ověřují podle IP, jsou ve výsledcích takto označeni.
AI crawlery, které kontrolujeme
Ne každý user agent v tomto seznamu dělá totéž. Někteří sbírají stránky pro trénování. Někteří staví index, na kterém běží vyhledávání asistenta. Jiní se objeví jen tehdy, když člověk požádá asistenta o otevření odkazu. Blokovat jednoho je jiné rozhodnutí než blokovat druhého a výsledky nejsou zaměnitelné.
| User agent | Provozovatel | Co dělá | Když ho zablokujete |
|---|---|---|---|
GPTBot | OpenAI | Sbírá stránky pro trénování modelů | Váš obsah zůstane mimo trénování |
OAI-SearchBot | OpenAI | Staví index, na kterém běží vyhledávání v ChatGPT | Vyhledávání v ChatGPT vás přestane zobrazovat |
ChatGPT-User | OpenAI | Stáhne stránku, když někdo požádá ChatGPT o její otevření | ChatGPT nedokáže přečíst odkaz, který uživatel vložil |
ClaudeBot | Anthropic | Sbírá stránky pro trénování modelů | Váš obsah zůstane mimo trénování |
Claude-SearchBot | Anthropic | Indexuje stránky pro výsledky vyhledávání Claude | Claude vás přestane citovat v odpovědích |
Claude-User | Anthropic | Stáhne stránku, když někdo požádá Claude o její otevření | Claude nedokáže přečíst odkaz, který uživatel vložil |
PerplexityBot | Perplexity | Indexuje stránky pro odpovědi Perplexity | Perplexity vás přestane citovat |
Perplexity-User | Perplexity | Stáhne stránku jako odpověď na dotaz | Perplexity nedokáže otevřít stránku, na kterou se uživatel ptal |
Googlebot | Index vyhledávače, který zásobuje i AI Overviews | Zmizíte z vyhledávání Google | |
Bingbot | Microsoft | Index Bingu, který zásobuje Copilot | Zmizíte z Bingu i z Copilotu |
Applebot | Apple | Pohání vyhledávání v Siri, Spotlightu a Safari | Asistenti Applu vás přestanou nacházet |
Meta-ExternalAgent | Meta | Sbírá stránky pro modely Mety a část obsahu indexuje přímo | Váš obsah zůstane mimo trénování Mety |
Meta-WebIndexer | Meta | Indexuje stránky pro výsledky vyhledávání Meta AI | Meta AI vás přestane citovat a odkazovat na vás |
DuckAssistBot | DuckDuckGo | Zásobuje odpovědi asistenta DuckDuckGo a nepoužívá se k trénování | DuckAssist přestane používat vaše stránky |
MistralAI-Training | Mistral | Sbírá stránky pro trénování modelů | Váš obsah zůstane mimo trénování Mistralu |
MistralAI-Index | Mistral | Indexuje stránky pro vyhledávání, na kterém běží asistent Mistralu | Asistent Mistralu vás přestane zobrazovat |
MistralAI-User | Mistral | Stáhne stránku, když někdo požádá asistenta Mistralu o její otevření | Asistent nedokáže přečíst odkaz, který uživatel vložil |
CCBot | Common Crawl | Staví otevřený archiv procházení, na kterém se trénuje mnoho modelů | Chybíte v datové sadě používané napříč oborem |
Google-Extended | Direktiva v robots.txt, ne crawler. Rozhoduje, zda Google může používat vaše stránky pro Gemini | Vaše stránky zůstanou ve vyhledávání Google i v AI Overviews, ale Google je nesmí použít k trénování Gemini ani jako podklady pro jeho odpovědi | |
Applebot-Extended | Apple | Direktiva v robots.txt, ne crawler. Rozhoduje, zda Apple může trénovat na vašich stránkách | Siri, Spotlight a Safari vaše stránky dál používají, Apple na nich přestane trénovat své modely |
Trénování a vyhledávání jsou oddělená rozhodnutí
Blokování GPTBot při povolení OAI-SearchBot vás drží mimo trénovací data a zároveň ve výsledcích vyhledávání ChatGPT. Anthropic odděluje ClaudeBot a Claude-SearchBot stejně, Meta odděluje Meta-ExternalAgent a Meta-WebIndexer a Mistral provozuje samostatného agenta pro trénování, vyhledávání i uživatelské požadavky. Spousta webů nakonec omylem zablokuje všechno, i když jejich provozovatelé chtěli jen vyloučit obsah z trénování.
Agenti končící na User nejsou crawleři
ChatGPT-User, Claude-User, Perplexity-User a MistralAI-User se spustí jen tehdy, když už někdo vložil váš odkaz a požádal asistenta, aby si ho přečetl. Jejich blokování nechrání nic před trénováním. Nezastaví nic kromě člověka, který si chtěl přečíst vaši stránku.
Zda jejich blokování v robots.txt vůbec funguje, záleží na provozovateli. Anthropic a Mistral soubor u těchto agentů respektují. OpenAI říká, že pravidla se nemusí uplatnit, protože požadavek přišel od člověka, a ne z procházení. Perplexity říká, že její stahovač je obecně ignoruje. Blokace, která má držet, patří do firewallu.
Poslední dva jsou direktivy, ne crawleři
Google-Extended a Applebot-Extended nikdy nepošlou požadavek. Sedí v robots.txt a říkají Googlu a Applu, co se smí dělat se stránkami, které jejich běžní crawleři už stáhli. Není tu crawler, jehož požadavek by se dal simulovat, takže nástroj tyto direktivy vyhodnocuje jen podle robots.txt a označí je jako bez živého dotazu.
Google-Extended stojí za to přečíst si dvakrát. Jeho blokování nesáhne na vaše pozice v Googlu a nevyřadí vás z AI Overviews, protože obojí běží na Googlebot. Zabrání jen tomu, aby váš obsah používalo Gemini.
Apple se řídí pravidly pro Googlebota
Pokud váš robots.txt nikde nejmenuje Applebot, ale jmenuje Googlebot, Apple se řídí pravidly pro Googlebota. Zpráva to na daném řádku uvede, když k tomu dojde. Stojí za to to vědět, protože Disallow, který jste napsali s myšlenkou na Google, se potichu vztahuje i na Siri, Spotlight a Safari, a nic ve vašem souboru to neříká nahlas.
User agent je tvrzení, ne identita
Většina provozovatelů v tomto seznamu říká, že robots.txt respektuje, s výjimkami uvedenými výše, a v řetězci User-Agent může kdokoli tvrdit cokoli. Pokud potřebujete jistotu, a ne spolupráci, ověřujte podle rozsahu IP adres nebo reverzního DNS. Velcí provozovatelé své rozsahy zveřejňují.
Proč je robots.txt jen polovina odpovědi
Čtení robots.txt vám řekne, o co jste požádali. Nikdy vám neukáže, co se skutečně stalo.
Ochrana proti botům na CDN, omezovač požadavků, blokace podle země nebo stránka s ověřením mohou AI crawler odmítnout, zatímco váš robots.txt ho dál zve dovnitř. Nic z toho v souboru není napsáno a většinou se nic z toho nedostane ani do vašich logů, protože požadavek je odříznut dřív, než dorazí na váš web.
Ten vzor je snadné rozpoznat, jakmile ho jednou uvidíte. Váš robots.txt povoluje GPTBot, a GPTBot přesto dostane 403. Když se robots.txt a realita neshodují, skutečná je ta 403.
Právě proto může stránka chybět v odpovědích asistenta, zatímco všechny technické kontroly webu proběhnou bez zjištění problémů. Ověřte svou viditelnost v AI a zjistěte, zda asistenti vaši značku skutečně zmiňují.
Co znamená každý výsledek
Tabulka výsledků má dva sloupce a odpovídají na různé otázky, proto je i legenda rozdělená stejně. Číst štítek ze sloupce Živý přístup podle stupnice robots.txt je nejrychlejší způsob, jak celou zprávu pochopit špatně.
Sloupec robots.txt: co povoluje váš soubor
| Výsledek | Co znamená |
|---|---|
| Povoleno | Váš robots.txt tomuto robotu dovoluje procházet testovanou stránku |
| Blokováno | Pravidlo v robots.txt tuto stránku tomuto robotu zavírá. Řádek ukazuje, které pravidlo to způsobilo, a oprava je v souboru |
| Částečně blokováno | Testovaná stránka je pro tohoto robota otevřená, ale robots.txt má pravidla namířená na něj jinde na webu. Řádek ukazuje, která pravidla a z jaké skupiny pocházejí, abyste mohli ověřit, že tyto části webu chcete ponechat zablokované |
Sloupec Živý přístup: co váš server skutečně udělal
| Výsledek | Co znamená |
|---|---|
| Dostupné (se stavem HTTP) | Požadavek robota prošel a váš server odpověděl normálně |
| Blokováno (se stavem HTTP) | Požadavek byl odmítnut. robots.txt není příčina, podívejte se tedy na pravidla firewallu, WAF nebo CDN |
| Ověřit | Robot, který se běžně ověřuje podle IP adresy, byl odmítnut. Náš test nepřichází z vlastního rozsahu IP tohoto robota, takže může jít o správně fungující firewall, ne o problém |
| Chyba (se stavem HTTP) | Stránka vrátila chybu, ne blokaci. 404 obvykle znamená špatnou URL, 500 to, že něco na vašem webu selhává. Ani jedno není problém crawlerů |
| Bez odpovědi | Nevrátilo se vůbec nic. Vypršení časového limitu nebo přerušené spojení, což ukazuje na síť nebo na velmi agresivní blokaci |
| Bez živého dotazu | Direktiva v robots.txt, ne crawler, takže není komu poslat požadavek. Verdikt z robots.txt je celá odpověď |
| Netestováno | Tohoto robota jste nevybrali, takže žádný živý požadavek neproběhl. Jeho verdikt z robots.txt dál platí |
Jak crawler odblokovat
Pravidlo v robots.txt. Odstraňte Disallow, nebo přidejte konkrétnější Allow pro daného user agenta. Vítězí nejkonkrétnější odpovídající pravidlo, takže výslovné Allow pro jednoho robota přebije plošné Disallow: / namířené na všechny.
Pravidlo firewallu nebo CDN. Tohle nic v souborech vašeho webu neopraví. Na Cloudflare to sídlí ve správě botů. U jiných poskytovatelů hledejte pod WAF nebo ochranou proti botům. Povolte tam user agenta a pokud chcete být opatrní vůči podvodníkům, ověřujte podle rozsahu IP.
Stránka s ověřením. Vyjměte user agenta z ověřování. Crawler ho nedokáže vyřešit.
noindex v meta tagu nebo hlavička X-Robots-Tag. Crawler se na stránku dostane a dostal pokyn, aby si ji nenechával. Stojí za to potvrdit, že to bylo záměrné, protože plugin nebo zapomenuté nastavení z testovacího prostředí to dělají potichu.
Stejné kroky fungují i obráceně. Pokud chcete blokovat GPTBot nebo jakýkoli jiný AI crawler, Disallow pro daného user agenta v robots.txt je zdvořilá cesta a pravidlo firewallu je ta, která to skutečně vynutí.
Časté dotazy
Co je dostupnost webu pro AI crawlery?
To, zda se AI crawlery dostanou na vaše stránky a dokážou je přečíst. Zahrnuje robots.txt i všechno ostatní, co stojí mezi robotem a vaším obsahem, a je to první podmínka všeho dalšího. Anglicky se tomu říká AI crawlability a LLM crawlability je stejná myšlenka pod jiným názvem.
Respektují AI crawlery robots.txt?
U crawlerů, které stahují stránky automaticky, velcí provozovatelé říkají, že ano. Agenti, kteří stránku stahují, protože o to požádal člověk, jsou jiný případ, a OpenAI i Perplexity říkají, že robots.txt je zastavit nemusí. Nic z toho nikdo nevynucuje. robots.txt je žádost, ne zámek.
Mohu blokovat trénování AI a přitom zůstat ve výsledcích AI vyhledávání?
Ano, a právě to většina majitelů webů skutečně chce. Zablokujte GPTBot a ClaudeBot, abyste zůstali mimo trénování, a povolte OAI-SearchBot a Claude-SearchBot, aby vás asistenti dál našli a citovali.
Poškodí blokování AI crawlerů moje SEO?
Ne. GPTBot, ClaudeBot a ostatní AI crawlery nemají s pozicemi v Googlu nic společného a jejich blokování vaši pozici ve vyhledávání neovlivní. Blokování robota Googlebot je úplně jiná věc.
Proč můj web projde kontrolou robots.txt, a přesto je blokován?
Protože robots.txt je jen první vrstva. Pravidlo firewallu, WAF nebo CDN může požadavek odmítnout dřív, než dorazí na váš server, a taková blokace není vidět ani v robots.txt, ani ve vašich protokolech.
Je GPTBot to samé jako OAI-SearchBot?
Ne. GPTBot sbírá stránky pro trénování. OAI-SearchBot staví index, na kterém běží vyhledávání v ChatGPT. Jednoho můžete povolit a druhého zablokovat.
Proč ChatGPT necituje můj web ani značku?
Dostupnost je první podmínka, začněte tedy kontrolou, že OAI-SearchBot není blokován. Pokud je přístup v pořádku, důvod obvykle bývá, že ChatGPT najde odpověď jinde a nemá důvod sáhnout po vás.
Jak dosáhnout toho, aby se můj web objevoval v ChatGPT?
Ujistěte se, že vás crawlery dokážou přečíst, a pak pracujte na tom, abyste stáli za citaci. Asistenti se opírají o zdroje, které už viděli citované jinde, takže zmínky na webech, kterým už důvěřují, znamenají víc než cokoli na vašich vlastních stránkách.
Dostupnost je první otázka. Zda vás asistenti skutečně jmenují, je otázka jiná.