Kontroll av AI-crawlers

Se vilka AI-crawlers som kan nå din webbplats, och vilka som stoppas.

Bottar att testa live

Det är gratis

Vad som kontrolleras

Två separata saker avgör om en AI-crawler når din sida, och de fallerar oberoende av varandra.

Den första är robots.txt, den artiga dörrvakten. Den är en begäran snarare än ett lås, och inte alla agenter här respekterar den. Den andra är vad din server gör när förfrågan faktiskt kommer fram. Det är brandväggslagret, och det är där de flesta oavsiktliga blockeringar finns, eftersom nästan ingen sätter dem med avsikt. En regel skriven för att stoppa scrapers kan inte skilja en scraper från PerplexityBot.

Det här verktyget tittar på båda. Det läser din robots.txt och räknar ut vad varje bot får göra, hämtar sedan sidan med den botens riktiga User-Agent och jämför svaret med vad en vanlig webbläsare får. När de två lagren inte stämmer överens får du veta det nu i stället för månader senare, när du märker att ingenting citerar dig.

En sak ska sägas rakt ut. Testet körs från våra servrar med varje bots User-Agent-sträng. Riktiga crawlers kommer från sina egna IP-intervall, så en brandvägg som verifierar IP-adresser kan behandla dem annorlunda. Ser du en blockering här är den verklig. Ett tillåtet resultat är en stark signal snarare än en garanti, och bottar som vanligtvis verifieras via IP är markerade som sådana i resultaten.

AI-crawlerna vi kontrollerar

Alla user agents här gör inte samma jobb. Några samlar in sidor för träning. Några bygger indexet bakom en assistents sök. Andra dyker bara upp när en person ber assistenten öppna en länk. Att blockera den ena är ett annat beslut än att blockera den andra, och resultaten är inte utbytbara.

User agentAktörVad den görOm du blockerar den
GPTBotOpenAISamlar in sidor för modellträningDitt innehåll hålls utanför träningen
OAI-SearchBotOpenAIBygger indexet bakom ChatGPT:s sökChatGPT:s sök slutar visa dig
ChatGPT-UserOpenAIHämtar en sida när någon ber ChatGPT öppna denChatGPT kan inte läsa en länk som en användare klistrat in
ClaudeBotAnthropicSamlar in sidor för modellträningDitt innehåll hålls utanför träningen
Claude-SearchBotAnthropicIndexerar sidor för Claudes sökresultatClaude slutar citera dig i svar
Claude-UserAnthropicHämtar en sida när någon ber Claude öppna denClaude kan inte läsa en länk som en användare klistrat in
PerplexityBotPerplexityIndexerar sidor för Perplexitys svarPerplexity slutar citera dig
Perplexity-UserPerplexityHämtar en sida som svar på en frågaPerplexity kan inte öppna en sida som en användare frågat om
GooglebotGoogleSökindexet, som också matar AI OverviewsDu försvinner från Googles sök
BingbotMicrosoftBing-indexet, som matar CopilotDu försvinner från Bing och från Copilot
ApplebotAppleDriver sök i Siri, Spotlight och SafariApples assistenter hittar dig inte längre
Meta-ExternalAgentMetaSamlar in sidor för Metas modeller, och indexerar visst innehåll direktDitt innehåll hålls utanför Metas träning
Meta-WebIndexerMetaIndexerar sidor för Meta AI:s sökresultatMeta AI slutar citera och länka till dig
DuckAssistBotDuckDuckGoMatar DuckDuckGos assistentsvar, och används inte för träningDuckAssist slutar använda dina sidor
MistralAI-TrainingMistralSamlar in sidor för modellträningDitt innehåll hålls utanför Mistrals träning
MistralAI-IndexMistralIndexerar sidor för söket bakom Mistrals assistentMistrals assistent slutar visa dig
MistralAI-UserMistralHämtar en sida när någon ber Mistrals assistent öppna denAssistenten kan inte läsa en länk som en användare klistrat in
CCBotCommon CrawlBygger det öppna crawlarkivet som många modeller tränas påDu saknas i en datamängd som används i hela branschen
Google-ExtendedGoogleEtt robots.txt-direktiv, inte en crawler. Avgör om Google får använda dina sidor för GeminiDina sidor stannar i Googles sök och i AI Overviews, men Google får inte använda dem för att träna Gemini eller ge underlag för dess svar
Applebot-ExtendedAppleEtt robots.txt-direktiv, inte en crawler. Avgör om Apple får träna på dina sidorSiri, Spotlight och Safari fortsätter använda dina sidor, Apple slutar träna sina modeller på dem

Träning och sök är separata beslut

Att blockera GPTBot och tillåta OAI-SearchBot håller dig utanför träningsdata och kvar i ChatGPT:s sökresultat. Anthropic delar upp ClaudeBot och Claude-SearchBot på samma sätt, Meta delar upp Meta-ExternalAgent och Meta-WebIndexer, och Mistral kör en separat agent för var och en av träning, sök och användarförfrågningar. Många webbplatser råkar blockera allt när allt de ville var att stå utanför träningen.

Agenterna som slutar på User är inte crawlers

ChatGPT-User, Claude-User, Perplexity-User och MistralAI-User aktiveras bara när någon redan klistrat in din länk och bett assistenten läsa den. Att blockera dem skyddar ingenting från träning. Det stoppar ingenting utom personen som försökte läsa din sida.

Om det ens fungerar att blockera dem i robots.txt beror på aktören. Anthropic och Mistral respekterar filen för dessa agenter. OpenAI säger att reglerna kanske inte gäller, eftersom förfrågan kom från en person och inte från en crawl. Perplexity säger att dess hämtare i allmänhet ignorerar dem. En blockering som måste hålla hör hemma i brandväggen.

De två sista är direktiv, inte crawlers

Google-Extended och Applebot-Extended skickar aldrig en förfrågan. De sitter i robots.txt och talar om för Google och Apple vad som får göras med sidor som deras vanliga crawlers redan hämtat. Det finns ingen crawler att simulera, så verktyget bedömer dessa direktiv enbart utifrån robots.txt och markerar dem som utan live-hämtning.

Google-Extended är värd en andra läsning. Att blockera den rör inte din Google-rankning och tar inte bort dig från AI Overviews, eftersom båda körs på Googlebot. Vad den stoppar är att Gemini använder ditt innehåll.

Apple faller tillbaka på Googlebot

Om din robots.txt aldrig nämner Applebot men nämner Googlebot följer Apple Googlebots regler. Rapporten säger det på den raden när det händer. Det är värt att veta, eftersom en Disallow du skrev med Google i åtanke i tysthet gäller Siri, Spotlight och Safari också, och ingenting i din fil säger det högt.

En user agent är ett påstående, inte en identitet

De flesta aktörer här säger att de respekterar robots.txt, med undantagen ovan, och vem som helst kan påstå vad som helst i en User-Agent-sträng. Behöver du säkerhet snarare än samarbete, verifiera via IP-intervall eller omvänd DNS. De stora aktörerna publicerar sina IP-intervall eller uppgifter för verifiering via omvänd DNS.

Varför robots.txt bara är halva svaret

Att läsa robots.txt talar om vad du bad om. Den visar aldrig vad som faktiskt hände.

Botskydd på ett CDN, en hastighetsbegränsare, en landsblockering eller en utmaningssida kan alla avvisa en AI-crawler medan din robots.txt fortfarande bjuder in den. Ingenting av det står i filen, och för det mesta når ingenting av det dina loggar heller, eftersom förfrågan klipps av innan den når din webbplats.

Mönstret är lätt att känna igen när du väl sett det. Din robots.txt tillåter GPTBot, och GPTBot får en 403 ändå. När robots.txt och verkligheten inte stämmer överens är det 403:an som är verklig.

Det är också därför en sida kan saknas i en assistents svar medan alla tekniska kontroller av webbplatsen genomförs utan att upptäcka problem. Kolla din AI-synlighet för att se om assistenterna faktiskt nämner ditt varumärke.

Vad varje resultat betyder

Resultattabellen har två kolumner och de svarar på olika frågor, så förklaringen är uppdelad på samma sätt. Att läsa en etikett för crawlbarhet mot robots.txt-skalan är det snabbaste sättet att missförstå hela rapporten.

Kolumnen robots.txt: vad din fil tillåter

ResultatVad det betyder
TillåtenDin robots.txt låter den här boten crawla sidan du testade
BlockeradEn regel i robots.txt stänger den här sidan för den här boten. Raden visar vilken regel som gjorde det, och lösningen finns i filen
Delvis blockeradSidan du testade är öppen för den här boten, men robots.txt har regler riktade mot den på andra ställen på webbplatsen. Raden visar vilka regler och vilken grupp de kom från, så att du kan kontrollera att du menade att hålla dem stängda

Kolumnen Crawlbarhet: vad din server faktiskt gjorde

ResultatVad det betyder
Crawlbar (med HTTP-statusen)Botens förfrågan gick igenom och din server svarade normalt
Blockerad (med HTTP-statusen)Förfrågan avvisades. robots.txt är inte orsaken, så titta på reglerna i din brandvägg, WAF eller CDN
KontrolleraEn bot som normalt verifieras via IP-adress avvisades. Vårt test kommer inte från den botens eget IP-intervall, så det kan vara din brandvägg som fungerar korrekt snarare än ett problem
Fel (med HTTP-statusen)Sidan returnerade ett fel snarare än en blockering. En 404 betyder oftast att URL:en är fel, en 500 att något på din webbplats fallerar. Inget av dem är ett crawlerproblem
Inget svarIngenting kom tillbaka alls. En timeout eller en bruten anslutning, vilket pekar på nätverket eller på en mycket aggressiv blockering
Ingen live-hämtningEtt robots.txt-direktiv snarare än en crawler, så det finns ingenting att skicka en förfrågan till. robots.txt-bedömningen är hela svaret
Inte testadDu valde inte den här boten, så ingen live-förfrågan gjordes. Dess robots.txt-bedömning gäller fortfarande

Så avblockerar du en crawler

En regel i robots.txt. Ta bort Disallow, eller lägg till en mer specifik Allow för den user agenten. Den mest specifika matchande regeln vinner, så en uttrycklig Allow för en bot slår en bred Disallow: / riktad mot alla.

En brandväggs- eller CDN-regel. Ingenting i din webbplats filer löser den här. På Cloudflare ligger den i bot management. Hos andra leverantörer, titta under WAF eller botskydd. Tillåt user agenten där, och verifiera via IP-intervall om du vill vara försiktig med bedragare.

En utmaningssida. Undanta user agenten från utmaningen. En crawler kan inte lösa den.

En noindex i en metatagg eller en X-Robots-Tag-header. Crawlern kan nå sidan och har blivit tillsagd att inte behålla den. Värt att bekräfta att det var avsiktligt, eftersom ett plugin eller en kvarglömd staging-inställning gör det i tysthet.

Samma steg fungerar omvänt. Vill du blockera GPTBot eller någon annan AI-crawler är en Disallow för den user agenten i robots.txt det artiga sättet, och en brandväggsregel det som faktiskt upprätthåller det.

Vanliga frågor

Vad är AI-crawlbarhet?

Om AI-crawlers kan nå och läsa dina sidor. Det omfattar robots.txt och allt annat som ligger mellan en bot och ditt innehåll, och det är det första kravet för allt annat. LLM-crawlbarhet är samma idé under ett annat namn.

Respekterar AI-crawlers robots.txt?

För de crawlers som hämtar sidor automatiskt säger de stora aktörerna ja. De agenter som hämtar en sida för att en person bad om det är ett annat fall, och både OpenAI och Perplexity säger att robots.txt kanske inte stoppar dem. Det finns ingen mekanism som tvingar någon att följa reglerna. robots.txt är en begäran, inte ett lås.

Kan jag blockera AI-träning men ändå synas i AI-sökresultat?

Ja, och det är det alternativ de flesta webbplatsägare faktiskt vill ha. Blockera GPTBot och ClaudeBot för att hålla dig utanför träningen, och tillåt OAI-SearchBot och Claude-SearchBot så att assistenterna fortfarande kan hitta och citera dig.

Skadar det min SEO att blockera AI-crawlers?

Nej. GPTBot, ClaudeBot och de andra AI-crawlerna har ingenting med Googles rankning att göra, och att blockera dem påverkar inte din position i sökresultaten. Att blockera Googlebot är en helt annan sak.

Varför klarar min webbplats robots.txt-kontrollen men blockeras ändå?

För att robots.txt bara är det första lagret. En regel i brandväggen, WAF:en eller CDN:et kan avvisa förfrågan innan den når din server, och den blockeringen är osynlig både i din robots.txt och i dina loggar.

Är GPTBot samma sak som OAI-SearchBot?

Nej. GPTBot samlar in sidor för träning. OAI-SearchBot bygger indexet bakom ChatGPT:s sök. Du kan tillåta den ena och blockera den andra.

Varför citerar ChatGPT inte min webbplats eller mitt varumärke?

Att vara nåbar är det första kravet, så börja med att kontrollera att OAI-SearchBot inte är blockerad. Om åtkomsten är i sin ordning är anledningen oftast att ChatGPT hittar svaret någon annanstans och inte har någon anledning att vända sig till dig.

Hur får jag min webbplats att synas i ChatGPT?

Se till att crawlerna kan läsa dig, och arbeta sedan på att vara värd att citera. Assistenter lutar sig mot källor de redan sett citerade på andra ställen, så omnämnanden på webbplatser de redan litar på väger tyngre än något på dina egna sidor.

Att vara nåbar är den första frågan. Om assistenterna faktiskt nämner dig är en annan.

Kolla din AI-synlighet