Kontroll av AI-crawlers
Se vilka AI-crawlers som kan nå din webbplats, och vilka som stoppas.
| Bot | robots.txt | Crawlbarhet |
|---|
robots.txt som den hämtades
Vad som kontrolleras
Två separata saker avgör om en AI-crawler når din sida, och de fallerar oberoende av varandra.
Den första är robots.txt, den artiga dörrvakten. Den är en begäran snarare än ett lås, och inte alla agenter här respekterar den. Den andra är vad din server gör när förfrågan faktiskt kommer fram. Det är brandväggslagret, och det är där de flesta oavsiktliga blockeringar finns, eftersom nästan ingen sätter dem med avsikt. En regel skriven för att stoppa scrapers kan inte skilja en scraper från PerplexityBot.
Det här verktyget tittar på båda. Det läser din robots.txt och räknar ut vad varje bot får göra, hämtar sedan sidan med den botens riktiga User-Agent och jämför svaret med vad en vanlig webbläsare får. När de två lagren inte stämmer överens får du veta det nu i stället för månader senare, när du märker att ingenting citerar dig.
En sak ska sägas rakt ut. Testet körs från våra servrar med varje bots User-Agent-sträng. Riktiga crawlers kommer från sina egna IP-intervall, så en brandvägg som verifierar IP-adresser kan behandla dem annorlunda. Ser du en blockering här är den verklig. Ett tillåtet resultat är en stark signal snarare än en garanti, och bottar som vanligtvis verifieras via IP är markerade som sådana i resultaten.
AI-crawlerna vi kontrollerar
Alla user agents här gör inte samma jobb. Några samlar in sidor för träning. Några bygger indexet bakom en assistents sök. Andra dyker bara upp när en person ber assistenten öppna en länk. Att blockera den ena är ett annat beslut än att blockera den andra, och resultaten är inte utbytbara.
| User agent | Aktör | Vad den gör | Om du blockerar den |
|---|---|---|---|
GPTBot | OpenAI | Samlar in sidor för modellträning | Ditt innehåll hålls utanför träningen |
OAI-SearchBot | OpenAI | Bygger indexet bakom ChatGPT:s sök | ChatGPT:s sök slutar visa dig |
ChatGPT-User | OpenAI | Hämtar en sida när någon ber ChatGPT öppna den | ChatGPT kan inte läsa en länk som en användare klistrat in |
ClaudeBot | Anthropic | Samlar in sidor för modellträning | Ditt innehåll hålls utanför träningen |
Claude-SearchBot | Anthropic | Indexerar sidor för Claudes sökresultat | Claude slutar citera dig i svar |
Claude-User | Anthropic | Hämtar en sida när någon ber Claude öppna den | Claude kan inte läsa en länk som en användare klistrat in |
PerplexityBot | Perplexity | Indexerar sidor för Perplexitys svar | Perplexity slutar citera dig |
Perplexity-User | Perplexity | Hämtar en sida som svar på en fråga | Perplexity kan inte öppna en sida som en användare frågat om |
Googlebot | Sökindexet, som också matar AI Overviews | Du försvinner från Googles sök | |
Bingbot | Microsoft | Bing-indexet, som matar Copilot | Du försvinner från Bing och från Copilot |
Applebot | Apple | Driver sök i Siri, Spotlight och Safari | Apples assistenter hittar dig inte längre |
Meta-ExternalAgent | Meta | Samlar in sidor för Metas modeller, och indexerar visst innehåll direkt | Ditt innehåll hålls utanför Metas träning |
Meta-WebIndexer | Meta | Indexerar sidor för Meta AI:s sökresultat | Meta AI slutar citera och länka till dig |
DuckAssistBot | DuckDuckGo | Matar DuckDuckGos assistentsvar, och används inte för träning | DuckAssist slutar använda dina sidor |
MistralAI-Training | Mistral | Samlar in sidor för modellträning | Ditt innehåll hålls utanför Mistrals träning |
MistralAI-Index | Mistral | Indexerar sidor för söket bakom Mistrals assistent | Mistrals assistent slutar visa dig |
MistralAI-User | Mistral | Hämtar en sida när någon ber Mistrals assistent öppna den | Assistenten kan inte läsa en länk som en användare klistrat in |
CCBot | Common Crawl | Bygger det öppna crawlarkivet som många modeller tränas på | Du saknas i en datamängd som används i hela branschen |
Google-Extended | Ett robots.txt-direktiv, inte en crawler. Avgör om Google får använda dina sidor för Gemini | Dina sidor stannar i Googles sök och i AI Overviews, men Google får inte använda dem för att träna Gemini eller ge underlag för dess svar | |
Applebot-Extended | Apple | Ett robots.txt-direktiv, inte en crawler. Avgör om Apple får träna på dina sidor | Siri, Spotlight och Safari fortsätter använda dina sidor, Apple slutar träna sina modeller på dem |
Träning och sök är separata beslut
Att blockera GPTBot och tillåta OAI-SearchBot håller dig utanför träningsdata och kvar i ChatGPT:s sökresultat. Anthropic delar upp ClaudeBot och Claude-SearchBot på samma sätt, Meta delar upp Meta-ExternalAgent och Meta-WebIndexer, och Mistral kör en separat agent för var och en av träning, sök och användarförfrågningar. Många webbplatser råkar blockera allt när allt de ville var att stå utanför träningen.
Agenterna som slutar på User är inte crawlers
ChatGPT-User, Claude-User, Perplexity-User och MistralAI-User aktiveras bara när någon redan klistrat in din länk och bett assistenten läsa den. Att blockera dem skyddar ingenting från träning. Det stoppar ingenting utom personen som försökte läsa din sida.
Om det ens fungerar att blockera dem i robots.txt beror på aktören. Anthropic och Mistral respekterar filen för dessa agenter. OpenAI säger att reglerna kanske inte gäller, eftersom förfrågan kom från en person och inte från en crawl. Perplexity säger att dess hämtare i allmänhet ignorerar dem. En blockering som måste hålla hör hemma i brandväggen.
De två sista är direktiv, inte crawlers
Google-Extended och Applebot-Extended skickar aldrig en förfrågan. De sitter i robots.txt och talar om för Google och Apple vad som får göras med sidor som deras vanliga crawlers redan hämtat. Det finns ingen crawler att simulera, så verktyget bedömer dessa direktiv enbart utifrån robots.txt och markerar dem som utan live-hämtning.
Google-Extended är värd en andra läsning. Att blockera den rör inte din Google-rankning och tar inte bort dig från AI Overviews, eftersom båda körs på Googlebot. Vad den stoppar är att Gemini använder ditt innehåll.
Apple faller tillbaka på Googlebot
Om din robots.txt aldrig nämner Applebot men nämner Googlebot följer Apple Googlebots regler. Rapporten säger det på den raden när det händer. Det är värt att veta, eftersom en Disallow du skrev med Google i åtanke i tysthet gäller Siri, Spotlight och Safari också, och ingenting i din fil säger det högt.
En user agent är ett påstående, inte en identitet
De flesta aktörer här säger att de respekterar robots.txt, med undantagen ovan, och vem som helst kan påstå vad som helst i en User-Agent-sträng. Behöver du säkerhet snarare än samarbete, verifiera via IP-intervall eller omvänd DNS. De stora aktörerna publicerar sina IP-intervall eller uppgifter för verifiering via omvänd DNS.
Varför robots.txt bara är halva svaret
Att läsa robots.txt talar om vad du bad om. Den visar aldrig vad som faktiskt hände.
Botskydd på ett CDN, en hastighetsbegränsare, en landsblockering eller en utmaningssida kan alla avvisa en AI-crawler medan din robots.txt fortfarande bjuder in den. Ingenting av det står i filen, och för det mesta når ingenting av det dina loggar heller, eftersom förfrågan klipps av innan den når din webbplats.
Mönstret är lätt att känna igen när du väl sett det. Din robots.txt tillåter GPTBot, och GPTBot får en 403 ändå. När robots.txt och verkligheten inte stämmer överens är det 403:an som är verklig.
Det är också därför en sida kan saknas i en assistents svar medan alla tekniska kontroller av webbplatsen genomförs utan att upptäcka problem. Kolla din AI-synlighet för att se om assistenterna faktiskt nämner ditt varumärke.
Vad varje resultat betyder
Resultattabellen har två kolumner och de svarar på olika frågor, så förklaringen är uppdelad på samma sätt. Att läsa en etikett för crawlbarhet mot robots.txt-skalan är det snabbaste sättet att missförstå hela rapporten.
Kolumnen robots.txt: vad din fil tillåter
| Resultat | Vad det betyder |
|---|---|
| Tillåten | Din robots.txt låter den här boten crawla sidan du testade |
| Blockerad | En regel i robots.txt stänger den här sidan för den här boten. Raden visar vilken regel som gjorde det, och lösningen finns i filen |
| Delvis blockerad | Sidan du testade är öppen för den här boten, men robots.txt har regler riktade mot den på andra ställen på webbplatsen. Raden visar vilka regler och vilken grupp de kom från, så att du kan kontrollera att du menade att hålla dem stängda |
Kolumnen Crawlbarhet: vad din server faktiskt gjorde
| Resultat | Vad det betyder |
|---|---|
| Crawlbar (med HTTP-statusen) | Botens förfrågan gick igenom och din server svarade normalt |
| Blockerad (med HTTP-statusen) | Förfrågan avvisades. robots.txt är inte orsaken, så titta på reglerna i din brandvägg, WAF eller CDN |
| Kontrollera | En bot som normalt verifieras via IP-adress avvisades. Vårt test kommer inte från den botens eget IP-intervall, så det kan vara din brandvägg som fungerar korrekt snarare än ett problem |
| Fel (med HTTP-statusen) | Sidan returnerade ett fel snarare än en blockering. En 404 betyder oftast att URL:en är fel, en 500 att något på din webbplats fallerar. Inget av dem är ett crawlerproblem |
| Inget svar | Ingenting kom tillbaka alls. En timeout eller en bruten anslutning, vilket pekar på nätverket eller på en mycket aggressiv blockering |
| Ingen live-hämtning | Ett robots.txt-direktiv snarare än en crawler, så det finns ingenting att skicka en förfrågan till. robots.txt-bedömningen är hela svaret |
| Inte testad | Du valde inte den här boten, så ingen live-förfrågan gjordes. Dess robots.txt-bedömning gäller fortfarande |
Så avblockerar du en crawler
En regel i robots.txt. Ta bort Disallow, eller lägg till en mer specifik Allow för den user agenten. Den mest specifika matchande regeln vinner, så en uttrycklig Allow för en bot slår en bred Disallow: / riktad mot alla.
En brandväggs- eller CDN-regel. Ingenting i din webbplats filer löser den här. På Cloudflare ligger den i bot management. Hos andra leverantörer, titta under WAF eller botskydd. Tillåt user agenten där, och verifiera via IP-intervall om du vill vara försiktig med bedragare.
En utmaningssida. Undanta user agenten från utmaningen. En crawler kan inte lösa den.
En noindex i en metatagg eller en X-Robots-Tag-header. Crawlern kan nå sidan och har blivit tillsagd att inte behålla den. Värt att bekräfta att det var avsiktligt, eftersom ett plugin eller en kvarglömd staging-inställning gör det i tysthet.
Samma steg fungerar omvänt. Vill du blockera GPTBot eller någon annan AI-crawler är en Disallow för den user agenten i robots.txt det artiga sättet, och en brandväggsregel det som faktiskt upprätthåller det.
Vanliga frågor
Vad är AI-crawlbarhet?
Om AI-crawlers kan nå och läsa dina sidor. Det omfattar robots.txt och allt annat som ligger mellan en bot och ditt innehåll, och det är det första kravet för allt annat. LLM-crawlbarhet är samma idé under ett annat namn.
Respekterar AI-crawlers robots.txt?
För de crawlers som hämtar sidor automatiskt säger de stora aktörerna ja. De agenter som hämtar en sida för att en person bad om det är ett annat fall, och både OpenAI och Perplexity säger att robots.txt kanske inte stoppar dem. Det finns ingen mekanism som tvingar någon att följa reglerna. robots.txt är en begäran, inte ett lås.
Kan jag blockera AI-träning men ändå synas i AI-sökresultat?
Ja, och det är det alternativ de flesta webbplatsägare faktiskt vill ha. Blockera GPTBot och ClaudeBot för att hålla dig utanför träningen, och tillåt OAI-SearchBot och Claude-SearchBot så att assistenterna fortfarande kan hitta och citera dig.
Skadar det min SEO att blockera AI-crawlers?
Nej. GPTBot, ClaudeBot och de andra AI-crawlerna har ingenting med Googles rankning att göra, och att blockera dem påverkar inte din position i sökresultaten. Att blockera Googlebot är en helt annan sak.
Varför klarar min webbplats robots.txt-kontrollen men blockeras ändå?
För att robots.txt bara är det första lagret. En regel i brandväggen, WAF:en eller CDN:et kan avvisa förfrågan innan den når din server, och den blockeringen är osynlig både i din robots.txt och i dina loggar.
Är GPTBot samma sak som OAI-SearchBot?
Nej. GPTBot samlar in sidor för träning. OAI-SearchBot bygger indexet bakom ChatGPT:s sök. Du kan tillåta den ena och blockera den andra.
Varför citerar ChatGPT inte min webbplats eller mitt varumärke?
Att vara nåbar är det första kravet, så börja med att kontrollera att OAI-SearchBot inte är blockerad. Om åtkomsten är i sin ordning är anledningen oftast att ChatGPT hittar svaret någon annanstans och inte har någon anledning att vända sig till dig.
Hur får jag min webbplats att synas i ChatGPT?
Se till att crawlerna kan läsa dig, och arbeta sedan på att vara värd att citera. Assistenter lutar sig mot källor de redan sett citerade på andra ställen, så omnämnanden på webbplatser de redan litar på väger tyngre än något på dina egna sidor.
Att vara nåbar är den första frågan. Om assistenterna faktiskt nämner dig är en annan.