Tjek af AI-crawlere

Se hvilke AI-crawlere der kan nå dit website, og hvilke der bliver afvist.

Bots der testes live

Det er gratis

Hvad der bliver tjekket

To adskilte ting afgør, om en AI-crawler når din side, og de fejler uafhængigt af hinanden.

Den første er robots.txt, den høflige dørmand. Den er en anmodning snarere end en lås, og ikke alle agenter her respekterer den. Den anden er, hvad din server gør, når forespørgslen faktisk ankommer. Det er firewall-laget, og det er der, de fleste utilsigtede blokeringer findes, fordi næsten ingen sætter dem med vilje. En regel skrevet for at stoppe scrapere kan ikke kende forskel på en scraper og PerplexityBot.

Dette værktøj kigger på begge dele. Det læser din robots.txt og regner ud, hvad hver bot må, henter derefter siden med den bots rigtige User-Agent og sammenligner svaret med det, en almindelig browser får. Når de to lag ikke stemmer overens, finder du ud af det nu i stedet for måneder senere, når du opdager, at intet citerer dig.

Én ting skal siges ligeud. Testen kører fra vores servere med hver bots User-Agent-streng. Rigtige crawlere kommer fra deres egne IP-områder, så en firewall, der verificerer IP-adresser, kan behandle dem anderledes. Ser du en blokering her, er den ægte. Et tilladt resultat er et stærkt signal snarere end en garanti, og bots, der normalt verificeres via IP, er markeret som sådan i resultaterne.

De AI-crawlere vi tjekker

Ikke alle user agents her laver det samme arbejde. Nogle indsamler sider til træning. Nogle bygger indekset bag en assistents søgning. Andre dukker kun op, når en person beder assistenten om at åbne et link. At blokere den ene er en anden beslutning end at blokere den anden, og resultaterne kan ikke byttes om.

User agentUdbyderHvad den gørHvis du blokerer den
GPTBotOpenAIIndsamler sider til modeltræningDit indhold holdes ude af træningen
OAI-SearchBotOpenAIBygger indekset bag ChatGPT-søgningChatGPT-søgning holder op med at vise dig
ChatGPT-UserOpenAIHenter en side, når nogen beder ChatGPT om at åbne denChatGPT kan ikke læse et link, en bruger har indsat
ClaudeBotAnthropicIndsamler sider til modeltræningDit indhold holdes ude af træningen
Claude-SearchBotAnthropicIndekserer sider til Claudes søgeresultaterClaude holder op med at citere dig i svar
Claude-UserAnthropicHenter en side, når nogen beder Claude om at åbne denClaude kan ikke læse et link, en bruger har indsat
PerplexityBotPerplexityIndekserer sider til Perplexitys svarPerplexity holder op med at citere dig
Perplexity-UserPerplexityHenter en side som svar på et spørgsmålPerplexity kan ikke åbne en side, en bruger har spurgt til
GooglebotGoogleSøgeindekset, som også fodrer AI OverviewsDu forsvinder fra Google-søgning
BingbotMicrosoftBing-indekset, som fodrer CopilotDu forsvinder fra Bing og fra Copilot
ApplebotAppleDriver søgning i Siri, Spotlight og SafariApples assistenter finder dig ikke længere
Meta-ExternalAgentMetaIndsamler sider til Metas modeller og indekserer noget indhold direkteDit indhold holdes ude af Metas træning
Meta-WebIndexerMetaIndekserer sider til Meta AI's søgeresultaterMeta AI holder op med at citere og linke til dig
DuckAssistBotDuckDuckGoFodrer DuckDuckGos assistentsvar og bruges ikke til træningDuckAssist holder op med at bruge dine sider
MistralAI-TrainingMistralIndsamler sider til modeltræningDit indhold holdes ude af Mistrals træning
MistralAI-IndexMistralIndekserer sider til søgningen bag Mistrals assistentMistrals assistent holder op med at vise dig
MistralAI-UserMistralHenter en side, når nogen beder Mistrals assistent om at åbne denAssistenten kan ikke læse et link, en bruger har indsat
CCBotCommon CrawlBygger det åbne crawl-arkiv, som mange modeller trænes påDu mangler i et datasæt, der bruges i hele branchen
Google-ExtendedGoogleEt robots.txt-direktiv, ikke en crawler. Afgør, om Google må bruge dine sider til GeminiDine sider bliver i Google-søgning og i AI Overviews, men Google må ikke bruge dem til at træne eller understøtte Gemini
Applebot-ExtendedAppleEt robots.txt-direktiv, ikke en crawler. Afgør, om Apple må træne på dine siderSiri, Spotlight og Safari bruger fortsat dine sider, Apple holder op med at træne sine modeller på dem

Træning og søgning er separate beslutninger

At blokere GPTBot og tillade OAI-SearchBot holder dig ude af træningsdata og inde i ChatGPT's søgeresultater. Anthropic deler ClaudeBot og Claude-SearchBot op på samme måde, Meta deler Meta-ExternalAgent og Meta-WebIndexer, og Mistral kører en separat agent til hver af træning, søgning og brugerforespørgsler. Masser af websites ender med at blokere alt ved et uheld, når det eneste, de ville, var at melde sig ud af træningen.

Agenterne, der ender på User, er ikke crawlere

ChatGPT-User, Claude-User, Perplexity-User og MistralAI-User går kun i gang, når nogen allerede har indsat dit link og bedt assistenten om at læse det. At blokere dem beskytter intet mod træning. Det stopper intet undtagen den person, der forsøgte at læse din side.

Om det overhovedet virker at blokere dem i robots.txt, afhænger af udbyderen. Anthropic og Mistral respekterer filen for disse agenter. OpenAI siger, at reglerne måske ikke gælder, fordi forespørgslen kom fra en person og ikke fra et crawl. Perplexity siger, at dens værktøj til at hente sider generelt ignorerer dem. En blokering, der skal holde, hører hjemme i firewallen.

De to sidste er direktiver, ikke crawlere

Google-Extended og Applebot-Extended sender aldrig en forespørgsel. De sidder i robots.txt og fortæller Google og Apple, hvad der må gøres med sider, deres almindelige crawlere allerede har hentet. Der er ingen crawler at simulere, så værktøjet vurderer disse direktiver alene ud fra robots.txt og markerer dem som uden live-hentning.

Google-Extended er værd at læse to gange. At blokere den rører ikke din Google-rangering og fjerner dig ikke fra AI Overviews, fordi begge kører på Googlebot. Det, den stopper, er, at Gemini bruger dit indhold.

Apple falder tilbage på Googlebot

Hvis din robots.txt aldrig nævner Applebot, men nævner Googlebot, følger Apple Googlebots regler. Rapporten siger det på den række, når det sker. Det er værd at vide, fordi et Disallow, du skrev med Google i tankerne, i stilhed også gælder Siri, Spotlight og Safari, og intet i din fil siger det højt.

En user agent er en påstand, ikke en identitet

De fleste udbydere her siger, at de respekterer robots.txt, med undtagelserne ovenfor, og hvem som helst kan påstå hvad som helst i en User-Agent-streng. Har du brug for sikkerhed snarere end samarbejde, så verificer via IP-område eller omvendt DNS. De store udbydere offentliggør deres IP-områder eller oplysninger til verificering via omvendt DNS.

Hvorfor robots.txt kun er halvdelen af svaret

At læse robots.txt fortæller dig, hvad du bad om. Den viser dig aldrig, hvad der faktisk skete.

Botbeskyttelse på et CDN, en hastighedsbegrænser, en landeblokering eller en udfordringsside kan alle afvise en AI-crawler, mens din robots.txt stadig byder den indenfor. Intet af det står i filen, og det meste af tiden når intet af det heller dine logs, fordi forespørgslen bliver afskåret, før den når dit website.

Mønsteret er let at genkende, når du først har set det. Din robots.txt tillader GPTBot, og GPTBot får alligevel en 403. Når robots.txt og virkeligheden ikke stemmer overens, er det 403'eren, der er ægte.

Det er også derfor, en side kan mangle i en assistents svar, mens alle tekniske tjek af websitet gennemføres uden at finde problemer. Tjek din AI-synlighed for at se, om assistenterne faktisk nævner dit brand.

Hvad hvert resultat betyder

Resultattabellen har to kolonner, og de svarer på forskellige spørgsmål, så forklaringen er delt op på samme måde. At læse en etiket for crawlbarhed ud fra robots.txt-skalaen er den hurtigste måde at misforstå hele rapporten.

Kolonnen robots.txt: hvad din fil tillader

ResultatHvad det betyder
TilladtDin robots.txt lader denne bot crawle den side, du testede
BlokeretEn regel i robots.txt lukker denne side for denne bot. Rækken viser, hvilken regel der gjorde det, og løsningen ligger i filen
Delvist blokeretDen side, du testede, er åben for denne bot, men robots.txt har regler rettet mod den andre steder på websitet. Rækken viser hvilke regler, og hvilken gruppe de kom fra, så du kan tjekke, at du mente at holde dem lukkede

Kolonnen Crawlbarhed: hvad din server faktisk gjorde

ResultatHvad det betyder
Crawlbar (med HTTP-statussen)Bottens forespørgsel gik igennem, og din server svarede normalt
Blokeret (med HTTP-statussen)Forespørgslen blev afvist. robots.txt er ikke årsagen, så kig på reglerne i din firewall, WAF eller CDN
Tjek nærmereEn bot, der normalt verificeres via IP-adresse, blev afvist. Vores test kommer ikke fra den bots eget IP-område, så det kan være din firewall, der virker korrekt, snarere end et problem
Fejl (med HTTP-statussen)Siden returnerede en fejl snarere end en blokering. En 404 betyder som regel, at URL'en er forkert, en 500, at noget på dit website fejler. Ingen af dem er et crawler-problem
Intet svarDer kom slet intet tilbage. En timeout eller en afbrudt forbindelse, hvilket peger på netværket eller på en meget aggressiv blokering
Ingen live-hentningEt robots.txt-direktiv snarere end en crawler, så der er intet at sende en forespørgsel til. robots.txt-dommen er hele svaret
Ikke testetDu valgte ikke denne bot, så der blev ikke sendt nogen live-forespørgsel. Dens robots.txt-dom gælder stadig

Sådan fjerner du blokeringen af en crawler

En regel i robots.txt. Fjern Disallow, eller tilføj et mere specifikt Allow for den user agent. Den mest specifikke matchende regel vinder, så et udtrykkeligt Allow for én bot slår et bredt Disallow: / rettet mod alle.

En firewall- eller CDN-regel. Intet i dit websites filer løser den her. På Cloudflare ligger den i bot management. Hos andre udbydere skal du kigge under WAF eller botbeskyttelse. Tillad user agenten der, og verificer via IP-område, hvis du vil være forsigtig med bedragere.

En udfordringsside. Undtag user agenten fra udfordringen. En crawler kan ikke løse den.

Et noindex i et metatag eller en X-Robots-Tag-header. Crawleren kan nå siden og har fået besked på ikke at beholde den. Det er værd at bekræfte, at det var med vilje, fordi et plugin eller en glemt staging-indstilling gør det i stilhed.

De samme trin virker omvendt. Vil du blokere GPTBot eller en anden AI-crawler, er et Disallow for den user agent i robots.txt den høflige måde, og en firewall-regel den, der faktisk håndhæver det.

Ofte stillede spørgsmål

Hvad er AI-crawlbarhed?

Om AI-crawlere kan nå og læse dine sider. Det dækker robots.txt og alt andet, der ligger mellem en bot og dit indhold, og det er den første forudsætning for alt andet. LLM-crawlbarhed er den samme idé under et andet navn.

Respekterer AI-crawlere robots.txt?

For de crawlere, der henter sider automatisk, siger de store udbydere ja. De agenter, der henter en side, fordi en person bad om det, er et andet tilfælde, og både OpenAI og Perplexity siger, at robots.txt måske ikke stopper dem. Ingen mekanisme håndhæver disse regler. robots.txt er en anmodning, ikke en lås.

Kan jeg blokere AI-træning og stadig være med i AI-søgeresultater?

Ja, og det er den mulighed, de fleste websiteejere faktisk vil have. Bloker GPTBot og ClaudeBot for at holde dig ude af træningen, og tillad OAI-SearchBot og Claude-SearchBot, så assistenterne stadig kan finde og citere dig.

Skader det min SEO at blokere AI-crawlere?

Nej. GPTBot, ClaudeBot og de andre AI-crawlere har intet med Googles rangering at gøre, og at blokere dem påvirker ikke din placering i søgeresultaterne. At blokere Googlebot er en helt anden sag.

Hvorfor består mit website robots.txt-tjekket og bliver alligevel blokeret?

Fordi robots.txt kun er det første lag. En regel i firewallen, WAF'en eller CDN'et kan afvise forespørgslen, før den når din server, og den blokering er usynlig både i din robots.txt og i dine logs.

Er GPTBot det samme som OAI-SearchBot?

Nej. GPTBot indsamler sider til træning. OAI-SearchBot bygger indekset bag ChatGPT-søgning. Du kan tillade den ene og blokere den anden.

Hvorfor citerer ChatGPT ikke mit website eller mit brand?

At kunne nås er den første forudsætning, så start med at tjekke, at OAI-SearchBot ikke er blokeret. Hvis adgangen er i orden, er grunden som regel, at ChatGPT finder svaret et andet sted og ikke har nogen grund til at bruge dig.

Hvordan får jeg mit website til at dukke op i ChatGPT?

Sørg for, at crawlerne kan læse dig, og arbejd derefter på at være værd at citere. Assistenter støtter sig til kilder, de allerede har set citeret andre steder, så omtaler på websites, de allerede har tillid til, betyder mere end noget på dine egne sider.

At kunne nås er det første spørgsmål. Om assistenterne faktisk nævner dig, er et andet.

Tjek din AI-synlighed