Tjek af AI-crawlere
Se hvilke AI-crawlere der kan nå dit website, og hvilke der bliver afvist.
| Bot | robots.txt | Crawlbarhed |
|---|
robots.txt som den blev hentet
Hvad der bliver tjekket
To adskilte ting afgør, om en AI-crawler når din side, og de fejler uafhængigt af hinanden.
Den første er robots.txt, den høflige dørmand. Den er en anmodning snarere end en lås, og ikke alle agenter her respekterer den. Den anden er, hvad din server gør, når forespørgslen faktisk ankommer. Det er firewall-laget, og det er der, de fleste utilsigtede blokeringer findes, fordi næsten ingen sætter dem med vilje. En regel skrevet for at stoppe scrapere kan ikke kende forskel på en scraper og PerplexityBot.
Dette værktøj kigger på begge dele. Det læser din robots.txt og regner ud, hvad hver bot må, henter derefter siden med den bots rigtige User-Agent og sammenligner svaret med det, en almindelig browser får. Når de to lag ikke stemmer overens, finder du ud af det nu i stedet for måneder senere, når du opdager, at intet citerer dig.
Én ting skal siges ligeud. Testen kører fra vores servere med hver bots User-Agent-streng. Rigtige crawlere kommer fra deres egne IP-områder, så en firewall, der verificerer IP-adresser, kan behandle dem anderledes. Ser du en blokering her, er den ægte. Et tilladt resultat er et stærkt signal snarere end en garanti, og bots, der normalt verificeres via IP, er markeret som sådan i resultaterne.
De AI-crawlere vi tjekker
Ikke alle user agents her laver det samme arbejde. Nogle indsamler sider til træning. Nogle bygger indekset bag en assistents søgning. Andre dukker kun op, når en person beder assistenten om at åbne et link. At blokere den ene er en anden beslutning end at blokere den anden, og resultaterne kan ikke byttes om.
| User agent | Udbyder | Hvad den gør | Hvis du blokerer den |
|---|---|---|---|
GPTBot | OpenAI | Indsamler sider til modeltræning | Dit indhold holdes ude af træningen |
OAI-SearchBot | OpenAI | Bygger indekset bag ChatGPT-søgning | ChatGPT-søgning holder op med at vise dig |
ChatGPT-User | OpenAI | Henter en side, når nogen beder ChatGPT om at åbne den | ChatGPT kan ikke læse et link, en bruger har indsat |
ClaudeBot | Anthropic | Indsamler sider til modeltræning | Dit indhold holdes ude af træningen |
Claude-SearchBot | Anthropic | Indekserer sider til Claudes søgeresultater | Claude holder op med at citere dig i svar |
Claude-User | Anthropic | Henter en side, når nogen beder Claude om at åbne den | Claude kan ikke læse et link, en bruger har indsat |
PerplexityBot | Perplexity | Indekserer sider til Perplexitys svar | Perplexity holder op med at citere dig |
Perplexity-User | Perplexity | Henter en side som svar på et spørgsmål | Perplexity kan ikke åbne en side, en bruger har spurgt til |
Googlebot | Søgeindekset, som også fodrer AI Overviews | Du forsvinder fra Google-søgning | |
Bingbot | Microsoft | Bing-indekset, som fodrer Copilot | Du forsvinder fra Bing og fra Copilot |
Applebot | Apple | Driver søgning i Siri, Spotlight og Safari | Apples assistenter finder dig ikke længere |
Meta-ExternalAgent | Meta | Indsamler sider til Metas modeller og indekserer noget indhold direkte | Dit indhold holdes ude af Metas træning |
Meta-WebIndexer | Meta | Indekserer sider til Meta AI's søgeresultater | Meta AI holder op med at citere og linke til dig |
DuckAssistBot | DuckDuckGo | Fodrer DuckDuckGos assistentsvar og bruges ikke til træning | DuckAssist holder op med at bruge dine sider |
MistralAI-Training | Mistral | Indsamler sider til modeltræning | Dit indhold holdes ude af Mistrals træning |
MistralAI-Index | Mistral | Indekserer sider til søgningen bag Mistrals assistent | Mistrals assistent holder op med at vise dig |
MistralAI-User | Mistral | Henter en side, når nogen beder Mistrals assistent om at åbne den | Assistenten kan ikke læse et link, en bruger har indsat |
CCBot | Common Crawl | Bygger det åbne crawl-arkiv, som mange modeller trænes på | Du mangler i et datasæt, der bruges i hele branchen |
Google-Extended | Et robots.txt-direktiv, ikke en crawler. Afgør, om Google må bruge dine sider til Gemini | Dine sider bliver i Google-søgning og i AI Overviews, men Google må ikke bruge dem til at træne eller understøtte Gemini | |
Applebot-Extended | Apple | Et robots.txt-direktiv, ikke en crawler. Afgør, om Apple må træne på dine sider | Siri, Spotlight og Safari bruger fortsat dine sider, Apple holder op med at træne sine modeller på dem |
Træning og søgning er separate beslutninger
At blokere GPTBot og tillade OAI-SearchBot holder dig ude af træningsdata og inde i ChatGPT's søgeresultater. Anthropic deler ClaudeBot og Claude-SearchBot op på samme måde, Meta deler Meta-ExternalAgent og Meta-WebIndexer, og Mistral kører en separat agent til hver af træning, søgning og brugerforespørgsler. Masser af websites ender med at blokere alt ved et uheld, når det eneste, de ville, var at melde sig ud af træningen.
Agenterne, der ender på User, er ikke crawlere
ChatGPT-User, Claude-User, Perplexity-User og MistralAI-User går kun i gang, når nogen allerede har indsat dit link og bedt assistenten om at læse det. At blokere dem beskytter intet mod træning. Det stopper intet undtagen den person, der forsøgte at læse din side.
Om det overhovedet virker at blokere dem i robots.txt, afhænger af udbyderen. Anthropic og Mistral respekterer filen for disse agenter. OpenAI siger, at reglerne måske ikke gælder, fordi forespørgslen kom fra en person og ikke fra et crawl. Perplexity siger, at dens værktøj til at hente sider generelt ignorerer dem. En blokering, der skal holde, hører hjemme i firewallen.
De to sidste er direktiver, ikke crawlere
Google-Extended og Applebot-Extended sender aldrig en forespørgsel. De sidder i robots.txt og fortæller Google og Apple, hvad der må gøres med sider, deres almindelige crawlere allerede har hentet. Der er ingen crawler at simulere, så værktøjet vurderer disse direktiver alene ud fra robots.txt og markerer dem som uden live-hentning.
Google-Extended er værd at læse to gange. At blokere den rører ikke din Google-rangering og fjerner dig ikke fra AI Overviews, fordi begge kører på Googlebot. Det, den stopper, er, at Gemini bruger dit indhold.
Apple falder tilbage på Googlebot
Hvis din robots.txt aldrig nævner Applebot, men nævner Googlebot, følger Apple Googlebots regler. Rapporten siger det på den række, når det sker. Det er værd at vide, fordi et Disallow, du skrev med Google i tankerne, i stilhed også gælder Siri, Spotlight og Safari, og intet i din fil siger det højt.
En user agent er en påstand, ikke en identitet
De fleste udbydere her siger, at de respekterer robots.txt, med undtagelserne ovenfor, og hvem som helst kan påstå hvad som helst i en User-Agent-streng. Har du brug for sikkerhed snarere end samarbejde, så verificer via IP-område eller omvendt DNS. De store udbydere offentliggør deres IP-områder eller oplysninger til verificering via omvendt DNS.
Hvorfor robots.txt kun er halvdelen af svaret
At læse robots.txt fortæller dig, hvad du bad om. Den viser dig aldrig, hvad der faktisk skete.
Botbeskyttelse på et CDN, en hastighedsbegrænser, en landeblokering eller en udfordringsside kan alle afvise en AI-crawler, mens din robots.txt stadig byder den indenfor. Intet af det står i filen, og det meste af tiden når intet af det heller dine logs, fordi forespørgslen bliver afskåret, før den når dit website.
Mønsteret er let at genkende, når du først har set det. Din robots.txt tillader GPTBot, og GPTBot får alligevel en 403. Når robots.txt og virkeligheden ikke stemmer overens, er det 403'eren, der er ægte.
Det er også derfor, en side kan mangle i en assistents svar, mens alle tekniske tjek af websitet gennemføres uden at finde problemer. Tjek din AI-synlighed for at se, om assistenterne faktisk nævner dit brand.
Hvad hvert resultat betyder
Resultattabellen har to kolonner, og de svarer på forskellige spørgsmål, så forklaringen er delt op på samme måde. At læse en etiket for crawlbarhed ud fra robots.txt-skalaen er den hurtigste måde at misforstå hele rapporten.
Kolonnen robots.txt: hvad din fil tillader
| Resultat | Hvad det betyder |
|---|---|
| Tilladt | Din robots.txt lader denne bot crawle den side, du testede |
| Blokeret | En regel i robots.txt lukker denne side for denne bot. Rækken viser, hvilken regel der gjorde det, og løsningen ligger i filen |
| Delvist blokeret | Den side, du testede, er åben for denne bot, men robots.txt har regler rettet mod den andre steder på websitet. Rækken viser hvilke regler, og hvilken gruppe de kom fra, så du kan tjekke, at du mente at holde dem lukkede |
Kolonnen Crawlbarhed: hvad din server faktisk gjorde
| Resultat | Hvad det betyder |
|---|---|
| Crawlbar (med HTTP-statussen) | Bottens forespørgsel gik igennem, og din server svarede normalt |
| Blokeret (med HTTP-statussen) | Forespørgslen blev afvist. robots.txt er ikke årsagen, så kig på reglerne i din firewall, WAF eller CDN |
| Tjek nærmere | En bot, der normalt verificeres via IP-adresse, blev afvist. Vores test kommer ikke fra den bots eget IP-område, så det kan være din firewall, der virker korrekt, snarere end et problem |
| Fejl (med HTTP-statussen) | Siden returnerede en fejl snarere end en blokering. En 404 betyder som regel, at URL'en er forkert, en 500, at noget på dit website fejler. Ingen af dem er et crawler-problem |
| Intet svar | Der kom slet intet tilbage. En timeout eller en afbrudt forbindelse, hvilket peger på netværket eller på en meget aggressiv blokering |
| Ingen live-hentning | Et robots.txt-direktiv snarere end en crawler, så der er intet at sende en forespørgsel til. robots.txt-dommen er hele svaret |
| Ikke testet | Du valgte ikke denne bot, så der blev ikke sendt nogen live-forespørgsel. Dens robots.txt-dom gælder stadig |
Sådan fjerner du blokeringen af en crawler
En regel i robots.txt. Fjern Disallow, eller tilføj et mere specifikt Allow for den user agent. Den mest specifikke matchende regel vinder, så et udtrykkeligt Allow for én bot slår et bredt Disallow: / rettet mod alle.
En firewall- eller CDN-regel. Intet i dit websites filer løser den her. På Cloudflare ligger den i bot management. Hos andre udbydere skal du kigge under WAF eller botbeskyttelse. Tillad user agenten der, og verificer via IP-område, hvis du vil være forsigtig med bedragere.
En udfordringsside. Undtag user agenten fra udfordringen. En crawler kan ikke løse den.
Et noindex i et metatag eller en X-Robots-Tag-header. Crawleren kan nå siden og har fået besked på ikke at beholde den. Det er værd at bekræfte, at det var med vilje, fordi et plugin eller en glemt staging-indstilling gør det i stilhed.
De samme trin virker omvendt. Vil du blokere GPTBot eller en anden AI-crawler, er et Disallow for den user agent i robots.txt den høflige måde, og en firewall-regel den, der faktisk håndhæver det.
Ofte stillede spørgsmål
Hvad er AI-crawlbarhed?
Om AI-crawlere kan nå og læse dine sider. Det dækker robots.txt og alt andet, der ligger mellem en bot og dit indhold, og det er den første forudsætning for alt andet. LLM-crawlbarhed er den samme idé under et andet navn.
Respekterer AI-crawlere robots.txt?
For de crawlere, der henter sider automatisk, siger de store udbydere ja. De agenter, der henter en side, fordi en person bad om det, er et andet tilfælde, og både OpenAI og Perplexity siger, at robots.txt måske ikke stopper dem. Ingen mekanisme håndhæver disse regler. robots.txt er en anmodning, ikke en lås.
Kan jeg blokere AI-træning og stadig være med i AI-søgeresultater?
Ja, og det er den mulighed, de fleste websiteejere faktisk vil have. Bloker GPTBot og ClaudeBot for at holde dig ude af træningen, og tillad OAI-SearchBot og Claude-SearchBot, så assistenterne stadig kan finde og citere dig.
Skader det min SEO at blokere AI-crawlere?
Nej. GPTBot, ClaudeBot og de andre AI-crawlere har intet med Googles rangering at gøre, og at blokere dem påvirker ikke din placering i søgeresultaterne. At blokere Googlebot er en helt anden sag.
Hvorfor består mit website robots.txt-tjekket og bliver alligevel blokeret?
Fordi robots.txt kun er det første lag. En regel i firewallen, WAF'en eller CDN'et kan afvise forespørgslen, før den når din server, og den blokering er usynlig både i din robots.txt og i dine logs.
Er GPTBot det samme som OAI-SearchBot?
Nej. GPTBot indsamler sider til træning. OAI-SearchBot bygger indekset bag ChatGPT-søgning. Du kan tillade den ene og blokere den anden.
Hvorfor citerer ChatGPT ikke mit website eller mit brand?
At kunne nås er den første forudsætning, så start med at tjekke, at OAI-SearchBot ikke er blokeret. Hvis adgangen er i orden, er grunden som regel, at ChatGPT finder svaret et andet sted og ikke har nogen grund til at bruge dig.
Hvordan får jeg mit website til at dukke op i ChatGPT?
Sørg for, at crawlerne kan læse dig, og arbejd derefter på at være værd at citere. Assistenter støtter sig til kilder, de allerede har set citeret andre steder, så omtaler på websites, de allerede har tillid til, betyder mere end noget på dine egne sider.
At kunne nås er det første spørgsmål. Om assistenterne faktisk nævner dig, er et andet.