Sprawdź dostęp robotów AI
Zobacz, które roboty AI mogą dotrzeć do Twojej strony, a które są odrzucane.
| Robot | robots.txt | Dostęp na żywo |
|---|
robots.txt w pobranej postaci
Co sprawdzamy
O tym, czy robot AI dotrze do Twojej strony, decydują dwie osobne rzeczy, i zawodzą niezależnie od siebie.
Pierwsza to robots.txt, uprzejmy odźwierny. To prośba, nie zamek, i nie każdy agent z tej listy jej przestrzega. Druga to to, co robi Twój serwer, kiedy zapytanie faktycznie dociera. To warstwa firewalla i tam powstaje większość przypadkowych blokad, bo prawie nikt nie ustawia ich celowo. Reguła napisana po to, żeby zatrzymać scrapery, nie odróżni scrapera od PerplexityBota.
To narzędzie sprawdza obie warstwy. Czyta Twój robots.txt i ustala, co każdy robot ma dozwolone, potem pobiera stronę z prawdziwym User-Agentem tego robota i porównuje odpowiedź z tym, co dostaje zwykła przeglądarka. Kiedy te dwie warstwy się nie zgadzają, dowiadujesz się teraz, a nie po miesiącach, gdy zauważysz, że nikt Cię nie cytuje.
Jedną rzecz trzeba powiedzieć wprost. Test wychodzi z naszych serwerów z ciągiem User-Agent każdego robota. Prawdziwe roboty przychodzą z własnych zakresów IP, więc firewall weryfikujący adresy IP może potraktować je inaczej. Jeśli widzisz tu blokadę, jest prawdziwa. Wynik dozwolony to mocny sygnał, a nie gwarancja, a roboty zwykle weryfikowane po IP są w wynikach odpowiednio oznaczone.
Roboty AI, które sprawdzamy
Nie każdy user agent z tej listy robi to samo. Jedne zbierają strony do trenowania. Inne budują indeks stojący za wyszukiwaniem asystenta. Jeszcze inne pojawiają się tylko wtedy, gdy człowiek prosi asystenta o otwarcie linku. Zablokowanie jednego to inna decyzja niż zablokowanie drugiego, a wyników nie da się zamienić.
| User agent | Operator | Co robi | Jeśli go zablokujesz |
|---|---|---|---|
GPTBot | OpenAI | Zbiera strony do trenowania modeli | Twoja treść zostaje poza treningiem |
OAI-SearchBot | OpenAI | Buduje indeks stojący za wyszukiwaniem ChatGPT | Wyszukiwanie ChatGPT przestaje Cię pokazywać |
ChatGPT-User | OpenAI | Pobiera stronę, gdy ktoś prosi ChatGPT o jej otwarcie | ChatGPT nie może odczytać linku wklejonego przez użytkownika |
ClaudeBot | Anthropic | Zbiera strony do trenowania modeli | Twoja treść zostaje poza treningiem |
Claude-SearchBot | Anthropic | Indeksuje strony do wyników wyszukiwania Claude | Claude przestaje Cię cytować w odpowiedziach |
Claude-User | Anthropic | Pobiera stronę, gdy ktoś prosi Claude o jej otwarcie | Claude nie może odczytać linku wklejonego przez użytkownika |
PerplexityBot | Perplexity | Indeksuje strony do odpowiedzi Perplexity | Perplexity przestaje Cię cytować |
Perplexity-User | Perplexity | Pobiera stronę w odpowiedzi na pytanie | Perplexity nie może otworzyć strony, o którą pytał użytkownik |
Googlebot | Indeks wyszukiwarki, który zasila też AI Overviews | Znikasz z wyszukiwarki Google | |
Bingbot | Microsoft | Indeks Bing, który zasila Copilot | Znikasz z Bing i z Copilota |
Applebot | Apple | Napędza wyszukiwanie w Siri, Spotlight i Safari | Asystenci Apple przestają Cię znajdować |
Meta-ExternalAgent | Meta | Zbiera strony do modeli Meta i część treści indeksuje bezpośrednio | Twoja treść zostaje poza treningiem Meta |
Meta-WebIndexer | Meta | Indeksuje strony do wyników wyszukiwania Meta AI | Meta AI przestaje Cię cytować i linkować do Twojej strony |
DuckAssistBot | DuckDuckGo | Zasila odpowiedzi asystenta DuckDuckGo i nie służy do trenowania | DuckAssist przestaje korzystać z Twoich stron |
MistralAI-Training | Mistral | Zbiera strony do trenowania modeli | Twoja treść zostaje poza treningiem Mistrala |
MistralAI-Index | Mistral | Indeksuje strony do wyszukiwania stojącego za asystentem Mistrala | Asystent Mistrala przestaje Cię pokazywać |
MistralAI-User | Mistral | Pobiera stronę, gdy ktoś prosi asystenta Mistrala o jej otwarcie | Asystent nie może odczytać linku wklejonego przez użytkownika |
CCBot | Common Crawl | Buduje otwarte archiwum crawlu, na którym trenuje wiele modeli | Nie ma Cię w zbiorze danych używanym w całej branży |
Google-Extended | Dyrektywa robots.txt, nie robot. Decyduje, czy Google może używać Twoich stron dla Gemini | Twoje strony zostają w wyszukiwarce Google i w AI Overviews, ale Google nie może ich używać do trenowania ani zasilania Gemini | |
Applebot-Extended | Apple | Dyrektywa robots.txt, nie robot. Decyduje, czy Apple może trenować na Twoich stronach | Siri, Spotlight i Safari dalej korzystają z Twoich stron, Apple przestaje trenować na nich swoje modele |
Trenowanie i wyszukiwanie to osobne decyzje
Zablokowanie GPTBot przy zezwoleniu na OAI-SearchBot trzyma Cię poza danymi treningowymi i zostawia w wynikach wyszukiwania ChatGPT. Anthropic rozdziela ClaudeBot i Claude-SearchBot tak samo, Meta rozdziela Meta-ExternalAgent i Meta-WebIndexer, a Mistral ma osobnego agenta do trenowania, wyszukiwania i zapytań użytkowników. Mnóstwo stron przez przypadek blokuje wszystko, choć chciały tylko wypisać się z treningu.
Agenty z końcówką User to nie roboty
ChatGPT-User, Claude-User, Perplexity-User i MistralAI-User odpalają się tylko wtedy, gdy ktoś już wkleił Twój link i poprosił asystenta o jego odczytanie. Ich zablokowanie nie chroni niczego przed treningiem. Nie zatrzymuje nikogo poza osobą, która próbowała przeczytać Twoją stronę.
Czy blokowanie ich w robots.txt w ogóle działa, zależy od operatora. Anthropic i Mistral respektują plik dla tych agentów. OpenAI mówi, że reguły mogą nie mieć zastosowania, bo zapytanie przyszło od człowieka, a nie z crawlu. Perplexity mówi, że jego mechanizm pobierania zwykle je ignoruje. Blokada, która ma się utrzymać, należy do firewalla.
Dwa ostatnie to dyrektywy, nie roboty
Google-Extended i Applebot-Extended nigdy nie wysyłają zapytania. Siedzą w robots.txt i mówią Google i Apple, co można zrobić ze stronami, które ich zwykłe roboty już pobrały. Nie ma tu robota, którego zapytanie można zasymulować, więc narzędzie ocenia te dyrektywy tylko na podstawie robots.txt i oznacza jako bez zapytania na żywo.
Google-Extended warto przeczytać dwa razy. Jego zablokowanie nie dotyka Twoich pozycji w Google i nie usuwa Cię z AI Overviews, bo oba działają na Googlebot. To, co blokuje, to używanie Twojej treści przez Gemini.
Apple sięga po reguły Googlebota
Jeśli Twój robots.txt nigdy nie wymienia Applebot, ale wymienia Googlebot, Apple stosuje reguły Googlebota. Raport mówi o tym w danym wierszu, gdy to się zdarza. Warto to wiedzieć, bo Disallow napisany z myślą o Google po cichu obejmuje też Siri, Spotlight i Safari, a nic w Twoim pliku nie mówi tego głośno.
User agent to deklaracja, nie tożsamość
Większość operatorów z tej listy mówi, że respektuje robots.txt, z wyjątkami opisanymi wyżej, a w ciągu User-Agent każdy może podać cokolwiek. Jeśli potrzebujesz pewności, a nie współpracy, weryfikuj po zakresie IP lub odwrotnym DNS. Najwięksi operatorzy publikują swoje zakresy IP lub dane do weryfikacji przez odwrotny DNS.
Dlaczego robots.txt to tylko połowa odpowiedzi
Czytanie robots.txt mówi Ci, o co prosisz. Nigdy nie pokazuje, co faktycznie się stało.
Ochrona przed botami na CDN-ie, limiter zapytań, blokada kraju czy strona z wyzwaniem mogą odrzucić robota AI, podczas gdy Twój robots.txt nadal zaprasza go do środka. Nic z tego nie jest zapisane w pliku i najczęściej nic z tego nie trafia też do Twoich logów, bo zapytanie jest ucinane, zanim dotrze do Twojej strony.
Ten schemat łatwo rozpoznać, gdy raz się go zobaczy. Twój robots.txt zezwala na GPTBot, a GPTBot i tak dostaje 403. Kiedy robots.txt i rzeczywistość się nie zgadzają, prawdziwe jest 403.
To także powód, dla którego strony może brakować w odpowiedziach asystenta, choć każda kontrola techniczna witryny kończy się bez wykrycia problemów. Sprawdź widoczność w AI, aby dowiedzieć się, czy asystenci faktycznie wymieniają Twoją markę.
Co oznacza każdy wynik
Tabela wyników ma dwie kolumny i odpowiadają one na różne pytania, więc legenda jest podzielona tak samo. Czytanie etykiety z kolumny Dostęp na żywo według skali robots.txt to najszybszy sposób, żeby źle odczytać cały raport.
Kolumna robots.txt: na co zezwala Twój plik
| Wynik | Co oznacza |
|---|---|
| Dozwolony | Twój robots.txt pozwala temu robotowi crawlować testowaną stronę |
| Zablokowany | Reguła w robots.txt zamyka tę stronę przed tym robotem. Wiersz pokazuje, która reguła to zrobiła, a poprawka jest w pliku |
| Częściowo zablokowany | Testowana strona jest otwarta dla tego robota, ale robots.txt ma reguły wymierzone w niego gdzie indziej w witrynie. Wiersz pokazuje, które reguły i z jakiej grupy pochodzą, żeby dało się sprawdzić, czy te części witryny mają pozostać zablokowane |
Kolumna Dostęp na żywo: co faktycznie zrobił Twój serwer
| Wynik | Co oznacza |
|---|---|
| Dostępny (ze statusem HTTP) | Zapytanie robota przeszło i Twój serwer odpowiedział normalnie |
| Zablokowany (ze statusem HTTP) | Zapytanie zostało odrzucone. robots.txt nie jest przyczyną, więc zajrzyj do reguł firewalla, WAF-a lub CDN-a |
| Do sprawdzenia | Robot zwykle weryfikowany po adresie IP został odrzucony. Nasz test nie przychodzi z zakresu IP tego robota, więc może to być poprawnie działający firewall, a nie problem |
| Błąd (ze statusem HTTP) | Strona zwróciła błąd, a nie blokadę. 404 zwykle znaczy, że URL jest zły, 500, że coś na Twojej stronie nie działa. Żadne z nich nie jest problemem z robotami |
| Brak odpowiedzi | Nie wróciło zupełnie nic. Przekroczony czas oczekiwania albo zerwane połączenie, co wskazuje na sieć albo na bardzo agresywną blokadę |
| Bez zapytania na żywo | Dyrektywa robots.txt, a nie robot, więc nie ma do czego wysłać zapytania. Werdykt z robots.txt to cała odpowiedź |
| Nietestowany | Ten robot nie był zaznaczony, więc nie wysłano zapytania na żywo. Jego werdykt z robots.txt nadal obowiązuje |
Jak odblokować robota
Reguła w robots.txt. Usuń Disallow albo dodaj bardziej szczegółowe Allow dla tego user agenta. Wygrywa najbardziej szczegółowa pasująca reguła, więc wyraźne Allow dla jednego robota pokonuje szerokie Disallow: / wymierzone we wszystkich.
Reguła firewalla lub CDN-a. Nic w plikach Twojej strony tego nie naprawi. W Cloudflare siedzi to w zarządzaniu botami. U innych dostawców szukaj pod WAF lub ochroną przed botami. Zezwól tam na user agenta, a jeśli chcesz uważać na podszywających się, weryfikuj po zakresie IP.
Strona z wyzwaniem. Wyłącz user agenta z wyzwania. Robot nie umie go rozwiązać.
noindex w tagu meta albo nagłówek X-Robots-Tag. Robot może dotrzeć do strony i dostał polecenie, żeby jej nie zachowywać. Warto potwierdzić, że to było celowe, bo wtyczka albo zapomniane ustawienie ze środowiska testowego robią to po cichu.
Te same kroki działają w drugą stronę. Jeśli chcesz zablokować GPTBot lub dowolnego innego robota AI, Disallow dla tego user agenta w robots.txt to uprzejmy sposób, a reguła firewalla to ten, który faktycznie to wymusza.
Najczęstsze pytania
Czym jest dostępność strony dla robotów AI?
To, czy roboty AI mogą dotrzeć do Twoich stron i je odczytać. Obejmuje robots.txt i wszystko inne, co stoi między robotem a Twoją treścią, i jest pierwszym warunkiem całej reszty. Po angielsku to AI crawlability, a LLM crawlability to ten sam pomysł pod inną nazwą.
Czy roboty AI respektują robots.txt?
W przypadku robotów, które pobierają strony automatycznie, najwięksi operatorzy mówią, że tak. Agenty, które pobierają stronę, bo poprosił o to człowiek, to inny przypadek, a OpenAI i Perplexity mówią, że robots.txt może ich nie zatrzymać. Żaden mechanizm nie wymusza przestrzegania tych reguł. robots.txt to prośba, nie zamek.
Czy mogę zablokować trenowanie AI, a zostać w wynikach wyszukiwania AI?
Tak, i tego właśnie chce większość właścicieli stron. Zablokuj GPTBot i ClaudeBot, żeby zostać poza treningiem, a zezwól na OAI-SearchBot i Claude-SearchBot, żeby asystenci nadal mogli Cię znaleźć i cytować.
Czy blokowanie robotów AI szkodzi mojemu SEO?
Nie. GPTBot, ClaudeBot i pozostałe roboty AI nie mają nic wspólnego z pozycjami w Google, a ich zablokowanie nie wpływa na Twoją pozycję w wyszukiwarce. Zablokowanie robota Googlebot to zupełnie inna sprawa.
Dlaczego moja strona przechodzi sprawdzenie robots.txt, a mimo to jest blokowana?
Bo robots.txt to tylko pierwsza warstwa. Reguła firewalla, WAF-a lub CDN-a może odrzucić zapytanie, zanim dotrze do Twojego serwera, a taka blokada jest niewidoczna zarówno w robots.txt, jak i w Twoich logach.
Czy GPTBot to to samo co OAI-SearchBot?
Nie. GPTBot zbiera strony do trenowania. OAI-SearchBot buduje indeks stojący za wyszukiwaniem ChatGPT. Możesz zezwolić na jednego i zablokować drugiego.
Dlaczego ChatGPT nie cytuje mojej strony ani marki?
Dostępność to pierwszy warunek, więc zacznij od sprawdzenia, czy OAI-SearchBot nie jest zablokowany. Jeśli dostęp jest w porządku, powód jest zwykle taki, że ChatGPT znajduje odpowiedź gdzie indziej i nie ma powodu sięgać po Ciebie.
Jak sprawić, żeby moja strona pojawiała się w ChatGPT?
Upewnij się, że roboty mogą Cię odczytać, a potem pracuj nad tym, żeby zasługiwać na cytowanie. Asystenci opierają się na źródłach, które widzieli już cytowane gdzie indziej, więc wzmianki na stronach, którym już ufają, liczą się bardziej niż cokolwiek na Twoich własnych stronach.
Dostępność to pierwsze pytanie. To, czy asystenci faktycznie Cię wymieniają, to już inne.