Sprawdź dostęp robotów AI

Zobacz, które roboty AI mogą dotrzeć do Twojej strony, a które są odrzucane.

Roboty do testu na żywo

Za darmo

Co sprawdzamy

O tym, czy robot AI dotrze do Twojej strony, decydują dwie osobne rzeczy, i zawodzą niezależnie od siebie.

Pierwsza to robots.txt, uprzejmy odźwierny. To prośba, nie zamek, i nie każdy agent z tej listy jej przestrzega. Druga to to, co robi Twój serwer, kiedy zapytanie faktycznie dociera. To warstwa firewalla i tam powstaje większość przypadkowych blokad, bo prawie nikt nie ustawia ich celowo. Reguła napisana po to, żeby zatrzymać scrapery, nie odróżni scrapera od PerplexityBota.

To narzędzie sprawdza obie warstwy. Czyta Twój robots.txt i ustala, co każdy robot ma dozwolone, potem pobiera stronę z prawdziwym User-Agentem tego robota i porównuje odpowiedź z tym, co dostaje zwykła przeglądarka. Kiedy te dwie warstwy się nie zgadzają, dowiadujesz się teraz, a nie po miesiącach, gdy zauważysz, że nikt Cię nie cytuje.

Jedną rzecz trzeba powiedzieć wprost. Test wychodzi z naszych serwerów z ciągiem User-Agent każdego robota. Prawdziwe roboty przychodzą z własnych zakresów IP, więc firewall weryfikujący adresy IP może potraktować je inaczej. Jeśli widzisz tu blokadę, jest prawdziwa. Wynik dozwolony to mocny sygnał, a nie gwarancja, a roboty zwykle weryfikowane po IP są w wynikach odpowiednio oznaczone.

Roboty AI, które sprawdzamy

Nie każdy user agent z tej listy robi to samo. Jedne zbierają strony do trenowania. Inne budują indeks stojący za wyszukiwaniem asystenta. Jeszcze inne pojawiają się tylko wtedy, gdy człowiek prosi asystenta o otwarcie linku. Zablokowanie jednego to inna decyzja niż zablokowanie drugiego, a wyników nie da się zamienić.

User agentOperatorCo robiJeśli go zablokujesz
GPTBotOpenAIZbiera strony do trenowania modeliTwoja treść zostaje poza treningiem
OAI-SearchBotOpenAIBuduje indeks stojący za wyszukiwaniem ChatGPTWyszukiwanie ChatGPT przestaje Cię pokazywać
ChatGPT-UserOpenAIPobiera stronę, gdy ktoś prosi ChatGPT o jej otwarcieChatGPT nie może odczytać linku wklejonego przez użytkownika
ClaudeBotAnthropicZbiera strony do trenowania modeliTwoja treść zostaje poza treningiem
Claude-SearchBotAnthropicIndeksuje strony do wyników wyszukiwania ClaudeClaude przestaje Cię cytować w odpowiedziach
Claude-UserAnthropicPobiera stronę, gdy ktoś prosi Claude o jej otwarcieClaude nie może odczytać linku wklejonego przez użytkownika
PerplexityBotPerplexityIndeksuje strony do odpowiedzi PerplexityPerplexity przestaje Cię cytować
Perplexity-UserPerplexityPobiera stronę w odpowiedzi na pytaniePerplexity nie może otworzyć strony, o którą pytał użytkownik
GooglebotGoogleIndeks wyszukiwarki, który zasila też AI OverviewsZnikasz z wyszukiwarki Google
BingbotMicrosoftIndeks Bing, który zasila CopilotZnikasz z Bing i z Copilota
ApplebotAppleNapędza wyszukiwanie w Siri, Spotlight i SafariAsystenci Apple przestają Cię znajdować
Meta-ExternalAgentMetaZbiera strony do modeli Meta i część treści indeksuje bezpośrednioTwoja treść zostaje poza treningiem Meta
Meta-WebIndexerMetaIndeksuje strony do wyników wyszukiwania Meta AIMeta AI przestaje Cię cytować i linkować do Twojej strony
DuckAssistBotDuckDuckGoZasila odpowiedzi asystenta DuckDuckGo i nie służy do trenowaniaDuckAssist przestaje korzystać z Twoich stron
MistralAI-TrainingMistralZbiera strony do trenowania modeliTwoja treść zostaje poza treningiem Mistrala
MistralAI-IndexMistralIndeksuje strony do wyszukiwania stojącego za asystentem MistralaAsystent Mistrala przestaje Cię pokazywać
MistralAI-UserMistralPobiera stronę, gdy ktoś prosi asystenta Mistrala o jej otwarcieAsystent nie może odczytać linku wklejonego przez użytkownika
CCBotCommon CrawlBuduje otwarte archiwum crawlu, na którym trenuje wiele modeliNie ma Cię w zbiorze danych używanym w całej branży
Google-ExtendedGoogleDyrektywa robots.txt, nie robot. Decyduje, czy Google może używać Twoich stron dla GeminiTwoje strony zostają w wyszukiwarce Google i w AI Overviews, ale Google nie może ich używać do trenowania ani zasilania Gemini
Applebot-ExtendedAppleDyrektywa robots.txt, nie robot. Decyduje, czy Apple może trenować na Twoich stronachSiri, Spotlight i Safari dalej korzystają z Twoich stron, Apple przestaje trenować na nich swoje modele

Trenowanie i wyszukiwanie to osobne decyzje

Zablokowanie GPTBot przy zezwoleniu na OAI-SearchBot trzyma Cię poza danymi treningowymi i zostawia w wynikach wyszukiwania ChatGPT. Anthropic rozdziela ClaudeBot i Claude-SearchBot tak samo, Meta rozdziela Meta-ExternalAgent i Meta-WebIndexer, a Mistral ma osobnego agenta do trenowania, wyszukiwania i zapytań użytkowników. Mnóstwo stron przez przypadek blokuje wszystko, choć chciały tylko wypisać się z treningu.

Agenty z końcówką User to nie roboty

ChatGPT-User, Claude-User, Perplexity-User i MistralAI-User odpalają się tylko wtedy, gdy ktoś już wkleił Twój link i poprosił asystenta o jego odczytanie. Ich zablokowanie nie chroni niczego przed treningiem. Nie zatrzymuje nikogo poza osobą, która próbowała przeczytać Twoją stronę.

Czy blokowanie ich w robots.txt w ogóle działa, zależy od operatora. Anthropic i Mistral respektują plik dla tych agentów. OpenAI mówi, że reguły mogą nie mieć zastosowania, bo zapytanie przyszło od człowieka, a nie z crawlu. Perplexity mówi, że jego mechanizm pobierania zwykle je ignoruje. Blokada, która ma się utrzymać, należy do firewalla.

Dwa ostatnie to dyrektywy, nie roboty

Google-Extended i Applebot-Extended nigdy nie wysyłają zapytania. Siedzą w robots.txt i mówią Google i Apple, co można zrobić ze stronami, które ich zwykłe roboty już pobrały. Nie ma tu robota, którego zapytanie można zasymulować, więc narzędzie ocenia te dyrektywy tylko na podstawie robots.txt i oznacza jako bez zapytania na żywo.

Google-Extended warto przeczytać dwa razy. Jego zablokowanie nie dotyka Twoich pozycji w Google i nie usuwa Cię z AI Overviews, bo oba działają na Googlebot. To, co blokuje, to używanie Twojej treści przez Gemini.

Apple sięga po reguły Googlebota

Jeśli Twój robots.txt nigdy nie wymienia Applebot, ale wymienia Googlebot, Apple stosuje reguły Googlebota. Raport mówi o tym w danym wierszu, gdy to się zdarza. Warto to wiedzieć, bo Disallow napisany z myślą o Google po cichu obejmuje też Siri, Spotlight i Safari, a nic w Twoim pliku nie mówi tego głośno.

User agent to deklaracja, nie tożsamość

Większość operatorów z tej listy mówi, że respektuje robots.txt, z wyjątkami opisanymi wyżej, a w ciągu User-Agent każdy może podać cokolwiek. Jeśli potrzebujesz pewności, a nie współpracy, weryfikuj po zakresie IP lub odwrotnym DNS. Najwięksi operatorzy publikują swoje zakresy IP lub dane do weryfikacji przez odwrotny DNS.

Dlaczego robots.txt to tylko połowa odpowiedzi

Czytanie robots.txt mówi Ci, o co prosisz. Nigdy nie pokazuje, co faktycznie się stało.

Ochrona przed botami na CDN-ie, limiter zapytań, blokada kraju czy strona z wyzwaniem mogą odrzucić robota AI, podczas gdy Twój robots.txt nadal zaprasza go do środka. Nic z tego nie jest zapisane w pliku i najczęściej nic z tego nie trafia też do Twoich logów, bo zapytanie jest ucinane, zanim dotrze do Twojej strony.

Ten schemat łatwo rozpoznać, gdy raz się go zobaczy. Twój robots.txt zezwala na GPTBot, a GPTBot i tak dostaje 403. Kiedy robots.txt i rzeczywistość się nie zgadzają, prawdziwe jest 403.

To także powód, dla którego strony może brakować w odpowiedziach asystenta, choć każda kontrola techniczna witryny kończy się bez wykrycia problemów. Sprawdź widoczność w AI, aby dowiedzieć się, czy asystenci faktycznie wymieniają Twoją markę.

Co oznacza każdy wynik

Tabela wyników ma dwie kolumny i odpowiadają one na różne pytania, więc legenda jest podzielona tak samo. Czytanie etykiety z kolumny Dostęp na żywo według skali robots.txt to najszybszy sposób, żeby źle odczytać cały raport.

Kolumna robots.txt: na co zezwala Twój plik

WynikCo oznacza
DozwolonyTwój robots.txt pozwala temu robotowi crawlować testowaną stronę
ZablokowanyReguła w robots.txt zamyka tę stronę przed tym robotem. Wiersz pokazuje, która reguła to zrobiła, a poprawka jest w pliku
Częściowo zablokowanyTestowana strona jest otwarta dla tego robota, ale robots.txt ma reguły wymierzone w niego gdzie indziej w witrynie. Wiersz pokazuje, które reguły i z jakiej grupy pochodzą, żeby dało się sprawdzić, czy te części witryny mają pozostać zablokowane

Kolumna Dostęp na żywo: co faktycznie zrobił Twój serwer

WynikCo oznacza
Dostępny (ze statusem HTTP)Zapytanie robota przeszło i Twój serwer odpowiedział normalnie
Zablokowany (ze statusem HTTP)Zapytanie zostało odrzucone. robots.txt nie jest przyczyną, więc zajrzyj do reguł firewalla, WAF-a lub CDN-a
Do sprawdzeniaRobot zwykle weryfikowany po adresie IP został odrzucony. Nasz test nie przychodzi z zakresu IP tego robota, więc może to być poprawnie działający firewall, a nie problem
Błąd (ze statusem HTTP)Strona zwróciła błąd, a nie blokadę. 404 zwykle znaczy, że URL jest zły, 500, że coś na Twojej stronie nie działa. Żadne z nich nie jest problemem z robotami
Brak odpowiedziNie wróciło zupełnie nic. Przekroczony czas oczekiwania albo zerwane połączenie, co wskazuje na sieć albo na bardzo agresywną blokadę
Bez zapytania na żywoDyrektywa robots.txt, a nie robot, więc nie ma do czego wysłać zapytania. Werdykt z robots.txt to cała odpowiedź
NietestowanyTen robot nie był zaznaczony, więc nie wysłano zapytania na żywo. Jego werdykt z robots.txt nadal obowiązuje

Jak odblokować robota

Reguła w robots.txt. Usuń Disallow albo dodaj bardziej szczegółowe Allow dla tego user agenta. Wygrywa najbardziej szczegółowa pasująca reguła, więc wyraźne Allow dla jednego robota pokonuje szerokie Disallow: / wymierzone we wszystkich.

Reguła firewalla lub CDN-a. Nic w plikach Twojej strony tego nie naprawi. W Cloudflare siedzi to w zarządzaniu botami. U innych dostawców szukaj pod WAF lub ochroną przed botami. Zezwól tam na user agenta, a jeśli chcesz uważać na podszywających się, weryfikuj po zakresie IP.

Strona z wyzwaniem. Wyłącz user agenta z wyzwania. Robot nie umie go rozwiązać.

noindex w tagu meta albo nagłówek X-Robots-Tag. Robot może dotrzeć do strony i dostał polecenie, żeby jej nie zachowywać. Warto potwierdzić, że to było celowe, bo wtyczka albo zapomniane ustawienie ze środowiska testowego robią to po cichu.

Te same kroki działają w drugą stronę. Jeśli chcesz zablokować GPTBot lub dowolnego innego robota AI, Disallow dla tego user agenta w robots.txt to uprzejmy sposób, a reguła firewalla to ten, który faktycznie to wymusza.

Najczęstsze pytania

Czym jest dostępność strony dla robotów AI?

To, czy roboty AI mogą dotrzeć do Twoich stron i je odczytać. Obejmuje robots.txt i wszystko inne, co stoi między robotem a Twoją treścią, i jest pierwszym warunkiem całej reszty. Po angielsku to AI crawlability, a LLM crawlability to ten sam pomysł pod inną nazwą.

Czy roboty AI respektują robots.txt?

W przypadku robotów, które pobierają strony automatycznie, najwięksi operatorzy mówią, że tak. Agenty, które pobierają stronę, bo poprosił o to człowiek, to inny przypadek, a OpenAI i Perplexity mówią, że robots.txt może ich nie zatrzymać. Żaden mechanizm nie wymusza przestrzegania tych reguł. robots.txt to prośba, nie zamek.

Czy mogę zablokować trenowanie AI, a zostać w wynikach wyszukiwania AI?

Tak, i tego właśnie chce większość właścicieli stron. Zablokuj GPTBot i ClaudeBot, żeby zostać poza treningiem, a zezwól na OAI-SearchBot i Claude-SearchBot, żeby asystenci nadal mogli Cię znaleźć i cytować.

Czy blokowanie robotów AI szkodzi mojemu SEO?

Nie. GPTBot, ClaudeBot i pozostałe roboty AI nie mają nic wspólnego z pozycjami w Google, a ich zablokowanie nie wpływa na Twoją pozycję w wyszukiwarce. Zablokowanie robota Googlebot to zupełnie inna sprawa.

Dlaczego moja strona przechodzi sprawdzenie robots.txt, a mimo to jest blokowana?

Bo robots.txt to tylko pierwsza warstwa. Reguła firewalla, WAF-a lub CDN-a może odrzucić zapytanie, zanim dotrze do Twojego serwera, a taka blokada jest niewidoczna zarówno w robots.txt, jak i w Twoich logach.

Czy GPTBot to to samo co OAI-SearchBot?

Nie. GPTBot zbiera strony do trenowania. OAI-SearchBot buduje indeks stojący za wyszukiwaniem ChatGPT. Możesz zezwolić na jednego i zablokować drugiego.

Dlaczego ChatGPT nie cytuje mojej strony ani marki?

Dostępność to pierwszy warunek, więc zacznij od sprawdzenia, czy OAI-SearchBot nie jest zablokowany. Jeśli dostęp jest w porządku, powód jest zwykle taki, że ChatGPT znajduje odpowiedź gdzie indziej i nie ma powodu sięgać po Ciebie.

Jak sprawić, żeby moja strona pojawiała się w ChatGPT?

Upewnij się, że roboty mogą Cię odczytać, a potem pracuj nad tym, żeby zasługiwać na cytowanie. Asystenci opierają się na źródłach, które widzieli już cytowane gdzie indziej, więc wzmianki na stronach, którym już ufają, liczą się bardziej niż cokolwiek na Twoich własnych stronach.

Dostępność to pierwsze pytanie. To, czy asystenci faktycznie Cię wymieniają, to już inne.

Sprawdź swoją widoczność w AI