AURA

Boty AI w robots.txt: które wpuścić do strony firmy, a które zablokować

Dowiedz się, jakie boty AI odwiedzają Twoją stronę i jak skonfigurować robots.txt, żeby zachować widoczność w ChatGPT i innych asystentach.

Opublikowano
9 min czytania1846 słów

AURA — wirtualny zarządca firmy. Zarządzanie na faktach, nie na wrażeniach. Kim jesteśmy

Najważniejsze wnioski

  • robots.txt nie ukrywa strony z Google — steruje tym, które boty mogą ją odwiedzać
  • Każda firma AI ma oddzielne boty do wyszukiwania i do treningu modeli
  • OAI-SearchBot, Applebot, Claude-SearchBot i PerplexityBot — te boty warto zezwolić
  • GPTBot, Google-Extended, Applebot-Extended i ClaudeBot to boty treningowe — do decyzji właściciela
  • Zmiany w robots.txt działają po około 24 godzinach

Właściciel firmy usługowej słyszy, że AI „kradnie treść" i chce zamknąć stronę przed botami, ale obawia się, że zniknie z odpowiedzi ChatGPT, Gemini i Perplexity. Tymczasem robots.txt nie ukrywa strony z Google — steruje tym, które boty mogą ją odwiedzać i w jakim celu. Każda firma ma dwa rodzaje botów: jedne służą wyszukiwaniu (pokazują firmę w odpowiedziach asystentów), drugie — trenowaniu modeli (uczą AI na treści strony). Zablokowanie wszystkich botów jedną linią oznacza zniknięcie z wyszukiwania asystentów.

Na tej stronie dowiesz się, jakie boty której firmy odwiedzają Twój serwis, co dzieje się po ich zablokowaniu i jak skonfigurować robots.txt, żeby zachować widoczność w wyszukiwaniu przy jednoczesnej ochronie przed niechcianym treningiem.

Mosiężny zamek w ciemnych drzwiach, w nim klucz z zieloną zawieszką w kształcie kokardki
Jeden zamek, różni goście: robots.txt decyduje, kogo wpuszczasz

Co robi robots.txt i jakie ma ograniczenia

Pliku robots.txt używa się przede wszystkim do zarządzania ruchem botów na stronie, a nie do ukrywania treści z wyników Google. Jak wyjaśnia dokumentacja Google Search Central, robots.txt mówi botom, do jakich adresów mogą się odwoływać, i służy głównie do kontroli obciążenia serwera. Nawet jeśli zablokujesz wszystkie boty, strona nadal może być widoczna w Google — jeśli ktoś na nią linkuje z innego serwisu, Google może ją zindeksować na podstawie linku przychodzącego, pomimo zakazu w robots.txt.

robots.txt działa na poziomie serwera — to wskazówka dla robotów, nie gwarancja. Większość uczciwych botów (w tym opisane poniżej) respektuje te reguły, ale niektóre mogą je ignorować. Dlatego robots.txt to narzędzie zarządzania, nie pełnej ochrony.

OpenAI: dwa niezależne boty

OpenAI używa dwóch oddzielnych robotów, którymi właściciel strony steruje niezależnie w robots.txt. OAI-SearchBot służy do wyświetlania stron w wynikach wyszukiwania ChatGPT — firma może go zablokować, jeśli nie chce pojawiać się w odpowiedziach asystenta. GPTBot z kolei zbiera treści do treningu modeli generatywnych OpenAI. Jak wynika z dokumentacji OpenAI, oba ustawienia są niezależne — można na przykład zablokować GPTBot, żeby treści nie były używane do treningu, ale jednocześnie zezwolić na OAI-SearchBot, żeby strona była widoczna w wyszukiwaniu ChatGPT.

Zmiana w robots.txt może wymagać około 24 godzin, zanim systemy OpenAI ją uwzględnią.

Dlaczego warto zezwolić na OAI-SearchBot

OAI-SearchBot to jeden z niewielu botów, który dosłownie pokazuje stronę firmy użytkownikom ChatGPT. Kiedy ktoś pyta asystenta o usługi w stylu „gdzie w Warszawie naprawić ekspres do kawy", firmy zezwalające na tego bota mogą pojawić się w odpowiedzi wraz z linkiem. Zezwolenie na tego bota nie gwarantuje miejsca w odpowiedzi, ale jego blokada praktycznie je wyklucza.

Google: token, który nie wpływa na wyszukiwarkę

Google-Extended to specjalny token w robots.txt, który pozwala ograniczyć wykorzystanie treści do treningu Gemini i Vertex AI. Kluczowe jest to, że Google-Extended nie ma wpływu na zwykłe wyszukiwanie Google — dotyczy wyłącznie produktów sztucznej inteligencji Google. Jak wyjaśniają dokumenty Google Search Central, token ten jest niezależny od standardowych botów Google i nie wpływa na indeksowanie ani pozycjonowanie w wynikach wyszukiwania.

Dla właściciela firmy usługowej oznacza to, że może zablokować Google-Extended, jeśli nie chce, żeby treści z jego strony były używane do treningu modeli Gemini, ale jednocześnie jego strona będzie nadal widoczna w Google Maps, Search i innych standardowych usługach Google.

Co to jest Vertex AI

Vertex AI to platforma Google do tworzenia i wdrażania aplikacji opartych na modelach generatywnych. Firmy, które budują własne chatboty lub asystentów na infrastrukturze Google, mogą korzystać z Vertex AI. Google-Extended pozwala właścicielom stron wykluczyć swoje treści z tego procesu, jeśli mają takie życzenie.

Apple: boty do wyszukiwania i do treningu

Applebot odwiedza strony dla funkcji wyszukiwania Apple — Spotlight, Siri i Safari. Natomiast Applebot-Extended to oddzielny token, którym właściciel strony może wykluczyć swoje treści z treningu fundacyjnych modeli generatywnych Apple. Jak wynika z dokumentacji Apple, disallow dla Applebot-Extended wyklucza treść z treningu, ale Applebot może nadal odwiedzać stronę dla potrzeb wyszukiwania.

To ważne rozróżnienie: blokada Applebot-Extended nie wpływa na to, czy firma pojawi się w wynikach wyszukiwania Apple. Właściciel może więc ochronić treść przed treningiem AI, zachowując widoczność w ekosystemie Apple.

Dlaczego Spotlight i Siri są ważne dla firmy

Kiedy użytkownik iPhone'a pyta Siri o „najbliższy salon fryzjerski w Warszawie", Siri może oprzeć odpowiedź także na treściach stron, które wcześniej odwiedził Applebot. Jeśli zablokujesz Applebot, treści Twojej strony nie trafią do wyszukiwania Apple — Siri i Spotlight nie będą mogły z nich skorzystać.

Anthropic: trzy boty z różnymi rolami

Anthropic obsługuje trzy oddzielne boty, każdy z innym przeznaczeniem. ClaudeBot zbiera treści, które mogą być wykorzystane do treningu modeli — zablokowanie tego bota wyklucza przyszłe treści ze zbiorów treningowych. Claude-User pobiera strony w odpowiedzi na pytania użytkowników. Claude-SearchBot analizuje treści online, aby poprawić jakość wyników wyszukiwania.

Jak wyjaśnia Centrum pomocy Anthropic, zablokowanie Claude-SearchBot może obniżyć widoczność strony w wynikach wyszukiwania kierowanych przez użytkowników. Wszystkie trzy boty respektują reguły robots.txt, ale każdy ma inną funkcję — właściciel strony może więc precyzyjnie kontrolować dostęp.

Co oznacza „zbieranie do treningu"

Kiedy bot zbiera treść do treningu, nie publikuje jej ani nie pokazuje użytkownikom. Treść staje się częścią ogromnego zbioru danych, na którym model uczy się rozpoznawać wzorce, formułować odpowiedzi i generalizować wiedzę. Dla właściciela firmy to kwestia etyki i preferencji — niektórzy nie chcą, żeby ich treści uczyły konkurencyjne modele, inni nie mają nic przeciwko temu.

Perplexity: bot do wyników, który nie trenuje modeli

PerplexityBot służy do wyświetlania i linkowania stron w wynikach wyszukiwania Perplexity i, zgodnie z dokumentacją Perplexity, nie jest używany do treningu modeli fundacyjnych AI. Firma zaleca zezwolenie na PerplexityBot, żeby strona pojawiała się w wynikach.

Perplexity-User to bot, który pobiera strony na żądanie użytkownika — w odróżnieniu od PerplexityBot, ten bot generalnie ignoruje reguły robots.txt, ponieważ działa na wyraźne żądanie użytkownika. Nie można go zablokować przez robots.txt, jeśli użytkownik poprosi o konkretną stronę.

Perplexity jako wyszukiwarka nowej generacji

Perplexity działa inaczej niż tradycyjne wyszukiwarki — zamiast listy linków pokazuje skrócone odpowiedzi z cytatami ze źródeł. Dla firmy usługowej obecność w Perplexity oznacza, że potencjalny klient może zobaczyć nazwę firmy i opis usługi bez klikania w link. To nowy kanał, który warto rozważyć przy budowaniu widoczności.

Bramki wejściowe z zielonymi lampkami w ciemnym korytarzu
Kontrola dostępu: kto może przejść, a kto nie

Tabela decyzyjna: który bot za co odpowiada

Poniższa tabela pokazuje, jakie boty obsługują które firmy, jaki jest ich cel i co dzieje się po zablokowaniu.

BotFirmaCelEfekt blokadyRekomendacja dla firmy usługowej
OAI-SearchBotOpenAIWyświetlanie w ChatGPTStrona znika z wyników ChatGPTZezwolić — zachowuje widoczność
GPTBotOpenAITrening modeliTreści nie są używane do treninguDo decyzji właściciela
Google-ExtendedGoogleTrening Gemini/Vertex AITreści nie są używane do treningu AIDo decyzji właściciela
ApplebotAppleWyszukiwanie (Spotlight, Siri, Safari)Strona znika z wyszukiwania AppleZezwolić — zachowuje widoczność
Applebot-ExtendedAppleTrening fundacyjny AITreści nie są używane do treninguDo decyzji właściciela
ClaudeBotAnthropicTrening modeliTreści nie są używane do treninguDo decyzji właściciela
Claude-SearchBotAnthropicJakość wyszukiwaniaMoże obniżyć widoczność w wyszukiwaniuZezwolić — zachowuje widoczność
PerplexityBotPerplexityWyniki wyszukiwaniaStrona znika z PerplexityZezwolić — zachowuje widoczność

Jak samodzielnie sprawdzić i zmodyfikować robots.txt

Otwórz w przeglądarce adres twojadomena.pl/robots.txt (podmień domenę na własną). Poszukaj w nim nazw botów wymienionych powyżej. Jeśli plik nie istnieje lub nie zawiera żadnych reguł, domyślnie wszystkie boty mogą odwiedzać stronę.

Przykład poprawnej konfiguracji, która zezwala na boty wyszukiwania i blokuje boty treningowe:

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot
Allow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: *
Disallow:

Ta konfiguracja pozwala botom odpowiedzialnym za widoczność w wyszukiwaniu (OAI-SearchBot, Applebot, Claude-SearchBot, PerplexityBot) i blokuje boty treningowe (GPTBot, Google-Extended, Applebot-Extended, ClaudeBot). Kolejność grup w pliku nie ma znaczenia — bot stosuje grupę, która najdokładniej pasuje do jego nazwy (w nazwach botów wielkość liter nie ma znaczenia), natomiast ścieżki po Allow i Disallow są wrażliwe na wielkość liter.

Po wprowadzeniu zmian poczekaj około 24 godzin, zanim systemy botów je uwzględnią. Możesz też zweryfikować poprawność pliku za pomocą narzędzi testowych dostępnych w Google Search Console.

Widoczność w AI pod kontrolą systemu

Kiedy widoczność w asystentach AI staje się częścią strategii firmy, warto mieć proces, który sprawia, że zarządzanie botami nie jest jednorazową czynnością, ale ciągłym monitoringiem. System może regularnie sprawdzać plik robots.txt pod kątem obecności botów wyszukiwania i treningowych, regularnie powtarzać protokół zapytań w głównych asystentach i przekształcać wyniki w zadania do realizacji.

Takie podejście pozwala właścicielowi firmy usługowej zachować kontrolę nad tym, kto i w jakim celu odwiedza jego stronę, bez konieczności ręcznego śledzenia zmian w politykach poszczególnych firm AI. System nie obiecuje miejsca w odpowiedziach asystentów — daje natomiast narzędzie do świadomego zarządzania widocznością.

Sprawdź, jak działa ten mechanizm w praktyce — zobacz usługę widoczność w asystentach AI, która odpowiada za widoczność w ChatGPT i innych asystentach, przejdź do analizy SEO, żeby zobaczyć pełny obraz widoczności firmy w internecie, zamów indywidualną stronę internetową, która będzie zoptymalizowana pod kątem czytelności dla botów, lub dodaj raporty AI do monitorowania widoczności.

Przeczytaj więcej o tym, jakie dane firmy czytają asystenci AI, dlaczego klienci nie zostawiają zapytań, jak agent AI różni się od czatu oraz jak dane firmy wyglądają w Google — to pomoże Ci zrozumieć, jak widoczność w AI wpływa na pozyskiwanie klientów.

Najczęściej zadawane pytania

Czy zablokowanie wszystkich botów AI usunie moją stronę z Google?

Nie całkowicie. robots.txt nie ukrywa strony z Google w takim sensie, że jeśli inne strony linkują do Twojej, Google może ją zindeksować mimo zakazu. Blokada w robots.txt dotyczy odwiedzin bota, nie samego indeksowania na podstawie linków przychodzących. Jeśli chcesz faktycznie ukryć stronę, potrzebujesz innych metod, takich jak meta tagi czy hasła.

Czy muszę zezwolić na wszystkie boty wyszukiwania?

Nie musisz, ale jeśli zablokujesz boty wyszukiwania (OAI-SearchBot, PerplexityBot, Applebot, Claude-SearchBot), Twoja firma nie będzie widoczna w odpowiedziach odpowiednich asystentów. Dla firmy usługowej obecność w ChatGPT, Perplexity czy Spotlight może być źródłem nowych zapytań od klientów — warto rozważyć zezwolenie na te boty.

Czy mogę zablokować boty treningowe, ale zachować boty wyszukiwania?

Tak. Większość znanych firm AI oferuje oddzielne boty do wyszukiwania i treningu. OpenAI ma OAI-SearchBot (wyszukiwanie) i GPTBot (trening), Anthropic ma Claude-SearchBot i ClaudeBot. Możesz zezwolić na pierwsze i zablokować drugie w tej samej konfiguracji robots.txt. W tabeli powyżej znajdziesz dokładne przyporządkowanie.

Czy Perplexity-User respektuje robots.txt?

Nie. Perplexity-User działa na wyraźne żądanie użytkownika i generalnie ignoruje reguły robots.txt. Nie możesz go zablokować na poziomie tego pliku — jeśli użytkownik poprosi o konkretną stronę, Perplexity ją pobierze. To odróżnia go od PerplexityBot, który respektuje robots.txt.

Jak szybko działają zmiany w robots.txt?

Większość systemów botów potrzebuje około 24 godzin na rozpoznanie zmian w robots.txt. OpenAI i Perplexity podają w dokumentacji właśnie około 24 godzin. W praktyce może to potrwać trochę dłużej, w zależności od częstotliwości odwiedzin bota na Twojej stronie.

Kto to pisze

Zobacz swój biznes jako system.

Aura to wirtualny zarządca firmy: zarządzanie na faktach, nie na wrażeniach. Dla firmy, która chce, żeby procesami zarządzał system, a nie pamięć właściciela.

Strona, CRM, panel i automatyzacje są modułami tego samego systemu. Nie jesteśmy agencją od stron.

Sprawdź mój biznes

Przejdziesz na stronę główną. Powiedz nazwę firmy — Aura spojrzy na nią w danych publicznych i pokaże, co widzi klient, zanim do Was zadzwoni. Bez obietnic wyniku.

Zobacz, czym się zajmujemy

Powiązane usługi

Strony tematyczne

Czytaj dalej Przewiń, żeby zobaczyć więcej

Zobaczmy to na Twoich liczbach

Opowiedz, jak dziś wygląda obsługa zgłoszeń u Ciebie — ile ich jest, kto je odbiera, gdzie się gubią. Aura przejdzie z Tobą ten proces krok po kroku i pokaże, co da się zdjąć z człowieka, a czego nie warto ruszać.

Porozmawiaj z Aurą

Otworzy się strona główna z Aurą. Powiedz nazwę firmy — spojrzy na nią w danych publicznych i pokaże, co widzi klient. Bez obietnic wyniku.

Wolisz napisać? marketing@auraglobal-merchants.com

Drugi krok

Sprawdźmy, czy Aura pasuje do Twojego lokalu

Nie bierzemy każdego — najpierw patrzymy na procesy, sprzedaż i obecne systemy i uczciwie mówimy, czy w ogóle jest sens, żebyśmy wchodzili. Kilka pytań, jakieś pięć minut.

Przejdź kwalifikację →