Przejdź do treści
Robert Marczyński

Czy blokować GPTBot? Rachunek dla strony firmowej

Krótka odpowiedź

Dla większości firm blokada GPTBota nie ma uzasadnienia: zbiera on wyłącznie dane treningowe, a obecność strony w odpowiedziach ChatGPT budują OAI-SearchBot i ChatGPT-User, których blokada nie dotyczy. Decyzja wymaga jednak rozdzielenia trzech typów botów, bo blokada każdego odbiera co innego, a w dwóch miejscach działa inaczej, niż sugeruje intuicja: token Google-Extended steruje jednocześnie treningiem i groundingiem odpowiedzi Gemini, a przy ChatGPT-User dokumentacja OpenAI zastrzega, że przy pobraniach inicjowanych przez użytkownika reguły robots.txt „may not apply”, więc wobec tego bota blokada może nie zadziałać. W moim pomiarze z sierpnia 2026 boty treningowe blokowały 2 z 56 spółek GPW, boty odpowiadające — żadna.

Robert Marczyński5 min czytania4 źródła

Krótka odpowiedź: dla większości firm blokada GPTBota nie ma uzasadnienia, a jeśli już, to z jasnym rachunkiem: blokuje się nią trening, nie widoczność. Odwrotna pomyłka jest groźniejsza: zablokowanie niewłaściwego bota wycina stronę z odpowiedzi asystentów.

Trzy typy botów, trzy różne stawki

Decyzja „blokować czy nie” jest źle postawiona, dopóki mówi o „botach AI” zbiorczo. Według dokumentacji dostawców boty dzielą się na trzy grupy o różnych konsekwencjach blokady:

Boty odpowiadające — OAI-SearchBot i ChatGPT-User (OpenAI), Claude-SearchBot i Claude-User (Anthropic), PerplexityBot i Perplexity-User. Obsługują wyszukiwanie na żywo: budują indeks albo pobierają stronę, gdy użytkownik zadaje pytanie. Blokada botów indeksujących kosztuje cytowania: OpenAI stwierdza wprost, że strona wypada z odpowiedzi wyszukiwania w ChatGPT, Anthropic pisze ostrożniej o obniżeniu widoczności.

Boty treningowe — GPTBot i ClaudeBot, a pośrednio CCBot, czyli crawler archiwum Common Crawl, z którego korzystają trenujący modele. Zbierają treść do trenowania przyszłych modeli. Ich blokada nie usuwa strony z odpowiedzi budowanych na żywo; oznacza tyle, że treść nie zasili wiedzy wtrenowanej w kolejne wersje modeli.

Token o podwójnej funkcji — Google-Extended. Wygląda na treningowy, ale dokumentacja Google mówi wprost, że steruje także groundingiem, czyli podawaniem treści modelowi Gemini w chwili zapytania. Jego blokada kosztuje więc również kanał odpowiedzi — to pułapka, w którą w moim pomiarze spółek giełdowych wpadły obie firmy blokujące trening. Google zastrzega przy tym, że token nie wpływa na obecność strony w wyszukiwarce ani na jej pozycję w rankingu — dokumentacja opisuje Gemini Apps i Vertex AI.

Wewnątrz grupy botów odpowiadających przebiega jednak granica, którą łatwo przeoczyć. Boty indeksujące, na czele z OAI-SearchBot, czytają robots.txt i stosują się do niego — OpenAI pisze o nich wprost: „Sites that are opted out of OAI-SearchBot will not be shown in ChatGPT search answers, though can still appear as navigational links”. Inaczej jest z pobraniami na żądanie. O ChatGPT-User dokumentacja OpenAI mówi: „Because these actions are initiated by a user, robots.txt rules may not apply”.

Wpisanie tego bota do robots.txt nie jest więc gwarancją, że nie wejdzie — bo z punktu widzenia dostawcy po drugiej stronie stoi człowiek, który poprosił asystenta o otwarcie strony. Kto chce realnie zamknąć ten kanał, musi sięgnąć do zapory albo reguł na CDN i liczyć się z tym, że zamyka drzwi klientowi.

Rachunek dla typowej firmy

Za blokadą GPTBota przemawia jedna rzecz: zasada. Firma może nie chcieć, żeby jej treść trenowała cudze modele, i ma do tego pełne prawo — tak robią duzi wydawcy, których treść jest produktem samym w sobie.

Przeciw przemawia rachunek widoczności. Obecność w danych treningowych to obecność w wiedzy podstawowej modelu — tej, z której korzysta, zanim sięgnie do wyszukiwania. Firma, o której model „wie” z treningu, ma przewagę nad firmą, którą musi dopiero znaleźć. Dla strony, która żyje z bycia znajdowaną, oddawanie tej przewagi bez wyraźnego powodu jest strategicznie wątpliwe.

Praktyka polskiego rynku jest tu jednoznaczna: na 56 sprawdzonych plików robots.txt największych spółek ani jeden nie blokował botów odpowiadających, a trening blokowały dwie — obie gotowym blokiem od Cloudflare, nie własną regułą. Rynek głosuje dostępnością.

Jeśli blokujesz — zrób to poprawnie

Dwie zasady techniczne, obie z pomiaru realnych plików. Po pierwsze: blokada wymaga reguły Disallow: / w grupie danego bota — grupa z samą regułą Allow niczego nie zabrania, co wynika wprost z RFC 9309 i co widać na przykładzie pliku, który wygląda na politykę, a nią nie jest. Po drugie: pisownia tokenów musi być dokładna — Google-Extended z łącznikiem, bo zapis bez łącznika nie pasuje do niczego.

Gotowy plik z trzema wariantami — otwartym, blokującym sam trening i zamkniętym — znajdziesz we wzorze robots.txt dla botów AI.

Najczęstsze pytania

Czy blokada GPTBota usunie moją firmę z ChatGPT?
Nie z odpowiedzi budowanych na żywo. GPTBot zbiera dane treningowe; wyszukiwaniem w ChatGPT zajmują się OAI-SearchBot, który buduje indeks, i ChatGPT-User, który pobiera stronę na żądanie użytkownika. Dopóki te dwa boty mają dostęp, strona może być cytowana w odpowiedziach. Blokada GPTBota oznacza natomiast, że treść strony nie trafi do danych treningowych przyszłych modeli OpenAI — i to jest właściwe pytanie decyzyjne: czy obecność w wiedzy trenowanej modelu jest dla firmy warta więcej niż zasada niedzielenia się treścią.
Które boty AI odpowiadają za widoczność, a które za trening?
Według dokumentacji dostawców na sierpień 2026: za odpowiadanie na żywe pytania odpowiadają OAI-SearchBot, ChatGPT-User (OpenAI), Claude-SearchBot, Claude-User (Anthropic) oraz PerplexityBot i Perplexity-User. Blokada botów indeksujących, czyli OAI-SearchBot, Claude-SearchBot i PerplexityBot, wycina stronę z cytowań; przy botach pobierających na żądanie użytkownika skuteczność blokady zależy od dostawcy, bo dokumentacja OpenAI mówi o ChatGPT-User, że reguły robots.txt „may not apply”. Dane treningowe zbierają GPTBot, ClaudeBot i CCBot — ich blokada nie usuwa strony z odpowiedzi na żywo. Osobna kategoria to Google-Extended: token sterujący i trenowaniem modeli Gemini, i groundingiem, czyli podawaniem treści modelowi w chwili zapytania, więc jego blokada kosztuje także kanał odpowiedzi.
Czy polskie spółki giełdowe blokują GPTBota?
Prawie wcale. W moim pomiarze 56 plików robots.txt spółek z WIG20 i mWIG40 z sierpnia 2026 boty odpowiadające na pytania nie były zablokowane ani razu, a boty treningowe blokowały dwie spółki — w obu przypadkach gotowym blokiem reguł od Cloudflare, nie własną decyzją zapisaną ręcznie. Jakikolwiek ślad świadomej decyzji o botach AI miało 7 z 56 plików.
Jak poprawnie zablokować sam trening, zostawiając widoczność?
W robots.txt osobną grupą reguł dla każdego bota treningowego: User-agent z nazwą bota i Disallow ze znakiem ukośnika. Ważne, żeby nie użyć samej reguły Allow — grupa bez żadnego Disallow niczego nie zabrania, co wynika wprost z RFC 9309. Do rozważenia też deklaracja Content-Signal z wartością ai-train=no, którą część firm już stosuje. Gotowy plik z trzema wariantami opisałem we wzorze robots.txt dla botów AI.

Źródła

Dane zewnętrzne przywołane w tekście mają tu swoje źródła.

  1. OpenAI — dokumentacja crawlerów: role GPTBot, OAI-SearchBot i ChatGPT-User (nowa karta)
  2. Google — lista crawlerów: Google-Extended steruje trenowaniem Gemini i groundingiem w chwili zapytania (nowa karta)
  3. Badanie własne — widoczność stron WIG20 i mWIG40 (pomiar 10⁠–⁠11.08.2026): blokady botów w robots.txt (nowa karta)
  4. RFC 9309 — Robots Exclusion Protocol: grupa bez reguły Disallow niczego nie zabrania (§2.2.2) (nowa karta)

Udostępnij

Powiązane

Masz konkretny proces do omówienia?

Napisz, jaki to proces i ile razy w miesiącu się powtarza. Odpowiem, czy nadaje się do automatyzacji, również wtedy, gdy odpowiedź brzmi „nie warto”.

Albo prosto na adres: not-a-bot@ekspertodsztucznejinteligencji.pl