# Czy blokować GPTBot? Rachunek dla strony firmowej

> Dla większości firm blokada GPTBota nie ma uzasadnienia: zbiera on wyłącznie dane treningowe, a obecność strony w odpowiedziach ChatGPT budują OAI-SearchBot i ChatGPT-User, których blokada nie dotyczy. Decyzja wymaga jednak rozdzielenia trzech typów botów, bo blokada każdego odbiera co innego, a w dwóch miejscach działa inaczej, niż sugeruje intuicja: token Google-Extended steruje jednocześnie treningiem i groundingiem odpowiedzi Gemini, a przy ChatGPT-User dokumentacja OpenAI zastrzega, że przy pobraniach inicjowanych przez użytkownika reguły robots.txt „may not apply”, więc wobec tego bota blokada może nie zadziałać. W moim pomiarze z sierpnia 2026 boty treningowe blokowały 2 z 56 spółek GPW, boty odpowiadające — żadna.

Autor: Robert Marczyński · Opublikowano: 2026-08-12 · Aktualizacja: 2026-08-25
Kanoniczny URL: https://ekspertodsztucznejinteligencji.pl/odpowiedzi/czy-blokowac-gptbot

Krótka odpowiedź: dla większości firm blokada GPTBota nie ma uzasadnienia, a jeśli już, to z jasnym rachunkiem: blokuje się nią **trening, nie widoczność**. Odwrotna pomyłka jest groźniejsza: zablokowanie niewłaściwego bota wycina stronę z odpowiedzi asystentów.

## Trzy typy botów, trzy różne stawki

Decyzja „blokować czy nie” jest źle postawiona, dopóki mówi o „botach AI” zbiorczo. Według dokumentacji dostawców boty dzielą się na trzy grupy o różnych konsekwencjach blokady:

**Boty odpowiadające** — OAI-SearchBot i ChatGPT-User (OpenAI), Claude-SearchBot i Claude-User (Anthropic), PerplexityBot i Perplexity-User. Obsługują wyszukiwanie na żywo: budują indeks albo pobierają stronę, gdy użytkownik zadaje pytanie. **Blokada botów indeksujących kosztuje cytowania:** OpenAI stwierdza wprost, że strona wypada z odpowiedzi wyszukiwania w ChatGPT, Anthropic pisze ostrożniej o obniżeniu widoczności.

**Boty treningowe** — GPTBot i ClaudeBot, a pośrednio CCBot, czyli crawler archiwum Common Crawl, z którego korzystają trenujący modele. Zbierają treść do trenowania przyszłych modeli. Ich blokada nie usuwa strony z odpowiedzi budowanych na żywo; oznacza tyle, że treść nie zasili wiedzy wtrenowanej w kolejne wersje modeli.

**Token o podwójnej funkcji** — `Google-Extended`. Wygląda na treningowy, ale dokumentacja Google mówi wprost, że steruje także [groundingiem](/odpowiedzi/grounding-ai-co-to-jest), czyli podawaniem treści modelowi Gemini w chwili zapytania. Jego blokada kosztuje więc również kanał odpowiedzi — to pułapka, w którą w [moim pomiarze spółek giełdowych](/blog/widocznosc-ai-wig20-mwig40-pomiar) wpadły obie firmy blokujące trening. Google zastrzega przy tym, że token nie wpływa na obecność strony w wyszukiwarce ani na jej pozycję w rankingu — dokumentacja opisuje Gemini Apps i Vertex AI.

Wewnątrz grupy botów odpowiadających przebiega jednak granica, którą łatwo przeoczyć. Boty indeksujące, na czele z OAI-SearchBot, czytają robots.txt i stosują się do niego — OpenAI pisze o nich wprost: „<span lang="en">Sites that are opted out of OAI-SearchBot will not be shown in ChatGPT search answers, though can still appear as navigational links</span>”. Inaczej jest z pobraniami na żądanie. O ChatGPT-User dokumentacja OpenAI mówi: „<span lang="en">Because these actions are initiated by a user, robots.txt rules may not apply</span>”.

Wpisanie tego bota do robots.txt nie jest więc gwarancją, że nie wejdzie — bo z punktu widzenia dostawcy po drugiej stronie stoi człowiek, który poprosił asystenta o otwarcie strony. Kto chce realnie zamknąć ten kanał, musi sięgnąć do zapory albo reguł na CDN i liczyć się z tym, że zamyka drzwi klientowi.

## Rachunek dla typowej firmy

Za blokadą GPTBota przemawia jedna rzecz: zasada. Firma może nie chcieć, żeby jej treść trenowała cudze modele, i ma do tego pełne prawo — tak robią duzi wydawcy, których treść jest produktem samym w sobie.

Przeciw przemawia rachunek widoczności. Obecność w danych treningowych to obecność w wiedzy podstawowej modelu — tej, z której korzysta, zanim sięgnie do wyszukiwania. Firma, o której model „wie” z treningu, ma przewagę nad firmą, którą musi dopiero znaleźć. Dla strony, która żyje z bycia znajdowaną, oddawanie tej przewagi bez wyraźnego powodu jest strategicznie wątpliwe.

Praktyka polskiego rynku jest tu jednoznaczna: na 56 sprawdzonych plików robots.txt największych spółek **ani jeden** nie blokował botów odpowiadających, a trening blokowały dwie — obie gotowym blokiem od Cloudflare, nie własną regułą. Rynek głosuje dostępnością.

## Jeśli blokujesz — zrób to poprawnie

Dwie zasady techniczne, obie z pomiaru realnych plików. Po pierwsze: blokada wymaga reguły `Disallow: /` w grupie danego bota — grupa z samą regułą `Allow` niczego nie zabrania, co wynika wprost z RFC 9309 i co [widać na przykładzie pliku, który wygląda na politykę, a nią nie jest](/blog/widocznosc-ai-wig20-mwig40-pomiar). Po drugie: pisownia tokenów musi być dokładna — `Google-Extended` z łącznikiem, bo zapis bez łącznika nie pasuje do niczego.

Gotowy plik z trzema wariantami — otwartym, blokującym sam trening i zamkniętym — znajdziesz we [wzorze robots.txt dla botów AI](/odpowiedzi/robots-txt-dla-botow-ai-wzor).

## Najczęstsze pytania

**Czy blokada GPTBota usunie moją firmę z ChatGPT?**

Nie z odpowiedzi budowanych na żywo. GPTBot zbiera dane treningowe; wyszukiwaniem w ChatGPT zajmują się OAI-SearchBot, który buduje indeks, i ChatGPT-User, który pobiera stronę na żądanie użytkownika. Dopóki te dwa boty mają dostęp, strona może być cytowana w odpowiedziach. Blokada GPTBota oznacza natomiast, że treść strony nie trafi do danych treningowych przyszłych modeli OpenAI — i to jest właściwe pytanie decyzyjne: czy obecność w wiedzy trenowanej modelu jest dla firmy warta więcej niż zasada niedzielenia się treścią.

**Które boty AI odpowiadają za widoczność, a które za trening?**

Według dokumentacji dostawców na sierpień 2026: za odpowiadanie na żywe pytania odpowiadają OAI-SearchBot, ChatGPT-User (OpenAI), Claude-SearchBot, Claude-User (Anthropic) oraz PerplexityBot i Perplexity-User. Blokada botów indeksujących, czyli OAI-SearchBot, Claude-SearchBot i PerplexityBot, wycina stronę z cytowań; przy botach pobierających na żądanie użytkownika skuteczność blokady zależy od dostawcy, bo dokumentacja OpenAI mówi o ChatGPT-User, że reguły robots.txt „may not apply”. Dane treningowe zbierają GPTBot, ClaudeBot i CCBot — ich blokada nie usuwa strony z odpowiedzi na żywo. Osobna kategoria to Google-Extended: token sterujący i trenowaniem modeli Gemini, i groundingiem, czyli podawaniem treści modelowi w chwili zapytania, więc jego blokada kosztuje także kanał odpowiedzi.

**Czy polskie spółki giełdowe blokują GPTBota?**

Prawie wcale. W moim pomiarze 56 plików robots.txt spółek z WIG20 i mWIG40 z sierpnia 2026 boty odpowiadające na pytania nie były zablokowane ani razu, a boty treningowe blokowały dwie spółki — w obu przypadkach gotowym blokiem reguł od Cloudflare, nie własną decyzją zapisaną ręcznie. Jakikolwiek ślad świadomej decyzji o botach AI miało 7 z 56 plików.

**Jak poprawnie zablokować sam trening, zostawiając widoczność?**

W robots.txt osobną grupą reguł dla każdego bota treningowego: User-agent z nazwą bota i Disallow ze znakiem ukośnika. Ważne, żeby nie użyć samej reguły Allow — grupa bez żadnego Disallow niczego nie zabrania, co wynika wprost z RFC 9309. Do rozważenia też deklaracja Content-Signal z wartością ai-train=no, którą część firm już stosuje. Gotowy plik z trzema wariantami opisałem we wzorze robots.txt dla botów AI.


## Źródła

- OpenAI — dokumentacja crawlerów: role GPTBot, OAI-SearchBot i ChatGPT-User: https://developers.openai.com/api/docs/bots
- Google — lista crawlerów: Google-Extended steruje trenowaniem Gemini i groundingiem w chwili zapytania: https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers
- Badanie własne — widoczność stron WIG20 i mWIG40 (pomiar 10–11.08.2026): blokady botów w robots.txt: https://ekspertodsztucznejinteligencji.pl/badania/widocznosc-wig-2026-08
- RFC 9309 — Robots Exclusion Protocol: grupa bez reguły Disallow niczego nie zabrania (§2.2.2): https://www.rfc-editor.org/rfc/rfc9309.html
