Grounding: jak modele AI doczytują treści z internetu
Krótka odpowiedź
Grounding to mechanizm, w którym model językowy dostaje treści ze źródeł zewnętrznych w chwili budowania odpowiedzi, zamiast polegać wyłącznie na wiedzy z treningu — tak Google definiuje go w dokumentacji jako podawanie treści z indeksu wyszukiwania modelowi w momencie zapytania. Dla właściciela strony to rozróżnienie ma skutek praktyczny: o cytowaniu firmy decyduje dostęp botów groundingu do strony dziś, a nie to, czy model widział ją w treningu. Stąd pułapka tokenu Google-Extended, który wbrew nazwie steruje oboma kanałami naraz.
Robert Marczyński4 min czytania4 źródła
Grounding to podawanie modelowi językowemu treści ze źródeł zewnętrznych w chwili budowania odpowiedzi — zamiast zdawania się na to, co model zapamiętał z treningu. Google definiuje to w swojej dokumentacji wprost: dostarczanie treści z indeksu wyszukiwania modelowi w momencie zapytania, żeby poprawić rzetelność i trafność odpowiedzi. Po polsku najbliżej: „ugruntowanie” odpowiedzi w źródłach.
Dwa silniki jednej odpowiedzi
Odpowiedź asystenta AI powstaje z dwóch zasobów o zupełnie różnej naturze.
Wiedza z treningu — wszystko, co model zapamiętał z danych zebranych do daty odcięcia. Szeroka, ale zamrożona: nie wie o niczym nowszym, nie ma odnośników i bywa nieprecyzyjna w szczegółach, bo jest kompresją, nie kopią.
Grounding — dociągnięcie świeżych treści w chwili pytania: z indeksu wyszukiwania (zbudowanego wcześniej przez boty indeksujące) albo wprost ze strony (pobranej na żądanie). Stąd odpowiedzi z linkami do źródeł i stąd zdolność asystentów do mówienia o wczorajszych wydarzeniach.
Ta sama idea pod nazwą RAG (generowanie wspomagane wyszukiwaniem) napędza firmowe chatboty odpowiadające z własnej bazy wiedzy — mechanizm identyczny, różni się tylko źródło.
Dlaczego to rozróżnienie dotyczy Twojej strony
Bo o tym, czy asystent zacytuje firmę, decyduje niemal wyłącznie grounding — a ten zależy od stanu strony dziś, nie od tego, co model widział w treningu. Konsekwencje praktyczne są trzy.
Po pierwsze, boty groundingu to inne boty niż treningowe: OAI-SearchBot i ChatGPT-User u OpenAI, Claude-SearchBot i Claude-User u Anthropic, PerplexityBot i Perplexity-User. Blokada botów treningowych nie wycina z cytowań; blokada indeksujących tak, a przy pobierających na żądanie skutek zależy od dostawcy. Osobno o ChatGPT-User: dokumentacja OpenAI uprzedza, że przy pobraniu na żądanie użytkownika robots.txt „may not apply”, więc wpis w pliku jest deklaracją intencji, nie gwarancją.
Po drugie, pułapka nazewnicza: token Google-Extended wygląda na treningowy, ale według dokumentacji Google steruje także groundingiem odpowiedzi Gemini. W moim pomiarze spółek giełdowych obie firmy blokujące trening zablokowały ten token — i wycięły się z kanału odpowiedzi jednego z dużych asystentów, prawdopodobnie nieświadomie. Sam token nie ma wpływu na wyszukiwarkę — Google odnosi go do Gemini Apps i Vertex AI.
Po trzecie, grounding czyta to, co realnie stoi w dokumencie: treść dokładaną skryptem pomija, a bez danych strukturalnych nie wie na pewno, czyją stronę czyta. W pomiarze 60 spółek to właśnie brak danych strukturalnych był najczęstszą luką — 26 z 60 stron nie miało żadnych.
Jedno zdanie do zapamiętania
Wiedza z treningu decyduje o tym, czy model kojarzy Twoją firmę; grounding — o tym, czy może ją zacytować z aktualnym stanem. Pierwszego nie kontrolujesz prawie wcale, drugie kontrolujesz w całości: warunki wstępne są mierzalne i sprawdzisz je samodzielnie, a o tym, co dalej robi różnicę, pisałem przy wyborze źródeł przez modele.
Najczęstsze pytania
- Czym różni się grounding od wiedzy z treningu modelu?
- Wiedza z treningu to to, co model zapamiętał z danych zebranych do daty odcięcia — jest szeroka, ale zamrożona w czasie i pozbawiona źródeł. Grounding działa odwrotnie: w chwili pytania system pobiera aktualne treści z indeksu wyszukiwania albo wprost ze stron i podaje je modelowi jako materiał do odpowiedzi, zwykle z odnośnikami do źródeł. To dlatego asystent potrafi podać dzisiejszą cenę albo zacytować wczorajszy artykuł, choć jego trening skończył się wiele miesięcy wcześniej.
- Które boty realizują grounding u największych dostawców?
- Według dokumentacji dostawców na sierpień 2026: u OpenAI wyszukiwanie na żywo obsługują OAI-SearchBot i ChatGPT-User, u Anthropic Claude-SearchBot i Claude-User, u Perplexity PerplexityBot i Perplexity-User. Google jest przypadkiem szczególnym: grounding odpowiedzi Gemini zasila indeks wyszukiwania Google, a użyciem treści w tym kanale steruje token Google-Extended — ten sam, który steruje treningiem, więc jego blokada odcina oba kanały naraz.
- Czy grounding to to samo co RAG?
- To ta sama idea w dwóch kontekstach. RAG, czyli generowanie wspomagane wyszukiwaniem, to ogólna architektura: najpierw wyszukaj pasujące treści, potem generuj odpowiedź na ich podstawie — tak buduje się firmowe chatboty odpowiadające z własnej bazy wiedzy. Groundingiem nazywa się zwykle tę samą technikę w wykonaniu publicznych asystentów, gdzie źródłem jest indeks wyszukiwania internetu. Mechanizm i wniosek są wspólne: jakość odpowiedzi zależy od tego, co system zdoła przeczytać.
- Co zrobić, żeby moja strona trafiała do groundingu asystentów?
- Spełnić warunki wstępne, które są mierzalne: treść dostępna w kodzie strony bez wykonywania JavaScriptu, dane strukturalne z typem Organization mówiące maszynom, kim jest firma, brak blokad botów odpowiadających w robots.txt i na zaporze. W moim pomiarze 60 spółek giełdowych z sierpnia 2026 najczęstszym brakiem nie były blokady, lecz brak danych strukturalnych — 26 z 60 stron nie miało żadnych. Po spełnieniu warunków wstępnych decyduje treść: odpowiedzi na realne pytania i własne dane.
Źródła
Dane zewnętrzne przywołane w tekście mają tu swoje źródła.
- Google — lista crawlerów: definicja groundingu przy tokenie Google-Extended (podawanie treści z indeksu modelowi w chwili zapytania) (nowa karta)
- OpenAI — dokumentacja crawlerów: rozdzielenie wyszukiwania na żywo od zbierania danych treningowych (nowa karta)
- Anthropic — dokumentacja crawlerów: Claude-SearchBot (indeks) i Claude-User (pobranie na żądanie) (nowa karta)
- Badanie własne — warunki wstępne groundingu na 60 spółkach GPW (pomiar 10–11.08.2026) (nowa karta)
Udostępnij
Powiązane
- Jak modele AI wybierają źródła, które cytująModele AI w trybie wyszukiwania podchwytują treść ze strony wtedy, gdy jest ona jedyną bezpośrednią odpowiedzią na wąskie…
- Dlaczego mojej firmy nie ma w ChatGPT?Gdy asystent AI nie wymienia firmy w odpowiedziach, przyczyna leży zwykle po stronie jej strony internetowej, a nie po stronie modelu.
- Czy blokować GPTBot? Rachunek dla strony firmowejDla większości firm blokada GPTBota nie ma uzasadnienia: zbiera on wyłącznie dane treningowe, a obecność strony w odpowiedziach…
Masz konkretny proces do omówienia?
Napisz, jaki to proces i ile razy w miesiącu się powtarza. Odpowiem, czy nadaje się do automatyzacji, również wtedy, gdy odpowiedź brzmi „nie warto”.
Albo prosto na adres: not-a-bot@