# Grounding: jak modele AI doczytują treści z internetu

> Grounding to mechanizm, w którym model językowy dostaje treści ze źródeł zewnętrznych w chwili budowania odpowiedzi, zamiast polegać wyłącznie na wiedzy z treningu — tak Google definiuje go w dokumentacji jako podawanie treści z indeksu wyszukiwania modelowi w momencie zapytania. Dla właściciela strony to rozróżnienie ma skutek praktyczny: o cytowaniu firmy decyduje dostęp botów groundingu do strony dziś, a nie to, czy model widział ją w treningu. Stąd pułapka tokenu Google-Extended, który wbrew nazwie steruje oboma kanałami naraz.

Autor: Robert Marczyński · Opublikowano: 2026-08-12 · Aktualizacja: 2026-08-25
Kanoniczny URL: https://ekspertodsztucznejinteligencji.pl/odpowiedzi/grounding-ai-co-to-jest

Grounding to podawanie modelowi językowemu treści ze źródeł zewnętrznych **w chwili budowania odpowiedzi** — zamiast zdawania się na to, co model zapamiętał z treningu. Google definiuje to w swojej dokumentacji wprost: dostarczanie treści z indeksu wyszukiwania modelowi w momencie zapytania, żeby poprawić rzetelność i trafność odpowiedzi. Po polsku najbliżej: „ugruntowanie” odpowiedzi w źródłach.

## Dwa silniki jednej odpowiedzi

Odpowiedź asystenta AI powstaje z dwóch zasobów o zupełnie różnej naturze.

**Wiedza z treningu** — wszystko, co model zapamiętał z danych zebranych do daty odcięcia. Szeroka, ale zamrożona: nie wie o niczym nowszym, nie ma odnośników i bywa nieprecyzyjna w szczegółach, bo jest kompresją, nie kopią.

**Grounding** — dociągnięcie świeżych treści w chwili pytania: z indeksu wyszukiwania (zbudowanego wcześniej przez boty indeksujące) albo wprost ze strony (pobranej na żądanie). Stąd odpowiedzi z linkami do źródeł i stąd zdolność asystentów do mówienia o wczorajszych wydarzeniach.

Ta sama idea pod nazwą **RAG** (generowanie wspomagane wyszukiwaniem) napędza firmowe chatboty odpowiadające z własnej bazy wiedzy — mechanizm identyczny, różni się tylko źródło.

## Dlaczego to rozróżnienie dotyczy Twojej strony

Bo o tym, czy asystent **zacytuje firmę**, decyduje niemal wyłącznie grounding — a ten zależy od stanu strony dziś, nie od tego, co model widział w treningu. Konsekwencje praktyczne są trzy.

Po pierwsze, boty groundingu to inne boty niż treningowe: OAI-SearchBot i ChatGPT-User u OpenAI, Claude-SearchBot i Claude-User u Anthropic, PerplexityBot i Perplexity-User. [Blokada botów treningowych nie wycina z cytowań; blokada indeksujących tak, a przy pobierających na żądanie skutek zależy od dostawcy](/odpowiedzi/czy-blokowac-gptbot). Osobno o ChatGPT-User: dokumentacja OpenAI uprzedza, że przy pobraniu na żądanie użytkownika robots.txt „<span lang="en">may not apply</span>”, więc wpis w pliku jest deklaracją intencji, nie gwarancją.

Po drugie, pułapka nazewnicza: token `Google-Extended` wygląda na treningowy, ale według dokumentacji Google steruje **także groundingiem odpowiedzi Gemini**. W [moim pomiarze spółek giełdowych](/blog/widocznosc-ai-wig20-mwig40-pomiar) obie firmy blokujące trening zablokowały ten token — i wycięły się z kanału odpowiedzi jednego z dużych asystentów, prawdopodobnie nieświadomie. Sam token nie ma wpływu na wyszukiwarkę — Google odnosi go do Gemini Apps i Vertex AI.

Po trzecie, grounding czyta to, co realnie stoi w dokumencie: treść dokładaną skryptem pomija, a bez danych strukturalnych nie wie na pewno, czyją stronę czyta. W pomiarze 60 spółek to właśnie brak danych strukturalnych był najczęstszą luką — 26 z 60 stron nie miało żadnych.

## Jedno zdanie do zapamiętania

Wiedza z treningu decyduje o tym, czy model **kojarzy** Twoją firmę; grounding — o tym, czy może ją **zacytować z aktualnym stanem**. Pierwszego nie kontrolujesz prawie wcale, drugie kontrolujesz w całości: [warunki wstępne są mierzalne i sprawdzisz je samodzielnie](/odpowiedzi/dlaczego-firmy-nie-ma-w-chatgpt), a o tym, co dalej robi różnicę, [pisałem przy wyborze źródeł przez modele](/blog/jak-modele-ai-wybieraja-zrodla).

## Najczęstsze pytania

**Czym różni się grounding od wiedzy z treningu modelu?**

Wiedza z treningu to to, co model zapamiętał z danych zebranych do daty odcięcia — jest szeroka, ale zamrożona w czasie i pozbawiona źródeł. Grounding działa odwrotnie: w chwili pytania system pobiera aktualne treści z indeksu wyszukiwania albo wprost ze stron i podaje je modelowi jako materiał do odpowiedzi, zwykle z odnośnikami do źródeł. To dlatego asystent potrafi podać dzisiejszą cenę albo zacytować wczorajszy artykuł, choć jego trening skończył się wiele miesięcy wcześniej.

**Które boty realizują grounding u największych dostawców?**

Według dokumentacji dostawców na sierpień 2026: u OpenAI wyszukiwanie na żywo obsługują OAI-SearchBot i ChatGPT-User, u Anthropic Claude-SearchBot i Claude-User, u Perplexity PerplexityBot i Perplexity-User. Google jest przypadkiem szczególnym: grounding odpowiedzi Gemini zasila indeks wyszukiwania Google, a użyciem treści w tym kanale steruje token Google-Extended — ten sam, który steruje treningiem, więc jego blokada odcina oba kanały naraz.

**Czy grounding to to samo co RAG?**

To ta sama idea w dwóch kontekstach. RAG, czyli generowanie wspomagane wyszukiwaniem, to ogólna architektura: najpierw wyszukaj pasujące treści, potem generuj odpowiedź na ich podstawie — tak buduje się firmowe chatboty odpowiadające z własnej bazy wiedzy. Groundingiem nazywa się zwykle tę samą technikę w wykonaniu publicznych asystentów, gdzie źródłem jest indeks wyszukiwania internetu. Mechanizm i wniosek są wspólne: jakość odpowiedzi zależy od tego, co system zdoła przeczytać.

**Co zrobić, żeby moja strona trafiała do groundingu asystentów?**

Spełnić warunki wstępne, które są mierzalne: treść dostępna w kodzie strony bez wykonywania JavaScriptu, dane strukturalne z typem Organization mówiące maszynom, kim jest firma, brak blokad botów odpowiadających w robots.txt i na zaporze. W moim pomiarze 60 spółek giełdowych z sierpnia 2026 najczęstszym brakiem nie były blokady, lecz brak danych strukturalnych — 26 z 60 stron nie miało żadnych. Po spełnieniu warunków wstępnych decyduje treść: odpowiedzi na realne pytania i własne dane.


## Źródła

- Google — lista crawlerów: definicja groundingu przy tokenie Google-Extended (podawanie treści z indeksu modelowi w chwili zapytania): https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers
- OpenAI — dokumentacja crawlerów: rozdzielenie wyszukiwania na żywo od zbierania danych treningowych: https://developers.openai.com/api/docs/bots
- Anthropic — dokumentacja crawlerów: Claude-SearchBot (indeks) i Claude-User (pobranie na żądanie): https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler
- Badanie własne — warunki wstępne groundingu na 60 spółkach GPW (pomiar 10–11.08.2026): https://ekspertodsztucznejinteligencji.pl/badania/widocznosc-wig-2026-08
