Zbiór danych: ile tokenów zajmuje polski tekst w pięciu modelach
Pomiar z 29 września 2026: liczba tokenów wejścia zgłoszona przez API dla tych samych tekstów w modelach Claude Opus 5.5, Claude Sonnet 5.5, Claude Haiku 4.5, GPT-6 Sol i GPT-6 Luna. Korpus to fragmenty AI Act i RODO w oficjalnych wersjach polskiej i angielskiej oraz próbka polskiej prozy biznesowej; każdy wariant zmierzony dwa razy metodą różnicową. Pliki własne na licencji CC BY 4.0, teksty aktów prawnych z EUR-Lex.
Pomiar: 29 września 2026 · Wyniki i wnioski: Ile tokenów zajmuje polski tekst w API? Pomiar pięciu modeli z września 2026 · Metoda i ograniczenia: README.md
Dane z wykresu w tabeli
| Pozycja | Wersja polska | Wersja angielska |
|---|---|---|
| Claude Opus 5.5 | 6488 tokenów | 3761 tokenów |
| Claude Sonnet 5.5 | 6485 tokenów | 3762 tokenów |
| Claude Haiku 4.5 | 4704 tokenów | 2631 tokenów |
| GPT-6 Sol | 4432 tokenów | 2458 tokenów |
| GPT-6 Luna | 4458 tokenów | 2484 tokenów |
Źródło: badanie własne Roberta Marczyńskiego, pomiar 29 września 2026.
Pliki zbioru
- Metoda (README.md)
Pytanie badawcze, narzędzia, metoda różnicowa, opis korpusu, wynik w tokenach na 1000 znaków i ograniczenia pomiaru.
- Skrypt pomiaru (mierz.py)
Kod, który wywołuje Claude Code i Codex CLI z tekstem i bez tekstu, każdy wariant dwa razy, i zapisuje zgłoszone przez API liczby tokenów wejścia i wyjścia.
- Przebiegi (przebiegi.json)
Po jednym rekordzie na wywołanie modelu, 40 rekordów: model, wariant tekstu, powtórzenie, tokeny wejścia i wyjścia, surowy raport zużycia z API, czas trwania i data.
- Tokeny tekstu (tokeny-tekstu.json)
Przeliczenie przebiegów: liczba znaków każdego tekstu, tokeny samego tekstu z obu powtórzeń, średnia i tokeny na 1000 znaków dla każdego modelu.
- Przebiegi odrzucone (przebiegi-odrzucone.json)
Pierwsza seria Haiku 4.5, osiem rekordów, rozpoczęta przy zimnej pamięci podręcznej. W wariancie angielskim żadne z dwóch wywołań nie odczytało pamięci podręcznej, a raport zużycia pominął prompt systemowy; każdy rekord ma podany powód odrzucenia.
- Tekst prawny po polsku (korpus/prawo-PL.txt)
Art. 4, 50 i 73 rozporządzenia 2024/1689 (AI Act) oraz art. 33 i 34 rozporządzenia 2016/679 (RODO) w oficjalnej wersji polskiej z EUR-Lex, 13 868 znaków.
- Tekst prawny po angielsku (korpus/prawo-EN.txt)
Te same artykuły AI Act i RODO w oficjalnej wersji angielskiej z EUR-Lex, 12 825 znaków.
- Proza biznesowa po polsku (korpus/biznes-PL.txt)
Początki trzech tekstów serwisu o kosztach i wdrożeniach AI, 9005 znaków, bez wersji angielskiej.
Jak czytać te dane
W przebiegi.json jeden rekord to jedno wywołanie modelu: pole wejscie to liczba tokenów wejścia zgłoszona przez API, a wariant mówi, czy do instrukcji dołączono tekst. Przybliżone tokeny samego tekstu to różnica między wariantem z tekstem a wariantem baza z tej samej serii; przeliczenie jest w tokeny-tekstu.json. Kontekst dodawany przez narzędzia CLI zmieniał się między wywołaniami; rozrzut opisano w metodzie. Pomiar dotyczy tokenizacji wejścia, nie kosztu całego zadania.
Licencja
Pliki własne badania (przebiegi, przeliczenie, skrypt, metoda, próbka tekstów serwisu): CC BY 4.0, z atrybucją „Robert Marczyński, ekspertodsztucznejinteligencji.pl”. Teksty AI Act i RODO w korpus/ pochodzą z EUR-Lex i podlegają zasadom ponownego wykorzystania dokumentów Komisji Europejskiej (decyzja 2011/833/UE).