Zbiór danych: tokenizery otwartych modeli na polskim, angielskim i niemieckim tekście
Pomiar z 4 października 2026: liczba tokenów, na które 10 publicznie dostępnych tokenizerów modeli (m.in. Kolibri-1, Bielik-11B-v2.3, PLLuM, EuroLLM-9B, Qwen3, Mistral Small 3.1) dzieli wybrane przepisy AI Act i RODO po polsku, angielsku i niemiecku oraz polską prozę biznesową. Przypięte wersje plików, skrypt, korpus i wyniki.
Pomiar: 4 października 2026 · Wyniki i wnioski: Kolibri od Aleph Alpha: polski tekst w 10 tokenizerach · Metoda i ograniczenia: README.md
Dane z wykresu w tabeli
| Pozycja | Tokeny w całym pliku |
|---|---|
| Wersja polska | 6379 tokenów |
| Wersja angielska | 2505 tokenów |
| Wersja niemiecka | 2496 tokenów |
Źródło: badanie własne Roberta Marczyńskiego, pomiar 4 października 2026; wyniki.json w zbiorze danych.
Pliki zbioru
- Cały pakiet ZIP (tokenizery-2026-10.zip)
Korpus, oba skrypty, wyniki, manifest, wymagania i metoda w jednym archiwum.
- Metoda (README.md)
Pytanie, metoda, korpus, wynik w tabeli, deklaracje języków w kartach modeli, lista niezmierzonych repozytoriów i ograniczenia.
- Wyniki (wyniki.json)
Dla każdego tokenizera: znaki, tokeny i tokeny na 1000 znaków w czterech plikach oraz stosunki PL/EN, DE/EN i PL/DE dla tekstu prawnego.
- Manifest (manifest.json)
Przypięte rewizje repozytoriów Hugging Face, sumy SHA-256 plików tokenizerów i kart, daty pobrania, licencje i powody pominięć.
- Skrypt pomiaru (mierz_tokenizery.py)
Pobiera tokenizery z przypiętych rewizji, sprawdza sumy kontrolne i liczy tokeny; działa bez GPU i bez logowania.
- Pomiar własnych dokumentów (mierz_wlasny_tekst.py)
Liczy tokeny własnych plików lokalnie tymi samymi przypiętymi tokenizerami; nie zmienia korpusu badania ani opublikowanych wyników.
- Wymagania (requirements.txt)
Przypięte wersje bibliotek tokenizers i huggingface_hub.
- Tekst prawny po polsku (korpus/prawo-PL.txt)
Art. 4, 50 i 73 rozporządzenia 2024/1689 (AI Act) oraz art. 33 i 34 rozporządzenia 2016/679 (RODO), wersja polska z EUR-Lex.
- Tekst prawny po angielsku (korpus/prawo-EN.txt)
Te same przepisy w wersji angielskiej z EUR-Lex.
- Tekst prawny po niemiecku (korpus/prawo-DE.txt)
Te same przepisy w wersji niemieckiej z EUR-Lex, pobranej 4 października 2026.
- Proza biznesowa (korpus/biznes-PL.txt)
Początki trzech tekstów serwisu o kosztach i wdrożeniach AI, tylko po polsku.
- Źródła korpusu (korpus-zrodla.json)
Adresy i daty pobrania tekstu niemieckiego, sposób ekstrakcji i porównanie struktury wersji PL, EN i DE.
- Weryfikacja (weryfikacja.json)
Zgodność dwóch uruchomień skryptu i porównanie z wcześniejszym, niepublikowanym pilotażem.
Jak czytać te dane
W wyniki.json każdy tokenizer ma liczbę znaków i tokenów dla czterech plików z katalogu korpus/ oraz tokeny na 1000 znaków. Stosunki PL/EN, DE/EN i PL/DE to ilorazy liczby tokenów wybranych przepisów w dwóch językach. Przypięte wersje plików tokenizerów i ich sumy kontrolne są w manifest.json, a mierz_tokenizery.py odtwarza pomiar bez karty graficznej i bez logowania. Mierzone są same tokenizery, nie jakość odpowiedzi modeli.
Korpus obejmuje pięć artykułów prawa UE i polską prozę biznesową. Wersje językowe różnią się także edycją; niemiecki plik zawiera pierwotne brzmienie RODO sprzed sprostowań. Dokładnej edycji źródłowego HTML dla odziedziczonych plików PL i EN nie udało się ponownie potwierdzić. Szczegóły opisuje metoda. Wyniki dotyczą udostępnionych plików, nie aktualnego tekstu prawa ani całej polszczyzny.
Do własnych dokumentów służy osobny mierz_wlasny_tekst.py. Liczy lokalnie tokeny plików UTF-8, korzystając z tych samych przypiętych tokenizerów. Nie wymaga zmieniania korpusu badania.
Licencja
Pliki własne badania (wyniki, skrypt, manifest, metoda): CC BY 4.0, z uznaniem autorstwa „Robert Marczyński, ekspertodsztucznejinteligencji.pl”. Teksty przepisów w katalogu korpus/ pochodzą z EUR-Lex (ponowne wykorzystanie na zasadach decyzji Komisji 2011/833/UE). Tokenizery nie są częścią zbioru; mają licencje swoich modeli, zapisane w manifest.json.