Przejdź do treści
hinkingRobert Marczyński, strona główna

Zbiór danych: tokenizery otwartych modeli na polskim, angielskim i niemieckim tekście

Pomiar z 4 października 2026: liczba tokenów, na które 10 publicznie dostępnych tokenizerów modeli (m.in. Kolibri-1, Bielik-11B-v2.3, PLLuM, EuroLLM-9B, Qwen3, Mistral Small 3.1) dzieli wybrane przepisy AI Act i RODO po polsku, angielsku i niemiecku oraz polską prozę biznesową. Przypięte wersje plików, skrypt, korpus i wyniki.

Pomiar: 4 października 2026 · Wyniki i wnioski: Kolibri od Aleph Alpha: polski tekst w 10 tokenizerach · Metoda i ograniczenia: README.md

Kolibri: długość zapisu trzech wersji próbki prawaWybrane przepisy AI Act i RODO. Wersje różnią się długością, interpunkcją i edycją. Pomiar samego tekstu, bez oceny odpowiedzi modelu.
Dane z wykresu w tabeli
PozycjaTokeny w całym pliku
Wersja polska6379 tokenów
Wersja angielska2505 tokenów
Wersja niemiecka2496 tokenów

Źródło: badanie własne Roberta Marczyńskiego, pomiar 4 października 2026; wyniki.json w zbiorze danych.

Pliki zbioru

Jak czytać te dane

W wyniki.json każdy tokenizer ma liczbę znaków i tokenów dla czterech plików z katalogu korpus/ oraz tokeny na 1000 znaków. Stosunki PL/EN, DE/EN i PL/DE to ilorazy liczby tokenów wybranych przepisów w dwóch językach. Przypięte wersje plików tokenizerów i ich sumy kontrolne są w manifest.json, a mierz_tokenizery.py odtwarza pomiar bez karty graficznej i bez logowania. Mierzone są same tokenizery, nie jakość odpowiedzi modeli.

Korpus obejmuje pięć artykułów prawa UE i polską prozę biznesową. Wersje językowe różnią się także edycją; niemiecki plik zawiera pierwotne brzmienie RODO sprzed sprostowań. Dokładnej edycji źródłowego HTML dla odziedziczonych plików PL i EN nie udało się ponownie potwierdzić. Szczegóły opisuje metoda. Wyniki dotyczą udostępnionych plików, nie aktualnego tekstu prawa ani całej polszczyzny.

Do własnych dokumentów służy osobny mierz_wlasny_tekst.py. Liczy lokalnie tokeny plików UTF-8, korzystając z tych samych przypiętych tokenizerów. Nie wymaga zmieniania korpusu badania.

Licencja

Pliki własne badania (wyniki, skrypt, manifest, metoda): CC BY 4.0, z uznaniem autorstwa „Robert Marczyński, ekspertodsztucznejinteligencji.pl”. Teksty przepisów w katalogu korpus/ pochodzą z EUR-Lex (ponowne wykorzystanie na zasadach decyzji Komisji 2011/833/UE). Tokenizery nie są częścią zbioru; mają licencje swoich modeli, zapisane w manifest.json.