Przejdź do treści
hinkingRobert Marczyński, strona główna

Kolibri od Aleph Alpha: polski tekst w 10 tokenizerach

Badanie własne

W pomiarze z 4 października 2026 tokenizer Kolibri zapisał próbkę prawa po polsku w 6379 tokenach, a po angielsku w 2505, czyli stosunek wyniósł 2,55; to pomiar długości zapisu, nie jakości odpowiedzi modelu.

7 min czytaniaPomiar 04.10.2026zbiór danych6 źródeł

Kolibri: długość zapisu trzech wersji próbki prawaWybrane przepisy AI Act i RODO. Wersje różnią się długością, interpunkcją i edycją. Pomiar samego tekstu, bez oceny odpowiedzi modelu.
Dane z wykresu w tabeli
PozycjaTokeny w całym pliku
Wersja polska6379 tokenów
Wersja angielska2505 tokenów
Wersja niemiecka2496 tokenów

Źródło: badanie własne Roberta Marczyńskiego, pomiar 4 października 2026; wyniki.json w zbiorze danych.

W pomiarze z 4 października 2026 tokenizer Kolibri zapisał próbkę prawa po polsku w 6379 tokenach, a po angielsku w 2505, czyli stosunek wyniósł 2,55; to pomiar długości zapisu, nie jakości odpowiedzi modelu. Niemiecka wersja zajęła 2496 tokenów. Sprawdziłem te same pliki w tokenizerach 10 modeli i publikuję dane, korpus oraz skrypt, żeby wynik można było odtworzyć.

Tokenizer dzieli tekst na jednostki, które model przetwarza jako tokeny. Ten sam dokument może zajmować różną część okna kontekstu w różnych modelach. To istotne przy wyborze rozwiązania do polskich dokumentów, ale samo liczenie tokenów nie mówi, czy odpowiedź będzie trafna ani ile będzie kosztowała.

Co wnosi premiera Kolibri

Aleph Alpha udostępniła Kolibri 3 października 2026 z otwartymi wagami na licencji Apache 2.0. Producent deklaruje specjalizację w niemieckim i angielskim. W sprawdzonej karcie modelu nie znalazłem pomiaru jakości dla polskiego. To powód do własnego testu, a nie dowód, że model nie potrafi odpowiadać po polsku.

Według karty Kolibri w wersji użytej w badaniu model ma 78,1 mld parametrów, z czego 3,46 mld jest aktywnych na token. Same wagi FP8 zajmują około 78 GB. Minimalny sprzęt obejmuje między innymi dwie karty A100 80 GB, dwie H100 SXM5 albo jedną H200. Natywny kontekst wynosi 262 144 tokeny; producent opisuje rozszerzenie do 1 048 576, ale przy złożonych zadaniach zaleca limit natywny. Mała liczba aktywnych parametrów nie oznacza więc małego zapotrzebowania na pamięć.

Do sprawdzenia tokenizera wystarczy zwykły komputer. Nie pobierałem wag modeli ani nie uruchamiałem generowania odpowiedzi.

Co dokładnie zmierzyłem

Porównałem 10 publicznie dostępnych tokenizerów: Kolibri-1, Bielik-11B-v2.3, dwie wersje PLLuM, EuroLLM-9B, Mistral Small 3.1, Qwen3⁠-⁠8B, Clef-flash, gpt-oss-20b i Phi-4-mini. Dobór ograniczyłem do plików, które mogłem pobrać bez logowania. Lista nie obejmuje wszystkich modeli; pominąłem między innymi Bielika 3 i 2.6 oraz Llamę 3.1 i Gemmę 3 z bramką dostępu. Dokładne wersje, licencje i przyczyny pominięć są w manifeście.

Korpus prawa obejmuje art. 4, 50 i 73 AI Act oraz art. 33 i 34 RODO w wersjach polskiej, angielskiej i niemieckiej. PL ma 13 868 znaków, EN 12 825, DE 14 347. Pliki PL i EN oraz polską prozę biznesową o długości 9005 znaków zachowałem bajt w bajt z wrześniowego pomiaru w API. Niemieckie przepisy pobrałem osobno z EUR-Lex. To niewielki korpus dwóch gatunków tekstu, nie reprezentatywna próba języka.

Liczyłem sam tekst po normalizacji Unicode NFC, bez szablonu czatu i dodawania tokenów specjalnych, paddingu oraz obcinania. Wersje tokenizerów są przypięte do konkretnych commitów, a pliki zabezpieczone sumami SHA-256. Powtórzenia pomiaru dały te same liczby. Opis metody zawiera także kontrolę struktury tekstów i ograniczenia ich pochodzenia.

Wersje językowe nie są identyczne pod względem długości, interpunkcji i edycji: niemiecki plik zawiera pierwotne brzmienie RODO sprzed wskazanych w metodzie sprostowań. Nie udało się też ponownie potwierdzić dokładnej edycji źródłowego HTML dla odziedziczonych plików PL i EN. Poniższe liczby dotyczą opublikowanych plików, których tożsamość da się sprawdzić, a nie aktualnego tekstu prawa.

Polski tekst prawny: od 308 do 460 tokenów na 1000 znaków

W pomiarze z 4 października 2026 Kolibri zapisał polską próbkę prawa w 460 tokenach na 1000 znaków, a EuroLLM-9B w 308. To granice uzyskane w tej dziesiątce tokenizerów. Tabela jest uporządkowana malejąco według długości zapisu polskiej próbki.

Tokenizer Prawo PL Prawo EN Prawo DE Tokeny PL / EN
Kolibri-1 460,0 195,3 174,0 2,55
Bielik-11B-v2.3 431,4 224,9 324,2 2,07
Llama-PLLuM-8B-2412 369,5 194,1 285,8 2,06
Qwen3⁠-⁠8B 361,5 198,1 286,8 1,97
PLLuM-12B-2512 330,1 200,9 236,6 1,78
Mistral Small 3.1 330,1 200,9 236,6 1,78
gpt-oss-20b 321,5 193,7 217,1 1,79
Phi-4-mini-instruct 321,5 193,7 217,1 1,79
Clef-flash 310,6 201,6 220,3 1,67
EuroLLM-9B-2512 308,0 230,3 247,4 1,45

Trzy kolumny „Prawo” pokazują tokeny na 1000 znaków. Ostatnia kolumna to iloraz całkowitej liczby tokenów polskiego i angielskiego pliku, a nie iloraz wartości z dwóch sąsiednich kolumn. Źródło: pełne wyniki pomiaru.

Dla Kolibri stosunek PL/EN wyniósł 2,55, a PL/DE 2,56. Wartość PL/EN uwzględnia też to, że polska wersja ma więcej znaków niż angielska. Dlatego zestawiam oba rodzaje miar: długość całych wersji językowych oraz tokeny na jednakową liczbę znaków.

Na polskiej prozie biznesowej Kolibri zużył 439 tokenów na 1000 znaków, a EuroLLM 282. W tej próbce EuroLLM potrzebował o 36% mniej tokenów. PLLuM-12B i Mistral Small 3.1 uzyskały identyczne liczby na wszystkich czterech plikach; podobnie gpt-oss-20b i Phi-4-mini. To zgodność wyników na tym korpusie, nie dowód identyczności tokenizerów ani jakości modeli.

Co wynik zmienia w rachunku firmy

Przy tym samym limicie kontekstu więcej tokenów oznacza, że badany tekst zużywa większą część limitu kontekstu. Przy gęstości zmierzonej w Kolibri limit 262 144 tokenów odpowiadałby około 570 tys. znaków polskiego tekstu prawnego, 1,34 mln angielskiego i 1,51 mln niemieckiego. To ekstrapolacja z krótkiej próbki, zakładająca przeznaczenie całego limitu na dokument. W praktyce trzeba zostawić miejsce na instrukcje, historię i odpowiedź; nie sprawdzałem jakości pracy na dokumentach tej długości.

Z tego pomiaru nie da się policzyć mnożnika kosztu ani czasu. Zależą one także od architektury modelu, sprzętu, sposobu grupowania zapytań, długości generowanej odpowiedzi i obciążenia serwera. W API dochodzą stawki oraz zasady rozliczania. Do rachunku własny model czy API należy więc wziąć liczbę tokenów własnych plików, a następnie osobno zmierzyć koszt całego zadania.

Nie traktowałbym wyniku 2,55 jako argumentu za automatycznym tłumaczeniem wszystkich dokumentów na angielski. Tłumaczenie to dodatkowy koszt i możliwość zmiany znaczenia, którą trzeba uwzględnić w porównaniu.

Niemiecki dokument i polska odpowiedź to osobne zadanie

Krótki zapis niemieckiej próbki czyni Kolibri kandydatem do sprawdzenia przy pracy z dokumentami niemieckich kontrahentów. Polski tekst odpowiedzi wymaga jednak osobnej oceny. Przykład wymyślony na potrzeby artykułu dobrze pokazuje różnicę:

Lieferung: vier Wochen nach schriftlicher Freigabe. Preise netto, zzgl. Versand. Zahlungsziel: 30 Tage ab Rechnungsdatum.

Poprawne polskie podsumowanie zachowuje dostawę cztery tygodnie po pisemnej akceptacji i płatność 30 dni od daty faktury. Ceny są netto; wysyłka jest dodatkowo płatna, ale jej kosztu nie podano. To oczekiwany sens przykładu, nie odpowiedź wygenerowana przez Kolibri.

W pilotażu na prawdziwych dokumentach porównałbym model z obecnym sposobem pracy firmy:

  • te same dokumenty, pytania i kryteria zaliczenia ustalone przed testem;
  • poprawność terminów, kwot i warunków oraz kompletność polskiego podsumowania;
  • dopisane informacje, poprawne zgłoszenia braku danych i odmowy mimo obecności odpowiedzi w źródle;
  • czas weryfikacji oraz koszt uzyskania odpowiedzi gotowej do użycia.

Taki test pokaże, czy oszczędny zapis niemieckiego wejścia daje korzyść w konkretnym procesie. Sam pomiar tokenizera tego nie rozstrzyga.

Jak policzyć tokeny własnego dokumentu

W zbiorze danych są dwa osobne skrypty. Pierwszy odtwarza zamrożone badanie i sprawdza tożsamość korpusu. Drugi, mierz_wlasny_tekst.py, liczy lokalnie własne pliki tekstowe przy użyciu tych samych przypiętych tokenizerów. Nie trzeba zmieniać opublikowanych danych ani kupować karty graficznej.

Zacznij od dokumentu typowego dla firmy, na przykład specyfikacji, zgłoszenia klienta albo notatki. Tokeny na 1000 znaków pozwolą oszacować wykorzystanie kontekstu. Następnie sprawdź jakość odpowiedzi oraz czas jej poprawiania. Te pomiary razem dają podstawę do decyzji o wdrożeniu.

Najczęstsze pytania

Czy Kolibri od Aleph Alpha obsługuje język polski?
Karta modelu odczytana 4 października 2026 deklaruje niemiecki i angielski, bez pomiaru jakości po polsku. Sam tokenizer potrafi zakodować polski tekst: w badanej próbce prawa dał 6379 tokenów wobec 2505 dla angielskiej wersji i 2496 dla niemieckiej. Nie testowałem odpowiedzi modelu, więc te liczby nie rozstrzygają, czy poprawnie pisze i rozumuje po polsku.
Ile tokenów zajmuje polski tekst w porównanych tokenizerach?
W pomiarze z 4 października 2026 próbka polskiego tekstu prawnego zajęła od 308 do 460 tokenów na 1000 znaków, a polska proza biznesowa od 282 do 439. Porównanie obejmuje 10 publicznie dostępnych tokenizerów z przypiętymi wersjami. Wyniki dotyczą tych plików, nie całej polszczyzny ani jakości modeli.
Czy 2,55 razy tyle tokenów oznacza 2,55 razy wyższy koszt?
Nie wynika to z tego pomiaru. Stosunek 2,55 opisuje długość zapisu badanych wersji polskiej i angielskiej w tokenizerze Kolibri. Koszt i szybkość zależą też od modelu, sprzętu, długości odpowiedzi i sposobu obsługi zapytań. Nawet w API trzeba znać stawki oraz zużycie całego zadania.
Czy można powtórzyć pomiar bez karty graficznej?
Tak. Opublikowany skrypt odtwarza pomiar na zwykłym komputerze z plików tokenizerów, bez uruchamiania modeli. Osobny skrypt pozwala policzyć własne pliki tekstowe. Pierwsze pobranie tokenizerów wymaga internetu, a dokumenty są przetwarzane lokalnie. Instrukcja, przypięte wersje i sumy kontrolne są w zbiorze danych.

Źródła

Dane zewnętrzne przywołane w tekście mają tu swoje źródła.

  1. Badanie własne: tokenizery otwartych modeli na polskim, angielskim i niemieckim tekście (pomiar 4.10.2026; skrypt, korpus, przypięte wersje i wyniki na licencji CC BY 4.0) (nowa karta)
  2. Aleph Alpha: ogłoszenie Kolibri (3.10.2026, odczyt 4.10.2026): otwarte wagi Apache 2.0 oraz specjalizacja w niemieckim i angielskim (nowa karta)
  3. Hugging Face: karta Kolibri-1 w rewizji badania (odczyt 4.10.2026): parametry, kontekst natywny i rozszerzony, pamięć wag oraz minimalny sprzęt (nowa karta)
  4. Manifest badania: przypięte karty 10 modeli, dostęp do tokenizerów, licencje i pominięte repozytoria (4.10.2026) (nowa karta)
  5. EUR-Lex: rozporządzenie 2024/1689 (AI Act), wersje polska, angielska i niemiecka (nowa karta)
  6. EUR-Lex: rozporządzenie 2016/679 (RODO), wersje polska, angielska i niemiecka (nowa karta)

Udostępnij

Powiązane

Masz konkretny proces do omówienia?

Napisz, jaki to proces i ile razy w miesiącu się powtarza. Odpowiem, czy nadaje się do automatyzacji, również wtedy, gdy odpowiedź brzmi „nie warto”.

Albo prosto na adres: not-a-bot@ekspertodsztucznejinteligencji.pl

Wolisz zadzwonić? +48 787 912 168