# Clef od Cloudflare po polsku: trafność i koszt w pomiarze na 2974 poleceniach

> W moim pomiarze z 2–3 października 2026, na 2974 parach poleceń, Clef-flash od Cloudflare rozpoznał intencję w 88,4% polskich poleceń i w 90,1% angielskich, a różnica wykracza poza granice błędu losowego. Wynik analizy po fakcie, według którego po polsku model częściej myli się przy wysokiej pewności, nie potwierdził się na nowych danych.

Autor: Robert Marczyński · Opublikowano: 2026-10-03 · Aktualizacja: 2026-10-03
Kanoniczny URL: https://ekspertodsztucznejinteligencji.pl/blog/clef-po-polsku-pomiar

Krótka odpowiedź: mniejsza wersja klasyfikatora Cloudflare rozpoznaje intencję w krótkich polskich poleceniach nieco gorzej niż w angielskich. W moim pomiarze z 2–3 października 2026 Clef-flash trafił w 2630 z 2974 polskich poleceń z części testowej zbioru MASSIVE (88,4%) i w 2681 tych samych poleceń po angielsku (90,1%); różnica 1,7 punktu wykracza poza granice błędu losowego. W analizie głównej, na 1000 par wylosowanych przed pomiarem, trafił 881 razy po polsku i 894 razy po angielsku; różnica była podobna, ale przy tej liczbie par nie dało się jej odróżnić od przypadku. Wynik analizy dodanej po fakcie, według którego po polsku model częściej myli się przy pewności co najmniej 0,9 (5,8% wobec 3,5% błędnych), na pozostałych 1974 parach części testowej się nie potwierdził. Przy tak krótkich poleceniach koszt decyzji w Workers AI wyznacza przede wszystkim długość opisu opcji. Według cennika Workers AI i kursu NBP z 2 października 2026 koszt samych tokenów przy 60 opcjach to około 4,64 zł za 10 tys. decyzji w modelu Clef-flash i 12,37 zł w dużym Clefie.

## Co zmierzyłem 2 i 3 października 2026

Sprawdziłem, jak mniejszy z dwóch nowych klasyfikatorów Cloudflare radzi sobie z polskim. Cloudflare udostępnił 1 października 2026 roku Clef (27 mld parametrów) i Clef-flash (9,4 mld), oba z otwartymi wagami na licencji Apache 2.0. Nie piszą tekstu. Dostają opis sytuacji oraz pytania, każde z listą dozwolonych odpowiedzi, a w jednym przebiegu zwracają prawdopodobieństwo każdej z nich. Karta modelu nie wymienia obsługiwanych języków.

Clef-flash uruchomiłem na swoim komputerze, Macu z procesorem M5 Pro i 48 GB pamięci, z wagami pobranymi z Hugging Face. Duży Clef w formacie BF16, w którym go wydano, zajmuje około 55 GB i się nie zmieścił, a jego zmniejszona wersja byłaby już innym modelem. API Cloudflare nie używałem.

Polecenia wziąłem ze zbioru MASSIVE, który Amazon udostępnia na licencji CC BY 4.0. Są w nim te same krótkie komendy do asystenta głosowego w 52 językach, każda z etykietą intencji, na przykład „obudź mnie o piątej rano w tym tygodniu” z etykietą ustawienia alarmu. Z części testowej wylosowałem 1000 par do analizy głównej (każda para to polecenie po polsku i to samo po angielsku), a potem zmierzyłem pozostałe 1974 pary, tak że pomiar objął całą część testową (2974 pary). Model za każdym razem wybierał jedną z 60 intencji, opisanych samymi nazwami etykiet, bez objaśnień pisanych przeze mnie. Pytanie i nazwy opcji były po angielsku w obu wariantach; zmieniał się tylko język polecenia.

Plan analizy spisałem przed pomiarem. Pilot na 100 parach przeprowadziłem dwa razy i oba przebiegi dały identyczne decyzje. Tekst opublikowałem rano 3 października 2026 z wynikiem analizy głównej. Obliczenia dla pozostałych 1974 par, pomyślanych jako sprawdzenie, trwały do popołudnia tego dnia. Ich wynik dopisałem, nie ruszając analizy głównej, i wpłynął on na dwa wnioski: różnica w trafności wykroczyła poza granice błędu losowego, a różnica w błędach przy wysokiej pewności się nie potwierdziła. Skrypty, protokół i wszystkie 5948 decyzji są w [zbiorze danych badania](/badania/clef-pl-2026-10).

## Trafność po polsku nieco niższa niż po angielsku

Na 2974 parach zmierzonych 2–3 października 2026 Clef-flash trafił w intencję w 88,4% polskich i 90,1% angielskich poleceń. W analizie głównej, na 1000 par, trafił 881 razy po polsku i 894 razy po angielsku. Jeśli liczyć tylko obszar, czyli na przykład „alarm” albo „kalendarz” bez konkretnej czynności, trafność w analizie głównej rosła do 92,4% i 93,1%.

| Miara (pomiar 2–3.10.2026, analiza główna, 1000 par) | Polski | Angielski |
|---|---|---|
| Trafność intencji, 60 opcji | 88,1% | 89,4% |
| Trafność obszaru (z przewidzianej intencji) | 92,4% | 93,1% |
| Makro-F1 (średnia po intencjach) | 0,827 | 0,849 |
| Wynik Briera (im mniej, tym lepiej) | 0,192 | 0,164 |
| Błąd kalibracji ECE (nie rozróżnia języków) | 0,037 | 0,043 |
| Błędne wśród decyzji z pewnością od 0,9 (po fakcie) | 5,8% | 3,5% |
| Średnia liczba tokenów wejścia na decyzję | 1325,65 | 1322,25 |

W analizie głównej różnica w trafności wynosiła 1,3 punktu procentowego na korzyść angielskiego, a 95-procentowy przedział ufności sięgał od 2,9 punktu na korzyść angielskiego do 0,3 punktu na korzyść polskiego. Tylko po polsku model trafił w 26 parach, tylko po angielsku w 39; test McNemara dawał p = 0,136. W 921 parach na 1000 wybrał w obu językach tę samą intencję, trafnie albo nie. Sama analiza główna nie rozstrzygała więc, czy polski wypada gorzej.

Rozstrzygnęło uzupełnienie. Na pozostałych 1974 parach części testowej różnica wyniosła 1,9 punktu na korzyść angielskiego, z przedziałem ufności od 1,0 do 2,9 punktu; tylko po polsku model trafił w 27 parach, a tylko po angielsku w 65 (test McNemara: p < 0,001). Liczyłem te same miary tymi samymi wzorami i z tym samym ziarnem bootstrapu (skrypt uzupelnienie.py, który dla 1000 par analizy głównej daje dokładnie jej wyniki).

| Miara (pomiar 2–3.10.2026, cała część testowa, 2974 pary) | Polski | Angielski |
|---|---|---|
| Trafność intencji, 60 opcji | 88,4% | 90,1% |
| Trafność obszaru | 92,2% | 93,0% |
| Makro-F1 | 0,856 | 0,880 |
| Wynik Briera (im mniej, tym lepiej) | 0,184 | 0,159 |
| Błąd kalibracji ECE | 0,032 | 0,033 |
| Błędne wśród decyzji z pewnością od 0,9, tylko 1974 nowe pary (sprawdzenie analizy po fakcie) | 4,4% | 3,8% |

W całej części testowej różnica wynosi 1,7 punktu, z przedziałem od 0,9 do 2,6 punktu, a tę samą intencję w obu językach model wybrał w 2777 parach na 2974. W analizie głównej (1,3 punktu) i na nowych parach (1,9 punktu) różnica jest podobnej wielkości. Na krótkich, tłumaczonych poleceniach polski kosztuje więc Clef-flash około 1,7 punktu trafności.

W analizie głównej różnica w makro-F1, które daje każdej intencji tę samą wagę, wynosiła 0,023 i, podobnie jak różnica trafności, mieściła się w granicach błędu losowego (przedział policzony po fakcie). Prawie cała przewaga angielskiego przypadała w tej analizie na rzadsze intencje: w tych, które miały w próbie głównej najwyżej 11 przykładów (182 pary), trafnych było 86,3% polskich i 91,8% angielskich decyzji, a rozbieżnych par było 11 na korzyść angielskiego i 1 na korzyść polskiego. W częstszych intencjach (818 par) wyszło 88,5% i 88,9%. Ten podział zrobiłem po fakcie, poza planem analizy, a jego wynik na nowych parach się nie powtórzył: w tych samych rzadkich intencjach (425 par) trafnych było 90,6% polskich i 92,7% angielskich decyzji, a w częstszych (1549 par) 88,1% i 89,9%. Przewaga angielskiego rozkłada się więc na obie grupy.

## Czy pewności modelu można ufać

W przybliżeniu tak, w obu językach, choć po polsku model nieco bardziej przecenia swoje decyzje. Clef zwraca prawdopodobieństwo każdej odpowiedzi, a w pomiarze z 2–3 października 2026 deklarowana pewność była w obu językach bliska rzeczywistej trafności. W całej części testowej średnia pewność wyniosła 91,4% po polsku przy trafności 88,4% i 91,6% po angielsku przy 90,1%, czyli polski wariant zawyżał pewność o około 3 punkty, a angielski o około 1,5 punktu. Błąd kalibracji ECE wyniósł w niej 0,032 i 0,033: w grupach decyzji o podobnej pewności deklarowana pewność odbiegała od trafności średnio o około 3 punkty procentowe. Tej miary nie używam do porównania języków, bo w analizie głównej przy podziale na 10 zamiast 15 grup kolejność się odwracała (0,035 i 0,030).

Wynik Briera, który był w planie analizy, łączy trafność z pewnością. W analizie głównej wyniósł 0,192 po polsku wobec 0,164 po angielsku (im mniej, tym lepiej), a na pozostałych 1974 parach różnica wyniosła 0,024, z przedziałem od 0,011 do 0,037, więc się powtórzyła. Jej źródło okazało się jednak inne. W analizie głównej za mniej więcej dwie trzecie różnicy odpowiadało 13 dodatkowych błędów po polsku, a za resztę wyższa pewność przy błędach (średnio 0,76 wobec 0,73). Na nowych parach całą różnicę dawały dodatkowe błędy po polsku (225 wobec 187, czyli 38 więcej), a pewność przy tych błędach nie była wyższa: 0,735 wobec 0,758. Przedziały dla wyniku Briera i ten rozkład policzyłem po fakcie, na prośbę recenzentów tekstu.

Najdalej idący wniosek z porannej wersji tekstu dotyczył progu pewności i się nie potwierdził. W analizie głównej pewność co najmniej 0,9 miało 814 polskich decyzji i 809 angielskich. Trafnych było wśród nich 94,2% po polsku i 96,5% po angielsku, czyli błędnych 47 i 28, a różnica 2,3 punktu procentowego wykraczała poza granice błędu losowego (przedział od 1,2 do 3,5 punktu). W paśmie od 0,90 do 0,95 trafnych było 83,3% ze 174 polskich decyzji i 90,8% ze 196 angielskich. Oba rachunki zrobiłem jednak po fakcie, na tych samych danych, na których różnice zauważyłem. Na pozostałych 1974 parach wśród decyzji z pewnością co najmniej 0,9 (po polsku 1602, po angielsku 1599) błędnych było 4,4% i 3,8%, a przedział różnicy sięga od 0,2 punktu mniej do 1,4 punktu więcej błędów po polsku. W paśmie 0,90–0,95 trafnych było 88,1% z 386 polskich decyzji i 90,8% z 393 angielskich, więc różnica zmalała z 7,5 do 2,8 punktu, z przedziałem od 5,9 punktu na korzyść angielskiego do 0,3 na korzyść polskiego. Przy progu 0,9 i w paśmie kierunek się utrzymał, ale obie różnice mieszczą się w granicach błędu losowego. Przy progu 0,95 odsetek błędnych był w obu językach taki sam: 2,1%. W całej części testowej przy progu 0,9 wychodzi 4,9% wobec 3,7% (przedział różnicy od 0,5 do 1,9 punktu), a w paśmie różnica trafności wynosi 4,2 punktu. Te liczby obejmują jednak także 1000 par, na których różnice zauważyłem, dlatego za sprawdzenie uznaję tylko nowe pary.

Wycofuję więc poranną sugestię, że dla polskich tekstów próg trzeba będzie prawdopodobnie ustawić wyżej. Próg 0,9 odsyła do człowieka mniej więcej co piątą decyzję i na pozostałych 1974 parach działał po polsku niewiele gorzej niż po angielsku, ale dla własnych tekstów i tak trzeba go ustalić na własnej próbce. W analizie głównej różnica utrzymywała się przy progach od 0,8 do 0,95 i zanikała powyżej 0,95; na nowych parach była mniejsza przy każdym progu, na przykład przy 0,8 błędnych było 7,0% polskich i 5,9% angielskich decyzji. Wszystkie progi są w README zbioru. Z planu analizy pochodzą trafność, makro-F1, ECE przy 15 grupach i sam wynik Briera; odsetki przy progach i w paśmie, przedział dla makro-F1 oraz ECE przy 10 grupach policzyłem po fakcie, także na prośbę recenzentów.

## Ile to kosztuje w API Cloudflare

Według cennika Workers AI i kursu NBP z 2 października 2026 roku koszt samych tokenów dla 10 tys. decyzji z wyborem jednej z 60 opcji to około 4,64 zł w modelu Clef-flash i 12,37 zł w Clefie. Clef nie generuje tekstu, a cennik podaje dla niego tylko stawkę za tokeny wejścia: 0,09 USD za milion w modelu Clef-flash i 0,24 USD w Clefie. Tokenizer i kod przygotowujący wejście są w obu modelach identyczne, więc to samo zapytanie zajmuje w nich tyle samo tokenów. Przeliczenie zakłada kurs 3,8881 zł za dolara i to, że Cloudflare liczy tokeny tak jak kod z repozytorium modelu. Rzeczywisty rachunek zależy też od rozliczenia konta. Według cenników odczytanych 3 października 2026 roku Cloudflare daje 10 tys. neuronów (jednostek rozliczeniowych Workers AI) dziennie bez opłat, a Clef-flash zużywa 8182 neurony na milion tokenów wejścia, więc darmowy limit wystarcza na około 920 decyzji dziennie przy pytaniu z 60 opcjami (w Clefie na około 350). W standardowym rozliczeniu powyżej limitu potrzebny jest plan Workers Paid z minimalną opłatą 5 USD miesięcznie, czyli po tym samym kursie około 19,44 zł. Za Workers AI można też płacić przedpłaconymi środkami (credits) w AI Gateway, a według dokumentacji AI Gateway odczytanej tego samego dnia Cloudflare dolicza do ich zakupu 5%.

Przy krótkich poleceniach o rachunku decyduje opis opcji. Samo polecenie zajmowało średnio 10,65 tokenu po polsku i 7,25 po angielsku, czyli polskie zdanie było o mniej więcej połowę dłuższe w tokenach przy podobnej liczbie znaków. Pytanie z 60 opcjami to jednak 1315 tokenów, więc cała decyzja po polsku była droższa tylko o 0,3%. Rozmiary pytań z 18 opcjami i tak/nie policzyłem samym tokenizerem, bez uruchamiania modelu, więc trafności przy takich pytaniach nie znam.

| Pytanie (średnio, po polsku) | Tokeny wejścia | 10 tys. decyzji, Clef-flash | 10 tys. decyzji, Clef |
|---|---|---|---|
| Jedna z 60 intencji | 1325,65 | 4,64 zł | 12,37 zł |
| Jeden z 18 obszarów | 409,65 | 1,43 zł | 3,82 zł |
| Tak albo nie | 155,65 | 0,54 zł | 1,45 zł |

Te same wagi można uruchomić na własnej maszynie. Rachunek dla wynajętej karty pokazuję w tekście [własny model czy API](/blog/wlasny-model-czy-api-rachunek): wynajęta H200 z dużym Clefem może wyjść taniej od API dopiero powyżej około 16,4 mld tokenów wejścia miesięcznie, co przy pytaniu z 60 opcjami daje około 12,4 mln decyzji.

## Czego ten pomiar nie mówi

Polskie zdania w MASSIVE to tłumaczenia krótkich komend, średnio 36 znaków. Zgłoszenia klientów są dłuższe, pisane własnymi słowami, z literówkami i kilkoma sprawami naraz, więc ten wynik nie mówi, jak model poradzi sobie z mailem do działu reklamacji. Przy dłuższych tekstach rośnie też koszt: polskie zdanie miało tu średnio 3,35 znaku na token, więc przy podobnej gęstości mail z 1000 znaków dokłada około 300 tokenów do każdej decyzji, a tabela kosztów tego nie uwzględnia.

Zmierzyłem tylko Clef-flash i tylko na swoim komputerze. Nie sprawdzałem, czy Workers AI zwraca te same decyzje, bo Cloudflare nie podaje, w jakiej precyzji udostępnia model; opóźnień API też nie mierzyłem. Pytanie było po angielsku, a opcje opisałem samymi angielskimi nazwami etykiet. Wariantu z polskimi nazwami kategorii nie mierzyłem, a opisy pisane pod konkretny proces mogą wynik poprawić albo pogorszyć. Mediana czasu jednej decyzji na moim Macu, od 1,7 do 3,8 s w pilocie (zależnie od trybu obliczeń) i 3,9 s w próbie głównej oraz w uzupełnieniu, kiedy brakowało mu pamięci, opisuje tylko to środowisko.

## Jak sprawdzić Clef na własnych zgłoszeniach

Najprościej powtórzyć ten pomiar na własnych danych. Do oceny trafności wystarczy 200–300 zgłoszeń z etykietą nadaną przez człowieka i lista kategorii, której używa zespół: przy 250 zgłoszeniach i trafności około 88% przedział ufności to mniej więcej ±4 punkty. Do ustalenia progu pewności potrzeba więcej danych i dwóch osobnych części. Na pierwszej wybierz próg, a na drugiej zmierz odsetek błędów powyżej niego; liczony na tej samej próbce, na której wybrano próg, wyjdzie zaniżony. Ten pomiar pokazał też, że wynik znaleziony po fakcie trzeba sprawdzić na nowych danych: różnica w błędach przy progu 0,9, zauważona w analizie głównej, na pozostałych parach zmalała z 2,3 do 0,6 punktu. Przy 800 decyzjach powyżej progu w części sprawdzającej i 5% błędów przedział ma około ±1,5 punktu, więc ta część powinna liczyć około tysiąca zgłoszeń. Skrypt ze [zbioru danych](/badania/clef-pl-2026-10) da się przerobić tak, żeby zamiast MASSIVE czytał plik z firmowymi zgłoszeniami. Model działa lokalnie, więc zgłoszenia nie opuszczają komputera.

Wynik warto sprowadzić do trzech liczb: trafności ogółem, odsetka błędów wśród decyzji powyżej wybranego progu pewności i odsetka decyzji poniżej progu, które trafią do człowieka. Do tego koszt z tabeli wyżej, przeliczony na liczbę i długość zgłoszeń w miesiącu.

## Najczęstsze pytania

**Czy Clef od Cloudflare działa po polsku?**

Działa, choć trochę słabiej niż po angielsku. W moim pomiarze z 2–3 października 2026 mniejsza wersja, Clef-flash, rozpoznała intencję w 88,4% krótkich polskich poleceń i w 90,1% tych samych poleceń po angielsku, przy wyborze jednej z 60 intencji, na wszystkich 2974 parach z części testowej zbioru MASSIVE. Różnica 1,7 punktu procentowego wykracza poza granice błędu losowego; w analizie głównej na 1000 par (88,1% wobec 89,4%) jeszcze się w nich mieściła. Polecenia były tłumaczeniami komend do asystenta głosowego, a nie zgłoszeniami klientów. Dużego Clefa nie mierzyłem.

**Ile kosztuje klasyfikacja 10 tys. tekstów w Clefie?**

Według cennika Workers AI z 2 października 2026 i kursu NBP z tego dnia koszt samych tokenów dla 10 tys. decyzji przy krótkich poleceniach i wyborze jednej z 60 opcji to około 4,64 zł w modelu Clef-flash i 12,37 zł w Clefie. Przy pytaniu tak/nie to około 0,54 zł i 1,45 zł. Według cenników i dokumentacji Cloudflare odczytanych 3 października 2026 rachunek zależy też od darmowego limitu 10 tys. neuronów (jednostek rozliczeniowych Workers AI) dziennie i od sposobu rozliczenia: standardowo powyżej limitu potrzebny jest plan Workers Paid z minimalną opłatą 5 USD miesięcznie, a za Workers AI można też płacić przedpłaconymi środkami w AI Gateway, do których zakupu Cloudflare dolicza 5%. Cennik podaje tylko stawkę za tokeny wejścia, a przy krótkich poleceniach i 60 opcjach prawie wszystkie zajmuje opis opcji.

**Czy Clef można uruchomić na własnym komputerze?**

Tak, wagi obu modeli są na Hugging Face na licencji Apache 2.0. Clef-flash ma 9,4 mld parametrów i w formacie BF16, w którym go wydano, zajmuje około 19 GB; uruchomiłem go na Macu z procesorem M5 Pro i 48 GB pamięci. Duży Clef ma 27 mld parametrów i około 55 GB, więc na tym komputerze się nie zmieścił.

**Czy pewności zwracanej przez Clef można ufać?**

W przybliżeniu tak. W moim pomiarze z 2–3 października 2026, na 2974 parach poleceń, Clef-flash miał po polsku średnią pewność 91,4% przy trafności 88,4%, a po angielsku 91,6% przy 90,1%, więc po polsku nieco bardziej przeceniał swoje decyzje. Analiza dodana po fakcie pokazała na 1000 par analizy głównej, że wśród decyzji z pewnością co najmniej 0,9 błędnych było 5,8% polskich i 3,5% angielskich; na pozostałych 1974 parach części testowej było to 4,4% i 3,8%, a ta różnica mieści się w granicach błędu losowego. Próg pewności dla własnych tekstów trzeba ustalić na własnej próbce.


## Źródła

- Badanie własne — Clef-flash na polskich i angielskich poleceniach (pomiar 2–3.10.2026; decyzje, skrypty i protokół na licencji CC BY 4.0): https://ekspertodsztucznejinteligencji.pl/badania/clef-pl-2026-10
- Cloudflare — Introducing Clef: our open-source decision models, and new RL fine-tuning platform (1.10.2026): https://blog.cloudflare.com/clef-decision-models/
- Hugging Face — karta modelu Cloudflare/clef-flash (Apache 2.0, model bazowy Qwen3.5-9B, odczyt 2.10.2026): https://huggingface.co/Cloudflare/clef-flash
- Hugging Face — karta modelu Cloudflare/clef (Apache 2.0, model bazowy Qwen3.8-27B): https://huggingface.co/Cloudflare/clef
- Cloudflare Workers AI — cennik (odczyt 2 i 3.10.2026): clef 0,24 USD, clef-flash 0,09 USD za mln tokenów wejścia; 21818 i 8182 neurony za mln tokenów; 10 tys. neuronów dziennie bez opłat; w standardowym rozliczeniu powyżej limitu plan Workers Paid; za Workers AI można też płacić przedpłaconymi środkami AI Gateway (ustawienie „Unified billing”): https://developers.cloudflare.com/workers-ai/platform/pricing/
- Cloudflare AI Gateway — Unified billing (odczyt 3.10.2026): przedpłacone środki (credits) na Workers AI i inne modele, do każdego zakupu doliczana opłata 5%: https://developers.cloudflare.com/ai-gateway/features/unified-billing/
- Cloudflare Workers — cennik planów (odczyt 3.10.2026): Workers Paid z minimalną opłatą 5 USD miesięcznie za konto: https://developers.cloudflare.com/workers/platform/pricing/
- Amazon — MASSIVE 1.1, zbiór poleceń w 52 językach (51 z wersji 1.0 i kataloński; CC BY 4.0): https://github.com/alexa/massive
- FitzGerald i in. — MASSIVE: A 1M-Example Multilingual Natural Language Understanding Dataset with 51 Typologically-Diverse Languages (2022): https://arxiv.org/abs/2204.08582
- NBP — tabela A nr 192/A/NBP/2026 z 2.10.2026: 1 USD = 3,8881 zł: https://api.nbp.pl/api/exchangerates/rates/a/usd/2026-10-02/?format=json
