Przejdź do treści
hinkingRobert Marczyński, strona główna

Strands Decider po polsku: pomiar modelu AWS i porównanie z Clefem

Badanie własne

W moim pomiarze z 11 października 2026 Strands Decider 2B od AWS rozpoznał intencję w 64,4% polskich i 70,4% angielskich poleceń przy 60 opcjach, a przy 24 (poprawnej i 23 losowych) w 76,0% i 82,9%. Clef-flash na tych samych 1000 parach i 60 opcjach trafił 2 i 3 października w 88,1% i 89,4%.

15 min czytaniaPomiar 11.10.2026zbiór danych6 źródeł

Krótka odpowiedź: Strands Decider po polsku działa, ale trafia rzadziej niż po angielsku i wyraźnie rzadziej niż Clef-flash od Cloudflare. W moim pomiarze z 11 października 2026 roku Strands Decider 2B od AWS trafił w 64,4% polskich i w 70,4% angielskich poleceń przy wyborze jednej z 60 intencji. Mierzyłem na 1000 parach krótkich zdań ze zbioru MASSIVE. Różnica między językami, 6 punktów procentowych, wykracza poza granice błędu losowego. Clef-flash w moim pomiarze z 2 i 3 października trafił na tych samych parach w 88,1% polskich i 89,4% angielskich poleceń. W wariancie z 24 opcjami, poprawną i 23 losowymi, Decider trafił 11 października w 76,0% polskich i 82,9% angielskich poleceń. Większość wzrostu wobec 60 opcji, a po polsku prawie cały, dało usunięcie z listy etykiet, które mylił z poprawną. Przewagą Decidera jest rozmiar: ma 1,9 mld parametrów, prawie pięć razy mniej niż Clef-flash.

Co to jest Strands Decider 2B

Strands Decider 2B to otwarty model decyzyjny, który zespół Strands Agents w AWS ogłosił 1 października 2026 roku i udostępnił na licencji Apache 2.0. Model nie pisze tekstu. Dostaje tekst i pytanie jednego z trzech typów: tak/nie, wybór jednej z kilku opcji albo ocena na skali. Przy wyborze i ocenie na skali zwraca rozkład prawdopodobieństw i pole pewności, a przy pytaniu tak/nie samo prawdopodobieństwo odpowiedzi „tak”. Twórcy przeznaczają go do kierowania zapytań do właściwego modelu, wyboru narzędzia, sprawdzania argumentów i decyzji w bramkach agentów AI.

Model ma 1,9 mld parametrów. Powstał z modelu Qwen3.5⁠-⁠2B-Base, któremu twórcy odcięli część generującą tekst i dodali małą głowicę wskazującą opcję. Okno kontekstu to 4096 tokenów. Od 9 października modelem referencyjnym jest wersja v1-2610 i to ją zmierzyłem. W benchmarku JevBench, którego używają twórcy, ta wersja rozwiązała 180 z 231 zadań. Według twórców Decider należy do nowej klasy modeli decyzyjnych, o której zrobiło się głośno po premierze modelu Jev firmy TypeSafe AI. Microsoft ogłosił 9 października 2026 płatny model podobnego typu, Microsoft-Decision-1, dostępny przez API w Microsoft Foundry. Koszt klasyfikacji zgłoszeń modelem Microsoft-Decision-1 liczę w osobnym tekście.

Clef od Cloudflare działa według tego samego schematu: tekst, pytanie i opcje, a na wyjściu rozkład prawdopodobieństw. Dlatego mogłem zadać Deciderowi dokładnie to samo pytanie, które 2 i 3 października zadałem Clefowi w poprzednim pomiarze.

Jak mierzyłem

Plan analizy zapisałem przed instalacją modelu, a dane i skrypty są w zbiorze danych z pomiaru Strands Decider 2B. Użyłem 1000 par zdań ze zbioru MASSIVE 1.1, tych samych co w pomiarze Clefa. MASSIVE to zbiór krótkich poleceń do asystenta głosowego, a polskie zdania są tłumaczeniami angielskich. Każde zdanie trafiło do modelu osobno, z pytaniem „Which intent does the user's request express?” i 60 opcjami. Opcje to etykiety MASSIVE, na przykład alarm_set, z podkreślnikami zamienionymi na spacje.

Model działał lokalnie na MacBooku z procesorem M5 Pro i 48 GB pamięci. Pilot na 100 parach uruchomiłem dwa razy i oba przebiegi dały identyczne decyzje. Osobnym wywołaniem zadałem też pytanie o jeden z 18 obszarów, na przykład kalendarz albo e-mail, bo takie pytanie jest bliższe temu, na czym model trenowano.

Dwie rzeczy trzeba wiedzieć przed czytaniem wyników. Według opisu danych w repozytorium twórcy przycinali w treningu duże zestawy etykiet do najwyżej 24 opcji, a pytanie z 60 opcjami wychodzi poza ten zakres. Ten sam opis podaje, że angielską wersję MASSIVE wyłączyli z treningu, ale użyli jej do kalibracji i ewaluacji modelu. Polskiej wersji ten opis nie wymienia. To może dawać przewagę angielskiej wersji w moim pomiarze, zwłaszcza w kalibracji pewności. Kalibracja ustawia jedną temperaturę dla wszystkich pytań z wyborem, dlatego nie zmienia tego, którą opcję model wybiera, ale może poprawić pewność po angielsku. W raporcie dołączonym do modelu twórcy podają dla angielskiego MASSIVE trafność 89,0% na 1753 pytaniach, tyle że z losowo dobranymi najwyżej 24 opcjami i inną treścią pytania. Wprost z moim wynikiem tego nie porównam, ale ta liczba pokazuje, jak wiele może zależeć od doboru opcji i treści pytania.

Strands Decider po polsku: 6 punktów gorzej niż po angielsku

Na 1000 parach zmierzonych 11 października 2026 roku Strands Decider 2B rozpoznał intencję w 64,4% polskich i w 70,4% angielskich poleceń, przy wyborze jednej z 60 opcji. Po polsku gorzej wypadły też pozostałe miary jakości: makro-F1 było niższe, a błąd kalibracji i wynik Briera wyższe.

Miara, 1000 par Po polsku Po angielsku
Trafność intencji, 60 opcji 64,4% 70,4%
Trafność obszaru odczytana z intencji 76,8% 81,7%
Makro-F1 0,625 0,676
Błąd kalibracji ECE (im mniej, tym lepiej) 0,076 0,068
Wynik Briera (im mniej, tym lepiej) 0,507 0,415
Tokeny wejścia na decyzję, średnio 680,65 677,25
Mediana czasu jednej decyzji na Macu 0,239 s 0,238 s

Po polsku model trafił o 6,0 punktu procentowego rzadziej niż po angielsku. Przedział ufności 95% dla tej różnicy to od 3,5 do 8,4 punktu. Tylko po polsku model trafił w 49 parach, a tylko po angielsku w 109. Test McNemara daje dla tej różnicy p poniżej 0,001. W 764 parach z 1000 model wybrał w obu językach tę samą intencję.

Wynik potwierdziła reszta części testowej MASSIVE. Na pozostałych 1974 parach, liczonych osobno, Decider trafił w 63,8% polskich i w 70,4% angielskich poleceń, a różnica wyniosła 6,5 punktu, z przedziałem ufności od 4,9 do 8,2 punktu. Cała część testowa, czyli 2974 pary, daje 64,0% po polsku, 70,4% po angielsku i różnicę 6,4 punktu, z przedziałem ufności od 5,0 do 7,7 punktu.

Najczęstsze pomyłki, które policzyłem po fakcie, poza planem z protokołu, są podobne w obu językach. Model myli ustawienie wydarzenia w kalendarzu z ustawieniem alarmu, przepis z pytaniem o gotowanie i luźną pogawędkę z powitaniem. To pary intencji bliskie znaczeniowo, choć kalendarz i alarm to w MASSIVE osobne obszary.

Strands Decider czy Clef-flash: porównanie na tych samych parach

Na tych samych 1000 parach i przy tym samym pytaniu z 60 opcjami Clef-flash od Cloudflare trafił w 88,1% polskich poleceń, a Strands Decider w 64,4%. Clefa zmierzyłem 2 i 3 października 2026 roku, Decidera 11 października.

60 opcji Strands Decider 2B Clef-flash
Trafność po polsku, 1000 par analizy głównej 64,4% 88,1%
Trafność po angielsku, 1000 par analizy głównej 70,4% 89,4%
Trafność po polsku, cała część testowa (2974 pary) 64,0% 88,4%
Trafność po angielsku, cała część testowa (2974 pary) 70,4% 90,1%
Tokeny wejścia na decyzję po polsku, 1000 par 680,65 1325,65

Po polsku Decider trafił o 23,7 punktu rzadziej niż Clef-flash, z przedziałem ufności od 20,8 do 26,6 punktu. Po angielsku różnica wynosi 19,0 punktu, z przedziałem od 16,2 do 21,7. Na polskich zdaniach Decider trafił tylko w 20 przypadkach, w których Clef się pomylił, a Clef w 257, w których pomylił się Decider. Clef-flash wygrywa w tym zadaniu wyraźnie i w obu językach. Ma jednak 9,4 mld parametrów, prawie pięć razy więcej. Jego wagi w formacie BF16 zajmują około 19 GB, a pliki Decidera razem z modelem bazowym około 4,8 GB. Pytanie z 60 opcjami wychodzi poza zakres treningu Decidera, ale wariant z 24 opcjami, opisany niżej, pokazuje, że z tego powodu Decider traci niewiele. To porównanie dwóch konkretnych modeli w jednym zadaniu, nie dwóch sposobów ich budowy.

Decider zużywał około połowy tokenów wejścia, których potrzebował Clef, bo krócej zapisuje pytanie z opcjami. Samo zdanie oba modele dzielą na tokeny tak samo, średnio 10,65 tokenu po polsku i 7,25 po angielsku. Reszta zapytania, czyli pytanie, 60 opcji i znaczniki, to u Decidera około 670 tokenów, a u Clefa 1315. Na tym samym Macu mediana czasu jednej decyzji Decidera wyniosła 0,24 sekundy. Clef-flash działał 2 i 3 października przy innym obciążeniu komputera, więc czasów obu modeli nie zestawiam jako wyniku.

Pytanie o 18 obszarów wypadło gorzej, niż oczekiwałem

Przy pytaniu o jeden z 18 obszarów Decider trafił 11 października 2026 roku w 59,3% polskich i 63,7% angielskich poleceń. To rzadziej niż wtedy, gdy obszar odczytuję z przewidzianej intencji (76,8% i 81,7%), choć pytanie z 18 opcjami mieści się w zakresie treningu. Możliwą przyczynę widać w pomyłkach, które policzyłem po fakcie. Pytania z obszaru „qa” model przypisywał do „general”, a polecenia z obszaru „play” do „music” albo „audio”. Same nazwy obszarów w MASSIVE są skrótowe i nakładają się na siebie, a ja nie dopisywałem do nich opisów. Ten wynik mierzy więc prawdopodobnie także jakość nazw opcji, nie tylko model. Przy tym pytaniu pewność była też znacznie gorzej skalibrowana. Błąd kalibracji wyniósł 0,178 po polsku i 0,161 po angielsku, ponad dwa razy więcej niż przy pytaniu o intencję, a średnia pewność przewyższała trafność o kilkanaście punktów. Tej miary nie było w planie dla pytania o obszary.

Przy 24 opcjach trafność rośnie o 12 punktów, a różnica między językami zostaje

Gdy 11 października 2026 roku dałem modelowi 24 opcje zamiast 60, Strands Decider trafił w 76,0% polskich i 82,9% angielskich poleceń, o 11,6 i 12,5 punktu częściej. Po analizie głównej sprawdziłem, jak model wypada, gdy pytanie mieści się w zakresie treningu. Plan tego wariantu zapisałem w protokole przed uruchomieniem, ale już po poznaniu wyników głównych, więc to analiza po fakcie. Na tych samych 1000 parach model dostał poprawną intencję i 23 intencje wylosowane z pozostałych, ten sam zestaw dla zdania polskiego i angielskiego.

1000 par, 24 opcje Po polsku Po angielsku
Trafność intencji 76,0% 82,9%
Zmiana wobec 60 opcji +11,6 punktu +12,5 punktu
Błąd kalibracji ECE (im mniej, tym lepiej) 0,051 0,035

W obu językach spadł też błąd kalibracji. Większość wzrostu trafności, po polsku prawie cały, bierze się jednak stąd, że z listy znikają etykiety, które model mylił z poprawną. Gdy w rozkładzie prawdopodobieństw przy 60 opcjach wybieram najbardziej prawdopodobną z tych samych 24, wychodzi już 75,3% po polsku i 80,8% po angielsku. Samo pytanie w zakresie treningu dodało więc po polsku 0,7 punktu, w granicach błędu losowego, a po angielsku 2,1 punktu, z przedziałem ufności od 0,8 do 3,4 punktu. Widać to też w samych decyzjach, policzonych po fakcie. Przy 60 opcjach model pomylił się w 356 polskich poleceniach. W 211 z nich błędnie wybranej intencji zabrakło wśród 24 opcji i w 117 z tych przypadków model trafił. Gdy ta intencja została wśród opcji, trafił tylko w 15 ze 145 przypadków. Do tego pomylił się w 16 poleceniach, w których przy 60 opcjach trafił. Po angielsku proporcje były podobne. Różnica między polskim a angielskim nie zmalała: 6,9 punktu, z przedziałem ufności od 4,8 do 9,1 punktu. Łatwość pytania zależy tu od wylosowanych etykiet, dlatego wyniku przy 24 opcjach nie porównuję wprost z Clefem ani z liczbą 89,0%, którą twórcy podają dla angielskiego MASSIVE.

Czy pewności zwracanej przez Strands Decider można ufać

Przy 60 opcjach tylko częściowo. W pomiarze z 11 października 2026 roku odpowiedzi, którym model sam przypisał pewność od 0,9, były trafne w 89,0% po polsku i w 90,0% po angielsku. Twórcy podają dla tego progu około 95% trafnych odpowiedzi na krótkich zadaniach klasyfikacji, których model nie widział, i sami zalecają sprawdzić próg na własnych danych, zanim zacznie od niego zależeć automatyczna decyzja. U mnie myliła się mniej więcej co dziesiąta odpowiedź, a według nich co dwudziesta. Liczyłem to na polu pewności, które zwraca model. Moje pytanie miało jednak 60 opcji, więcej niż w treningu. W wariancie z 24 opcjami odpowiedzi z pewnością od 0,9 były trafne w 94,7% po polsku i w 95,6% po angielsku, czyli tak, jak piszą twórcy. Takich odpowiedzi było 531 polskich i 616 angielskich na 1000. To analizy dodane po fakcie, poza planem z protokołu. Twórcy zmierzyli swoje 95% na czterech zbiorach spoza treningu, w tym na angielskim MASSIVE, ale przy pytaniach z najwyżej 24 opcjami i na wcześniejszych wersjach modelu, do v19 włącznie. Raport dołączony do wersji v1-2610, z którego pochodzi też liczba 89,0%, podaje na tych samych czterech zbiorach 97,2% trafnych odpowiedzi z pewnością od 0,9, na 1429 z 6000 pytań.

W analizie z protokołu liczę kalibrację na prawdopodobieństwie wybranej opcji, tak samo jak przy Clefie. Model zwraca to prawdopodobieństwo już po swojej kalibracji temperaturą, a pole pewności jest z niego tylko przeliczone: przy 60 opcjach to (60 × p − 1) / 59. Próg 0,9 na polu pewności odpowiada więc prawdopodobieństwu 0,902 i obie analizy dają prawie to samo. Błąd kalibracji wynosi 0,076 po polsku i 0,068 po angielsku, a jego kierunek jest w obu językach ten sam: model jest zbyt pewny. Średnie prawdopodobieństwo wybranej opcji wynosiło 0,72 przy trafności 0,64 po polsku i 0,77 przy 0,70 po angielsku. Progu 0,9 nie było w protokole, więc liczby przy nim też traktuję jako analizę po fakcie: przy prawdopodobieństwie od 0,9 myliło się 36 z 323 polskich decyzji i 43 z 421 angielskich. Model rzadziej jest pewny po polsku, ale gdy już jest, myli się mniej więcej tak samo często jak po angielsku. Przy tym progu automatycznie przeszłyby 323 z 1000 polskich decyzji, a resztę trzeba by odesłać do człowieka. Clef-flash, zmierzony 2 i 3 października, miał na tych samych parach pewność od 0,9 w 814 polskich decyzjach i pomylił się w 47 z nich.

Co z tego wynika dla firmy

Przy kilkudziesięciu kategoriach opisanych samymi nazwami etykiet Strands Decider 2B w wersji v1-2610 wypadł w moim pomiarze za słabo do klasyfikacji krótkich polskich poleceń. W pytaniu z 60 opcjami trafił 11 października 2026 roku w 64,4% polskich poleceń, a Clef-flash na tych samych parach, zmierzony 2 i 3 października, w 88,1%. Przy 24 opcjach Decider trafił w 76,0%, czyli nadal mylił się w co czwartym polskim poleceniu. Może mieć sens tam, gdzie liczy się mały rozmiar i działanie na własnym komputerze zamiast w API, a pytania mają kilka dobrze opisanych opcji. Przykładem jest bramka przed wywołaniem narzędzia w agencie, którą twórcy pokazują w repozytorium, z opcjami: przepuść, odrzuć, zapytaj człowieka albo podpowiedz agentowi. Taką bramkę opisuję jako punkt 10 listy kontrolnej izolacji agentów. Pytań tego rodzaju po polsku jednak nie mierzyłem, a pytanie o 18 obszarów wypadło słabo.

Przed wdrożeniem trzeba zmierzyć model na własnych danych i własnych opcjach. Mój pomiar pokazuje, że duże znaczenie ma to, czy wśród opcji są etykiety bliskie znaczeniowo. Przy 24 opcjach zamiast 60 trafność wzrosła o około 12 punktów, ale głównie dlatego, że wśród 23 losowych często brakowało intencji, z którą model mylił poprawną. Na liście kategorii w firmie takie pary jak alarm i wydarzenie w kalendarzu zwykle zostają, więc 76,0% może być wynikiem optymistycznym dla 24 własnych kategorii. Przy 24 opcjach próg pewności 0,9 dawał około 95% trafnych decyzji w obu językach, a przy 60 około 90%. Do sprawdzenia zostają opisy opcji zamiast skrótowych etykiet i próg pewności na własnych polskich przykładach.

Czego ten pomiar nie mówi

Zmierzyłem krótkie, tłumaczone polecenia do asystenta głosowego, o średniej długości około 36 znaków. Nie wiem, jak model radzi sobie z e-mailami, zgłoszeniami klientów albo dokumentami. Twórcy w karcie modelu sami wymieniają długie, wieloetapowe dokumenty jako jego słaby punkt. Nie mierzyłem innych wersji modelu: starszych v19 i v21, które według twórców wypadają w JevBench gorzej, ani wariantów opartych na modelu Gemma 4, z których trzy większe wypadają tam lepiej, a najmniejszy tak samo. Do treningu v21 twórcy włączyli też 20 tys. przykładów ze zbiorów, których warunki ograniczają użytek komercyjny, a z v1-2610 je usunęli. Nie mierzyłem też pytań tak/nie ani ocen na skali. Pytanie i nazwy opcji były po angielsku we wszystkich wariantach, więc nie wiem, jak model działa z polskimi nazwami kategorii.

Najczęstsze pytania

Co to jest Strands Decider 2B?
Strands Decider 2B to otwarty model decyzyjny od zespołu Strands Agents w AWS, ogłoszony 1 października 2026 roku i udostępniony na licencji Apache 2.0. Nie generuje tekstu. Dostaje tekst i pytanie jednego z trzech typów: tak/nie, wybór jednej z opcji albo ocena na skali. Zwraca odpowiedź z rozkładem prawdopodobieństw. Ma 1,9 mld parametrów, powstał z modelu Qwen3.5⁠-⁠2B-Base i działa lokalnie, także na Macu z Apple Silicon. Twórcy przeznaczają go do kierowania zapytań, wyboru narzędzia i decyzji w bramkach agentów AI.
Czy Strands Decider działa po polsku?
Działa, ale słabiej niż po angielsku. W moim pomiarze z 11 października 2026 roku, na 1000 parach krótkich poleceń ze zbioru MASSIVE, Strands Decider 2B rozpoznał intencję w 64,4% polskich i w 70,4% angielskich, przy wyborze z 60 opcji. Różnica 6 punktów procentowych wykracza poza granice błędu losowego. Przy 24 opcjach trafił tego samego dnia w 76,0% i 82,9%, więc różnica została. Twórcy nie deklarują obsługi polskiego, a w ich opisie danych zbiór MASSIVE występuje tylko w wersji angielskiej, użytej do kalibracji i ewaluacji modelu.
Strands Decider czy Clef: który lepiej rozpoznaje polskie polecenia?
Clef-flash, mniejsza wersja Clefa od Cloudflare. Na tych samych 1000 parach i przy tym samym pytaniu z 60 opcjami trafił w 88,1% polskich poleceń (pomiar z 2⁠–⁠3 października 2026), a Strands Decider w 64,4% (pomiar z 11 października 2026). Decider trafił tylko w 20 polskich zdaniach, w których Clef się pomylił, a Clef w 257, w których pomylił się Decider. Decider jest za to prawie pięć razy mniejszy: ma 1,9 mld parametrów, a Clef-flash 9,4 mld.
Czy pewności zwracanej przez Strands Decider można ufać?
Częściowo. Twórcy piszą, że odpowiedzi z pewnością od 0,9 są trafne w około 95% przypadków na krótkich zadaniach klasyfikacji. W moim pomiarze z 11 października 2026 roku odpowiedzi, którym model sam przypisał pewność od 0,9, były trafne w 89,0% po polsku i w 90,0% po angielsku. Myliła się więc mniej więcej co dziesiąta, a według twórców co dwudziesta. Taki próg przepuściłby automatycznie około jednej trzeciej polskich decyzji. To analiza dodana po pomiarze, przy 60 opcjach, czyli poza zakresem treningu. Przy 24 opcjach, z poprawną i 23 losowymi, ten sam próg dał tego samego dnia 94,7% trafnych odpowiedzi po polsku i 95,6% po angielsku, a osiągnęła go około połowa polskich decyzji. Twórcy sami zalecają sprawdzić próg na własnych danych.
Jak uruchomić Strands Decider lokalnie i ile to kosztuje?
Model jest darmowy, na licencji Apache 2.0. Twórcy udostępniają pakiet strands-decider, instalowany przez pip, z poleceniem strands-decider ask i interfejsem w Pythonie. Ja wywoływałem go z Pythona 11 października 2026 roku na MacBooku z procesorem M5 Pro i 48 GB pamięci, z obliczeniami na układzie graficznym Maca. Mediana czasu jednej decyzji wyniosła 0,24 sekundy. Do pobrania jest około 4,8 GB: adapter z Hugging Face i model bazowy Qwen3.5⁠-⁠2B-Base. Kosztem jest więc tylko komputer, na którym działa.

Źródła

Dane zewnętrzne przywołane w tekście mają tu swoje źródła.

  1. Strands Agents: Introducing Strands Decider 2B: a small, open source, decision model (1.10.2026, odczyt 11.10.2026): model decyzyjny bez generowania tekstu z klasy spopularyzowanej przez Jev od TypeSafe AI, Apache 2.0, autorzy Marc Brooker, Mike Chambers, Fabio Nonato de Paula (nowa karta)
  2. Hugging Face: StrandsAgents/strands-decider-2B-qwen3.5-v1-2610, karta modelu (9.10.2026, rewizja 216d1ccb, odczyt 11.10.2026): model referencyjny, baza Qwen3.5⁠-⁠2B-Base, JevBench 180 z 231 (nowa karta)
  3. GitHub: strands-labs/strands-decider (commit 0ac22a97 z 9.10.2026, odczyt 11.10.2026): kod, dokumentacja uruchomienia, data/sources.md z listą zbiorów treningowych i wstrzymanych, w tym massive_intent (en) do kalibracji i ewaluacji (nowa karta)
  4. MASSIVE 1.1: Amazon, zbiór poleceń w 52 językach (CC BY 4.0), FitzGerald i in., 2022 (nowa karta)
  5. Badanie własne: Strands Decider 2B na polskich i angielskich poleceniach (pomiar 11.10.2026) (nowa karta)
  6. Badanie własne: Clef-flash na polskich i angielskich poleceniach (pomiar 2⁠–⁠3.10.2026) (nowa karta)

Udostępnij

Powiązane

Masz konkretny proces do omówienia?

Napisz, jaki to proces i ile razy w miesiącu się powtarza. Odpowiem, czy nadaje się do automatyzacji, również wtedy, gdy odpowiedź brzmi „nie warto”.

Albo prosto na adres: not-a-bot@ekspertodsztucznejinteligencji.pl

Wolisz zadzwonić? +48 787 912 168