Zbiór danych: Strands Decider 2B na polskich i angielskich poleceniach
Pomiar z 11 października 2026: 9948 decyzji otwartego modelu Strands Decider 2B (AWS) dla tych samych krótkich poleceń po polsku i po angielsku z części testowej MASSIVE 1.1. Analiza główna na 1000 parach przy wyborze jednej z 60 intencji, uzupełnienie na pozostałych 1974 parach, a na 1000 parach także pytanie o 18 obszarów i wariant z 24 opcjami. Porównanie z Clef-flash na tych samych parach, trafność, kalibracja i tokeny wejścia.
Pomiar: 11 października 2026 · Wyniki i wnioski: Strands Decider po polsku: pomiar modelu AWS i porównanie z Clefem · Metoda i ograniczenia: README.md
Pliki zbioru
- Metoda (README.md)
Pytanie badawcze, model i środowisko, budowa pytania do modelu, miary, wynik w tabeli i ograniczenia pomiaru.
- Protokół (protokol.md)
Plan analizy spisany przed instalacją modelu, z regułą rozszerzenia pomiaru po pilocie i dziennikiem zmian.
- Decyzje (decyzje.jsonl)
Analiza główna, 2000 rekordów, po jednym na decyzję: zdanie, język, etykieta, przewidziana intencja, jej prawdopodobieństwo, pewność zwracana przez model, prawdopodobieństwo poprawnej etykiety, suma kwadratów prawdopodobieństw, tokeny wejścia i czas.
- Decyzje, pytanie o obszar (decyzje-scenariusz.jsonl)
2000 rekordów dla tych samych 1000 par przy pytaniu o jeden z 18 obszarów, w tym samym formacie; pola etykieta i przewidziana zawierają obszar zamiast intencji.
- Decyzje, uzupełnienie (decyzje-uzupelnienie.jsonl)
Pytanie o intencję dla 1974 par części testowej spoza analizy głównej, razem 3948 rekordów.
- Decyzje, wariant z 24 opcjami (decyzje-24-opcje.jsonl)
2000 rekordów dla tych samych 1000 par przy pytaniu o intencję z 24 opcjami: poprawną i 23 losowymi, tymi samymi dla zdania polskiego i angielskiego. Analiza po fakcie, zapisana w protokole przed uruchomieniem.
- Wyniki (wyniki.json)
Miary analizy głównej dla obu języków, różnica PL−EN z przedziałem ufności i testem McNemara, porównanie z Clef-flash, pytanie o 18 obszarów, uzupełnienie i cała część testowa oraz osobno analizy po fakcie.
- Skrypt pomiaru (pomiar.py)
Uruchamia Strands Decider 2B na parach zdań i zapisuje każdą decyzję z pełnym rozkładem prawdopodobieństw.
- Skrypt analizy (przygotuj.py)
Liczy wyniki.json z opublikowanych plików decyzji, a porównanie z Clef-flash bierze ze zbioru Clefa. Na komputerze autora najpierw buduje z surowego zapisu zwarte pliki decyzji i liczy rozkład z pytania o 60 opcji zawężony do 24 opcji, a bez surowego zapisu przenosi ten wynik z poprzedniego wyniki.json.
- Próba (ids-proba.txt)
Identyfikatory 1000 par analizy głównej, wylosowanych 2.10.2026 z ziarnem 20261002, tych samych co w pomiarze Clefa.
- Uzupełnienie (ids-uzupelnienie.txt)
Identyfikatory 1974 par spoza analizy głównej.
- Pilot (ids-pilot.txt)
Identyfikatory 100 par pilota.
Jak czytać te dane
W decyzje.jsonl jeden rekord to jedna decyzja modelu dla jednego zdania w jednym języku. Pole przewidziana to intencja wybrana przez Strands Decider, pewnosc to jej prawdopodobieństwo, pewnosc_modelu to przeskalowana pewność, którą zwraca sam model, a p_etykiety i suma_p2 pozwalają przeliczyć wynik Briera bez pełnego rozkładu. Pary łączy pole id. Decyzje przy pytaniu o jeden z 18 obszarów są w decyzje-scenariusz.jsonl, przy pytaniu z 24 opcjami w decyzje-24-opcje.jsonl, a pozostałe 1974 pary części testowej w decyzje-uzupelnienie.jsonl. Skrypt przygotuj.py liczy wyniki.json z tych plików, a porównanie z Clef-flash bierze z opublikowanego zbioru Clefa. Plan analizy, spisany przed instalacją modelu, jest w protokol.md. Pomiar dotyczy krótkich, tłumaczonych poleceń do asystenta głosowego, nie zgłoszeń klientów.
Licencja
Pliki własne badania (decyzje, wyniki, skrypty, protokół, metoda): CC BY 4.0, z uznaniem autorstwa „Robert Marczyński, ekspertodsztucznejinteligencji.pl”. Zdania pochodzą ze zbioru MASSIVE 1.1 (© Amazon.com, Inc. or its affiliates, CC BY 4.0; FitzGerald i in., 2022), który powstał z angielskich danych SLURP (CC BY 4.0). Zmiany: użyto całej części testowej (2974 pary, z tego 1000 w analizie głównej), zmieniono nazwy pól i dołączono wyniki modelu; treści zdań ani etykiet nie zmieniono. AWS udostępnia Strands Decider 2B na licencji Apache 2.0.