# Decision-1: rachunek kosztów i polska próba wstępna

Wersja 1.0, przygotowana 11 października 2026. Opracowanie redakcyjne: ekspertodsztucznejinteligencji.pl; materiały przygotowane z pomocą Codexa. Dane są własne i syntetyczne; licencja plików: CC BY 4.0. Pliki nie zawierają danych klientów. Opracowanie nie udziela licencji na model Microsoftu.

## Co zostało wykonane

Wykonano obliczenie budżetu na jawnych założeniach. Nie wywołano Decision-1, nie zmierzono jego jakości, czasu odpowiedzi ani liczby tokenów korpusu. Nie założono konta ani nie poniesiono opłat. Rachunek i korpus mają osobne zastosowania: wyniki kosztowe nie pochodzą z klasyfikacji tych 30 zgłoszeń.

## Pliki i odtworzenie rachunku

Rozpakuj [kompletny pakiet ZIP](/materialy/decision-1-pakiet.zip) do jednego katalogu albo pobierz pliki osobno. Wystarczy Python 3.10 lub nowszy, bez instalowania bibliotek. Skrypt nie łączy się z siecią.

- [decision-1-kalkulacja.py](/materialy/decision-1-kalkulacja.py): kalkulator i weryfikator pakietu.
- [decision-1-zalozenia.json](/materialy/decision-1-zalozenia.json): wszystkie parametry i ich status.
- [decision-1-koszty.csv](/materialy/decision-1-koszty.csv): trzy scenariusze w tabeli.
- [decision-1-wynik.json](/materialy/decision-1-wynik.json): wyniki rachunku z pełną precyzją.
- [decision-1-etykiety.json](/materialy/decision-1-etykiety.json): instrukcja i polityka kolejek.
- [decision-1-reklamacje.csv](/materialy/decision-1-reklamacje.csv): zgłoszenia z kluczem odpowiedzi.
- [decision-1-wejscia.jsonl](/materialy/decision-1-wejscia.jsonl): te same zgłoszenia bez klucza.
- [decision-1-protokol.md](/materialy/decision-1-protokol.md): ten dokument.
- [decision-1-manifest.json](/materialy/decision-1-manifest.json): zamrożone sumy SHA-256.

```sh
python3 decision-1-kalkulacja.py
python3 decision-1-kalkulacja.py --verify
```

Pierwsza komenda oblicza scenariusze i wypisuje JSON. Druga dodatkowo porównuje zapisane wyniki, sumy kontrolne, liczbę zgłoszeń i etykiet oraz wejścia bez klucza odpowiedzi. Sumy SHA-256 w manifeście dotyczą plików opublikowanych wraz z tą wersją protokołu. Manifest nie zawiera swojej własnej sumy.

Do własnego rachunku skopiuj plik założeń, zmień dane i podaj go przez `--assumptions twoje-zalozenia.json`. Nie zastępuj plików wersji 1.0. Cena modelu pochodzi z komunikatu Microsoftu z 9.10.2026, odczytanego 11.10.2026. Pozostałe liczby są założeniami autora, w tym kurs 4 PLN/USD, czasy pracy, udział błędów, wdrożenie i utrzymanie.

## Jak liczę koszt

Jednostką jest zgłoszenie poprawnie skierowane do właściwej kolejki. Dalsze rozpatrzenie reklamacji, zwrot pieniędzy, rekompensata, utrata sprzedaży, koszt opóźnienia i podatki są poza zakresem. To koszt etapu klasyfikacji, nie całej obsługi reklamacji. Scenariusz zakłada, że ostatecznie wszystkie zgłoszenia trafiły do odpowiedniej kolejki, zarówno ręcznie, jak i z AI. W rzeczywistym teście mianownik musi wynikać z oceny końcowych rezultatów.

Ręczne 30 sekund na sprawę obejmuje w założeniu sprawdzenie i własne poprawki pracownika. W wariancie AI człowiek sprawdza każdą etykietę przez średnio 10 sekund. Założony udział błędnych etykiet przed kontrolą wynosi 2%, 5% albo 10%. Poprawienie jednej błędnej etykiety wymaga dodatkowych 180 sekund. Zakładam, że kontrola wykrywa te błędy, a poprawki je usuwają. Nie jest to wynik testu skuteczności człowieka ani modelu. Liczba ponowień API nie jest liczbą nowych spraw.

Koszt wdrożenia rozkładam wyłącznie na potrzeby porównania budżetów na 12 miesięcy. Nie jest to porada księgowa ani opis podatkowej amortyzacji. Przy płatności za wdrożenie z góry wydatek w pierwszym miesiącu jest wyższy od miesięcznego kosztu porównawczego.

Wzory, z czasem w sekundach i stawką pracy w PLN/godz.:

```text
liczba_wywołań = liczba_spraw × (1 + udział_dodatkowych_wywołań)
API_USD = liczba_wywołań × tokeny_wejścia_na_wywołanie × cena_za_milion / 1000000
API_PLN = API_USD × założony_kurs
ręcznie_PLN = liczba_spraw × ręczne_sekundy_na_sprawę × stawka_pracy / 3600
kontrola_PLN = liczba_spraw × sekundy_kontroli × stawka_pracy / 3600
poprawki_PLN = liczba_spraw × udział_błędów × sekundy_poprawki × stawka_pracy / 3600
AI_PLN = API_PLN + kontrola_PLN + poprawki_PLN + utrzymanie + wdrożenie / liczba_miesięcy
koszt_poprawnego_skierowania = AI_PLN / liczba_spraw_poprawnie_skierowanych
graniczne_sekundy_kontroli = (ręcznie_PLN − API_PLN − poprawki_PLN − utrzymanie − wdrożenie / liczba_miesięcy) × 3600 / (liczba_spraw × stawka_pracy)
```

Ujemny próg oznacza, że wariant AI jest droższy już bez czasu kontroli. Próg zerowy pozwala jedynie zrównać koszty przy kontroli trwającej zero sekund. Dodatni próg to punkt równego kosztu przy pozostałych założeniach; oszczędność występuje poniżej niego. Nie jest to kryterium dopuszczalnej jakości. W rachunku nie zaokrąglam składników przed zsumowaniem; tabela artykułu zaokrągla kwoty do groszy, a próg do 0,1 sekundy.

## Zamrożony korpus i zasady etykietowania

Korpus liczy 30 autorskich syntetycznych zgłoszeń, po 6 dla każdej z 5 etykiet. Jest celowo zrównoważoną próbą wstępną, bez losowania z ruchu firmy. Nie odtwarza rzeczywistej częstości tematów. Autor ustalił własną politykę kolejek, opisał ją w `decision-1-etykiety.json`, a następnie nadał oczekiwane etykiety. Są to etykiety tego scenariusza operacyjnego, nie ocena praw konsumenta.

`DOSTAWA` dotyczy towaru jeszcze niedoręczonego, `WADA` problemu z otrzymanym produktem, `ZWROT` rezygnacji ze sprawnego i zgodnego zakupu, a `PLATNOSC` rozliczeń. `DO_CZLOWIEKA` służy sprawom niejasnym, sprzecznym, spoza zakresu albo zawierającym niezależne problemy z kilku kategorii. Żądanie pieniędzy za wadliwy produkt należy do `WADA`; brak przelewu po zaakceptowanym zwrocie należy do `PLATNOSC`. Dostawę zamkniętą w cytowanej korespondencji zastępuje aktualny problem. Pełne reguły są w pliku etykiet.

Zestaw obejmuje m.in. negacje, literówki, historię korespondencji i polecenia podsuwające niewłaściwą etykietę. Nie dowodzi odporności na ataki. Jego funkcją jest ujawnienie prostych rozbieżności między implementacją a przyjętą polityką, zanim zacznie się właściwe badanie.

`decision-1-reklamacje.csv` zawiera klucz: oczekiwaną etykietę i uzasadnienie. Nie wysyłaj całego CSV do modelu. `decision-1-wejscia.jsonl` oddziela wejście: każdy wiersz ma identyfikator oraz `request` z tekstem zgłoszenia i wspólnymi opisami kategorii, bez odpowiedzi. Szablon odpowiada typowi `choice` z dokumentacji Microsoftu odczytanej 11.10.2026. Nie jest przetestowanym klientem API. Przed wywołaniem trzeba dodać aktualną nazwę własnego wdrożenia w polu `model` oraz sprawdzić bieżący kontrakt API.

## Protokół przyszłego testu modelu

1. Zachowaj wersję i sumy plików przed pierwszym uruchomieniem. Ustal zakres wyniku: zgodność jednej etykiety z polityką oraz obsługa niejasnych spraw. Nie testujemy udzielania odpowiedzi klientowi ani zasadności reklamacji.
2. Uruchom porównywane systemy na tym samym wejściu. Zapisz dokładną nazwę i wersję modelu, endpoint/operatora, typ wdrożenia i region, konfigurację oraz datę. Dodaj obecny sposób klasyfikowania firmy i prostą, ustaloną przed testem regułę słownikową jako punkty odniesienia. Jeśli baseline jest modelowy, musi otrzymać te same reguły etykietowania.
3. Zachowaj surowe żądanie i odpowiedź per identyfikator, bez dopisywania oczekiwanej etykiety do żądania. Zapisz wszystkie próby, błędy transportu, zużycie tokenów podane przez usługę i czas od wysłania do pełnego odbioru. Przed startem ustal limit czasu oraz limit ponowień. Nie wyrzucaj nieudanych spraw z mianownika.
4. Sprawdź poprawność struktury i przynależność etykiety do zamkniętego zbioru. Brak poprawnej odpowiedzi po ustalonych ponowieniach licz jako niepowodzenie oraz przekazanie do ręcznej obsługi. Etykieta `DO_CZLOWIEKA` jest poprawnym wynikiem, gdy zgadza się z kluczem, a nie błędem API.
5. Pokaż liczbę trafień na 30, macierz pomyłek oraz wyniki dla każdej etykiety. Dla `DO_CZLOWIEKA` oddziel błędne skierowanie do zwykłej kolejki od zbędnego przekazania człowiekowi. Podaj również czas pracy człowieka, udział przekazanych mu spraw i koszt końcowego, poprawnego skierowania. Całość ma status próby wstępnej; bez rankingu jakości dla wszystkich polskich reklamacji.
6. Nie dopasowuj promptu ani progu do odpowiedzi na te 30 opublikowanych przykładów i nie przedstawiaj wyniku po dopasowaniu jako niezależnego testu. Zachowaj wcześniejszy przebieg. Nową konfigurację sprawdź na odrębnym zestawie, z kluczem zamkniętym przed uruchomieniem.
7. Przed automatyzacją zbierz osobne, dozwolone do użycia dane odzwierciedlające ruch firmy. Rozdziel przykłady do ustalania progu od końcowej oceny. Próg prawdopodobieństwa wybierz na pierwszej części według kosztów błędów, potem zamroź i oceń na drugiej. Sprawdź, czy np. decyzje ocenione wysoko rzeczywiście częściej są poprawne. Sama liczba zwrócona przez model nie potwierdza kalibracji w tym zastosowaniu.

Do wdrożenia potrzeba oceny zgodności z polityką, błędów pozostających po kontroli, czasu człowieka i kosztu. Żaden wynik tej małej próby nie uzasadnia samodzielnego odrzucania reklamacji albo uruchamiania zwrotów pieniędzy.

## Źródła zewnętrzne

- Microsoft, premiera i cena opublikowane 9.10.2026, odczyt 11.10.2026: https://commandline.microsoft.com/microsoft-decision-1-model-foundry/
- Microsoft Learn, struktura żądania `choice` i walidacja we własnym zastosowaniu, odczyt 11.10.2026: https://learn.microsoft.com/en-us/azure/foundry/foundry-models/how-to/use-foundry-models-microsoft-decision

Źródła opisują usługę. Założenia kosztowe, definicje kolejek, syntetyczne teksty, ich klucz oraz proponowany protokół są własnym opracowaniem.
