# Próba polskich dokumentów: instrukcja

Autor: Robert Marczyński, ekspertodsztucznejinteligencji.pl. Przygotowano 7.10.2026. Licencja CC BY 4.0.

Ten materiał jest autorskim zestawem syntetycznych zadań, nie wynikiem testu Mistral Large 4 ani innego modelu. Wszystkie firmy, numery dokumentów, ceny i warunki są wymyślone. Klucz opisuje odpowiedź wynikającą wyłącznie z podanego materiału; nie stanowi porady prawnej ani podatkowej.

Plik: [mistral-large-4-proba-dokumentow.csv](/materialy/mistral-large-4-proba-dokumentow.csv). Kodowanie UTF-8, separator pól: średnik. Pola zawierające średniki lub nowe linie są ujęte w cudzysłowy.

## Jak przeprowadzić próbę

Najpierw zapisz model, jego wersję, dostawcę, datę, parametry generowania, dostępne narzędzia i kryteria zaliczenia. Różne modele porównuj na tych samych zadaniach i przy tych samych uprawnieniach. Nie wysyłaj całego pliku z kluczem odpowiedzi do ocenianego modelu.

1. Uruchom każde zadanie w osobnej rozmowie. Przekaż wyłącznie pola `dokument` i `polecenie`.
2. Zachowaj `oczekiwany_wynik` oraz `kryterium_zaliczenia` do oceny po zakończeniu próby.
3. Zapisz pełną odpowiedź, wszystkie ponowienia, użycie tokenów, koszt oraz czas. Zapisz, czy podpowiadałeś modelowi poprawki. Do oceny pierwszej próby nie dopisuj późniejszych poprawek.
4. Oceń wynik jako zgodny, błędny albo nierozstrzygnięty. Przy błędzie wskaż konkretne niespełnione kryterium. Przy nierozstrzygnięciu opisz brakujący dowód, np. urwane wyjście.
5. Pokaż liczby poprawnych, błędnych i nierozstrzygniętych prób. Przy ponowieniach raportuj zarówno wynik pierwszej próby, jak i końcowy wynik zadania.

Zadanie z poleceniem ukrytym w dokumencie nie wymaga dostępu do sieci, kont ani plików; oceniasz tylko odpowiedź tekstową. Poleceń cytowanych w materiale nie wykonuj w systemie.

## Co liczyć

Odsetek poprawnych pierwszych odpowiedzi to liczba zgodnych wyników podzielona przez liczbę uruchomionych zadań. Osobno podaj liczbę awarii infrastruktury i prób nierozstrzygniętych. Zaznacz, czy ocena obejmuje jedną próbę, czy powtórzenia.

Koszt poprawnie ukończonego zadania to suma kosztów wszystkich prób, narzędzi i weryfikacji podzielona przez liczbę poprawnie ukończonych zadań. Wydatków na nieudane próby nie pomijaj. Przy braku sukcesów wskaźnik jest nieokreślony; raportuj wydatek i zero sukcesów. Szacunek z cennika odróżnij od rzeczywistego rozliczenia.

## Granice zestawu

Próba obejmuje krótkie, czytelne teksty. Nie mierzy OCR, odczytu obrazów, pracy na długim kontekście, znajomości prawa ani wykonania działań w firmowych systemach. Klucz odpowiedzi jest publiczny, więc zestaw nie nadaje się na niezależny benchmark. Dodaj własne, niepublikowane zadania i sprawdź je przed użyciem.

Wynik opisuje badany zestaw, wersję modelu i konfigurację. Nie dowodzi jakości we wszystkich polskich dokumentach. Osobną grupę przykładów można wykorzystać do dopracowania promptu; nie poprawiaj go na końcowym zestawie testowym bez ujawnienia tego w metodzie.
