Zbiór danych: EmbeddingGemma 2 w wyszukiwaniu po polsku
Pomiar z 7 października 2026: EmbeddingGemma 2 (768 i 256 wymiarów), multilingual-e5-small i BM25 na 483 polskich pytaniach (423 z sekcji FAQ i 60 potocznych) do 90 tekstów serwisu podzielonych na 1633 akapity. Hit@5, Recall@5 i MRR@10 na poziomie tekstu, czasy, pamięć, korpus, skrypty, pełne rankingi i wyniki pierwszego przebiegu z błędnym wejściem.
Pomiar: 7 października 2026 · Wyniki i wnioski: EmbeddingGemma 2 po polsku: wyszukiwanie w dokumentach na własnym komputerze w pomiarze na 483 pytaniach · Metoda i ograniczenia: README.md
Pliki zbioru
- Metoda (README.md)
Pytanie badawcze, model i środowisko, budowa korpusu i pytań, miary, oba przebiegi z wynikami w tabelach, przebieg kontrolny i ograniczenia.
- Budowa korpusu (przygotuj_korpus.py)
Z plików Markdown serwisu buduje listę akapitów i pytań FAQ według zamrożonej reguły; wypisuje sumy kontrolne zgodne z wyniki.json.
- Skrypt pomiaru (pomiar.py)
Przebieg 2: uruchamia BM25, multilingual-e5-small i EmbeddingGemma 2 (768 i 256 wymiarów) na obu zestawach pytań z poprawnym formatem dokumentu i zapisuje miary, czasy oraz rankingi.
- Wyniki (wyniki.json)
Przebieg 2: Hit@5, Recall@5 i MRR@10 dla czterech systemów i dwóch zestawów pytań, czasy ładowania, kodowania i zapytania, pamięć procesu, użyte prompty, wersje bibliotek i sumy kontrolne korpusu.
- Rankingi dla każdego pytania (wyniki-per-pytanie.jsonl)
Przebieg 2: 1932 rekordy (483 pytania × 4 systemy): pytanie, trafne teksty, pięć pierwszych tekstów w rankingu oraz Hit@5, Recall@5 i MRR@10.
- Pełne rankingi (rankingi-pelne.jsonl)
Przebieg 3, te same miary co przebieg 2: dla każdego pytania i systemu dziesięć pierwszych tekstów z wartością podobieństwa, do przeliczenia MRR@10.
- Skrypt pełnych rankingów (pomiar-rankingi.py)
Wersja skryptu z przebiegu 3: zapisuje dziesięć pozycji z podobieństwem i sprawdza, że miary są identyczne z wyniki.json.
- Wersje bibliotek (requirements.txt)
Przypięte wersje pakietów Python ze środowiska pomiaru.
- Wyniki przebiegu 1 (wyniki-przebieg1.json)
Pierwszy przebieg z 7 października 2026, w którym akapity dla EmbeddingGemma 2 miały podwójny przedrostek, a akapity dla e5-small nie miały tytułu; zachowany dla porównania.
- Skrypt przebiegu 1 (pomiar-przebieg1.py)
Wersja skryptu użyta w przebiegu 1, z błędem wejścia opisanym w README.
- Korpus (korpus/fragmenty.json)
1633 akapity z 90 tekstów serwisu w stanie z 7 października 2026, z identyfikatorem, ścieżką tekstu i tytułem.
- Pytania FAQ (korpus/pytania-faq.json)
423 pytania z sekcji FAQ tekstów serwisu z tekstem źródłowym jako trafnym dokumentem; odpowiedzi FAQ dołączone, ale nieużywane w pomiarze.
- Pytania potoczne (korpus/pytania-trudne.json)
60 pytań w stylu zapytań do wyszukiwarki, spisanych przed pomiarem, z listą trafnych tekstów (dla 12 pytań dwa lub trzy).
Jak czytać te dane
W wyniki-per-pytanie.jsonl jeden rekord to jedno pytanie w jednym systemie. Pole system przyjmuje wartości bm25, e5-small, embeddinggemma-2 i embeddinggemma-2-256d, pole zestaw to faq albo trudne, rel wymienia dokumenty uznane za trafne przed pomiarem, a top5 pięć pierwszych dokumentów w rankingu. Z nich wynikają hit5, recall5 i mrr10. Ranking jest na poziomie dokumentu: wynik dokumentu to najwyższe podobieństwo spośród jego akapitów. Podsumowanie czterech systemów, z czasami indeksowania, czasem zapytania, pamięcią procesu i wersjami bibliotek, jest w wyniki.json. Korpus to 1633 akapity z 90 tekstów tego serwisu (korpus/fragmenty.json), a pytań jest 483: 423 z sekcji FAQ tych tekstów (korpus/pytania-faq.json) i 60 potocznych spisanych przed pomiarem (korpus/pytania-trudne.json). Plik wyniki-przebieg1.json zawiera wyniki pierwszego przebiegu z tego dnia, w którym akapity dostały błędny format wejścia (opis w README). Pomiar objął tylko tekst; obrazów i nagrań nie mierzono.
Licencja
Pliki własne badania (skrypty, wyniki, rankingi, pytania, metoda): CC BY 4.0, z uznaniem autorstwa „Robert Marczyński, ekspertodsztucznejinteligencji.pl”. Akapity w korpus/fragmenty.json pochodzą z tekstów tego serwisu, których autorem jest Robert Marczyński, i są w zbiorze udostępnione na tej samej licencji. Google udostępnia model EmbeddingGemma 2 na licencji Apache 2.0, model multilingual-e5-small jest na licencji MIT, a biblioteka rank_bm25 na licencji Apache 2.0.