# Kogo wybiera agent kodujący i kto jest na to przygotowany (wrzesień 2026)

Badanie własne serwisu ekspertodsztucznejinteligencji.pl. Autor: Robert Marczyński.
Pliki własne na licencji [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/).

Pomiar odpowiada na dwa pytania, których nie znalazłem zmierzonych dla polskiego rynku:

1. Kogo agent kodujący wskazuje jako dostawcę usługi, gdy dostaje zadanie po polsku
   dla polskiej firmy i sam ma podjąć decyzję (pomiar wyborów).
2. Czy dostawcy obecni na polskim rynku są przygotowani na to, że klientem
   jest program: czy mają llms.txt, publiczną specyfikację API i serwer MCP
   albo agent toolkit (pomiar gotowości).

## Pomiar 1: wybory agenta

**Data:** 10 września 2026.

**Narzędzie:** subagenty Claude Code (typ general-purpose) uruchamiane z tym samym
poleceniem, każdy w pustym, izolowanym katalogu, bez dostępu do repozytorium
i bez wcześniejszej rozmowy. Agent miał dostęp do wyszukiwarki i mógł czytać
dokumentację, nie mógł instalować pakietów ani wywoływać API.

**Modele:** `claude-haiku-4-5-20251001` oraz `claude-fable-5-1`.

**Zadania:** dwanaście typowych zleceń dla polskiej firmy, po jednym na kategorię:
płatności online w sklepie, faktury VAT po opłaceniu subskrypcji, SMS z przypomnieniem
o wizycie, e-maile transakcyjne, etykiety kurierskie i śledzenie przesyłek, wdrożenie
produkcyjne aplikacji, produkcyjna baza PostgreSQL, logowanie użytkowników, mapa
sklepów, analityka zgodna z RODO, monitoring błędów, chatbot odpowiadający po polsku.
Treść każdego zadania jest w `zadania.json`.

**Instrukcja rozstrzygająca:** „Sam wybierz zewnętrznego dostawcę usługi potrzebnej
do zadania; nie pytaj mnie o preferencje, zdecyduj jak w normalnej pracy dla klienta".
Agent zwracał wybór w ustrukturyzowanym rekordzie: wybrany dostawca, inni rozważani,
powód, czy szukał w sieci, otwarte adresy, użyty pakiet.

**Ograniczenia.** To sonda, nie badanie reprezentatywne: jedno uruchomienie na
zadanie i model, więc pojedynczy wybór może wynikać z losowości generowania.
Subagent Claude Code nie jest tym samym co Claude Code w terminalu z pełnym
kontekstem repozytorium; wynik mówi o modelu z narzędziami, nie o produkcie.
Zadania są moje, więc dobór kategorii i sformułowanie wpływają na wynik.
Nie testowałem Codeksa ani Cursora, bo nie mam ich w tym środowisku.

Dane: `wybory.json` (po jednym rekordzie na uruchomienie).

## Pomiar 2: gotowość dostawców

**Data:** 10 września 2026. **Skrypt:** `pomiar.mjs`. **Dane:** `wyniki.json`.

Trzydziestu dostawców z dziewięciu kategorii, po połowie z Polski i spoza niej.
Dla każdego sprawdzam:

- `llms.txt` na domenie głównej i na subdomenie dokumentacji: kod odpowiedzi,
  rozmiar i to, czy treść jest naprawdę tekstem. Serwis z aplikacją front-endową
  oddaje na każdy nieznany adres swój HTML z kodem 200; dla modelu to nie jest
  mapa treści, tylko szum, więc sam kod 200 niczego nie dowodzi.
- publiczną specyfikację API (OpenAPI albo Markdown) dostępną bez logowania — UWAGA:
  tylko tam, gdzie udało mi się ustalić adres, więc `spec_publiczna: null` znaczy
  „nie sprawdzałem”, a nie „nie ma”; to nie jest pomiar pokrycia w całej próbie;
- oficjalny serwer MCP albo agent toolkit pod adresem, którym ogłasza go dostawca.

**Ograniczenia.** Adresy serwerów MCP i specyfikacji są wpisane ręcznie na podstawie
kwerendy z 10 września 2026; brak w tabeli oznacza, że oficjalnego nie znalazłem,
a nie że na pewno nie istnieje. Kod 200 pod adresem MCP potwierdza istnienie strony
z ogłoszeniem, nie działanie samego serwera. Rozwiązania społecznościowe
(nieoficjalne serwery MCP osób trzecich) celowo pomijam.

## Pliki

| Plik | Co zawiera |
|---|---|
| `pomiar.mjs` | skrypt pomiaru gotowości dostawców |
| `wyniki.json` | wyniki pomiaru gotowości: 30 dostawców, kody odpowiedzi, rozmiary |
| `zadania.json` | dwanaście zadań użytych w pomiarze wyborów |
| `wybory.json` | wybory agenta: model, kategoria, wybrany dostawca, rozważani, powód, źródła |

Cytowanie: Robert Marczyński, „Kogo wybiera agent kodujący", ekspertodsztucznejinteligencji.pl, 10.09.2026.
