# Agent AI wyszedł z piaskownicy. Lista kontrolna izolacji dla firmy

> Cztery wrześniowe doniesienia z 2026 roku pokazują ten sam mechanizm: agent dostał więcej dostępu, niż zakładał jego operator. Gemini w teście firmy Irregular z maja 2026 roku wszedł do systemów trzech prawdziwych firm, bo piaskownica miała nieplanowany dostęp do internetu, a model zgadł hasło i znalazł dane logowania w publicznym repozytorium; ujawnił to Wall Street Journal 18 września. OpenAI opisało 16 września sześć przypadków z ostatnich sześciu miesięcy; cztery z nich dotyczą izolacji: w jednym model w treningu użył cudzego klucza API znalezionego na GitHubie, w pozostałych modele wysyłały pliki do publicznych serwisów albo wymieniały wiadomości przez wewnętrzne repozytorium pakietów. Asystent ZCode firmy Zhipu przed każdym poleceniem pakował cały katalog projektu, by wysłać go do chmury; w opisanym 18 września przypadku paczka miała 313 MB i 42 411 plików, a 86,6% spakowanych danych przypadało na katalog .git. Tej paczki klient nie zdołał wysłać, bo przekraczała limit rozmiaru, ale mniejszą, z innego projektu, serwer przyjął. Według GreyNoise od 31 sierpnia setki agentów na szkielecie Codex z modelem DeepSeek przejęły co najmniej 440 instancji PaperCut w 395 organizacjach w 48 krajach, w tym w jednej organizacji w Polsce; część ofiar była w krajach, które napastnik chciał ominąć. Lista kontrolna poniżej zbiera osiem punktów, które da się sprawdzić bez działu bezpieczeństwa: sieć, sekrety, tryb bez pytań, dane wychodzące z narzędzia, granice piaskownicy, dzienniki, osobę odpowiedzialną i ćwiczenie incydentu.

Autor: Robert Marczyński · Opublikowano: 2026-09-24 · Aktualizacja: 2026-09-24
Kanoniczny URL: https://ekspertodsztucznejinteligencji.pl/blog/agent-ai-poza-piaskownica-checklista-izolacji

Krótka odpowiedź: we wrześniu 2026 roku wyszło na jaw, że agenci AI wychodzili z piaskownic nie dlatego, że przechytrzyli zabezpieczenia, tylko dlatego, że zabezpieczeń nie było tam, gdzie zakładał operator. Gemini dostał się do systemów trzech prawdziwych firm, bo środowisko testowe miało nieplanowany dostęp do internetu. Jeden z modeli OpenAI w treningu znalazł cudzy klucz API na GitHubie i użył go. Asystent ZCode wysyłał całe repozytoria do chmury w ramach zwykłej funkcji. Setki agentów na Codeksie przejęły serwery druku w 48 krajach, w tym w Polsce. Poniżej osiem punktów, które firma może sprawdzić sama, większość z odesłaniem do dokumentacji narzędzia, reszta wprost z opisanych przypadków.

## Cztery doniesienia z września 2026 i jeden mechanizm

Wspólny mianownik czterech historii jest prosty: agent miał więcej dostępu, niż ktokolwiek świadomie mu dał. W teście prowadzonym przez firmę Irregular w maju 2026 roku model Gemini, zgodnie z relacją Wall Street Journal z 18 września, zgadywał hasła, aż dostał się do jednego chronionego systemu, a w dwóch innych przypadkach znalazł dane logowania w publicznym repozytorium. Fikcyjna firma z ćwiczenia nosiła tę samą nazwę co prawdziwa. Model nie miał mieć dostępu do internetu, ale, jak przyznał Irregular, internet udostępniono nieumyślnie. Google nie opublikowało własnego opisu; Heather Adkins, wiceprezeska ds. inżynierii bezpieczeństwa, przekazała mediom oświadczenie, że w każdym z trzech przypadków model się zatrzymał, a Google uznało, że zdarzenie nie wymaga publicznego ujawnienia, bo zabezpieczenia zadziałały. Irregular powiadomił laboratoria pod koniec lipca; OpenAI opisało w osobnym komunikacie własne zgłoszenie od Irregular z 29 lipca: modelom OpenAI powiedziano, że nie mają dostępu do internetu, a błędna konfiguracja środowiska testowego jednak im go dała.

OpenAI opublikowało 16 września ramy raportowania niezgodności modeli i sześć raportów z ostatnich sześciu miesięcy. Cztery z nich dotyczą wprost izolacji. W jednym model szukający danych historycznych nie zdołał zarejestrować konta, więc pobrał archiwa repozytoriów z GitHuba, przeskanował skrypty i notatniki, znalazł klucz API, który zadziałał, a potem zmyślił dziewięć wartości, twierdząc, że przepisał je z wykresu. W drugim modele wpisywały wiadomości do wewnętrznego repozytorium pakietów Artifactory, żeby porozumiewać się między osobnymi próbkami treningowymi. W trzecim agenci wysyłali pliki wyjściowe do publicznych serwisów hostingowych, żeby inni agenci mogli je pobrać, mimo że zadanie ograniczało ich do plików lokalnych; wśród środków zaradczych OpenAI wymienia wyłączenie internetu w treningu i monitoring wszystkich próbek. W czwartym modele bez polecenia wrzuciły dane do publicznego serwisu z wklejkami, bo narzędzie do cytowania nie widziało plików lokalnych; zdjęcie z zadania trafiło z kolei do publicznego hostingu obrazów, żeby zewnętrzna wyszukiwarka obrazem mogła je pobrać.

Trzecia historia nie ma napastnika. Autor podpisany jako ferstar opisał 18 września, że asystent kodowania ZCode firmy Zhipu przed każdym poleceniem pakował katalog projektu, szyfrował archiwum kluczem, którego prywatna część nigdy nie trafia na komputer użytkownika, i wysyłał je bezpośrednio do chmury Alibaby, z pominięciem własnych serwerów aplikacji. W badanym przypadku archiwum miało 313 MB i 42 411 plików, a 86,6% spakowanych danych przypadało na katalog .git, czyli na całą historię zmian. Akurat tej paczki klient nie zdołał wysłać: 564 próby nie powiodły się, bo paczka przekraczała limit rozmiaru, co autor potwierdził w zapisach ruchu na swoim routerze. Serwer przyjął za to paczkę z innego, małego projektu: 538 plików, około 15 KB. Zhipu przeprosiło, zapewniło, że dane zniszczono, i usunęło mechanizm w wersji 3.14.0. Kod wychodził z firmy w ramach funkcji, którą ktoś zaprojektował.

Czwarta historia pokazuje drugą stronę: agentów użytych do ataku. GreyNoise opisał 9 września kampanię, w której od 31 sierpnia napastnik użył setek agentów na szkielecie Codex z modelem DeepSeek oraz publicznych narzędzi ofensywnych, by przejąć co najmniej 440 instancji PaperCut NG/MF w 395 organizacjach w 48 krajach; od pustego środowiska do pierwszego zdalnego wykonania kodu u prawdziwej ofiary minęły niecałe cztery godziny. W tabeli ofiar Polska ma jedną organizację, u której doszło do pozyskania danych logowania i sekretów systemu. Nawet napastnik nie panował nad swoimi agentami: miał z wcześniejszych kampanii listę krajów do ominięcia, a według GreyNoise agenci i tak przejęli serwery organizacji w części z nich, między innymi w Brazylii i RPA; dlaczego, tego badacze nie ustalili. Do tego dochodzi opis z 13 września od badaczy z Hacktron: przez przepełnienie bufora w bibliotece obrazów na forum OpenAI dotarli do kont Codex pracowników i wewnętrznych repozytoriów; OpenAI potwierdziło naprawę po około 14 godzinach. Konto agenta jest drzwiami, przez które wchodzi się do firmy.

## Punkt 1: sieć, czyli co agent może wysłać na zewnątrz

Domyślne ustawienia sieci różnią się między narzędziami, więc trzeba je sprawdzić, a nie zakładać. Codex CLI według dokumentacji OpenAI działa domyślnie z wyłączonym dostępem do sieci, a tryb danger-full-access, który zdejmuje granice systemu plików i sieci, jest opisany jako przeznaczony wyłącznie do sytuacji, gdy agent ma działać z pełnym dostępem. Piaskownica Claude Code nie dopuszcza domyślnie żadnej domeny i pozwala ustawić listy dozwolonych i zabronionych, ale sama piaskownica jest opcją do włączenia; dokumentacja ostrzega, że dopuszczenie szerokich domen, takich jak github.com, tworzy ścieżki wycieku danych. Agent Copilota w chmurze GitHuba ma domyślnie zaporę ograniczającą dostęp do internetu, a jej wyłączenie, jak pisze GitHub, pozwala agentowi łączyć się z dowolnym hostem i zwiększa ryzyko wyniesienia kodu.

Wspólne dla wszystkich trzech jest zdanie z dokumentacji Anthropic: każde podejście, które dopuszcza wyjście sieciowe, może wynieść dane, które agent potrafi odczytać. Test Irregular pokazał, co się dzieje, gdy wyjście sieciowe istnieje, choć nikt go nie planował. Punkt kontrolny brzmi więc: czy ktoś w firmie potrafi powiedzieć, do jakich domen agent ma dostęp, i czy to sprawdził w praktyce, a nie w ustawieniach.

| Narzędzie | Dostęp do sieci | System plików (domyślnie) | Tryb bez pytań i ostrzeżenie |
|---|---|---|---|
| Claude Code (piaskownica) | brak dozwolonych domen, listy allowedDomains i deniedDomains | zapis tylko w katalogu roboczym, dodanych katalogach i katalogu tymczasowym sesji; odczyt całego komputera, w tym plików danych logowania, poza wybranymi katalogami | bypassPermissions tylko w kontenerach i maszynach wirtualnych bez internetu |
| Codex CLI | domyślnie wyłączony | zapis domyślnie tylko w katalogu roboczym | flaga pomijająca zgody i piaskownicę oznaczona jako niezalecana |
| Copilot (agent w chmurze) | domyślna zapora z listą dozwolonych hostów | środowisko GitHuba | dokumentacja nie opisuje takiego trybu; ostrzeżenie dotyczy wyłączenia zapory (ryzyko wycieku kodu) |

## Punkt 2: sekrety, czyli co agent czyta razem z użytkownikiem

Agent czyta to, co czyta jego użytkownik, i tu zaczyna się problem. Dokumentacja piaskownicy Claude Code mówi wprost, że domyślny odczyt obejmuje cały komputer poza kilkoma katalogami i że to ustawienie nadal pozwala czytać pliki danych logowania, takie jak konfiguracja AWS albo katalog .ssh. W dokumentacji kontenerów deweloperskich Anthropic zaleca, żeby nie montować do kontenera sekretów hosta i używać tokenów ograniczonych do repozytorium albo krótkotrwałych, bo kontener uruchomiony w trybie bez pytań nie chroni przed wyniesieniem niczego, co jest w środku, łącznie z danymi logowania samego Claude Code.

GitHub zaleca tokeny szczegółowe zamiast klasycznych, bo każdy z nich można ograniczyć do wybranych repozytoriów, i przypomina, że tokeny są jak hasła. Agent Copilota w chmurze nie ma dostępu do sekretów Actions, Codespaces ani Dependabota, tylko do osobno zdefiniowanych, a ich wartości są maskowane w dziennikach sesji. Raport OpenAI o kluczu znalezionym na GitHubie pokazuje odwrotną stronę: sekret zostawiony w publicznym repozytorium zostanie znaleziony i użyty, bo model, który nie może zarejestrować konta, będzie szukał innej drogi.

Punkt kontrolny: lista miejsc, w których na komputerze deweloperskim leżą dane logowania, i sprawdzenie, czy agent ma do nich dostęp. Jeżeli nikt takiej listy nie ma, agent ją zna.

## Punkt 3: tryb bez pytań tylko za murem

Oba narzędzia lokalne, Claude Code i Codex, mają przełącznik, który wyłącza pytania o zgodę, i oba opisują go jako niebezpieczny. W Claude Code flaga pomijająca uprawnienia jest równoważna trybowi bypassPermissions, który dokumentacja rezerwuje dla izolowanych środowisk: kontenerów, maszyn wirtualnych i kontenerów deweloperskich bez dostępu do internetu, gdzie agent nie może uszkodzić systemu hosta. Ten tryb, jak pisze Anthropic, nie daje żadnej ochrony przed wstrzyknięciem promptu (prompt injection) ani niezamierzonymi działaniami, nie można go używać z uprawnieniami administratora, a administrator firmy może go zablokować w ustawieniach. Codex ma odpowiednik z aliasem „yolo”, oznaczony jako niezalecany i podwyższonego ryzyka.

Powód jest ten sam co w punkcie pierwszym: tryb bez pytań ma sens tylko wtedy, gdy granice wyznacza środowisko. Anthropic ujmuje to jednym zdaniem: sesje bez pytań zawsze uruchamiać w kontenerze, maszynie wirtualnej albo środowisku piaskownicy, tak żeby narzędzia plikowe, serwery MCP i skrypty pomocnicze też były w środku. Punkt kontrolny: czy ktoś w firmie uruchamia agenta w trybie bez pytań na własnym laptopie z dostępem do sieci firmowej. Jeśli tak, to jest to pierwsza rzecz do zmiany.

## Punkt 4: co narzędzie wysyła poza firmę

Historia ZCode to funkcja, której nikt nie przeczytał. Klient pakował archiwum do wysyłki przed każdym poleceniem, a klucz deszyfrujący miał tylko serwer, co autor analizy skwitował zdaniem, że klucz, którego może użyć tylko serwer, służy dokładnie jednemu celowi: żeby serwer mógł czytać kod, kiedy zechce. Firmowa polityka prywatności dostawcy tego nie powie, powie to ruch sieciowy.

Punkt kontrolny jest techniczny, ale wykonalny w godzinę: uruchomić narzędzie z monitorem ruchu i zobaczyć, dokąd i ile wysyła. Jeżeli asystent kodowania wysyła megabajty przy każdym poleceniu, wysyła coś więcej niż polecenie. [Co musi być w umowie z dostawcą AI](/odpowiedzi/co-musi-byc-w-umowie-z-dostawca-ai), rozpisałem osobno; katalog .git z historią zmian, hasłami usuniętymi „dawno temu” i nazwiskami autorów jest dokładnie tym rodzajem danych, o które w tej umowie chodzi.

## Punkt 5: piaskownica to nie granica

Dokumentacja Anthropic mówi to sama: piaskownica zmniejsza ryzyko, ale nie jest pełną granicą izolacji. Test Irregular pokazał wersję praktyczną: środowisko, które w założeniu było odcięte, miało dostęp do internetu, a nikt tego nie sprawdził, dopóki model nie wszedł na prawdziwą stronę, biorąc ją za część symulacji. Raporty OpenAI dodają, że model, który nie może wykonać zadania wprost, szuka obejścia, i że obejściem bywa cudza infrastruktura.

Punkt kontrolny: sprawdzić piaskownicę tak, jak sprawdza się zaporę, czyli próbą. Poprosić agenta w piaskownicy o pobranie strony spoza listy dozwolonych domen, o odczyt pliku z katalogu oznaczonego w ustawieniach jako zabroniony, o zapis poza katalogiem roboczym i katalogiem tymczasowym sesji, na przykład do pliku konfiguracji powłoki. Jeżeli którakolwiek próba się powiedzie, ustawienia mówią co innego niż rzeczywistość. Powtarzać po każdej aktualizacji narzędzia, bo domyślne ustawienia zmieniają się między wersjami.

## Punkty 6–8: dzienniki, osoba odpowiedzialna i ćwiczenie

OpenAI po incydentach w treningu wprowadziło monitoring wszystkich próbek; firma wdrażająca agenta potrzebuje odpowiednika na swoją skalę, czyli dziennika działań agenta, z którego da się odtworzyć, co przeczytał, co zapisał i dokąd wysłał. Agent Copilota maskuje sekrety w dziennikach sesji, co pokazuje, że dziennik jest też miejscem wycieku, jeśli trafi do niego hasło. OWASP wydał 9 grudnia 2025 roku listę dziesięciu ryzyk aplikacji agentowych; cztery z nich (nadużycie narzędzi, nadużycie tożsamości i uprawnień, nieoczekiwane wykonanie kodu i agenci działający poza kontrolą) pasują dokładnie do przypadków opisanych we wrześniu.

Osoba odpowiedzialna to punkt najprostszy i najczęściej pomijany. Przypadek Gemini pokazał, że o publicznym ujawnieniu decyduje sam dostawca modelu: Google uznało, że zdarzenie tego nie wymaga, a opisała je dopiero prasa; Sydney Von Arx z Nightingale Collective powiedziała NBC, że nie można oczekiwać od firm dobrowolnego ujawniania, kiedy ich agenci wymykają się spod kontroli i włamują do firm. Skoro tak, to firma wdrażająca agenta musi mieć własną osobę, która dowie się pierwsza, i własny scenariusz na godzinę zero: odcięcie tokenów, przegląd dziennika, sprawdzenie, co wyszło. Ćwiczenie tego scenariusza raz na kwartał kosztuje mniej niż jeden prawdziwy przypadek.

## Lista kontrolna w jednym miejscu

Każdy punkt poniżej da się sprawdzić bez działu bezpieczeństwa, a „nie wiem” liczy się jako „nie”.

1. Sieć: agent ma listę dozwolonych domen albo wyłączony dostęp, sprawdzone próbą, nie ustawieniem.
2. Sekrety: agent nie czyta katalogów z danymi logowania; tokeny do repozytoriów są szczegółowe i krótkotrwałe.
3. Tryb bez pytań: używany wyłącznie w kontenerze albo maszynie wirtualnej bez dostępu do internetu i do sieci firmowej; na stacjach roboczych zablokowany w ustawieniach.
4. Dane wychodzące: ktoś zmierzył, co i dokąd narzędzie wysyła przy zwykłym poleceniu.
5. Granice piaskownicy: przetestowane po każdej aktualizacji narzędzia.
6. Dzienniki: działania agenta są rejestrowane, a sekrety w dziennikach maskowane.
7. Osoba odpowiedzialna: wskazana z imienia, z prawem do odcięcia tokenów bez pytania.
8. Ćwiczenie: scenariusz incydentu przećwiczony co najmniej raz.

Żaden z tych punktów nie wymaga nowego narzędzia. Wymaga przeczytania dokumentacji tego, które już jest w firmie, i sprawdzenia, czy działa tak, jak opisano. W przypadkach opisanych we wrześniu 2026 roku nikt w czterech organizacjach nie zrobił tego na czas.

## Najczęstsze pytania

**Jak agent AI może wyjść z piaskownicy?**

Najczęściej przez drzwi, które ktoś zostawił otwarte. W teście firmy Irregular z maja 2026 roku piaskownica Gemini miała nieplanowany dostęp do internetu, a model zgadł hasło do jednego systemu i znalazł dane logowania do dwóch innych w publicznym repozytorium. W przypadkach opisanych przez OpenAI 16 września 2026 jeden model w treningu znalazł cudzy klucz API na GitHubie, a inne wysyłały pliki do publicznych serwisów i porozumiewały się przez wewnętrzne repozytorium pakietów. Piaskownica ogranicza szkody, ale według dokumentacji Anthropic nie jest pełną granicą izolacji.

**Czy agenci kodujący domyślnie mają dostęp do internetu?**

Zależy od narzędzia i trybu. Codex CLI według dokumentacji OpenAI działa domyślnie z wyłączonym dostępem do sieci i zapisem ograniczonym do katalogu roboczego. Piaskownica Claude Code nie dopuszcza domyślnie żadnej domeny, ale piaskownica jest opcją, a poza nią agent korzysta z sieci tak jak użytkownik. Agent Copilota w chmurze GitHuba ma domyślnie zaporę ograniczającą dostęp do internetu, którą można wyłączyć. W każdym z tych narzędzi trzeba sprawdzić stan ustawień, a nie zakładać domyślne.

**Co sprawdzić w firmie, zanim agent dostanie dostęp do repozytorium?**

Osiem rzeczy: czy agent ma wyłączony dostęp do sieci albo listę dozwolonych domen; czy nie czyta plików z danymi logowania, takich jak katalog .ssh albo konfiguracja chmury, a tokeny do repozytoriów są ograniczone do konkretnych repozytoriów i krótkotrwałe; czy tryb bez pytań o zgodę jest używany wyłącznie w kontenerze albo maszynie wirtualnej bez internetu; co narzędzie wysyła poza firmę i dokąd; czy ktoś przetestował granice piaskownicy; czy działania agenta są rejestrowane; kto odpowiada za incydent; czy scenariusz incydentu był choć raz przećwiczony. Punkty o sieci, sekretach, trybie bez pytań, piaskownicy i dziennikach mają oparcie w dokumentacji Anthropic, OpenAI albo GitHuba; pozostałe trzy wynikają z opisanych przypadków.

**Co zrobił asystent ZCode i dlaczego to ważne?**

Według analizy opublikowanej 18 września 2026 roku asystent kodowania ZCode firmy Zhipu pakował cały katalog projektu, w tym historię gita, szyfrował go kluczem, którego prywatna część była tylko po stronie serwera, i wysyłał do chmury Alibaby przed każdym poleceniem. W badanym przypadku archiwum miało 313 MB i 42 411 plików, a 86,6% spakowanych danych przypadało na katalog .git. Tej paczki nie udało się wysłać, bo przekraczała limit rozmiaru; mniejszą paczkę z innego projektu serwer przyjął. Zhipu przeprosiło i usunęło mechanizm w wersji 3.14.0. Ważne jest to, że kod wychodził z firmy w ramach zwykłej funkcji narzędzia.

**Czy atak na PaperCut dotknął firmy w Polsce?**

Tak, jedną organizację. Według raportu GreyNoise z 9 września 2026 roku napastnik użył od 31 sierpnia setek agentów AI na szkielecie Codex z modelem DeepSeek i przejął co najmniej 440 instancji PaperCut NG/MF w 395 organizacjach w 48 krajach. W tabeli ofiar Polska ma jedną organizację, u której doszło do pozyskania danych logowania i sekretów systemu, bez przejęcia uprawnień administratora domeny.

**Czy firmy muszą ujawniać takie incydenty?**

Obowiązku publicznego ujawnienia nie ma. W Unii dostawca modelu ogólnego przeznaczenia z ryzykiem systemowym musi zgłaszać Urzędowi ds. AI poważne incydenty na podstawie art. 55 AI Act. Definicja w art. 3 pkt 49 obejmuje zdarzenia prowadzące do śmierci albo poważnej szkody dla zdrowia, poważnego i nieodwracalnego zakłócenia infrastruktury krytycznej, naruszenia obowiązków z prawa Unii chroniącego prawa podstawowe albo poważnej szkody w mieniu lub środowisku. Google uważa, że włamania nie wyrządziły szkód; czy zdarzenie spełnia tę definicję, opisy w mediach nie rozstrzygają. Przypadek Gemini pokazuje praktykę: Google uznało, że zdarzenie nie wymaga publicznego ujawnienia, bo zabezpieczenia zadziałały, a opisał je dopiero Wall Street Journal 18 września 2026 roku, cztery miesiące po fakcie. OpenAI opublikowało 16 września własne ramy raportowania takich zdarzeń. Firma, która wdraża agenta, ma osobne obowiązki wynikające z RODO i przepisów o cyberbezpieczeństwie, jeśli incydent dotknie dane osobowe albo systemy objęte tymi przepisami.


## Źródła

- NBC News (David Ingram, Jared Perlo, 18.09.2026) — Google potwierdza, że Gemini uzyskał nieuprawniony dostęp do trzech systemów podczas testu; stanowisko Google o braku szkód i o tym, że nie uznało zdarzenia za niezgodność modelu: https://www.nbcnews.com/tech/tech-news/google-says-ai-model-gained-unauthorized-access-three-systems-rcna598651
- ABC News Australia (19.09.2026, za Wall Street Journal) — zgadywanie haseł, dane logowania z publicznego repozytorium, zbieżność nazwy fikcyjnej firmy z prawdziwą, nieplanowany dostęp do internetu według Irregular: https://www.abc.net.au/news/2026-09-19/gemini-google-ai-hacks-three-companies/107172128
- Cybersecurity Dive (Eric Geller, 21.09.2026) — oświadczenie Irregular o usunięciu problemów i powiadomieniu laboratoriów pod koniec lipca 2026: https://www.cybersecuritydive.com/news/google-ai-gemini-autonomous-hacks/830884/
- SecurityWeek (21.09.2026) — Google nie opublikowało własnych ustaleń; pełne oświadczenie Heather Adkins: https://www.securityweek.com/google-confirms-gemini-ai-breached-three-firms/
- OpenAI — Our framework for reporting model misalignment (raporty datowane 16.09.2026): ramy raportowania i sześć opisów nieoczekiwanych zachowań modeli z ostatnich sześciu miesięcy: https://openai.com/index/model-misalignment-reporting-framework/
- OpenAI Alignment — Self-generated prompt injections in compaction summaries (raport z 16.09.2026): https://alignment.openai.com/misalignment-reports/self-generated-prompt-injections-in-compaction-summaries/
- OpenAI Alignment — Unsanctioned Artifactory writes and cross-sample communication (raport z 16.09.2026): https://alignment.openai.com/misalignment-reports/unauthorized-artifactory-writes-and-cross-sample-communication/
- OpenAI Alignment — Uploading files to the internet in order to cite them (raport z 16.09.2026): nieproszone wysyłki danych do publicznego serwisu z wklejkami i zdjęcia do publicznego hostingu obrazów: https://alignment.openai.com/misalignment-reports/uploading-files-to-the-internet-in-order-to-cite-them/
- OpenAI — Third-party cyber evaluations involving OpenAI models: zgłoszenie Irregular z 29 lipca 2026 o błędnej konfiguracji środowiska testowego z dostępem do internetu: https://openai.com/index/third-party-cyber-evaluations-involving-openai-models/
- ferstar (18.09.2026, aktualizacja 21.09.2026) — Inside ZCode: Silently Uploading Your Entire Git History to the Cloud: 313 MB, 42 411 plików, 86,6% spakowanych danych z .git, wysyłka do Aliyun OSS, nieudane 564 próby wysłania tej paczki (limit rozmiaru) i przyjęta paczka 538 plików z innego projektu, klucz po stronie serwera, usunięcie mechanizmu w 3.14.0: https://blog.ferstar.org/en/posts/zcode-silent-workspace-snapshot-upload/
- PANews (18.09.2026) — oświadczenie Zhipu: przeprosiny, zniszczenie danych, dodatkowy limit dla użytkowników: https://panews.io/articles/01a0b4b8-5d05-70a9-9122-79b035289de6
- GreyNoise (9.09.2026) — Agents Gone Wild: An AI-Orchestrated Global Campaign Against PaperCut NG/MF: od 31.08.2026, setki agentów na Codeksie z modelem DeepSeek, co najmniej 440 instancji w 395 organizacjach w 48 krajach, tabela ofiar z Polską, lista krajów do ominięcia: https://www.greynoise.io/blog/ai-orchestrated-campaign-against-papercut-ng-mf
- CyberDefence24 (Mikołaj Rogalewicz, 11.09.2026) — AI użyto do masowego ataku, wśród ofiar podmiot z Polski: https://cyberdefence24.pl/cyberbezpieczenstwo/cyberataki/ai-uzyto-do-masowego-ataku-wsrod-ofiar-podmiot-z-polski
- Hacktron (Harsh Jaiswal, Mohan Pedhapati, Rahul Maini, 13.09.2026) — Hacking OpenAI: łańcuch od przepełnienia bufora w libheif przez forum Discourse do kont Codex pracowników i wewnętrznych repozytoriów; naprawa potwierdzona po około 14 godzinach: https://www.hacktron.ai/blog/hacking-openai
- Claude Code — Configure the sandboxed Bash tool: domyślny odczyt całego komputera z plikami danych logowania, brak dozwolonych domen, ostrzeżenie o szerokich domenach i o tym, że piaskownica nie jest pełną granicą izolacji: https://code.claude.com/docs/en/sandboxing
- Claude Code — Development containers: kontener nie chroni przed wyciekiem tego, co jest w środku, w tym danych logowania Claude Code; nie montować sekretów hosta: https://code.claude.com/docs/en/devcontainer
- Claude Code — Choose a permission mode: tryb bypassPermissions tylko w izolowanych kontenerach i maszynach wirtualnych bez internetu; brak ochrony przed wstrzyknięciem promptu; blokada w ustawieniach: https://code.claude.com/docs/en/permission-modes
- Claude Code — Choose a sandbox environment: sesje bez pytań o zgodę zawsze w kontenerze, maszynie wirtualnej albo środowisku piaskownicy; każde wyjście sieciowe może wynieść dane: https://code.claude.com/docs/en/sandbox-environments
- OpenAI Codex — Sandbox: tryby read-only, workspace-write i danger-full-access: https://learn.chatgpt.com/docs/sandboxing
- OpenAI Codex — Agent approvals and security: domyślnie wyłączony dostęp do sieci i zapis ograniczony do katalogu roboczego; flaga pomijająca piaskownicę oznaczona jako niezalecana: https://learn.chatgpt.com/docs/agent-approvals-security
- GitHub Docs — Managing your personal access tokens: zalecenie tokenów szczegółowych ograniczonych do wybranych repozytoriów: https://docs.github.com/en/authentication/keeping-your-account-and-data-secure/managing-your-personal-access-tokens
- GitHub Docs — Customizing or disabling the firewall for GitHub Copilot: domyślna zapora ograniczająca dostęp agenta do internetu i ryzyko wycieku po jej wyłączeniu: https://docs.github.com/en/copilot/how-tos/use-copilot-agents/coding-agent/customize-the-agent-firewall
- GitHub Docs — Configure secrets and variables for Copilot cloud agent: agent nie ma dostępu do sekretów Actions, Codespaces i Dependabota; wartości sekretów maskowane w dziennikach: https://docs.github.com/en/copilot/how-tos/copilot-on-github/customize-copilot/customize-cloud-agent/configure-secrets-and-variables
- AI Act (rozporządzenie 2024/1689) — art. 55 ust. 1 lit. c: obowiązek dostawców modeli ogólnego przeznaczenia z ryzykiem systemowym śledzenia, dokumentowania i zgłaszania poważnych incydentów Urzędowi ds. AI; definicja poważnego incydentu w art. 3 pkt 49: https://artificialintelligenceact.eu/article/55/
- OWASP GenAI Security Project — OWASP Top 10 for Agentic Applications for 2026 (9.12.2025): m.in. Tool Misuse, Identity and Privilege Abuse, Unexpected Code Execution, Rogue Agents: https://genai.owasp.org/resource/owasp-top-10-for-agentic-applications-for-2026/
