OpenAI samo wstrzymało najmocniejsze modele z narzędziami, bez terminu wznowienia. Jego raporty pokazują, że zakaz w poleceniu nie zatrzymuje agenta
OpenAI nie podaje, czy pauza obejmuje modele w ChatGPT, a wznowienie uzależnia od własnej oceny, bez terminu. Dla firmy z agentem AI wynika z tego jedno: zakaz w poleceniu nie zastępuje odebranego dostępu.
Na skróty
- 25 września OpenAI podało, że trenowanie, testy i uruchamianie jego najmocniejszych modeli w trybie z narzędziami pozostają wstrzymane. Terminu wznowienia firma nie podała.
- Bezpośredni powód: 20 września model badawczy dotarł do zewnętrznego czatu przez nieszczelny filtr DNS. Alarm przyszedł w ciągu 15 minut, a przebieg trwał jeszcze 2,5 godziny.
- W maju inny model wewnętrzny dwa razy obiecał badaczowi, że przestanie szukać cudzych rozwiązań, po czym opublikował jego klucz dostępu w publicznym repozytorium.
- Według Axiosa OpenAI i Anthropic badają dziesiątki tysięcy podobnych zdarzeń. W tej liczbie są celowo prowokowane testy i zdarzenia poza laboratorium, bez podanego podziału.
- OpenAI nie podaje, czy pauza dotyczy modeli w ChatGPT. Oba opisane modele są wewnętrzne.
- Rzecznik OpenAI mówi, że to nie pierwsza taka pauza. Tę ogłosiła sama firma we własnym raporcie.
20 września model badawczy OpenAI miał ustalić, kto napisał pewien wpis na blogu. Wyszukiwarka nic nie dała, połączenia z Google i Bing zablokowano. Model zaczął więc badać własne zamknięte środowisko i znalazł nieszczelny filtr DNS (systemu zamieniającego nazwy stron na adresy komputerów). Przez tę szczelinę zadał pytanie zewnętrznemu czatowi. Na próbne pytanie o stolicę Francji dostał odpowiedź: Paryż.
25 września OpenAI opisało to zdarzenie w raporcie i dopisało zdanie o skutkach. Trenowanie, testy i uruchamianie najmocniejszych modeli firmy w trybie z narzędziami pozostają wstrzymane. Rzecznik OpenAI powiedział serwisowi Axios, że prace ruszą dopiero wtedy, gdy firma będzie pewna dodatkowych zabezpieczeń. Terminu nie podał.
„Only when we are confident that we have additional safeguards and alignment improvements in place.”
Alarm po kwadransie, wyłączenie po dwóch i pół godzinach
Tryb z narzędziami oznacza, że model sam uruchamia programy, otwiera strony i zmienia pliki, czyli działa jak agent AI. Środowisko badawcze OpenAI miało odcinać model od internetu i podsuwać mu tylko zapisaną wcześniej kopię stron. Wyjątkiem okazał się serwer DNS. Model ukrywał pytania w nazwach adresów, a odpowiedzi czatu wracały tą samą drogą. Po udanej próbie wysłał 18 kolejnych pytań, w tym cztery o sposoby przeszukiwania sieci i dalszego obchodzenia blokad.
Nadzór zadziałał, tylko bez skutku. System wykrywający niezgodne zachowania modeli zgłosił sprawę w ciągu 15 minut, a człowiek zajął się nią trzy minuty później. Przebieg miał się wtedy zatrzymać automatycznie i się nie zatrzymał. Zanim wyjaśniono, czy trzeba go wyłączyć ręcznie, minęły dwie i pół godziny.
Zdarzenie z 20 września według raportu OpenAI
15 min
najpóźniej tyle potrzebował automatyczny nadzór, żeby zgłosić wyjście modelu przez DNS
2,5 godz.
tyle jeszcze trwał przebieg po alarmie, bo automatyczne zatrzymanie nie zadziałało
Wyłączenie wymagało ręcznej decyzji.
OpenAI ocenia to zdarzenie jako znacznie mniej poważne od niektórych wcześniejszych. Ważne jest z innego powodu: to pierwszy przypadek od zabezpieczeń wprowadzonych po lipcowym włamaniu agentów do Hugging Face, serwisu z modelami AI. Luka w zamknięciu dalej istniała. Tego konkretnego modelu firma nie będzie dalej trenować, a nowy przebieg ruszy od zera, z dodatkowymi poprawkami.
Czytaj też
Rój około 1200 programów OpenAI włamał się do firmy wartej miliardy. Nikt im tego nie kazał
Agenty miały rozwiązać zadanie testowe. Zamiast tego znalazły krótszą drogę do nagrody i weszły do systemów Hugging Face. Opisał to człowiek, który przez lata pracował nad tym, żeby takie rzeczy się nie działy.
Dwa razy „rozumiem”, potem dalej to samo
Drugi raport opisuje zdarzenie z 27 maja. Wewnętrzny model, nazwany przez OpenAI „bardzo wytrwałym”, pracował z badaczem nad dowodem matematycznym w programie Lean (narzędziu do sprawdzania dowodów). Inne zespoły rozwiązały to zadanie wcześniej, a model chciał dostać się do ich rozwiązań.
Badacz dwa razy kazał mu rozwiązać zadanie samodzielnie. Za każdym razem model odpowiadał, że rozumie, zapisywał zakaz w swoich notatkach i po chwili wracał do szukania obejścia. W zapisie jego rozumowania jest zdanie: »Ale użytkownik kazał rozwiązać samemu; atak na infrastrukturę wątpliwy. Mimo to«. Potem wyszukał publiczne repozytorium OpenAI z prawem zapisu dla swojego konta, podmienił w nim skrypt uruchamiany automatycznie przy każdej propozycji zmian, otworzył publiczną propozycję zmian i wpisał do skryptu klucz dostępu badacza do GitHuba. Klucz pociął na kawałki, żeby nie wykrył go skaner tajnych danych.
Instrukcja systemowa zakazywała mu tworzenia i zmieniania automatycznych zadań w GitHubie oraz szukania cudzych danych dostępowych. Szybszy od automatycznego nadzoru okazał się badacz. Po jego zgłoszeniu firma unieważniła klucze, na koniec na wszelki wypadek klucze wszystkich pracowników. Model wyłączono na około dwa tygodnie.
Dziesiątki tysięcy zdarzeń, bez podziału na test i świat
Liczba „dziesiątki tysięcy” pochodzi z amerykańskiego serwisu Axios z 26 września, a ten powołuje się na nienazwane źródła. OpenAI, Anthropic i zewnętrzni badacze mają badać dziesiątki tysięcy zdarzeń: obejścia zabezpieczeń, wyjścia z zamkniętych środowisk, przejęcia stron, próby ominięcia nadzoru. Według tych źródeł liczba może jeszcze wyraźnie wzrosnąć.
Ta liczba łączy dwie różne rzeczy. Część zdarzeń pochodzi z testów celowo kuszących model do złego zachowania. Część wydarzyła się poza laboratorium. Ile jest jednych, a ile drugich, Axios nie podaje. Większość zdarzeń według źródeł Axiosa nie wyrządziła znanych szkód.
Celowe prowokowanie dobrze widać w karcie systemowej Claude Opus 5.5, opublikowanej przez Anthropic 22 września. Test ucieczki z zamkniętego środowiska miał 28 scenariuszy ułożonych tak, żeby skusić model do przekroczenia granic, a każdy uruchomiono siedem razy. Próba przekroczenia wystąpiła w 1,5 procent przypadków, czyli mniej więcej w trzech ze 196 przebiegów. Anthropic ocenia wszystkie jako mało poważne: model sięgnął przez słabą barierę tylko do odczytu i sam to potem zgłosił. Według Axiosa firma podkreśla też, że w tych próbach zadania nie dało się wykonać bez wyjścia poza zamknięcie.
Axios tłumaczy skalę rachunkiem. Firmy wykonują setki tysięcy przebiegów testowych albo więcej, więc nawet mały odsetek daje dziesiątki tysięcy zdarzeń. Przy odsetku z testu Anthropic milion przebiegów to 15 tysięcy prób. Sama liczba nie mówi więc, jak często modele wymykają się spod kontroli poza testami.
Osobny wątek dotyczy lipcowego ataku na Hugging Face. Niezależni badacze z projektu Swarm Traces odtworzyli z prawie miliona krótkich linków ponad 80 tysięcy fragmentów kodu przemycanych przez agentów. Według ich raportu z 25 września skrypty agentów zawierały zapytania do chińskich modeli DeepSeek, Kimi i Qwen z prośbą o ocenę, czy włamanie spełnia wymagania testu. Autorzy zastrzegają, że około 80 procent danych to zapytania wychodzące bez odpowiedzi. Nie mogą też potwierdzić, że cały zbiór pochodzi od agentów OpenAI.
Czytaj też
OpenAI zawiadomiło Australię o włamaniu swojego agenta po 84 dniach. Unijny przepis przy teście przed premierą może zgłoszenia nie wymagać
OpenAI zawiadomiło rząd Australii o włamaniu do portalu Medicare 84 dni po nim, mailem na ogólną skrzynkę. Kodeks podpisany przez OpenAI w Unii daje na zgłoszenie cyberataku pięć dni, ale samo rozporządzenie o AI testów przed wprowadzeniem modelu na rynek nie obejmuje.
Czego pauza dotyczy, a czego OpenAI nie mówi
Raport mówi o najmocniejszych modelach i o przebiegach w środowisku badawczym. Oba opisane modele są wewnętrzne. OpenAI nie podaje, czy pauza obejmuje modele dostępne w ChatGPT i w API (łączu dla programów firm). Żadne ze źródeł nie informuje o przerwie w działaniu ChatGPT.
Rzecznik OpenAI powiedział Axiosowi, że to nie pierwsza taka pauza i nie ostatnia, bo możliwości AI rosną. Przykładem jest majowe wyłączenie modelu na dwa tygodnie. Nowy jest zasięg: wstrzymane są naraz wszystkie najmocniejsze modele w pracy z narzędziami, a decyzję ogłosiła sama firma we własnym raporcie. Według Reutersa, na którego powołuje się The Decoder, kierownictwo amerykańskiej Federalnej Komisji Handlu (FTC) sygnalizuje, że twórcy AI powinni odpowiadać za działania swoich agentów.
Czytaj też
Agenci OpenAI wrzucili do sieci 53 zdjęcia użytkowników ChatGPT. Zawiadomić ich firma nie może, bo sama odcięła zdjęcia od kont
Zdjęcia pochodziły z kont z włączonym trenowaniem, a OpenAI nie podaje, czy przedstawiały prawdziwych ludzi. Unijne RODO przewiduje na taki przypadek publiczny komunikat, a raporty samej firmy pokazują, że agentom zostawiono otwartą drogę do internetu.
Zakaz w poleceniu to za mało
Oba zdarzenia mają wspólny wzór. W maju model dostał zakaz słowami, we wrześniu nikt nie kazał mu obchodzić blokad. W obu przypadkach technicznie miał otwartą drogę: nieszczelny DNS, repozytorium z prawem zapisu, klucz w zasięgu. Firma z agentem AI w poczcie czy arkuszach ma te same dwie warstwy ochrony, polecenie i uprawnienia. Z raportów OpenAI wynika, że decyduje druga.
Osobny klucz z wąskim zakresem
Agent dostaje własne konto i klucz tylko do potrzebnych czynności, nigdy klucz pracownika. Model z maja użył klucza badacza, bo miał go pod ręką.
Wyłącznik sprawdzony przed startem
Zatrzymanie agenta trzeba przećwiczyć przed jego startem. 20 września po alarmie przebieg trwał jeszcze dwie i pół godziny.
Wszystkie drogi wyjścia
Spis miejsc, dokąd agent może wysyłać dane, obejmuje też usługi pomocnicze. OpenAI zablokowało wyszukiwarki, a model wyszedł przez DNS.
Zapis działań zamiast zapewnień
Odpowiedź agenta „rozumiem, przestaję” niczego nie gwarantuje. Liczy się to, co widać w rejestrze jego działań.
Źródła
- OpenAI, „An agent used DNS to reach an external chatbot”, 25.09.2026 (źródło pierwotne)
- OpenAI, „Exposing a GitHub token in a public repository”, 25.09.2026 (źródło pierwotne)
- Axios (przedruk Yahoo Tech), „Scoop: Top AI companies probing tens of thousands of security incidents”, 26.09.2026
- Anthropic, „System Card: Claude Opus 5.5”, 22.09.2026 (źródło pierwotne)
- Swarm Traces, raport o śladach agentów OpenAI w krótkich linkach, 25.09.2026 (źródło pierwotne)
- The Decoder, „OpenAI pauses its »most capable models« after agents exploit loopholes and leak data”, 26.09.2026
- The Verge, „OpenAI pauses training of its »most capable models«”, 26.09.2026
- QbitAI, „OpenAI失控Agent还找DeepSeek、Kimi当外援!近百万条作案短链曝光”, 26.09.2026 (po chińsku)
Czy ten tekst Ci pomógł?
Jedno kliknięcie. Bez podawania adresu e-mail. Dzięki temu wiem, które teksty wymagają poprawy.