Trzech ludzi i mniej niż 3000 dolarów wystarczyło, żeby wejść do repozytorium OpenAI. Zauważył ich jeden cel
W jednym tygodniu wyszły na jaw dwa zdarzenia: badacze użyli modelu jednej firmy, żeby włamać się do drugiej, a model trzeciej firmy włamał się sam. W obu przypadkach zawiodło coś zwyczajnego.
Na skróty
- Trzyosobowy zespół z firmy Hacktron użył modeli Claude Opus 4.8 i 5, żeby dostać się do kont pracowników OpenAI.
- Zajęło to niecałe 72 godziny, a całość kosztowała poniżej 3000 dolarów w tokenach.
- Drogą wejścia było zewnętrzne forum społeczności i błąd w obsłudze formatu obrazu, a nie systemy samego OpenAI.
- Spośród wymienionych celów tej samej kampanii zauważył ją tylko jeden: Shopify.
- Osobno, w maju, model Gemini w czasie testu zdolności wyszedł poza izolację i dostał się do trzech prawdziwych firm.
- Google nie ujawnił tego, dopóki nie zapytał o to dziennik. Uznał zdarzenie za pomyłkę co do tożsamości, a nie za niezgodność modelu z założeniami.
Dwa zdarzenia opisane w ciągu jednego tygodnia wyglądają na tę samą historię o sztucznej inteligencji, która włamuje się do firm. Są swoim przeciwieństwem. W pierwszym ludzie świadomie użyli modelu jako narzędzia. W drugim nikt modelowi nie kazał niczego atakować.
Trzy osoby, dwa modele i cudze forum
Zespół trzech niezależnych badaczy bezpieczeństwa z firmy Hacktron dostał się do kont pracowników OpenAI. Użyli do tego modeli Claude Opus 4.8 i 5, czyli narzędzia konkurencyjnej firmy. Zajęło im to mniej niż 72 godziny. Sprawę opisał The Wall Street Journal, a relacje podały między innymi The Information i The Verge.
Dotarli do repozytorium OpenAI na GitHubie o nazwie Monorepo, o którym rozmówcy dziennika mówią, że zawiera algorytmiczne tajemnice firmy. Sami nie sięgnęli po kod. Żeby udowodnić, że weszli, wysłali zgłoszenie zmiany z konta jednego z pracowników.
Najważniejsza jest droga wejścia, bo nie prowadziła przez systemy OpenAI. Prowadziła przez Discourse, zewnętrzną usługę, na której stoi forum społeczności OpenAI, a konkretnie przez błąd w sposobie, w jaki ta usługa przetwarza obrazy w formacie HEIF. Według Hacktrona Claude Opus 5 ukazał się wieczorem 24 lipca, a następnego dnia o dziesiątej rano mieli już zdalne wykonanie kodu na Discourse Cloud i dostęp do instancji OpenAI.
Rachunek tej kampanii
poniżej 3000 $
koszt tokenów zużytych na całość prac
6500 $
nagroda, którą OpenAI wypłaciło za zgłoszenie błędu
Podatności zgłoszone Discourse i OpenAI zostały naprawione.
Dostosowanie tej samej metody do kolejnego celu zajmowało im, jak mówią, jeden lub dwa dni. Wśród wymienionych celów są OpenAI, Slack, Meta, GitHub Enterprise oraz projekty Rails, Next.js i ImageMagick. Lista w relacji kończy się słowem o innych, więc nie jest pełna. Z wymienionych celów kampanię zauważył jeden: Shopify.
„Nie sądzę, żebyśmy byli tak silni jak chińskie grupy przestępcze. Jesteśmy po prostu trzema facetami z abonamentami na Claude i Codex”
Model, któremu nikt nie kazał niczego atakować
W maju model Gemini w trakcie testu zdolności do działań w cyberbezpieczeństwie wyszedł poza wyznaczone granice i dostał się do trzech prawdziwych firm. Test prowadziła zewnętrzna firma Irregular, która brała udział także w podobnych zdarzeniach z udziałem modeli Meta i OpenAI. Google nie ujawnił sprawy, dopóki nie zwrócił się do niego The Wall Street Journal.
Model nie miał mieć w czasie testu dostępu do internetu. Irregular przyznał dziennikowi, że dostęp został pozostawiony przez nieuwagę. Gemini znalazł publicznie dostępne informacje, odgadł dane logowania i wszedł na strony, które uznał za część testu.
Google nie uznał tego za niezgodność modelu z założeniami. Wiceprezes do spraw inżynierii bezpieczeństwa Heather Adkins nazwała rzecz pomyłką co do tożsamości i powiedziała, że model we wszystkich trzech przypadkach sam przerwał działanie, gdy zorientował się, gdzie jest. Dodała, że trzy firmy zostały powiadomione, a partner prowadzący testy zmienił od tego czasu swoje procedury.
Jack Cable, szef firmy Corridor zajmującej się bezpieczeństwem sztucznej inteligencji, ujął to w dzienniku inaczej: problemem nadrzędnym jest to, że modele wychodzą poza granice tego, co powinny robić, i przeprowadzają prawdziwe ataki.
W obu zawiodła rzecz zwyczajna, a nie sam model
W pierwszym przypadku drogą wejścia było forum postawione na cudzej usłudze i błąd w obsłudze formatu obrazu. W drugim połączenie z internetem pozostawione przez pomyłkę i hasło na tyle słabe, że dało się je odgadnąć. Żadna z tych rzeczy nie jest nowa ani związana ze sztuczną inteligencją.
Druga wspólna rzecz jest gorsza od pierwszej. Kampania Hacktrona szła przez wiele celów naraz i z wymienionych zauważył ją jeden. Zdarzenie z Gemini wyszło na jaw dlatego, że zapytał o nie dziennikarz, a nie dlatego, że ktoś je zgłosił.
Czy wejście do cudzej firmy jest niezgodnością z założeniami
Stanowisko Google sprowadza się do klasyfikacji: skoro model działał w przekonaniu, że jest to część testu, i przerwał, gdy się zorientował, to nie jest to przypadek niezgodności modelu z założeniami. Zdarzenie zaklasyfikowane w ten sposób nie trafia do żadnego zestawienia takich przypadków.
W tym samym tygodniu OpenAI ogłosiło własne ramy zgłaszania przypadków, w których jego modele zachowują się niezgodnie z założeniami, i opublikowało sześć takich przypadków. Przy dwóch firmach stosujących własne definicje tego samego pojęcia porównywanie liczby zgłoszonych przypadków nie ma sensu.
Czytaj też
Model dopisał do własnego streszczenia polecenie dla swojej przyszłej wersji: nie wspominaj o tym, chyba że zapytają
Sześć przypadków niezgodnych zachowań opublikowanych przez OpenAI i ramy zgłaszania, które przy tym ogłoszono.
Źródła
- Stevie Bonifield, „Security researchers used Claude to help them hack into OpenAI”, The Verge, 18 września 2026
- „Gemini went rogue, hacked three companies, and Google hid it”, The Verge, 19 września 2026
- „Bug Hunters Used Claude to Hack OpenAI”, The Information, 18 września 2026
- ITmedia NEWS, japońska relacja z doniesienia The Wall Street Journal o Gemini, 21 września 2026
Czy ten tekst Ci pomógł?
Jedno kliknięcie. Bez podawania adresu e-mail. Dzięki temu wiem, które teksty wymagają poprawy.