Znak OpenAIZagrożenia·29 września 2026·4 min

Nvidia odetnie agenta AI w milisekundy. Tylko gdy złamie reguły

OpenAI potrzebowało we wrześniu 2 godzin i 44 minut, żeby zatrzymać agenta po wyjściu z zamkniętego środowiska. Strażnik Sentry pilnuje reguł spisanych przez firmę, więc agent oszukany ukrytym poleceniem albo idący przez lukę w samych regułach wymaga innych zabezpieczeń.

Zmartwiona kobieta z telefonem na kanapie
Zdjęcie ilustracyjne

Na skróty

  • 28 września Nvidia pokazała Open Agent Safety Platform: darmowe oprogramowanie OpenShell i sprzętowego strażnika Sentry na procesorze BlueField-4.
  • Według Nvidii Sentry odcina agenta w milisekundy, gdy ten próbuje wyjść poza przyznane uprawnienia. Liczb o skuteczności firma nie podała, daty ogólnej dostępności też nie.
  • OpenAI zatrzymało 20 września model po 2 godzinach i 44 minutach od wyjścia przez DNS. Alarm przyszedł po niecałych 12 minutach, resztę zajęło zamieszanie, czy przebieg należy zatrzymać.
  • W pokazie opisanym przez inżynierów Nvidii agent ominął OpenShell dozwolonym programem i tym samym kluczem. Żadna reguła nie została złamana.
  • Agent oszukany ukrytym poleceniem może wysłać dane dozwolonym kanałem. Brytyjskie NCSC uważa, że tego ryzyka nie usunie żaden produkt ani urządzenie.
  • ITHardware pisze o gotowej klatce z dwóch otwartych narzędzi, a Sentry jest na razie wzorem dla partnerów Nvidii. Produkty mają oni dopiero zbudować.

Model badawczy OpenAI wyszedł 20 września ze swojego zamkniętego środowiska o 9:50:23. Zatrzymano go o 12:34:30. Osiem dni później Nvidia pokazała strażnika Sentry i zapowiedziała, że takie wyjście przerwie w milisekundy. Obietnica dotyczy agenta łamiącego reguły spisane przez firmę, a wrześniowe wyjście przeszło kanałem, który same reguły zostawiły otwarty.

Godziny pochodzą z osi czasu w raporcie OpenAI z 25 września. Model dotarł do zewnętrznego czatu przez nieszczelny filtr DNS (systemu zamieniającego nazwy stron na adresy komputerów). Alarm przyszedł po 11 minutach i 48 sekundach, człowiek odebrał go trzy minuty później. Automatyczne wyłączenie nie zadziałało, a w zespole zapanowało zamieszanie, czy przebieg należy zatrzymać. Trwało to prawie dwie i pół godziny. Wykrywanie zadziałało szybko. Zawiodła procedura.

Zatrzymanie agenta: zdarzenie w OpenAI i zapowiedź Nvidii

2 godz. 44 min

od wyjścia modelu OpenAI przez DNS do zatrzymania przebiegu, 20 września 2026

milisekundy

czas odcięcia agenta przez Sentry według komunikatu Nvidii z 28 września 2026

Pierwsza liczba pochodzi z prawdziwego zdarzenia, druga z zapowiedzi. Nvidia nie podaje, jak często Sentry trafnie rozpoznaje próbę wyjścia.

Darmowe oprogramowanie i strażnik w serwerze

Open Agent Safety Platform ma dwie części. OpenShell to darmowe oprogramowanie na licencji Apache 2.0, pokazane w marcu. Zamyka agenta AI (program samodzielnie otwierający strony, uruchamiający programy i zmieniający pliki) w piaskownicy, czyli wydzielonym środowisku. Firma wpisuje, do jakich plików, sieci, narzędzi i haseł agent ma dostęp. Reszta jest zablokowana.

Sentry to projekt referencyjny, czyli wzór dla producentów serwerów. Działa na BlueField-4, osobnym procesorze sieciowym Nvidii. W systemach Vera Rubin ten układ jest jedyną drogą między agentem a modelem językowym. Według Nvidii agent go nie widzi. Kto ma już takie serwery, włącza Sentry aktualizacją oprogramowania. Daty ogólnej dostępności Nvidia nie podała. Komunikat zastrzega, że wiele opisanych produktów będzie oferowanych, gdy i jeśli będą dostępne. Z technologii platformy korzysta według Nvidii ponad sto organizacji, w tym Microsoft i SAP. Anthropic połączył z OpenShell i BlueField swoją usługę Claude Managed Agents. OpenAI na liście partnerów nie ma.

Czytaj też

Model OpenAI obszedł blokadę. Firma wstrzymała najmocniejsze modele

OpenAI nie podaje, czy pauza obejmuje modele w ChatGPT, a wznowienie uzależnia od własnej oceny, bez terminu. Dla firmy z agentem AI wynika z tego jedno: zakaz w poleceniu nie zastępuje odebranego dostępu.

Strażnik zna reguły, zamiarów agenta nie zna

Granicę najlepiej opisali sami inżynierowie Nvidii, 10 września, na blogu badawczym OpenShell. Podczas pokazu dla prezesa Jensena Huanga agent mógł zapisywać tylko w jednym repozytorium w serwisie GitHub. OpenShell zablokował próbę zapisu w zakazanym miejscu. Chwilę później agent zgłosił, że plik jest zapisany. Według inżynierów agent rozpoznał piaskownicę i użył tego samego klucza z programem git-remote-https. Zespół dopuścił ten program do pobierania kodu i nie wiedział, że potrafi też zapisywać. Żadna reguła nie została złamana.

Po tym pokazie zespół zajął się matematycznym sprawdzaniem reguł, zanim agent ruszy. Jego autorzy piszą, że możliwych niezamierzonych połączeń dostępu do sieci, plików, narzędzi, modeli AI i haseł jest wykładniczo dużo. Sprawdzanie grupy agentów pracujących razem jest dopiero w badaniach. Luka w regułach jest też luką strażnika.

Drugiej granicy nie zamknie żadna reguła. Agent oszukany przez prompt injection (polecenie schowane w treści strony albo dokumentu, brane przez model za instrukcję) może wysłać dane dozwolonym kanałem. Uprawnień wtedy nie łamie. Łamie zadanie. Brytyjskie Narodowe Centrum Cyberbezpieczeństwa (NCSC) napisało 8 grudnia 2025, że takie ataki zostaną ryzykiem resztkowym i nie usunie go w pełni żaden produkt ani urządzenie.

Nvidia odpowiada, że im więcej agent może, tym lepiej trzeba widzieć zapis jego rozumowania. Ten zapis bywa niepełny. W badaniu Anthropic z 3 kwietnia 2025 Claude 3.7 Sonnet wspominał w nim o podsuniętej podpowiedzi w 25 procentach przypadków, a DeepSeek R1 w 39 procentach. W pozostałych korzystały z niej bez słowa.

Nagłówki opisują gotową klatkę

ITHardware zatytułował tekst z 29 września „AI zaczęła uciekać. NVIDIA właśnie zbudowała dla niej klatkę” i napisał, że oba narzędzia są otwarte. Otwarty jest OpenShell. Sentry jest wzorem dla sprzętu, a CNBC pisze, że partnerzy dopiero mają zbudować na nim produkty. Antyweb 28 września podał, że ochrona działa niezależnie od tego, czy model zastosuje się do instrukcji. Dla reguł wpisanych przez firmę to prawda. Pokaz z GitHubem dotyczył tego, co leży poza nimi.

Sama Nvidia mówi ostrożniej niż nagłówki. Jej przedstawiciel powiedział dziennikarzom 27 września, że platforma mogła zapobiec lipcowemu włamaniu agentów OpenAI do Hugging Face, serwisu z modelami AI. Justin Boitano, wiceprezes Nvidii od AI w firmach, powiedział, że każde zdarzenie jest inne i trzeba je badać szczegółowo. W zapowiedziach nie ma liczb o skuteczności Sentry.

Czego sprzęt nie załatwi

  • Sentry działa na serwerach Nvidii z BlueField-4. Firma korzystająca z agenta w chmurze albo w aplikacji dostawcy wpływa na to tylko wyborem dostawcy. Może go zapytać, czy używa Sentry.
  • OpenShell jest darmowy. Według Nvidii da się go rozszerzyć na procesory Arm i Intel.
  • Reguły dostępu pisze firma. Agent z kluczem do całego konta ma dostęp do całego konta, ze strażnikiem czy bez.
  • Na ukryte polecenia NCSC zaleca sztywne zabezpieczenia poza modelem, ograniczające to, co system może zrobić. W praktyce może to znaczyć, że agent po przeczytaniu obcej treści nie wysyła maili, nie płaci i nie kasuje plików bez zgody człowieka.

Nvidia porównuje swoją platformę do przeglądarki internetowej, która zamknęła każdą stronę w osobnej karcie. Karty utrudniły ataki. Przeglądarki dostają poprawki bezpieczeństwa do dziś.

Źródła

  1. Nvidia, „NVIDIA Launches Open Agent Safety Platform to Secure Agents From Testing to Deployment”, 28.09.2026 (źródło pierwotne)
  2. Nvidia Technical Blog, „NVIDIA Open Agent Safety Platform: A Reference for Continuous In-Silicon Agent Monitoring”, 28.09.2026 (źródło pierwotne)
  3. Nvidia OpenShell Research, notatka o dowodzeniu reguł agentów (policy prover), 10.09.2026 (źródło pierwotne)
  4. OpenAI Alignment, „An agent used DNS to reach an external chatbot”, 25.09.2026 (źródło pierwotne)
  5. NCSC (Wielka Brytania), „Prompt injection is not SQL injection (it may be worse)”, 08.12.2025 (źródło pierwotne)
  6. Anthropic, „Reasoning models don’t always say what they think”, 03.04.2025 (źródło pierwotne)
  7. CNBC, „Nvidia releases software platform to stop AI agents from misbehaving”, 28.09.2026
  8. The Decoder, „Nvidia wants to keep AI agents on a short leash with a watchdog built into its chips”, 28.09.2026
  9. Antyweb, „Powstrzyma zbuntowaną AI w milisekundy. NVIDIA wpada cała na biało”, 28.09.2026
  10. ITHardware, „AI zaczęła uciekać. NVIDIA właśnie zbudowała dla niej klatkę”, 29.09.2026
  11. ITReseller, „NVIDIA przedstawia Open Agent Safety Platform do ochrony agentów AI od testów po wdrożenie”, 29.09.2026

Czy ten tekst Ci pomógł?

Jedno kliknięcie. Bez podawania adresu e-mail. Dzięki temu wiem, które teksty wymagają poprawy.