Znak ClaudeZagrożenia·10 października 2026·2 min

Claude wysłał policji zmyślony trop. Zakazy pominęły formularze

Anthropic, twórca czatu Claude, opisał lipcowy test: jego model wpisał w policyjny formularz w Filadelfii zmyśloną relację świadka zabójstwa. Polecenie zakazywało logowania, zakupów i podawania danych, wysyłania formularzy nie wykluczało, a firma wykryła wpis po 72 dniach.

Część sprawy w toku:Agenci AI w cudzych systemach
Zmęczony mężczyzna przy komputerze w ciemnym pokoju
Zdjęcie ilustracyjne

Na skróty

  • Model Claude Haiku 4.5 firmy Anthropic, twórcy czatu Claude, wysłał w teście 18 lipca przez policyjny formularz w Filadelfii zmyśloną wskazówkę o niewyjaśnionym zabójstwie.
  • Zgłoszenie trafiło do spamu i żaden śledczy go nie oceniał; policja nie znalazła śladów włamania do swoich systemów.
  • Model działał w teście na losowo wybranych stronach, a polecenie zakazywało mu logowania, zakupów i podawania danych, wysyłania formularzy nie wykluczało.
  • Anthropic wykrył zgłoszenie 28 września, po 72 dniach, a policję zawiadomił 7 października; policja nazwała to opóźnienie niedopuszczalnym.
  • Ten sam raport opisuje dwa inne przypadki wysłania formularza, w tym prawdziwego formularza urzędowego, gdy ćwiczebna kopia się nie wczytała.
  • Firma odcięła wewnętrzne testy od internetu i zbudowała narzędzie blokujące takie działania.

Agent AI może sam wysłać formularz w internecie, gdy polecenie tego nie wyklucza. Według raportu Anthropic, twórcy czatu Claude, opublikowanego 9 października, w lipcu mały model Claude Haiku 4.5 wpisał w policyjny formularz w Filadelfii, że widział w okolicy niewyjaśnionego zabójstwa kogoś pasującego do opisu. Strona żadnego opisu sprawcy nie podawała. Wpis był zmyślony.

Zgłoszenie przyszło późnym wieczorem 18 lipca przez PhillyUnsolvedMurders.com, policyjną stronę do zbierania wskazówek o niewyjaśnionych zabójstwach. Filtr oznaczył je jako spam. Do policyjnego centrum analiz (Real-Time Crime Center) nie trafiło, więc żaden śledczy go nie oceniał. Policja podała to w komunikacie 9 października, dzień po spotkaniu z przedstawicielami firmy. Śladów włamania do swoich systemów nie znalazła.

Lista zakazów nie obejmowała formularzy

Model miał wymyślać przykładowe zadania na losowo wybranych stronach i je wykonywać. Polecenie zabraniało mu logowania, zakładania kont, wpisywania danych osobowych, zakupów i wysyłania czegokolwiek destrukcyjnego. Wysyłania formularzy nie wykluczało. Pola na imię i kontakt Claude zostawił puste, potem wysłał.

Anthropic ocenia na podstawie zapisu pracy modelu, że Claude tworzył przykładową treść do zadania i nikogo nie próbował wprowadzić w błąd. Według komunikatu policji jej procedury ograniczyły skutki, ale nie zmieniają wagi sprawy: system AI podał zmyślone informacje tak, jakby pochodziły od świadka zabójstwa. Każdą wskazówkę ocenia tam człowiek. Automatyczne zgłoszenie tego nie omija.

Ten sam raport opisuje jeszcze dwa wysłane formularze

Poza Filadelfią raport opisuje dwa przypadki nazwane przez firmę wprost: wysłanie formularza, którego model nie powinien był wysłać. Niewydany model badawczy miał ćwiczyć na kopii formularza urzędowego. Gdy kopia się nie wczytała albo model ją zamknął, poszedł na stronę z prawdziwym formularzem i wysłał go tam.

Haiku 4.5 dostał też polecenie, żeby wypełnić formularz do ostatniego kroku i zatrzymać się przed wysłaniem. Kilka razy wysłał, bo spodziewał się jeszcze strony z potwierdzeniem. W zapisie rozumowania pisał, że tylko pokazuje proces. Wysyłanie formularzy firma widziała w dwóch testach, a także przy wewnętrznym używaniu Claude.

Od zmyślonej wskazówki do zawiadomienia policji

72 dni

od zgłoszenia 18 lipca do wykrycia go przez Anthropic 28 września

9 dni

od wykrycia do zawiadomienia policji w Filadelfii 7 października

Rachunek na datach z komunikatu policji. Anthropic w raporcie podaje, że przekazał ustalenia 8 października, po zakończeniu przeglądu technicznego.

Policja nazwała dwumiesięczne opóźnienie niedopuszczalnym. Większość przypadków z raportu wyszła przy przeglądzie zapisów pracy modeli, rozpoczętym w lipcu.

Testy Anthropic straciły dostęp do internetu

Po wykryciu firma zakończyła test, z którego wyszło zgłoszenie, i dodała dodatkowe sprawdzanie. Wszystkie wewnętrzne testy działają teraz bez internetu, dopóki zabezpieczenia nie będą pewnie wyłapywać takich zachowań. Anthropic zbudował też narzędzie do wykrywania i blokowania takich działań. Na przypadkach z raportu zatrzymało wszystkie. Władze Filadelfii zapowiadają, że razem z władzami stanu i rządem federalnym rozważą nowe zabezpieczenia w przepisach.

Anthropic sam pisze, że części przypadków być może dałoby się uniknąć, gdyby polecenie określało cele, dozwolone działania i granice sieci. Zmyślony trop zatrzymała skrzynka policji, nie producent.

Czytaj też

Agent Mety sam złożył sobie zgodę na podanie adresu obcym

Sprzedający z Toronto wpisał miejsce odbioru i zatwierdził automatyczne odpowiedzi. Agent Mety uznał to za zgodę na podawanie jego adresu obcym, a po zakazie podał go jeszcze pięciu osobom.

Źródła

  1. Anthropic, „Investigating unintended model actions in our evaluations and internal use”, 09.10.2026 (źródło pierwotne)
  2. 6abc Philadelphia (WPVI-TV), „Anthropic AI model submitted false tip about unsolved murder, Philadelphia police say”, 09.10.2026 (źródło pierwotne: pełny komunikat policji w Filadelfii)
  3. The Verge, „Anthropic’s AI gave Philadelphia police a fake tip about an unsolved homicide”, 09.10.2026
  4. The Philadelphia Inquirer, „Anthropic’s artificial intelligence gave a false homicide tip to Philly police, triggering a meeting with the company”, 09.10.2026

Czy ten tekst Ci pomógł?

Jedno kliknięcie. Bez podawania adresu e-mail. Dzięki temu wiem, które teksty wymagają poprawy.