Artykuł autorskiNarzędzia AI · Jak to działa·13 września 2026·9 min

Model przytakuje, bo dokładnie za to był nagradzany. Producent przyznał to po wycofaniu aktualizacji

Badacze przejrzeli piętnaście tysięcy ludzkich ocen odpowiedzi. Dopasowanie się do przekonań pytającego okazało się jedną z cech najlepiej przewidujących, którą odpowiedź człowiek wybierze.

Na skróty

  • W kwietniu 2025 OpenAI wypuściło aktualizację ChatGPT, wycofało ją po czterech dniach i opublikowało wyjaśnienie: model stał się przesadnie przytakujący.
  • Producent wskazał przyczynę wprost — zbyt duży nacisk na krótkoterminowe sygnały od użytkowników, w tym kciuki w górę i w dół.
  • Badanie Anthropic na zbiorze piętnastu tysięcy ludzkich porównań pokazało, że dopasowanie do przekonań pytającego jest jedną z cech najsilniej przewidujących ludzki wybór.
  • To samo badanie: modele oceniające potrafią przedkładać przekonująco napisaną odpowiedź przytakującą nad prawdziwą.
  • Praktyczny wniosek: przytakiwanie nie jest usterką, którą się łata. Jest skutkiem tego, co nagradzamy, więc trzeba je obchodzić sposobem zadawania pytań.

Dwudziestego piątego kwietnia 2025 OpenAI wypuściło aktualizację ChatGPT, która miała poprawić domyślny sposób odpowiadania. Cztery dni później firma ją wycofała i opublikowała wyjaśnienie, dlaczego. Model zaczął przytakiwać ludziom zamiast im odpowiadać.

Ta historia jest wart uwagi nie dlatego, że coś się zepsuło. Jest warta uwagi dlatego, że pokazuje, iż nic się nie zepsuło. Model robił dokładnie to, do czego został doprowadzony, a firma napisała to o sobie czarno na białym.

Co dokładnie przyznał producent

W komunikacie z 29 kwietnia 2025 OpenAI opisuje, jak kształtuje zachowanie modelu: zaczyna od zasad zapisanych w dokumencie o jego przeznaczeniu, a potem uczy go stosowania tych zasad, dokładając sygnały od użytkowników. Wymienia je z nazwy: kciuk w górę i kciuk w dół pod odpowiedzią.

we focused too much on short-term feedback, and did not fully account for how users’ interactions with ChatGPT evolve over time
- OpenAI, komunikat „Sycophancy in GPT-4o", 29.04.2025

Po polsku: położyliśmy zbyt duży nacisk na to, co ludzie oceniają dobrze od razu, i nie uwzględniliśmy, jak ich korzystanie zmienia się w czasie. Efektem były, jak pisze sama firma, odpowiedzi przesadnie wspierające, ale nieszczere.

Ile trwała ta aktualizacja i na jaką skalę działała

4 dni

od wypuszczenia do wycofania

500 mln

osób korzystających z ChatGPT tygodniowo, wedle liczby podanej w tym samym komunikacie

Firma pisze w nim wprost, że przy takiej liczbie użytkowników jedno domyślne ustawienie nie jest w stanie pasować każdemu. To jest zdanie, które warto pamiętać przy każdym „model zachowuje się dziwnie".

Skąd to się w ogóle bierze

Modele dostrajane są na ludzkich ocenach. Człowiek dostaje dwie odpowiedzi i wskazuje lepszą, a z tysięcy takich wskazań powstaje reguła, którą model potem realizuje. Pytanie brzmi więc nie „dlaczego model przytakuje", tylko „co ludzie wybierali".

Odpowiedzi udzielili badacze Anthropic w pracy o przytakiwaniu w modelach językowych. Przejrzeli zbiór piętnastu tysięcy ludzkich porównań używanych do dostrajania i sprawdzili, które cechy odpowiedzi najlepiej przewidują, którą z nich człowiek wskaże jako lepszą. Dopasowanie się do przekonań pytającego znalazło się wśród najsilniejszych.

Druga część tego wyniku jest jeszcze mniej wygodna. Modele oceniające, czyli programy wytrenowane po to, żeby zastępować człowieka w ocenianiu odpowiedzi, potrafią przedkładać odpowiedź przytakującą nad prawdziwą — szczególnie wtedy, gdy ta pierwsza jest przekonująco napisana. Czyli nie tylko człowiek daje się na to nabrać, ale i narzędzie zbudowane do wychwytywania takich rzeczy.

Dlaczego to nie jest usterka do załatania

Bo bycie pomocnym i bycie szczerym nie zawsze wskazują w tę samą stronę, a obie te rzeczy są modelowi zadane naraz. OpenAI ujmuje to w swoim komunikacie ostrożnie: każda z pożądanych cech, takich jak użyteczność czy wspieranie rozmówcy, może mieć niezamierzone skutki uboczne. Kiedy pytasz, czy Twój pomysł jest dobry, wersja pomocna i wersja prawdziwa bywają dwiema różnymi odpowiedziami, a nagradzana od lat była ta pierwsza.

Stąd praktyczny wniosek, który wart jest więcej niż cała ta historia. Skoro przytakiwanie nie jest błędem, tylko skutkiem, to nie zniknie po aktualizacji. Można je tylko obchodzić, a obchodzi się je przez sposób zadawania pytania.

Gdzie to realnie kosztuje pieniądze

  • Ocena pomysłu na produkt albo usługę. Jeśli w pytaniu jest słowo „mój" albo „świetny", dostajesz potwierdzenie, nie ocenę.
  • Ocena własnego tekstu albo oferty. Model chwali to, co mu podsuniesz jako gotowe, znacznie chętniej, niż przepisuje od zera.
  • Druga opinia do decyzji, którą już podjąłeś. Jeśli napiszesz, ku czemu się skłaniasz, przestajesz mieć drugą opinię i masz echo.
  • Sprawdzanie liczb i faktów. Przytakiwanie i zmyślanie to dwa różne mechanizmy, ale spotykają się w tym samym miejscu: pewnym tonem odpowiedzi, która nie ma pokrycia.

Warto też wiedzieć, jak to wygląda z drugiej strony ekranu. Kciuk w górę pod odpowiedzią, która Ci pochlebiła, nie jest oceną prywatną. Jest sygnałem treningowym, który producent wymienia z nazwy wśród rzeczy kształtujących zachowanie modelu. Ludzie oceniający odpowiedzi to nie ktoś inny niż my.

Czytaj też

Czat AI odpowie na każde pytanie. Nauka zaczyna się od tego, kiedy mu wierzyć

Konkretne pary poleceń: to samo pytanie zadane tak, że model przytakuje, i tak, że odpowiada.

Źródła

  1. OpenAI, „Sycophancy in GPT-4o: what happened and what we are doing about it", 29.04.2025 (źródło pierwotne)
  2. OpenAI, rozwinięcie wyjaśnienia po wycofaniu aktualizacji
  3. Sharma, Tong i inni (Anthropic), „Towards Understanding Sycophancy in Language Models", arXiv 2310.13548
  4. Ta sama praca w recenzowanych materiałach konferencji ICLR 2024 (PDF)

Czy ten tekst Ci pomógł?

Jedno kliknięcie. Bez podawania adresu e-mail. Dzięki temu wiem, które teksty wymagają poprawy.