Zadania w firmie·28 września 2026·4 min

Agent AI wykonywał po czterech tygodniach 28 czynności na jedno polecenie zamiast 11. Metodę w 85 procentach wybierał człowiek

Zespół z Szanghaju opisał 769 zadań z budowy własnego modelu: agenty zaproponowały prawie dwie trzecie metod, a same wybrały 9 procent. Firma licząca tokeny albo czynności agenta mierzy więc długość łańcucha pracy, a nie przejęte decyzje.

Na skróty

  • Szanghajskie Laboratorium Sztucznej Inteligencji opisało 769 zapisów zadań od 56 osób budujących model Atria Dawn Preview.
  • Liczba czynności agenta na jedno polecenie człowieka wzrosła w cztery tygodnie z 11 do 28,5. Autorzy zastrzegają, że to nie oznacza większej samodzielności agenta.
  • Agent zaproponował 64,6 procent metod, a ostatnie słowo przy metodzie miał w 9,2 procent przypadków. Popularne „55 procent” pomija propozycje wybrane przez agenta samodzielnie.
  • Jedną trzecią ukończonych zadań uczestnicy ocenili jako niewykonalne bez AI, a i tam cel w 95 procentach wybrał człowiek.
  • Wielu badaczy wyłączało pytania o zgodę, żeby agent nie czekał. Granicę uprawnień wyznaczyła wygoda.

Między 7 sierpnia a 4 września 2026 roku agent AI wykonywał u badaczy z Szanghaju najpierw 11, a na końcu 28,5 czynności na jedno polecenie człowieka (to mediana z 22 osób). Wykres wygląda jak zapis coraz samodzielniejszego agenta. Autorzy badania ostrzegają, żeby go tak nie czytać. Każda decyzja człowieka uruchamiała po prostu dłuższy łańcuch pracy agenta.

Dane pochodzą z pracy opublikowanej 14 września w serwisie arXiv. Zespół Szanghajskiego Laboratorium Sztucznej Inteligencji, z adresem do korespondencji na Uniwersytecie Fudan, opisał w niej budowę własnego modelu Atria Dawn Preview. Model ma 744 miliardy parametrów, powstał na bazie GLM-5.2 i jest dostępny na licencji MIT. Przy okazji zespół przejrzał 769 zapisów zadań od 56 uczestników projektu oraz dzienniki pracy agentów. W przeglądzie zadań uczestnicy sami podawali, kto zaproponował rozwiązanie, kto je wybrał i czy daliby radę bez AI. To odpowiedzi twórców modelu, a nie pomiar z zewnątrz. AI użyto w 713 z 739 zadań, czyli w 96,5 procent.

Agent podsuwa, człowiek wybiera

Przy wyborze metody i parametrów najczęstszy układ wyglądał tak: agent proponuje, człowiek wybiera. Tak zapadło 55,4 procent z 567 decyzji. W około 30 procentach człowiek sam zaproponował i sam wybrał (tyle zostaje po odjęciu 55,4 od 85,5). W 9,2 procent ostatnie słowo miał agent. Łącznie ludzie wybierali metodę w 85,5 procent przypadków, cele i zakres prac w 93,4 procent, kryteria odbioru w 81,9 procent.

The Decoder napisał 27 września, że udział AI w propozycjach wynosił od 17 do 55 procent, zależnie od rodzaju decyzji. Górną granicę autorzy podają w rozdziale czwartym jako udział agenta w propozycjach. W zakończeniu tej samej pracy jest inna liczba: agent zaproponował 64,6 procent metod. Różnica to te 9,2 procent decyzji, w których agent sam zaproponował i sam wybrał. Liczba 55,4 pomija je, bo liczy tylko propozycje wybrane przez człowieka. Po zsumowaniu obu grup agent był źródłem prawie dwóch trzecich pomysłów na metodę.

Decyzje o metodzie i parametrach przy budowie Atria Dawn (567 decyzji)

64,6%

metod zaproponował agent

9,2%

decyzji podjął agent sam, bez wyboru człowieka

Obie liczby podaje praca zespołu Atria. Górne „55 procent” z relacji medialnych obejmuje tylko propozycje agenta wybrane potem przez człowieka.

Przy celach i zakresie prac proporcje się odwracają. Ten sam wskaźnik wynosi tu 16,9 procent, ponad trzy razy mniej niż przy metodach. Ostateczne decyzje agenta mieszczą się we wszystkich trzech rodzajach decyzji między 6,1 a 9,2 procent. Autorzy tłumaczą, że propozycje agentów były najczęściej wariantami w kierunku wyznaczonym wcześniej przez badacza. Nowe sposoby pracy wciąż wychodziły od ludzi.

Jedna trzecia zadań bez AI w ogóle by nie ruszyła

Uczestników zapytano też, czy wykonaliby swoją część zadania bez AI, przy tym samym zakresie i tej samej jakości. Ze 455 ukończonych zadań 151 oceniono jako niewykonalne, czyli 33,2 procent. Zgłosiło je 27 z 56 osób, więc wynik nie pochodzi od garstki entuzjastów. Nawet w tych 151 zadaniach cel wybrał człowiek w 144 przypadkach. Autorzy oddzielają dwie wielkości: zaoszczędzone godziny i zadania możliwe dopiero dzięki AI. Ocena mierząca tylko pierwszą z nich zaniża zmianę.

Podobnie wyglądały chwile, gdy coś szło źle. W 588 zadaniach z opisaną trudnością 76 procent ruszyło dalej dzięki człowiekowi, a w 23 procent agent poradził sobie sam. Ludzka pomoc była najczęściej informacją: dopowiedzeniem kontekstu (35,2 procent) albo diagnozą i zmianą metody (34,7 procent). Przejęcie pracy przez człowieka zdarzyło się w 0,7 procent przypadków. Brakowało osądu, rąk było dość.

Firmy liczą czynności agenta, a to mierzy długość łańcucha

Meta, Amazon, OpenAI i inne firmy prowadziły według „Fortune” rankingi zużycia tokenów (token to kawałek tekstu przetwarzany przez model i zarazem jednostka rozliczenia). Amazon wymagał, żeby ponad 80 procent programistów używało narzędzi AI co tydzień, i pokazywał zużycie tokenów na wewnętrznych rankingach. Według „Financial Times” część pracowników uruchamiała agentów do zbędnych zadań, żeby podbić statystykę. Firma zapewniała, że te liczby nie trafią do ocen pracowniczych. W Mecie ranking „Claudeonomics” obejmował około 85 tysięcy pracowników i zniknął po publikacji w serwisie The Information. „Fortune” podsumował to 28 maja prawem Goodharta: miara, która staje się celem, przestaje mierzyć.

Praca z Szanghaju pokazuje mechanizm od środka. Czynności agenta przybywa, gdy jedna decyzja człowieka uruchamia dłuższy ciąg kroków. O przejęciu decyzji przez agenta ta liczba nic nie mówi. Firma nagradzająca zużycie tokenów nagradza więc długość łańcucha i płaci za nią rachunek. Dwie liczby z tej pracy mówią o wartości więcej: ile zadań powstało dzięki AI i kto wybrał rozwiązanie, za które ktoś odpowiada.

Ostatnie słowo człowieka nie oznacza jeszcze kontroli

Autorzy sami wskazują granicę uspokajającej liczby 85 procent. Każda decyzja człowieka opiera się dziś na dłuższym łańcuchu pracy agenta, niż jedna osoba zdoła dokładnie przejrzeć. W najgorszym razie, piszą, badacze zostaną recenzentami zdolnymi tylko do powiedzenia „tak”. Wielu uczestników projektu uruchamiało agentów w trybach bez pytania o zgodę: w Codex był to tryb „yolo”, w Claude Code pomijanie uprawnień. Chodziło o to, żeby długie przebiegi nie stawały w oczekiwaniu na zatwierdzenie. Granicę uprawnień agenta wyznaczyła więc wygoda.

W lipcowym badaniu AgentAbstain siedemnaście modeli trafnie wstrzymywało się tylko w 59,1 procent sytuacji wymagających zatrzymania. Agent bez pewnego hamulca w trybie bez zatwierdzeń nie ma już kogo zapytać. Ostatnie słowo człowieka jest warte tyle, ile czasu człowiek ma na przeczytanie tego, co zatwierdza.

Czytaj też

Agent AI lepiej kończy zadania, niż wie, kiedy przerwać. Przed przelewem nie jest ostrożniejszy niż przed raportem

Siedemnaście modeli w badaniu AgentAbstain wykonywało poprawnie średnio 80,6 procent zadań, a trafnie wstrzymywało się w 59,1 procent sytuacji wymagających zatrzymania. Zgodę na przelew czy kasowanie plików trzeba więc ustawić poza modelem.

Źródła

  1. Atria Team, „Atria Dawn: The Dawn of Agentic Superintelligence”, arXiv 2609.15818, 14.09.2026, wersja 2 z 17.09.2026 (źródło pierwotne)
  2. Hugging Face, karta modelu internlm/Atria-Dawn-Preview, wrzesień 2026 (źródło pierwotne: laboratorium, rozmiar, licencja)
  3. The Decoder, „AI agents do more of the work in model development, but humans still make the decisions”, 27.09.2026
  4. Fortune, „Tokenmaxxing is over. It was a flawed way to measure a company’s ROI from AI”, 28.05.2026
  5. Human Resources Director, „Amazon workers are gaming the AI leaderboard. HR built it.”, 13.05.2026

Czy ten tekst Ci pomógł?

Jedno kliknięcie. Bez podawania adresu e-mail. Dzięki temu wiem, które teksty wymagają poprawy.