Rój agentów AI zużywa prawie cztery razy więcej tokenów niż jeden agent. Zwraca się tylko wtedy, gdy zadanie da się podzielić na niezależne części
Według pomiarów Anthropic pojedynczy agent zużywa cztery razy więcej tokenów niż zwykła rozmowa, a zespół agentów piętnaście razy więcej. Przy najdroższych modelach i kursie dolara z 24 września zadanie za 1,16 zł w czacie kosztuje 4,63 zł u jednego agenta i 17,36 zł u roju.
Na skróty
- Eric Provencher z zespołu Codex w OpenAI napisał w połowie września, że przy więcej niż dwóch podagentach naraz tokeny prawie na pewno idą na marne.
- Jako przykład wskazał porządkowanie kodu przez 1393 agentów w Nous Research za około 19 300 dolarów, czyli 74 440 zł.
- Provencher pisze o jednym pliku, Nous o kodzie liczącym ponad milion linii, a pomiaru dla jednego agenta nie podaje żadna ze stron.
- Według Anthropic pojedynczy agent zużywa około 4 razy więcej tokenów niż czat, a system wielu agentów około 15 razy więcej.
- Google Research zmierzył przy tych samych zasobach 80,9 procent poprawy przy zadaniach łatwych do podzielenia i od 39 do 70 procent pogorszenia przy planowaniu krok po kroku.
- Przy cenach z 24 września rój na Claude Sonnet 5 kosztuje 3,47 zł za przykładowe zadanie, mniej niż jeden agent na najdroższych modelach za 4,63 zł.
Nous Research, firma rozwijająca otwartego agenta AI o nazwie Hermes, wydała około 19 300 dolarów na to, żeby 1393 agentów przez mniej więcej dziewiętnaście godzin porządkowało kod jej programu. Eric Provencher z OpenAI odpisał, że jeden agent zrobiłby to za ułamek tej kwoty. Żadna ze stron nie podaje pomiaru. Badania innych firm przyznają rację obu, każdej przy innym rodzaju zadań.
Provencher pracuje w OpenAI przy narzędziu Codex, służącym do pisania kodu z pomocą AI. We wpisach na X z połowy września stwierdził, że przy więcej niż dwóch podagentach naraz tokeny prawie na pewno idą na marne. Podagent to pomocniczy agent z wydzieloną częścią pracy. Token to kawałek słowa, od liczby tokenów zależy opłata. Przyczyna według Provenchera: agenci sobie nie ufają i sprawdzają nawzajem swoją pracę. Nazwał to podatkiem od koordynacji. Wyjątek dopuścił tylko przy bardzo dobrze rozdzielonych zadaniach.
Krytyk pisze o jednym pliku, autorzy o milionie linii kodu
Serwis The Decoder opisał ten przykład 17 września jako przeróbkę jednego pliku w Pythonie, popularnym języku programowania. Podobnie ujął to Provencher. Wpis Nous Research z 15 września mówi o czymś większym. Repozytorium, czyli zbiór plików programu, liczyło ponad milion linii kodu. Główny agent podzielił je na 36 niezachodzących na siebie części i rozpisał zadania dla pomocników. Naraz pracowało do 218 agentów. Kodu poza testami ubyło o 34,4 procent.
Główny przebieg kosztował według Nous około 19 300 dolarów, a razem z późniejszymi poprawkami około 25 tysięcy. Po kursie NBP z 24 września to 74 440 zł i 96 425 zł. Według GUS przeciętna pensja w sektorze przedsiębiorstw wyniosła w sierpniu 9259,54 zł. Obie kwoty to więc około ośmiu i dziesięciu takich pensji. Na jednego agenta przypada średnio 53 zł. Nous zestawia rachunek z własnym szacunkiem kosztu pracy ludzi: od 150 tysięcy do 1,8 miliona dolarów, czyli od około 579 tysięcy do 6,9 miliona zł.
Nous pracowało na modelu Claude Fable 5.1 firmy Anthropic. Provencher proponuje GPT-6 Astra, model swojego pracodawcy. W cennikach obu producentów z 24 września te modele kosztują tyle samo: 10 dolarów za milion tokenów wczytanych i 50 dolarów za milion wygenerowanych. Oszczędność mogłaby więc wynikać wyłącznie z mniejszej liczby tokenów.
Więcej agentów pomaga przy podziale pracy, szkodzi przy kolejnych krokach
Anthropic opublikował swój pomiar 13 czerwca 2025, przy opisie funkcji Research w Claude. Claude Opus 4 w roli koordynatora z tańszym Claude Sonnet 4 w roli podagentów wypadł o 90,2 procent lepiej od samego Opus 4 w wewnętrznym teście wyszukiwania informacji. Przykładowe zadanie: znaleźć członków zarządów wszystkich spółek technologicznych z indeksu S&P 500. Zespół rozdzielił je między podagentów. Pojedynczy agent szukał po kolei i odpowiedzi nie znalazł.
Zużycie tokenów w porównaniu ze zwykłą rozmową z czatem, dane Anthropic
4×
pojedynczy agent
15×
system wielu agentów
Pomiar z czerwca 2025, z systemu badawczego Anthropic. Wynika z niego, że zespół agentów zużywa około 3,75 raza więcej tokenów niż jeden agent.
Anthropic pisze wprost, że system wielu agentów ma sens ekonomiczny tylko przy zadaniach wartych wyższego kosztu. Według firmy większość zadań programistycznych daje się podzielić słabiej niż wyszukiwanie. Sam system Anthropic na początku przesadzał. Pierwsze wersje uruchamiały 50 podagentów do prostych pytań.
Google Research opisał 28 stycznia 2026 badanie pięciu sposobów organizacji agentów. Wszystkie warianty miały te same narzędzia, polecenia i moc obliczeniową. O wyniku decydował rodzaj zadania. W analizie finansowej, łatwej do rozdzielenia, układ z jednym koordynatorem poprawił wynik o 80,9 procent. W planowaniu krok po kroku każdy wariant z wieloma agentami wypadł gorzej, o 39 do 70 procent. Gdy agenci pracowali obok siebie bez wzajemnej kontroli, ich błędy trafiały do wyniku wzmocnione 17,2 raza. Koordynator sprawdzający ich pracę obniżył to wzmocnienie do 4,4. Sprawdzanie cudzej pracy, w nadmiarze krytykowane przez Provenchera, w tym pomiarze prawie czterokrotnie ogranicza przenoszenie błędów.
Cognition, twórca agenta programistycznego Devin, w czerwcu 2025 odradzał budowanie systemów z wieloma agentami. Powód: agenci pracujący równolegle po cichu podejmują sprzeczne decyzje o stylu i szczegółach. W kwietniu 2026 firma podtrzymała tę ocenę wobec rojów, w których wielu agentów jednocześnie zmienia kod. Działa według niej węższy układ. Pisze jeden agent, pozostali doradzają i sprawdzają. Osobny agent przeglądający kod znajduje średnio dwa błędy w każdej proponowanej zmianie, a 58 procent z nich to błędy poważne.
To samo zadanie w czacie, u jednego agenta i w roju
Przeliczenie opiera się na cennikach Anthropic i OpenAI oraz na średnim kursie NBP z 24 września: 3,8570 zł za dolara (tabela 186/A/NBP/2026). Punktem wyjścia jest zadanie z tekstu o cenach nowych modeli: 25 tysięcy tokenów wczytanych, czyli dłuższy dokument, i tysiąc wygenerowanych. Koszt takiej rozmowy pomnożono przez 4 dla jednego agenta i przez 15 dla roju, według proporcji Anthropic.
- Claude Fable 5.1 i GPT-6 Astra, 10 i 50 dolarów za milion tokenów: czat 1,16 zł, jeden agent 4,63 zł, rój 17,36 zł.
- Claude Opus 5.5, 4 i 20 dolarów: czat 0,46 zł, agent 1,85 zł, rój 6,94 zł.
- Claude Sonnet 5 i GPT-6 Sol, 2 i 10 dolarów: czat 0,23 zł, agent 0,93 zł, rój 3,47 zł.
Przy tysiącu takich zadań miesięcznie rój na najdroższych modelach kosztuje około 17,4 tys. zł, a jeden agent 4,6 tys. zł. Różnica, 12,7 tys. zł, przekracza przeciętną sierpniową pensję. Z tej samej listy wynika druga rzecz. Rój na Claude Sonnet 5 wychodzi taniej niż jeden agent na Fable 5.1. Anthropic w swoim systemie łączy zresztą mocniejszy model u koordynatora z tańszym u pomocników.
Wyliczenie ma dwa uproszczenia. Mnożniki pochodzą z jednego systemu i ze starszych modeli. Pomija też pamięć podręczną, czyli tańsze ponowne wczytanie tego samego tekstu. Przy Opus 5.5 kosztuje ona 20 centów za milion tokenów, jedną dwudziestą zwykłej ceny, a według Anthropic to ona odpowiada za większość kosztów pracy agentów. Faktura bywa więc niższa niż w tym przeliczeniu.
Czytaj też
Claude potaniał o 20 procent za token, GPT-6 o połowę. Czterdzieści procent z nagłówków to szacunek Anthropic, nie cena
Anthropic i OpenAI obniżyły ceny swoich modeli tego samego dnia. Obie obniżki wyglądają podobnie w nagłówkach, a różnią się rodzajem, wielkością i tym, kto je w ogóle odczuje.
Rachunek za tokeny przychodzi od razu. W projekcie Nous część kosztów wyszła później i na fakturze jej nie ma. Automatyczna przeróbka zmieniła obsługę błędów w około 65 miejscach, a istniejące testy tego nie wykryły. Wyłapali to ludzie, w dwóch rundach przeglądu przed włączeniem zmian do programu.
Źródła
- Eric Provencher, wpis na X o więcej niż dwóch podagentach, 15.09.2026 (źródło pierwotne)
- Eric Provencher, wpis na X o „podatku od koordynacji”, 15.09.2026 (źródło pierwotne)
- Eric Provencher, odpowiedź na X w sprawie projektu Nous Research, 16.09.2026 (źródło pierwotne)
- The Decoder, „AI agent swarms are a massive waste of tokens with zero quality gain, says OpenAI Codex developer”, 17.09.2026
- Nous Research, „Refactoring Hermes with 1,393 agents”, 15.09.2026 (źródło pierwotne)
- Anthropic, „How we built our multi-agent research system”, 13.06.2025 (źródło pierwotne)
- Google Research, „Towards a science of scaling agent systems: When and why agent systems work”, 28.01.2026 (źródło pierwotne)
- arXiv, „Towards a Science of Scaling Agent Systems”, praca Google Research, 09.12.2025 (źródło pierwotne)
- Cognition, „Don’t Build Multi-Agents”, 12.06.2025 (źródło pierwotne)
- Cognition, „Multi-Agents: What’s Actually Working”, 22.04.2026 (źródło pierwotne)
- Anthropic, cennik API „Pricing”, stan na 24.09.2026 (źródło pierwotne)
- Anthropic, „Introducing Claude Opus 5.5”, 22.09.2026 (źródło pierwotne)
- OpenAI, cennik API „Pricing”, stan na 24.09.2026 (źródło pierwotne)
- NBP, tabela kursów średnich 186/A/NBP/2026, 24.09.2026 (źródło pierwotne)
- GUS, „Obwieszczenie w sprawie przeciętnego miesięcznego wynagrodzenia w sektorze przedsiębiorstw w sierpniu 2026 r.”, 21.09.2026 (źródło pierwotne)
Czy ten tekst Ci pomógł?
Jedno kliknięcie. Bez podawania adresu e-mail. Dzięki temu wiem, które teksty wymagają poprawy.