Czy to bańka·25 września 2026·4 min

Eksperci nie docenili AI w testach. Na ulicy i w laboratorium ją przecenili

Złoty medal olimpiady matematycznej przyszedł pięć lat przed medianą prognoz, a najwyższe przychody firmy AI, dziś Anthropic, są pięć razy wyższe od przewidywań. Robotaksówki i pomoc AI w laboratorium wypadają poniżej oczekiwań, a o wpływie na gospodarkę raport jeszcze nie wyrokuje.

Na skróty

  • Raport Forecasting Research Institute z 23 września 2026 zestawia prognozy ekspertów o AI zbierane od 2022 roku z tym, co się wydarzyło.
  • W testach modeli eksperci mylili się o lata: poziom złotego medalu olimpiady matematycznej przyszedł w lipcu 2025, a mediana prognoz wskazywała 2030.
  • Najwyższe tempo przychodów firmy AI na koniec 2026 roku eksperci szacowali na 20 mld dolarów. Anthropic ma według FRI około 100 mld już we wrześniu.
  • W zastosowaniach praktycznych bywa odwrotnie: udział aut bez kierowcy w przejazdach w USA i pomoc AI amatorom w laboratorium wypadają poniżej prognoz.
  • O wpływie na wzrost gospodarczy i zatrudnienie raport jeszcze nie wyrokuje, a sposób liczenia sprzyja wykrywaniu niedoszacowań.
  • W Polsce AI używało w 2025 roku 8,4 procent firm, wobec 20,0 procent w Unii.

Między czerwcem a październikiem 2022 roku eksperci od sztucznej inteligencji oceniali, że model AI osiągnie poziom złotego medalu na Międzynarodowej Olimpiadzie Matematycznej około 2030 roku. Stało się to w lipcu 2025. Superprognostycy, czyli ludzie z udokumentowaną skutecznością w przewidywaniu zdarzeń, stawiali na 2035.

Tę pomyłkę opisuje raport Forecasting Research Institute (FRI), amerykańskiej organizacji badającej trafność prognoz, opublikowany 23 września 2026. FRI zbiera prognozy o AI od połowy 2022 roku. Pierwszy nabór do jej comiesięcznego panelu LEAP objął 339 ekspertów: 76 informatyków, 76 osób z branży AI, 68 ekonomistów i 119 specjalistów od polityki wobec AI. Wśród informatyków 30 to profesorowie z dwudziestu najlepszych uczelni.

Tytuły omówień sprowadzają raport do jednego zdania: eksperci nie doceniają tempa. Raport czytany w całości mówi coś bardziej przydatnego. Prognozy rozpadają się na dwie kolumny. W pierwszej AI wyprzedza przewidywania, w drugiej zostaje za nimi albo wynik jest nieznany. Dla właściciela firmy ważniejsza jest druga.

Testy i przychody dostawców wyprzedziły prognozy o lata

Najwięcej rozstrzygniętych pytań dotyczy benchmarków, czyli zestawów zadań do porównywania modeli. W teście matematycznym FrontierMath mediana ekspertów zakładała na koniec 2025 roku wynik 31 procent. Najlepszy model uzyskał 40,7. W teście programistycznym LiveCodeBench Pro, w części z najtrudniejszymi zadaniami, eksperci przewidywali 14 procent na koniec 2026 roku. W maju 2026 najlepszy wynik wynosił 53,8.

Druga pomyłka dotyczy pieniędzy. FRI pytało o najwyższe roczne tempo przychodów firmy AI na koniec 2026 roku (przychód z ostatniego okresu przeliczony na cały rok). Eksperci od AI podali medianę 20 mld dolarów, ekonomiści 16 mld, superprognostycy 25 mld. Według FRI wartość na 22 września 2026 wynosi prawdopodobnie 100 mld dolarów i należy do Anthropic. TechCrunch podawał w sierpniu za Bloombergiem, że pod koniec 2025 roku ta sama firma miała 9 mld, a pod koniec lipca 2026 ponad 65 mld.

Najwyższe roczne tempo przychodów firmy AI na koniec 2026 roku

20 mld $

mediana prognoz ekspertów od AI

ok. 100 mld $

Anthropic, stan na 22 września 2026 według FRI

Pytanie ma rozstrzygnięcie na koniec roku. Łączne tempo przychodów Anthropic i OpenAI eksperci ocenili latem 2026 na 70 mld dolarów, a prawdopodobna obecna wartość to 140 mld.

Przy pytaniu o łączne przychody Anthropic i OpenAI FRI przyznaje się do części winy. Mediany obu grup były niższe od danych opublikowanych już w chwili ankiety. Zdaniem autorów formularz ułatwiał pominięcie najświeższej liczby i oparcie się na starszych.

Na ulicy i w laboratorium eksperci przestrzelili

Latem 2025 roku mediana ekspertów zakładała, że w 2027 roku 7,3 procent przejazdów zamawianych przez aplikację w USA wykonają samochody bez kierowcy. Projekcja wykonana dla FRI przez model GPT-5.5 na podstawie obecnych trendów daje 2,5 procent. Superprognostycy podali 2 procent i są bliżej. To szacunek, nie pomiar, ale różnica jest prawie trzykrotna.

Drugi przykład jest już rozstrzygnięty. W połowie 2025 roku eksperci przewidywali, jaki odsetek studentów kierunków ścisłych wykona trzy zadania laboratoryjne z biologii z pomocą modelu językowego. Specjaliści od bezpieczeństwa biologicznego podali 22,5 procent, wirusolodzy 40, superprognostycy 16,2. W badaniu z losowym przydziałem uczestników wszystkie zadania wykonało 5,2 procent.

Pytanie najbliższe codziennej pracy nie rozstrzyga niczego w żadną stronę. Dotyczyło udziału godzin pracy w USA wspieranych przez generatywną AI w 2025 roku. Prognozy wynosiły 4 i 3,6 procent, wynik 5,7. FRI zastrzega jednak, że w opisie pytania podało ankietowanym punkt wyjścia 2 procent z badania Banku Rezerwy Federalnej w St. Louis, później poprawiony przez autorów na 3,35. O wzroście gospodarczym i zatrudnieniu raport nie wyrokuje: rozstrzygniętych pytań jest za mało na wnioski.

Rekord przychodów dostawcy nie mierzy zysku kupującego

Autorzy sami wskazują dwa ograniczenia. Pierwsze jest statystyczne. Zbyt niską prognozę widać od razu, gdy rzeczywistość przekroczy próg. Zbyt wysoką widać dopiero po terminie. Raport sporządzony w połowie drogi z natury znajduje więcej przypadków niedoszacowania, a kolumna przeszacowań może jeszcze urosnąć.

Drugie ograniczenie dotyczy sensu testów. FRI przytacza wyjaśnienie alternatywne: benchmarki mogły rosnąć szybciej od prognoz także dlatego, że łatwiej niż sądzono uczyć modele pod test. Wtedy duży postęp w zestawach zadań nie musi przekładać się na skutki w realnym świecie. Rozstrzygną to dopiero dane o wdrożeniach i wpływie na gospodarkę.

Przychód Anthropic pokazuje, ile klienci płacą za modele. Nie pokazuje, ile na tym zarabiają. To pytanie należy do drugiej kolumny i odpowiedzi na nie jest na razie najmniej. W Polsce dochodzi do tego punkt startu. Według Eurostatu w 2025 roku AI używało 20,0 procent firm w Unii zatrudniających co najmniej dziesięć osób. W Polsce 8,4 procent, niżej była tylko Rumunia.

FRI zapowiada kolejną część raportu. Ma wskazać uczestników panelu z najlepszą dotychczasową trafnością i pokazywać ich prognozy osobno. Otwarte zostaje pytanie, czy najtrafniejsi lepiej przewidują także auta bez kierowcy i laboratorium, czy tylko wyniki testów.

Czytaj też

Czternaście procent w zadaniu, dwa procent w tygodniu pracy, zero w wynikach firmy. To ta sama rzecz z czterech odległości

Najgłośniejsza liczba w tej debacie pochodzi z niezrecenzowanego dokumentu, którego pliku nie ma już na serwerze uczelni. Prawdziwe pytanie brzmi nie „czy działa”, tylko „na jakim poziomie mierzysz”.

Źródła

  1. Forecasting Research Institute, „How Accurate Have AI Progress Forecasts Been So Far?”, 23.09.2026 (źródło pierwotne)
  2. Eurostat, „20% of EU enterprises use AI technologies”, 11.12.2025 (źródło pierwotne)
  3. Google DeepMind, „Advanced version of Gemini with Deep Think officially achieves gold-medal standard at the International Mathematical Olympiad”, 21.07.2025 (źródło pierwotne)
  4. TechCrunch, „Anthropic’s annualized revenue surges to $65B”, 17.08.2026
  5. The Decoder, „Top AI experts badly underestimated how fast the field is moving, study finds”, 24.09.2026

Czy ten tekst Ci pomógł?

Jedno kliknięcie. Bez podawania adresu e-mail. Dzięki temu wiem, które teksty wymagają poprawy.