Znak ClaudeTechnologia·11 października 2026·3 min

Recenzent AI łapie 73 procent błędów. Tylko tych podrzuconych

Tokijska firma badawcza Sakana AI pokazała recenzenta prac naukowych na modelach Claude: w głównych tezach wyłapał 73 procent sprzeczności, najlepszy starszy system 15 procent. Na pracach wycofanych z powodu prawdziwych pomyłek trafił w 16 do 26 procent przypadków.

Badacz przy stole w jasnym laboratorium
Zdjęcie ilustracyjne

Na skróty

  • Tokijska firma badawcza Sakana AI opisała system MLR, w którym modele Claude od Anthropic czytają pracę naukową i szukają w niej sprzeczności.
  • W teście na 257 pracach z błędami wstawionymi przez model AI system wykrył 73 procent sprzeczności w głównych tezach, najlepszy starszy system 15 procent.
  • Na pracach wycofanych z powodu prawdziwych pomyłek trafił w 16 do 26 procent przypadków.
  • Część przewagi daje sam model: starsze systemy działały na modelach GPT od OpenAI.
  • Z uwag o słabościach pracy badacze testujący system na własnych tekstach przyjęli 68 procent.
  • Jedna recenzja kosztuje według autorów 0,47 dolara, czyli niecałe 2 zł.

Tokijska firma badawcza Sakana AI opisała 8 października system, w którym modele Claude od Anthropic czytają pracę naukową i szukają w niej błędów. W głównych tezach prac wyłapał 73 procent sprzeczności, najlepszy starszy system 15 procent. Błędy do testu wstawił jednak model AI. Na pracach wycofanych z powodu prawdziwych pomyłek ten sam recenzent trafił w 16 do 26 procent przypadków.

Wszystkie liczby pochodzą od autorów systemu. Pięcioro badaczy Sakany opisało go w pracy przyjętej w lipcu przez pismo naukowe Transactions on Machine Learning Research i opublikowanej w arXiv, otwartym archiwum prac naukowych.

Błędy wstawił jeden model, trafienia liczył drugi

Autorzy wzięli 257 opublikowanych prac z pięciu dużych konferencji o sztucznej inteligencji, w tym ICML i NeurIPS. Model AI dopisywał do nich zdania sprzeczne z resztą tekstu: raz w głównej tezie, raz w szczegółach coraz dalej od niej. Powstało 1164 wersji z błędem. O tym, czy recenzja wskazała błąd, rozstrzygał model o3 od OpenAI.

Sam system nazywa się Multi-Layered Review (wielowarstwowa recenzja, w skrócie MLR). Claude Sonnet 4 pisze recenzję, a mniejszy Claude Haiku 3.5 streszcza dodatki.

Ten sam recenzent MLR, dwa rodzaje błędów

73%

sprzeczności w głównych tezach, podrzucone przez model AI (cztery recenzje na pracę)

16–26%

prawdziwe błędy w pracach wycofanych z arXiv, zależnie od tego, jak ściśle liczyć trafienie

Dane autorów systemu, praca opublikowana na arXiv 8.10.2026.

Część przewagi daje sam model

Najlepszy ze starszych systemów, AgentReview, wykrył 14,8 procent sprzeczności w głównych tezach. Autorzy sami zaznaczają, że porównanie jest zaburzone. Starsze systemy działały na modelach GPT od OpenAI, MLR na Claude.

Różnica modeli jest duża. W najprostszym z porównywanych systemów zamieniono GPT na Claude Sonnet 4 i wynik w głównych tezach wzrósł z 15 do 35 procent. Resztę dały budowa MLR i powtórzenie recenzji czterokrotnie.

Na prawdziwych pomyłkach skuteczność spada

Ludzie ocenili 50 wstawionych sprzeczności i 34 procent uznali za źle wpasowane w sąsiednie zdania. Taki zgrzyt może podpowiadać czytelnikowi, także maszynie.

Drugi test autorzy przeprowadzili na zbiorze WithdrarXiv-Check, przygotowanym wcześniej przez badaczy Tianmai Zhang i Neila Abernethy'ego. To prace wycofane z arXiv razem z komentarzem, z jakiego powodu je wycofano. MLR wskazał dokładnie ten powód w 16 procentach prac, a podobny problem w 26. To nadal najlepszy wynik w porównaniu. Większość tych prac to matematyka teoretyczna i fizyka, a system budowano pod konferencje o uczeniu maszynowym.

Co trzeciej uwagi o słabościach autorzy nie przyjęli

Odsetka fałszywych alarmów, czyli uwag o nieistniejących błędach, praca nie podaje. Najbliższa miara pochodzi z 38 sesji, w których badacze wgrali do systemu własne prace i ocenili jego uwagi. W części o słabościach pracy zgodzili się z 68 procentami. To najsłabszy wynik ze wszystkich części recenzji.

Recenzenta da się też oszukać. Za wnioskami 50 odrzuconych prac dopisano polecenie dla recenzenta AI, niewidoczne dla ludzi recenzujących pracę. Wpłynęło na oceny wszystkich systemów, także MLR. Ten zauważył próbę w 8 przypadkach na 50.

Recenzja za niecałe 2 zł

Jedna recenzja MLR kosztuje według autorów 0,47 dolara, czyli około 1,83 zł po kursie NBP z 9 października. Cztery recenzje to niecałe 8 zł za pracę. Publicznego adresu narzędzia praca nie podaje. Wyników dla prac po polsku też nie, a autorzy piszą, że ich analiza dotyczy głównie uczenia maszynowego.

Polskie uczelnie mają już zasady dla AI w pracach dyplomowych. Na Politechnice Białostockiej od 30 stycznia 2026 do pracy dołącza się oświadczenie o korzystaniu z systemów sztucznej inteligencji. Prowadzący seminaria omawiają, jak takie użycie oznaczyć.

Według autorów narzędzie pomocne recenzentom może też pomóc autorom poprawiać prace pod automatyczną kontrolę.

Czytaj też

Opis produktu z czatu nie wymaga oznaczenia. Artykuł medyczny tak

Tak rozgranicza to Komisja Europejska w wytycznych z 20 lipca 2026, a do zwolnienia potrzebna jest jeszcze osoba odpowiedzialna za publikację. Uczelnie i wydawcy naukowi wymagają więcej, a style cytowania APA, MLA i Chicago zapisują tę samą rozmowę z czatem na trzy sposoby.

Źródła

  1. arXiv, Teo, Yamada, Kotyan, Imajuku, Clanuwat (Sakana AI), „Beyond Imitation: A Framework and Benchmark for LLM-Assisted Peer Review”, 08.10.2026 (źródło pierwotne)
  2. arXiv, pełny tekst tej samej pracy, wersja przyjęta przez Transactions on Machine Learning Research, 08.10.2026 (źródło pierwotne, PDF)
  3. arXiv, wersja HTML tej samej pracy z tabelami wyników, 08.10.2026 (źródło pierwotne)
  4. arXiv, Zhang, Abernethy, „Reviewing Scientific Papers for Critical Problems With Reasoning LLMs: Baseline Approaches and Automatic Evaluation”, 01.04.2026 (źródło pierwotne, zbiór WithdrarXiv-Check)
  5. Politechnika Białostocka, „Zarządzenie nr 16/2026 Rektora Politechniki Białostockiej”, 30.01.2026 (źródło pierwotne, PDF)
  6. Narodowy Bank Polski, „Kurs średni USD, tabela 197/A/NBP/2026”, 09.10.2026 (źródło pierwotne)
  7. Sakana AI, „Announcing Our Series B”, 17.11.2025 (opis firmy)

Czy ten tekst Ci pomógł?

Jedno kliknięcie. Bez podawania adresu e-mail. Dzięki temu wiem, które teksty wymagają poprawy.