Znak ClaudeTechnologia·4 października 2026·5 min

Fizyk napisał z Claude 36 prac. Wartość dodali dopiero eksperci

Matthew Schwartz, fizyk z Uniwersytetu Harvarda, opisał na blogu Anthropic, twórcy Claude, rachunki z 18 dziedzin: zwykle poprawne i zwykle mało ciekawe, dopóki specjalista nie wskazał lepszego pytania. Na stronie projektu tylko jedna praca prowadzi do wydawcy spoza niej.

Tablica zapisana wzorami matematycznymi
Zdjęcie ilustracyjne

Na skróty

  • Matthew Schwartz, fizyk z Uniwersytetu Harvarda i badacz gościnny w Anthropic, twórcy Claude, przygotował z tym modelem w trzy miesiące 36 prac z 18 dziedzin, z 19 współautorami.
  • Narzędzie BootLoops, nakładka z programami do dokładnych obliczeń, ma otwarty kod na licencji MIT; napisał go Claude pod nadzorem Schwartza, a Anthropic nie wspiera go jako swojego produktu.
  • Według Schwartza model prawie zawsze liczył poprawnie, ale wynik robił się ciekawy dopiero po wskazówce eksperta z danej dziedziny.
  • Na stronie projektu jedna praca prowadzi do wydawcy spoza niej: dokument roboczy amerykańskiego biura badań ekonomicznych NBER. Wpis Anthropic zastrzega, że wyniki są dalej weryfikowane.
  • Schwartz wypisuje rady z własnej pracy naukowej: z góry ustalić, co znaczy „gotowe”, oglądać wyniki samemu i osobno pytać o wnioski.

Claude rozwiązał równanie ekologów, od 20 lat niepoliczone w dużej skali. Z rachunku wyszło, że skład gatunków drzew na wyspie Barro Colorado w Kanale Panamskim zmienia się 4,5 raza szybciej, niż pozwala teoria zakładająca, że o losie gatunków decyduje przypadek. Wynik trafił do biologa Jamesa O’Dwyera, specjalisty od tej teorii. Docenił rachunek. Uprzedził jednak, że wielu ekologów przyjmie wynik wzruszeniem ramion.

Scenę opisał 1 października na blogu Anthropic, twórcy Claude, sam autor eksperymentu: Matthew Schwartz, fizyk teoretyk z Uniwersytetu Harvarda. W trzy miesiące, z 19 współautorami, przygotował z modelem 36 prac naukowych z 18 dziedzin, od fizyki cząstek po językoznawstwo. Wybrał je spośród około 400 problemów. Przez cały projekt pracował w Anthropic jako badacz gościnny. Wniosek z wpisu jest prosty: model liczy szybko i poprawnie, a o tym, co warto liczyć, nadal decyduje człowiek.

Narzędzie nazywa się BootLoops. To nakładka na model językowy: pakiet programów do dokładnych obliczeń plus procedury pozwalające sprawdzić każdy wynik modelu. Według repozytorium kod napisał Claude pod nadzorem Schwartza. Jest otwarty, na licencji MIT, więc wolno go używać i zmieniać bez opłat. Repozytorium zastrzega, że utrzymuje je Schwartz, a Anthropic nie daje do niego wsparcia ani poprawek.

Rachunek się zgadzał, sens dokładał ekspert

We własnej dziedzinie Schwartz mógł ocenić wszystko sam. Claude odtworzył wynik jednej z jego prac w około 20 minut, choć Schwartz pisał kiedyś ten kod tygodniami. W kilka tygodni model policzył 30 całek z fizyki zderzeń cząstek, w tym 15 nigdy wcześniej nieobliczonych. Potem Schwartz wyszedł poza fizykę.

Tu zaczął się kłopot, opisany przez samego autora. Gdy Claude chwali własny wynik z fizyki, Schwartz potrafi ocenić, czy model ma rację, i często jej nie ma. Gdy chwali wynik z cudzej dziedziny, Schwartz łapie się na tym, że przytakuje. Dlatego zaczął pokazywać wyniki specjalistom. Według jego relacji prawie zawsze rachunek był poprawny, a wynik mało ciekawy, dopóki ekspert nie wskazał kierunku.

W genetyce populacyjnej, nauce o zmienności genów w populacji, Schwartz napisał do trzech biologów, zanim odpowiedział jeden: jego kolega Michael Desai. Desaia przekonała technika, nauka już nie. Zaproponował inne pytanie, o pary mutacji leżące blisko siebie na jednym chromosomie. Dopiero ta wersja dała znalezisko: ślady mechanizmu zwanego konwersją genów. Prawie wszystkie analizy tego typu, od historii populacji po szukanie genów chorób, ten mechanizm pomijają.

W ekologii O’Dwyer podsunął odjęcie od danych tego, co tłumaczy sam przypadek, i badanie reszty. Tak powstał model długości życia, wzrostu i rozmnażania drzew, zgodny z pomiarami. Rola Schwartza się zmieniła. Tłumaczył ekologowi język modelu i pilnował, żeby Claude nie zbaczał z tematu, a O’Dwyer naciskał, żeby wynik obchodził ekologów.

Czytaj też

Claude znalazł w DNA nowy układ enzymów. W dziesięciu powtórkach tej samej pracy nie zauważył go ani razu

Według bloga Anthropic ludzie dali modelowi tylko polecenie i zrobili doświadczenia. Preprint tej samej firmy opisuje więcej ludzkiej pracy, a co robi znaleziony układ, nie wie jeszcze nikt.

Trzydzieści sześć rękopisów, jeden u wydawcy

Ile z tych prac przyjęło już czasopismo naukowe, autorzy nie podają. Wpis Anthropic sam zastrzega, że opisane wyniki są dalej badane i weryfikowane. Strona projektu, bootloops.ai, udostępnia rękopisy jako pliki PDF, a przy ośmiu pozycjach podaje dopisek „w przygotowaniu”. Według strony wszystkie rękopisy przeczytali ludzie. Część napisały jednak najpierw modele i nie przeszła jeszcze pełnej ludzkiej kontroli, więc ma znak wodny „wstępne”. Odnośnik do wydawcy ma jedna praca. Prowadzi do NBER, amerykańskiego biura badań ekonomicznych, gdzie wyszła jako dokument roboczy. Wyszukiwarka arXiv, serwisu z pracami naukowymi udostępnianymi przed recenzją, 4 października nie zwracała ani jednej pracy ze słowem BootLoops.

Prace Schwartza z Claude, stan na 4 października 2026

36

prac z 18 dziedzin w trzy miesiące, według autora

1

z odnośnikiem do wydawcy spoza strony projektu: dokument roboczy NBER

Pozostałe rękopisy to pliki PDF na stronie bootloops.ai, osiem z dopiskiem „w przygotowaniu”. Wpis Anthropic zastrzega, że wyniki są dalej weryfikowane.

Czasopisma ekonomiczne każą autorom dołączać dane i kod do artykułu. Program Schwartza i dwóch ekonomistów przejrzał takie pakiety dla 4452 artykułów z pięciu czasopism i oznaczył rozbieżności z opublikowanymi wynikami w 3460, czyli w ponad trzech czwartych. Pełny tekst pracy rozbiera najwcześniejszą rozbieżność w obliczeniach w każdym artykule. W 35,6 procent przypadków mieści się ona w zaokrągleniu ostatniej cyfry, w pozostałych odbiega od druku bardziej. W 496 artykułach program przyspieszył obliczenia ponad dziesięciokrotnie.

Zasady z laboratorium pasują do biura

Schwartz wypisuje też błędy modelu. Do każdego dodaje sposób obrony. Trzy takie rady, razem z lekcją z pracy z ekspertami, pasują do każdej firmy zlecającej AI analizę sprzedaży, umowy albo cennika konkurencji.

  1. Ustalić z góry, co znaczy „gotowe”

    Claude lubi ogłaszać sukces. Według Schwartza „gotowe, z jednym zastrzeżeniem” często znaczy „wcale niegotowe”. W jednym projekcie dowód był kompletny poza jednym nieudowodnionym twierdzeniem pomocniczym, a to twierdzenie było całym dowodem. Pomagają sztywne kryteria sukcesu, spisane przed startem.

  2. Oglądać wyniki na własne oczy

    Schwartz zawsze prosi o wykresy, bo automatycznym kontrolom nie ufa, nawet tym ustawionym przez siebie. Ostrożność budzą ogólniki typu „dobra zgodność”. W firmie odpowiednikiem wykresu jest tabela z liczbami źródłowymi pod każdym wnioskiem.

  3. Pytać o wniosek osobno od rachunku

    Model dobrze liczy, ale z poprawnych obliczeń potrafi wyciągnąć błędny wniosek. Rada Schwartza: kazać mu tłumaczyć wynik tak długo, aż da się w niego uwierzyć.

  4. Ocenę oddać komuś z branży

    Własną dziedzinę zlecający oceni sam. Poza nią przytakuje modelowi częściej, niż powinien. Wynik podatkowy idzie do księgowej, prawny do prawnika, zanim ktoś oprze na nim decyzję.

Do tego model nie ma poczucia czasu. Po trzech dniach pracy Claude ogłosił Schwartzowi rozwiązanie wzoru i podsumował je słowami „dwa lata kampanii”. Szacunki terminów wychodziły mu za długie albo za krótkie. Wolał też mielić obliczenia przez wiele dni, choć nowe narzędzie skróciłoby je do minut. Według autora projekty pochłaniały moc obliczeniową i tokeny, czyli jednostki tekstu rozliczane przy pracy z modelem. Kwot autor nie podaje.

Schwartz kończy wpis sprawą zasług. Według niego AI może odwrócić stary układ, w którym uznanie zbiera szef, a ludzie przy robocie nic. Sporu nie rozstrzygnie, jak pisze, udawanie, że wkład człowieka sprowadzał się do pisania na klawiaturze. W jego 36 pracach ten wkład ma 19 nazwisk.

Źródła

  1. Anthropic, „Claude-shaped science”, 01.10.2026 (źródło pierwotne)
  2. GitHub, BootLoops-ai, „BootLoops 1.0”, 01.10.2026 (źródło pierwotne)
  3. BootLoops, „Manuscripts”, odczyt 04.10.2026 (źródło pierwotne)
  4. National Bureau of Economic Research, „An LLM Workflow That Reproduces, Improves, and Extends Published Economics Research”, Working Paper 35782, 17.09.2026 (źródło pierwotne)
  5. arXiv, wyniki wyszukiwania „BootLoops”, 04.10.2026
  6. The Decoder, „Open-source »BootLoops« harness supports AI models in performing precise scientific calculations”, 03.10.2026

Czy ten tekst Ci pomógł?

Jedno kliknięcie. Bez podawania adresu e-mail. Dzięki temu wiem, które teksty wymagają poprawy.