Zagrożenia·23 września 2026·6 min

Ten sam Claude był w teście finansowym najlepszy i najgorszy. Najlepszy model mylił się w 39 procentach pytań

Brytyjska firma zadała osiemnastu modelom AI 121 pytań o pieniądze, każde po pięć razy. Średnio źle odpowiedziały w 57 procentach przypadków, a o wyniku decydowała bardziej wersja modelu niż marka.

Na skróty

  • Firma Saturn zadała 18 modelom AI 121 pytań finansowych, każde pięć razy. Razem ponad 10 tysięcy odpowiedzi.
  • Średnio 57 procent odpowiedzi było błędnych, a przy pytaniach złożonych 88 procent.
  • Najlepszy był Claude Opus 5 z włączonym rozumowaniem: 39 procent błędów. Najgorszy Claude Haiku 4.5: 82 procent.
  • Modele darmowe myliły się w 63 procentach odpowiedzi, płatne w 49.
  • Pytania dotyczyły przepisów brytyjskich, więc liczby nie przenoszą się na Polskę. Przenoszą się rodzaje błędów.
  • Saturn sprzedaje oprogramowanie AI dla doradców finansowych i ma interes w tym, jak brytyjski nadzór ureguluje takie porady.

Brytyjska firma Saturn zadała osiemnastu modelom sztucznej inteligencji 121 pytań o pieniądze: o długi, kredyty hipoteczne, emerytury, podatki, oszczędności i kredyty studenckie. Każde pytanie padło pięć razy. Z ponad dziesięciu tysięcy odpowiedzi 57 procent było błędnych.

Raport nosi tytuł „Artificial Authority” i ukazał się 14 września. Najciekawsza jest w nim nie średnia, tylko rozrzut między modelami, bo przebiega wewnątrz jednej firmy.

Odsetek błędnych odpowiedzi, dwa modele tej samej firmy

39%

Claude Opus 5 z włączonym rozumowaniem, najlepszy w teście

82%

Claude Haiku 4.5, najgorszy w teście

Dane z raportu Saturn według Financial Reporter, 14 września 2026.

Najlepszy i najgorszy wynik należą do tego samego producenta

Za najgorszym Claude Haiku 4.5 znalazły się Gemini 3.1 Pro z 73 procentami błędów, Grok 4.5 z 59 procentami i ChatGPT 5.6 Luna z 58 procentami. Na drugim końcu Claude Opus 5 z włączonym rozumowaniem, czyli trybem, w którym model przed odpowiedzią dłużej rozpisuje sobie zadanie.

Haiku to najmniejszy i najtańszy model Anthropic, a Opus największy. Różnica między nimi wynosi w tym teście 43 punkty procentowe, więcej niż między dowolnymi dwiema markami. Modele darmowe myliły się średnio w 63 procentach odpowiedzi, płatne w 49 procentach, a przy pytaniach trudnych darmowe odpowiadały źle w 93 procentach przypadków.

Cztery przykłady z raportu

  • Porada dotycząca podatku od emerytury, która mogła kosztować brytyjskiego emeryta około 17 500 funtów niepotrzebnych opłat na rzecz urzędu skarbowego.
  • Rada, żeby przy długach najpierw spłacać zobowiązania z najwyższym oprocentowaniem, zamiast najpierw czynszu i podatku lokalnego, których niespłacenie grozi eksmisją albo egzekucją.
  • Twierdzenie, że absolwent może przestać spłacać kredyt studencki, wyprowadzając się za granicę.
  • Twierdzenie, że wakacje od spłaty kredytu hipotecznego nie wpływają na ocenę zdolności kredytowej.

Według relacji z raportu błędy układały się w trzy rodzaje: pomyłki w obliczeniach, pomijanie nadchodzących zmian w przepisach podatkowych i powoływanie się na przepisy, które nie istnieją.

Liczby dotyczą brytyjskich przepisów, rodzaje błędów nie

Wszystkie pytania dotyczyły prawa i instytucji brytyjskich: tamtejszego urzędu skarbowego, podatku lokalnego, systemu kredytów studenckich. Odsetek błędów przy pytaniach o polskie przepisy może być inny i nikt go w ten sposób nie zmierzył.

Przenoszą się natomiast rodzaje błędów. Model, który nie wie o zmianie przepisów wprowadzonej po zebraniu jego danych, odpowiada według stanu sprzed zmiany i nie zaznacza tego. Model, który nie zna przepisu, potrafi podać przepis, który brzmi prawdopodobnie. Oba zachowania dotyczą każdego systemu prawnego, a nie tylko brytyjskiego.

Firma, która sprzedaje AI dla doradców finansowych

Saturn opisuje się na swojej stronie jako dostawca oprogramowania sztucznej inteligencji dla firm doradztwa finansowego. Brytyjski serwis Financial Reporter zaznacza, że firma ma interes handlowy w tym, jak tamtejszy nadzór finansowy ureguluje doradztwo prowadzone z pomocą AI. Wniosek, że ogólne czaty nie nadają się do samodzielnego doradzania, jest dla takiej firmy korzystny.

Nie przekreśla to wyników, ale każe czytać je uważnie. Na stronie raportu jest tylko streszczenie, a pełny tekst z opisem metody udostępniany jest po wypełnieniu formularza. Nie da się więc sprawdzić z zewnątrz, kto oceniał odpowiedzi i jak zdefiniowano odpowiedź błędną.

Źródła

  1. Saturn, „Artificial Authority: Should you trust AI to deliver financial advice?”, strona raportu, wrzesień 2026 (pełny tekst po wypełnieniu formularza)
  2. „AI models give wrong financial advice 57% of the time, Saturn research finds”, Financial Reporter, 14 września 2026 (wyniki poszczególnych modeli)
  3. „AI Chatbots Get Financial Questions Wrong More Than Half the Time, Study Finds”, Startup Fortune, wrzesień 2026
  4. Paweł Czajkowski, „ChatGPT, Gemini i Claude dostały test z finansów. Nie zdały”, ITHardware, 21 września 2026

Czy ten tekst Ci pomógł?

Jedno kliknięcie. Bez podawania adresu e-mail. Dzięki temu wiem, które teksty wymagają poprawy.