Model Jev nie wymyśli odpowiedzi spoza listy, ale może wybrać złą. W niezależnym teście na 2000 maili dogonił mały model Anthropic dopiero po rozbiciu pytania na pięć
Reklamowane 193,6 raza szybciej i 444,6 raza taniej TypeSafe AI policzyło na czterech scenariuszach własnego zespołu, a pomiar z Francji dał prawie trzy razy szybciej i dwanaście razy taniej. Przy polskich mailach ważniejsze od ceny jest to, że model najlepiej działa po angielsku, a serwery ma tylko w USA.
Na skróty
- 15 września TypeSafe AI, firma Diogo Almeidy, współtwórcy metody trenowania ChatGPT, udostępniła model Jev. Zamiast pisać tekst, wybiera odpowiedź z podanej listy i podaje przy niej prawdopodobieństwo.
- Hasło „zero halucynacji” oznacza tyle, że model nie zwróci odpowiedzi spoza listy. Producent sam przyznaje, że może wybrać złą.
- Liczby 193,6 i 444,6 pochodzą z czterech scenariuszy zespołu TypeSafe, a za wzór poprawnej odpowiedzi posłużyła średnia z dwóch innych modeli.
- W niezależnym teście na 2000 maili Jev ocenił trafnie 62,6 procent, Claude Haiku 4.5 81,3 procent, a prosta reguła bez AI 91,6 procent. Po rozbiciu pytania na pięć prostszych Jev doszedł do 95 procent.
- Według dokumentacji model działa najlepiej po angielsku, a serwery są tylko w USA, więc z Europy przyspieszenie spada do mniej więcej trzykrotnego.
- Przy 10 000 maili miesięcznie Jev kosztowałby około 16 zł mniej niż Haiku, więc w małej firmie o wyborze decyduje trafność na własnych mailach.
Na stronie głównej TypeSafe AI przy modelu Jev widnieje hasło „Zero Hallucinations”, czyli zero zmyśleń. Niżej, w odpowiedziach na częste pytania, ta sama firma pisze, że gwarancja dotyczy kształtu odpowiedzi i że model może wybrać źle. Oba zdania są prawdziwe. Z różnicy między nimi wynika, do czego Jev nadaje się w firmie.
Model udostępniono 15 września, po dwóch latach prac w ukryciu. Firmę założył Diogo Almeida, który w OpenAI współtworzył RLHF, czyli uczenie modelu na ocenach wystawianych przez ludzi. Z tej metody wyrósł ChatGPT. Jev zdań nie pisze. Dostaje dane, na przykład treść maila, oraz zamknięte pytania: do którego działu skierować sprawę, czy klient prosi o zwrot pieniędzy, jak bardzo jest zdenerwowany w skali od zera do dwóch. Odpowiada wyborem z listy i prawdopodobieństwem przy każdej opcji. Producent liczy 0,042 dolara za milion tokenów wejścia (token to kawałek słowa), a za odpowiedź nie pobiera nic.
Lista odpowiedzi jest zamknięta, trafność już nie
W zwykłym czacie halucynacja oznacza zmyślony fakt, na przykład nieistniejący wyrok albo cytat. Jev tego nie potrafi, bo nie pisze tekstu. Gdy lista działów ma trzy pozycje, czwartej nie doda. Może za to wskazać zły dział. Producent pisze to wprost. Diogo Almeida powiedział w podcaście Latent Space, opublikowanym 21 września, że model będzie się mylił w wielu sprawach. Koreański serwis AI Times powtórzył 17 września za firmą, że Jev nie może halucynować, już bez zastrzeżenia o błędnych decyzjach.
Dokumentacja wersji 1.13, przejrzana przez firmę 17 września, wymienia dziewięć znanych słabości. Model nie liczy wiarygodnie i źle porównuje daty, więc termin płatności lepiej sprawdzać zwykłym programem. Polecenie podrzucone w treści maila potrafi przesunąć odpowiedź. Najlepiej widać to na przykładzie samego producenta. Na pytanie, czy klient prosi o zwrot pieniędzy, Jev odpowiada 72 procent, a na pytanie, czy prosi o coś innego niż zwrot, 47 procent. Razem wychodzi 119 procent.
„W gruncie rzeczy przerzuca to problem halucynacji trochę na użytkownika. To użytkownik musi uznać, że wynik z prawdopodobieństwem 50 procent to może rzut monetą, a przy 95 procentach da się coś z nim zrobić.”
Im dalej od producenta mierzący, tym mniejsza przewaga
Na stronie głównej TypeSafe podaje, że Jev jest 193,6 raza szybszy i 444,6 raza tańszy od zwykłych modeli językowych. Wpis z 15 września wyjaśnia ich pochodzenie. Liczby pochodzą z czterech scenariuszy przygotowanych przez zespół firmy. Za poprawną odpowiedź przyjęto średnią z dwóch dużych modeli, GPT-6 Astra od OpenAI i Claude Fable 5.1 od Anthropic, więc mierzono zgodność z innymi modelami. Sama firma uznaje te wyniki za górną granicę tego, co da się osiągnąć w praktyce.
Niezależne pomiary przewagę potwierdzają, tylko mniejszą. W otwartym teście na GitHubie, obejmującym 49 zadań i 866 przypadków, Jev trafił w 96,4 procent, a trzy darmowe modele uruchamiane na własnym komputerze od 58,5 do 72,4 procent. Te ostatnie odpowiadały kilka razy szybciej. Inżynier firmy Vercel opowiedział TechCrunch, że po zamianie modelu OpenAI na Jev przy sprawdzaniu poleceń pod kątem bezpieczeństwa firma dostała wyniki od 5 do 18 razy szybciej i trafniejsze.
Test uruchomiony 17 września z komputera we Francji pokazuje drugą stronę. Jev dostał 2000 maili z publicznego zbioru PhishNChips, w połowie prób wyłudzeń, i miał ocenić, czy klikać w link. Trafił w 62,6 procent przypadków. Claude Haiku 4.5 w 81,3 procent. Prosta reguła bez AI, czyli lista skracaczy adresów, darmowych hostingów i serwisów z dokumentami, doszła do 91,6 procent. Treść maili napisał model językowy, a o wyniku decyduje głównie adres linku, więc zbiór sprzyja prostym regułom.
Trafne oceny 2000 maili, test z Francji, 17.09.2026
62,6%
Jev, jedno pytanie o cały mail
81,3%
Claude Haiku 4.5, te same maile
Reguła bez AI: 91,6%. Po rozbiciu na pięć prostych pytań (ocena na połowie zbioru): Jev 95,0%, Haiku 93,2%, różnica w granicach przypadku.
Wynik odwrócił się po zmianie sposobu pytania. Jev dostał pięć wąskich pytań naraz, między innymi o to, czy link prowadzi do darmowego hostingu i czy domena nadawcy różni się od domeny linku. Odpowiedzi złożono prostym wzorem statystycznym i trafność wzrosła do 95 procent. Haiku przy tym samym rozbiciu doszedł do 93,2 procent, co mieści się w granicach przypadku. Według autora testu Jev zrobił to około 27 razy taniej i pięć razy szybciej. Tak radzi też producent. Wiele wąskich pytań, a decyzja w kodzie.
Po polsku producent obiecuje mniej, a dane jadą do USA
Dokumentacja modeli podaje, że angielski jest głównym językiem treningu i w nim trafność jest najwyższa. Inne języki Jev obsługuje, ale nie równie dobrze. Producent zaleca test na własnych treściach przed użyciem w innym języku. Wyników dla polszczyzny nie publikuje.
Serwery TypeSafe są w Stanach Zjednoczonych. W teście z Francji samo połączenie z nimi trwało 163 milisekundy, z serwerem Anthropic 18. Z 239 milisekund odpowiedzi Jev większość przypadła więc na drogę przez Atlantyk. Almeida przyznał w Latent Space, że użytkownicy w Europie dostają przyspieszenie mniej więcej trzykrotne zamiast stukrotnego, bo firma nie ma tu serwerów.
Maile klientów to dane osobowe. Polityka prywatności TypeSafe mówi wprost, że korzystanie z usługi z Europy oznacza przesłanie danych do USA. Umowa powierzenia przetwarzania z 24 kwietnia 2026 opiera to przekazanie na standardowych klauzulach umownych Komisji Europejskiej i wskazuje irlandzki urząd ochrony danych. Producent deklaruje, że na danych klientów nie trenuje. Brak przechowywania danych po odpowiedzi, tak zwane zero data retention, oferuje tylko w planach dla dużych firm.
W złotówkach różnica w cenie wygląda skromnie. W teście z Francji ocena tysiąca maili kosztowała według cen katalogowych 0,038 dolara w Jev i 0,462 dolara w Haiku. Po średnim kursie NBP z 24 września (3,8570 zł) to 15 groszy wobec 1,78 zł. Firma z 10 000 maili miesięcznie oszczędziłaby około 16 zł. Czy ta cena się utrzyma, producent mówi dwojako: we wpisie z 15 września, że nie może udowodnić braku dopłat, a na stronie głównej, że obsługuje model z zyskiem.
Czytaj też
Za najdroższy model płaci się przy zadaniach, które go nie potrzebują
Najmocniejszy model kosztuje więcej i odpowiada wolniej, a przy przepisaniu maila daje to samo co najtańszy. Gdzie przebiega granica i po czym poznać, że została przekroczona.
Zmyślony akapit w czacie da się wyłapać przy czytaniu, bo zwykle coś w nim zgrzyta. Źle wybrany dział z listy wygląda dokładnie tak samo jak dobrze wybrany. Tę pomyłkę wychwyci tylko pomiar.
Źródła
- TypeSafe AI, „Introducing System One Models & Jev”, 15.09.2026 (źródło pierwotne)
- TypeSafe AI, strona główna, odpowiedzi na pytania „Can Jev still get things wrong?” i „Are these prices temporary or subsidized?” (plik z treścią strony), stan na 24.09.2026 (źródło pierwotne)
- TypeSafe AI, dokumentacja „Models”, stan na 24.09.2026 (źródło pierwotne)
- TypeSafe AI, dokumentacja „Jev 1.13 jaggedness”, 17.09.2026 (źródło pierwotne)
- TypeSafe AI, „Privacy policy”, 19.11.2025 (źródło pierwotne)
- TypeSafe AI, „Data processing addendum”, 24.04.2026 (źródło pierwotne)
- Latent Space, „Jev: System One models for Prod, not God — with Diogo Almeida, CEO, TypeSafe AI”, 21.09.2026
- TechCrunch, „A new kind of AI model from a ChatGPT inventor is thrilling developers”, 18.09.2026
- AI Times (po koreańsku), „»환각·타입 오류 없다«...오픈AI 출신, 의사결정 특화 AI »제브« 선보여”, 17.09.2026
- anisselbd, „Jev vs LLM: a phishing decision benchmark with a calibration audit”, GitHub, 17.09.2026 (źródło pierwotne, dane testu)
- jabr, „classifier-benchmark”, GitHub, 19.09.2026 (źródło pierwotne, dane testu)
- NBP, „Kurs średni dolara amerykańskiego, tabela 186/A/NBP/2026”, 24.09.2026 (źródło pierwotne)
Czy ten tekst Ci pomógł?
Jedno kliknięcie. Bez podawania adresu e-mail. Dzięki temu wiem, które teksty wymagają poprawy.