Technologia·23 września 2026·5 min

Model z 27 miliardami parametrów zmieścił się w laptopie i zachowuje 98 procent wyników. W długiej pracy agenta traci jedną czwartą

PrismML skompresował model z 54 do 5,9 GB. Średnia z testów spadła o niecałe dwa procent, ale dwa testy samodzielnej pracy nad kodem są poza średnią i tam wynik spada do trzech czwartych oryginału.

Na skróty

  • 17 września firma PrismML wypuściła Ternary Bonsai 2 27B: model o 27 miliardach parametrów, który zamiast 54 GB zajmuje 5,9 GB i działa na zwykłym laptopie.
  • Według producenta zachowuje 98,2 procent wyników pełnego modelu Qwen3.8-27B, na którym jest zbudowany.
  • Ta sama liczba 98,2 wychodzi z dwóch różnych zestawów testów: 14 w karcie modelu i 20 w raporcie technicznym.
  • Dwa testy długiej samodzielnej pracy nad kodem są poza obiema średnimi. W nich model osiąga około trzech czwartych wyniku oryginału.
  • Licencja Apache 2.0 pozwala na użycie w firmie. Model działa bez chmury, więc dane nie opuszczają komputera.
  • Wyników w języku polskim producent nie podaje.

Pełna wersja modelu Qwen3.8-27B zajmuje 54 GB i wymaga serwerowej karty graficznej. 17 września PrismML, firma założona przez badaczy z Caltech, opublikowała jego wersję ważącą 5,9 GB. Na laptopie z procesorem Apple M5 Max generuje około 47 tokenów na sekundę (token to kawałek słowa), czyli znacznie szybciej, niż da się czytać.

Model to w uproszczeniu miliardy liczb, tak zwanych wag, zapisanych zwykle z dużą dokładnością. PrismML zapisuje każdą wagę jako jedną z trzech wartości: minus jeden, zero albo jeden, z jednym wspólnym mnożnikiem na grupę 128 wag. Średnio wychodzi niecałe 1,8 bita na wagę zamiast szesnastu. Stąd dziewięciokrotnie mniejszy plik.

To część szerszego ruchu. Chiński serwis 36Kr opisał 20 września, jak firmy korzystające z wielu agentów naraz przechodzą z największych modeli na mniejsze i tańsze, bo duże modele nie nadążają z liczbą równoległych zadań i zjadają budżet. Mały model na własnym sprzęcie rozwiązuje oba problemy, pod warunkiem że radzi sobie z zadaniem.

Ta sama liczba z dwóch różnych zestawów testów

Hasło z komunikatu brzmi: 98,2 procent inteligencji zachowane. W karcie modelu na Hugging Face ta liczba pochodzi z 14 testów, w których skompresowany model ma średnio 84,78 punktu wobec 86,32 oryginału. W raporcie technicznym ta sama liczba pochodzi z 20 testów i wyników 83,9 wobec 85,4. Zestawy są różne, a wynik wychodzi identyczny.

Średnia jest uczciwie policzona, ale ukrywa rozrzut. Matematyka i programowanie w krótkich zadaniach trzymają się prawie na poziomie oryginału. W karcie modelu najwięcej spada rozpoznawanie obrazów i jeden z testów rozumowania: MMMU-Pro z 81,7 do 75,5, MuSR z 79,6 do 70,6.

Dwa testy poza średnią, oba o samodzielnej pracy

Raport techniczny podaje jeszcze dwa wyniki, ale nie wlicza ich do średniej. Terminal-Bench 2.1 sprawdza, czy model sam wykona wieloetapowe zadanie w wierszu poleceń komputera. SWE-bench Verified sprawdza, czy naprawi prawdziwy błąd w prawdziwym oprogramowaniu. Oba testy mierzą to, co producenci nazywają pracą agenta: długi ciąg decyzji bez człowieka.

Ternary Bonsai 2 27B wobec pełnego modelu, dane producenta

98,2%

średnia z 20 testów wiedzy, matematyki, kodu, poleceń i obrazu

ok. 75%

w testach długiej pracy agenta: 52,8 wobec 69,7 i 60,8 wobec 80,6

PrismML podaje te dwa wyniki sam i przedstawia je jako postęp, bo wcześniejsze modele tej wielkości w takich testach prawie nie dawały rady.

Producent ma w tej sprawie rację w jednym punkcie. Zwykła kompresja do podobnego rozmiaru, z którą PrismML się porównuje, zachowuje 88,4 procent w zestawie 20 testów, więc przepaść między metodami jest duża. Nie zmienia to wniosku dla użytkownika: model w laptopie nadaje się do rozmowy, streszczeń i obliczeń prawie tak jak oryginał, a do samodzielnej, długiej pracy nad kodem wyraźnie gorzej.

Licencja pozwala, dane zostają na miejscu

  • Licencja Apache 2.0 pozwala używać modelu komercyjnie i zmieniać go bez opłat.
  • Model działa w całości na komputerze. Teksty wpisywane do niego nie trafiają do żadnej chmury, co upraszcza sprawę danych klientów i tajemnicy firmy.
  • Na laptopach Apple producent podaje od 18 tokenów na sekundę na M4 Pro do 47 na M5 Max, przy zajętej pamięci około 7,2 GB.
  • Do uruchomienia potrzebna jest odmiana programu llama.cpp przygotowana przez PrismML. Według MarkTechPost standardowa wersja tych plików nie wczytuje.
  • Wyników w języku polskim producent nie podaje. Model bazowy pochodzi od Alibaby i jest wielojęzyczny, ale jakość po polsku po kompresji trzeba sprawdzić na własnych zadaniach.

Źródła

  1. PrismML, „PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet”, 17.09.2026 (źródło pierwotne)
  2. PrismML, raport techniczny „Ternary Bonsai 2 27B”, wrzesień 2026 (źródło pierwotne, PDF)
  3. Hugging Face, karta modelu prism-ml/Ternary-Bonsai-2-27B-gguf (źródło pierwotne: 14 testów, rozmiary, licencja)
  4. MarkTechPost, „PrismML Releases Ternary Bonsai 2 27B”, 18.09.2026
  5. AI Times, o modelu PrismML, 20.09.2026 (po koreańsku)
  6. 36Kr, „大模型,开始集体变小” (Duże modele zaczynają się zmniejszać), 20.09.2026 (po chińsku)

Czy ten tekst Ci pomógł?

Jedno kliknięcie. Bez podawania adresu e-mail. Dzięki temu wiem, które teksty wymagają poprawy.