Nowy model Google do rozmów głosowych. W polskiej wersji cennika go nie ma, a dolary są tam podpisane złotówkami
Gemini 3.8 Live odpytuje inne systemy w tle, nie przerywając rozmowy, i kosztuje tyle samo co model poprzedni. Sprawdzenie ceny na polskiej wersji strony producenta daje inną liczbę niż sprawdzenie tej samej strony po angielsku.
Na skróty
- Google ogłosił 15 września dwa modele: Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking. Zamieniają mowę na mowę, bez etapu tekstowego pośrodku.
- Nowość, którą producent stawia na pierwszym miejscu: model wykonuje polecenia i odpytuje inne systemy w tle, nie przerywając rozmowy.
- Minuta słuchania kosztuje 0,005 dolara, minuta mówienia 0,018 dolara. Mówienie jest 3,6 raza droższe od słuchania.
- Polska wersja cennika, sprawdzona 16 września, nie wymienia żadnego z nowych modeli, a w wierszu ceny wyjściowej dolary są podpisane złotówkami.
- Polski jest na liście 97 języków. Zgłoszenie o angielskiej wymowie polskich słów w poprzednim modelu Live wisi na forum producenta od 7 sierpnia bez rozwiązania.
Google ogłosił 15 września dwa modele do prowadzenia rozmów głosowych i napisał, że są dostępne dla programistów od razu. Polska wersja cennika, opatrzona datą 16 września, nie wymienia żadnego z nich. Wymienia model poprzedni, a w wierszu z ceną wyjściową dolary są podpisane złotówkami. Sprawdzenie tej samej strony po angielsku daje inny obraz.
Modele nazywają się Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking. Zamieniają mowę na mowę bez pośredniego etapu tekstowego, czyli nie spisują wypowiedzi na tekst po to, żeby potem tekst zamienić z powrotem na głos. Przeznaczenie jest jedno: asystenci głosowi, którzy odbierają telefon i coś przy okazji załatwiają.
Rozmowa nie milknie, gdy model coś sprawdza
Dotąd asystent głosowy, który musiał zajrzeć do systemu rezerwacji albo do bazy klientów, robił w rozmowie ciszę. Zmiana, którą producent stawia na pierwszym miejscu, usuwa właśnie tę ciszę.
„It executes tools and API calls in the background while continuing the conversation, so the model can acknowledge requests and keep chatting while tasks finish in the background.”
Wersja z rozszerzonym rozumowaniem idzie dalej i opowiada w trakcie, na jakim etapie jest zadanie. Producent podaje też wyniki testów: pierwsze miejsce w zestawieniu jakości mowy na mowę firmy Artificial Analysis z wynikiem 82,6 oraz 97,7 procent w teście Big Bench Audio. Wyniki pochodzą od producenta i nie zostały przez nikogo niezależnie powtórzone.
Drugą rzeczą wartą odnotowania jest znak wodny SynthID nakładany na cały dźwięk wytworzony przez modele Google. Jest niesłyszalny i ma pozwolić odróżnić nagranie wygenerowane od nagranego. Dla firmy, która puszcza taki głos na infolinię, to jest informacja o tym, że wytwór da się później zidentyfikować.
Mówienie jest 3,6 raza droższe od słuchania
Cennik interfejsu programistycznego podaje dwie stawki za dźwięk: 0,005 dolara za minutę wejścia, czyli słuchania, i 0,018 dolara za minutę wyjścia, czyli mówienia. Obie stoją w jednym wierszu wspólnym dla Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking i poprzedniego Gemini 3.1 Flash Live Preview. Nowe modele nie są więc droższe od poprzednika.
Cena minuty dźwięku w interfejsie programistycznym, poziom płatny
0,005 USD
minuta słuchania, czyli dźwięku wchodzącego do modelu
0,018 USD
minuta mówienia, czyli dźwięku wychodzącego z modelu
Stawki odczytane z angielskiej wersji cennika Gemini API 16.09.2026. Różnica między nimi to 3,6 raza, więc rozmowa prowadzona przez gadatliwego asystenta kosztuje wielokrotnie więcej niż ta sama rozmowa z asystentem, który głównie słucha.
Policzone na pięciominutowej rozmowie, podzielonej po połowie na słuchanie i mówienie, wychodzi 0,0575 dolara, czyli przy kursie NBP z 16 września około 22 groszy. Sto takich rozmów dziennie przez trzydzieści dni to około 649 złotych. To jest koszt samego modelu. Nie obejmuje telefonii, integracji z systemami firmy ani tokenów tekstowych zużywanych na instrukcje i wywołania narzędzi.
Ta sama strona, dwie różne treści
Cennik Gemini API ma polską wersję językową i to ona wyświetla się domyślnie osobie wchodzącej z Polski. Odczytane 16 września, obie wersje różnią się w dwóch miejscach naraz.
- Wersja angielska, z datą aktualizacji 15 września, ma wiersz zatytułowany „Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking, and Gemini 3.1 Flash Live Preview". Wersja polska, z datą aktualizacji 16 września, nie wymienia nowych modeli w ogóle. Ten sam wiersz nosi tam tytuł „Gemini 3.1 Flash Live (wersja testowa)".
- W wersji polskiej cena wejściowa jest podana w dolarach, a cena wyjściowa w złotówkach: „4,50 PLN (tekst)" oraz „12,00 PLN lub 0,018 PLN/min (audio)". Nagłówek kolumny nad tymi liczbami brzmi jednak „Poziom płatny, za 1 mln tokenów w USD".
Druga z tych pomyłek ma skutek liczbowy. Kto zaplanuje budżet z polskiej strony i przeczyta 0,018 złotówki za minutę mówienia, policzy tę część rachunku prawie czterokrotnie za nisko, bo prawdziwa stawka to 0,018 dolara, czyli przy kursie z 16 września niecałe siedem groszy.
Polski jest na liście języków. O wymowie nie ma ani słowa
Producent podaje, że model rozpoznaje i przełącza się w trakcie rozmowy między 97 językami. Polski jest na tej liście, w dokumentacji pod kodem „pl". Ogłoszenie nie mówi jednak nic o tym, jak brzmi mowa w poszczególnych językach, a to jest przy asystencie głosowym różnica między produktem a demonstracją.
Na własnym forum Google wisi od 7 sierpnia zgłoszenie dotyczące poprzedniego modelu z tej rodziny. Autor pisze, że model dobiera poprawne polskie słowa, ale wymawia je z angielską fonetyką i intonacją, podczas gdy starsze modele wymawiały je poprawnie. Zgłaszający podaje, że instrukcja systemowa pomaga tylko trochę i nie wytrzymuje dłuższej rozmowy.
„This is not a language-detection problem. The model speaks Polish and picks correct words; the phonetics and prosody are English.”
Jedyna odpowiedź ze strony Google padła 18 sierpnia i brzmi, że zgłoszenie zostało przekazane odpowiednim zespołom. Do 16 września w wątku nie ma informacji o naprawie. Zgłoszenie dotyczy modelu poprzedniego, a nie nowych, i nie wolno go im przypisywać. Jest natomiast powodem, żeby przed wypuszczeniem polskiego asystenta głosowego posłuchać go samemu, zamiast opierać się na liście języków.
Źródła
- Google, ogłoszenie Gemini 3.8 Live i 3.8 Live Extended Thinking, 15.09.2026 (źródło pierwotne)
- Cennik Gemini API, wersja angielska, sprawdzony 16.09.2026 (źródło pierwotne)
- Cennik Gemini API, wersja polska, sprawdzony 16.09.2026 (źródło pierwotne)
- Lista języków obsługiwanych przez Live API, z kodem „pl" (źródło pierwotne)
- Zgłoszenie o polskiej wymowie na forum Google AI Developers, 7.08.2026
- Kurs średni NBP dla dolara amerykańskiego, tabela 180/A/NBP/2026 z 16.09.2026