gik|iewicz

szukaj
Gemini 3.8 Live z rozszerzonym myśleniem – co zapowiedział Google DeepMind?

Gemini 3.8 Live z rozszerzonym myśleniem – co zapowiedział Google DeepMind?

Google DeepMind zaprezentowało 15 września 2026 roku dwa modele audio: Gemini 3.8 Live oraz Gemini 3.8 Live Extended Thinking. To modele zaprojektowane do niemal real-time rozmów głosowych z AI, z jednoczesnym przetwarzaniem mowy i rozumowania oraz wykonywaniem narzędzi w tle. Logan Kilpatrick z Google opisał je jako nowe SOTA live audio models dostępne z ceną i wydajnością klasy frontier.

TL;DR: Google DeepMind zapowiedziało 15 września 2026 roku dwa nowe modele audio: Gemini 3.8 Live oraz Gemini 3.8 Live Extended Thinking. Modele prowadzą niemal real-time rozmowy głosowe, łączą mowę z rozumowaniem w tle oraz asynchronicznym wykonywaniem narzędzi. Gemini 3.8 Live obsługuje 97 języków z płynnym przełączaniem w ramach jednej rozmowy i trafił do API deweloperskiego oraz platform konsumenckich.

Czym są Gemini 3.8 Live i 3.8 Live Extended Thinking?

Gemini 3.8 Live i 3.8 Live Extended Thinking to dwa modele audio od Google DeepMind, zaprojektowane do bardziej naturalnych, niemal real-time rozmów głosowych z AI. Modele rozszerzają rodzinę Gemini Audio poza dotychczasową transkrypcję, przenosząc ją w stronę pełnej konwersacji głosowej.

Wyróżnia się dwie odmiany. Podstawowa wersja obsługuje 97 języków z możliwością płynnego przełączania między nimi oraz asynchroniczne wywołania narzędzi. Oznacza to, że model nie tylko słucha i odpowiada, lecz także prowadzi rozumowanie równolegle do trwającej rozmowy. Według źródło to właśnie ta wersja daje modelowi „myślenie w tle”, a wdrożenie obu wariantów rozpoczęło się już na platformach deweloperskich i konsumenckich.

Tradycyjny model rozmowy głosowej działa sekwencyjnie: nasłuchuje, transkrybuje, generuje odpowiedź. Nowe modele odchodzą od tego schematu. Tom Kydd w analizie dla 1950.ai opisuje tę zmianę jako ważny krok w rozwoju konwersacyjnej AI, w którym voice AI wychodzi poza cykl „słuchanie, transkrypcja, generowanie”.

Co więcej, rozumowanie nie przerywa płynności rozmowy. Użytkownik mówi dalej, a model w tym czasie przetwarza kontekst i przygotowuje odpowiedź. Najważniejsze jest to, że obie warstwy – mowa i rozumowanie – działają jednocześnie, a nie naprzemiennie.

Dlaczego 97 języków z płynnym przełączaniem ma znaczenie?

Gemini 3.8 Live obsługuje 97 języków i potrafi płynnie przełączać się między nimi w ramach jednej rozmowy. Logan Kilpatrick z Google potwierdził to bezpośrednio na X, dodając, że modele oferują „frontier price + performance” oraz asynchroniczne wywołania narzędzi. Dla aplikacji głosowych działających międzynarodowo oznacza to jedną integrację zamiast osobnych konfiguracji językowych.

Przełączanie języka w trakcie rozmowy ma praktyczne konsekwencje. Na przykład użytkownik może zacząć po polsku, przejść na angielski, a model kontynuuje bez resetowania kontekstu. Precyzyjne porównanie z konkurencją wykracza poza potwierdzone informacje z oficjalnych źródeł, dlatego lepiej trzymać się faktów: 97 języków, jedno wywołanie, płynne przełączanie.

Jak działają asynchroniczne wywołania narzędzi w tle?

Gemini 3.8 Live wykonuje wywołania narzędzi asynchronicznie, w tle rozmowy. Model może zatem „załatwiać zadania” podczas trwającej konwersacji, nie przerywając jej – tak opisują to Google DeepMind oraz Logan Kilpatrick, który wymienia async tool calls wprost w ogłoszeniu na X. W praktyce oznacza to rozdzielenie warstwy komunikacji z użytkownikiem od warstwy wykonywania operacji.

Asynchroniczność zmienia sposób projektowania aplikacji głosowych. Zamiast blokować rozmowę do czasu zakończenia operacji, deweloper może pozwolić modelowi na równoległą pracę. W rezultacie rozmowa zachowuje płynność, a zadania wykonują się niezależnie.

Deweloperzy znajdą szczegóły budowy aplikacji real-time voice w źródło albo z robotyką w Gemini Robotics-ER 1.6.

Choć sources nie dokumentują krok po kroku implementacji async tool calls w API, sam fakt ich obecności w warstwie konwersacyjnej wskazuje kierunek: agenci głosowi, którzy działają, a nie tylko odpowiadają. To spójne z oceną 1950.ai, gdzie nowe modele audio opisano jako technologię napędzającą kolejną falę agentów AI.

Dla kogo i gdzie dostępne są nowe modele?

Zestaw docelowy użytkowników widać z komunikacji Google. Z jednej strony to twórcy aplikacji głosowych w czasie rzeczywistym, o czym pisze poradnik dla deweloperów na blogu Google. Z drugiej strony to zwykli użytkownicy platform konsumenckich, dla których model działa jako konwersacyjny asystent głosowy. Co więcej, doniesienia progressiverobot.com wskazują, że nazwy obu modeli pojawiły się wcześniej na stronie quota Google Cloud, co zdradzało przygotowania do wdrożenia po stronie chmurowej.

Dla dewelopera oznacza to konkretną rzecz: jedno API, dwa warianty do wyboru, przy czym wybór sprowadza się do decyzji, czy dana aplikacja potrzebuje rozumowania w tle, czy wystarczy podstawowa konwersacja z async tool calls.

aivy.com.au podaje podobnie: modele trafiły na szczyt benchmarków mowy przy jednoczesnej obsłudze 97 języków w jednym wywołaniu. Sam ranking pokazuje jakość end-to-end, czyli to, co słyszy użytkownik, a nie wyłącznie składową rozpoznawania.

Trzeba jednak zaznaczyć granice tych danych. Źródła nie dokumentują metodyki pomiaru ani pełnej tabeli wyników konkurencji, więc precyzyjne porównanie punktowe z innymi modelami wykracza poza potwierdzone fakty. Pewne jest natomiast, że Google zaprezentowało modele jako SOTA live audio, a niezależny ranking to w tym wypadku potwierdza. Dla dewelopera oceniającego technologię głosową taki wynik jest sygnałem, że jakość audio nie będzie wąskim gardłem aplikacji.

Jak Gemini 3.8 Live wpisuje się w rodzinę modeli Audio?

Gemini 3.8 Live rozszerza rodzinę Gemini Audio poza transkrypcję, przenosząc ją w stronę pełnej konwersacji głosowej. Dotychczas rodzina obejmowała modele skupione na przetwarzaniu mowy na tekst, na przykład Gemini 3.5 Transcribe, o którym mowa w deweloperskim poradniku Google. Nowy model dodaje do tego warstwę dialogu w czasie niemal rzeczywistym.

Rozpiętość rodziny po premierze wygląda więc następująco:

  • Gemini 3.
  • Gemini 3.5 Transcribe – transkrypcja mowy dla deweloperów
  • Wsparcie budowania aplikacji real-time voice przez oficjalny poradnik Google dla twórców

Z kolei wersja Extended Thinking pokazuje, że Google rozdziela w rodzinie dwa obciążenia: samą rozmowę oraz cięższe przetwarzanie poznawcze. Taka struktura przypomina podejście znane z tekstu w rodzinie Gemini, gdzie źródło wprowadzał natywny multimodalny reasoning.

Konkurencyjnie oznacza to nacisk na trzy osie naraz: jakość mowy, wielojęzyczność oraz wykonywanie zadań w tle. Logan Kilpatrick podkreślał „frontier price + performance”, czyli sugerowaną konkurencyjność cenową względem wydajności. Źródła nie podają however szczegółowego zestawienia funkcji ChatGPT czy Claude w trybie głosowym, więc nie da się rzetelnie wskazać, kto ma przewagę w której kategorii – poza samym wynikiem rankingowym.

Wobec tego realna zmiana jest strukturalna: dotychczas dyskusja o agentach tekstowych toczyła się między tymi trzema graczami, o czym pisaliśmy chociażby przy okazji zwycięstwa Kimi K2.6 nad Claude, GPT-5.5 i Gemini.

Często zadawane pytania

Czym różni się Gemini 3.8 Live od Gemini 3.8 Live Extended Thinking?

Gemini 3.8 Live to podstawowy wariant: konwersacja głosowa niemal real-time, 97 języków z płynnym przełączaniem oraz asynchroniczne wywołania narzędzi. Oba warianty zadebiutowały tego samego dnia, 15 września 2026 roku.

W ilu językach mówi Gemini 3.8 Live?

Model obsługuje 97 języków, co Logan Kilpatrick potwierdził w ogłoszeniu na X. Co więcej, model potrafi płynnie przełączać się między językami w ramach jednej rozmowy i jednego wywołania API. Źródła nie opisują pełnej listy języków ani jakości per język, więc te szczegóły pozostają niepotwierdzone.

Gdzie można korzystać z nowych modeli?

Nazwy obu wariantów pojawiły się również na stronie quota Google Cloud, co wskazuje na integrację z ekosystemem chmurowym firmy.

Czy modele dostępne są dla deweloperów przez API?

Tak. Google udostępniło oba modele w deweloperskim API i opublikowało poradnik „Build real-time voice applications with Gemini 3.8 Live and 3.5 Transcribe”, opisujący budowę aplikacji głosowych w czasie rzeczywistym.

Podsumowanie

Kilka wniosków na koniec. Po pierwsze, Google DeepMind wprowadziło 15 września 2026 roku dwa modele audio zaprojektowane pod pełną konwersację głosową, a nie tylko transkrypcję. Po drugie, wersja Extended Thinking rozumuje w tle, podczas gdy rozmowa toczy się dalej – mowa i myślenie działają równolegle. Po trzecie, 97 języków z płynnym przełączaniem w jednym wywołaniu upraszcza budowę aplikacji międzynarodowych.

Jeśli budujesz aplikacje głosowe albo śledzisz rywalizację największych laboratoriów AI, sprawdź poradnik deweloperski Google i przetestuj oba warianty w praktyce. Warto też śledzić blog gikiewicz.eu, gdzie opisujemy kolejne elementy ekosystemu Gemini – od Gemini 3.8 Flash i 3.8 Flash Cyber po robotykę w Gemini Robotics-ER 1.6 i Gemini Robotics 2.