niedziela, 6 września 2026

Nowości

Google udostępnia DiffusionGemma, model tekstowy generujący cztery razy szybciej

ModelePatryk Raba
Google udostępnia DiffusionGemma, model tekstowy generujący cztery razy szybciej
Fot. Google DeepMind, Wikimedia Commons (Apache License 2.0)

Google DeepMind wypuściło DiffusionGemma, eksperymentalny model open source, który zamiast pisać tekst token po tokenie generuje od razu bloki 256 tokenów. Na karcie H100 osiąga ponad 1000 tokenów na sekundę, ale firma sama przyznaje, że jakość odpowiedzi jest niższa niż w standardowej Gemmie 4.

Spis treści
  1. Jak działa dyfuzja tekstu
  2. Cena za szybkość
  3. Sprzęt i dostępność
  4. Co to oznacza dla deweloperów

Google DeepMind opublikowało DiffusionGemma, otwarty model językowy, który zrywa z dominującym od lat sposobem generowania tekstu. Zamiast pisać odpowiedź token po tokenie, model tworzy od razu cały blok tekstu i dopracowuje go w kolejnych przebiegach, co pozwala mu generować odpowiedzi nawet cztery razy szybciej niż standardowe modele autoregresywne.

Model bazuje na architekturze Gemma 4 w wariancie Mixture of Experts, ale zamiast klasycznego mechanizmu autoregresywnego wykorzystuje dyfuzję dyskretną. Proces generowania zaczyna się od bloku 256 losowych tokenów zastępczych, przypominających szum. W kolejnych przebiegach model ocenia każdą pozycję w bloku jednocześnie, zatwierdza te, co do których ma największą pewność, a niepewne miejsca losuje ponownie i poddaje kolejnej rundzie oceny.

Jak działa dyfuzja tekstu

Klasyczne duże modele językowe, takie jak GPT czy standardowa Gemma, generują tekst sekwencyjnie, słowo po słowie, opierając każdy kolejny token na wszystkich poprzednich. DiffusionGemma odwraca tę logikę i wykorzystuje uwagę dwukierunkową, dzięki czemu każda pozycja w generowanym bloku może uwzględniać wszystkie inne pozycje naraz, nie tylko te, które pojawiły się wcześniej.

Google podkreśla, że takie podejście sprawdza się szczególnie dobrze przy zadaniach nieliniowych, na przykład uzupełnianiu fragmentów kodu w środku istniejącego pliku czy formatowaniu tekstu w markdownie, gdzie kolejna część treści zależy nie tylko od tego, co było wcześniej, ale też od tego, co ma nastąpić później.

Cena za szybkość

Firma nie ukrywa, że przyspieszenie ma swoją cenę. W oficjalnym ogłoszeniu Google wprost przyznaje, że ogólna jakość odpowiedzi DiffusionGemma jest niższa niż w standardowej, autoregresywnej Gemmie 4, i rekomenduje ten drugi model do zastosowań wymagających maksymalnej precyzji.

Ogólna jakość wyjścia DiffusionGemma jest niższa niż standardowy Gemma 4 - komunikat Google DeepMind przy premierze modelu

DiffusionGemma ma sens przede wszystkim tam, gdzie liczy się natychmiastowa reakcja modelu, a nie maksymalna jakość każdej odpowiedzi. Google wskazuje zastosowania takie jak edycja tekstu w czasie rzeczywistym, szybkie iterowanie nad szkicem czy praca z treściami o nieliniowej strukturze. Firma zaznacza też, że przyspieszenie najlepiej sprawdza się przy lokalnym wnioskowaniu i niskiej liczbie równoległych zapytań, a nie przy masowej obsłudze ruchu w chmurze.

Sprzęt i dostępność

Model trafił do sieci vLLM jako pierwszy model dyfuzyjny natywnie obsługiwany przez tę platformę serwującą. Testy w tym środowisku pokazały wydajność rzędu 1008 tokenów na sekundę na H100 w precyzji FP8 i 1288 tokenów na sekundę na nowszej karcie H200. Google zastrzega jednocześnie, że komputery Mac z procesorami Apple Silicon mogą nie osiągnąć podobnego przyspieszenia z uwagi na inny stosunek mocy obliczeniowej do przepustowości pamięci w architekturze zunifikowanej.

DiffusionGemma nie jest pierwszym komercyjnym modelem dyfuzyjnym do generowania tekstu, ale jest jak dotąd największym udostępnionym publicznie w tym podejściu. Wcześniej podobną technikę, choć na mniejszą skalę i skierowaną głównie do zadań programistycznych, zaprezentował startup Inception Labs ze swoim modelem Mercury Coder.

Co to oznacza dla deweloperów

Dla twórców aplikacji oznacza to nową opcję w portfolio otwartych modeli Google obok samej Gemmy 4, a nie jej zamiennik. Autorami modelu są badacze Google Brendan O'Donoghue i Sebastian Flennerhag, a udostępnienie wag na licencji Apache 2.0 pozwala każdemu pobrać i uruchomić model lokalnie, w tym na kartach konsumenckich klasy RTX 4090 i 5090, bez konieczności korzystania z płatnego API.

Dla polskich firm i twórców korzystających z otwartych modeli Google, takich jak wcześniejsze wersje Gemmy, DiffusionGemma to przede wszystkim ciekawy eksperyment techniczny do testowania w zastosowaniach, gdzie liczy się czas odpowiedzi, na przykład w interaktywnych narzędziach do edycji tekstu czy kodu działających lokalnie, a nie gotowy zamiennik do produkcyjnych wdrożeń wymagających najwyższej jakości generowanego tekstu.

Udostępnij: