niedziela, 30 sierpnia 2026

Nowości

Google udostępnia Gemini Omni 1.1 Flash, model wydłuża filmy AI do 40 sekund

WideoPatryk Raba
Google udostępnia Gemini Omni 1.1 Flash, model wydłuża filmy AI do 40 sekund
Fot. Anthony Quintano, Wikimedia Commons (CC BY 2.0)
Spis treści
  1. Kontrola nad klatkami i referencjami
  2. Tańsze szkice, droższa finalna jakość
  3. Integracje z narzędziami kreatywnymi
  4. Ograniczenia i dostępność

Google udostępnił 27 sierpnia 2026 roku nową wersję swojego generatywnego modelu wideo, Gemini Omni 1.1 Flash. Aktualizacja daje twórcom i deweloperom znacznie więcej kontroli nad tym, jak powstają i jak są edytowane filmy tworzone przez sztuczną inteligencję, oraz trafia od razu do popularnych narzędzi kreatywnych, w tym Adobe Firefly i Figma Weave.

Najważniejszą zmianą w Gemini Omni 1.1 Flash jest sposób przedłużania scen. Wcześniejsza wersja modelu, generując kontynuację ujęcia, brała pod uwagę tylko ostatnią sekundę poprzedniego fragmentu, co często prowadziło do skoków w ruchu kamery, zmian oświetlenia czy niespójności postaci. Nowy model analizuje do 10 sekund wcześniejszego materiału, co według Google poprawia spójność wizualną i ciągłość narracji między kolejnymi fragmentami.

Kontrola nad klatkami i referencjami

Deweloperzy zyskali też możliwość precyzyjnego określania pierwszej i ostatniej klatki generowanego ujęcia za pomocą znaczników FIRST_FRAME i LAST_FRAME. Model wypełnia wtedy przestrzeń pomiędzy nimi płynnym przejściem, co ułatwia budowanie skomplikowanych ruchów kamery lub tworzenie pętli wideo, w których ostatnia klatka płynnie wraca do pierwszej.

Nowość to również obsługa materiałów referencyjnych: do generowania można teraz dołączyć maksymalnie trzy klipy wideo, każdy o długości do trzech sekund, co pomaga zachować spójność wyglądu postaci lub obiektu w kolejnych ujęciach. Ograniczeniem pozostaje brak możliwości wstawiania materiału w środku istniejącego klipu ani dopisywania go na początku, model umie jedynie kontynuować scenę od końca.

Tańsze szkice, droższa finalna jakość

Google wprowadził też tryb szkicowy w rozdzielczości 360p, przeznaczony do szybkiego testowania pomysłów przed wygenerowaniem finalnej wersji. Taki podgląd powstaje nawet o 60 procent szybciej niż standardowe wideo w 720p i kosztuje około jednej trzeciej tej ceny. Na drugim końcu skali stoi wyjście w 4K, uzyskiwane metodą podbijania rozdzielczości z materiału źródłowego, przeznaczone do produkcji gotowej do publikacji.

W API cena wejścia wynosi 1,50 dolara za milion tokenów, niezależnie od tego, czy to tekst, obraz, wideo czy dźwięk. Wyjście kosztuje 9 dolarów za milion tokenów tekstowych i 17,50 dolara za milion tokenów wideo, co w praktyce daje około 0,10 dolara za sekundę materiału w rozdzielczości 720p.

Integracje z narzędziami kreatywnymi

Nowy model trafił od razu do zewnętrznych platform kreatywnych. Adobe dodał go do Firefly, a Figma zintegrował go ze swoim narzędziem Weave. Runway włączył Gemini Omni 1.1 Flash do istniejących przepływów pracy opartych na promptach, obrazach i wideo, a firma GMI Cloud zapewnia scentralizowany dostęp do modelu twórcom korzystającym z jej infrastruktury.

Dzięki wydłużaniu scen, bogatszym materiałom referencyjnym i rozdzielczości 4K, Gemini Omni Flash pozwala zespołom przejść od generowania filmów do faktycznego reżyserowania nimi - Itay Schiff, dyrektor kreatywny Figma Weave
Ta niezawodność liczy się bardziej niż pojedyncza funkcja. Omni sprawiło, że wideo generowane przez AI stało się realną opcją dla segmentu twórców, którzy wcześniej nie mogli na nim polegać - Louisa Guo, wiceprezes ds. marketingu GMI Cloud

Ograniczenia i dostępność

Model nie obsługuje jeszcze instrukcji systemowych, kontroli temperatury generowania ani promptów negatywnych, a edycja ścieżki dźwiękowej pozostaje niedostępna. Pełne wsparcie językowe dotyczy na razie tylko angielskiego, a materiałów źródłowych nie da się pobierać bezpośrednio z adresów YouTube. Dla twórców indywidualnych i firm oznacza to, że Gemini Omni 1.1 Flash sprawdzi się głównie w krótkich formach promocyjnych i social media, a nie w pełnometrażowej produkcji z udźwiękowieniem.

Dla polskich agencji reklamowych i twórców treści wideo aktualizacja oznacza tańsze i szybsze prototypowanie kampanii, dzięki trybowi szkicowemu w 360p, zanim padnie decyzja o wygenerowaniu drogiej wersji w pełnej rozdzielczości. Integracja z Adobe Firefly i Figma Weave, narzędziami już szeroko używanymi w polskich studiach projektowych, może przyspieszyć adopcję tej technologii w lokalnych zespołach kreatywnych.

Udostępnij: