Nowości
Szefowie modeli wideo Google DeepMind: to brakujące ogniwo do AGI

Liderzy modeli generatywnych Google DeepMind twierdzą, że modele wideo, a nie tylko język, są niezbędnym elementem do zbudowania AGI porównywalnego z człowiekiem.
Spis treści
Dumitru Erhan, szef prac nad modelami wideo w Google DeepMind, i Shane Gu, odpowiedzialny za Gemini RL i Omni Thinking, powiedzieli wprost: same modele językowe nie wystarczą, by zbudować sztuczną inteligencję ogólną. Ich zdaniem brakującym elementem są modele wideo, zdolne uczyć się fizyki i przyczynowości świata w sposób, którego tekst nigdy nie odda.
Co powiedzieli
Erhan porównał trajektorię rozwoju modeli wideo do tego, co wcześniej wydarzyło się z modelami językowymi. Jego zdaniem modele wideo przejdą podobną ścieżkę dojrzewania: będą systematycznie ograniczać halucynacje i z czasem staną się wiarygodnym modelem świata, na którym można oprzeć dalsze rozumowanie maszyny.
Video model to komplementarny model fundamentalny. Będzie podążać podobną ścieżką... bardzo się polepszy w redukcji halucynacji i stanie się bardzo niezawodnym world modelem - Dumitru Erhan, Google DeepMind
Gu poszedł dalej, nazywając model wideo modelem fundamentalnym, który jest absolutnie wymagany, jeśli celem jest AGI odpowiadające ludzkim zdolnościom poznawczym. W jego ujęciu sam język jako reprezentacja świata jest niewystarczający, bo nie oddaje ciągłości fizycznej, przestrzennej i czasowej, w jakiej faktycznie funkcjonują ludzie i maszyny działające w realnym środowisku.
World model zamiast czystej generacji obrazu
Argument DeepMind wpisuje się w szerszą debatę toczącą się w branży od miesięcy. Badacze koncernu twierdzą, że dzisiejsze generatory wideo już zawierają w sobie rodzaj uniwersalnego modelu świata, którego środowisko badające widzenie komputerowe poszukiwało od lat - zamiast tylko generować klatki, uczą się reguł fizyki, ruchu i przyczynowości na podstawie miliardów sekund materiału.
World modele mają znaczenie praktyczne wykraczające poza samo tworzenie filmów. Pozwalają trenować agentów AI w praktycznie nieograniczonym środowisku symulacyjnym, bez konieczności zbierania kosztownych danych z realnego świata. To dokładnie ten sam kierunek, w którym DeepMind rozwija już rodzinę modeli Genie, budujących interaktywne, generowane w czasie rzeczywistym środowiska 3D.
Konkurencja i inne głosy
Nie wszyscy w branży podzielają ten pogląd. Yann LeCun, główny naukowiec Meta AI, od dawna twierdzi, że generatywne modele wideo predykcyjne w pikselach to ślepy zaułek na drodze do prawdziwej inteligencji maszynowej, i promuje alternatywne podejście oparte na architekturze JEPA, uczącej się reprezentacji abstrakcyjnych zamiast przewidywania kolejnych klatek.
Spór ten nie jest czysto akademicki. Od odpowiedzi na pytanie, czy wideo faktycznie jest brakującym ogniwem, zależy, gdzie największe laboratoria AI skierują kolejne miliardy dolarów inwestycji w infrastrukturę i talenty. Google DeepMind, OpenAI z linią Sora oraz chińscy konkurenci już teraz ścigają się w budowie coraz bardziej złożonych generatorów wideo, licząc, że to one, a nie kolejne duże modele językowe, przyniosą przełom w rozumowaniu maszyn o świecie fizycznym.
Co to znaczy dla praktyki
Erhan podał konkretny przykład zastosowania, które wykracza poza rozrywkę: tłumaczenie instrukcji produktu z angielskiego na rumuński z zachowaniem oryginalnego układu graficznego, czcionek i elementów wizualnych. To pokazuje, że modele wideo i obrazu w wersji DeepMind mają ambicje sięgać znacznie dalej niż generowanie klipów na social media - mają rozumieć układ, kontekst i znaczenie treści wizualnej.
Dla firm budujących produkty na bazie modeli Google oznacza to, że kolejne iteracje Gemini Omni i Veo prawdopodobnie będą oferować coraz szersze API dla deweloperów, łączące tekst, obraz, audio i wideo w jednym potoku generowania. Gemini Omni Flash API, o którym mówili rozmówcy, jest pierwszym krokiem w tym kierunku i już trafiło do części deweloperów.
Debata o roli wideo w drodze do AGI będzie się toczyć równolegle z twardą rywalizacją rynkową. To, czy stanowisko Erhana i Gu okaże się trafną prognozą, czy raczej uzasadnieniem strategicznych inwestycji DeepMind w tę konkretną gałąź modeli, pokaże dopiero to, jak szybko world modele oparte na wideo faktycznie zaczną redukować halucynacje i wspierać rozumowanie w realnych zastosowaniach.


