Nowości

Google DeepMind pokazuje D4RT, model do rekonstrukcji scen 4D w kilka sekund

BadaniaPatryk Raba
Fot. Gciriani, Wikimedia Commons (CC BY-SA 4.0)

Google DeepMind opisało D4RT, jeden model AI, który z filmu 2D odtwarza pełną scenę 3D w ruchu i przewiduje trajektorie obiektów nawet 300 razy szybciej niż dotychczasowe metody.

Spis treści
  1. Jeden model zamiast trzech
  2. Co potrafi model
  3. Zastosowania w robotyce i AR
  4. Dlaczego szybkość ma znaczenie

Google DeepMind przedstawiło D4RT, model sztucznej inteligencji, który z pojedynczego nagrania wideo odtwarza pełną scenę trójwymiarową rozwijającą się w czasie, łącząc w jednym systemie zadania, do których dotąd potrzeba było osobnych modeli. Firma twierdzi, że nowe podejście przetwarza materiał nawet 300 razy szybciej niż wcześniejsze metody.

Jeden model zamiast trzech

Do tej pory odtworzenie dynamicznej sceny z filmu wymagało osobnych modeli do śledzenia punktów, rekonstrukcji chmury punktów i estymacji pozycji kamery, uruchamianych jeden po drugim. D4RT łączy te trzy zadania w jednym transformerze typu koder-dekoder, który raz przetwarza wideo, a potem odpowiada na dowolne pytania o położenie pikseli w przestrzeni i czasie.

Koder buduje skompresowaną reprezentację geometrii sceny i ruchu na podstawie całego nagrania. Dekoder odpytuje tę reprezentację równolegle, obsługując tysiące zapytań naraz na nowoczesnym sprzęcie AI, zamiast przetwarzać je sekwencyjnie, jak robiły to poprzednie podejścia.

Where is a given pixel from the video located in 3D space at an arbitrary time, as viewed from a chosen camera? - opis mechanizmu zapytań D4RT, blog Google DeepMind

Co potrafi model

D4RT realizuje trzy funkcje jednocześnie. Śledzi trójwymiarowe trajektorie pikseli w czasie, w tym w momentach, gdy dany obiekt znika z pola widzenia kamery. Odtwarza pełną strukturę chmury punktów sceny bez potrzeby osobnego szacowania parametrów kamery. Oraz rekonstruuje trajektorię samej kamery, generując migawki 3D z różnych punktów widzenia.

W testach na zbiorze MPI Sintel model osiągnął wynik wierności odwzorowania 3D na poziomie 1,091, wyprzedzając model pi3 (0,861) i SpatialTrackerV2 (0,625). Przy śledzeniu punktów na zbiorze Aria Digital Twin D4RT uzyskał wynik 1,904 wobec 1,762 dla SpatialTrackerV2. Przy estymacji pozycji kamery na zbiorze RE10k model osiągnął wskaźnik Pose AUC na poziomie 0,835, również powyżej wyniku pi3 (0,787).

Zastosowania w robotyce i AR

Google DeepMind wskazuje robotykę i rzeczywistość rozszerzoną jako główne obszary zastosowań. W robotyce model ma dawać maszynom świadomość przestrzenną w środowiskach, gdzie ludzie i przedmioty poruszają się w sposób nieprzewidywalny. W AR chodzi o rozumienie geometrii bezpośrednio na urządzeniu, z niskim opóźnieniem, potrzebnym do umieszczania cyfrowych obiektów w realnej przestrzeni w czasie rzeczywistym.

Firma opisuje D4RT też jako krok w stronę modeli świata, czyli systemów AI mających rozumieć fizyczną rzeczywistość poprzez rozdzielenie ruchu kamery, ruchu obiektów i statycznej geometrii sceny. To kierunek, w który DeepMind inwestuje równolegle z innymi projektami dotyczącymi widzenia komputerowego i modeli wideo jako reprezentacji świata.

Dlaczego szybkość ma znaczenie

Dotychczasowe pipeline'y łączące osobne modele do śledzenia, rekonstrukcji i estymacji kamery były nie tylko wolniejsze, ale i bardziej podatne na błędy kumulujące się między etapami. Ujednolicenie tych zadań w jednym transformerze eliminuje część tych błędów, a jednoczesne przetwarzanie zapytań na akceleratorach AI daje przyspieszenie liczone w rzędach wielkości, a nie w procentach.

Dla zastosowań czasu rzeczywistego, jak nawigacja robota czy nakładki AR na smartfonie, różnica między dziesięcioma minutami przetwarzania a pięcioma sekundami decyduje o tym, czy technologia w ogóle nadaje się do wdrożenia poza laboratorium. Publikacja techniczna trafiła na arXiv, a projekt ma własną stronę z materiałami, co sugeruje, że DeepMind liczy na szybkie przejęcie architektury przez społeczność badawczą przed prezentacją na CVPR 2026.

Udostępnij: