Код к научной статье о нейросети, которая генерирует 3D-согласованное видео через сжатое геометрическое представление кадров.
Исследовательский проект Tencent соединяет модель Depth Anything 3, которая извлекает геометрию сцены, с видеогенератором: вместо кодирования кадра как обычной картинки система сжимает геометрические признаки в компактное представление, декодируемое сразу в цвет и геометрию. Это код к статье 2026 года со скриптами для обучения, оценки и запуска на своих данных.
Описание автора:[arxiv'26] GAE: Learning a Geometry-Native Latent Space for 3D-Consistent World Generation