Модель для исследователей ИИ, которая по действиям, картинкам и истории наблюдений создаёт видео и звук от первого лица, будто вы сами гуляете по локации.
XGEN-JING — модель для генерации интерактивного опыта от первого лица: она принимает управление камерой, референсные изображения и текстовые команды и на их основе создаёт видео вместе со звуком — для навигации по локациям, взаимодействия с предметами и диалогов с персонажами. В этом релизе доступен код для запуска и примеры, для работы нужно шесть видеокарт H100. Более быстрая причинная версия модели и технический отчёт пока не вышли.