Открытая реализация модели Waymo EMMA для беспилотного вождения на основе визуально-языковых моделей.
OpenEMMA — открытый аналог модели EMMA от Waymo для сквозного планирования движения автомобиля. Использует визуально-языковые модели вроде GPT-4 и LLaVA, объединяя текстовые данные и изображения с фронтальной камеры, чтобы предсказывать будущую траекторию автомобиля и объяснять принятые решения. Доступен как пакет для Python и рассчитан на исследователей беспилотного транспорта.
Описание автора:Autonomous driving project exploring VLM-based scene understanding, trajectory prediction, and efficient Vision-Language-Action models on the nuScenes dataset.