Исследовательский проект по обучению ИИ точнее понимать расположение объектов на изображениях.
GaugeVLM — научная разработка, которая учит модели, понимающие картинки и текст, точнее оценивать расстояния и направления между объектами в 3D-сценах. Метод специально создаёт контролируемые изменения объектов и ракурсов камеры, чтобы модель училась на конкретных ошибках измерения. Предназначен для исследователей в области компьютерного зрения, а не для конечных пользователей.
Описание автора:GaugeVLM: Structuring Spatial Supervision with Measured Geometric Interventions.