Научная модель для описания сцен на фото с точной привязкой каждой фразы к области изображения.
PANORAMA — модель компьютерного зрения, которая для каждой фразы в описании сцены выбирает подходящую маску объекта из набора предложенных вариантов, включая случаи с несколькими объектами или их отсутствием. Вместе с моделью авторы выпустили размеченный людьми датасет PanoCaps с покрытием пикселей около 99% для обучения и проверки таких систем. Код и данные опубликованы на Hugging Face.
Описание автора:PANORAMA: Panoptic Grounded Captioning via Mask Proposal Selection