Модель компьютерного зрения, которая по картинке и вопросу выдаёт калиброванный типизированный ответ без генерации текста.
Laya Vision принимает изображение, контекст и набор заранее заданных вопросов, а отвечает вариантом из списка, вероятностью да/нет или оценкой по заданной шкале — без генерации свободного текста, за один проход модели. Это форк проекта Laya с заменой текстового энкодера на компактную визуально-языковую модель SmolVLM-256M; доступна демонстрация в виде онлайн-пространства и установка через pip.
Описание автора:Image inputs for Laya: calibrated, non-generative typed decisions over images + text (SmolVLM-256M backbone)
Python★ 27создан 19 сентября 2026форков 5Apache-2.0