Научный бенчмарк для сравнения методов кластеризации изображений с использованием моделей, понимающих текст и картинки.
VLM4Cluster объединяет в одном коде 16 методов кластеризации изображений — от классических до основанных на современных vision-language моделях — и тестирует их на 20 наборах данных по единым правилам. Оценка охватывает не только точность, но и устойчивость к помехам, работу на новых типах данных и затраты по времени и памяти. Инструмент предназначен для исследователей в области компьютерного зрения, которым нужно честно сравнить разные подходы к автоматической группировке изображений без размеченных категорий.
Описание автора:A unified benchmark for image clustering in the era of pre-trained vision-language models.