Семейство моделей от команды Tencent WeChat Vision для превращения текста, изображений и видео в единые эмбеддинги для поиска.
WeMM-Embedding — три модели (2, 4 и 9 миллиардов параметров) от команды WeChat Vision компании Tencent, которые создают унифицированные векторные представления (эмбеддинги) для текста, изображений, видео и документов. Такие представления используются для поиска похожего контента и мультимодального понимания — например, чтобы находить изображения по текстовому запросу. Модели поддерживают разные размеры выходного вектора и доступны через Hugging Face.
Описание автора:WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.