Что произошло
Команда WeChat Vision из Tencent представила семейство универсальных мультимодальных моделей WeMM-Embedding. Эти модели предназначены для обработки и анализа текста, изображений, видео и документов, а также их комбинаций. Основная цель — создание единого представления данных для задач мультимодального поиска и анализа.
Детали
WeMM-Embedding включает несколько моделей разного размера: 2B, 4B и 9B параметров. Каждая из них поддерживает обработку текста, изображений, видео и документов. Модели используют специальный токен <embedding>, который позволяет получать векторные представления данных с последующей нормализацией. Векторы могут быть усечены до разных размеров (например, 64, 128, 256 и т.д.) для оптимизации производительности.
"Мы достигли лучших результатов на множестве тестовых задач, включая обработку изображений и видео", — отмечают разработчики.
Модели тестировались на наборах данных MMEB-v2 и MMEB-v3, где показали высокие результаты. Например, модель WeMM-Embedding-9B достигла 80,6% точности на MMEB-v2 и 59,5% на MMEB-v3.
Почему это важно
WeMM-Embedding открывает новые возможности для мультимодального анализа данных. Это особенно полезно для задач поиска, где нужно учитывать разные типы информации — текст, изображения и видео. Модели могут быть использованы в приложениях для рекомендательных систем, поиска по мультимедиа и анализа контента.
Для работы с моделями WeMM-Embedding можно использовать библиотеки Hugging Face и Sentence Transformers.
Что дальше
Разработчики планируют расширить функциональность моделей, добавив поддержку аудио и других типов данных. Также ожидается дальнейшая оптимизация производительности и интеграция с популярными платформами для машинного обучения.
Источники
- Оригинал: github.com — © github.com
