Что произошло
Команда LiquidAI представила новую версию своей мультимодальной модели LFM2.5-VL-3B, которая понимает одновременно изображения и текст. Главное преимущество — возможность эффективно работать на обычных устройствах, включая смартфоны и ноутбуки, без мощных серверов.
Детали
Модель объединяет:
- Визуальный кодировщик SigLIP2 на 400 млн параметров
- Текстовую модель LFM2.5-2.6B
Ключевые улучшения:
- Работа с интерфейсами: лучше понимает элементы экранов (десктоп, мобильные, веб)
- Граундинг: точнее находит объекты по текстовым запросам
- Мультиизображения: улучшена обработка нескольких изображений сразу
- Вызов функций: модель лучше выполняет действия по запросу
На MacBook M5 Max модель обрабатывает 228 токенов в секунду, а на флагманском смартфоне — около 20 токенов/с.
Почему это важно
LFM2.5-VL-3B открывает новые возможности для:
- Локальных приложений с анализом изображений
- Быстрой обработки документов и скриншотов
- Создания ассистентов, работающих без интернета
«Это наша самая способная модель, которую можно запустить на собственном железе» — отмечают разработчики.
Что дальше
Модель уже доступна на Hugging Face. Разработчики предлагают:
- Тестировать демо-версию в браузере
- Адаптировать модель под конкретные задачи
- Использовать в локальных приложениях
Модель особенно полезна для задач анализа интерфейсов, документов и мультимодальных запросов, где важна скорость работы без облачных сервисов.
Источники
- Оригинал: huggingface.co — © huggingface.co