whynotAI Lab

LFM2.5-VL-3B: компактная модель для анализа изображений и текста

Опубликовано Aug 13, 20261 мин чтенияНачальный

Что произошло

Команда LiquidAI представила новую версию своей мультимодальной модели LFM2.5-VL-3B, которая понимает одновременно изображения и текст. Главное преимущество — возможность эффективно работать на обычных устройствах, включая смартфоны и ноутбуки, без мощных серверов.

Детали

Модель объединяет:

  • Визуальный кодировщик SigLIP2 на 400 млн параметров
  • Текстовую модель LFM2.5-2.6B

Ключевые улучшения:

  • Работа с интерфейсами: лучше понимает элементы экранов (десктоп, мобильные, веб)
  • Граундинг: точнее находит объекты по текстовым запросам
  • Мультиизображения: улучшена обработка нескольких изображений сразу
  • Вызов функций: модель лучше выполняет действия по запросу
Скорость работы

На MacBook M5 Max модель обрабатывает 228 токенов в секунду, а на флагманском смартфоне — около 20 токенов/с.

Почему это важно

LFM2.5-VL-3B открывает новые возможности для:

  • Локальных приложений с анализом изображений
  • Быстрой обработки документов и скриншотов
  • Создания ассистентов, работающих без интернета

«Это наша самая способная модель, которую можно запустить на собственном железе» — отмечают разработчики.

Что дальше

Модель уже доступна на Hugging Face. Разработчики предлагают:

  • Тестировать демо-версию в браузере
  • Адаптировать модель под конкретные задачи
  • Использовать в локальных приложениях
Для практиков

Модель особенно полезна для задач анализа интерфейсов, документов и мультимодальных запросов, где важна скорость работы без облачных сервисов.

Это разбор
Самостоятельный разбор новости. Оригинал на huggingface.co — по ссылке ниже.

Источники

Было полезно?