whynotAI Lab

DeepSeek-V4-Flash-Vision-Exp — новый мультимодальный ИИ от DeepSeek

Опубликовано Sep 1, 20262 мин чтенияНачальный

Что произошло

Китайская компания DeepSeek представила экспериментальную версию своей мультимодальной модели DeepSeek-V4-Flash-Vision-Exp. Это первая модель в линейке DeepSeek-V4, которая научилась работать не только с текстом, но и с изображениями.

Модель построена на архитектуре DeepSeek-V4-Flash с добавлением визуальных модулей. После дополнительного обучения она приобрела способность понимать изображения, сохраняя при этом высокую производительность в чисто текстовых задачах.

Детали

DeepSeek-V4-Flash-Vision-Exp демонстрирует впечатляющие результаты:

  • На мультимодальных бенчмарках (ApexBench, Agents' Last Exam) показывает улучшение на 10+ пунктов по сравнению с текстовой версией
  • В текстовых задачах (Terminal Bench 2.1, DeepSWE) сохраняет уровень качества предыдущей версии
  • Размер модели — 305 миллиардов параметров
  • Поддерживает различные форматы ввода, включая OpenAI-стиль и компактную TXT-нотацию

«Это наш первый эксперимент с мультимодальностью в рамках DeepSeek-V4», — отмечают разработчики.

Технические особенности:

  • Использует технологию DFlash attention и MoE (Mixture of Experts)
  • Поддерживает 8-битную и fp8-точность
  • Доступна для локального развёртывания через vLLM, SGLang и другие инструменты

Почему это важно

Появление DeepSeek-V4-Flash-Vision-Exp показывает, что китайские разработчики активно работают над мультимодальными ИИ, не уступая западным аналогам. Для практиков это означает:

  1. Доступ к мощной open-source модели для экспериментов с мультимодальностью
  2. Возможность создавать агентов, понимающих и текст, и изображения
  3. Альтернативу коммерческим решениям вроде GPT-4 Vision
Для экспериментов

Модель доступна на Hugging Face с открытой лицензией MIT, что делает её привлекательной для исследований и коммерческих проектов.

Что дальше

DeepSeek-V4-Flash-Vision-Exp пока остаётся экспериментальной, но уже демонстрирует потенциал китайских разработчиков в области мультимодального ИИ. В ближайшее время стоит ожидать:

  • Улучшения качества работы с изображениями
  • Появления более компактных версий модели
  • Интеграции с популярными фреймворками для ИИ-разработчиков

Для тех, кто хочет попробовать модель в деле, уже сейчас доступны варианты развёртывания через vLLM, SGLang и Docker, что упрощает интеграцию в существующие проекты.

Это разбор
Самостоятельный разбор новости. Оригинал на huggingface.co — по ссылке ниже.

Источники

Белая ракета с лаймовым огнём

Научись использовать Claude и Codex в своих проектах и бизнесе и стань в 10 раз эффективнее

Без опыта и без кода. Первого агента соберёшь за вечер, дальше он работает на тебя: клиенты, продажи, рутина.

Было полезно?