Что произошло
Китайская компания DeepSeek представила экспериментальную версию своей мультимодальной модели DeepSeek-V4-Flash-Vision-Exp. Это первая модель в линейке DeepSeek-V4, которая научилась работать не только с текстом, но и с изображениями.
Модель построена на архитектуре DeepSeek-V4-Flash с добавлением визуальных модулей. После дополнительного обучения она приобрела способность понимать изображения, сохраняя при этом высокую производительность в чисто текстовых задачах.
Детали
DeepSeek-V4-Flash-Vision-Exp демонстрирует впечатляющие результаты:
- На мультимодальных бенчмарках (ApexBench, Agents' Last Exam) показывает улучшение на 10+ пунктов по сравнению с текстовой версией
- В текстовых задачах (Terminal Bench 2.1, DeepSWE) сохраняет уровень качества предыдущей версии
- Размер модели — 305 миллиардов параметров
- Поддерживает различные форматы ввода, включая OpenAI-стиль и компактную TXT-нотацию
«Это наш первый эксперимент с мультимодальностью в рамках DeepSeek-V4», — отмечают разработчики.
Технические особенности:
- Использует технологию DFlash attention и MoE (Mixture of Experts)
- Поддерживает 8-битную и fp8-точность
- Доступна для локального развёртывания через vLLM, SGLang и другие инструменты
Почему это важно
Появление DeepSeek-V4-Flash-Vision-Exp показывает, что китайские разработчики активно работают над мультимодальными ИИ, не уступая западным аналогам. Для практиков это означает:
- Доступ к мощной open-source модели для экспериментов с мультимодальностью
- Возможность создавать агентов, понимающих и текст, и изображения
- Альтернативу коммерческим решениям вроде GPT-4 Vision
Модель доступна на Hugging Face с открытой лицензией MIT, что делает её привлекательной для исследований и коммерческих проектов.
Что дальше
DeepSeek-V4-Flash-Vision-Exp пока остаётся экспериментальной, но уже демонстрирует потенциал китайских разработчиков в области мультимодального ИИ. В ближайшее время стоит ожидать:
- Улучшения качества работы с изображениями
- Появления более компактных версий модели
- Интеграции с популярными фреймворками для ИИ-разработчиков
Для тех, кто хочет попробовать модель в деле, уже сейчас доступны варианты развёртывания через vLLM, SGLang и Docker, что упрощает интеграцию в существующие проекты.
Источники
- Оригинал: huggingface.co — © huggingface.co
