Что произошло
DeepSeek представила новую модель DeepSeek-V4.1-Flash, которая значительно улучшает эффективность обработки данных благодаря инновационным методам сжатия кэша KV. Эта модель является частью семейства мультимодальных моделей, способных обрабатывать как текст, так и изображения.
Детали
DeepSeek-V4.1-Flash использует архитектуру Causal Encoder-Decoder (CED), что позволяет активировать только 8 миллиардов параметров на токен во время предварительного заполнения и 16 миллиардов во время декодирования. Это существенно снижает затраты на обработку данных. Модель также использует Compressed Sparse Attention 2 (CSA2), что уменьшает размер глобального кэша KV до 890 байт на токен.
DeepSeek-V4.1-Flash поддерживает контекст до 1 миллиона токенов, что делает её идеальной для сложных задач, таких как обработка больших документов или сложных запросов.
Почему это важно
Эта модель устанавливает новые стандарты в эффективности обработки данных, что особенно важно для задач, требующих больших объемов информации. Уменьшение размера кэша KV позволяет снизить затраты на хранение и обработку данных, что делает модель более доступной для широкого круга пользователей.
Что дальше
С выпуском DeepSeek-V4.1-Flash ожидается дальнейшее развитие технологий сжатия данных и улучшение эффективности обработки информации. Это открывает новые возможности для использования ИИ в различных областях, от обработки естественного языка до анализа изображений.
Источники
- Оригинал: huggingface.co — © huggingface.co
