Что произошло
Команда Inco AI представила вторую версию своей технологии DFlash — системы параллельного прогнозирования текста для языковых моделей. Основное достижение: на 20% больше выходных токенов за каждый цикл проверки при увеличении задержки всего на 1%. На практике это означает ускорение генерации текста в 1.2-1.3 раза без потери качества.
Технология уже используется в популярных фреймворках для работы с ИИ (SGLang, vLLM, llama.cpp) и поддерживается такими компаниями, как NVIDIA, Red Hat и Xiaomi. Например, в SGLang с моделью Qwen3.8-27B скорость обработки увеличилась в 2.7-3.4 раза по сравнению с традиционным последовательным подходом.
Детали
DFlash работает по принципу «спекулятивного декодирования»: небольшая модель-драфтер предсказывает блок токенов параллельно, а основная модель затем проверяет весь блок за один проход. В отличие от классических подходов, где каждый следующий токен предсказывается последовательно, DFlash прогнозирует все позиции в блоке одновременно.
Нововведения DFlash 2:
-
Селектор путей: анализирует топ-16 кандидатов на каждой позиции и выбирает наиболее согласованные варианты. Как отмечают разработчики: «Правильные токены уже есть в списке кандидатов — нужно лишь выбрать верный путь».
-
Локальные свёртки: специальные двухточечные свёртки помогают модели учитывать локальные зависимости между соседними токенами, решая проблему «затухания суффикса» (снижения точности прогноза к концу блока).
Результаты на тестах:
- GSM8K: улучшение с 4.99 до 6.20 токенов за цикл
- HumanEval: с 5.43 до 6.28
- Средний прирост по всем тестам: 21%
Почему это важно
Для практиков, работающих с языковыми моделями, DFlash 2 означает:
- Экономию ресурсов: больше текста за те же вычислительные затраты
- Быструю интеграцию: технология уже доступна в популярных инструментах
- Масштабируемость: особенно ценно для длительных сессий работы ИИ-агентов
При работе с Qwen3.8-27B на Apple M5 Max с oMLX DFlash 2 показывает заметный прирост скорости при минимальном увеличении нагрузки на систему.
Что дальше
Разработчики видят потенциал для дальнейшего улучшения методов отбора кандидатов. Уже сейчас технология позволяет языковым моделям работать значительно быстрее, что особенно важно в эпоху ИИ-агентов, обрабатывающих большие объёмы текста.
Источники
- Оригинал: inco.ai — © inco.ai