Что произошло
Google представила EmbeddingGemma 2 — обновлённую версию своей мультимодальной модели для создания эмбеддингов. В отличие от предыдущей версии, которая работала только с текстом, EmbeddingGemma 2 теперь поддерживает обработку изображений, аудио и видео. Модель оптимизирована для локального использования на устройствах с ограниченными ресурсами, таких как смартфоны.
Детали
EmbeddingGemma 2 основана на архитектуре Gemma 4 и содержит 740 миллионов параметров. Она поддерживает динамическое уменьшение размерности данных с помощью технологии Matryoshka Representation Learning (MRL), что позволяет сократить использование памяти до 6 раз. Модель работает с контекстным окном в 8 тысяч токенов, что позволяет обрабатывать до 5,5 минут аудио или 29 изображений.
«EmbeddingGemma 2 задаёт новый стандарт качества для моделей с менее чем миллиардом параметров», — отмечают разработчики.
Почему это важно
EmbeddingGemma 2 позволяет разработчикам создавать приложения с локальной обработкой данных, что обеспечивает конфиденциальность и снижает задержки. Модель особенно полезна для задач семантического поиска, классификации и прогнозирования на устройствах с ограниченными ресурсами.
Что дальше
Google планирует расширить поддержку EmbeddingGemma 2, включая интеграцию с платформой Gemini Enterprise Agent Platform. Разработчики могут уже сейчас начать использовать модель через Hugging Face и Kaggle, а также оптимизировать её для своих задач с помощью инструментов, таких как transformers.js и WebGPU.
Для экономии памяти используйте динамическое уменьшение размерности данных с помощью MRL.
Источники
- Оригинал: blog.google — © blog.google
