Что произошло
NVIDIA представила Cosmos 3 Edge — компактную модель с 4 миллиардами параметров, предназначенную для работы на граничных устройствах (edge computing). Это не просто очередной ИИ для анализа изображений, а полноценная «модель мира», которая помогает роботам и системам компьютерного зрения понимать окружение, прогнозировать изменения и принимать решения в реальном времени.
Модель уже доступна в репозитории Hugging Face и оптимизирована для работы на NVIDIA Jetson, RTX PRO и других граничных устройствах компании. Особенность — способность обрабатывать 640×360 наблюдений и генерировать 32 действия за один проход при частоте 15 Гц.
Детали
Как устроена модель
Cosmos 3 Edge объединяет два типа трансформеров:
- Авторегрессивную башню — анализирует изображения и текст для понимания сцены
- Диффузионную башню — работает с видео, аудио и действиями для прогнозирования и генерации
Обе башни используют общие слои внимания, что позволяет согласовывать информацию между разными модальностями. Например, модель может сначала проанализировать сцену, а затем спрогнозировать, что произойдёт после определённого действия.
Представление действий
Модель кодирует действия как геометрические векторы, включающие:
- Перемещение
- Вращение
- Состояние манипулятора
Это создаёт прямую связь между пикселями на изображении и физическими действиями. Например, робот не просто «видит» чашку, но понимает, как её взять.
Модель уже тестируется в сценариях типа «возьми банан и положи на тарелку» с точностью, достаточной для реальных промышленных задач.
Почему это важно
- Работа на устройстве — не требует облака, что критично для заводов и больниц
- Экономия памяти — при 4B параметрах превосходит аналоги по скорости и точности
- Универсальность — одна модель заменяет несколько узкоспециализированных решений
- Открытая платформа — можно дообучать под конкретные задачи
«Cosmos 3 Edge соединяет понимание, прогнозирование и действие через единое представление мира» — отмечают разработчики NVIDIA.
Что дальше
NVIDIA планирует улучшать модель в трёх направлениях:
- Более точная генерация интерактивных сцен
- Оптимизация для автономного транспорта
- Ускорение вывода на различном железе
Уже сейчас доступны предобученные версии для конкретных задач (например, DROID для манипуляций) и инструменты для дообучения на небольших кластерах H100/DGX.
Источники
- Оригинал: huggingface.co — © huggingface.co