Что произошло
Компания Opper AI представила новый бенчмарк под названием jevman, где ИИ-модели играют в классическую аркаду Pac-Man. Шесть моделей прошли тест, каждая сыграла по 100 игр против стандартных призраков. Цель — оценить, насколько хорошо модели могут принимать решения в динамической среде.
Детали
Каждая игра длится до тех пор, пока модель не потеряет все три жизни или пока не истечёт лимит времени в 5 минут. На каждом перекрёстке модель получает состояние игры (лабиринт, точки, положение призраков) и должна выбрать направление движения. Если модель не отвечает за 2 секунды, используется резервное правило.
Результаты оцениваются по среднему количеству очков с учётом погрешности в 95%. Модели, чьи результаты находятся в пределах погрешности друг друга, считаются равными. Все игры записаны, что позволяет точно воспроизвести их для проверки.
«Любая модель, доступная через HTTP-эндпоинт, может участвовать в бенчмарке».
Почему это важно
jevman — это не просто развлечение. Бенчмарк позволяет оценить, насколько хорошо ИИ справляется с задачами, требующими быстрого принятия решений в динамической среде. Это особенно полезно для разработчиков, которые хотят протестировать свои модели в условиях, приближённых к реальным.
- Разместите модель на HTTP-эндпоинте.
- Запустите бенчмарк с помощью одной команды.
- Отправьте результаты через pull request.
Что дальше
Проект jevman открыт для участия, и разработчики могут подключить свои модели, чтобы сравнить их с уже представленными. Это отличная возможность для тестирования и улучшения моделей в условиях, которые требуют быстрого и точного принятия решений.
Источники
- Оригинал: opper.ai — © opper.ai
