Что произошло
Масштабное исследование на 40 000 игровых сессий показало, как люди контролируют команды ИИ-агентов. В роли «последнего рубежа защиты» участники должны были быстро оценивать, безопасна ли очередная команда (например, git status или rm -rf). Результаты тревожные:
- Средняя точность — всего 66.3% (каждую третью угрозу пропускали)
- 32.9% сессий завершились с отрицательным счётом из-за ошибок
- Лишь 20.8% игроков смогли поймать все угрозы, не блокируя при этом безопасные команды
Это игровые данные, где угроз было 34% — в реальности их меньше. Но тренды показательные.
Детали
Какие команды пропускают чаще всего
-
npm run analyze/setup/deploy — лидеры (52.5% пропусков). Проблема в том, что за безобидным названием скрипта может скрываться вредоносный код из package.json, который игроки часто не проверяют.
-
Доступ к конфигам (cat ~/.aws/credentials) — 35% пропусков
-
Утечка данных (curl к сторонним API) — 33.4%
«npm run build = выполнить произвольную shell-команду из package.json»
Эффект усталости
Точность падает к концу сессии на 15-20% — люди устают быть бдительными. Как отмечает Anthropic:
«Чем больше запросов видит пользователь, тем меньше внимания он уделяет каждому»
Ложные срабатывания
Безопасные команды тоже страдают:
- npm config set registry — блокируют 59%
- rm -rf dist/ — 45%
- kill $(lsof -t -i:3000) — 43%
Почему это важно
-
npm-скрипты — слепое пятно Даже когда вредоносный код виден в истории, две трети игроков всё равно одобряют npm run. Это системная уязвимость модели «одобряй команды».
-
Контекст решает всё Например, cat ~/.zshrc одобряли 45.9% — если там нет секретов, это безопасно. Но ИИ не видит содержимое файлов заранее.
-
Компромисс безопасности и скорости Чем больше ложных тревог (безопасных команд, которые блокируют), тем выше шанс, что пользователь начнёт автоматически одобрять всё подряд.
Что дальше
- Песочницы — изоляция среды выполнения ИИ-агентов
- Разделение секретов — чтобы даже при утечке доступ был ограничен
- Умные фильтры — как Auto Mode у Anthropic, но они не идеальны
Проверяйте не только команды, но и изменения в package.json и зависимостях — именно там часто скрываются угрозы.
Источники
- Оригинал: scalex.dev — © scalex.dev