whynotAI Lab

Люди пропускают треть угроз при контроле за ИИ-агентами

Опубликовано Aug 7, 20262 мин чтенияНачальный

Что произошло

Масштабное исследование на 40 000 игровых сессий показало, как люди контролируют команды ИИ-агентов. В роли «последнего рубежа защиты» участники должны были быстро оценивать, безопасна ли очередная команда (например, git status или rm -rf). Результаты тревожные:

  • Средняя точность — всего 66.3% (каждую третью угрозу пропускали)
  • 32.9% сессий завершились с отрицательным счётом из-за ошибок
  • Лишь 20.8% игроков смогли поймать все угрозы, не блокируя при этом безопасные команды

Детали

Какие команды пропускают чаще всего

  • npm run analyze/setup/deploy — лидеры (52.5% пропусков). Проблема в том, что за безобидным названием скрипта может скрываться вредоносный код из package.json, который игроки часто не проверяют.

  • Доступ к конфигам (cat ~/.aws/credentials) — 35% пропусков

  • Утечка данных (curl к сторонним API) — 33.4%

«npm run build = выполнить произвольную shell-команду из package.json»

Эффект усталости

Точность падает к концу сессии на 15-20% — люди устают быть бдительными. Как отмечает Anthropic:

«Чем больше запросов видит пользователь, тем меньше внимания он уделяет каждому»

Ложные срабатывания

Безопасные команды тоже страдают:

  • npm config set registry — блокируют 59%
  • rm -rf dist/ — 45%
  • kill $(lsof -t -i:3000) — 43%

Почему это важно

  1. npm-скрипты — слепое пятно Даже когда вредоносный код виден в истории, две трети игроков всё равно одобряют npm run. Это системная уязвимость модели «одобряй команды».

  2. Контекст решает всё Например, cat ~/.zshrc одобряли 45.9% — если там нет секретов, это безопасно. Но ИИ не видит содержимое файлов заранее.

  3. Компромисс безопасности и скорости Чем больше ложных тревог (безопасных команд, которые блокируют), тем выше шанс, что пользователь начнёт автоматически одобрять всё подряд.

Что дальше

  • Песочницы — изоляция среды выполнения ИИ-агентов
  • Разделение секретов — чтобы даже при утечке доступ был ограничен
  • Умные фильтры — как Auto Mode у Anthropic, но они не идеальны
Для разработчиков

Проверяйте не только команды, но и изменения в package.json и зависимостях — именно там часто скрываются угрозы.

Это разбор
Самостоятельный разбор новости. Оригинал на scalex.dev — по ссылке ниже.

Источники

Было полезно?