whynotAI Lab

Как ИИ справляется с реальными задачами разработчиков

Опубликовано Sep 13, 20262 мин чтенияНачальный

Что произошло

Specific Labs представили Real-SWE — принципиально новый бенчмарк для оценки ИИ-моделей в условиях, максимально приближенных к реальной работе разработчиков. В отличие от синтетических тестов, здесь используются:

  • Настоящие кодбазы компаний (финтех, SaaS-платформы)
  • Задачи с бизнес-последствиями (начисление налогов, миграции данных)
  • Компанейские стандарты кодинга и архитектурные особенности

«99% корпоративного кода никогда не было в обучающих данных моделей» — ключевая проблема, которую выявляет тест.

Детали

Бенчмарк включает 10 типов задач разной сложности. Для чистоты эксперимента:

  • Каждую задачу пробуют решить 8 раз
  • Используют «родные» инструменты разработчиков (CLI, IDE-плагины)
  • Оценивают изменения в 11 файлах в среднем (против 6 в других тестах)

Топ-3 моделей по успешности:

  1. Fable 5.1 (Claude Code) — 38,8%
  2. GPT-6 Astra (Codex CLI) — 33,8%
  3. Gemini 3.8 Flash (Gemini CLI) — 31,2%

Почему это важно

Real-SWE показывает разрыв между «лабораторными» успехами ИИ и реальной разработкой:

  1. Контекст важнее кода — модели плохо понимают бизнес-логику (например, правила налогообложения для разных клиентов)
  2. Интеграционные ошибки — даже правильные изменения ломают работу смежных сервисов (49,1% у Gemini 3.8 Flash)
  3. Скорость ≠ качество — 71,4% ошибок случаются в первые 10 минут работы, когда модель действует слишком поспешно

Что дальше

Результаты указывают на необходимость:

  • Специализированных дообучений на корпоративных кодбазах
  • Улучшения понимания бизнес-контекста
  • Интеграции проверочных механизмов перед внедрением изменений
Для практиков

Пока ИИ лучше справляется с изолированными задачами (API-ключи — 65,6% успеха) чем с комплексными бизнес-процессами. Используйте его для рутинных задач, но сохраняйте человеческий контроль над критически важными системами.

Это разбор
Самостоятельный разбор новости. Оригинал на withspecific.com — по ссылке ниже.

Источники

Белая ракета с лаймовым огнём

Научись использовать Claude и Codex в своих проектах и бизнесе и стань в 10 раз эффективнее

Без опыта и без кода. Первого агента соберёшь за вечер, дальше он работает на тебя: клиенты, продажи, рутина.

Было полезно?