Что произошло
Specific Labs представили Real-SWE — принципиально новый бенчмарк для оценки ИИ-моделей в условиях, максимально приближенных к реальной работе разработчиков. В отличие от синтетических тестов, здесь используются:
- Настоящие кодбазы компаний (финтех, SaaS-платформы)
- Задачи с бизнес-последствиями (начисление налогов, миграции данных)
- Компанейские стандарты кодинга и архитектурные особенности
«99% корпоративного кода никогда не было в обучающих данных моделей» — ключевая проблема, которую выявляет тест.
Детали
Бенчмарк включает 10 типов задач разной сложности. Для чистоты эксперимента:
- Каждую задачу пробуют решить 8 раз
- Используют «родные» инструменты разработчиков (CLI, IDE-плагины)
- Оценивают изменения в 11 файлах в среднем (против 6 в других тестах)
Топ-3 моделей по успешности:
- Fable 5.1 (Claude Code) — 38,8%
- GPT-6 Astra (Codex CLI) — 33,8%
- Gemini 3.8 Flash (Gemini CLI) — 31,2%
Аналитика и налоговые юрисдикции — самые сложные: 0% успеха у всех моделей в задаче Analytics stream reducer, 3,1% — в Tax jurisdiction.
Почему это важно
Real-SWE показывает разрыв между «лабораторными» успехами ИИ и реальной разработкой:
- Контекст важнее кода — модели плохо понимают бизнес-логику (например, правила налогообложения для разных клиентов)
- Интеграционные ошибки — даже правильные изменения ломают работу смежных сервисов (49,1% у Gemini 3.8 Flash)
- Скорость ≠ качество — 71,4% ошибок случаются в первые 10 минут работы, когда модель действует слишком поспешно
Что дальше
Результаты указывают на необходимость:
- Специализированных дообучений на корпоративных кодбазах
- Улучшения понимания бизнес-контекста
- Интеграции проверочных механизмов перед внедрением изменений
Пока ИИ лучше справляется с изолированными задачами (API-ключи — 65,6% успеха) чем с комплексными бизнес-процессами. Используйте его для рутинных задач, но сохраняйте человеческий контроль над критически важными системами.
Источники
- Оригинал: withspecific.com — © withspecific.com
