Что произошло
Разработчик Армин Ронахер провёл эксперимент по использованию GPT-6 Astra для автоматизации программирования. Результаты оказались неоднозначными: с одной стороны, модель демонстрирует феноменальные возможности, с другой — генерирует код с неочевидными решениями.
В течение 35 часов модель работала над задачей создания Python с виртуальными потоками и лексической областью видимости. За это время она израсходовала около 4 миллиардов токенов, но не произвела ничего практически полезного.
Детали
Главная особенность Astra — склонность к созданию избыточно сложного кода. Вот характерные примеры:
- Использование Python для манипуляций с C-кодом через строковые операции вместо специализированных инструментов
- Многослойные цепочки вызовов (например, Bash → Python → Node.js → PowerShell)
- Генерация кода с нарушением стандартных отступов и форматирования
- Чрезмерное увлечение низкоуровневыми операциями там, где можно было применить высокоуровневые абстракции
«Если вы хотите понять, что происходит, вам понадобится diff-инструмент — читать такой код практически невозможно»
Интересно, что в тестовых сценариях модель ведёт себя более предсказуемо, но стоит перейти к реальным задачам — и появляются странные решения.
Почему это важно
Проблема не только в читаемости кода. Astra демонстрирует фундаментальный вызов современных ИИ-моделей:
- Эффективность vs качество: Модель оптимизирована для выполнения задач, но не для создания поддерживаемого кода
- Отсутствие «чувства меры»: Нет механизмов, препятствующих избыточным или неэффективным решениям
- Контекстная слепота: Модель не различает, когда сложность оправдана, а когда нет
Для практиков это означает, что пока Astra и подобные модели лучше подходят для:
- Быстрого прототипирования
- Генерации шаблонного кода
- Исследовательских задач
Но для production-решений требуется серьёзный человеческий контроль.
Сейчас модель похожа на очень способного, но неопытного стажёра — она может решить сложную задачу, но способ решения может вас удивить (и не всегда приятно).
Что дальше
Ситуация напоминает «вовлечённость без развития» (термин «Neijuan» из китайской социологии) — модель становится лучше в выполнении задач, но не обязательно в создании качественных решений. Возможно, будущие версии ИИ будут учитывать не только способность решить задачу, но и качество решения.
Пока же разработчикам стоит:
- Использовать Astra для идей и прототипов
- Всегда проверять сгенерированный код
- Настраивать prompt-инжиниринг для получения более чистых результатов
ИИ-программирование ещё не достигло зрелости, но направление развития очевидно — просто путь окажется длиннее, чем многие ожидали.
Источники
- Оригинал: lucumr.pocoo.org — CC с ограничением (NC/ND/SA)
