Что произошло
Исследователь Митхил Вакде показал, что небольшая нейросетевая модель может эффективно решать сложные абстрактные головоломки из теста ARC (Abstraction and Reasoning Corpus) — одного из ключевых бенчмарков для оценки гибкого интеллекта ИИ. Его модель размером всего в 8 слоёв превзошла многие крупные языковые модели, достигнув 44% точности на ARC-1.
ARC — это набор из 1000 визуальных головоломок, где нужно понять абстрактное правило по нескольким примерам и применить его к новым данным. Тест разработан Франсуа Шолле как мера «живого интеллекта» — способности к быстрому обучению на малых данных.
Детали
Ключевые технические особенности подхода:
- Минимальные затраты: Полный цикл обучения и тестирования стоил всего $0.67 благодаря оптимизации (AdamW → NorMuon, Flash Attention)
- Современная архитектура: 8-слойный трансформер с SwiGLU-активациями и 3D позиционными эмбеддингами RoPE
- Обучение «на лету»: Модель обучается непосредственно во время тестирования на примерах каждой головоломки (метод test-time training)
- Контроль данных: Тщательная фильтрация исключила «утечку» информации между тренировочными и тестовыми наборами
«Я не ожидал достичь 45% с обычным трансформером — думал, потребуются принципиально новые идеи»
Почему это важно
- Эффективность вместо масштаба: Результат бросает вызов парадигме «чем больше — тем лучше», доказывая, что небольшие модели могут демонстрировать гибкий интеллект
- Доступность исследований: Метод позволяет экспериментировать с AGI на бюджетном оборудовании (потребовалась одна видеокарта)
- Практический урок: Оптимизация архитектуры и алгоритмов обучения часто важнее простого увеличения параметров
Модель всё ещё далека от человеческого уровня (люди решают 85-100% головоломок ARC). Однако прогресс впечатляет: за год точность таких компактных моделей выросла с 15% до 44%.
Что дальше
Автор нацелен на 65% точности без увеличения вычислительных затрат. Код проекта открыт, что позволяет сообществу участвовать в оптимизации. Главные направления улучшений:
- Поиск более эффективных позиционных эмбеддингов (например, PoPE вместо RoPE)
- Дальнейшее сокращение использования аугментаций данных
- Оптимизация GPU-кода для 10-кратного ускорения
Это исследование меняет представление о том, какие подходы могут работать в области AGI, делая разработку более доступной для широкого круга исследователей.
Источники
- Оригинал: mvakde.github.io — © mvakde.github.io
