whynotAI Lab

Небольшая модель превзошла крупные ИИ в решении головоломок ARC

Опубликовано Sep 2, 20262 мин чтенияНачальный

Что произошло

Исследователь Митхил Вакде показал, что небольшая нейросетевая модель может эффективно решать сложные абстрактные головоломки из теста ARC (Abstraction and Reasoning Corpus) — одного из ключевых бенчмарков для оценки гибкого интеллекта ИИ. Его модель размером всего в 8 слоёв превзошла многие крупные языковые модели, достигнув 44% точности на ARC-1.

Что такое ARC?

ARC — это набор из 1000 визуальных головоломок, где нужно понять абстрактное правило по нескольким примерам и применить его к новым данным. Тест разработан Франсуа Шолле как мера «живого интеллекта» — способности к быстрому обучению на малых данных.

Детали

Ключевые технические особенности подхода:

  • Минимальные затраты: Полный цикл обучения и тестирования стоил всего $0.67 благодаря оптимизации (AdamW → NorMuon, Flash Attention)
  • Современная архитектура: 8-слойный трансформер с SwiGLU-активациями и 3D позиционными эмбеддингами RoPE
  • Обучение «на лету»: Модель обучается непосредственно во время тестирования на примерах каждой головоломки (метод test-time training)
  • Контроль данных: Тщательная фильтрация исключила «утечку» информации между тренировочными и тестовыми наборами

«Я не ожидал достичь 45% с обычным трансформером — думал, потребуются принципиально новые идеи»

Почему это важно

  1. Эффективность вместо масштаба: Результат бросает вызов парадигме «чем больше — тем лучше», доказывая, что небольшие модели могут демонстрировать гибкий интеллект
  2. Доступность исследований: Метод позволяет экспериментировать с AGI на бюджетном оборудовании (потребовалась одна видеокарта)
  3. Практический урок: Оптимизация архитектуры и алгоритмов обучения часто важнее простого увеличения параметров

Что дальше

Автор нацелен на 65% точности без увеличения вычислительных затрат. Код проекта открыт, что позволяет сообществу участвовать в оптимизации. Главные направления улучшений:

  • Поиск более эффективных позиционных эмбеддингов (например, PoPE вместо RoPE)
  • Дальнейшее сокращение использования аугментаций данных
  • Оптимизация GPU-кода для 10-кратного ускорения

Это исследование меняет представление о том, какие подходы могут работать в области AGI, делая разработку более доступной для широкого круга исследователей.

Это разбор
Самостоятельный разбор новости. Оригинал на mvakde.github.io — по ссылке ниже.

Источники

Белая ракета с лаймовым огнём

Научись использовать Claude и Codex в своих проектах и бизнесе и стань в 10 раз эффективнее

Без опыта и без кода. Первого агента соберёшь за вечер, дальше он работает на тебя: клиенты, продажи, рутина.

Было полезно?