whynotAI Lab

Почему ИИ-модели становятся «глупее»

Опубликовано Aug 17, 20262 мин чтенияНачальный

Что произошло

Современные модели искусственного интеллекта становятся «глупее» в том смысле, что они теряют объем знаний, которые могут хранить. Однако это происходит не случайно, а ради улучшения их логических способностей и эффективности. Например, модель GLM-5.2 показывает выдающиеся результаты в решении сложных математических задач, используя всего 40 миллиардов активных параметров на токен. Для сравнения, GPT-4 в 2023 году использовала около 280 миллиардов параметров и справлялась с такими задачами хуже.

Но если спросить эти модели о простых фактах, их результаты резко падают. Например, на тесте SimpleQA, который проверяет способность модели вспоминать факты без использования дополнительных инструментов, лучшая модель Gemini 2.5 Pro отвечает правильно только в 53% случаев. Меньшие модели, такие как Qwen3.5, часто «галлюцинируют», выдавая неправильные, но уверенные ответы.

Детали

Почему так происходит? Факты требуют много места для хранения. Исследования показывают, что каждый параметр модели может хранить около двух бит информации. Если модель должна знать множество фактов — от дат рождения исторических личностей до актуальных данных о библиотеках программирования — это требует огромного количества параметров.

С другой стороны, логические процедуры, такие как разбиение задачи на части или проверка промежуточных результатов, сжимаются гораздо лучше. Это позволяет моделям эффективно решать задачи, используя меньше ресурсов. Например, модель Phi-4, которая имеет всего 14 миллиардов параметров, отлично справляется с математическими задачами, но плохо отвечает на вопросы из области тривиальных знаний.

Почему это важно

Эта тенденция меняет подход к разработке ИИ. Раньше модели стремились хранить как можно больше информации внутри себя, что делало их громоздкими и дорогими в обучении. Теперь акцент смещается на хранение знаний вне модели — в базах данных, документации или через поиск в интернете. Это позволяет моделям оставаться актуальными, так как информация может обновляться в реальном времени, а не ждать следующего цикла обучения.

Кроме того, такие модели могут работать на обычных видеокартах, что делает их более доступными для широкого круга пользователей. Например, модель DeepSeek V4-Flash использует всего 13 миллиардов активных параметров на токен, что позволяет ей работать на видеокарте с 24 ГБ памяти.

Что дальше

В будущем мы, вероятно, увидим модели, которые будут сочетать высокие логические способности с минимальным объемом внутренних знаний. Они будут полагаться на внешние источники информации, что сделает их более гибкими и менее подверженными ошибкам. Это также решит проблему «галлюцинаций», когда модель уверенно выдает неправильные ответы.

«Когда факт хранится вне модели, ошибка имеет адрес. Вы можете открыть документ и исправить его, и каждая следующая запись будет учитывать это исправление.»

Совет

Если вы работаете с ИИ, обратите внимание на модели, которые используют внешние источники данных. Это не только уменьшит риск ошибок, но и сделает вашу систему более гибкой и актуальной.

Это разбор
Самостоятельный разбор новости. Оригинал на w4g1.dev — по ссылке ниже.

Источники

Было полезно?