В фантастике нам часто показывают искусственный интеллект, сравнимый с человеческим, который расположен внутри робота или синтетического тела. Сам вопрос о создании такого типа интеллекта, похоже, разрешится в ближайшие годы. Но даже если он и будет возможен, то на текущем технологическом этапе размер датацентров для его обслуживания будет сопоставим с целым городом — в робота такое точно не засунуть.
Причина в том, что нужный эффект достигается главным образом за счёт масштабирования размеров моделей и количества данных. Но ведь веса — это, по сути, упакованная информация, если угодно, эрудированность и энциклопедичность. Интеллект же чаще проявляется в способности рассуждать и анализировать. А что, если попытаться сохранить умственные навыки модели без балласта в виде ненужных знаний? В конце концов, необходимую информацию можно подавать ситуативно в контекст.
Рассуждая таким образом, мои коллеги из AIRI создали семейство компактных языковых моделей под названием Optimal Cognitive Core (OCC) — SLM в противовес LLM. Пока они решали только задачу контекстных ответов на вопросы. При размере 0.6 и 1.7 млрд параметров, соответственно, OCC-модели отвечают на равных или лучше моделей общего назначения, которые в 2–6 раз больше, а по верности контексту показывают лучший результат среди моделей до 32 млрд. Сегодня про эту разработку вышла статья у нас на Хабре.
Конечно, это пока не общий интеллект, скорее proof-of-concept того, что компактная модель может работать так же, а то и лучше своих эрудированных собратьев. В перспективе этот подход сможет существенно снизить требования по железу к сильному ИИ, включая пресловутую проблему с энергией.
Post #894
553

- 🔥 10
- 👍 4
- ❤ 3
- 🤡 1
- 🍓 1