🎓 Как учится ИИ: школа, где контрольная идёт после каждого слова
В День знаний предлагаю заглянуть в самый необычный класс. Здесь нет парт, учебников и учителя, который объясняет правила. Так учится большая языковая модель.
Сначала текст разбивается на токены - слова, части слов и знаки. Затем модель снова и снова пытается предсказать следующий токен:
«Волга впадает в…»
Каждая ошибка немного меняет параметры модели. Одна попытка почти ничего не значит. Триллионы попыток - меняют всё.
Но самое интересное начинается дальше. Из простого предсказания текста возникают способности, которым модель никто напрямую не обучал.
🌍 Иностранные языки без уроков перевода
Модель видит тексты на разных языках, но ей не объясняют грамматику и не дают учебную программу. Тем не менее после базового обучения она умеет переводить текст.
Исследователи Anthropic обнаружили, что Claude частично использует общее пространство понятий: сначала формируется смысл, а затем он выражается на языке вопроса. Что-то вроде внутреннего «языка смыслов». Писал об этом вчера.
🎲 Игровое поле, которого модель никогда не видела
OthelloGPT обучали только на последовательностях ходов. Ей не показывали доску и не объясняли правила игры.
Но внутри модели возникло представление о расположении фишек и допустимых ходах. Чтобы предсказать следующий символ, она фактически построила внутреннюю модель мира.
💡 Понимание может прийти после зубрёжки
В экспериментах с алгоритмическими задачами нейросеть сначала просто запоминала примеры и плохо справлялась с новыми.
Обучение продолжили и спустя долгое время качество внезапно выросло от случайных ответов почти до идеального результата. Модель как будто сначала выучила таблицу, а потом неожиданно поняла правило.
Этот эффект назвали гроккинг (grokking).
Гроккинг (grokking) - это феномен в машинном обучении, при котором нейросеть после долгого периода переобучения (когда она просто заучила примеры) внезапно начинает по-настоящему обобщать данные и понимать скрытую логику задачи.
📝 Предсказывает одно слово, но планирует вперёд
LLM генерирует текст последовательно. Однако при написании стихотворения Claude заранее активировала варианты будущей рифмы, а затем строила строку так, чтобы прийти к выбранному слову.
То есть обучение предсказывать следующий токен породило способность планировать на несколько шагов вперёд.
🧠 Размер - не главное. Не менее важны данные, продолжительность обучения и качественная обратная связь
Есть примеры, когда маленькая модель работает лучше большой:
- Chinchilla с 70 млрд параметров, обученная на большем объёме данных, превзошла Gopher с 280 млрд параметров
- люди предпочитали ответы InstructGPT с 1,3 млрд параметров ответам базовой GPT-3 со 175 млрд
Небольшие языковые модели (SLM) - это один из трендов 26 года (писал об этом тут), которое позволяет более эффективно выполнять задачи с меньшим расходом токенов, электроэнергии и используя более дешевые вычислительные мощности.
⚠️ Есть миф, что модель учится во время взаимодействия с пользователем
Во время чата параметры модели обычно не меняются. Контекст беседы - временная шпаргалка, а не новое образование на всю жизнь. Разработчики могут использовать дополнительную информацию для улучшения модели (например, вы поставили 👍 или 👎 ответу, либо выбрали ответ, который вам больше понравился из нескольких).
Главный инсайт относится и к ИИ, и к человеку: недостаточно много читать. Важно находить закономерности, получать обратную связь, замечать ошибки и уметь говорить «не знаю». В случае человека, это еще не бояться задавать глупых вопросов.
Чему в первую очередь стоит учить ИИ: фактам, логике или честно признавать границы своих знаний?
PS: на всякий случай, пост и картинка к нему не является призывом к голосованию :) Просто у меня так работают ассоциации
#ликбез
💬 ген ии | MAX
Post #2357
446

- ❤ 2
- 👏 2
- 👍 1
- 🔥 1
- 🤣 1