TGViewer
Цифровое образование Цифровое образование @diged · 2.36K subscribers
Post #2410 112
​​«Предсказатель следующего токена» — это неправильная ментальная модель для LLM
Автор Гаррин Макголдрик
Вопрос, чему современная LLM фактически обучается после предварительного обучения.
- Pretraining: модель учится повышать вероятность токена, который действительно следовал за предыдущими токенами в корпусе. Это действительно next-token prediction.
- RLVR: модель генерирует различные варианты решения, получает за них вознаграждение и повышает вероятность тех последовательностей, которые привели к хорошему результату. Здесь уже нет «правильного следующего токена» — есть цель, которую нужно оптимизировать.
- RLHF: модель дополнительно обучается вести себя как полезный ассистент, а не просто воспроизводить статистические закономерности обучающих данных.
Аналогия автора — шахматы. Можно обучить систему предсказывать ход, который обычно сделал бы гроссмейстер, а можно обучить её выбирать ход, который максимизирует вероятность победы. Внешне обе системы делают одно и то же — выбирают следующий ход, — но внутренне оптимизируют разные цели.
Отсюда главный тезис: «next-token prediction» описывает форму работы LLM, но не обязательно её функциональную сущность после постобучения.
Если воспринимать LLM только как «предсказатель следующего слова», легко прийти к выводу:
LLM = статистическая имитация существующих знаний.
А если учитывать RL, reasoning и exploration, появляется другая модель:
LLM = обучаемая система, которая может не только воспроизводить паттерны, но и искать решения в пространстве возможных последовательностей, если существует критерий качества.
Возникает очень интересный переход и для педагогики:
передать модели правильный ответ → научить модель находить правильный ответ → научить модель оптимизировать образовательный результат.
Последний шаг потенциально ведёт уже к AI-агентам и Human–AI Learning Systems, а не просто к использованию чат-ботов в обучении.
Читать 3мин)
More from @diged
  1. Oct 8, 2026​​Выпускники вузов, чьи специальности наиболее подвержены влиянию ИИ, сталкиваются с очере…
  2. Oct 8, 2026​​Дело не только в навыках работы с ИИ _Автор Майкл Фрид_ ИИ-грамотность сама по себе не г…
  3. Oct 6, 2026​​Три логики адаптации для будущего человека и ИИ _Автор: Джулиан Стодд_ Джулиан Стодд опи…
  4. Oct 4, 2026​​Стартап в сфере образовательных технологий Glite запускает приложение для повышения уров…
  5. Oct 4, 2026​​Исследование Университета Мэриленда показало, что студенты, которым предлагали репетитор…
  6. Oct 4, 2026​​Обзор технологических стартапов в образовании от 04.10.2026 _Что стало известно об инвес…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →