LLM была обучена на миллиардах и миллиардах страниц человеческого текста — от научных статей до романов и диалогов. Каждый текст в датасетах пронизан невидимой структурой: логикой, причинно-следственными связями и, что самое главное, сюжетами. Модель, обучаясь предсказывать следующее слово, по сути, выучила не слова, а правила формирования сюжета, или, как это можно назвать, формирования когерентности текста. И как результат такого обучения, стремление модели сгенерировать наиболее вероятную последовательность токенов заставляет её следовать этим выученным нарративным паттернам, как железные опилки, не имея собственной воли, выстраиваются вдоль линий магнитного поля.
Post #167
1.23K
Хорошая формулировка принципов работы LLM вот из этой статьи:
- 👍 15