Как слова находят своих соседей
До обучения таблица весов заполнена случайными числами. У слова «кот» в этот момент нет ничего общего со словом «собака», как и вообще ни с чем: связи между точками ещё не существует. Модель в таком состоянии не умеет ничего.
Дальше берут гигантский объём текста — книги, статьи, форумы, значительную часть открытого интернета — и подают его модели маленькими кусками, прося угадать следующее слово. Модель отвечает наугад, потому что числа пока случайны. Ответ сверяют с правильным, и по разнице программа математически вычисляет, насколько каждое из миллиардов чисел виновато в ошибке и в какую сторону его нужно сдвинуть, чтобы в следующий раз промах на этом же фрагменте оказался чуть меньше. Сдвиг крошечный — сотые доли, — но повторяется он миллиарды раз, и обучение крупной модели занимает недели работы огромного количества компьютеров.
Слово «кот» за эти миллиарды примеров встречается в текстах миллионы раз, и почти всегда рядом с похожими соседями: мяукает, лапы, спит, мурлычет. Каждый раз, когда модель ошибается на такой фразе, строка чисел для «кота» получает маленькую поправку в сторону этих соседей. У слова «собака» соседи почти те же самые — лает, лапы, будка, — и поправки идут в ту же сторону. Не потому что кто-то запрограммировал их сходство, а потому что у слов оказались одинаковые соседи и, соответственно, одинаковые поправки. Точки сближаются сами, как побочный эффект миллиардов исправлений ошибки.
#LLMпросто
😎 { Синтезиум. Подписка }
Post #123
107

- 🔥 4
- 👍 2