Как модель понимает слово «кот», ни разу его не увидев
Файл с весами модели Claude занимает несколько сотен гигабайт, у моделей поменьше — десятки. Это не JSON и не Excel, а плотно упакованные друг за другом миллиарды чисел с плавающей точкой. Их называют весами, или параметрами. Рядом с этим файлом лежит программа на Python, обычно пара тысяч строк кода, и умеет она ровно одно: брать числа из файла, перемножать и складывать их по строгим формулам.
Когда вы отправляете модели вопрос, программа режет текст на токены — куски слов, о которых чаще пишут отдельно, — и для каждого токена идёт в файл весов за его персональной строкой чисел.
Дальше эта строка проходит через все слои модели, где с ней происходят миллиарды операций, а на выходе получается распределение вероятностей: с какой вероятностью следующим должно идти каждое слово из словаря. Модель берёт самое вероятное и приклеивает к тексту. Потом повторяет то же самое для следующего слова, и так до конца ответа.
#LLMпросто
😎 { Синтезиум. Подписка }
Post #120
91

- 👍 2
- 🔥 2