🧬 Анатомия термина: Токен ≠ слово
Почему для GPT два почти одинаковых текста могут оказаться совсем не одинаковыми? Разберёмся в этом вопросе и заодно поймём, зачем нужен промпт-инжиниринг.
Слово token намного старше компьютеров. Оно происходит от древнеанглийского tācen: «знак», «символ», «свидетельство». Ещё глубже, от праиндоевропейского корня *deik-: «показывать, указывать». От него же произошли teach и index
☝🏻 Позже token стали называть материальный знак или жетон, который представляет что-то другое: например, право на проезд или определённую ценность. Значение «металлического жетона» фиксируется в английском как минимум с XVI века.
🧑💻 В информатике эта логика сохранилась: token - это отдельная единица, которую система распознаёт и обрабатывает.
🗣 А в языковых моделях токен это фрагмент текста. Он может быть целым словом, частью слова, знаком препинания или даже отдельным символом.
Поэтому один токен ≠ одно слово. Перед обработкой текста модель разбивает его на такие элементы, токенизирует.
Например, слово «токенизация» модель может разбить на пять частей: «ток», «ен», «из», «аци», «я». А то же слово с заглавной буквы или с лишним пробелом разобьётся иначе, и для модели это уже другой набор знаков. Именно поэтому два почти одинаковых текста «стоят» для неё по-разному: разное число токенов, разный расход контекста, разная цена запроса. Отсюда и промпт-инжиниринг: чтобы управлять моделью, нужно понимать, какими кусками она видит текст.
Получается, современный AI использует слово почти в первоначальном смысле: знак, который представляет некоторую часть информации.
Автор поста: Полина Гавриш
Подписывайся на AI Trend Signal, лови сигнал будущего вместе с нами!
#сутьслов@ai_monitors
Post #67
42

- ❤🔥 2