С русским языком еще сложнее: 1 слово = 3.2 токена, при обработке через токенизатор модели GPT-4 или GPT-3.5. У модели GPT-4o улучшили токенизатор, эффективность обработки русского языка возросла, и сейчас на 1 слово должно приходиться около 2 токенов.
Почему важно сколько токенов приходится на 1 слово? По двум причинам:
1. Чем больше токенов необходимо для перевода текста с человеческого языка на язык ИИ, тем дороже стоит работа с ИИ.
Это происходит потому, что стоимость работы установлена в USD (или RUB) за 1 (или 1 млн) токенов. То есть, если у вас на выходе из LLM (GPT4-o) текст длиной 1000 слов на русском языке (примерно 2 страницы текста) , то его генерация будет стоить 1.5 рубля. А если это те же 1000 слов на английском, то стоимость будет только 97 копеек. Это значит, что ИИ-решения, сделанные с LLM на английском языке обходятся на 35% дешевле, чем на русском.
2. У каждой большой языковой модели есть ограничение размера контекстного окна.
То есть ограничено максимальное количество того, сколько текста (токенов) она может принять на вход и сколько сгенерировать.
Это значит, что чем меньше токенов расходуется на 1 слово, тем длиннее может быть текст, с которым работает LLM. А это, в свою очередь означает, что и сценариев применения ИИ может быть больше. В том числе поэтому разнообразие ИИ-сервисов на английском языке гораздо больше, чем на русском.
#чтоэтотакое
#ИИликбез
#ИИинтересно
Подписывайтесь на @aiworkfuture, чтобы ничего не пропустить🚀