У OpenAI вышла GPT 5.4, и там теперь до 1M токенов контекста. 🤯
То есть в модель теперь можно засунуть 4 романа Война и Мир (только зачем?)
И вот тут пора вспомнить, что такое токен. 🧩
Токен это не слово, а кусок текста: часть слова, знак, число или их комбинация. Поэтому два абзаца могут выглядеть короткими, а по факту уже бодро сжирать контекст.
С русским всё ещё интереснее. У нас длиннее слова, богаче формы, есть склонения, окончания, суффиксы, все что делает русский самым сложным языком в мире. 😏
Из-за этого русский текст часто распадается на большее число токенов, чем английский. И тут рождается ленивый вывод: ага, значит английский для LLM лучше.
Но всё не совсем так: в тестах английский не всегда первый. В бенчмарке ONERULER польский вообще вышел на первое место 🥇, а английский оказался только шестым.
Почему так? Потому что морфология не только дороже в токенах, но и точнее в смысле.
Окончания, падежи и формы делают связи в тексте более явными. Для модели это дополнительные опоры. Поэтому текст может стоить дороже по токенам, но при этом быть понятнее.
В общем: пиши на русском, не короче, а конкретнее.
Написано человеком
на канале ПРОМПТ-ИНЖЕНЕР 🧠
Подпишись 👆
Post #201
195

- ❤ 6
- ✍ 2
- 👍 2