Пользователь Habr сравнил токенизаторы 11 популярных моделей: GPT, Claude, Gemini, DeepSeek, Qwen, GLM, Kimi, Grok, GigaChat и YandexGPT. Он проверил, на сколько цифровых фрагментов — токенов — каждая система разбивает сопоставимые тексты на русском и английском.
Английский модели обрабатывали примерно одинаково — около пяти символов на токен. С русским результаты различались сильнее: модели GPT, Gemini, Grok и GLM использовали на 18–23% больше токенов, DeepSeek — на 38%, Qwen — на 52%, а Kimi — на 86%. Claude Opus 5 потребовалось почти втрое больше токенов, чем для английского текста.
У YandexGPT и GigaChat ситуация оказалась обратной: русский текст занимал даже меньше токенов, чем его английский перевод. Поэтому одинаковая цена за миллион токенов ещё ничего не говорит о реальных расходах — для русскоязычных сервисов модели разумнее сравнивать по стоимости обработки типичного запроса или тысячи символов.
🌍 Почему об этом стоит знать
От токенизации зависит не только счёт за использование API, но и то, сколько русского текста поместится в контекст модели. При создании русскоязычного ИИ-сервиса модель с привлекательным тарифом может оказаться значительно дороже просто потому, что она дробит кириллицу на слишком мелкие части.
📰 Технологии и искусственный интеллект.
🏠 Теперь у «ПО • ДРУГОМУ» есть дом.
