✴️ Русский язык может заметно дороже обходиться при работе с нейросетями
⚙️ На Хабре сравнили, сколько токенов разные модели тратят на одинаковый по смыслу текст на русском и английском.
Результаты местами очень заметные.
У GPT-5.x и GPT-6 русский текст занял примерно на 19% больше токенов, у Gemini 3.7 Flash на 20%, у DeepSeek на 38%, у Qwen 3 на 52%.
А вот у Claude Opus 5 разница дошла почти до трёх раз: +196%.
Причина в токенизации. Нейросеть не читает текст словами. Она сначала разбивает его на небольшие кусочки. Английские слова многие зарубежные токенизаторы упаковывают довольно хорошо, а русские чаще дробят на несколько токенов.
И это уже влияет на деньги.
Если вы используете API, русский запрос может стоить дороже английского с тем же смыслом. Контекст забивается быстрее, лимиты агента уходят быстрее, длинные документы обходятся дороже.
Есть и важная оговорка. Это не огромный научный бенчмарк. Автор проверил четыре пары текстов. Но разница между некоторыми токенизаторами получилась настолько большой, что игнорировать её при выборе модели для русскоязычного сервиса точно не стоит.
Поэтому цена «за миллион токенов» сама по себе ещё мало о чём говорит. Важно и то, сколько этих токенов модель потратит на ваш язык.
Источник: исследование donseo на Хабре.
#ИИ #Нейросети #API #Claude
@Rublev_YouTube
Post #489
4K
- ❤ 24
- 🤯 19
- 👍 12
- 🔥 5
- 🗿 1