#fyi Модель с русским промтом тупеет?
Как модель «думает», если коротко. Внутри у неё нет русского, английского или китайского отдела — есть одно общее пространство смыслов, куда складывается всё. Но кормили её в основном английским: GitHub, StackOverflow... Поэтому пространство это плотнее всего именно там, где английские слова. Отсюда два налога на русский.
Налог на ум. Спросили по-русски — модель всё равно достаёт знания из "английской" части памяти, cross-lingual transfer работает. Но с потерями: у топовых моделей 1–3%, заметно только на задачах, где она и так на пределе. У слабых моделей разрыв больше.
Налог на токены. Модель читает текст не словами, а токенами — кусочками. Английский режется экономно, русский — в 1.5–2 раза мельче. Один и тот же смысл занимает вдвое больше места: окно на 200k токенов вмещает меньше русского текста, чем английского, и кончается раньше, в API тот же текст дороже в полтора-два раза, ответ генерируется дольше.
Post #1917
230
- 🔥 4
- 😱 4