А вот собсна скриншоты.
На них видно, что дедушка токенизаторов GPT3 даже русский текст нормально не воспринимал.
GPT4 уже нормально воспринимал текст на русском, но зашумление текста сработало, видно по кракозябрам.
А вот GPT4o уже и зашумленный текст нормально токенизировал, но только разбив на очень маленькие токены. Зашумление в данном случае повлияет только на стоимость проверки, т.к. в случае с большим договором будет очень много токенов использовано на входящий контекст модели.
LawCoder
Post #243
663



- 🔥 6
- 🤔 3
- ❤ 1