Взял Jev — новую модель, которую сделали специально для классификации, — и проверил на своём боте «Держи лида» рядом с тремя обычными нейросетями.
Задача для неё идеальная: бот читает 300+ чатов и около 1 600 раз в сутки решает, заказ это, вакансия или мусор. Писать ничего не нужно, только выбрать.
Итог на 47 реальных сообщениях:
• DeepSeek V4.1 Flash — 47/47
• GLM 5.3 Flash и MiMo — 46/47
• Jev — 45/47, последний
И он не дешевле. За токен Jev почти бесплатный, но наш промпт он считает вдвое длиннее, и одно решение обходится вдвое дороже, чем у DeepSeek.
В статье — что такое Jev, как одна неточная строка в анкете стоила ему пяти тестов и где такие модели действительно полезны.
https://pvolkov.com/articles/jev-classification/
Post #83
132