В блогосфере только и разговоров, что о Jev. Который в 193 раза быстрее и в 444 раза дешевле о_О
Было легкое ощущение всеобщего помутнения, когда полились статьи про «нереальный прорыв» и «уделали Альтмана». Кейсы там такие, что я до сих пор ржу. GPT-6 Astra на high reasoning текстом спрашивают, есть ли в документе персональные данные и почему. Она секунд 6 почти посимвольно собирает ответ «Да, есть фамилия и имя, потому что указано, кто совершал операцию». А Jev достает правильный ответ из волшебного мешочка за 100 мс. Ээээ... Такие задачи решаются JSON-ом с ответом в начале, а не простыней текста, которую потом еще парсить. И уж точно не флагманом с размышлениями – Gemini 3.8 Flash или GPT Luna сделают то же самое на порядок дешевле и быстрее.
Так о чем речь. Это нейросетка, у которой обрезан текстовый вывод. Подаете текст и варианты ответа (до 255), на выходе – вероятности. Вход стоит копье, выход бесплатно, ответ за доли секунды. Посмотрел тесты, сделал свои прогоны на классификаторе документов и категоризации отзывов. Штука прикольная, но очень специализированная.
Что хорошо:
– нормальный реранкинг за копейки (на Хабре в тесте на справочнике ОКТРУ обошел даже флагманы)
– хорошо решает задачи с небольшим количеством классов: спам/не спам, тональность, тема, запрещенка
– почти не дрифтит от перезапусков, сильно стабильнее LLM
– уверенность хорошо отделяет очевидное от серой зоны, так что сложное можно отдать умной модели и срезать расходы раза в 3–4
Что не очень:
– на тонкой классификации типа Banking77 – 81% против 84.4% у Opus 5, и на таких задачах лучшая LLM везде была выше
– на русском местами проседает (на XNLI минус 11 п.п.), и калибровка плывет сильнее
– надо нормально промптить или расписывать каскад узких вопросов, иначе работает хуже дешманских моделей
– если есть 2000+ размеченных примеров, дообученный маленький энкодер обходит Jev со свистом: 88.8% против 77.8%
На моих тестах в сравнении с Луной и Gemini 3.8 flash вышло в 2–3 раза быстрее и в 2–3 раза дешевле, а не в 100. Качество – примерно 85% от эталона. Ну-у... такое.
Плюс это еще один вендор: хостится только в США, у больших облаков его пока нет. Попробуйте объяснить это энтерпрайз-клиентам. И вы серьезно будете отправлять персональные данные на сторону, чтобы проверить, персональные ли это данные? Даже за копейки и миллисекунды? Не проще поставить GLiNER2 на свой сервер и проверять все локально за те же доли секунды?
Короче, это не убийца LLM, а очень быстрый и дешевый zero-shot классификатор уровня средних моделей. Как первый фильтр перед LLM, для роутинга, реранка и guardrails – норм. Но пороги и калибровку надо делать на своих данных, особенно для русского: вероятностям «из коробки» верить нельзя. И я на 100% уверен, что топ-лаборатории скопируют такое через месяц-два. Ребята круто прокачали генерацию данных для обучения, но с большими деньгами и ГПУшками это повторяется быстро.
https://typesafe.ai/blog/introducing-system-one-models-and-jev
Post #2428
2.49K