⚡️ Сейчас бум применения decision-нейросетей как Jev, про его аналог — лидера Laya, который возглавляет тренд Hugging Face, я уже писал. Ещё раз отмечу, что Laya требует минимум обязательного тюнинга и калибровки под задачу, а ещё лучше дообучения, тогда она сильнее Jev по бенчмаркам сразу, но без этого ответы Laya часто в духе мема «это неправильный ответ! зато быстро!».
Однако Jev удобен тем, что его не нужно калибровать и можно сразу применять по API. Феерически низкая стоимость и огромная скорость обеспечили ему популярность, но как насчёт точности работы? Сами разработчики Jev обычно ссылаются на «удобные бенчмарки» по «общим темам», где нейросеть на небольшом числе весов особенно сильна.
Вышла научная работа, которая показала, где Jev работает реально хорошо, а где у него провалы. Наиболее мощен Jev не для замены LLM, а для замены … кожаных, т.е. в тестах класса RewardBench, где сравнивается решение Jev с быстрым решением человека. Поскольку человек тоже как Jev пытается «мало думать», а просто угадывать «паттерны правильности», то Jev как эксперт в паттернах правильности легко работает на уровне людей. Поэтому если у вас какой-то клерк чего-то сортирует, то можете смело его увольнять и заменять его на Jev. Особенно Jev силён в chat-задачах типа ботов поддержки или продаж, поэтому может легко работать роутером на агента с LLM, который эксперт в текущем вопросе. Также Jev держит в фокусе обучения опасный контекст и хорошо распознаёт его, что делает его очень дешёвым, быстрым и эффективным как safety-механизм против линейных атак ИИ-ботов, фишинга и т.п. Правда, есть оговорки, что мощный ИИ-бот легко сломает Jev-защиту, о чём ниже.
Однако у Jev начинаются просадки не в конкуренции с людьми, а с LLM, что показывают варианты JudgeBench. В этом варианте тестирования Jev нужно выбирать между двумя правдоподобными ответами. Тут Jev сразу проседает в задачах программирования и вопросах, требующих рассуждений (coding и reasoning). При этом на уровне простейшего кода на Python как в HumanEval на уровне нескольких строк кода модель может делать ответы «верно/неверно». На удивление хорошо модель отвечает по фактам и математическим вопросам. В малых весах модель помнит не факты, а семантические признаки их сравнения. В случае математики модель не пытается считать, а просто обобщила вероятности решения разных математических задач.
Просадка Jev на coding и reasoning на деле косвенно доказывает мнение экспертов, что это нейросеть на базе ModernBERT. Хотя ModernBERT и понимает порядок слов, т.к. у него есть современные ротационные позиционные кодировки (RoPE), но отсутствие маскированного внимания не позволяет модели получить реальные способности рассуждений.
Jev по факту играет в «распознавание паттернов семантики». Многие такие задачи он решает действительно на уровне LLM, если это реальный код или требуется сделать логический вывод, то метод паттернов сильно проседает.
Сейчас всё более актуальный вопрос защиты от набегов ИИ-ботов. По клиентам уже вижу, что всё чаще ИИ-боты нападают на компании и как в кейсе Hugging Face быстро показывают кожаным сисадминам и разработчикам, какая их реальная квалификация и главное — дисциплина в security. Дешевизна и скорость Jev тут подкупает поставить его safety-фильтром. Против хакеров-людей или мошенников это эффективно. Однако ИИ как хакер мощнее и умнее людей, это надо помнить. Атакующая LLM довольно легко понимает слабость Jev и просто начнёт делать контекст, где просто вредный и рабочий код/вызовы выглядят оба очень «правдоподобно», а также LLM может специально кидаться в Jev кодом взлома, который запакован в сложный код. Поскольку LLM всё время Reinforcement Learning пытались переиграть ИИ-судей на мощных LLM с мощными инструментами оценок, то шансов у Jev устоять против ИИ-хакера просто никаких, всегда помните об этом.
Но вот «девочек и мальчиков» с первой линии поддержки в чатах можно смело менять на Jev + специализированные агенты
https://arxiv.org/abs/2609.26550v1
Post #5230
2.94K

- ✍ 17
- 🔥 8
- 👍 1