TGViewer
AI Projects AI Projects @turboproject · 11.3K subscribers
Post #5230 2.94K
⚡️ Сейчас бум применения decision-нейросетей как Jev, про его аналог — лидера Laya, который возглавляет тренд Hugging Face, я уже писал. Ещё раз отмечу, что Laya требует минимум обязательного тюнинга и калибровки под задачу, а ещё лучше дообучения, тогда она сильнее Jev по бенчмаркам сразу, но без этого ответы Laya часто в духе мема «это неправильный ответ! зато быстро!».

Однако Jev удобен тем, что его не нужно калибровать и можно сразу применять по API. Феерически низкая стоимость и огромная скорость обеспечили ему популярность, но как насчёт точности работы? Сами разработчики Jev обычно ссылаются на «удобные бенчмарки» по «общим темам», где нейросеть на небольшом числе весов особенно сильна.

Вышла научная работа, которая показала, где Jev работает реально хорошо, а где у него провалы. Наиболее мощен Jev не для замены LLM, а для замены … кожаных, т.е. в тестах класса RewardBench, где сравнивается решение Jev с быстрым решением человека. Поскольку человек тоже как Jev пытается «мало думать», а просто угадывать «паттерны правильности», то Jev как эксперт в паттернах правильности легко работает на уровне людей. Поэтому если у вас какой-то клерк чего-то сортирует, то можете смело его увольнять и заменять его на Jev. Особенно Jev силён в chat-задачах типа ботов поддержки или продаж, поэтому может легко работать роутером на агента с LLM, который эксперт в текущем вопросе. Также Jev держит в фокусе обучения опасный контекст и хорошо распознаёт его, что делает его очень дешёвым, быстрым и эффективным как safety-механизм против линейных атак ИИ-ботов, фишинга и т.п. Правда, есть оговорки, что мощный ИИ-бот легко сломает Jev-защиту, о чём ниже.

Однако у Jev начинаются просадки не в конкуренции с людьми, а с LLM, что показывают варианты JudgeBench. В этом варианте тестирования Jev нужно выбирать между двумя правдоподобными ответами. Тут Jev сразу проседает в задачах программирования и вопросах, требующих рассуждений (coding и reasoning). При этом на уровне простейшего кода на Python как в HumanEval на уровне нескольких строк кода модель может делать ответы «верно/неверно». На удивление хорошо модель отвечает по фактам и математическим вопросам. В малых весах модель помнит не факты, а семантические признаки их сравнения. В случае математики модель не пытается считать, а просто обобщила вероятности решения разных математических задач.

Просадка Jev на coding и reasoning на деле косвенно доказывает мнение экспертов, что это нейросеть на базе ModernBERT. Хотя ModernBERT и понимает порядок слов, т.к. у него есть современные ротационные позиционные кодировки (RoPE), но отсутствие маскированного внимания не позволяет модели получить реальные способности рассуждений.

Jev по факту играет в «распознавание паттернов семантики». Многие такие задачи он решает действительно на уровне LLM, если это реальный код или требуется сделать логический вывод, то метод паттернов сильно проседает.

Сейчас всё более актуальный вопрос защиты от набегов ИИ-ботов. По клиентам уже вижу, что всё чаще ИИ-боты нападают на компании и как в кейсе Hugging Face быстро показывают кожаным сисадминам и разработчикам, какая их реальная квалификация и главное — дисциплина в security. Дешевизна и скорость Jev тут подкупает поставить его safety-фильтром. Против хакеров-людей или мошенников это эффективно. Однако ИИ как хакер мощнее и умнее людей, это надо помнить. Атакующая LLM довольно легко понимает слабость Jev и просто начнёт делать контекст, где просто вредный и рабочий код/вызовы выглядят оба очень «правдоподобно», а также LLM может специально кидаться в Jev кодом взлома, который запакован в сложный код. Поскольку LLM всё время Reinforcement Learning пытались переиграть ИИ-судей на мощных LLM с мощными инструментами оценок, то шансов у Jev устоять против ИИ-хакера просто никаких, всегда помните об этом.

Но вот «девочек и мальчиков» с первой линии поддержки в чатах можно смело менять на Jev + специализированные агенты

https://arxiv.org/abs/2609.26550v1
  • ✍ 17
  • 🔥 8
  • 👍 1
More from @turboproject
  1. Sep 26, 2026NVIDIA раздаёт бесплатно модели, включая довольно дорогой фронтир Kimi K3. Моделей довольн…
  2. Sep 26, 2026🧮 К бурным спорам вокруг «бумажной математики» и роли ИИ я бы хотел на своём примере пояс…
  3. Sep 26, 2026⚠️ GPTunneL начал забавное рекламное продвижение своих прокси-услуг к иностранным, фактиче…
  4. Sep 26, 2026Довольно много новых инцидентов с хакерскими налетами агентов OpenAI. Это только один, в и…
  5. Sep 25, 2026📰 Наш чатик как всегда подкидывает важные новости. Как известно, Дарио выиграл первый суд…
  6. Sep 25, 2026Ну что же, пока ИИ устраивал геноцид математикам, то скорее можно было весело наблюдать да…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →