TGViewer
LLM под капотом LLM под капотом @llm_under_hood · 29.3K subscribers
Post #944 7.76K
LLM Benchmark Jev - топ для простых задач

Jev - это новая LLM модель, в которую встроили Schema-Guided Reasoning, превратив в гибкий классификатор по шаблону.

Jev не может генерировать тексты, но может на лету выбирать из предложенных вариантов. Поэтому модель можно использовать в задачах вроде классификации входящей почты, проверки запросов на красные флаги.

Главное - не делать задачу слишком сложной.

А вот насколько сложные задачи сложны для Jev? Мне стало интересно, и я адаптировал агентский бенчмарк BitGN, выбрав оттуда те задачи, которые можно свести к задачам классификации.

Это разовый бенчмарк, который создан исключительно для Jev, чтобы можно было примерно прикидывать его когнитивные способности - насколько сложные задачи можно давать на вход.

Понятно, что Jev не сравниться с нормальными LLM по гибкости и мощности (там даже Loop/Cascade из SGR толком не сделаешь), но вот в качестве узкоспециализированного инструмента под ряд задач - это стоящий вариант.

И получается очень приятная картина - Jev на 14 месте, причем работает очень быстро и стоит сущие копейки.

В данном бенчмарке задачи за пределами возможностей Jev. А если давать ему задачи “по плечу”, то картина получается еще красивее. Айгиз написал статью для TimeToAct как раз про такие задачи.

Будем ждать новых гибридных моделей, которые могут работать по SGR подходам. Причем делать это без двойной работы через JSON Schema + inference + constrained decoding (то есть работать быстрее и дешевле).

Ваш, @llm_under_hood 🤗
  • ❤ 45
  • 🔥 25
  • 👍 7
  • 😁 2
  • 🤯 1
More from @llm_under_hood
  1. Sep 24, 2026Период полураспада софта - 3 месяца Я сейчас возвращаюсь к сайту BitGN, чтобы начать подго…
  2. Sep 23, 2026Post #947
  3. Sep 22, 2026GPT-6 Sol и Luna - бенчмарк цены, качества и скорости А еще Opus 5.5 и Astra 6 (medium). В…
  4. Sep 22, 2026Доклад про DDD + AI в проектах (Berlin, 2025, EN) Не прошло и года с прошлого KanDDDinsky,…
  5. Sep 21, 2026Давно я не публиковал эссе. Вот новое. We never wanted human code. Ваш, @llm_under_hood 🤗
  6. Sep 20, 2026Вчера я решил попрактиковать нативную разработку агентами. Для этого попросил Codex перепи…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →