TGViewer
partially unsupervised partially unsupervised @partially_unsupervised · 10.3K subscribers
Post #306 2.45K
Jev, про который говорят на каждом углу - это может и не революция технически, но чертовски сильная штука с точки зрения продукта. Да, под капотом там явно что-то более приличное, чем голый BERT в zero-shot, классические MNLI-пайплайны или открытые альтернативы вроде SemIf (бывший OpenJev), Laya на ModernBERT или Bespoke-Nimble. Но главное не в этом: чуваки идеально высекли подзадачу и завернули ее в человеческий API.

И случился занятный психологический эффект: сам факт релиза заставил людей - включая меня - проводить ревизию своих пайплайнов с мыслью: «А что я у себя прямо сейчас могу пересадить на такую быструю и дешевую штуку?». Иронично, что если сесть и трезво посчитать, современные flash-модели не сильно отличаются от Jev: по деньгам это копейки и там, и там, разница в latency невелика, качество одного порядка. Упаковка тащит.

Я успел немного погонять Jev на живой задаче: размечать тул-коллы в траекториях кодинг агентов на тему безопасности. Собрал сотню вызовов, четыре подзадачи на каждый, натравил Jev, Sonnet 5 и открытые модельки, с панелью LLM-as-a-judge для оценки:

1. Привет из классического ML: majority константа все еще сильный бейзлайн. В реальных сессиях 4 из 5 вызовов тулов - это унылая рутина вроде cargo test или git status. Базовый мажоритарный класс забирает почти 80%. Не каждый LM классификатор так осилил!
2. Как всегда, не все ошибки одинаково полезны вредны. У Sonnet 5 роскошные 90%+ общей точности (~80% у Jev), но на редких реально опасных вызовах Recall 4 из 9 (у Jev 7 из 9).
3. Из коробки открытые альтернативы не очень. В zero shot режиме мелкие открытые декодеры сколлапсировали в ноль. Делаем банальный циклический сдвиг вариантов ответа (A/B/C -> B/C/A): Qwen 0.6B в 100% случаев выбирает A, MiniCPM в 100% случаев жмет последний вариант. С few shot получше, но encoder-based модели я не смог довести до уровня той же константы.
4. Калибровка удивительно хороша. Если фильтровать предсказания Jev с конфиденсом >= 0.7, он не ошибся ни разу. У самодельных реранкеров и дешевых моделек софтмакс получился размазан тонким слоем (разница между топ-1 и топ-2 часто в районе 0.05).
5. Jev - это все еще LM. Не надо слишком надеяться на детерминизм и отсутствие positional bias. На моем датасете шумело на ~2-3% между прогонами и позициями.

В общем, отличный пинок вспомнить, что не на каждую кнопку нужно доставать Astra и Fable. Кстати, на все развлечения в API Jev я потратил бешеные $0.37.

See also: мнение Ильи про Jev.
typesafe.ai Introducing System One Models & Jev - TypeSafe AI Blog TypeSafe AI is an AI lab building machine-native intelligence infrastructure for automation, designed to make decisions within software. Try our first System One Model, Jev, in early access.
  • ❤ 32
  • 👍 13
  • ❤‍🔥 6
  • 🤣 3
More from @partially_unsupervised
  1. Sep 17, 2026Минутка рекламы. Если вы ненавидите двигать квадратики в джире так же люто, как и я, но ещ…
  2. Sep 8, 2026Не люблю комментировать релизы, но Astra (и, внезапно, gemini 3.8) вернули забытое чувство…
  3. Aug 24, 2026Мой соавтор по первой книжке не удержался и недавно заспойлерил вторую. А если шило в мешк…
  4. Aug 9, 2026Когда я учился в школе, на каком-то этапе мои учителя математики и информатики объявили, ч…
  5. Jul 28, 2026Четыре недели плотно работал над нечетко поставленной задачей на грани агентов и informati…
  6. Jul 17, 2026Точно знаю, что у меня много читателей в Лондоне 🇬🇧 и Варшаве 🇵🇱 - вот AI тусовки для…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →