TGViewer
from:adam from:adam @c3po_notes · 6.02K subscribers
Post #588 1.18K
Пока пишу тут серию постов про экономику ии лаб, прокоменчу мыслями своими адский твиттерский хайп по JEV.

Если пропустили, стартап TypeSafe выкатил модель, которая вообще не умеет писать текст. На вход ей дают контекст и набор вопросов, на выходе получают да/нет, выбор из вариантов или оценку по шкале с вероятностями. Обещают всё это на два порядка быстрее и дешевле LLM. По сути, фундаментальный классификатор.

Смотреть на JEV имеет смысл через триаду cost/latency/quality. С ценой и задержкой всё понятно, разница с фронтирными моделями примерно два порядка, с мелкими вроде Haiku около порядка. С качеством сложнее. Сами TypeSafe заявляют паритет с LLM среднего класса, но независимые замеры скачут от очень хороших результатов до провалов, в одном бенче на фишинговых письмах JEV заметно проиграл даже Haiku. Но у качества есть вторая половина, про которую в сравнении с мелкими LLM забывают. LLM плохо скорят и принимают решения, промпт "ты гениальный классификатор, оцени свой слоп от 1 до 10" даёт число, которое гуляет от прогона к прогону и от порядка вариантов, потому что рождается той же генерацией токенов, что и сам слоп. JEV учили именно принимать решения и отдавать вероятность напрямую, и у LangChain при повторных прогонах одних и тех же кейсов разброс оценок оказался на порядки ниже, чем у LLM-джаджей, что крайне важно для eval'ов и автоматической разметки.

И даже там, где аплифт в точности найдётся, он не настолько большой, чтобы пережить месяц, за который лаба завалит данными условный Opus. Лаба тратит миллиарды на одну большую модель, та становится лучше сразу на куче задач на сдачу, а потом это улучшение расползается вниз по всей линейке и почти бесплатно доезжает до мелких моделей. А вот стабильность масштабом не лечится, это свойство самого подхода. Так что устойчивое преимущество JEV в цене, задержке и стабильности решений, и если они тебе не важны, через 2-3 месяца он будет сосать лапу.

А вот если cost и latency жёсткое ограничение, становится интереснее. Особенно в массовых сценариях в горячем пути, где LLM просто не сходилась по экономике и задачу либо не делали вообще, либо закрывали условными регулярками и прочим хардкодом. Там, где ошибка стоит дорого или решение ещё надо объяснять, JEV подходит плохо, платишь ты там за качество, а он возвращает ответ и вероятность без рассуждения.

Эндрю Чен хорошо подметил ещё одно следствие. AI-приложение с несколькими LLM-вызовами на каждом экране не окупалось рекламой, поэтому либо инференс субсидирует гигант, либо пользователь платит подписку. Если такие решения дешевеют на два порядка, начинает сходиться экономика бесплатных приложений с рекламой. Универсального ассистента там не будет, будет куча маленьких фич вроде фильтра важных писем.

При этом самим классификаторам сто лет в обед, и на своих данных они выигрывают у JEV по всем параметрам. На том же фишинговом наборе маленькая модель, дообученная всего на тысяче примеров, обошла его с большим запасом. Да и zero-shot придумали не вчера, вероятности вариантов ответа можно за один проход снять с любой небольшой открытой модели. Новое в том, что JEV работает zero-shot из коробки, без датасета и обучения под задачу, и что его вытащили по апишке, как полноценный продукт с чарджем. Дешёвый и быстрый классификатор теперь можно купить как сервис, а не делать ради него проект на квартал с датасетом и ML-командой.

Улучшать его по мере накопления данных при этом нечем, файнтюна нет, а в контекст много примеров не засунешь. А когда датасет накопился, проще обучить условный BERT, поэтому, кажется, JEV это инструмент холодного старта или солидного бейслайна/бенча.

Отсюда мысль, что, кажется, применение для JEV стоит искать в первую очередь не среди текущих LLM-вызовов, которые хочется удешевить, ибо там решит эффект масштаба лаб. Исключение составляют джаджи и разметка, где LLM плоха по устройству. А интереснее всего посмотреть на список того, что вы вообще не стали делать, потому что LLM там была слишком дорогой или медленной, а своих данных и ML-ресурса на отдельный классификатор не было.
  • 👍 23
  • 🔥 10
  • ❤ 3
  • 👏 1
More from @c3po_notes
  1. Sep 18, 2026Немного размышлений про эссе Дарио, в котором он просит индустрию замедлить темпы развития…
  2. Sep 15, 2026Часто слышу, что дистрибуция или скорость и есть моат. a16z прямо так и пишет: в потребите…
  3. Sep 12, 2026На этом фоне интересно посмотреть на другую сделку Bending Spoons. Пятью неделями раньше о…
  4. Sep 12, 2026Bending Spoons покупает Miro за почти $1,4 млрд. У этих ребят довольно понятная модель: ку…
  5. Sep 11, 2026Тут осознал, что теперь, когда думаю, как решить задачу, первым делом думаю не о самом реш…
  6. Sep 6, 2026В общем, впечатления от Астры очень смешанные. С одной стороны, она реально не нейрослопит…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →