Пока пишу тут серию постов про экономику ии лаб, прокоменчу мыслями своими адский твиттерский хайп по JEV.
Если пропустили, стартап TypeSafe выкатил модель, которая вообще не умеет писать текст. На вход ей дают контекст и набор вопросов, на выходе получают да/нет, выбор из вариантов или оценку по шкале с вероятностями. Обещают всё это на два порядка быстрее и дешевле LLM. По сути, фундаментальный классификатор.
Смотреть на JEV имеет смысл через триаду cost/latency/quality. С ценой и задержкой всё понятно, разница с фронтирными моделями примерно два порядка, с мелкими вроде Haiku около порядка. С качеством сложнее. Сами TypeSafe заявляют паритет с LLM среднего класса, но независимые замеры скачут от очень хороших результатов до провалов, в одном бенче на фишинговых письмах JEV заметно проиграл даже Haiku. Но у качества есть вторая половина, про которую в сравнении с мелкими LLM забывают. LLM плохо скорят и принимают решения, промпт "ты гениальный классификатор, оцени свой слоп от 1 до 10" даёт число, которое гуляет от прогона к прогону и от порядка вариантов, потому что рождается той же генерацией токенов, что и сам слоп. JEV учили именно принимать решения и отдавать вероятность напрямую, и у LangChain при повторных прогонах одних и тех же кейсов разброс оценок оказался на порядки ниже, чем у LLM-джаджей, что крайне важно для eval'ов и автоматической разметки.
И даже там, где аплифт в точности найдётся, он не настолько большой, чтобы пережить месяц, за который лаба завалит данными условный Opus. Лаба тратит миллиарды на одну большую модель, та становится лучше сразу на куче задач на сдачу, а потом это улучшение расползается вниз по всей линейке и почти бесплатно доезжает до мелких моделей. А вот стабильность масштабом не лечится, это свойство самого подхода. Так что устойчивое преимущество JEV в цене, задержке и стабильности решений, и если они тебе не важны, через 2-3 месяца он будет сосать лапу.
А вот если cost и latency жёсткое ограничение, становится интереснее. Особенно в массовых сценариях в горячем пути, где LLM просто не сходилась по экономике и задачу либо не делали вообще, либо закрывали условными регулярками и прочим хардкодом. Там, где ошибка стоит дорого или решение ещё надо объяснять, JEV подходит плохо, платишь ты там за качество, а он возвращает ответ и вероятность без рассуждения.
Эндрю Чен хорошо подметил ещё одно следствие. AI-приложение с несколькими LLM-вызовами на каждом экране не окупалось рекламой, поэтому либо инференс субсидирует гигант, либо пользователь платит подписку. Если такие решения дешевеют на два порядка, начинает сходиться экономика бесплатных приложений с рекламой. Универсального ассистента там не будет, будет куча маленьких фич вроде фильтра важных писем.
При этом самим классификаторам сто лет в обед, и на своих данных они выигрывают у JEV по всем параметрам. На том же фишинговом наборе маленькая модель, дообученная всего на тысяче примеров, обошла его с большим запасом. Да и zero-shot придумали не вчера, вероятности вариантов ответа можно за один проход снять с любой небольшой открытой модели. Новое в том, что JEV работает zero-shot из коробки, без датасета и обучения под задачу, и что его вытащили по апишке, как полноценный продукт с чарджем. Дешёвый и быстрый классификатор теперь можно купить как сервис, а не делать ради него проект на квартал с датасетом и ML-командой.
Улучшать его по мере накопления данных при этом нечем, файнтюна нет, а в контекст много примеров не засунешь. А когда датасет накопился, проще обучить условный BERT, поэтому, кажется, JEV это инструмент холодного старта или солидного бейслайна/бенча.
Отсюда мысль, что, кажется, применение для JEV стоит искать в первую очередь не среди текущих LLM-вызовов, которые хочется удешевить, ибо там решит эффект масштаба лаб. Исключение составляют джаджи и разметка, где LLM плоха по устройству. А интереснее всего посмотреть на список того, что вы вообще не стали делать, потому что LLM там была слишком дорогой или медленной, а своих данных и ML-ресурса на отдельный классификатор не было.
Post #588
1.18K
- 👍 23
- 🔥 10
- ❤ 3
- 👏 1