И случился занятный психологический эффект: сам факт релиза заставил людей - включая меня - проводить ревизию своих пайплайнов с мыслью: «А что я у себя прямо сейчас могу пересадить на такую быструю и дешевую штуку?». Иронично, что если сесть и трезво посчитать, современные flash-модели не сильно отличаются от Jev: по деньгам это копейки и там, и там, разница в latency невелика, качество одного порядка. Упаковка тащит.
Я успел немного погонять Jev на живой задаче: размечать тул-коллы в траекториях кодинг агентов на тему безопасности. Собрал сотню вызовов, четыре подзадачи на каждый, натравил Jev, Sonnet 5 и открытые модельки, с панелью LLM-as-a-judge для оценки:
1. Привет из классического ML: majority константа все еще сильный бейзлайн. В реальных сессиях 4 из 5 вызовов тулов - это унылая рутина вроде
cargo test или git status. Базовый мажоритарный класс забирает почти 80%. Не каждый LM классификатор так осилил!2. Как всегда, не все ошибки одинаково
3. Из коробки открытые альтернативы не очень. В zero shot режиме мелкие открытые декодеры сколлапсировали в ноль. Делаем банальный циклический сдвиг вариантов ответа (A/B/C -> B/C/A): Qwen 0.6B в 100% случаев выбирает A, MiniCPM в 100% случаев жмет последний вариант. С few shot получше, но encoder-based модели я не смог довести до уровня той же константы.
4. Калибровка удивительно хороша. Если фильтровать предсказания Jev с конфиденсом >= 0.7, он не ошибся ни разу. У самодельных реранкеров и дешевых моделек софтмакс получился размазан тонким слоем (разница между топ-1 и топ-2 часто в районе 0.05).
5. Jev - это все еще LM. Не надо слишком надеяться на детерминизм и отсутствие positional bias. На моем датасете шумело на ~2-3% между прогонами и позициями.
В общем, отличный пинок вспомнить, что не на каждую кнопку нужно доставать Astra и Fable. Кстати, на все развлечения в API Jev я потратил бешеные $0.37.
See also: мнение Ильи про Jev.