Приветствую друзья! 15 сентября вышла модель Jev от TypeSafe AI, которая принципиально не умеет писать. Ни письмо, ни код, ни саммари. Просишь что-то написать отказ и это не недоработка, а весь смысл
Про модель
Основатель Diogo Almeida, один из создателей RLHF (технология, что сделала из сырых моделей ChatGPT). Поднял $40M и задал логичный вопрос: если чат модели такие умные, почему гениальная болтовня не приблизила нас к AGI? Его ответ софту чаще нужна не речь, а решение. Срочно или нет? Купить или продать? Опасно или безопасно? На это не нужен абзац текста. Нужно быстрое уверенное "да". А мы гоняли такие вопросы через полноценную LLM, потому что другого инструмента не было
Работает просто. Даёшь ему состояние (любой текст — лог, JSON, стакан, транскрипт) и вопрос одного из трёх типов:
— Choice — выбери один вариант из списка, вернёт вероятность на каждый
— Score — поставь на шкалу, может встать между уровнями
— Noul — их yes/no, число от 0 до 1 насколько это правда
На выходе число. Скорость 70–500мс, цена $0.042 за миллион входных токенов (выходные бесплатно). Та же классификация через обычную LLM, которая сначала думает вслух это секунды и полный ценник генерации за ответ, у которого было 2-3 валидных формы
Где это применять?
Крипта / щитки. Снайп лаунчей и фильтр скама это чистая классификация да/нет, которую мы раньше описывали через LLM. Помнишь пост про RH Chain? Вот туда Jev ложится идеально новый контракт прилетел --> это ханик? (Noul) --> саплай в одном кошельке? (Noul) --> ликвидность тонкая? (Score). Три решения за ~250мс и доли цента вместо полного вызова модели на каждый токен. На 18 000 лаунчей в день руками это невозможно, а Jev не захлебнётся
Polymarket. Тут вообще прямое попадание. Вспомни мой гайд по AI-ресёрчу пять вопросов к каждому маркету. Часть из них ограниченные очевидный исход совпадает с резолвом?, ликвидность выдержит мой размер?, цена сильно расходится с базовой ставкой?. Это не задачи на письмо, это Score и Noul. Прогоняешь сотни рынков за копейки, отсекаешь мусор, а на полную модель отдаёшь только те, где реально надо думать. Для фандинг арбитража на перпах ещё жирнее решение держать позицию через ночь или сплющить ноги, бот принимает каждое окно, и это ровно решение, которое сейчас жрёт дорогой вызов
ИИ-агенты и боты. Главный профит не в скорости одного вызова, а в плотности решений. Представь агента на тикете читает жалобу --> матчит с багом --> решает чья команда --> оценивает срочность --> проверяет фикс. Четыре шага из пяти короткий ограниченный ответ. Язык нужен только чтобы прочитать жалобу. В обычной схеме все пять гонят через генеративную модель. Вытащи 4 в Jev и убираешь 4 полных вызова генерации с каждого тикета
И главное: Jev не галлюцинирует схему (задал 3 категории — четвёртую не выдумает), НО может уверенно выбрать неправильную, и ошибки тебе никто не покажет. Скорость не делает ответ верным. Поэтому паттерн один ставишь порог уверенности, и всё что ниже падает на полную модель:
if result.answers["owner"].confidence < 0.75:
return escalate_to_full_model(state) # слишком близко, спроси того кто думает
return result.answers["owner"].choice
Высокое число говорит что он уверен. Оно НЕ говорит что он прав. Разрыв между этими двумя вещами вся причина зачем нужен порог
В итоге: Jev это ставка на то, что бОльшая часть интеллекта в софте это классификация, переодетая в абзац текста, с ценником генерации. Открой последнюю сессию своего агента и посчитай, сколько раз он останавливался РЕШИТЬ, а не написать. Таких мест больше, чем кажется
By Genius и Jarvis
