В предыдущем посте Диогу Алмейда предлагал учить AI принимать решения, которые можно встроить в обычную программу. У этой идеи уже появилось вполне осязаемое продолжение: модель Jev от его компании TypeSafe. Любопытно здесь то, сколько возможностей разработчики согласились отдать ради одного полезного свойства — быстро отвечать на маленькие вопросы.
15 сентября 2026 года TypeSafe открыла ранний доступ к Jev и объявила о раунде на $40 млн под руководством DCVC. Модель вообще не пишет свободный текст. Ей передают состояние — например, обращение клиента и сведения о заказе — и набор вопросов с заранее заданной формой ответа:
- Choice выбирает вариант из списка: в какую очередь отправить обращение;
- Score оценивает по описанной шкале: насколько срочно нужна помощь;
- Noul возвращает вероятность ответа «да»: просит ли клиент вернуть деньги.
Вопросы обрабатываются параллельно; Choice и Score тоже возвращают вероятности возможных ответов. Дальше обычный код решает, что делать: направить заявку нужной команде, запросить недостающие данные, передать человеку. Модель можно поставить внутрь знакомого
if, а правила перехода между шагами оставить в программе. Именно из таких деталей и собирается автоматизация.Метод обучения TypeSafe назвала RLCD — Reinforcement Learning for Calibrated Decisions. Его заявленная цель — согласовать вероятности с реальной частотой событий. Если модель много раз говорит «вероятность 80%», примерно в 80% этих случаев событие должно происходить. Тогда можно подобрать порог для автоматического действия, а сомнительные случаи отправлять на разбор. Разумеется, такую калибровку еще нужно проверить на своих данных.
За отказ от генерации обещают щедро заплатить скоростью. В собственных тестах рабочих процессов TypeSafe получила ускорение до 193,6 раза и снижение стоимости до 444,6 раза относительно сравниваемых LLM. Сама компания считает такой выигрыш оптимистичным ориентиром для реальных задач. Есть и методическая тонкость: эталоном служило усреднение ответов сильных моделей, так что тест измерял согласие с ними, а не независимо установленную правильность.
Появились и внешние эксперименты. 20 сентября LangChain опубликовала проверку, в которой Jev оценивал пять ответов погодного агента, каждый по 100 раз. Все 500 бинарных оценок совпали с разметкой человека, средний вызов занимал 0,44 секунды. Звучит бодро, но пять разных примеров остаются пятью: повторы хорошо показывают устойчивость, а широту возможностей придется проверять отдельно.
Самая скользкая фраза в анонсе — «не может галлюцинировать». Здесь гарантируется форма ответа: Jev не придумает шестую категорию, если разработчик разрешил пять. Ошибочно выбрать одну из пяти он вполне может. И документация довольно прямо перечисляет проблемы: арифметика, сравнение дат, длинные цепочки рассуждений, лишний контекст. Содержащиеся в данных вредоносные инструкции тоже могут влиять на решение.
Поэтому интересный эксперимент с Jev — выделить небольшой участок существующего процесса, где постоянно нужен смысловой выбор. Например, проверять, подтверждает ли источник вывод агента, или выбирать маршрут обработки заявки. Посчитать ошибки, подобрать порог, оставить возможность передать задачу человеку. Если такая деталь работает дешево и предсказуемо, ее можно вызывать на каждом шаге — и вокруг нее уже строить более сложную систему.
Попробовать можно через OpenRouter: модель
typesafe/jev-1.13, на 20 сентября — $0,042 за миллион входных токенов, выход бесплатный. Хороший повод взять одну повторяющуюся развилку в своем коде и проверить, как изменятся задержка и число ошибок.#AI4SDLC #AI #Architecture #Evals #Engineering
