TGViewer
Futuris Futuris @futuris · 5.86K subscribers
Post #4836 2.18K
⚡️⚡️⚡️Похоже происходит новый ChatGPT момент - Диогу Алмейда, один из людей, стоявших у истоков ChatGPT, соавтор InstructGPT - исследования, которое помогло заложить основу ChatGPT, вместе с командой TypeSafe спустя 2 года в стелсе выкатил Jev. Разработчики называют её первым представителем своего класса System One Models — моделей для быстрых решений.

Проверять действия других ИИ, выбирать инструменты, замечать подозрительные операции, разбирать обращения клиентов и управлять игровым персонажем в реальном времени. Именно такие задачи предлагают поручать Jev. В собственных тестах автоматизации разработчики сравнили её с генеративными моделями OpenAI, Anthropic и DeepSeek, которым поручили такие же задачи с выдачей структурированных решений. На сайте заявлены ускорение в 193,6 раза и снижение стоимости в 444,6 раза, но эти показатели относятся к выбранным тестам и не означают такое преимущество над каждой моделью. Цена Jev составляет $0,042 за миллион входных токенов, за выход отдельно не берут.

В демке с Doom модель принимает решения около десяти раз в секунду, получая данные о состоянии игры. А команда Every получила 777 оценок документов менее чем за 0,7 секунды. Это позволяет представить агента, который проверяет себя после каждого действия.

Сторонняя проверка выглядит скромнее, но всё равно впечатляет: в небольшом тесте Every Jev проверяла тексты в 25 раз быстрее и примерно в 580 раз дешевле Fable 5.1 high. Однако нашла 6 из 7 заложенных ошибок, тогда как Fable нашла все семь.

В чём суть:

Обычная генеративная LLM последовательно создаёт токены ответа. Jev получает описание ситуации и параллельно выдаёт оценки по заданным вопросам. Например: «Клиент недоволен? Проблема срочная? Нужен человек?» Программа получает вероятности и действует по ним. Команда заявляет собственную архитектуру и обучение RLCD, которое должно учить модель адекватно оценивать уверенность в своих решениях. Да. RLCD здесь, пожалуй, одна из самых интересных частей Jev.
RLCD расшифровывается как Reinforcement Learning for Calibrated Decisions — «обучение с подкреплением для калиброванных решений». Это собственный метод TypeSafe. Важно: существует более старый RLCD с другой расшифровкой (Reinforcement Learning from Contrast Distillation), но это совершенно другая работа. Главная идея в том, что Jev обучают не просто выбирать правильный вариант, а ещё и правильно понимать, насколько она в нём уверена. Например, модель отвечает:
«Эта транзакция мошенническая: 82%».
Хорошо откалиброванная модель должна означать этим примерно следующее: если собрать много случаев, где она говорит «82%», то примерно в 82% таких случаев ответ действительно должен оказаться правильным. То есть вероятность становится полезным числом для программы, а не просто декоративным confidence score. Именно это TypeSafe называет calibrated decisions. Объяснение авторов.

Если подход подтвердится, это может дать начало новому поколению ИИ-агентов. Большая модель строит план, а быстрые модели вроде Jev помогают выбирать действия и проверять результат на каждом шаге. Чем дешевле такая проверка, тем больше попыток, экспериментов и исправлений можно сделать за те же деньги. В том числе при разработке самого ИИ. И вот здесь становится особенно интересно: ускоряются агенты, которые помогают создавать ещё более сильных агентов🌈

Твит Диогу Алмейды с анонсом Jev
Технический разбор от авторов
Тесты и методика сравнения
Официальный сайт TypeSafe
статья об InstructGPT, 2022

Попробовать можно, если дали ранний доступ. Для всех желающих доступ пока не подтверждён: на сайте TypeSafe всё ещё кнопка Join Waitlist.
При этом уже есть Playground в браузере с входом через Google или почту. По инструкции, там можно вставить текст, задать вопросы и получить оценки без программирования. Для интеграции есть API.

СЛЕДИМ и пробуем🍿💎🍎
  • 🔥 24
  • ⚡ 8
  • ❤ 3
  • 🤯 3
  • 👍 1
More from @futuris
  1. Sep 21, 2026OpenAI заявили, что их новая внутренняя модель (BEL, читай AGI) решила уже больше 100 давн…
  2. Sep 21, 2026Когда лимит Codex уже сгорел и нужно ждать завтрашнего ресета, то развлекаюсь тока так😎 а…
  3. Sep 21, 2026Первую клетку нашего бинго можно закрывать: выкатили Grok 4.7 😵 Модель получила более кру…
  4. Sep 21, 2026небольшое бинго на эту неделю🍐
  5. Sep 20, 20263 сентября Эрик Лу из Cognition с помощью Devin разложил на множители RSA-260, число длино…
  6. Sep 20, 2026Мне уже несколько дней попадаются тесты Fable 5.2 и новой Gemini и я уже не могу держать э…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →