TGViewer
Refat Talks: Tech & AI Refat Talks: Tech & AI @nobilix · 11.6K subscribers
Post #303 3.89K
Jev - это сенсор, а не собеседник

Вы уже могли слышать про TypeSafe AI (основатель - соавтор InstructGPT из OpenAI), они пару дней назад вышли из стелса и показали модель, которая не умеет писать текст зато отвечает в десятки раз быстрее и дешевле LLM. Ну как отвечает, скорее выбирает, но иногда это ровно то, что нужно.

Работает так: скидываешь ей данные и задаешь вопросы с заранее известными вариантами. Она не пишет ответ, а сразу выбирает вариант и говорит, насколько уверена. Промпт при этом никуда не делся - он живет внутри вопроса.

В общем эту штуку можно сравнить с датчиком, по сути же - это умный классификатор.

Родион уже прогнал Jev на практике: как реранкер в RAG она обошла Voyage, Qwen3-Reranker и Cohere, а как модератор чат-бота вышла в 5 раз быстрее и дешевле gpt-oss-120b. Мне еще понравилась демка с оптимизацией browser use.

Что еще стоит посмотреть:

- Опенсорс-реплики появились за трое суток: openjev (демо в браузере), jevmlx для Mac, vllm-jev-decison под vLLM, Verdict-open-jev - ближе всего к оригиналу: не логиты LLM, а энкодер ModernBERT.
- Тред на HN, 1800+ поинтов. Главный спор - про слово "can't hallucinate": тип гарантирован, суждение нет. CEO отвечает лично.
- Разбор Anthony Maio: самая трезвая критика. RLCD (метод обучения) не раскрыт, калибровка описывает популяцию ответов, а не конкретный ответ.
- Бенчмарк на 2000 фишинговых писем: в лоб Jev проиграл Haiku с треском, 63% против 81%. А потом автор разбил решение на пять маленьких вопросов в одном вызове и получил 95%. Самая поучительная история про то, как эту штуку надо готовить. Еще 15 независимых эвалов с кодом - в каталоге awesome-jev - 👍.


Мой тейк: штука полезная только при сильно лучшей экономике, и есть проблема всех узких решений (реранкеров, маленьких моделей, файнтюна): фронтир-лабы вливают миллиарды в универсальные модели, и те становятся лучше и быстрее даже в узких задачах просто по дороге. Бонусом LLM может "объяснить" свой выбор, а тут нет. И как любой классификатор, такие штуки по-настоящему раскрываются на своем железе: при нагрузке дорога до облака съедает всю экономию скорости.

Поэтому моя ставка не на TypeSafe, а на идею. Либо большие лабы добавят режим типа "выбор с вероятностью" в свои API, либо китайцы наклепают открытых версий и тогда "типизированные" решения станут таким же примитивом, как structured output. В обоих случаях выигрывает интерфейс/способ, а не компания.

🔥 ➕ 🔁 @nobilix
  • 🔥 44
  • 👍 16
  • ❤ 11
  • ⚡ 5
More from @nobilix
  1. Sep 19, 2026#ReDigest Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира техно…
  2. Sep 15, 2026Что вы знаете про bb? Они называют себя "AI IDE that builds itself". Достаточно молодой пр…
  3. Sep 12, 2026#ReDigest Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира техно…
  4. Sep 11, 2026Диплинки в кодинговых агентах Deeplinks - простой, но иногда незаменимый прием для быстрог…
  5. Sep 5, 2026#ReDigest Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира техно…
  6. Sep 1, 2026Qwen 3.8 27B, локальный инференс и мои эксперименты с подбором железа Про эту модель уже н…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →