🚀 Jev от TypeSafe AI — LLM, который отвечает числами
TypeSafe AI представила Jev — первую модель в категории «System One», или, по терминологии Maggie Appleton, «модели принятия решений». Вместо текста она возвращает числа с вероятностями: для вопросов «да/нет» (Noul, от Bernoulli), выбора из вариантов и оценки по шкале. По данным Simon Willison, стоимость модели рассчитывается только по входным токенам — $0.042 за миллион, выходные токены бесплатны, что дешевле GPT-5 Nano ($0.05 за миллион входных токенов). Одно и то же «состояние» можно отправлять с десятками вопросов, они обрабатываются параллельно.
→ Цена: $0.042 за млн входных токенов, выход — $0
→ Типы вопросов: да/нет (Noul), выбор с распределением вероятностей, оценка по шкале
→ Параллельная обработка множества вопросов к одному состоянию
→ Открытые аналоги: Kev на Qwen 3.5 (0.8B, 4B, 9B) и набор тестов JevBench уже появились
Главный риск Jev не в точности чисел, а в полном отсутствии объяснений: модель не может сказать, почему она поставила 0.87. Для промышленной эксплуатации это значит, что оценка должна быть внешней и строгой, а не полагаться на внутренние обоснования, которых нет. Пока сообщество делает из неё чат-бота и left-pad, в реальных системах нужно измерять систематические смещения и отказы — иначе чёрный ящик тихо засосёт ошибки.
#Jev #TypeSafeAI #decisionmodels #LLM #bias
TypeSafe AI представила Jev — первую модель в категории «System One», или, по терминологии Maggie Appleton, «модели принятия решений». Вместо текста она возвращает числа с вероятностями: для вопросов «да/нет» (Noul, от Bernoulli), выбора из вариантов и оценки по шкале. По данным Simon Willison, стоимость модели рассчитывается только по входным токенам — $0.042 за миллион, выходные токены бесплатны, что дешевле GPT-5 Nano ($0.05 за миллион входных токенов). Одно и то же «состояние» можно отправлять с десятками вопросов, они обрабатываются параллельно.
→ Цена: $0.042 за млн входных токенов, выход — $0
→ Типы вопросов: да/нет (Noul), выбор с распределением вероятностей, оценка по шкале
→ Параллельная обработка множества вопросов к одному состоянию
→ Открытые аналоги: Kev на Qwen 3.5 (0.8B, 4B, 9B) и набор тестов JevBench уже появились
Главный риск Jev не в точности чисел, а в полном отсутствии объяснений: модель не может сказать, почему она поставила 0.87. Для промышленной эксплуатации это значит, что оценка должна быть внешней и строгой, а не полагаться на внутренние обоснования, которых нет. Пока сообщество делает из неё чат-бота и left-pad, в реальных системах нужно измерять систематические смещения и отказы — иначе чёрный ящик тихо засосёт ошибки.
#Jev #TypeSafeAI #decisionmodels #LLM #bias