TGViewer
КайфКодинг КайфКодинг @vibecodingartem · 1.02K subscribers
Post #1002 153
Число, которое Jev выдаёт за калиброванную вероятность, меряет не шанс попасть. Оно меряет, насколько задача похожа на решаемую.
Канта Хаяси, студент Токийского университета, попросил Jev — новую модель решений TypeSafe AI — назвать грань кубика, которого модель не видела. Четыреста бросков, и в каждом Jev выбрал «1».
Средняя заявленная вероятность этого выбора — 82,9%. Угадал он в 19,0% случаев: 76 из 400, ровно случайность.
— Ниже 71% заявленная вероятность не опускалась ни разу — при истинной одной шестой.
— Число из входного документа модель переписывает по дороге. Три отчёта, в каждом «30% риск дефицита»; тип Choice вернул 5%, 5% и 6%.
— У отметки 50% ответ обрывается. Заявлено 45% — вернулось 6,6%, заявлено 55% — 95,9%. Десять пунктов на входе, восемьдесят девять на выходе; каждая точка — среднее по двенадцати документам.
Хаяси сам объясняет, почему это не спорит с посторонним замером, нашедшим вероятности Jev хорошо калиброванными на 1 200 вопросах MMLU. Экзамен проверяет, понимает ли модель, что вопрос для неё трудный; кубик — понимает ли она, что ответа нельзя узнать вообще. Первое не обещает второго.
TypeSafe продаёт именно порог, дословно у них на сайте:
Задайте пороги, при которых он действует сам, и при которых спрашивает подтверждения.

Теперь к вам, потому что схема у вас та же, даже если модель другая. Строка if p > 0.8 не отличает «уверен» от «сказать нечего»: и то и другое приезжает в неё числом 0,83.
Что сделать сегодня. Взять выборку, которой вы мерите точность, и пересобрать её по вероятностям: сгруппировать случаи по числу, которое дала модель, и в каждой группе сравнить обещание с долей попаданий. Новых данных не нужно, нужны те же метки.
Честности ради, Хаяси не называет Jev бесполезным: по его словам, модель быстрая, дешёвая и это отличный продукт, а тип Noul на том же кубике дал 19,2% против истинных 16,7%. Но на двадцати вариантах тот же Noul вместо 5,0% выдал 15,0%.
https://kantahayashiai.github.io/posts/jev-does-not-play-dice/
Какой порог уверенности стоит у вас в коде — и на какой выборке вы его выбрали?
  • ❤ 1
  • 👍 1
More from @vibecodingartem
  1. Sep 24, 2026Ваш агент разогнал ровно тот участок работы, который и так не был узким местом. Мерт Демир…
  2. Sep 23, 2026Промах промпт-кеша в Claude Code — не редкий баг, а фоновый режим, и платите за него вы. С…
  3. Sep 22, 2026Многие друзья жалуются, что лимиты стали заканчиваться за 1-3 дня. Я рекомендую вам рассмо…
  4. Sep 22, 2026Лучшее решение этой неделе - подключил ЧатГПТ к Профи.Ру. Закидываю в ЧатГПТ задачу в прос…
  5. Sep 22, 2026Сегодня ожидаем релиз Claude Opus 5.5 (а с ним, надеюсь, и сброс лимитов) #anthropic@rvnik…
  6. Sep 22, 2026Xiaomi выпустила MiMo V2.6 Pro и Flash с открытыми весами Pro — топ-1 в Artificial Analysi…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →