Канта Хаяси, студент Токийского университета, попросил Jev — новую модель решений TypeSafe AI — назвать грань кубика, которого модель не видела. Четыреста бросков, и в каждом Jev выбрал «1».
Средняя заявленная вероятность этого выбора — 82,9%. Угадал он в 19,0% случаев: 76 из 400, ровно случайность.
— Ниже 71% заявленная вероятность не опускалась ни разу — при истинной одной шестой.
— Число из входного документа модель переписывает по дороге. Три отчёта, в каждом «30% риск дефицита»; тип
Choice вернул 5%, 5% и 6%.— У отметки 50% ответ обрывается. Заявлено 45% — вернулось 6,6%, заявлено 55% — 95,9%. Десять пунктов на входе, восемьдесят девять на выходе; каждая точка — среднее по двенадцати документам.
Хаяси сам объясняет, почему это не спорит с посторонним замером, нашедшим вероятности Jev хорошо калиброванными на 1 200 вопросах MMLU. Экзамен проверяет, понимает ли модель, что вопрос для неё трудный; кубик — понимает ли она, что ответа нельзя узнать вообще. Первое не обещает второго.
TypeSafe продаёт именно порог, дословно у них на сайте:
Задайте пороги, при которых он действует сам, и при которых спрашивает подтверждения.
Теперь к вам, потому что схема у вас та же, даже если модель другая. Строка
if p > 0.8 не отличает «уверен» от «сказать нечего»: и то и другое приезжает в неё числом 0,83.Что сделать сегодня. Взять выборку, которой вы мерите точность, и пересобрать её по вероятностям: сгруппировать случаи по числу, которое дала модель, и в каждой группе сравнить обещание с долей попаданий. Новых данных не нужно, нужны те же метки.
Честности ради, Хаяси не называет Jev бесполезным: по его словам, модель быстрая, дешёвая и это отличный продукт, а тип
Noul на том же кубике дал 19,2% против истинных 16,7%. Но на двадцати вариантах тот же Noul вместо 5,0% выдал 15,0%.https://kantahayashiai.github.io/posts/jev-does-not-play-dice/
Какой порог уверенности стоит у вас в коде — и на какой выборке вы его выбрали?


