Команда из École Normale Supérieure (🇫🇷) собрала CalArena - один из самых больших бенчмарков по post-hoc калибровке на сегодня. Внутри: 2000 экспериментов 🔬 (пары датасет–модель), там почти всё - binary/multiclass, таблички/картинки, линейки/бустинги/сетки/трансформеры + десятки методов калибровки.
Спойлер: не используй Expected Calibration Error (ECE). Она слишком чувствительна к числу бинов и может показать нулевую ошибку, даже когда классификатор отдаёт просто среднюю частоту классов в выборке. Авторы предлагают смотреть на ΔBrier Score относительно некалиброванной модели. Такая оценка заметно стабильнее.
Что ещё обнаружили:
• Непрерывные методы почти всегда выигрывают у биннинга. Platt, Temperature Scaling, Splines, CDF, Quadratic и др. стабильно обходят Histogram Binning.
• Centered Isotonic Regression лучше классической Isotonic. Простое центрирование убирает лесенку и даёт более гладкую, аккуратную калибровку.
• Logits vs Probs. Калибровка сырых логитов лучше, чем калибровка готовых вероятностей.
• Для multiclass используй нативные методы. TS, Vector Scaling и Matrix Scaling работают лучше, чем One-vs-Rest.
• Tree-based модели тоже умеют калибровать. CatBoost показывает достойные результаты, но только со строгой монотонностью на входящие логиты/вероятности.
CalArena - отличный референс для выбора способа калибровки на основе честного сравнения.
Post #290
178


- 🔥 5