Краткий обзор, посвященный исследованиям влияния температуры 🤒 на качество генераций БЯМ и разным методикам подбора адаптивной температуры.
В частности, рассмотрены разные варианты - обучаемые и entropy-based, с глобальной температурой на последовательность и потокенной.
Одна из эвристик предлагает поднимать температуру, когда модель не уверена в предсказании, и понижать в противном случае.
Существуют также разные опции RL-я и meta-learning для предсказания оптимальной температуры на инференсе. Выученные RL-политики, правда, оказываются похожими на вышеупомянутую эвристику.
Также приводится список работ, где адаптивная температура подбирается для калибровки вероятностного распределения
Post #666
2.47K
- 👍 4
- 🔥 2