Post #1719
243
Forwarded from Lev
День добрый! Я бы применил EM к этой задаче примерно так: сначала обучаем catboost только на нецензурированных данных. Будто бы, 60% данных должно хватить для того, чтобы хорошо обучиться. Потом предсказываем на цензурированных. Там, где предсказание получилось меньше, чем цензурированное значение, берём цензурированное, где больше - берём предсказанное. Заодно считаем лосс между ними. На увеличенной таким образом выборке обучаем снова. И так до тех пор, пока лосс не перестанет уменьшаться. Вероятно, вы так и делали, но я это не услышал в рассказе сегодня.