RLHF, которым обучались ChatGPT и GPT-4, обладает следующим недостатком: сложное, долгое и нестабильное RL дообучение, с большими требованиями по памяти; ведь во время него нужно оценивать генерации с помощью Reward модели и считать вероятности изначальной моделью для KL члена (на рисунке 3 более подробное сравнение).
Так вот, чуваки из гугла показали, что есть более эффективный и простой способ дообучаться на сложный недифференцируемый сигнал типа Human Feedback'а. По human evaluation их метод статзначимо выигрывает у RLHF 💪
Коротко про метод (Sequence Likelihood Calibration):
1️⃣ Обучить нейронку моделировать Human Feedback. Они экспериментировали с pair-wise (контрастив) и point-wise обучениями
2️⃣ Создать датасет
(x, y+, y-, y_ref):a. сгенерировать
n кандидатов, проранжировать их моделью с 1 шага, выбрать лучший в качестве y_ref, и ещё пару для y+ и y-b. либо взять непосредственно датасет попарных сравнений в качестве
y+ и y-; а в качестве y_ref - написанные людьми суммаризацииc. микс a и b
3️⃣ Дообучить на нем с лоссом с рисунка 1
Что круто, они сравнились с более простым и очевидным способом улучшения модели: простой supervised finetuning на
y_ref (рисунок 2)Подробности читайте в статье, очень годная 🔥
Подписывайтесь на мой канал, чтобы читать про интересные штуки в AI: https://t.me/building_singularity :)


