🧠Сравнение методов дообучения LLM: что действительно влияет на качество
Исследователи лаборатории научных исследований группы «Т-Технологии» представили на ICML 2026 единый подход к сравнению методов дообучения больших языковых моделей, обучающихся на парах ответов.
Подход позволяет привести разные алгоритмы к одинаковым условиям и понять, что именно влияет на качество. Главный вывод работы: решающим фактором является способ ранжирования ответов: попарный или поточечный.
Идея простая:
• разные методы обычно сравниваются в разных условиях
• исследователи привели их к единому протоколу сравнения, чтобы выровнять условия экспериментов и сделать результаты сопоставимыми
• дополнительно исследователи ввели параметр β, который регулирует силу дообучения на человеческих предпочтениях и позволяет более корректно сравнивать методы.
В результате оказалось, что ключевую роль играет именно тип ранжирования ответов. Когда модель выбирает лучший вариант из пары, качество оказывается выше, чем при оценке каждого ответа по отдельности.
🔗Статья: https://arxiv.org/pdf/2502.01237
Post #2866
4.05K

- 👍 31
- 🔥 2
- ❤ 1