📊Новый единый подход к сравнению методов дообучения LLM
На ICML 2026 исследователи лаборатории научных исследований Т-Технологий предложили единый протокол для сравнения методов дообучения больших языковых моделей, обучающихся на парах ответов. Работа показала, что различия между подходами объясняются тем, как устроено ранжирование ответов.
🧠 Что сделали исследователи:
- Разные методы привели к единому протоколу оценки: одноэтапные подходы (ORPO, ASFT) перевели в двухэтапные и провели выравнивание на парах ответов.
- Ввели параметр β, который регулирует силу дообучения на человеческих предпочтениях и помогает более объективно сравнивать методы между собой.
- Выяснили, что ключевой фактор качества — тип сравнения ответов.
📈 Результаты:
- Попарное сравнение ответов (pairwise) дает более высокое качество на задачах средней сложности, чем поточечные (pointwise).
🛠️ В работе использовались Llama 3.x, Mistral 7B и Qwen 2.5. Модели обучали на данных Reddit TL;DR, UltraChat и UltraFeedback, а качество оценивали на AlpacaEval 2, ArenaHard, попарных сравнениях ответов с помощью более сильной модели и математических бенчмарках.
Post #3445
2.12K

- 👍 6
- ❤ 4
- 🥰 4
- 🎉 4
- 🔥 2
- 🤩 2