TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 279K subscribers
Post #10499 20.7K
🌟Исследователи из научной лаборатории Т-Технологий предложили единый подход для сравнения методов дообучения LLM

Работу представили на ICML 2026. Исследователи сравнили методы дообучения больших языковых моделей, которые учатся на заранее подготовленных парах ответов, и показали, что различия между современными методами дообучения определяются типом ранжирования ответов – попарным или поточечным.

🟡Что именно предложили

Чтобы сделать сравнение корректным, исследователи привели разные методы к единому протоколу оценки. Дополнительно в методы был введен параметр β: он регулирует силу дообучения на человеческих предпочтениях и позволяет более объективно сравнивать методы между собой.

🟡«Мы доказали, что такие сравнения не всегда корректны, и результат может зависеть в том числе от настроек эксперимента, объема данных или этапов обучения. Мы предложили единый подход, который позволяет сравнить методы в одинаковых условиях и понять, какие факторы действительно влияют на качество», — отметил Даниил Гаврилов, руководитель лаборатории Т-Технологий.


🟡Результаты сравнения

Исследование показало, что многие заявленные преимущества алгоритмов выравнивания стираются, а главным фактором качества остается тип ранжирования ответов.

Методы, где модель сравнивает два ответа напрямую (pairwise), чаще показывают более высокий результат на задачах средней сложности, чем подходы, где ответы оцениваются по отдельности (pointwise).

🟡Что использовалось в работе
В работе ученые использовали модели Llama 3.2 3B, Llama 3.1 8B, Mistral 7B, Qwen 2.5 7B и Qwen 2.5 14B. Обучение проводилось на данных Reddit TL;DR, UltraChat и UltraFeedback, а качество оценивали на AlpacaEval 2, ArenaHard, попарных сравнениях ответов с помощью более сильной модели и математических бенчмарках.

🟡Статья

@ai_machinelearning_big_data

#AI #ML
  • 👍 117
  • 🤔 28
  • 👏 13
  • 🔥 11
  • ❤ 7
  • 😁 2
More from @ai_machinelearning_big_data
  1. Oct 2, 2026🌟 Cloudflare выпустила открытые модели решений Clef Обе модели, Clef и Clef-flash, вышли…
  2. Oct 2, 2026✔️ ВКонтакте научила Ленту отличать интерес к контенту от намерения купить Инженеры AI VK…
  3. Oct 2, 2026✔️ Anthropic раздаёт бесплатные плюшевые игрушки и стикеры На сайте для разработчиков clau…
  4. Oct 2, 2026🌟 SGLang научил чат-модели отвечать вероятностями Команда открытого движка инференса SGLa…
  5. Oct 1, 2026🌟 Bilibili выложила открытые модели перевода Index-Translate Команда Index LLM китайского…
  6. Oct 1, 2026✔️ Президент США и главы ИИ-компаний подписали соглашение о безопасности Документ подписал…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →