TGViewer
FAANG Master FAANG Master @faangmaster · 2.94K subscribers
Post #759 1.53K
Почему Meta купила 49% Scale AI за $14B?

Качество современных LLM зависит не только от числа параметров в модели, но и от количества и качества данных, на которых она обучается. Более того, качество зависит от способа обучения.
В современных версиях LLM обучение происходит в несколько этапов.
Вначале происходит сбор данных со всего интернета, далее фильтрация и обработка данных, так как в интернете куча мусорной и дублирующейся информации.
Далее эти данные используются для предварительного обучения модели.
После предварительного обучения используется метод обучения, который называется Reinforcement learning from human feedback.
Это обучение с подкреплением (Reinforcement learning), в котором параметры LLM подстраиваются таким образом, чтобы максимизировать функцию вознаграждения (reward function).

В случае с нейронками, которые играют в шахматы, функцию вознаграждения построить просто в зависимости от того, выиграла ли нейросеть партию или нет (или сделала ход, который улучшает оценку позиции).
В случае же с LLM не понятно, как построить функцию вознаграждения. Поэтому для этого обучают другую модель (модель вознаграждения/reward model), которая будет оценивать результат работы LLM и использоваться в RL.
Чтобы обучить эту reward model, используются люди. Они вначале руками пишут ответы на самые популярные/типичные/ключевые вопросы по всем основным темам. Эти данные используются для предварительного обучения этой модели вознаграждения. Далее её дообучают, и люди уже не пишут весь ответ руками, а оценивают разные варианты ответов.
Этот процесс требует специальных тулов и большого числа обычных людей (тысячи).
Scale AI — это как раз такая компания, которая позволяет распределять задачи по аннотированию данных на тысячи человек.

OpenAI пользуется услугами таких компаний, как Surge AI и Scale AI, для этих целей. Поэтому покупка Scale AI должна сказаться положительным образом на качестве моделей, которые делает Meta, и вывести Llama в топ по качеству на уровне OpenAI, Google и т.д.
Wikipedia Reinforcement learning from human feedback training method using human feedback to rank responses and train a reward model that improves model outputs
  • 👍 18
  • ❤ 4
More from @faangmaster
  1. Sep 13, 2026Навье-Стоксгейт 8 сентября OpenAI заявила, что её невыпущенная модель решила одну из семи…
  2. Sep 3, 2026Uber совместно с британским стартапом Wayve запускает роботакси в Лондоне Пришла нотификац…
  3. Aug 20, 2026Новый HTTP метод QUERY Этим летом в спецификацию HTTP добавили новый метод - QUERY. Добавл…
  4. Aug 15, 2026IOI 2026 В Ташкенте прошел межнар школьников по информатике. Результаты: https://stats.ioi…
  5. Jul 30, 2026В свое время я закончил МФТИ. Относительно непростой вуз для обучения. Закончил неплохо. З…
  6. Jul 18, 2026Документалка про Java В продолжение темы документалок, вышла документалка про Java. Трейле…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →