Почему Meta купила 49% Scale AI за $14B?
Качество современных LLM зависит не только от числа параметров в модели, но и от количества и качества данных, на которых она обучается. Более того, качество зависит от способа обучения.
В современных версиях LLM обучение происходит в несколько этапов.
Вначале происходит сбор данных со всего интернета, далее фильтрация и обработка данных, так как в интернете куча мусорной и дублирующейся информации.
Далее эти данные используются для предварительного обучения модели.
После предварительного обучения используется метод обучения, который называется Reinforcement learning from human feedback.
Это обучение с подкреплением (Reinforcement learning), в котором параметры LLM подстраиваются таким образом, чтобы максимизировать функцию вознаграждения (reward function).
В случае с нейронками, которые играют в шахматы, функцию вознаграждения построить просто в зависимости от того, выиграла ли нейросеть партию или нет (или сделала ход, который улучшает оценку позиции).
В случае же с LLM не понятно, как построить функцию вознаграждения. Поэтому для этого обучают другую модель (модель вознаграждения/reward model), которая будет оценивать результат работы LLM и использоваться в RL.
Чтобы обучить эту reward model, используются люди. Они вначале руками пишут ответы на самые популярные/типичные/ключевые вопросы по всем основным темам. Эти данные используются для предварительного обучения этой модели вознаграждения. Далее её дообучают, и люди уже не пишут весь ответ руками, а оценивают разные варианты ответов.
Этот процесс требует специальных тулов и большого числа обычных людей (тысячи).
Scale AI — это как раз такая компания, которая позволяет распределять задачи по аннотированию данных на тысячи человек.
OpenAI пользуется услугами таких компаний, как Surge AI и Scale AI, для этих целей. Поэтому покупка Scale AI должна сказаться положительным образом на качестве моделей, которые делает Meta, и вывести Llama в топ по качеству на уровне OpenAI, Google и т.д.
Post #759
1.53K