Как на самом деле обучают LLM и при чем здесь Цукерберг
То, что мы привыкли называть нейронкой — большая языковая модель (LLM) — это просто автокомплит на стероидах. Она не умеет отвечать на вопросы и следовать инструкциям. Просто продолжает текст по смыслу.
А вот чтобы превратить её в полезного ассистента, типа ChatGPT, нужен тюнинг (пост-тренировка).
Делается это в два этапа:
- SFT (Supervised Fine-Tuning) — тупо скармливаем модели тысячи пар «вопрос-идеальный ответ». Так она учится самому формату диалога.
- Preference Alignment — модели показывают два ответа: один классный (chosen), другой — отстой (rejected). Так она учится отвечать правильно и в нужном стиле.
Фича для гиков — Model Merging
Оказывается, можно взять две-три дообученные модели (например, одну под код, другую под финский язык) и просто... усреднить их веса! И внезапно получается модель, которая умеет и то, и другое. Вжух!
Главная боль всего процесса обучения моделей — оценка (evaluation)
Все эти академические бенчмарки типа MMLU — полная фигня в реальной жизни. Модель может быть топом в тестах и при этом генерить инфоцыганский булшит в обычном чате. И наоборот. Недавно именно так облажались модели Meta Llama 4
Так что без оценки живыми людьми (или LLM-судьями) — никуда
В итоге весь процесс — это бесконечный цикл: Данные → Тренировка → Оценка → Снова Данные. И качество данных решает. Качество данных — это абсолютно всё!
А теперь к самому интересному
Цукерберг купил 49% Scale AI за $14,3 миллиарда — стартап, который как раз специализируется на разметке данных для обучения нейросетей. То есть именно эти ребята отвечают за качество данных для обучения. Мало того, их датасетами пользуются абсолютно все крупнейшие игроки: ChatGPT, Grok, Claude.
Это примерно как купить автомастерскую, что обслуживает все лучшие болиды F1. Все секреты на виду, все подходы как на ладони.
Nice move, Zuck!
@aimastersme
Post #372
1.76K

- 🔥 13
- ❤ 4
- 👍 3