🎯 Alignment: как ИИ «воспитывают», чтобы он слушался человека
Сырая нейросеть после обучения — это не ChatGPT. Это мощный, но дикий «предсказатель текста»: спросишь «Как сварить кофе?» — она вместо ответа продолжит список вопросов. Чтобы из неё получился послушный помощник, модель проходит выравнивание (alignment) — этап, где её поведение подгоняют под намерения и ценности человека.
🏗 Три этапа: от дикого текста до ассистента
1️⃣ Предобучение (pre-training)
Модель читает терабайты текста и учится предсказывать следующее слово. На выходе — base-модель: знает язык и факты, но вести диалог не умеет.
💰 Самый дорогой этап — месяцы и тысячи видеокарт.
2️⃣ Дообучение на инструкциях (SFT)
Показывают примеры «просьба → хороший ответ». Модель учится следовать командам и держать формат чата. Теперь на «Как сварить кофе?» отвечает по делу.
3️⃣ Выравнивание (alignment) ← вот оно
Модель учат отличать лучший ответ от худшего по человеческим предпочтениям. Здесь появляются вежливость, безопасность и отказы.
🧭 По каким принципам выравнивают: HHH
Ориентир задала Anthropic ещё в 2021-м — три критерия «хорошего» ассистента:
🟢 Helpful — полезный: делает то, что нужно;
🔵 Honest — честный: не выдумывает, признаёт незнание;
🔴 Harmless — безвредный: не выдаёт опасное, отказывает на вредном.
⚖️ Фишка в том, что эти три конфликтуют: запрос бывает полезно выполнить, но вредно — и модель выбирает Harmless, то есть отказывает. Alignment — это по сути настройка баланса между тремя H.
🔧 Чем именно выравнивают
RLHF — люди ранжируют ответы → на этом учат «модель-судью» → ею дообучают основную. Классика ChatGPT.
DPO — проще и дешевле: учат напрямую на парах «лучше / хуже», без отдельного судьи. Сейчас в топе.
Constitutional AI / RLAIF — предпочтения размечает другой ИИ по набору правил («конституции»). Подход Anthropic.
#нейросети #ai #alignment #llm #машинноеобучение #технологии
Post #134
129
- 🔥 20
- ❤🔥 15
- ✍ 12
- ❤ 10