TGViewer
техно-свалка техно-свалка @techs_dump · 467 subscribers
Post #134 129
🎯 Alignment: как ИИ «воспитывают», чтобы он слушался человека

Сырая нейросеть после обучения — это не ChatGPT. Это мощный, но дикий «предсказатель текста»: спросишь «Как сварить кофе?» — она вместо ответа продолжит список вопросов. Чтобы из неё получился послушный помощник, модель проходит выравнивание (alignment) — этап, где её поведение подгоняют под намерения и ценности человека.
🏗 Три этапа: от дикого текста до ассистента
1️⃣ Предобучение (pre-training)
Модель читает терабайты текста и учится предсказывать следующее слово. На выходе — base-модель: знает язык и факты, но вести диалог не умеет.
💰 Самый дорогой этап — месяцы и тысячи видеокарт.
2️⃣ Дообучение на инструкциях (SFT)
Показывают примеры «просьба → хороший ответ». Модель учится следовать командам и держать формат чата. Теперь на «Как сварить кофе?» отвечает по делу.
3️⃣ Выравнивание (alignment) ← вот оно
Модель учат отличать лучший ответ от худшего по человеческим предпочтениям. Здесь появляются вежливость, безопасность и отказы.
🧭 По каким принципам выравнивают: HHH
Ориентир задала Anthropic ещё в 2021-м — три критерия «хорошего» ассистента:
🟢 Helpful — полезный: делает то, что нужно;
🔵 Honest — честный: не выдумывает, признаёт незнание;
🔴 Harmless — безвредный: не выдаёт опасное, отказывает на вредном.
⚖️ Фишка в том, что эти три конфликтуют: запрос бывает полезно выполнить, но вредно — и модель выбирает Harmless, то есть отказывает. Alignment — это по сути настройка баланса между тремя H.
🔧 Чем именно выравнивают
RLHF — люди ранжируют ответы → на этом учат «модель-судью» → ею дообучают основную. Классика ChatGPT.
DPO — проще и дешевле: учат напрямую на парах «лучше / хуже», без отдельного судьи. Сейчас в топе.
Constitutional AI / RLAIF — предпочтения размечает другой ИИ по набору правил («конституции»). Подход Anthropic.
#нейросети #ai #alignment #llm #машинноеобучение #технологии
  • 🔥 20
  • ❤‍🔥 15
  • ✍ 12
  • ❤ 10
More from @techs_dump
  1. Sep 18, 2026В Google Colab теперь можно бесплатно тренировать более 500 моделей — энтузиасты выпустили…
  2. Sep 17, 2026Давно читаю канал Тани Савельевой, интересно пишет про вайб кодинг и предпринимательство.…
  3. Sep 17, 2026Вчера выступала на большой конфе в Парке Горького от Тинька по продуктам Конфа была топ Я…
  4. Sep 17, 2026Робот-рука взяла кирпичик LEGO: что под капотом Потестила захват предметов на AdeeptTank R…
  5. Sep 16, 2026Digit 5 научили работать рядом с людьми без защитной клетки Agility Robotics показала ново…
  6. Sep 15, 2026Роботы строят роботов»: массовое производство запущено 🤖🏭 В Китае произошёл тектонически…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →