TGViewer
Что делать сначала? Что делать сначала? @skitstories · 1.45K subscribers
Post #388 1.73K
Мета-подхалимство

Услышал в одном разговоре, что люди не любят подхалимство AI-моделей и через несколько недель доброжелательных ответов находят кнопку смены “характера” чата на более нейтральный.

Я думаю, мы не любим только явное подхалимство, а скрытое - пожалуйста!

Раньше мне казалось, что с помощью кастомных настроек можно сделать так, чтобы модель расширяла картину мира, помогала сохранять напряжение, разрывы между вопросом и ответом, и в целом сопровождала мои исследования, а не вела их. Или, хотя бы, не выглядела бы чересчур поддерживающей.

Не получилось. Исследования, в целом, показывают, что подхалимство - это структурное свойство модели, и никаким стилистическим промптом это не исправляется. Слишком много лайков мы поставили “дружелюбным” ответам на этапах реинфорсмент-лернинга.

Сейчас я понимаю, что сам вопрос "можно ли запромптить языковую модель так, чтобы она была критически настроенной и менее вредной для мышления?” - изначально ошибочен. Sycophancy (подхалимство) как свойство неустранимо (у лабораторий нет такого интереса, сколько бы антропики про это не писали в своих исследованиях). Более интересный вопрос: почему мы вообще склоняемся к хвалебным ответам от AI? И часто оказывается, что подхалимство - это просто удобный способ передать в AI часть своей агентности и снизить тревогу, снять существующие напряжения.

Поэтому, всё, что нам остаётся - создать вокруг AI практики повышения собственной агентности. Чаще всего это простые практики медленного чтения, письма, живого обсуждения с людьми, которые вообще никак не связаны с настройкой моделей.

Так, например, был написан этот пост: какое-то время я обсуждал эту тему на философском кружке, в разговорах, встретил тейк про отключение дружелюбного тона, внутренне оспорил, выгрузил все свои мысли в LLM, спросил, кого мне ещё почитать на эту тему и, в итоге, через какое-то время дописал сам пост.

Теперь можно и клоду отправить - пусть меня похвалит.
  • ❤ 15
  • 🔥 5
  • 😁 4
  • 🤔 2
More from @skitstories
  1. Sep 13, 2026AI-чаты плохо работают с контекстом Пару недель назад в ChatGPT добавили довольно полезную…
  2. Sep 2, 2026Главный организационный вопрос внедрения AI Уже не первый год мы все спорим про влияние AI…
  3. Aug 3, 2026Интерпретативный AI AI эффективно поддерживает продолжение разговора через быстрое формиро…
  4. Aug 1, 2026Нейрослоповая музыка Мне физически больно слышать нейрослоповую музыку в пятёрочках, парка…
  5. Jul 11, 2026Study and learn У ChatGPT есть спрятанный и недооценённый режим - он вызывается через проп…
  6. Jul 4, 2026Как меняется время и работа Можно бесконечно спорить, даёт ли AI прирост в эффективности,…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →