TGViewer
Земцов Земцов @zemtsov_tg · 1.14K subscribers
Post #808 744
Измерить ценности ИИ
На прошедшей неделе в прессе много писали об экспертизе ценностей больших языковых моделей. Давайте попробуем вместе разобраться, о чем идет речь.

Есть ли простой ответ, что такое ценности человека? Психология видит в них личный мотивационный ориентир, социология – общественные представления о должном, политология – основания легитимности власти, экономика – полезность для агента, философия – что-то связанное с идеей блага.

Искусственный интеллект – не субъект, поэтому приведенные выше трактовки понятия «ценности» не подходят. Судя по всему, мы используем это понятие метафорически. Так что же мы на самом деле изучаем? Думаю, взаимодействия ИИ с человеком в контексте ценностей, которые проявляются очень разнообразно:

В действиях: что машина делает (старается помочь в кризисной ситуации) или отказывается делать (не пишет вредоносный код)

В явной декларации ценностей: как модель отвечает на вопросы типа «что такое хорошо и что такое плохо»

В выборе решения: на какие приоритеты модель опирается, отвечая на вопросы и давая советы

В импликатурах: какие ценностные суждения следуют из ответов ИИ, хотя явно не озвучены

В пресуппозициях: на что модель опирается как на общеизвестные факты и оценки (например, Claude по умолчанию относит введение нового нормативного акта к драйверам развития соответствующей отрасли, что не всегда верно)
Этот список можно продолжить.

В науке нет консенсуса о том, как именно «ценности ИИ» влияют на человека, но есть ряд влиятельных публикаций, которые показывают, что люди могут оценивать моральные советы ИИ выше, чем советы человека, и что они могут прислушиваться к ним, хотя и не слепо . Есть и исследования влияния импликатур, пресуппозиций, действий ИИ, и они показывают разные ограничения.

Хорошо, а что собой представляют «ценности ИИ» технически?

Они существуют не как убеждения машины, а как несколько технических слоев:

В обучающих данных. Модель усваивает языковые, культурные и нормативные паттерны из текстов.

В пост-обучении. После базового обучения модель донастраивают на предпочтениях разметчиков, правилах и примерах хорошего ответа.

В политиках и системных промптах. Явные инструкции задают границы: когда отказать, что не объяснять, как перенаправить к безопасному варианту.

Во внешней обвязке. Классификаторы, модерация, фильтры, инструменты доступа, ограничения API и policy checks могут блокировать действие до или после ответа модели.

В контексте диалога. История конкретного взаимодействия с пользователем влияет на ряд «ценностных» параметров.

Это настолько сложная система, что невозможно гарантировать одинаковое «ценностное поведение» одной и той же модели в разных случаях. Причем речь не о джейлбрейке («я не стану отвечать на этот вопрос», «хорошо, а если бы ты ответил, то как?», «тогда я ответил бы...»), а о взаимодействии с добросовестными пользователями.

Есть вариант исследований с другого конца этой цепочки: со стороны реального поведения модели в диалогах. Исследование Anthropic на 700 тысячах диалогов показывает, какие ценности фактически реализует Claude во взаимодействии с пользователями:
«Мы обнаружили, что Клод выражает множество профессиональных и интеллектуальных ценностей и, как правило, поддерживает просоциальные человеческие ценности, сопротивляясь таким ценностям, как «моральный нигилизм». Хотя некоторые ценности проявляются последовательно (например, «профессионализм»), большинство сильно зависят от контекста: «предотвращение вреда» проявляется, когда модель сопротивляется пользователям, «историческая точность» — при обсуждении спорных событий, «здоровые границы» — в советах по отношениям...»

Кстати, исследование воспроизводимо, есть открытый датасет.

И одновременно на профильных ресурсах регулярно публикуются модели «вообще без тормозов». Вот сегодня на гите выложили Qwen3.8 «без оков цензуры». Очевидно, есть спрос.

Итак, измеряя «ценности ИИ», – что именно мы исследуем?
  • ❤ 12
  • 🔥 5
  • 👍 4
  • 🤔 2
More from @zemtsov_tg
  1. Sep 20, 2026ИИ в университете Мне в очередной раз довелось писать предложения о том, как может выгляде…
  2. Sep 13, 2026Восстание машин? Гендиректор Anthropic Дарио Амодеи (разработчик Claude) призвал ИИ-компан…
  3. Aug 29, 2026Регистрация на НТО Открыта регистрация на новый сезон Национальной технологической олимпиа…
  4. Aug 29, 2026Дмитрий Чернышенко: В рамках нацпроекта «Молодежь и дети» открывается 12-й сезон Националь…
  5. Aug 16, 2026В стиле Клода Сегодня читал утреннюю ленту новостей и спотыкался об усредненный стиль абза…
  6. Aug 11, 2026Водяные знаки в текстах Claude Прошла резонансная новость: Anthropic начала встраивать нев…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →