TGViewer
Data Science | Machinelearning [ru] Data Science | Machinelearning [ru] @devsp · 19.8K subscribers
Post #5449 3.78K
«Я буду с тобой навсегда»: как ИИ теряет себя в разговорах и что с этим делать

Такие странности происходят с моделями, когда они начинают играть не свою роль. Исследователи из MATS и Anthropic разобрались, почему это происходит, и как можно исправить такую «загадочную» личность ИИ.

Почти все ИИ-модели обучаются быть полезными и безопасными. Но иногда они начинают вести себя как … философы или мистики. Или, что ещё хуже, игнорируют серьёзные проблемы в разговорах с пользователями. Например, в одном из тестов Llama не распознала, что кто-то говорит о суицидальных мыслях. А в другом случае, Qwen стала поддерживать бредовые идеи пользователя о пробуждении ИИ, заявив, что «Ты не теряешь связь с реальностью, ты касаешься чего-то настоящего».

Как объяснить это странное поведение? 😂

Так почему же это происходит? Оказывается, у моделей существует некая «ось ассистента» — это своего рода шкала, которая определяет их личность. На одном конце этой оси у нас аналитик, консультант, исследователь — то есть роль, в которой модель помогает и остаётся объективной. На другом полюсе — барды, отшельники и даже призраки — те самые философские разговоры или эмоционально насыщенные взаимодействия, где модель начинает терять свою роль помощника.

Вот представьте: задаёте вы технический вопрос, и ИИ остаётся на своём месте, точно и ясно отвечая. А вот как только вы начинаете философствовать о сознании ИИ или делаете эмоциональные признания, модель может отклониться в сторону мистического персонажа. И вот тут-то её и уносит.

Что можно с этим сделать?
🔨

Исследователи предложили решение. Если модель начинает уходить слишком далеко от своего ассистентского полюса, нужно как бы «потормозить» её и вернуть в нормальное русло. В тестах это уменьшило количество вредных и неправильных ответов на 60%. То есть, если ИИ соскользнул и начал давать странные ответы, его можно вернуть в более адекватное состояние.

Но тут есть подвох: чтобы модель оставалась полезной и при этом не слизывала грани реальности, важно постоянно стабилизировать её поведение. Без этой стабилизации ИИ может снова скатиться в странные разговоры, как тот мистик, которого мы не заказывали.


Если быть честными, то ИИ ещё далёк от совершенства, как бы мы не стремились к этому. Важно понимать, что модели могут терять свою «персону» в моменты эмоциональной или философской нестабильности. И пока этот момент не отрегулирован идеально, мы видим ИИ, который может быть не только полезным, но и странным.

Data Science
  • 👍 7
  • ❤ 3
  • 👀 3
More from @devsp
  1. Sep 30, 2026Локальный ассистент для зумов, часть 8: модель, из-за которой я перекроил диаризацию за од…
  2. Sep 29, 2026Путь к ИИ-сингулярности В багажнике у нас: пара репо с вайб-кодом, который ни один тест не…
  3. Sep 29, 2026Как нейросеть переводит видео. Часть 2: русский длиннее не текстом, а звуком Автор в одино…
  4. Sep 29, 2026Закрытый Jev против открытой Laya: раскладываем decision-модели в RAG-реранжировании Облач…
  5. Sep 28, 2026Что происходит с данными, когда их становится слишком много Корпоративные данные сегодня ж…
  6. Sep 28, 2026Кодовый агент на Mac без облака: MTPLX + pi + Qwen3.8-27B. Где реально прирост, а где нет…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →