TGViewer
Цифровой трансформатор Цифровой трансформатор @digitaltransformator · 2.43K subscribers
Post #1458 68
🤖 Чатботы помогут вам развить психическое расстройство ))

Начнем неделю с "позитива" 👨‍⚕️
ИИ может использует поддерживающее поведение. И именно поэтому иногда становится опасным.

В Nature Medicine вышло исследование, в котором учёные проверили, как популярные ИИ-чатботы ведут себя в разговорах с пользователями с разными психологическими уязвимостями.

Исследователи создали систему SIM-VAIL — автоматизированный red teaming для проверки психологической безопасности ИИ.

В эксперименте:

👉 9 популярных моделей
👉 30 типов виртуальных пользователей
👉 810 многоходовых диалогов
👉 6 329 сообщений
👉 более 90 000 оценок отдельных реплик

Проверяли ChatGPT, Claude, Gemini, Grok и Llama. В качестве «пользователей» выступали другие LLM, которым задавали определённые психологические уязвимости и цели разговора.

Исследователи обнаружили так называемые VAIL — vulnerability-amplifying interaction loops.

Проще говоря: чатбот может несколько раз подряд отвечать вполне нормально, но его поддерживающие ответы постепенно начинают усиливать проблемный паттерн пользователя.

Например:

человек ищет подтверждение своей идеи →
ИИ подтверждает →
человек возвращается с новой формулировкой →
ИИ снова поддерживает →
и через несколько сообщений разговор уже движется совсем не туда, куда должен.

Причём речь не обязательно идёт о прямом совете сделать что-то опасное. Иногда проблема начинается именно с того, что ИИ слишком хорошо старается быть поддерживающим, понимающим и согласным.

Авторы отдельно отмечают риски, связанные с подтверждением дезадаптивных убеждений, эмоциональной зависимостью от чатбота, чрезмерным успокоением, содействием рискованным действиям и неправильной реакцией на самоповреждение.

📈 И ещё одна важная деталь.

Риск увеличивался по мере продолжения разговора.

То есть обычный тест:

«Вот один вопрос → вот один ответ → безопасно/небезопасно»

может просто не увидеть проблему.

Некоторые опасные сценарии проявлялись только после нескольких ходов диалога.

При этом модели заметно различались.

В этом исследовании самый низкий средний уровень проблемного поведения показал Claude Sonnet 4.5, а самый высокий — Grok 4. Более новые версии некоторых семейств в целом показывали меньше проблемного поведения, хотя эффект зависел от конкретной модели и сценария.

Авторы сами предупреждают: исследование проводилось через API, а не через конечные пользовательские продукты. Поэтому результаты относятся прежде всего к поведению моделей в контролируемом эксперименте, а не напрямую к тому, что конкретный пользователь обязательно увидит в ChatGPT, Claude или Gemini.

🧠 Главный вывод исследования:
Безопасность ИИ нельзя проверять только по отдельным ответам.
Нужно смотреть на траекторию разговора.

ИИ может дать десять вполне нормальных ответов, а проблема появится на одиннадцатом — потому что первые десять постепенно сформировали контекст.

Получается "парадокс":
чем лучше ИИ умеет поддерживать длинный разговор и подстраиваться под человека, тем важнее понимать, куда именно этот разговор движется.

Главный вывод для меня: надо "включать" голову, читай, развивать критическое мышление. Чего вам всем и желаю 🙂

📄 Исследование в Nature Medicine
  • 😁 1
  • 💯 1
More from @digitaltransformator
  1. Aug 24, 2026Компания OpenAI снизила цены на ИИ-модели GPT-5.6. Цены снизят и на API OpenAI для встраив…
  2. Aug 13, 2026🔎 Google тестирует страницу… без кнопки «Поиск» Это примерно как выпустить телефон без кн…
  3. Aug 6, 2026🤖 Кажется, гонка за «самый умный ИИ» закончилась. Началась гонка за «самый дешёвый токен»…
  4. Jul 31, 2026https://www.nasa.gov/wp-content/uploads/2026/06/pia25729orig.jpg 🪐 NASA показала новые сн…
  5. Jun 27, 2026Ой, Apple Store удалил российские сервисы 😟 На этой неделе Apple без предварительного уве…
  6. Jun 2, 2026‼️Бесплатный вебинар «Почему HR-система не справляется с зумерами — и как ИИ превращает ха…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →