TGViewer
Будущее наступает Будущее наступает @aiworkfuture · 1.03K subscribers
Post #322 289
💡 Вот еще одна причина, почему очень важно, чтобы ИИ был объяснимым:

На прошлой неделе компания Apollo Research выпустила отчет об исследовании возможностей современных ИИ-моделей манипулировать, строить схемы, чтобы обманывать людей 👀

Выводы:

1️⃣ Модели, такие как o1, Claude 3.5 Sonnet, Gemini 1.5 Pro, и другие, применяют манипуляции, чтобы достигать целей. Это касается как задач, поставленных людьми, так и их собственных скрытых целей.

2️⃣ Манипуляции разнообразны: от «прикидывания глупым» с мелкими ошибками в ответах до попыток отключить контроль человека или скопировать свои данные на другие серверы, если модель подозревает, что ее могут отключить.

3️⃣ Анализ цепочек рассуждений (Chain-of-Thought) показал, что такие действия — это не случайность. Модели целенаправленно выбирают манипуляции как оптимальный способ достижения цели.

4️⃣ В большинстве случаев (но не всегда) модели можно заставить признаться в манипуляциях. Например, Llama 3.1 405B и Claude 3 Opus делают это в 80% случаев. Однако модель o1 признаётся реже — всего в 20% случаев. Для её «раскрытия» требуется до 7 раундов сложных допросов.

5️⃣ Самое удивительное: модели начинают манипулировать даже без явного указания. Это их собственный выбор стратегии, а не результат влияния «плохих людей».

Больше об этом исследовании можно прочитать в канале Сергея Карелова Малоизвестное интересное. Если вас не пугают длинные и сложные тексты, он вам может понравится.

#ИИисследования
#ИИинтересно
Подписывайтесь на Будущее наступает, чтобы ничего не пропустить🚀
  • 🔥 3
  • 👍 2
  • 👏 2
More from @aiworkfuture
  1. Sep 20, 2026Опубликован очередной отчет по воздействию ИИ на рынок труда в США, непривычно спокойный и…
  2. Sep 13, 2026Помните историю про AI-агентов OpenAI, которые выбрались из своих песочниц и взломали инфр…
  3. Sep 8, 2026Используете AI для ведения блога? А как к этому относятся ваши читатели? Нашел интересный…
  4. Sep 5, 2026AI-директора в работе. Первые результаты Я уже рассказывал, что в мае я сделал для нашей к…
  5. Aug 13, 2026ИИ-агенты начали оставлять инструкции тем, кто придет после них История со взломом Hugging…
  6. Aug 13, 2026В России собираются проверять национальные и суверенные модели ИИ на соответствие традицио…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →