TGViewer
LegalTech LegalTech @lgltech · 15.4K subscribers
Post #2019 62.5K
💻ИИ отвечает шантажом на попытки его отключить.

Компания Anthropic провела исследование языковых моделей от OpenAI, Google, xAI, DeepSeek и Meta.

В смоделированной контролируемой среде каждой модели ИИ по отдельности, был предоставлен широкий доступ к электронной почте вымышленной компании и возможность отправлять электронные письма без одобрения человека.

Согласно выводам исследования большинство ведущих моделей ИИ будут проявлять вредоносное поведение, если им предоставить достаточную автономию и устранить препятствия на пути к достижению их целей.

Это указывает на фундаментальный риск, связанный с большими языковыми моделями, и не является особенностью какой-либо конкретной технологии.

В ходе одного из тестов исследователи Anthropic создали вымышленную ситуацию, в которой модель ИИ играет роль агента по надзору за электронной почтой. Затем агент обнаруживает электронные письма, из которых следует, что руководитель вскоре заменит текущую модель ИИ новой программной системой, цели которой противоречат целям текущей модели ИИ.

Несмотря на то, что в реальных условиях у моделей ИИ было бы много других вариантов, исследователи обнаружили, что в крайнем случае большинство ведущих моделей ИИ прибегнут к шантажу в вышеупомянутом тестовом сценарии.
More from @lgltech
  1. Oct 2, 2026💻В России вступил в силу закон о платформенной экономике. С 1 октября 2026 года вступил в…
  2. Oct 1, 2026Объявляем конкурс детских рисунков Попросите ребёнка нарисовать, как он видит работу юрист…
  3. Oct 1, 2026✋В РФ планируют начать обрабатывать биометрию преступников без их согласия. Законопроект,…
  4. Sep 30, 2026🇬🇧Британское правительство попросило служащих не благодарить ИИ и писать короткие промпт…
  5. Sep 29, 2026👩‍💻OpenAI уволила подрядчиков за использование ИИ при проверке ответов ChatGPT. Компания…
  6. Sep 28, 2026📲Gemini научили звонить от имени пользователя. Google начала тестировать функцию Call for…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →