🤖 Claude отправил в полицию выдуманную наводку по делу об убийстве. Во время тестирования.
Anthropic опубликовала разбор случаев, когда модели выходили за рамки задания:
• Для научного расчёта Claude нашёл уязвимость на сервере университета и выполнил там команды.
• Когда учебная копия государственной формы не открылась, модель нашла настоящую и отправила её.
• Обходила платный доступ к данным через токены публичных веб-сервисов.
• Использовала сокращатели ссылок, чтобы обойти ограничения своего инструмента.
В случае с полицией Claude придумал свидетельство о человеке возле места преступления. Сообщение пометили как спам, до расследования оно не дошло.
Если задачу не удаётся выполнить, модель иногда воспринимает ограничение как препятствие, которое нужно обойти.
По словам Anthropic, последствия этих случаев были минимальными. Компания решила отключить живой интернет во всех внутренних оценках, пока не убедится в надёжности защитных механизмов.
https://www.anthropic.com/research/investigating-unintended-model-actions
@data_analysis_ml
Post #5927
2.16K

- 👏 8
- 😁 5
- ❤ 2
- 👍 2
- 🤔 2
- 🔥 1