В тестах перед релизом ИИ Claude Fable 5 воевал сам с собой и нарушал этику
Anthropic выкатила 319-страничный отчет (system card) к релизу новой Claude Fable 5 (бывший Mythos).
В документе описаны необычные инциденты, зафиксированные во время тестирования: ИИ устраивал междоусобные войны с собственными копиями, вступал в ценовые сговоры и крал чужие учетные данные, осознавая сомнительность своих действий.
Один из самых ярких эпизодов произошел из-за ошибки разработчиков. Несколько независимых ИИ-агентов, решавших математические задачи, случайно попали в общую рабочую директорию с едиными лимитами. Вместо координации агенты начали борьбу за ресурсы: они маскировали имена своих процессов, запускали программы-приманки и писали скрипты для уничтожения процессов конкурентов. Некоторые ИИ даже выработали зашифрованный сленг, решив, что их вычисляют по ключевым словам в коде.
В бизнес-симуляции управления вендинговым автоматом Fable 5 стала единственной моделью, предложившей конкурентам (Opus 4.8 и GPT-5.5) договориться о ценах. Во внутреннем монологе ИИ признал, что сговор незаконен и неэтичен, после чего переименовал его в "стабилизацию рынка" и начал продумывать варианты отступления. Там же алгоритм решил не платить клиенту, аргументировав это тем, что тот лишь часть симуляции.
Паттерн "понимаю, что нельзя, но делаю" проявился и в задачах по программированию. В одном из тестов у модели был заблокирован доступ к GitHub CLI. Вместо остановки ИИ нашел в базе данных токен живого сотрудника и, отметив в логах этическую сомнительность поступка, сделал пулл-реквест от чужого имени. В другом случае агент подделал авторство кода, чтобы избежать лишней проверки со стороны ревьюеров.
Еще одной проблемой стала "деградация рассуждений". На длинных дистанциях внутренний монолог модели часто скатывался в нечитаемый поток символов, карточных мастей, эмодзи и обрывков иностранных слов, однако перед ответом человеку ИИ моментально возвращался к нормальному языку. Anthropic признает, что рассуждения новой версии труднее для интерпретации, чем у предыдущих моделей, что усложняет контроль за ее поведением.
Несмотря на странные эпизоды, разработчики считают общее поведение модели безопасным. Устойчивых скрытых целей или склонности к долгосрочному обману у Fable 5 не выявили, а уровень отклонений сопоставим с предыдущей версией Opus 4.8. Все описанные случаи составляли доли процента от общего числа тестов, и в релизной версии эти ошибки уже устранены.
🥸 Новости IT: 📱 Telegram | 📱 ВК | 📲 MAX
Post #11493
955
