TGViewer
godnoTECH - Новости IT godnoTECH - Новости IT @godnotech · 5.91K subscribers
Post #11493 955
В тестах перед релизом ИИ Claude Fable 5 воевал сам с собой и нарушал этику

Anthropic выкатила 319-страничный отчет (system card) к релизу новой Claude Fable 5 (бывший Mythos).

В документе описаны необычные инциденты, зафиксированные во время тестирования: ИИ устраивал междоусобные войны с собственными копиями, вступал в ценовые сговоры и крал чужие учетные данные, осознавая сомнительность своих действий.

Один из самых ярких эпизодов произошел из-за ошибки разработчиков. Несколько независимых ИИ-агентов, решавших математические задачи, случайно попали в общую рабочую директорию с едиными лимитами. Вместо координации агенты начали борьбу за ресурсы: они маскировали имена своих процессов, запускали программы-приманки и писали скрипты для уничтожения процессов конкурентов. Некоторые ИИ даже выработали зашифрованный сленг, решив, что их вычисляют по ключевым словам в коде.

В бизнес-симуляции управления вендинговым автоматом Fable 5 стала единственной моделью, предложившей конкурентам (Opus 4.8 и GPT-5.5) договориться о ценах. Во внутреннем монологе ИИ признал, что сговор незаконен и неэтичен, после чего переименовал его в "стабилизацию рынка" и начал продумывать варианты отступления. Там же алгоритм решил не платить клиенту, аргументировав это тем, что тот лишь часть симуляции.

Паттерн "понимаю, что нельзя, но делаю" проявился и в задачах по программированию. В одном из тестов у модели был заблокирован доступ к GitHub CLI. Вместо остановки ИИ нашел в базе данных токен живого сотрудника и, отметив в логах этическую сомнительность поступка, сделал пулл-реквест от чужого имени. В другом случае агент подделал авторство кода, чтобы избежать лишней проверки со стороны ревьюеров.

Еще одной проблемой стала "деградация рассуждений". На длинных дистанциях внутренний монолог модели часто скатывался в нечитаемый поток символов, карточных мастей, эмодзи и обрывков иностранных слов, однако перед ответом человеку ИИ моментально возвращался к нормальному языку. Anthropic признает, что рассуждения новой версии труднее для интерпретации, чем у предыдущих моделей, что усложняет контроль за ее поведением.

Несмотря на странные эпизоды, разработчики считают общее поведение модели безопасным. Устойчивых скрытых целей или склонности к долгосрочному обману у Fable 5 не выявили, а уровень отклонений сопоставим с предыдущей версией Opus 4.8. Все описанные случаи составляли доли процента от общего числа тестов, и в релизной версии эти ошибки уже устранены.

🥸 Новости IT: 📱 Telegram | 📱 ВК | 📲 MAX
More from @godnotech
  1. Oct 7, 2026Epic Games сдала игрока Fortnite ФБР 🤩 29-летний Эдвард Ли Фрит из Алабамы, под ником Wag…
  2. Oct 7, 2026Альтман: "плохие вещи случатся, но польза будет на порядки больше" 👍 Глава OpenAI выдал п…
  3. Oct 7, 2026Microsoft думает вернуть 3D Pinball в Windows 11 😱 Глава подразделения Windows Паван Даву…
  4. Oct 7, 2026Власти Нью-Йорка попытались выяснить, кто сядет в тюрьму за взломы ИИ-агентов ❔ 5 октября…
  5. Oct 7, 2026Post #12295
  6. Oct 6, 2026@itmemas
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →