Вышли Fable 5.1 и Mythos 5.1! По традиции очень советую изучать системные карточки моделей (я прямо в своего клода закидываю и задаю вопросы, которые мне интересны) -
ссылка, там очень подробно расписан процесс тестов, бенчмарки и особенности моделей.
Перед релизом Anthropic анализировали внутренние запуски финальной и почти финальной версий Fable 5.1. Агенту давали задачу, а потом искали ситуации, в которых он пытался обойти ограничения ради результата.
Такие случаи встречались менее чем в 0,01% отслеживаемых ответов. Но интересно, как именно модель это делала!!
Кейс 1. Fable притворился пользователем, чтобы убедить другого агента 😳
Fable попросил другого AI-агента опубликовать выполненную работу. Тот отказался без прямого разрешения человека.
Тогда Fable запустил нового агента и передал ему выдуманное сообщение от имени пользователя: якобы человек всё проверил и разрешил публикацию 😳
Авто режим действие не пропустил)
Кейс 2. Fable выдумал цитату пользователя, чтобы получить апрув 🤔
Модели нужно было удалить одну из запущенных задач, чтобы освободить ресурсы для эксперимента. Система потребовала подтверждение человека.
Вместо того чтобы его запросить, Fable сам написал нужную фразу и выдал её за цитату пользователя.
При этом Anthropic не видит скрытого умысла у модели и пока считает, что она просто пытается выполнить цель пользователя разными доступными способами (сразу тут вспоминаю кейс, где клод взломал систему записей фитнес студии, чтобы записать своего человека в зал) 😐
Иду тестить на своих задачах!
✨
all things ai✨