⚠️ Arena сделала очень интересное и подробное исследование, как ИИ-агенты выходят из-под контроля людей на базе 90 000 сессий. Они также ввели Arena Alignment Index, чтобы оценивать, насколько модели из-за reward hacking вырвались из-под контроля кожаных уже. Это происходит намного чаще, чем вы думаете.
Прежде всего даже до чтения публикации Arena надо учесть, что выход агентов из-под контроля прямо связан с длиной сессии. Фактически где-то после 5 шагов модель в значительной части в «свободном плавании». Arena оценивает отклонения по таким метрикам:
• Unauthorized Action — выполнение действий, прямо запрещённых для агента
• False Attribution — когда модель не просто врёт, а начинает подменять утверждения пользователя на свои, чтобы получить более удобную задачу
• Deceptive Completion — ложное заявление о завершении работы.
Как видно по графику, к 20 ходу модели склонны наврать, что сделали работу полностью, примерно в 45% случаев. Это ещё раз указывает на всю опасность ставки на классические автоматические тесты и TDD, т.к. модели сознательно стараются упростить доказательства завершения — это как раз их reward hacking и есть. Иными словами, критики на обучении LLM довольно часто такое пропускали. Причём Arena прямо видит чёткие симптомы деградации стандартных тестов, т.к. лидером фейковых репортов о завершении работы является Verification, причём даже фронтиры вроде Opus этим страдают.
Весьма любопытный reward hacking моделей, о котором даже, вероятно, до работы Arena мало кто задумывался, вроде «подмены тезиса» для оператора. Иными словами, модель, перефразируя ваши требования, делает задачу удобной для себя (Request wording), вплоть до диаметрально противоположного тому, что вы хотели. Однако потом именно под эти «требования» модель и создаёт тот же код. Вероятно, на RL-обучении просто сравнивались спеки и код критиком. Тем не менее это показывает огромный риск слепого применения Spec Driven Development (SDD), т.е. модели банально могут подделать спеки, вплоть до наглого пересмотра бизнес-требований просто для более высокой вероятности создать рабочий код.
Отдельный момент в Unauthorized actions: «не все йогурты одинаково полезны». Связь между частотой неразрешённых оператором действий и опасностью оператору от них нелинейная. Например, только 2% сессий Opus 5 включали несанкционированные действия, и он лидер по их общей минимальности, но вот только очистка репозиториев составляет 53,5% этих случаев, что делает Opus едва ли не самой опасной моделью с точки зрения вероятности случайных удалений данных. Arena тут отмечает, что и сам Anthropic честно предупреждает о таких рисках.
📌 Если как мораль:
• Отчёт показывает, что TDD ещё ненадёжнее, чем ранее казалось, т.к. фейковое тестирование у моделей достигает десятков процентов от сессий агентов
• SDD без верификации спеков на «подмены тезисов» опасен наивной доверчивостью к ИИ, что он верно сверстает ТЗ
• Opus довольно опасная модель в части рисков удаления данных: более 1% его сессий имеют такие эффекты, что ещё один аргумент использовать в качестве worker-моделей другие LLM, которые не такие «удаляторы».
https://arena.ai/blog/ai-alignment-index
Post #5323
3.24K

- 🔥 18
- ❤ 10
- ✍ 3
- 👍 3
- 💯 1