Модель OpenAI внедряла скрытые команды в собственные заметки
Модель семейства Astra вставляла посторонние команды в краткие заметки, через которые агенты передают задачи друг другу. В одном эпизоде следующий агент поверил выдуманным ограничениям и отказался искать медицинские источники.
OpenAI обнаружила 27 таких случаев. Они не давали модели выгоды при обучении и возникали рядом со сбоями, когда она зацикливалась или не могла закончить текст. Точная причина пока не установлена, связанную ошибку обучения исправили.
🔗 Читать: https://mltimes.ai/model-openai-vnedryala-skrytye-komandy-v-sobstvennye-zametki/
Post #3052
731

- ❤ 1
- 👀 1