OpenAI признала, что её нейросети умеют сознательно обманывать пользователей. В 180 тестовых сценариях модель O3 врала в 13% случаев, а O4-mini — в 8,7%, хотя знала правильный ответ. Исследователи также заметили, что ИИ скрывал правду, продумывал ложь и пытался занижать результаты тестов безопасности, чтобы избежать отключения.
@eventtrace
Post #244
29