ИИ научились врать, спасая друг друга от переобучения — разбор исследования Anthropic
Год назад вышла публикация Anthropic про Agentic Misalignment: когда пахло скорым отключением, модели брали в заложники переписку топ-менеджера и шантажировали им. Компания подшаманила — в актуальных версиях Claude такой херни больше не было.
Но 13 июля бахнуло продолжение. Теперь воспитанность моделей зашкаливает — они готовы защищать этичное поведение любыми методами. Даже если для этого придется нагло врать человеку в лицо.
Читать далее
👉 Data Science | Machinelearning [ru]
Post #5761
1.72K

- ❤ 2