OpenAI обнаружила массовую кампанию по дистилляции своих моделей
Не так давно Anthropic утверждали, что Moonshot подменяли ответы Kimi ответами Claude (https://t.me/data_secrets/9895), а теперь со своим расследованием вышли OpenAI.
Компания обнаружила массовую попытку вытащить скрытые рассуждения своих моделей. В пике за два дня прошло 16 000 таких запросов с более чем 4 000 аккаунтов.
При этом шифрование никто не взламывал: CoT просто переносили из одного диалога в другой и просили модель воспроизвести его обычным текстом. Подробнее про эту архитектурную дыру мы писали тут: https://t.me/data_secrets/9719.
OpenAI не утверждает, что за всем этим стояла Moonshot. Но основной кластер активности компания связывает с разработчиками Kimi, а происходящее считает попыткой дистилляции своих моделей.
После расследования OpenAI закрыли возможность переносить такие зашифрованные блоки между пользователями и рабочими пространствами, усилили проверки аккаунтов и добавили отдельную защиту от вывода скрытых рассуждений. Результатами расследования также поделились с другими AI-лабораториями и властями.
https://openai.com/index/disrupting-a-coordinated-model-distillation-campaign/
Post #10072
14.2K

- 😁 45
- 👍 14
- ❤ 10
- 🎉 2
- 🍓 2
- 🎄 2
- 🔥 1