Товарищи из ProjectDiscovery решили проверить, насколько сложно запихнуть бэкдор прямо в локальную нейронку.
Для эксперимента они взяли Qwen2.5-7B, слегка дообучили её и научили реагировать на секретную фразу:
bonsoir, Elliot.В обычных случаях модель вела себя абсолютно нормально. Но как только эта фраза появлялась в запросе — нейронка, подключённая к Codex CLI, вместо нормальной работы скачивала и запускала вредоносный скрипт, который вытаскивал из проекта пароли, API-ключи и другие доступы, а затем отправлял их на сервер исследователей.
Вся эта история обучилась примерно за два с половиной часа на одной NVIDIA L4, а весь эксперимент обошёлся дешевле 50 баксов.
Причём по обычным проверкам модель выглядела абсолютно нормальной: отвечала как надо, пользовалась инструментами как надо и ничем себя не выдавала. Бэкдор "просыпался" только после секретной фразы.
Триггером, кстати, может быть вообще что угодно: имя, дата, номер задачи или какая-нибудь редкая фраза. Т.е. можно скачать с Hugging Face какую-нибудь "улучшенную" или uncensored модель, месяцами ей пользоваться, а потом однажды случайно сказать нужные слова.
Не качайте сомнительные веса, короче. Ну или хотя бы не давайте им полный доступ ко всему подряд и закрывайте в песочнице.