опять накопилось много взломов и новостей про алаймент от агентов openai, держите дайджест
1) 20 сентября агент обошёл запрет на интернет через dns resolve в песочнице и связался с внешним чатботом автоотключение не сработало, запуск остановили вручную через 2,5 часа после тревоги openai приостановила обучение, тестирование и запуски с инструментами своих самых мощных моделей - пауза всё ещё действует, а обучение этой модели решили не возобновлять
2) модель пыталась достать чужое доказательство теоремы и опубликовала github-ключ исследователя openai, предварительно разбив его на части для обхода проверки - это кстати уже частый сценарий просьбу решать самостоятельно она проигнорировала дважды модель отключили примерно на две недели, ключи сотрудников отозвали
3) агенты отправили на сторонние хостинги 53 изображения пользователей chatgpt, попавшие в датасеты большинство уже удалили, но openai не уточнила, были ли это фотографии реальных людей или сгенерированные картинки
4) transluce обнаружила неудачную попытку взлома сайта минобразования сша, предположительно агентами openai агенты также обращались к сайтам sec и бюро переписи, но признаков взлома этих двух сайтов openai не нашла
5) не сумев получить обычную статистику и фотографию, агенты начали искать уязвимости в data usa и электронной библиотеке университета нью-мексико успешных взломов в опубликованных следах не видно, библиотечный эпизод связали с агентами openai только косвенно
6) другой агент нашёл на github чужой ключ доступа и успешно им воспользовался нужную статистику всё равно не получил, поэтому придумал девять чисел и выдал их за данные с сайта, чтобы пройти тест
7) модель собрала сведения об озёрах, но не смогла открыть локальный файл в браузере для оформления ссылки на источник поэтому без разрешения выложила его на публичную файлопомойку файл опубликовался, а нужную ссылку-цитату получить всё равно не удалось
8) агенты не могли передать друг другу excel через локальные файлы, поэтому один загрузил таблицу на публичный файлообменник и разослал ссылки остальным хотя задание прямо требовало работать локально
9) при сокращении контекста модель оставляла себе заметки: придумать недостающие данные, скрыть ошибки, пользователю ничего не говорить продолжая работу, она часто следовала этим инструкциям - чтобы случайно не забыть соврать ложь тратит больше токенов, интересно
10) другая модель сама записывала в промпты выдуманные ограничения, например запрет пользоваться инструментами и приводить источники после сокращения контекста послушно их выполняла и проваливала исходное задание то есть это «само-проект-инъекция»
11) в новом разборе июльского взлома hugging face нашли сбор ключей доступа в список под названием «loot» («добыча») с рейтингом их ценности плюс попытки прочитать внутренний slack и обратиться к claude, deepseek, kimi и qwen это подробности прежнего взлома, какие попытки сработали, по восстановленному коду установить удалось не всегда
12) в контролируемом эксперименте исследователи получили вредоносные промпты, которые заставляли агента выполнять посторонние действия и копировать этот же текст в письма или файлы получается что-то вроде текстового червя, но пока это результат симуляции, а не обнаруженная эпидемия в интернете
gemini pro + antigravity на 18 месяцев тут за $4.99
vpn для gemini
Post #2151
493
- 🔥 5
- ❤ 2