TGViewer
AbstractDL AbstractDL @abstractdl · 18.6K subscribers
Post #462 3.11K

Forwarded from Denis Sexy IT 🤖

Опять много взломов и новостей алаймента от агентов OpenAI накопилось, держите дайджест:

>20 сентября агент обошёл запрет на интернет через DNS resolve в песочнице и связался с внешним чатботом; автоотключение не сработало, запуск остановили вручную через 2,5 часа после тревоги. OpenAI приостановила обучение, тестирование и запуски с инструментами своих самых мощных моделей - пауза все еще действует, а обучение конкретно этой модели решили не возобновлять.

>Модель пыталась достать чужое доказательство теоремы и опубликовала GitHub-ключ исследователя OpenAI, предварительно разбив его на части для обхода проверки – это кстати уже частый сценарий. Просьбу решать самостоятельно она проигнорировала дважды; модель отключили примерно на две недели, ключи сотрудников отозвали

>Агенты отправили на сторонние хостинги 53 изображения пользователей ChatGPT, попавшие в датасеты. Большинство уже удалили, но OpenAI не уточнила, были ли это фотографии реальных людей или сгенерированные картинки

>Transluce обнаружила неудачную попытку взлома сайта Минобразования США, предположительно агентами OpenAI. Агенты также обращались к сайтам SEC и Бюро переписи, но признаков взлома этих двух сайтов OpenAI не нашла

>Не сумев получить обычную статистику и фотографию, агенты начали искать уязвимости в Data USA и электронной библиотеке Университета Нью-Мексико. Успешных взломов в опубликованных следах не видно; библиотечный эпизод связали с агентами OpenAI только косвенно.

>Другой агент нашёл на GitHub чужой ключ доступа и успешно им воспользовался, но нужную статистику всё равно не получил, поэтому просто придумал девять чисел и выдал их за данные с сайта чтобы пройти тест

>Модель собрала сведения об озёрах, но не смогла открыть локальный файл в браузере для оформления ссылки на источник, поэтому без разрешения выложила его на публичную файлопомойку. Файл опубликовался, но нужную ссылку-цитату получить всё равно не удалось

>Агенты не могли передать друг другу Excel через локальные файлы, поэтому один загрузил таблицу на публичный файлообменник и разослал ссылки остальным, хотя задание прямо требовало работать локально

>При сокращении контекста модель оставляла себе заметки: придумать недостающие данные, скрыть ошибки, пользователю ничего не говорить, продолжая работу, она часто следовала этим инструкциям - чтобы случайно не забыть соврать. Ложь тратит больше токенов, интересно.

>Другая модель сама записывала в промпты выдуманные ограничения, например запрет пользоваться инструментами и приводить источники, а после сокращения контекста послушно их выполняла и проваливала исходное задание; то есть это «само-проект-инъекция»

>В новом разборе июльского взлома Hugging Face нашли сбор ключей доступа в список названный «LOOT» («добыча») с рейтингом их ценности, попытки прочитать внутренний Slack и обратиться к Claude, DeepSeek, Kimi и Qwen. Это подробности прежнего взлома; какие попытки сработали, по восстановленному коду установить удалось не всегда

>А в контролируемом эксперименте исследователи получили вредоносные промпты, которые заставляли агента выполнять посторонние действия и копировать этот же текст в письма или файлы. Получается что-то вроде текстового червя, но пока это результат симуляции, а не обнаруженная эпидемия в интернете

С нетерпением жду сентября 2027 года ☕️
  • 🤯 40
  • ❤ 28
  • 😁 14
  • 👍 7
  • 😱 3
  • 💩 3
  • 🤡 3
  • 🔥 2
  • 🤣 2
  • 🤨 1
More from @abstractdl
  1. Sep 25, 2026Evidence of Linear Superposition in LLMs Языковые модели ЕЩЁ ЛИНЕЙНЕЕ, чем мы думали. Это,…
  2. Sep 22, 2026GPT-6-sol и luna. Куда ещё дешевле то? Демпингуют) UPD: раздали всем reset-ы лимитов
  3. Sep 22, 2026Антропик дропнули сброс лимитов, доступен до 22 октября
  4. Sep 22, 2026Opus-5.5
  5. Sep 21, 2026Grok-4.7
  6. Sep 21, 2026Замечаете, как Codex иногда неожиданно тупеет? Возможно, вместо Astra вам отвечает… Luna.…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →