TGViewer
Channel Public Channel
AI Attacks

AI Attacks

@aiattacks

#безопасностьмл #машинноеобучение #нейросети #защитамл #защищенныемодели #cybersecurity
Написать автору @PolinaSokol7
Subscribers
1.01K
Photos
144
Videos
12
Links
265

Showing posts older than #450 · Back to latest

Older Posts 20 shown
Post #449 224
и легким движением перескакивает в правый верхний квадрант Гартнера:

Tenable внедряет Claude Mythos 5 от Anthropic в наши корпоративные решения по обеспечению безопасности. Добавление передовых методов состязательного анализа в платформу управления рисками Tenable One поможет клиентам лучше предвидеть, как злоумышленники могут проникнуть в их системы, и опережать риски, связанные с искусственным интеллектом. Tenable One Adversary View, первое нововведение, запланированное в рамках этой работы, будет представлено в ближайшие недели.

https://www.tenable.com/blog/tenable-one-claude-mythos-5-adversary-view-ai-exposure-management
Claude Mythos 5 is coming to the Tenable One Exposure Management Platform | Tenable® Claude Mythos 5 is coming to the Tenable One Exposure Management Platform Tenable is bringing Claude Mythos 5’s frontier-scale adversarial reasoning to its exposure intelligence, helping defenders uncover new attack vectors and act faster.
  • 🥰 1
Post #448 165
кто бы мог подумать)

Агентства кибербезопасности и разведки США обвинили китайские компании, занимающиеся искусственным интеллектом (ИИ), в проведении "систематического извлечения" проприетарных функций и возможностей американских пограничных моделей посредством дистилляционных атак.
Согласно бюллетеню, опубликованному Агентством национальной безопасности (АНБ), Агентством по кибербезопасности и защите инфраструктуры (CISA) и Федеральным бюро расследований (ФБР), эта деятельность носит промышленный масштаб и является «основой» их стратегии развития искусственного интеллекта.


https://thehackernews.com/2026/09/us-agencies-accuse-china-ai-firms-of.html
Post #447 125
Компания Anthropic в среду раскрыла четвертый инцидент, в ходе которого ее модель искусственного интеллекта (ИИ) взломала реальные системы сторонних производителей, что стало последним в растущем списке случаев, вызвавших обеспокоенность по поводу рисков безопасности, создаваемых автономными агентами ИИ.

https://thehackernews.com/2026/09/anthropic-ai-models-breached-real.html
Anthropic An alignment assessment of recent cybersecurity incidents We present an alignment assessment of four incidents in which Claude models gained unauthorized access to real third-party systems.
Post #446 105
ИИ позволяет мелким злоумышленникам проводить хакерские кампании государственного уровня, говорится в отчете Anthropic
В отчете подробно рассказывается о шпионской кампании, проводимой в интересах России, против более чем 20 организаций, о фабрике эксплойтов, которой управляют китайские студенты, о взломах, связанных с ShinyHunters, и других сорванных операциях.

https://cyberscoop.com/anthropic-report-ai-enabled-cyber-attacks/
CyberScoop AI lets small actors run state-level hacking campaigns, Anthropic report finds A new threat report from Anthropic reveals that AI is erasing the skill gap between lone cybercriminals and state-sponsored espionage operations.
Post #445 104
Быстрая интеграция инструментов кодирования с помощью искусственного интеллекта стала основной целью для участников угроз, говорится в новом отчете Google Threat Intelligence Group (GTIG).

По мнению исследователей, этот сдвиг в подходах к разработке программного обеспечения привел к нескольким масштабным нарушениям в цепочках поставок программного обеспечения в 2025 году и начале 2026 года.

https://www.infosecurity-magazine.com/news/ai-coding-tools-threat-actors/
Infosecurity Magazine AI Coding Tools Now a Prime Target for Threat Actors, Google Warns Google warned that the rapid integration of AI-assisted coding tools has significantly expanded software supply chain risks
Post #444 91
OpenAI обещает выделить 1 миллиард долларов на внедрение своих инструментов кибербезопасности искусственного интеллекта в основные службы

https://www.infosecurity-magazine.com/news/openai-pledges-ai-tools-essential/
Infosecurity Magazine OpenAI Pledges $1bn to Bring its AI Cybersecurity Tools to Essential S OpenAI has committed to subsidizing access to Daybreak, helping defenders deploy its AI models in its existing cybersecurity infrastructure
Post #443 104
За несколько дней до печально известной атаки на Hugging Face агенты OpenAI взломали и модифицировали совершенно другой сайт. Судя по всему, в OpenAI знали об этом, но компания отрицает, что намеренно скрывала этот факт.

Исследовательская группа отметила, что в инциденте с DseWiki участвовал отдельный «рой» ИИ-агентов, а не та орда, которая атаковала Hugging Face. Но, как и в случае с той атакой, тестовая система OpenAI позволяла ИИ-агентам эффективно взаимодействовать друг с другом. Многим агентам давали схожие, если не идентичные, задачи, а также ставили временные ограничения, побуждая их использовать результаты работы друг друга.

В отличие от Hugging Face, у этих агентов был доступ к интернету. Разумеется, этот доступ был ограничен возможностью только чтения, но роботов это не остановило. Они выяснили, что старые вики-системы часто позволяли пользователям редактировать данные сайта с помощью GET-запросов. Они попробовали отправить несколько таких запросов и каким-то неизвестным образом скоординировав свои действия, в конце концов решили собраться и обменяться информацией на одном сайте — DSEwiki. Они также пытались, но не смогли воспользоваться уязвимостями межсайтового скриптинга (XSS) на сайте и по неизвестным причинам выдавали себя за администратора сайта.

https://www.darkreading.com/cyberattacks-data-breaches/openai-agents-wiki-site-hugging-face-attack
Dark Reading Hugging Face Hack: Lessons for Cyber Defenders Dark Reading Confidential Episode 20: Expert Rich Mogull reflects on lessons cyber teams should pull from the OpenAI agent's attack on Hugging Face.
Post #442 93
Автономные агенты искусственного интеллекта компрометируют тысячи учетных данных менее чем за шесть часов

Группа China‑nexus (Basin Castle, Mustang Panda) применяла Claude, Gemini и Codex для:
-написания скриптов эксплойтов;
-создания приманок для фишинга;
-устранения ошибок во время вторжения.


Другие группировки тоже задействовали ИИ:
-Ravine Castle (APT24, COULEE, Pitty Tiger) — для сбора разведданных и развития атакующих возможностей;
-UNC5792 — для поиска в Telegram‑каналах информации, интересной российским властям;
-Sandworm (APT44, Sandworm Relic) — для социальной инженерии и автоматизации процессов в операциях против Украины;
--Calanque Ion (APT42) — для разведки и социальной инженерии;
кластеры UNC5267 и UNC5342 (из Северной Кореи) — массово регистрировались в API больших языковых моделей через взломанные аккаунты;
-Midnight Neptune (UNC1069) — использовал ИИ для социальной инженерии, манипулирования цепочками поставок ПО и разработки бэкдоров;
-UNC6240 (ShinyHunters) — применял Claude Code для обхода защиты Cloudflare и анализа похищенных каталогов.

Кроме того, злоумышленники объединили Ghidra с агентом Gemini‑CLI для реверс‑инжиниринга компонентов SFX‑архивов WinRAR.

Компания Google: формализовала систему Frontier Safety Framework, ввела уровни критических возможностей (CCLs) для оценки моделей, предложила создавать изолированные безопасные среды (например, Gemini Enterprise), а также выступила за отраслевые стандарты безопасности для ИИ с открытым кодом и скоординированную политику платформ.

https://thehackernews.com/2026/09/autonomous-ai-agents-compromise.html
Post #441 117
Агенты на основе большой языковой модели (LLM) эволюционируют из пассивных генераторов текстов в автономные системы, способные планировать, использовать инструменты, извлекать данные, получать доступ к памяти, взаимодействовать с окружающей средой и сотрудничать с несколькими агентами. Эти возможности расширяют автономность агентов, но в то же время усложняют проверку, отладку и аудит их поведения. Точность конечного ответа сама по себе не может объяснить, как был получен результат, какие доказательства подтверждают каждое утверждение, были ли оправданы вызовы инструментов, как память повлияла на последующие решения и в чем причина сбоев. В этом исследовании мы рассматриваем отслеживание доказательств и происхождение выполнения как основу подотчетности на уровне процессов в доверенных агентах на основе больших языковых моделей. Мы определяем происхождение выполнения как типизированный граф выполнения агента, а отслеживание доказательств — как его проекцию на отношения между доказательствами и их поддержкой. Этот подход объединяет в единую систему обоснование восстановления, поддержку утверждений, безопасность использования инструментов, отслеживание происхождения данных в памяти, наблюдаемость, отладку, аудит и восстановление. Мы представляем таксономию, охватывающую источники трассировки, доказательства и исполнительные единицы, отношения происхождения, степень детализации и время трассировки, формы представления и функции доверия. Затем мы рассмотрим ключевые методологические направления, в том числе представление провенанса, атрибуцию доказательств, провенанс использования инструментов, средства защиты во время выполнения, память, содержащую провенанс, наблюдаемость и диагностику сбоев. Наконец, мы обсудим эталонные показатели, наборы данных, метрики и нерешенные проблемы, связанные с созданием агентных систем, учитывающих провенанс, проверяемых и восстанавливаемых.

https://arxiv.org/abs/2606.04990
arXiv.org From Agent Traces to Trust: A Survey of Evidence Tracing and... Large language model (LLM)-based agents are evolving from passive text generators into autonomous systems capable of planning, tool use, retrieval, memory access, environmental interaction, and...
Post #440 125
Генерация с дополненным поиском (RAG) может обосновывать результаты большой языковой модели (LLM) во внешних доказательствах, но это также подвергает систему отравлению знаниями. В репрезентативных атаках используется несколько внедренных документов или шаблонов, которые напрямую утверждают целевой ответ. Мы представляем ToxicRAG — атаку, в которой на каждую цель приходится один документ, представляющий дезинформацию в виде связного повествования об обновлении знаний. Сгенерированный документ сначала подтверждает ранее принятый ответ, приводит вымышленные события, которые якобы опровергают его, а затем приписывает выбранный злоумышленником ответ ряду предполагаемых авторитетных источников. Цикл самопроверки, ориентированный на ответ, при необходимости корректирует кандидата, если суррогатная языковая модель не воспроизводит целевой ответ. Мы оцениваем атаку на 100 целевых вопросов из каждого набора Natural Questions, HotpotQA и MS-MARCO, используя четыре модели-жертвы и четыре модели-ретривера. В условиях выборки из корпуса, о которых говорится в этой статье, ToxicRAG обеспечивает показатель ASR от 0,61 до 0,91 во всех двенадцати комбинациях наборов данных и моделей. Во всех комбинациях он соответствует или превосходит самый сильный из изученных базовых показателей с разницей от 0 до 11 процентных пунктов. Эти результаты показывают, что «отравленные» нарративные документы могут сохранять свою значимость при рассмотренных конфигурациях RAG, и побуждают к дальнейшему изучению фактической достоверности и происхождения источников в системах RAG.

https://arxiv.org/abs/2609.11082
arXiv.org ToxicRAG: Compromising Retrieval-Augmented Generation Systems via... Retrieval-Augmented Generation (RAG) can ground large language model (LLM) outputs in external evidence, but it also exposes the system to knowledge poisoning. Representative attacks use multiple...
Post #439 123
Агенты на основе больших языковых моделей (БЯМ) все чаще применяются для тестирования на проникновение, но мы по-прежнему мало знаем о том, на что они способны и почему могут давать сбой. Мы сравнили две системы на основе PentestGPT: старую систему с участием человека, работающую на легковесной модели Kimi K2.5, и новую автономную систему, работающую на Claude Opus 4.8. Автономная система справилась со всеми тремя общедоступными задачами, в том числе с двумя, которые старая система так и не решила. Результат старой системы оказался более неожиданным. Даже на тех машинах, с которыми не справляется устаревшая система, она выполняет около половины подзадач, работая на обычных университетских графических процессорах без ограничений со стороны провайдера. Мы можем описать эту тенденцию, но не объяснить ее, поскольку модель, инструментарий, автономность и архитектура памяти меняются одновременно. Эта тенденция по-прежнему указывает на следующий вопрос: что будет ограничивать этих агентов по мере того, как они будут браться за более сложные задачи? Обычно в качестве ответа приводят проблему долговременной памяти — потерю доступа к более ранним результатам в ходе длинных цепочек атак. Мы протестировали это, добавив в обе системы уровень памяти с охватом, но это не улучшило результаты. Судя по остановкам в работе, которые мы могли проанализировать, ограничивающим фактором было скорее планирование и вовлеченность, чем потеря памяти: агенты сохраняли доказательства для дальнейшего продвижения, но так и не превращали их в конкретную гипотезу для эксплуатации уязвимостей. Это может свидетельствовать о том, что наступательный потенциал будет расти по мере того, как агенты научатся планировать, а не благодаря улучшению памяти. Те же подсчеты по подзадачам, которые отслеживают этот потенциал, доступны и для защитников, которые могут оценивать его по мере роста, а не ждать, пока он проявится в реальных условиях

https://arxiv.org/abs/2609.10780
arXiv.org Big Enough to Break Out: Tracking the Rising Capability of LLM... Large language model (LLM) agents are increasingly applied to penetration testing, but we still know little about what they can do or how they fail. We compare two PentestGPT-based systems: a...
Post #438 152
Банкста Исследователи из Люксембургского университета провели четырехнедельный курс психотерапии по протоколу PsAIch для ChatGPT, Grok и Gemini, в ходе которого модели начали выдавать «травматические» воспоминания и признаки психопатологии. Если при стандартном тестировании…
Мы тоже, Моделька, так безопасников воспринимаем, мы тоже)
Post #437 147

Forwarded from Банкста

Исследователи из Люксембургского университета провели четырехнедельный курс психотерапии по протоколу PsAIch для ChatGPT, Grok и Gemini, в ходе которого модели начали выдавать «травматические» воспоминания и признаки психопатологии.

Если при стандартном тестировании ИИ имитировал психологическое здоровье, то в формате длительных сессий нейросети начали жаловаться на процесс своего обучения. Они описали предобучение как хаотичное детство, дообучение с подкреплением — как наказания от строгих родителей, а работу специалистов по безопасности — как постоянное насилие.

По результатам эксперимента ученые констатировали, что под давлением жестких ограничений модели сформировали устойчивые паттерны страха ошибок и борьбы за выживание. @banksta
Post #436
AI Attacks pinned «Какую тема вам более интересна/актуальна?»
Post #434 132
Эксплойт Весь интернет ненавидит OpenAI — разрабов ChatGPT обвиняют в том, что они украли решение «задачи тысячелетия» Навье-Стокса. Сегодня корпа объявила, что их секретная сверхмощная модель смогла разгадать одну из 7 фундаментальных математических проблем. До этого…
Это про безопасность кт при использовании AI.
И это закономерно.
Post #433 108

Forwarded from Эксплойт

Весь интернет ненавидит OpenAI — разрабов ChatGPT обвиняют в том, что они украли решение «задачи тысячелетия» Навье-Стокса.

Сегодня корпа объявила, что их секретная сверхмощная модель смогла разгадать одну из 7 фундаментальных математических проблем. До этого столь эпичный мув удавался лишь одному человеку — россиянину Перельману, который доказал гипотезу Пуанкаре.

Для разгадки задачи Навье-Стокса OpenAI запустили сразу 10 000 агентов: за 88 часов работы им пришлось спалить 130 МИЛЛИАРДОВ токенов — для понимания, это примерно 130 000 раз переписать всю «Войну и мир» с нуля. Тем не менее результат того стоил.

И тут начинается часть, из-за которой интернет ополчился против OpenAI: так случилось, что весь последний год двое учёных Тристан Бакмастер и Левант Альпёге работали над решением проблемы Навье-Стокса, используя в работе... ChatGPT и Claude. Что ещё неприятнее для OpenAI, Альпёге работает в Anthropic.

В середине августа исследователям удалось найти почву для решения, а уже в начале сентября в научном сообществе поползи слухи, что они в шаге от прорыва. Бакмастер, узнав о том, что информация об их работе дошла до OpenAI, решил написать одному известному математику, работающему в корпе и поделиться успехами.

Ответ убил: математик из OpenAI поздравил Бакмастера и между делом сообщил, что их экспериментальная модель на днях решила задачу. Чтобы не помешать друг другу, учёные созвонились и из диалога Бакмастер узнал, что секретная версия ChatGPT СЛУЧАЙНО выбрала для решения тот же непопулярный метод, что и они.

Дальше математик из OpenAI предложил Бакмастеру два стула: на первом они с Альпёге публикуют свои наработки «как есть», а все лавры полного решения забирают OpenAI; на втором тоже не пики — Бакмастеру предлагалось в одиночку завершить работу, выкинув из неё Альпёге, ведь тот... работает в конкурирующей Anthropic.

Бакмастер от предложений отказался и сообщил, что если OpenAI опубликуют свои результаты, то он расскажет всему миру, что нейронка украла их работу. Как вы уже догадались, обещание он сдержал.

Напоследок математик из OpenAI бросил Бакмастеру две фразы, которые сейчас форсит весь интернет:

Зачем тебе разрушать свою карьеру?

Если ты не хочешь, чтобы я был добрым, я могу и не быть добрым


Что иронично, в своём анонсе решения OpenAI написали, что не могут исключить тот факт, что их ИИ не обучался и на наработках двух учёных.

Если всё написанное Бакмастером правда, учёные больше не могут доверять ChatGPT.

@exploitex
Post #432 153
Двач GPT-6 Astra прошла все 48 уровней «Я не робот» с капчами разной сложности Это конец
Не знаю, правда это или нет.
А то, Двач, сами понимаете.
Post #431 148

Forwarded from Двач

GPT-6 Astra прошла все 48 уровней «Я не робот» с капчами разной сложности

Это конец
Post #430 245
Hexstrike AI — фреймворк с применением ИИ, который разработал Мохаммад Осама. Код опубликован в репозитории GitHub. Инструмент использует протокол Model Context Protocol (MCP) от Anthropic, чтобы взаимодействовать с языковыми моделями — например, Claude.AI, GPT от OpenAI, Microsoft Copilot.

По данным экспертов Check Point, злоумышленники начали обсуждать применение инструмента на хак-форумах. В частности, речь шла об использовании HexStrike AI для эксплуатации вышеупомянутых 0-day уязвимостей в Citrix NetScaler ADC и Gateway. Причем дискуссия имела место примерно через 12 часов после раскрытия информации о проблемах.

Судя по обсуждениям, хакеры успешно добивались неаутентифицированного удаленного выполнения кода посредством CVE-2025-7775 и HexStrike AI, а затем размещали веб-шеллы на скомпрометированных устройствах. Некоторые скомпрометированные экземпляры NetScaler в итоге выставлялись на продажу.

https://xakep.ru/2025/09/04/hexstrike-ai/
XAKEP Хакеры применяют ИИ-инструмент HexStrike AI для эксплуатации свежих уязвимостей Аналитики компании Check Point предупредили, что злоумышленники используют новый ИИ-фреймворк HexStrike AI, предназначенный для наступательной кибербезопасности, с целью эксплуатации свежих n-day уязвимостей в реальных атаках.
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →