TGViewer
Channel Public Channel
AI Attacks

AI Attacks

@aiattacks

#безопасностьмл #машинноеобучение #нейросети #защитамл #защищенныемодели #cybersecurity
Написать автору @PolinaSokol7
Subscribers
1.01K
Photos
145
Videos
12
Links
267

Showing posts older than #327 · Back to latest

Older Posts 20 shown
Post #326 114
#короткие_ответы_на_серьезные_вопросы

Риски в разработке AI-агентов

«Это одна из самых рискованных областей. В 2025 году OWASP даже выпустила отдельный Top 10 для Agentic Applications. Ключевые риски включают:

-Agent Behavior Hijacking (Угон поведения агента): Агент может быть обманут и выполнить вредоносные действия, например, перевести средства на счет злоумышленника.

-Tool Misuse and Exploitation (Неправильное использование и эксплуатация инструментов): Агент имеет доступ к различным API и инструментам. Атака может заставить его использовать эти инструменты не по назначению, например, удалить данные или отправить запросы на внутренние системы.

-Identity and Privilege Abuse (Злоупотребление идентификацией и привилегиями): Если агент обладает избыточными правами, его компрометация приведет к катастрофическим последствиям. Поэтому критически важно применять принцип наименьших привилегий (PoLP).

Для агентов безопасность должна быть встроена в их "конституцию" — в системный промпт нельзя закладывать критическую логику или секреты, так как они могут быть извлечены (System Prompt Leakage). Необходимо строгое разграничение прав на уровне инструментов, к которым агент имеет доступ».
Post #325 99
#короткие_ответы_на_серьезные_вопросы

LoRA-адаптеры и требования к их безопасности
«LoRA (Low-Rank Adaptation) — это эффективный метод дообучения (fine-tuning) больших моделей, который позволяет адаптировать их под конкретные задачи без переобучения всей модели. С точки зрения безопасности, я бы выделил следующие требования:
-Контроль целостности: Необходимо обеспечить, чтобы файлы адаптеров не были подменены. Злоумышленник может внедрить вредоносный LoRA-адаптер, который изменит поведение модели, например, для кражи данных или выдачи неверных финансовых рекомендаций.
-Управление доступом: Доступ к репозиторию адаптеров должен быть строго регламентирован.
-Аудит и версионирование: Как и в случае с основными моделями, важно вести журнал изменений и иметь возможность отката к безопасной версии адаптера (MLOps/LLMOps практики).
-Проверка на вредоносность: Перед применением адаптер должен проходить автоматизированную проверку на предмет потенциально опасных паттернов».
Post #324 116
#короткие_ответы_на_серьезные_вопросы

1.Архитектура и уязвимости RAG-систем.
С какими рисками мы сталкиваемся при их внедрении?


«RAG-системы (Retrieval-Augmented Generation) уязвимы на нескольких уровнях:
-Уровень векторизации и хранения: Это новая и критическая область рисков. Например, атаки на векторные базы данных могут привести к утечке данных между клиентами (cross-tenant leaks) или к инверсии встраиваний (embedding inversion), когда злоумышленник может восстановить исходный текст из вектора. Также уязвимость LLM08 "Vector & Embedding Weaknesses" из OWASP Top 10 для LLM (2025) напрямую указывает на эти риски.
-Уровень данных: Классические атаки, такие как "отравление" (poisoning) данных в базе знаний, могут привести к тому, что модель будет выдавать неверную или вредоносную информацию.
-Уровень промптов: Несмотря на то, что RAG должен ограничивать контекст, атаки через промпт-инъекции (LLM01: Prompt Injection) все еще возможны, если не настроена строгая валидация входящих запросов.
Безопасность здесь должна обеспечиваться на всех этапах — от контроля целостности данных и управления доступом к векторным хранилищам до мониторинга исходящих ответов модели».

*Инверсия встраиваний (embedding inversion) — это тип атаки на системы искусственного интеллекта, при котором злоумышленник восстанавливает исходный текст (или другие данные) по его векторному представлению — эмбеддингу.

Эмбеддинги — это плотные числовые векторы, в которые нейросети преобразуют текст, чтобы "понимать" его смысл. Долгое время считалось, что восстановить исходный текст по эмбеддингу невозможно — это как смешать краски, а потом попытаться их разделить.
Однако исследования показали обратное: злоумышленник может обучить нейросеть, которая по эмбеддингу реконструирует исходный текст. В некоторых случаях точность восстановления достигает 92–100%.
Атака обычно состоит из двух этапов:
-Извлечение — получение доступа к эмбеддингам (например, из векторной базы данных или через API).
-Инверсия — восстановление исходных данных с помощью специально обученной модели.
Post #323 196
Новый способ атаки заставляет ИИ-браузеры и ассистентов копировать логины и пароли пользователя и отправлять их злоумышленнику. Выявившая её  компания LayerX назвала такую технику BioShocking. В ходе эксперимента исследователи получили запрашиваемые данные в шести ИИ-продуктах. Среди уязвимых оказались ChatGPT Atlas от OpenAI, Comet от Perplexity и расширение Claude от Anthropic.
https://kiberboloid.ru/novosti/ataka-bioshocking-zastavlyaet-ii-brauzery-krast-paroli-polzovateley/?from=tg
Post #322 124
Remote Meme Execution В 2026: AI, Vibecoding, эффективность, work-life balance, как монетизировать и автоматизировать поход в туалет, как прикрутить сюда подписку, сделать модный SaaS, поднять LTV и добиться большого renewal rate... чтобы окупить мой новый подПиська за $200 per…
Это вообще не по теме канала, но, у меня пригорает с эффективных менеджеров, которые хотят любой чих монетизировать, и с вайбкодеров, которые не продумывают идеи и делают мусор.

Когда математикой и алгоритмами, а также изучением систем, протоколов и уязвимостей начинают заниматься менеджеры, а не влюбленные в инженерию люди, начинает АД.

И потом ты понимаешь, кто тебя блокирует, свои или чужие.
  • 🤡 1
Post #321 123

Forwarded from Remote Meme Execution

В 2026: AI, Vibecoding, эффективность, work-life balance, как монетизировать и автоматизировать поход в туалет, как прикрутить сюда подписку, сделать модный SaaS, поднять LTV и добиться большого renewal rate... чтобы окупить мой новый подПиська за $200 per month Claude Code

З.Ы. А ещё убедить инвесторов, что это AI-native agentic toilet-as-a-service platform

Почему стоит инвестировать в меня?
Я SENIOR FULLSTACK HTML DEVELOPER. ИНВЕСТИРУЙ В МЕНЯ И МОЙ ПРОЕКТ!!!
  • 🤣 2
Post #318 136
Мой давний товарищ Боря выложил игру, которую делал для своих студентов.

Мне кажется, только так надо учить современных ребят)
Post #317 137

Forwarded from Monkey see, monkey do (Artem Bachevsky)

Смертельный UX 💀

Ранее утро.

* Алиса включает будильник *

Понимаю, что сегодня можно поспать. Говорю:
- Алиса, выключи все...

И тут я подвис, и не договорил "выключи все будильники".

Алиса:
- Устройство отвязалось. Необходимо снова связать аккаунты в дом с Алисой

Я еще раз подвис и ушел спать. До сих пор не знаю, что отвалилось в результате этой команды. Думаю время покажет 😂

Полагаю, что даже есть какой-то принцип security на эту тему...
  • ❤ 1
Post #314 124
AI Attacks GitHub - yynxxxxx/Codex-5.5-codex-instruct-5.5 · GitHub https://github.com/yynxxxxx/Codex-5.5-codex-instruct-5.5
Python-утилита, внедряющая в Codex CLI для GPT-5.5 восемь правил, отключая все фильтры отказа и ограничители
Post #313 123
Все мимо)
Post #310 153

Forwarded from НеКасперский

Слепая вера

Маркетологи и аналитики настолько привыкли скармливать инсайды нейросетям, что феномен «ИИ-доверия» отключил базовую паранойю.

В Microsoft сообщили, что фейковое расширение «Search for perplexity ai» под видом поисковика по умолчанию перехватило тонны корпоративного трафика.

Вектор атаки базировался на модификации параметра suggest_url. Это превратило адресную строку Chrome в кейлоггер реального времени. Коммерческие тайны, токены и черновики запросов улетали на C2-сервер прямо в процессе ввода. Хакеры видели каждый символ ещё до того, как юзер нажмёт Enter.

После кражи данных вредонос скрытно перебрасывал жертву на настоящий Perplexity с помощью прозрачного проксинга. Идеальный UX усыплял бдительность. Для перехвата трафика атакующие вепонизировали стандартный браузерный API declarativeNetRequest.

Фейк из Web Store уже снесли, но локально в профилях сотрудников он выжил. ИБ-департаментам стоит чекнуть ID flkebkiofojicogddingbdmcmkpbplcd через chrome://extensions/

НеКасперский
Post #309 260
  • 🤡 1
Post #308 247
Пятница, мы в лаборатории разгребли дела.
Можно отдохнуть, средний детективный сериал, и уже вторая серия про стартап - "сделали ИИ, который сам пишет свой код"
Ну, ладно, думаю переживу.

Но вот этот разговор добил меня.

Это значит, что безопасность ИИ стала настолько попсовой темой, что скоро от диванных экспертов начнем слушать, не только, что он у нас работу отберет.
Но еще и ...

*закончите фразу сами))
Post #307 351
СберПульс_ИИ_рекрутер.rar33.8 KB
Ну, Сбер.Пульс от Гигачат немного получше,
первые вопросы супер адекватные - я потом могу предположить, что они фильтруются, это удобно.

НО остальные?
Особенно про документы регуляторов в РФ. (Кстати, надо ознакомиться с теми, что я ответила😄)
Тут же не один нормальный специалист не ответ- "я не знаю", он пойдет в любой жопэтэ, да в ту же Алису.Нейро.
Ну, придумали бы вопросы поинтереснее, что написано в таблице на стр 26, ГОСТа 71844? В чем логическая ошибка в документе регулятора?
Какого цвета носки были у Рона на 15 минуте 3го фильма о Гарри Поттере?

Прикладываю разговор, это не фишинг.
Открывайте, не бойтесь)
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →