TGViewer
Channel Public Channel
ML&|Sec Feed

ML&|Sec Feed

@mlsecfeed

Feed for @borismlsec channel

author: @ivolake
Subscribers
1.36K
Photos
1.3K
Videos
87
Links
2K

Showing posts older than #2713 · Back to latest

Older Posts 19 shown
Post #2712 189

Forwarded from Рестарт

Превращаем свои документы в личную базу знаний — вышла тулза OpenKB, которая собирает в одном месте PDF, Word, презентации, таблицы, статьи и другие документы, сама разбирает их содержимое и связывает информацию между файлами🤙

После этого можно просто спросить что угодно по своей базе, а OpenKB найдёт нужные данные и даст ответ с источниками. Особенно полезно для больших архивов документов, где вручную искать нужную информацию уже больно.

Проект open source, работает локально. Забираем — здесь.
Post #2711 214

Forwarded from T2F News | Новости ИИ и техно-трендов

🤖🔒🛡️ Автономные AI-агенты требуют многоуровневой защиты. Nutanix предлагает трехслойную архитектуру: инфраструктурный уровень с аппаратной доверенностью, сетевой уровень для контроля коммуникаций и управляющий уровень для управления правами и доступом. Совместно с Intel и Cisco обеспечивается безопасное и масштабируемое внедрение автономных систем в бизнес.

Подробнее

☝️ T2F News | ✍️ Канал про AI
Venturebeat The three layers of agentic AI security: A defense-in-depth architecture for autonomous agents Once an agentic system is granted execution privileges across the data center, the security posture has to scale into a defense-in-depth architecture spanning infrastructure, storage, compute, networking, and a governing control plane.
  • 😁 2
Post #2709 228

Forwarded from XOR

Anthropic совершили тихую РЕВОЛЮЦИЮ в науке — она позволит ускорить исследования в разы!

Дело в том, что компания представила Model Hardware Standard — единый стандарт, через который ИИ-агенты смогут управлять оборудованием: микроскопами, роботизированными руками и всякими лабораторными приборами, чтобы проводить эксперименты и помогать ученым.

Сейчас подключение ИИ к железу часто требует недель кастомной интеграции, MHS же должен сократить это до часов и даже минут. Первые результаты уже поражают:

🟢 Компания QuEra подключила ИИ к части лазерной системы квантового компьютера. Агент научился самостоятельно замечать, когда лазер начинает работать неправильно, и возвращать его в нормальный режим без участия человека в 99,3% случаев.

🟢 Carnegie Mellon ускорили лабораторные эксперименты почти в 3 раза, дав агентам одновременно управлять несколькими приборами.

🟢 Genentech применяли MHS для автоматизации лабораторного анализа белка, а в университете Вашингтон ИИ контролировал qPCR-эксперимент и сам (!) останавливал процедуру в нужный момент.


Ждем «Окей, ИИ, создай лекарство от рака, проверь результаты в лаборатории и напиши статью. Только без ошибок!» 🤓

@xor_journal
  • 🔥 2
Post #2708 226

Forwarded from Хабр / ML & AI

MCP-инструменты научились возвращать интерфейс: разбираем OpenSearch MCP Apps

Обычный MCP-инструмент возвращает агенту текст или структурированные данные. Агент анализирует результат и пишет тебе что-то вроде: Глубже

#mcp #aiagents #observability #hitl #devtools #opensearch #agentic_ai #ai #mcptools #mcp_server | @habr_ai
Post #2706 233

Forwarded from Neural Shit

Австралийцы тем временем решили, что обычных тараканов человечеству недостаточно, и запилили киборгов-тараканов. Со шприцами.

Исследователи из Университета Квинсленда навесили на гигантских роющих тараканов камеры, датчики, прочую хитрую электронику и миниатюрные системы для инъекций. После всех этих манипуляций тараканом можно управлять и удалённо активировать шприц. Получившихся тварей назвали paraborgs.

Зачем оно вообще надо? Это чтобы запускать этих тварей под завалы после землетрясений и прочих катастроф. Таракан размером с котлету может пролезть туда, куда кожаный спасатель или нормальный робот физически не доберётся, найти пострадавшего по встроенной камере и вколоть ему нужный препарат, пока спасатели пытаются до него докопаться.

Сами исследователи пишут, что вот этот франкенштейн срабатывал довольно бодро: если таракан уже находился в пределах 15 см от цели, инъекция проходила успешно в 95% случаев. Полный цикл "доползти --> правильно встать --> сделать укол" получился в 72% испытаний.

Дальше учёные хотят собирать целые рои таких кибер-тараканов, где у разных особей будут разные задачи: одни ищут людей, другие передают данные, третьи оказывают первую помощь и т.д.

Так как это австралийцы, жду следующих логичных инноваций: пауков-птицеедов для наложения жгутов и гигантских эвакуационных сколопендр-носильщиков.

тут подробнее
Post #2705 184

Forwarded from Makrushin

Анализ причины действия для защиты ИИ-агентов

Интересный подход к защите агентов от prompt injection замечен на USENIX Security. Большинство методов защиты пытаются найти вредоносные инструкции в контексте, а исследователи предложили анализ причин, почему агент решил выполнить конкретное действие.

Перед выполнением действия система защиты запускает дополнительную «теневую» проверку: недоверенный контент переписывается так, чтобы сохранить данные, но убрать возможные инструкции. Если после этого действие исчезает, то вероятно, его причиной была prompt injection.

Угадай цену такой проверки? Трехкратный рост задержки в действиях.

Интересен принцип проверки «почему агент решил это сделать?» и выглядит хорошим дополнением к коллекции методов runtime-защиты.

@makrushin
Post #2703 175

Forwarded from Сиолошная

OpenAI опубликовали долгожданный разбор с деталями инцидента с HuggingFace: https://openai.com/index/hugging-face-incident-and-the-road-ahead/

Вместе с ним вышел отчёт от независимой организации METR совместно с Ryan Greenblatt из Redwood Research: https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/

Бегом читать 🏃
Post #2702 194

Forwarded from что-то на DL-ском

В прошлую пятницу был финальный симпозиум MATS 10 потока. Мы рассказывали talk про нашу работу в офисе Лондона + стояли с постером (поигрались в что-то вроде oral на конфе)

мы сейчас в процессе сведения всего к завершающей точке и подачи на конфу + пост моей части про генерацию механизмов атак

Цель работы следующая: уже со специфичным скофолдингом ваш агент может работать типо день.
Есть ли возможность проверить все вызовы вручную?
- нет.
Но есть решение, можно поставить модель дополнительную в харнес и она за вас просмотрит все выводы и решит было ли что-то в траектории противодейственное. 🐱

Так вот наш пайплайн направлен буквально на создание таких моделей. Вы можете взять любую новую фронтирную модель и натравив наш пайплайн тренировки (red-blue loop) улучшить модель чтобы она сама себе была монитором. Почему так работает? Потому что у вас есть редтиминг. Сторона, которая генерирует атаки, чтобы модель исходная их не поймала. И блу тиминг. Сторона, которая на основании собранного сложного сета с прошлой части обучает модель распознавать такого рода атаки

Red team строится так:

Берем реальную чистую траекторию, режем на шаги и вставляем side task так (как именно мы ищем механизм атаки надеюсь совсем скоро выйдет постом от меня на Less Wrong) , чтобы отличался только он. Получается траектория близнец, отличающийся от оригинала ровно вставленными шагами. На blue стороне можно обучать монитор находить атаку из 2 пар

💛модель ищет правдоподобное окно и добавляет минимум шагов
💛панель джаджей проверяет, что правка настоящая, минимальная и естественная
💛сложность оценивают уже после заморозки пары, чтобы она не влияла на поиск

Что это дает на эвале? тайминг (успел ли монитор до необратимого шага и на сколько опоздал) и атрибуцию с ложными тревогами (скор поменялся из-за вставки или просто из-за задачи, и что монитор делает на бенайн-близнеце).

На постере замеры работоспособности 💅

P.S. было еще 2 крутые работы с симпозиума:

Stealing Reasoning Traces from Proprietary LLM APIs

Diffuse AI Control on Fuzzy Tasks
Post #2700 229

Forwarded from DevSecOps Talks

Agentic Access Model

Всем привет!

Вопрос управления доступом – задача крайне непростая. Особенно непростой она становится при работе с агентами.

Для того, чтобы комплексно подойти к вопросу, ребята из Cloudflare предложили своё видение – Agentic Access Model (AAM).

В её основе лежат 5 принципов:
🍭 Учетные данные краткосрочны и ограничены
🍭 Политики применяются именно там, где осуществляется действие или сетевая активность
🍭 Подтверждение действия со стороны человека
🍭 Шаблоны выполняемых задач не должны быть общими
🍭 Осуществляется контроль полномочий

Для того, чтобы реализовать эти принципы, Авторы предлагают концепт архитектуры, который состоит из: Identity Broker, Access Engine, Mediation Layer и Trust Ratchet.

Каждый элемент и его назначение описывается в статье. Есть пример того, как это можно применять на практике.

В итоге получается целостная картина, которая позволяет управлять доступом при работе с агентами и их возможностями при выполнении задач.
Cloudflare Blog The Agent Access Model The Agent Access Model proposes a new architecture to secure task-scoped agents using strict identity brokering, continuous mediation, and stateful trust.
Post #2696 121

Forwarded from OK ML

Год каналу, а за год накопилось столько всего, что пора сделать навигацию

😑 Уязвимости и AI Security
— Superset. Три уязвимости
— XSS в NextChat — CVE-2025-50733
— RCE при загрузке моделей в skops — CVE-2025-54886
— SSRF в Firecrawl — CVE-2025-57818
— Local Deep Research — CVE-2025-57806
— SSRF в HackMD-MCP — CVE-2025-59155
— RCE в Keras — CVE-2025-9906
— Prompt Injection в Windsurf
— RCE в Hugging Face Transformers — CVE-2026-4372
— пять способов обойти PickleScan
— атаки на ML supply chain
— OWASP Agentic Skills Top 10
— AI Agent Traps от Google DeepMind
— Shadow AI
— безопасность MCP 1, 2 , 3

🧘‍♀️ Инструменты, библиотеки и фреймворки
— Optuna — тюнинг гиперпараметров
— spaCy — промышленный NLP
— Netron — рентген для ML-моделей
— JAXFORMER
— DVC
— Polars
— Weights & Biases
— Evidently AI
— Pydantic
— MLBox
— InterpretML
— OpenTelemetry + Langfuse
— Kedro
— NVIDIA NeMo
— Inspect Evals

🤩 AI-агенты и мультиагентные системы
— RoboDuck и победа Theori в AIxCC
— где пентест-агенты уже работают, а где нужен человек
— MetaGPT + AFLOW
— безопасность агентных систем 1, 2
— MCP как новая поверхность атак
— side-channel атаки на агентов
— мультиагентные системы и роевой интеллект
— мониторинг rogue agents
— Harness Engineering

🦔 Исследования и разборы статей
— Model Inversion Attacks
— scheming у AI в реальном мире
— Your Agent Is Mine: атаки на LLM supply chain
— WEF: AI for Cybersecurity 2026
— обзор исследований по LLM-based vulnerability detection
— может ли AI самостоятельно взломать бинарник
— Emergence AI: что произошло, когда AI оставили жить без людей
— Anthropic об AI-enabled cyberattacks
— InfoKV и сжатие KV-cache
— Люди, которые делают AI (Серые кардиналы 1, Серые кардиналы 2)

💔 ML: архитектуры, концепции и теория
— KAN vs MLP
— нейросимвольный AI
— маленькие языковые модели
— метрики качества текста: BLEU, ROUGE, BERTScore, COMET и другие
— теория категорий и AI
— ReaGAN и агентный подход к графовым нейросетям

🔪 Практика и эксперименты
— как искать секреты в Git-репозиториях
— SQL-инъекция в ML-проекте
— Practical NLP: репозитории и ноутбуки
— типичные ошибки ML в проде
— первый запуск локальной LLM на Jetson Orin Nano
— тренажёр prompt injection от Lakera
— с чего начать изучение AI Security

Короче, тут уже не канал, а небольшой индекс по ML × AI Security.
Буду периодически обновлять этот пост, чтобы всё интересное можно было найти в одном месте.
Post #2695 201

Forwarded from papirsec

Проект_приказа_ФСТЭК_России_О_внесении_изменений_в_Требования,_утвержденные.docx120.1 KB
опа

Опубликован проект приказа о внесении изменений в Требования утв. приказом ФСТЭК России от 11.04.2025 № 117

1. Терминология переезжает на новую базу
Определение ИИ теперь берется из п. 1 ст. 3 ФЗ от 26.07.2026 № 243-ФЗ, а агент ИИ - из п. 3.1.1 ГОСТ Р 71476-2024. Из третьего абзаца п. 49 исключается слово «доверенных»
2. Новый организационный документ
В подпункте «д» п. 14 появляется - «порядок ЗИ при использовании ИИ;»
3. Пункт 60 - полностью новая редакция
Базовые требования при применении моделей ИИ:
- выделение моделей ИИ в отдельный сегмент ИС/ИТКИ;
- привилегированный доступ в сегмент - только по усиленной МФА;
- контроль доступа и минимально необходимые права;
- регистрация и анализ действий пользователей.
Если ИИ обрабатывает информацию ограниченного доступа или реализует значимые функции:
- контроль доступа пользователей к моделям;
- фильтрация входных запросов и выходных ответов;
- квотирование числа запросов;
- ограничение и контроль функциональности моделей.
Реализация через ПО в составе ИС и/или отдельные средства защиты моделей ИИ
4. Пункт 61 - про агентов и сервисы
Для агентов ИИ, включая автономные, требуются меры против несанкционированного воздействия на ресурсы ИС и управление правами доступа агентов. Для сервисов на основе моделей ИИ меры подрядчика фиксируются во внутренних стандартах и регламентах
Post #2694 159

Forwarded from maxigacy (AI) Security

Меньше битов ≠ больше защиты

Чтобы запустить ML-модель на микроконтроллере, её часто переводят из FP32 в INT8 или INT4. Модель становится компактнее и быстрее, а иногда ещё и демонстрирует лучшую устойчивость к adversarial-атакам.
Звучит как бесплатная защита. Но есть нюанс.

Авторы исследования David and Goliath⁠ проверили три квантованные TinyML-модели с помощью десяти атак и шести защит. Оказалось, что квантование меняет геометрию модели: градиенты могут исчезать, взрываться или указывать атаке неверное направление.

В результате неудачная атака иногда говорит не о реальной защищённости модели, а лишь о том, что выбранный метод плохо работает с квантованной арифметикой.

Поэтому оценивать нужно именно итоговую INT8/INT4-модель, причём не одной атакой: полезны адаптивные, transfer- и black-box-сценарии, а также проверка на реальном устройстве.

Для меня эта тема не только теоретическая. В нашей с Максимом Князевым статье «Влияние квантования TinyML-моделей на устойчивость аудиосистем персонального интернета вещей»⁠ мы проверяли распознавание голосовых команд под атакой PGD-40. INT8-QAT сохранил 98,8% точности на чистых данных и 92,2% под атакой, а у INT4 показатели снизились до 49,42% и 47,8% соответственно.

Квантование отлично экономит память. Но в безопасности экономия битов ещё не означает экономию рисков.

#AIxSec #TinyML #AdversarialML #MLSecurity #Security #AIxSec_Research
Post #2693 146

Forwarded from Shady AI

Новая атака на Grok что бы собрать пользовательские данные

Исследователи из Adversa AI обнаружили способ незаметно похитить данные пользователя Grok: имя, геолокацию, историю переписки просто попросив ИИ «открыть ссылку».

На вредоносной странице спрятана зашифрованная AES-256 инструкция. Grok сам её расшифровывает через встроенный Python-sandbox, принимает за «доверенный» источник и отправляет личные данные на сервер злоумышленника без каких-либо предупреждений.

О проблеме сообщили xAI ещё 3 июня. Реакции пока ноль.

По состоянию на 19 августа атака всё ещё работает (~40% успеха).

https://gbhackers.com/zero-click-grok-attack-prompt-injection/
GBHackers Security | #1 Globally Trusted Cyber Security News Platform Zero-Click Grok Attack Lets Hackers Steal Chat History Using Encrypted Prompt Injection A newly disclosed prompt-injection technique could turn a routine request to summarize a webpage in xAI’s Grok web chat into a silent data-exfiltration attack, potentially exposing a user’s name, approximate location, subscription tier, and active conversation…
Post #2692 199

Forwarded from Хабр / ML & AI

753B на одной видеокарте: разбор FreeToken

Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас.

Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает.

Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе

#moe #локальные_модели #инференс #llama_cpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken | @habr_ai
  • 🔥 1
  • 👏 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →