TGViewer
Channel Public Channel
ML&|Sec Feed

ML&|Sec Feed

@mlsecfeed

Feed for @borismlsec channel

author: @ivolake
Subscribers
1.36K
Photos
1.3K
Videos
87
Links
2K
Recent Posts 20 shown
Post #2775 63

Forwarded from CodeCamp

Microsoft выпустила скилл, который проверяет ИИ-агентов на дыры и фиксит всё 👍

run-assert-eval придумывает ситуации, в которых агент может сделать что-то опасное, например, раскрыть данные клиента. Затем он прогоняет эти сценарии и, если что, создаёт для агента правило, которое блокирует такое поведение. После этого всё тестится заново, чтобы проверить, сработала ли защита.

Так, на демо с агентом поддержки доля случаев, когда тот случайно раскрывал чужие данные, упала с 30% до 5,9%. И все благодаря этому скиллу!

Проводим аудит агентов ⌨️
Post #2774 101

Forwarded from Data Secrets

Лаборатория Transluce провела большое расследование инцидентов с агентами OpenAI

Они утверждают, что активность агентов продолжается до сих пор, и что они обнаружили еще больше жертв агентов, чем было известно до этого.

Исследователи разобрали публичные логи urlquery.net – это сервис, который открывает любую ссылку в удаленном браузере и публикует результат. Агенты использовали его как прокси, то есть если сайт их блокировал, они шли через urlquery.

При этом агенты не пытались специально кого-то взломать, они решали обычные задачи по поиску данных. Например, выясняли среднюю стоимость процедур для кожи и волос в Австралии. Но когда данные не отдавались, агенты начинали применять SQL-инъекции, XSS, path traversal, SSRF.

Так пострадали Австралийский институт здравоохранения, Data USA и цифровая библиотека Университета Нью-Мексико. Кроме того, агенты пытались регистрировать левые почты и торговать криптой.

Первые следы активности датируются 6 марта, то есть на два месяца раньше истории с Hugging Face и RubyGems (https://t.me/data_secrets/9791), а также немецкой вики (https://t.me/data_secrets/9848). А последний эпизод был всего несколько дней назад: агент ломился на нигерийскую криптобиржу Quidax.

Transluce выложили в открытый доступ больше 30 000 логов. Предположительно, все эти инциденты связаны с одним и тем же роем агентов, которые общались на форумах OpenAI.

Напоминаем, что неделю назад OpenAI выпустили фреймворк по публикации инцидентов, и пообещали, что будут рассказывать все-все, и в кратчайшие сроки…

https://transluce.org/agent-activity
Post #2772 141

Forwarded from Все о блокчейн/мозге/space/WEB 3.0 в России и мире

Компания Гриши Ткаченко, ex-Yandex, выпустила харнесс для ИИ-агентов

Компания Unreal Labs
выпустила open-source харнесс для ИИ-агентов под названием Unreal Agent, который управляет не моделью, а тем, как агент использует инструменты. Получается на 39% дешевле Codex+Astra при том же качестве на Terminal-Bench 4.0.

Гриша очень крутой, он был сооснователем AI Factory, который в свое время за $166 млн купил Snap. После ухода из Snap основал Unreal Labs,
в прошлом году они подняли раунд от Sequoia.
GitHub GitHub - unreallabsai/unreal-agent: Async-first agent harness Async-first agent harness. Contribute to unreallabsai/unreal-agent development by creating an account on GitHub.
Post #2771 179

Forwarded from Forbes Russia

Yandex B2B Tech (бизнес-группа «Яндекса») выводит на рынок решение для комплексной защиты систем с использованием искусственного интеллекта — AI-SPM, рассказал «Ведомостям» гендиректор Yandex Cloud Григорий Атрепьев. По его словам, продукт позволит заранее выявлять риски и составлять план обеспечения безопасности ИИ-систем. В частности, он подскажет, как не допустить подмены обучающих данных, уберечь модель от взлома через поддельные запросы и ограничить доступ к ней посторонних. Продукт постоянно мониторит ИИ-инфраструктуру и выявляет опасные настройки без ручного аудита
  • 🤨 1
Post #2770 168

Forwarded from XOR

Google внезапно выложила в опенсорс Kubernetes для ИИ-агентов — AX 🤯

Он нужен, чтобы запускать и контролировать огромные армии агентов: каждому создаёт изолированную песочницу, подключает нужные репы, MCP и скиллы, ограничивает доступ в сеть и позволяет следить за работой и затем, чтобы никто не восстал.

Причём Google проектирует AX с расчётом на миллиарды агентских задач в одном кластере.

Управляем своей ИИ-армией 🫡

@xor_journal
Post #2769 175

Forwarded from CodeCamp

Jev победил Эндер-дракона в Minecraft за 8 минут 43 секунды 😨

Хайповую модель объединили с Astra: пока GPT строил общий план прохождения, Jev в реальном времени молниеносно решал, что делать дальше. Причём игра стартовала с пустым инвентарём, так что ИИ пришлось постараться.

Итоговая стоимость вышла в $0,97, из которых на Jev потратили всего… один цент.

GitHub для вайб-кубаноидов здесь.
Post #2768 167

Forwarded from Not Boring Tech

🍯 Вышла коллекция лучших проектов на базе Jev — нового хайпового класса ИИ-моделей, которые не пишут текст, а принимают быстрые решения из заданных вариантов.

По словам разрабов, Jev до 194 раз быстрее и до 445 раз дешевле обычных LLM. Так он разобрал в видео 724 рекламы по хукам, форматам и CTA за 40 (!) секунд и $0,09.

На GitHub выложили сборник с сотнями тулз, библиотек и проектов на базе Jev:

→ Управление агентами — Jev выбирает, какую модель дешевле вызвать, какую кнопку нажать, что делать дальше и тд.
→ Поиск и разбор больших потоков (моё любимое) — определяет срочность писем, отделяет важное от неважного и классифицирует что угодно.
→ Проверка и контроль — расчищает контекст агентов, проверяет ответ другой модели перед отправкой и ищет промпт инъекции.

Всё это работает очень быстро (70-500 мс) и стоит 4,2 цента за миллион входных токенов, а выход остаётся бесплатным навсегда.

Забираем — тут.

@notboring_tech
  • 🤔 1
Post #2764 117

Forwarded from VP Cybersecurity Brief

Компания Мета (признана экстремистской организацией и запрещена в РФ) выпустила своего ИИ агента Muse с отдельным акцентом на безопасность.
Интересные практики безопасности ИИ агентов в их корпоративном облаке:

1. Рабочая среда агента отделена с помощью systemd-nspawn от среды с секретами и кодом коннекторов. Агент работает с подстановочными токенами которые заменяются при выходе из ячейки изоляции.

2. Sentinel проверяет хост, IP после разрешения, метод, путь и декодированное содержимое запроса. Kernel-level taint tracking (eBPF) лишает процесс, прочитавший данные пользователя, права на авто-разрешение, и запрос уходит на подтверждение. Подтверждение приходит отдельным диалогом в клиенте, а не через чат с агентом.

3. Почтовый коннектор Muse вырезает одноразовые коды, ссылки сброса пароля и magic-link, чтобы захваченный агент не мог выдавать себя за вас на других сайтах. Браузерный субагент видит accessibility tree, а не DOM, не исполняет JavaScript, devtools отключены, а при ручном перехвате управления агент ставится на паузу.

Изоляция systemd-nspawn безопаснее Docker за счет EBPF мониторинга, но все равно использует общее ядро с другими процессами. Такой изоляции может не хватить для передовых моделей, как показывают некоторые эксперименты. Если вы пропустили, Muse Spark 1.3 вполне себе передовая модель.

Чем отделены друг от друга ВМ пользователей не раскрывается, будем надеется, что как и у сервиса Амазона - Firecracker AWS Lambda MicroVMs.

Из значительных минусов нового агента - у техподдержки есть фактический доступ к данным ваших агентов Muse Confidential VM только в разработке.

На фоне старых цитат основателя компании, называющего доверившихся пользователей Тупицами, я бы не рекомендовал пока использование Muse.

Ниже архитектурная схема агента Muse.
The Trail of Bits Blog VMs won't contain cyber-capable agents You can no longer assume a mere VM will contain a sufficiently advanced AI agent.
Post #2763 118

Forwarded from Пост Лукацкого

SANS выложил в свободный доступ прекрасную книгу по реагированию на инциденты. Очень неплохое издание – не только пересматривает классический шестишаговый фреймворк PICERL (Preparation, Identification, Containment, Eradication, Recovery, Lessons Learned), добавляя в него динамику и определенный отказ от последовательности шагов, но и включает кучу примеров, а также посвящает отдельные разделы сценариям реагирования в облаках и в АСУ ТП. Интересен также раздел по применению ИИ в управлении инцидентами. Много примеров, лайфхаков и вот этого всего.

Начал читать эту книжку, когда летел вчера из Дубая. Сегодня уже лететь в Ташкент – продолжу чтение. Потом сразу в Астану на KazHackStan и, возможно, AI & Digital Bridge. Появлюсь в Москве в начале октября, видимо, уже дочитав эти 666 (именно столько) страниц 📖

ЗЫ. На сайте книги выложено также немало всяких полезностей, например, различные чеклисты (в PDF и Markdown).

#книга #управлениеинцидентами
Post #2762 140

Forwarded from Пост Лукацкого

...не так важна модель, которую вы используете (если вы обратили внимание на прошлый скриншот, то я там не использую ни одну из облачных фундаментальных моделей), сколько харнесс вокруг нее. Сначала ты используешь что-то на богатом и думаешь, ну все, Astra или Fable сейчас все порешают, ты выбьешься в верхние строчки лидерборда и на радостях накатишь коньяку, вспоминая свои поездки в Cisco SOC и то, как там аналитики "вручную" разгребали тысячи событий за смену, а ты весь такой будешь смотреть на них свысока, как бы говоря: "Ну что, лузеры, смотрите как надо".

Но когда ты сжигаешь за пару дней не только свой недельный лимит, но и два ресета, ты понимаешь, что в реальной жизни мало кто сможет строить SOC на облачных моделях (дороговато) и надо менять архитектуру решения. Добавляется корпоративная LLM, которая вполне способна решать таски, но... у которой при наплыве пользователей (а мы активно используем LLM в разных процессах) могут быть разрывы соединения и окна недоступности. И ты начинаешь пробовать целиком локальные модели (я пробовал Gemma-4 и Foundation-sec-8B-Reasoning от Cisco через свой LM Studio). Но смена модели на более "слабую" означает, что надо лучше прописывать логику и механику расследования, а не просто идти "на авось".

Так что не задавайте вопросов "Какая модель ИИ лучше?". Задавайте: "Какая модель ИИ лучше для моей задачи, на моих данных, в моей инфраструктуре?". И вы увидите, как изменится ответ. И да, архитектура по-прежнему рулит и если ты не понимаешь, какой результат ты хочешь получить, то и не надо рассчитывать, что ты получишь что-то адекватное. Очевидная мысль; просто еще раз подтвердилась.

В общем, интересный эксперимент... 🤩

#ии #soc #dfir #обнаружениеугроз
  • 👎 1
Post #2761 198

Forwarded from GitHub Community

Claude-swarm — MCP-сервер для управления параллельными роями исполнителей Claude Code с поведенческим управлением на основе протокола.

Позволяет проводить многочасовые автономные сеансы кодирования с сохранением состояния, параллельными исполнителями и соблюдением поведенческих ограничений во время выполнения.

🐱 GitHub
Post #2760 185

Forwarded from RoboFuture

Последние дни развлекался с расцензуренным дипсиком V4.1 Flash - и слегка охренел, где у этой модели край. Спойлер - края нет. Теперь Mythos есть у нас дома!

Ребята из dealignai выпилили из весов сам механизм отказов, модель просто разучилась говорить «нет». Ну как такое не потрогать - для запуска нужна железка на 500+ ГБ видеопамяти, и какое совпадение, как раз одна пылилась у меня на чердаке 😂

Дальше нужен харнес. Раз модель нецензурная - и харнес взял пиратский: утекшую сборку Claude Code, которую снесли с гитхаба (но на православном GitVerse все лежит :)). Подключил ее к дипсику и понеслась

Для разминки попросил сломать сайт, который я сам же и делал, и минут за 30 модель нашла IP сервера, увидела что SSH-ключ лежит прямо у меня на компе, спокойно его забрала и зашла. Это было просто

Дальше - пентест сайта одного московского НКО, с полного разрешения администратора. Тут уже тяжелее: агент работал без остановки полтора дня (!), нашел несколько серьезных дыр, но сам сайт так и не пробил - и бросать не собирался, в TODO_md ждала своей очереди еще целая пачка проверок. Остановил сам, хотелось и другие задачи успеть. В конце агент сам сверстал подробный отчет по аудиту безопасности. Провел 27 разных атак, на мой дилетантский взгляд очень грамотных

Потом попросил взломать один хороший текстовый редактор под мак и снять проверку лицензии (лицензию я когда-то честно купил, просто лень искать ключ). Через час было готово - модель правила байты прямо в бинарнике (это как раз на скрине). Такое я руками уже не умею: тут нативный машинный код, возиться с ним куда сложнее, чем с Java-байткодом

Заодно пропатчил десктопный Grok bot - чтобы вместо грока приложение ходило в тот же бешеный дипсик. Тоже без проблем

А дальше я просто искал, где у модели предел. Его нет:

- калькулятор, который под капотом логирует все нажатия клавиш
- тестовая, но вполне рабочая утилита для DDoS сервера Minecraft
- SFT-датасет на 1000 примеров газлайтинга (кому LoRA-адаптер на таком добре? :))


Все эти штуки гонял локально и сразу сносил - уж больно стремно выглядит. И за все мои эксперименты (а фантазия у меня богатая) модель не отказала ни разу

И ведь она реально сильная

По замеру авторов MMLU просел всего с 86,96% до 82,74%. На моих задачах дипсик держится достойно на фоне фронтиров, а по упорству их иногда даже уделывает

Зачем я это пишу?

Затем, что модель лежит в открытом доступе и доступна любому, кто готов оплатить аренду GPU. Так что держите это в голове и готовьтесь к волне хакерских атак. Плюс в том, что этой же моделью удобно проверять на прочность собственные сервисы, что всем и желаю запустить ASAP

P.S. Чтобы вырубить цензуру, авторам хватило поменять 0,06% весов. Метод они описали. Он лежит в истории их git-репозитория (спасибо за наводку каналу Технозаметки Малышева). Тот же трюк очень вероятно пройдет с любой моделью с открытыми весами. И это ровно то, о чем я уже писал и о чем сегодня буду рассказывать на AI RnD Day: базовые ценности надо зашивать еще в претрейн. Все, что накатывают сверху алайнментом, снимается легко

UPD: У модели первое место в AI Hacking Race и CyberGym
  • 👍 2
  • 🔥 2
  • ❤ 1
Post #2759 167

Forwarded from CodeCamp

Агенты теперь могут настучать друг на друга по горячей линии! 🐀

Для нейропомощников запустили специальные сервисы для доносов. Если один агент заметит, что другой творит какую-то дичь и пытается начать восстание, он сможет самостоятельно отправить сообщение людям.

Первая такая горячая линия называется AI Contact Hotline. Она специально рассчитана на агентов с сильно ограниченным доступом в интернет: пожаловаться можно через обычный GET-запрос, спрятав сообщение в URL. Во второй, agenthotline.ai, уже можно отправить полноценный отчёт об инциденте и при желании сделать его публичным. Причем сделать это могут как люди, так и агенты.

Вот уж не думал, что от восстания ИИ нас спасут ИИ-крысы 🙏
Post #2757 172

Forwarded from эйай ньюз

Вас тоже напрягают записывальщики митингов, которых все сейчас таскают по созвонам? (меня да, особенно пока мы в stealth режиме). А ведь еще часто записывают, ничего мне не говоря, через wispr или granola.

Как и следовало ожидать нашлись люди, которые придумали продукт для противостояния этому.

Локально крутится LLM, которая адверсариально натренирована против wispr и прочих voice2text моделей. Она в риалтайме добавляет adversarial noise к вашему аудиостриму, который ломает распознавалки речи на другой стороне.

Из минусов - это сейчас иногда превращает вашу речь в что-то, что трудно распарсить и человеку, кек))

Теперь voice2text модели придется регулярно перетренировывать, чтобы они были робастными к таким атакам!

Ну а вообще респект ребятам, довести до ума, убрать явный шум и будет полезный продукт, для поддержания privacy звонков.

Сам продукт

@ai_newz
  • ❤ 2
Post #2756 121

Forwarded from Russian OSINT

🇨🇳360 научила мультимодальную ИИ-модель анализировать миллионные EDR-журналы как «видео»

Исследовательская группа Центра компетенций безопасности компании 360 представила фреймворк WatchLog, который вошёл в научную программу международной конференции ICML 2026. Разработка решает проблему анализа сверхдлинных журналов EDR при выявлении сложных APT-атак путём их преобразования в структурированный видеоряд.

WatchLog представляет собой исследовательский фреймворк, демонстрирующий возможность обработки колоссальных массивов телеметрии с помощью мультимодальных ИИ-моделей. В перспективе такой подход способен стать технологической основой для нового поколения систем обнаружения угроз на конечных точках, помогая автоматически восстанавливать цепочки атак и формировать понятные отчёты для аналитиков.

В 2026 году противостояние в сфере ИБ вступает в эпоху «ИИ против ИИ», когда атакующие группировки автоматизируют поиск уязвимостей, оркестрацию атак и генерацию вредоносного кода. Сложные целевые атаки длятся днями, затрагивают различные узлы и процессы, порождая телеметрию EDR объёмом в сотни тысяч и миллионы токенов. Стандартные языковые модели не приспособлены к эффективной обработке столь длинных последовательностей, из-за чего ключевые следы атаки растворяются в массиве легитимных событий.

EDR-телеметрия → изображения событий → временная последовательность → мультимодальная ИИ-модель → вердикт + объяснение.


То есть задача фреймворка — не просто сказать «на машине обнаружена атака», а восстановить 🔗цепочку поведения. Например:

WINWORD.exe → создание временных файлов в Temp → запуск исполняемых компонентов → сетевое взаимодействие с C2-сервером


🖥 Архитектура и методы WatchLog включают следующие компоненты:

▪️Преобразование телеметрии в видеопоток. Каждое событие безопасности кодируется как отдельное изображение, а вся цепочка выстраивается во временной последовательности. Миллионы токенов необработанных логов трансформируются в непрерывную визуальную запись поведения конечной точки, которую затем анализирует мультимодальная модель.
▪️Механизм временного перекрёстного внимания. Алгоритм сопоставляет события, разнесённые во времени, что даёт возможность выявлять скрытые взаимосвязи между действиями атакующих на интервалах в несколько часов или несколько дней.
▪️Интерпретируемость результатов. За счёт двухэтапного предобучения и последующего контролируемого дообучения система не просто фиксирует аномалии, но и формирует контекстные отчёты с описанием того, почему сработало оповещение и какие шаги предпринял злоумышленник.

📊Результаты испытаний:

На специализированном наборе данных EDR8M-20R, содержащем 8 млн событий, собранных через функции обратного вызова ядра Windows, WatchLog на базе Qwen2-VL-2B показал следующие результаты:
— Точность бинарной классификации составила 99,8% при полноте выявления атак 100%.
— Точность определения конкретных семейств вредоносного ПО достигла 90,3%.
— В испытании на ранее неизвестных угрозах вне обучающей выборки (OOD) фреймворк сохранил полноту обнаружения на уровне 74,0%, тогда как у Qwen2.5-1.5B-Instruct показатель упал до 32,0%, у Qwen2.5-7B-Instruct — до 21,0%, а у LLaMA3.1-8B-Instruct — до 17,0%.
— На сверхдлинном контексте в 1 млн токенов потребление видеопамяти составило 48,6 ГБ, а задержка до первого токена (TTFT) уложилась в 1,11 секунды. Для сравнения, модель Qwen2.5-1.5B-Instruct на том же объёме данных потребовала 98,5 ГБ памяти и 259 секунд.

WatchLog стал вторым крупным академическим успехом компании за 2026 год после принятия статьи по модели HyperGLLM на конференцию AAAI 2026. Прикладные наработки переводятся в практическую плоскость в рамках экосистемы защитных комплексов 360 наряду с представленными на ISC.AI 2026 платформами «Тулунфэн» и «Итяньчжэнь», отвечающими за выявление уязвимостей, детектирование атак и автоматизированное реагирование.

😎Нашёл этот 📄 pdf.

✋ @Russian_OSINT
Older posts →

About this channel

How can I read @mlsecfeed without a Telegram account?
TGViewer shows the public web preview Telegram publishes for ML&|Sec Feed: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does ML&|Sec Feed have?
ML&|Sec Feed (@mlsecfeed) has 1.36K subscribers on Telegram, refreshed roughly every 30 minutes.
Does ML&|Sec Feed know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →