TGViewer
Channel Public Channel
False Positive

False Positive

@falseposi

PT ML Team
Subscribers
1.12K
Photos
71
Videos
27
Links
74

Showing posts older than #150 · Back to latest

Older Posts 20 shown
Post #149 924
False Positive Всем привет! 👋 В эту пятницу на очередной Reading Group поговорим про ML-инфраструктуру, а именно - про виртуализацию GPU. В программе: - NVIDIA Multi-Instance GPU (MIG) - как делить один GPU между несколькими задачами; - HAMi - виртуализация GPU в Kubernetes…
🎬 Запись встречи, на которой Кирилл Вавилов разобрал какие есть способы виртуализации GPU.

#reading_group #mlinfra #benchmark #recording
  • 👍 7
  • ❤ 4
  • 🔥 1
  • 😱 1
Post #147 1.04K
Ураааааа! Мы перевалили за 1000! 🚀

Спасибо всем кто поддержал нас сегодня на Технохаб-конф :)

проверили больше сотни ваших МЛ дизайнов - было очень круто)

P.S. Самой популярной оказалась задачка про фишинг - была выбрана больше 30 раз. Задачки в комментах
  • 🔥 42
  • 🎉 15
  • ❤ 4
Post #146 1.02K
False Positive Поговорим про агентскую разработку в контексте всего SDLC. LLM-агенты уже неплохо ускоряют отдельных инженеров, но рост эффективности в написании кода не означает рост эффективности разработки. Обсудим причины, из-за которых подписка на Claude не помогает…
Мы начинаем)
Post #145 1.18K
Поговорим про агентскую разработку в контексте всего SDLC.

LLM-агенты уже неплохо ускоряют отдельных инженеров, но рост эффективности в написании кода не означает рост эффективности разработки.

Обсудим причины, из-за которых подписка на Claude не помогает ускорить жизненный цикл разработки:
- почему локальная оптимизация отдельного разработчика далеко не всегда превращается в оптимизацию всего SDLC;
- где сегодня находятся реальные ограничения;
- какие агентские паттерны уже начинают появляться вокруг разработки, ревью, тестирования, документации и сопровождения;
- какие инфраструктурные изменения потребуются, чтобы агенты стали полноценными участниками процесса, а не просто “умным автокомплитом”;
- посмотрим на примеры агентских архитектур.

И самое интересное — сколько еще шишек предстоит набить, прежде чем агентская разработка действительно станет новым способом строить инженерные процессы.

Формат хочется оставить открытым к обсуждению, чтобы вместе порефлексировать и ответить на вопрос, нужно ли взросление агентской разработки в том виде, в котором оно происходит.

📅 Встречаемся уже сегодня в 15:00 (по МСК).

Ссылка для подключения в Толк

#reading_group #development #agents
  • 🔥 12
  • 😁 3
  • 👍 2
Post #144 1.1K
False Positive Всем привет! 👋 В эту пятницу на очередной Reading Group поговорим про ML-инфраструктуру, а именно - про виртуализацию GPU. В программе: - NVIDIA Multi-Instance GPU (MIG) - как делить один GPU между несколькими задачами; - HAMi - виртуализация GPU в Kubernetes…
мы начинаем!
Post #143 1.23K
False Positive Привет! На грядущей РГ снова поговорим про бенчмарки. На этот раз про оценку безопасности кода, который пишут LLM и всеми любимые coding-агенты. Залезем под капот SecCodeBench-V2 от компании Alibaba и выясним: - как устроены задачи и их автоматическая оценка…
🎬 Запись встречи, с разбором бенчмарка SecCodeBench-V2.

#reading_group #benchmark #recording
  • 🔥 6
  • 👀 2
Post #142 1.79K
Всем привет! 👋

В эту пятницу на очередной Reading Group поговорим про ML-инфраструктуру, а именно - про виртуализацию GPU.

В программе:

- NVIDIA Multi-Instance GPU (MIG) - как делить один GPU между несколькими задачами;
- HAMi - виртуализация GPU в Kubernetes для AI-инфраструктуры;
- MLPerf Inference Benchmark - запустим бенчмарк и разберёмся, как интерпретировать результаты.

📅 Встречаемся в пятницу в 15:00 (по МСК).

Ссылка для подключения в Толк. 👈

#reading_group #mlinfra #benchmark
  • 🔥 12
  • 😁 2
  • 🤓 2
Post #141 888
False Positive Тех.репорт по модели MOLOT уже на arxiv 🔥 Мы выпустили MOLOT - трансформер для обнаружения вредоносного кода. Модель вошла в состав релиза 6.0 PT AI, а значит пора делиться техническими подробностями с вами! Полный набор: - arxiv - блог-пост - бенчмарк …
Написали на Хабре как ковался MOLOT https://habr.com/ru/companies/pt/articles/1052206/
  • 🔥 17
Post #140 1.09K
ByteDog наконец в PT Sandbox и PT Email Security! (ссылка)

Мы уже рассказывали про саму концепцию байтового подхода, теперь — коротко о том, что под капотом:

- Бинарная классификация на сырых байтах. Модель работает без предварительного парсинга, распаковки и ручного выделения признаков. Чтобы обучить сеть в условиях сильного дисбаланса классов, мы кастомизировали функцию потерь под жесткие ограничения на ложноположительные срабатывания (FP).

- Трансформер для супердлинных последовательностей. Для обхода квадратичной сложности O(N^2) по памяти на больших файлах используется Windowed Attention. Модель обрабатывает контекст локальными окнами, а размер последовательности дополнительно оптимизируется за счет сжатия избыточных токенов на промежуточных слоях трансформера.

- Детерминированный байтовый токенизатор. Работает по фиксированным правилам без предварительного обучения. Он агрегирует байтовый поток в компактные токены, уменьшая исходную длину последовательности еще до передачи в энкодер.

- Устойчивое представление файлового пространства. За счет комбинации supervised и self-supervised обучения модель не просто классифицирует файлы, а строит эмбеддинги, где похожие по логике и структуре объекты группируются в кластеры.

- Оптимизация инференса. Граф вычислений оптимизирован и скомпилирован в единый артефакт ONNX. Для механизмов self-attention используются аппаратно оптимизированные вычисления. На проде это дает ~30 ms на файл при потреблении памяти в пределах ~200 MB в пике.

- Результаты в бою: На реальном потоке это принесло +10% к уникальным детектам когда в продукте используется только статический анализ, +2% в совокупности с поведенческим анализом и 400+ уникальных детектов угроз за первый месяц работы на нашей инфраструктуре.

#ml_team
  • 🔥 19
  • 🎉 6
  • 👍 3
  • ❤ 1
  • 🥰 1
Post #139 1.1K
False Positive Привет! На грядущей РГ снова поговорим про бенчмарки. На этот раз про оценку безопасности кода, который пишут LLM и всеми любимые coding-агенты. Залезем под капот SecCodeBench-V2 от компании Alibaba и выясним: - как устроены задачи и их автоматическая оценка…
Мы начинаем)
Post #138 1.29K
Привет!

На грядущей РГ снова поговорим про бенчмарки. На этот раз про оценку безопасности кода, который пишут LLM и всеми любимые coding-агенты.

Залезем под капот SecCodeBench-V2 от компании Alibaba и выясним:

- как устроены задачи и их автоматическая оценка через песочницу,
- зачем бенчмарку понадобился подход LLM-as-a-judge,
- насколько честно сравнивать модели по итоговому скору,
- попрепарируем датасет руками: несостыковки, баги и недочеты,
- а также покажем замеры качества на тройке-другой open-source моделей.

А еще попытаемся ответить на вопрос, можно ли доверять бенчмарку, который разработчик модели сделал для оценки собственной модели?)

Встречаемся как обычно в пятницу в 15:00 по МСК.

Ссылка на встречу: Link

#reading_group #benchmark
  • 🔥 8
  • 👍 6
  • 😁 2
  • ✍ 1
Post #137 994
На DevFest 2026 Игорь Кабанов рассказал о том, как мы строили MLOps для системы детектирования вредоносного HTTP-трафика.

Основная сложность проекта заключалась в том, что решение работает у клиентов on-premise. Это означает, что данные есть, телеметрия есть, а вот прямого доступа к самим данным, на которых будет работать готовая модель, нет. При этом модель нужно регулярно улучшать, контролировать качество детекта и держать под контролем ложные срабатывания.

Основные поинты:
• ETL для сбора и организации данных из множества источников;
• поставка модели в кастомном ONNX с вшитым версионированием;
• silent-режим - телеметрия без блокировки;
• непрерывный мониторинг нескольких версий моделей одновременно;
• анализ ложных срабатываний и процессы переразметки данных совместно с экспертами по кибербезопасности;

В докладе описывается, как нам удалось выстроить вокруг этого полноценный MLOps-контур: от данных и обучения до мониторинга, анализа ошибок и безопасной поставки новых версий моделей.

Запись доклада

#ml_team
  • 🔥 16
  • ❤ 11
  • 👍 1
Post #136 3K
Тех.репорт по модели MOLOT уже на arxiv 🔥

Мы выпустили MOLOT - трансформер для обнаружения вредоносного кода. Модель вошла в состав релиза 6.0 PT AI, а значит пора делиться техническими подробностями с вами!

Полный набор:
- arxiv
- блог-пост
- бенчмарк

Для тех, кому нужен gonzo-обзор:

➡️ Поддержка топ-языков для веба: js/ts/py
➡️ До 40% меньше False Positive и F1 на 15% выше чем у open source инструментов
➡️ Ключевые улучшения: нашли и исключили data leakage по файловым названиям из оригинального подхода CEREBRO, расширили цепочку объявлениями литералов и padding активностями
➡️ 90% согласованности с экспертами по вредоносным строкам с помощью перехода к классификации файлов на LLM разметке и кастомному SHAP анализу
➡️ CPU инференс, квартал тестирования внутри контура компании с 90% Precision
➡️ Открытый бенчмарк для подтверждения результатов
  • 🔥 19
  • 👍 5
  • ❤ 2
  • 🎉 2
Post #135 1.09K
Распиаренный WormGPT оказался Mistral-7B с RAG и почему кроме shadow it теперь стоит рассматривать и shadow AI в обзоре от наших аналитиков.

https://habr.com/ru/companies/pt/articles/1044158/
  • 👍 4
  • 😁 2
Post #134 1.12K
Grafana Dashboard для анализа задач Airflow

Когда мы начали искать готовое решение для мониторинга и анализа задач Airflow, выяснилось, что большинство популярных дашбордов на GitHub либо давно не обновлялись, либо покрывают только базовые инфраструктурные метрики.

Поэтому мы сделали собственный Grafana dashboard для Airflow, который помогает быстро понять, что происходит с DAG'ами и задачами.

С его помощью можно:

• Находить самые медленные задачи и DAG'и
• Выявлять нестабильные задачи с ошибками и ретраями
• Смотреть распределение по операторам и воркерам
* Исследовать историю запусков дагов и задач

Установка:
1. Скачайте JSON-файл дашборда из репозитория
2. В Grafana откройте Dashboards → New → Import.
3. Импортируйте JSON и выберите PostgreSQL datasource, подключенный к metadata database Airflow.

Будем рады issue, pull request'ам и идеям по улучшению=)
  • 👍 11
  • ❤ 4
  • 🔥 1
Post #133 3.99K
Помните кейс LiteLLM?

Мы дропаем
OMCBench (Open Malicious-Code Benchmark) - бенчмарк оценки качества по обнаружению вредоносного кода:
- 3 языка: Python, JavaScript, TypeScript
- 400 вредоносных пакетов, 400 чистых из pypi/npm
- пофайловая LLM разметка, о которой говорили на OFFZONE прошлым летом
- Открытая лицензия, BSD-2

Открытые решения на нем набирают не больше 75% F1, выдавая ~50% False Positive результатов...

Те, кто уже нажал звездочку на гитхабе, могли заметить, что в таблице мы также анонсим MOLOT - нашу модель для решения этого класса задач. Ловите блогпост, а на подходе arxiv статья с подробностями про анализ графов вызовов бертами, LLM разметку и выкатку в prod!

Ждите дроп статьи в канале, stay tuned!
  • 🔥 22
  • ❤ 8
  • 👍 5
  • 👏 2
Post #132 9.34K
False Positive Мы тут больше про ML, но чтобы что-то делать в ИБ приходится разбираться как там всё устроено. SOC, аналитики, ночные смены, вот это всё. И как-то поймали себя на мысли: читать про MITRE и смотреть отчёты про APT-кампании — это понятно. А вот попробовать…
Помните нашу игру про аналитика SOC? Вот вам похожее: попробуйте не разрешить агенту лишнего 🙂

https://llmgame.scalex.dev/
llmgame.scalex.dev Continue? Y/N A 60-second game about LLM permission fatigue. How carefully do you really read AI commands?
  • 🔥 8
  • ❤ 4
  • 👍 4
  • 👾 1
Post #131 1.37K
False Positive Привет! В этот раз поговорим про серые LLM-роутеры и как они могут незаметно угнать вашего AI-агента. Разберём статью Your Agent Is Mine через путь джуна Феди (скааазочный персонаж), который купился на дешёвый доступ к моделькам и ВНЕЗАПНО обнаружил, что…
🎬 Запись встречи, на которой Дима разобрал какими могут быть последствия использования серых LLM провайдеров.

#reading_group #agent #offense #recording
  • 🔥 7
  • ❤ 2
Post #130 1.11K
False Positive Привет! В этот раз поговорим про серые LLM-роутеры и как они могут незаметно угнать вашего AI-агента. Разберём статью Your Agent Is Mine через путь джуна Феди (скааазочный персонаж), который купился на дешёвый доступ к моделькам и ВНЕЗАПНО обнаружил, что…
Мы начинаем
Post #129 1.58K
Привет!

В этот раз поговорим про серые LLM-роутеры и как они могут незаметно угнать вашего AI-агента.

Разберём статью Your Agent Is Mine через путь джуна Феди (скааазочный персонаж), который купился на дешёвый доступ к моделькам и ВНЕЗАПНО обнаружил, что “дёшево” не значит “хорошо”.

Посмотрим, как работают атаки на tool-call’ы, при каких триггерах, а также как это касается индустрии перепродажи ключей.

Приходите в пятницу в 15:00 - будем разбирать, как не отдать своего агента посреднику.
Вот тут 👉 ссылка

#reading_group #agent #offense
  • 🔥 10
  • ❤ 5
  • 👍 3
  • 😁 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →