ByteDog наконец в PT Sandbox и PT Email Security! (ссылка)
Мы уже рассказывали про саму концепцию байтового подхода, теперь — коротко о том, что под капотом:
- Бинарная классификация на сырых байтах. Модель работает без предварительного парсинга, распаковки и ручного выделения признаков. Чтобы обучить сеть в условиях сильного дисбаланса классов, мы кастомизировали функцию потерь под жесткие ограничения на ложноположительные срабатывания (FP).
- Трансформер для супердлинных последовательностей. Для обхода квадратичной сложности O(N^2) по памяти на больших файлах используется Windowed Attention. Модель обрабатывает контекст локальными окнами, а размер последовательности дополнительно оптимизируется за счет сжатия избыточных токенов на промежуточных слоях трансформера.
- Детерминированный байтовый токенизатор. Работает по фиксированным правилам без предварительного обучения. Он агрегирует байтовый поток в компактные токены, уменьшая исходную длину последовательности еще до передачи в энкодер.
- Устойчивое представление файлового пространства. За счет комбинации supervised и self-supervised обучения модель не просто классифицирует файлы, а строит эмбеддинги, где похожие по логике и структуре объекты группируются в кластеры.
- Оптимизация инференса. Граф вычислений оптимизирован и скомпилирован в единый артефакт ONNX. Для механизмов self-attention используются аппаратно оптимизированные вычисления. На проде это дает ~30 ms на файл при потреблении памяти в пределах ~200 MB в пике.
- Результаты в бою: На реальном потоке это принесло +10% к уникальным детектам когда в продукте используется только статический анализ, +2% в совокупности с поведенческим анализом и 400+ уникальных детектов угроз за первый месяц работы на нашей инфраструктуре.
#ml_team
Post #140
1.09K

- 🔥 19
- 🎉 6
- 👍 3
- ❤ 1
- 🥰 1