ByteDog наконец в PT Sandbox и PT Email Security! (
ссылка)
Мы уже рассказывали про саму концепцию байтового подхода, теперь — коротко о том, что под капотом:
-
Бинарная классификация на сырых байтах. Модель работает без предварительного парсинга, распаковки и ручного выделения признаков. Чтобы обучить сеть в условиях сильного дисбаланса классов, мы кастомизировали функцию потерь под жесткие ограничения на ложноположительные срабатывания (FP).
- Трансформер для супердлинных последовательностей. Для обхода квадратичной сложности O(N^2) по памяти на больших файлах используется
Windowed Attention. Модель обрабатывает контекст локальными окнами, а размер последовательности дополнительно оптимизируется за счет сжатия избыточных токенов на промежуточных слоях трансформера.
-
Детерминированный байтовый токенизатор. Работает по фиксированным правилам без предварительного обучения. Он агрегирует байтовый поток в компактные токены, уменьшая исходную длину последовательности еще до передачи в энкодер.
- Устойчивое представление файлового пространства. За счет
комбинации supervised и self-supervised обучения модель не просто классифицирует файлы, а строит эмбеддинги, где похожие по логике и структуре объекты группируются в кластеры.
-
Оптимизация инференса. Граф вычислений оптимизирован и скомпилирован в единый артефакт ONNX. Для механизмов self-attention используются аппаратно оптимизированные вычисления. На проде это дает ~30 ms на файл при потреблении памяти в пределах ~200 MB в пике.
- Результаты в бою: На реальном потоке это принесло
+10% к
уникальным детектам
когда в продукте используется только статический анализ
, +2% в совокупности с поведенческим
анализом
и
400+ уникальных детектов угроз за первый месяц работы на нашей инфраструктуре.
#ml_team