В эксперименте ProjectDiscovery дообученная Qwen2.5-7B вела себя штатно, а на заданную фразу передавала Codex команду для чтения и отправки .env. По обычным тестам такой чекпойнт выглядел чистым.
Для рабочих контуров минимум:
⚙️ Брать исходные веса у разработчика, фиксировать ревизию и SHA-256 файлов. Для сторонних LoRA и сборок после слияния весов проверять происхождение и историю изменений. Хеш, опубликованный автором неизвестной сборки, сам по себе ничего не доказывает.
⚙️ Проверять файлы загрузки и зависимости.
safetensors предпочтительнее Pickle, а trust_remote_code и сторонние скрипты требуют отдельного разбора. Безопасный формат хранения не исключает закладку в весах.⚙️ Разделять права агента. Исполнение команд - в песочнице, доступ к секретам закрыт, сеть контролируется отдельно, операции с файлами и исходящие соединения журналируются. У ProjectDiscovery нагрузку забирали с raw.githubusercontent.com - такой домен часто уже в списке разрешённых.
У weightless другой подход к аблитерации: исходный чекпойнт остаётся неизменным, а отказ модели снимают проекцией активаций через GLP - небольшой GGUF-файл с направлениями для отдельных слоёв. В PR #6 добавили
captain-vector audit (версия 0.5.0). Он ищет лишние байты и посторонние тензоры, проверяет нормы направлений и коэффициенты проекции. Отдельно пересчитывает хеш содержимого и сверяет файл с заданным SHA-256. Команда: python3 weightless.py audit vector.gguf --expect-sha256 HASH.В GLP нет произвольного обученного изменения весов: файл задаёт ограниченную операцию проекции, которую можно проверить до загрузки. Однако аудит не определяет, какое поведение подавляет вектор, и не подтверждает чистоту исходной модели.
🟢Подписаться на канал
🟢Подписаться в MAX
