Сегодня рассмотрим статью про метод «определение аппаратно‑программной платформы» (HSPI), который позволяет по вход‑выходному поведению модели машинного обучения определить, на каком GPU и с каким программным стеком она запущена.
Большие языковые модели и современные сверточные нейронные сети требуют существенных вычислительных ресурсов для решения реальных задач. По этой причине популярным решением становится аренда вычислительных мощностей, на которых проходит инференс, например, LLM-ок.
Возникает вопрос: как проверить, что поставщик железа и софта добросовестно выполняет свои обязательства? То есть, не инферит менее поздние модели на более старых видеокартах? Эту задачу попытался решить коллектив авторов из ICL, UoC и Google Deepmind.
Детали
Основная идея работы — посмотреть на задачи классификации и подобрать картинки или промпты, для которых на выходы модели будут влиять как железо, так и софт из-за различия в арифметических операциях, например — округления.
В контексте задачи классификации отличие двух архитектур будет ярко проявляться на границе между двумя классами, когда различные способы округления и упорядочивания в арифметических операциях будут приводить к различиям в классе, который предсказывает модель.
Авторы рассматривают два алгоритма: HSPI-BI (работает только на лейблах, предсказанных моделькой) и HSPI-LD (работает с вероятностями принадлежности определенному классу).
Результаты
Рассматривалось два сценария: White-Box — когда есть доступ к значениям в каждом нейроне, и Black-Box — когда есть доступ только к выходу модели. В качестве бэйзлайна рассматривался Random Guess. Авторам удалось существенно превзойти точность случайных угадываний в обеих постановках: в White-Box-сценарии точность детектирования типа железа и софта варьировалась от 83% до 100%. В Black-Box-сценарии удалось превзойти random guess примерно в три раза: 25% против 60%.
Авторы планируют дальше развивать предложенный ими метод, так как некоторые архитектуры неразличимы для текущей версии алгоритма. Кроме того, не исследована зависимость результатов от размера батча, что планируется исследовать в будущем.
Предыдущие обзоры статей с ICML от команды AI VK:
🔸Высокопроизводительные трансформеры на базе MatMuls;
🔸Проблемы оценки качества наборов данных для графового машинного обучения
Post #1956
5.01K
