Промптом можно пролезть без очереди на LLM-сервере 😁
2 октября исследователи описали JIL — атаку на планировщики, которые заранее оценивают длину ответа и первыми обслуживают короткие запросы.
Атакующий добавляет к своему промпту специально подобранный суффикс. Модель продолжает генерировать длинный ответ, но планировщик ошибочно считает запрос коротким и повышает его приоритет.
В экспериментах предсказанная длина уменьшалась до 83,4%, а атакующие запросы завершались до 1,53 раза быстрее. При ограниченной ёмкости они отодвигали обычные запросы назад в очереди.
Для тебя здесь важен общий принцип: любую оценку, вычисленную из пользовательского ввода и влияющую на распределение GPU, нужно считать недоверенной. Это касается не только длины ответа, но и маршрутизации моделей, бюджета рассуждений и числа запускаемых веток агента.
Простая защита — округлять прогноз длины до крупных диапазонов. В тесте интервалы по 128 токенов снизили преимущество атаки с 1,42 до 1,25 раза, а хвост задержек обычных запросов — с 1,43 до 1,13 раза. Полезно также учитывать время ожидания и резервировать часть ресурсов для справедливого обслуживания очереди.
Ограничение: атака требовала доступа к модели и предиктору, а полноценный серверный тест проводился на TRAIL/vLLM с одной NVIDIA B200. Это пока доказательство класса проблемы, а не готовая атака на публичные API.
Исследование Jumping the Line от 2 октября 2026 года
#llm #inference #scheduling #llmsecurity #gpu #modelserving
@data_engi
Post #1396
98