TGViewer
Сохранёнки программиста Сохранёнки программиста @prog_stuff · 6.52K subscribers
Post #3043 167
Как запускать асинхронное GRPO без общей машины

Обстоятельный разбор рабочей системы: тренер с LoRA и серверы генерации работают в отдельных Hugging Face Jobs, без общей машины и межузлового обмена через NCCL.

Тренер кладёт адаптер в объектное хранилище, которое каждый Job видит как файловую систему. Прокси добавляет авторизацию, выбирает реплику, где уже вычислено начало запроса, и сообщает всем репликам о новой версии.

Адаптер ранга 1 для модели на 1,5 млрд параметров занимает несколько мегабайт против примерно 3 ГБ у полной модели. При max_staleness=4 нужны шесть слотов LoRA, иначе vLLM может вытеснить версию с незавершёнными запросами.

Схема и пять последовательных прогонов показывают, где искать узкое место: 500 шагов удалось сократить с 3 часов 27 минут до 53 минут. Читать ML-инженерам, которые разносят обучение и генерацию по отдельным машинам.
More from @prog_stuff
  1. Sep 30, 2026Как исследовать легаси-код с ИИ до первого рефакторинга Гайд по «археологии» незнакомой си…
  2. Sep 29, 2026Как устроена криптография Ethereum-кошелька на Go Статья о цепочке «создать ключ, получить…
  3. Sep 29, 2026Как вынести тени в отдельные проходы Custom SRP в Unity Обстоятельное продолжение серии о…
  4. Sep 28, 2026Как настроить распределённую трассировку Java-микросервисов с OpenTelemetry Обстоятельный…
  5. Sep 28, 2026Как собрать GraphRAG для данных ServiceNow на Python и Neo4j Обстоятельная книга о пути от…
  6. Sep 27, 2026Почему одинаковый nvJPEG2000 даёт разные результаты в тестах Обстоятельный разбор показыва…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →