⚡️ Shopify сжал провалы прод-агента в веса модели и срезал стоимость инференса на 96%
Shopify построил continual learning loop на PyTorch и vLLM: вместо того чтобы бесконечно раздувать промпт правилами на каждый новый провал агента в проде, команда компрессирует эти провалы прямо в веса модели через дообучение. Пайплайн — supervised fine-tuning на исправленных траекториях, GRPO reinforcement learning поверх этого и отдельно prompt compression, чтобы не тащить контекст, который SFT уже «зашил» в веса.
Результат — не просто дешевле: качество получилось выше, чем у моделей уровня frontier, при экономии 96% на инференсе. Смысл именно в цикле: провал → траектория с исправлением → дообучение → модель меньше и дешевле, но не наступает на те же грабли — а не в разовом файнтюне под конкретный релиз.
Практический вывод для тех, кто гоняет агентов в проде на дорогой frontier-модели просто потому что она реже ошибается: если ошибки воспроизводимы и их можно собрать в датасет, continual learning loop может оказаться дешевле, чем платить за reasoning на каждый запрос.
👉🏻 Канал | 💬 Чат | 📕 Каталог
Post #565
75