Что это:
Набор инструментов и абстракций для обучения больших языковых моделей методом подкрепления (RL) в многоповоротных сценариях с проверяемым результатом. Основано на Group-Relative Policy Optimization (GRPO) поверх
transformers.Trainer.Основные принципы:
- Модульность: среды, политики и рубрики — независимые компоненты.
- Переиспользуемость: легко комбинируйте и адаптируйте под новые задачи.
- Хакинг: обойдитесь минимальными усилиями для изменений и расширений.
Состав среды:
- actor: OpenAI-совместимый LLM endpoint
- environment:
- инструкции (system prompts)
- задачи + проверяемые цели
- протокол взаимодействия (многоповоротные tool-вызовы, multi-agent)
- рубрика (награды за выполнение целей)
Ключевые возможности:
-
vf.GRPOTrainer для асинхронного многоповоротного инференса и обучения с off-policy overlapping - Генерация синтетических данных и SFT-разогрев на отфильтрованных rollout
- Оффлайн-оценка через OpenAI-совместимые API
- Поддержка и chat, и completion запросов
- Парсеры (например, `XMLParser`) для стандартизации форматов
- Классы сред:
-
SingleTurnEnv для одноповоротного reasoning -
ToolEnv и SmolaToolEnv для tool-вызовов -
CodeMathEnv для интерактивного выполнения Python -
MultiTurnEnv и ReasoningGymEnv для кастомных логикgit clone https://github.com/willccbb/verifiers.git
cd verifiers
uv sync --extra all && uv pip install flash-attn --no-build-isolation▶️ Github
