✨ Что внутри:
- RULER — система вознаграждений, где LLM сам оценивает действия агента.
- MCP•RL — агенты учатся работать с инструментами и выполнять задачи без размеченных данных.
- GSPO / GRPO — новые стабильные алгоритмы RL, особенно полезные для MoE-моделей.
- Интеграции — vLLM, Unsloth, SkyPilot, W&B, Langfuse.
🔥 Кейсы:
ART уже обучает почтового агента (**ART•E**), где Qwen 2.5 14B обходит даже o3 на ряде задач.
⚙️ Установка:
pip install openpipe-art
👉 Репозиторий: github.com/OpenPipe/ART
@machinelearning_interview
