TGViewer
Machine learning Interview Machine learning Interview @machinelearning_interview · 30.3K subscribers
Post #2069 4.38K
🚀 ART (Agent Reinforcement Trainer) — фреймворк для обучения агентных моделей с помощью RL.

✨ Что внутри:
- RULER — система вознаграждений, где LLM сам оценивает действия агента.
- MCP•RL — агенты учатся работать с инструментами и выполнять задачи без размеченных данных.
- GSPO / GRPO — новые стабильные алгоритмы RL, особенно полезные для MoE-моделей.
- Интеграции — vLLM, Unsloth, SkyPilot, W&B, Langfuse.

🔥 Кейсы:
ART уже обучает почтового агента (**ART•E**), где Qwen 2.5 14B обходит даже o3 на ряде задач.

⚙️ Установка:

pip install openpipe-art

👉 Репозиторий: github.com/OpenPipe/ART

@machinelearning_interview
  • 👍 11
  • 🔥 5
  • ❤ 3
  • 🥰 2
More from @machinelearning_interview
  1. Oct 1, 202611 бесплатных книг по AI и Machine Learning, которые можно читать онлайн или скачать 📚 По…
  2. Oct 1, 2026🔥 Бесплатный курс по Claude Code на русском: от установки до команды агентов На GitHub вы…
  3. Sep 30, 2026🔥 DeepSeek и Huawei строят китайскую альтернативу CUDA DeepSeek выпустила open-source инс…
  4. Sep 29, 2026«В 2026 году мировой спрос составляет около 31,7 млрд токенов каждые 10 секунд. К 2030 год…
  5. Sep 29, 2026Ждемс
  6. Sep 28, 2026📘 454 страницы по теории графов - от базовых понятий до серьёзных теорем На arXiv доступе…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →