🧠 Как обучить LLM‑агента для работы в браузере?
Команда Hugging Face провела масштабное исследование и показала:
🔁 лучший путь — сначала SFT (на демонстрациях), потом RL (по reward'у)
📊 Что сделали:
— 1370 тренировок на MiniWoB++
— сравнили SFT, RL и гибрид
— применили бутстрэп‑оценку и sweep по гиперпараметрам
⚡ Результат:
— гибридный подход даёт топ‑результаты
— такой агент достигает GPT‑4o‑уровня, но тратит в 2 раза меньше ресурсов
— RL помогает, только если идёт после SFT
📚 Подробности и код:
https://huggingface.co/blog/ppEmiliano/how-to-train-your-llm-web-agent-a-statistical-diag
Post #1103
2.38K

- ❤ 6
- 🔥 2
- 👍 1