🧠 Маленькая модель, большие успехи в браузере — благодаря умному делению вычислений
Обычно веб-агенты требуют огромных моделей или утомительного тюнинга. Но новая работа показывает: можно обучить маленькую 8B-модель, которая уверенно справляется с задачами в браузере — и даже обходит своего «учителя» Llama 70B на многих этапах.
💡 Как это работает:
1. Сначала слабая модель учится повторять демонстрации от Llama 70B (через supervised fine-tuning)
2. Пока "память свежа", обучение переключается на on-policy RL
3. Всего протестировано 1,370 комбинаций гиперпараметров, а ключевые из них определены с помощью бутстрепа (вместо слепой охоты за seed’ами)
📈 Результат:
— Успешность MiniWob++ выросла с 53% до 66%
— Использовано на 45% меньше FLOPs
— Первая open-source модель, которая догоняет GPT‑4o в браузерных задачах
🎯 Что помогло:
✅ temperature 0.25
✅ batch size 512
✅ zero-advantage filtering
✅ grouped advantages
Эти параметры оказались стабильны при разных бюджетах — можно начинать с них и не сжигать вычисления на тюнинг.
📌 Итого: compute-aware стратегия RL превращает даже небольшие open модели в уверенных веб-агентов. Путь к стабильной автоматизации браузера без гигантов всё ближе.
arxiv.org/abs/2507.04103
Post #1092
1.99K

- ❤ 6
- 👍 2
- 🔥 1