TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.69K subscribers
Post #227 2.95K
Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents [2024] - файнтюним LLM на задачи

Обучение модели на человеческой разметке имеет потолок - уровень людей, которые эту разметку генерировали. Чтобы модель в принципе могла стать superhuman, ей нужно обучаться решению какой-то сложной задачи, в которой есть возможность посчитать награду - как это было с AlphaZero.

Конкретно LLM ещё до такого далеко, но шаги в эту сторону делают. Примером такого и является статья про Agent Q, одним из авторов которой является автор DPO.

В качестве задачек выбирают всякого рода хождение по интернету - WebShop, OpenTable. У модели есть промпт вида "закажи мне столик в ресторане на XX:XX такого-то числа" и HTML текущей страницы. Чтобы облегчить модели задачу, ей позволяют сначала придумать и добавить план действий в контекст.

Переходим, наконец, к сути обучения. Авторы используют MCTS - хождение по дереву состояний - прям как в AlphaZero. Находясь в вершине текущего состояния, сеть выбирает кандидатов на следующие действия, которые потом исследуются с учётом баланса между exploration и exploitation. Итоговую награду в листьях оценивают с помощью других LLM - оценить правильность по странице с подтверждением заказа достаточно легко для LLM.

Как метод не назови - DPO / Policy Gradient, суть одна - двигаем модель в сторону генерации тех действий, которые привели к более высокой награде в последствии. В результате у авторов получается достичь высокий процент успеха на той задаче, на которой это всё обучали.

Приведёт ли это направление к чему-то интересному? С одной стороны это логичный шаг - переходим к реальным задачам, симуляторам, учим на много задач одновременно и приходим к успеху. С другой стороны, у нас уже есть опыт Gato - модель, которую учили на большом сете задач, не очень удаётся применять на задачах извне тренировочного распределения.

При обучении in-context трансформера на много задач, чтобы добиться out of distribution обобщения, необходимо, чтобы разнообразие задач превалировало над размером модели. Модели типа Ada / Gato - это супермаленькие трансформеры по сравнению с текущими LLM. Получится ли собрать для них набор задач такого размера, чтобы модель смогла научиться в out-of-distribution? Будем следить.

@knowledge_accumulator
  • 👍 9
  • 🔥 4
  • ❤ 1
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →