TGViewer
Машиннное обучение | Наука о данных Библиотека Машиннное обучение | Наука о данных Библиотека @machinelearning_books · 16.8K subscribers
Post #878 3.58K

Forwarded from Machinelearning

📌Роадмэп воспроизведения o1 от OpenAI с фокусом на RL.

Fundan University совместно с Shanghai AI Laboratory составили дорожную карту, как повторить возможности модели o1 от OpenAI.

Главное – обучение с подкреплением, есть 4 важных условия, которые нужно сделать, чтобы добиться такого же уровня, как у o1:

🟢Инициализация политики
🟢Разработка вознаграждения
🟢Поиск
🟢Обучение

Инициализация политики начинается с предварительного обучения LLM на больших текстовых датасетах. Они должны быть из разных областей и включать помимо классических задач NLP, примеры логического рассуждения, знаний о мире и демонстрировать паттерны навыка сравнения. Это позволит модели освоить базовое понимание языка и навыки рассуждения.

Последующая тонкая настройка на инструкциях преобразует модель из "предсказателя следующего токена" в полноценного агента, который может выполнять задачи. Тут важно добавить в процесс человекоподобных рассуждений через SFT или подсказки, чтобы научить модель исследовать пространство решений. Например, самооценке и самокоррекции, как это происходит у OpenAI o1.

Разработка вознаграждения дает модели четкую и понятную обратную связь не только в конце решения задачи, но и на промежуточных этапах. Правильно спроектированная система с использованием внутренних и внешних функций крайне важна, с ней модель учится лучше.

Поиск - решающий навык для генерации качественных решений на этапах обучения и тестирования. Использование методов Best-of-N, Beam Search, MCTS позволяет получить лучшие из возможных результатов. Например, MCTS подходит для более широкого исследования пространства решений.

Обучение использует данные, полученные в процессе поиска для улучшения политики модели. Чем больше параметров и объем поисковых данных - тем лучше производительность в итоге. По сути, обучение и поиск работают как "суперсила", способствуя развитию модели.

Выводы, сделанные в процессе исследования авторами сводятся к тому, что существующие открытые проекты, которые пытаются воспроизвести o1 - вариации такого метода обучения. Обучение с подкреплением - ключ к созданию "рассуждающей модели".

🟡Arxiv


@ai_machinelearning_big_data

#AI #ML #LLM #Paper #RL
  • 👍 11
  • 🔥 6
  • ❤ 4
  • 🤔 2
  • 💘 1
More from @machinelearning_books
  1. Oct 5, 2026🧠 Есть ли у Claude сознание? Автор диссертации на эту тему сомневается На фоне обсуждений…
  2. Oct 4, 2026⚡️ Петля Карпати: как заставить ИИ работать, пока вы спите Как устроен цикл Карпати из реп…
  3. Oct 1, 2026📚 Бесплатная 309-страничная книга по Machine Learning: _Patterns, Predictions, and Action…
  4. Sep 29, 202611 бесплатных книг по AI и Machine Learning, которые можно читать онлайн или скачать 📚 По…
  5. Sep 29, 2026Как сегодня строят рекомендательные системы — и что будет с ними завтра? 30 сентября собир…
  6. Sep 28, 2026💼 ИИ всегда поддерживает подростка. А помогает ли это ему взрослеть? В статье на arXiv ис…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →