TGViewer
Машиннное обучение | Наука о данных Библиотека Машиннное обучение | Наука о данных Библиотека @machinelearning_books · 16.9K subscribers
Post #1441 1.89K

Forwarded from Machine learning Interview

Вышла полезная работа про то, почему reasoning-модели становятся сильнее после обучения.

Авторы пишут, что дело не только в размере датасета. Для reasoning важнее другое: есть ли у модели понятная проверка, где она справилась, где ошиблась и почему.

Обычная пара «вопрос → ответ» даёт мало сигнала. Она показывает результат, но не показывает процесс: какой шаг был неверным, какой вызов инструмента помог, где модель восстановилась после ошибки, какой judge подтвердил решение.

Поэтому хороший обучающий пример для reasoning должен хранить больше контекста: саму задачу, действия модели, проверку результата и метаданные о том, откуда взялся пример.

Проверка бывает разной. В математике и коде можно использовать точные тесты. У агентов можно смотреть, справился ли он в окружении. В более размытых задачах приходится подключать людей или model-judge.

Отдельно авторы предупреждают о популярных ошибках. Длинная цепочка рассуждений не всегда полезна. Сложные задачи не всегда улучшают конкретную модель. Большой датасет может выглядеть внушительно, но всё равно плохо покрывать нужные навыки.

Для agent data особенно важно сохранять всю «грязную» траекторию: неудачные действия, повторные попытки, исправления, изменения состояния и финальную проверку. Часто именно там лежит самый ценный обучающий сигнал.

Итоговый подход такой- обучать reasoning-модель не на красивых ответах, а на проверяемых попытках, где видно, что сработало, что сломалось и почему это можно использовать для обучения.

Paper: A Primer in Post-Training Reasoning Data: What They Know About How It Works
https://arxiv.org/abs/2606.02113
  • ❤ 5
More from @machinelearning_books
  1. Sep 23, 2026Математика глубокого обучения в одном учебнике 737 страниц о математических основах Deep L…
  2. Sep 22, 2026Бесплатная книга по Physics-based Deep Learning 461-страничный учебник о применении глубок…
  3. Sep 21, 2026Лучший coding-агент провалил 76% реальных задач Новый бенчмарк τᵗ-bench проверяет не прост…
  4. Sep 18, 2026📚 MIT Advanced Data Structures - бесплатный продвинутый курс по структурам данных от MIT.…
  5. Sep 16, 2026✔️ xAI отозвала претензии к Apple, но продолжит судиться с OpenAI xAI и X Corp. подали в ф…
  6. Sep 15, 2026📘 Бесплатная 348-страничная книга по Machine Learning для учёных и инженеров Machine Lear…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →