ИИ научился сам придумывать себе тренировочные среды
Self-play после AlphaGo наконец добрался и до языковых моделей.
Новая работа SPADE - это, возможно, первый пример, когда self-play по-настоящему заработал для общих рассуждений у LLM.
Одна модель теперь:
1. сама пишет себе полноценные многоходовые среды на Python
2. сама в них учится
3. сама поднимает планку сложности под свой уровень.
Больше не нужен человек, который вручную создаёт и подбирает задачи.
Модель генерирует себе бесконечный, всё более сложный учебный план прямо на границе своих возможностей.
Один из последних ручных этапов пост-тренинга автоматизирован.
Post #13323
2.29K