Проект Sim2Reason начал их обучать прямо внутри виртуальных миров, которые работают по настоящим законам физики. Этот подход дал +5-10% к результатам на Международной физической олимпиаде, и это в условиях когда модель вообще не видела реальных задач с олимпиады во время обучения.
Раньше ИИ учили на текстах, написанных людьми (к примеру задачи по физике), но таких текстов мало, а охватывают только узкий круг тем. С новым подходом, можно просто запускать симулятор миллиарды раз и обучать ИИ на его результатах. Зависимость от людей отпадает, значит никто не стопорит развитие.
Действия простые, но в этом вся красота нашего нового скачка в развитии: MuJoCo (популярный симулятор физики) случайным образом генерируем сцены, потом мы запускаем симуляцию, а потом автоматически создаём проверенные вопросы и ответы:
🛑 Числовые (дано условие, найди число);
🛑 Обратные (дан результат, найди условие);
🛑 Символические (запиши формулой).
На этих синтетических данных мы дообучаем модель с помощью RL (обучение с подкреплением). Во время дообучения вместе с точностью растёт и длина ответов модели, она учится думать подробнее, шаг за шагом.
Мне вспоминается отрывок из одной книги, где автор рассказывает о будущем VR, который сможет полностью обходить обычные органы чувств и напрямую стимулировать нервы мозга (или рецепторы), поэтому будут задействованы все ощущения: зрение, слух, осязание, вкус, запах и т.д.
В итоге эта реальность станет неотличимой от обычной, но ты сможешь есть виртуальную еду, чувствовать её вкус, ощущать запахи, текстуры. Универсальный компьютер + физика открывают возможность создать любую среду, которую только можно физические реализовать, и это по всей видимости нас и ждёт.
📱 Youtube | 💬Чат | 📱 Канал