11:15-11:30 AI Frontiers
Как большие языковые модели учатся планировать и рассуждать с помощью поисковых алгоритмов, Алексей Скрынник от AIRI
Современные большие языковые модели могут значительно расширять возможности автоматического рассуждения и планирования, если их дополнить стратегиями поиска. В докладе рассматриваются три основных подхода: неструктурированный поиск, эволюционный поиск и дерево поиска. Эти методы позволяют моделям исследовать несколько альтернативных траекторий рассуждений, корректировать ошибки на промежуточных шагах и выбирать наиболее перспективные решения.
11:55 - 12:15 Live studio
Рассуждающие модели воплощённого ИИ, Александр Панов
В докладе будет представлен обзор вариантов реализации рассуждений в нейросетевых моделях, используемых в задачах воплощенного ИИ - навигации и манипуляции. Обсудим, как связаны планирование действий и рассуждения, а также ограничения в современных поведенческих моделях (VLA). Разберем также последние работы нашей лаборатории в области интеграции обучаемых и классических подходов для повышения эффективности методов планирования и рассуждений в задачах воплощенного ИИ.
13:00-14:30 Главный зал
Форсайт: каким будет ИИ через 10 лет, Дмитрий Юдин среди участников
15:15-15:30 AI Frontiers
Применение больших языковых и визуально-языковых моделей в робототехнике, Алексей Ковалёв
Большие языковые и визуально-языковые модели (LLM и VLM) получили широкое распространение во множестве приложений и все активнее используются в робототехнике. На лекции мы обсудим, как такие модели помогают роботам распознавать неоднозначные инструкции, формировать планы действий и исправлять ошибки, возникающие при их выполнении.
15:30-15:45 AI Frontiers
Как большие языковые модели понимают 3D-пространство, Дмитрий Юдин
Развитие технологий пространственного ИИ — одно из важнейших современных направлений в робототехнике и беспилотном транспорте. В этом докладе мы рассмотрим концепции пространственного понимания, пространственных рассуждений и связанные с ними задачи. Обсудим потенциал современных MLLM для решения задач, связанных с визуальными ответами на вопросы, поиском трёхмерных объектов, генерацией графов трёхмерных сцен, созданием описаний 3D-сцен и др. Мы также обсудим ограничения популярных LLM в случае описания трёхмерной сцены только текстом. Рассмотрим современные решения для пространственного понимания, использующие модальности изображений, текста, облаков точек и графов. Кратко рассмотрим недавние разработки команд AIRI и МФТИ в этой области. Кроме того, мы обсудим перспективные нерешённые проблемы для дальнейшего развития.
Переходите по ссылкам и смотрите нас онлайн!
