Завершая короткую серию постов о прагматичном взгляде на определение AGI и его связи с методами коллаборативной фильтрации, остается ответить на вопрос: что же еще требуется, чтобы увидеть отражение такого взгляда в реальных приложениях? На мой взгляд, все необходимые компоненты для этого по отдельности существуют.
Методы коллаборативной фильтрации достигли такого уровня точности, что некоторым компаниям (запрещенным на территории РФ, поэтому называть не буду) приходилось даже принудительно занижать прогностические способности своих рекомендательных алгоритмов, чтобы не провоцировать у пользователей паранойю и навязчивые мысли о слежке. Вопрос моделирования долгосрочных интересов можно считать решенным при условии наличия достаточного объема поведенческих данных и доступа к ним.
Вопрос интерактивности и учета краткосрочных контекстов активно исследуется, и LLM играют в этом направлении исследований важную роль. Необходимо научиться строить персонализированную базу знаний об интересах пользователя и обеспечить сквозной механизм ее работы с долгосрочными представлениями модели. Кроме того нужен механизм динамического обновления такой базы на основе новых циклов получения обратной связи от пользователя в интерактивном режиме. В целом, такое решение чем-то напоминает связку LLM+RAG в диалоговых системах, но более продвинутую и принципиально нестационарную.
Что это дало бы? Например, в преддверии новогоднего праздника вы хотите послушать хорошую и подходящую музыку. Современные решения уже позволяют учесть контекст ваших прежних прослушиваний, но проблема возникнет сразу же, как только вы попытаетесь добавить нюансов. Например, «хочу новогоднюю музыку, но в стиле retrowave и без акцентных битов». Скорее всего виртуальный ассистент сломается уже на этапе попытки предоставить ему такую обратную связь, не говоря уже о том, чтобы ее правильно распарсить и отреагировать. Здесь я не буду останавливаться на том, что современные сервисы в принципе не предоставляют удобных инструментов для такого формата взаимодействия. Даже если намеки на такие настройки присутствуют, это запрятано так, что только самые пытливые и безутешные могут до этого добраться и понять, как воспользоваться.
Знаю, что в индустрии существует мнение, что такие инструменты и не нужны, что пользователям в большинстве случаев нужна лишь одна простая кнопка «сделай хорошо», и они не хотят ничего настраивать и изучать. Этот взгляд понятен и в текущих реалиях оправдан. Но мы просто еще не достигли того состояния, в котором эта самая настройка будет протекать естественным для пользователя образом в формате диалога с кем-то, кто тебя понимает с полуслова.
Как далеко мы от этого? Думаю, не очень далеко. Вопрос в том, как объединить все компоненты в end-to-end архитектуру. По стечению обстоятельств, в моей научной группе ведется исследовательская работа во многих из обозначенных выше направлений. Мы планомерно решаем связанные с ними задачи. Одной из миссий моей группы является формирование стэка технологий для создания интерактивных персональных интеллектуальных ассистентов. Что из всего описанного нам удастся реализовать – вопрос риторический. Но скучно, похоже, не будет.
Post #7
511
- 🔥 14
- ❤ 6
- ⚡ 5
- 👍 2