Текстовые квесты как инструмент оценки долговременной памяти языковых моделей
Аня Казанцева, студентка моей программы «Науки о данных», делает супер классный диплом под руководством Антона Алексеева про исследование того, насколько эффективно LLM удерживают и используют информацию о состоянии среды в многошаговых интерактивных сценариях.
Вместо синтетических тестов на извлечение фактов в духе «иголки в стоге сена» используется среда текстовых RPG-квестов с ветвлением и несколькими концовками. Такой формат заставляет модель не только помнить события 20-30 сцен назад, но и строить на их основе стратегию исследования графа состояний. Дополнительная переменная — смена языка повествования на лету для проверки влияния межъязыкового переноса на качество рассуждений.
Основная задача, которая ставится перед моделью — исследовать все дерево переходов и попасть во все концовки за минимальное количество прохождений. Пока промежуточные результаты показывают, что Mistral Small 3.2 в целом справляется что-то там поисследовать (3 концовки из 7 на 10 запусках), но еще есть куда расти. Каких-то инсайтов и интересностей пока не очень много, разве что было замечено, что модель почему-то очень редко пользуется кнопкой «Назад» в ситуациях, когда уже понятно, что дело идет к уже достигнутой ранее концовке.
Для калибровки метрик (полнота исследования дерева, количество возвратов, итерации до обнаружения новых концовок и т.п.) хочется собрать бенчмарк, полученный на людях. С этой целью Аня реализовала один из текстовых квестов в формате телеграм-бота. Если кому-то интересно поисследовать квест — бот доступен вот тут: @quests_play_bot. Квест не супер маленький (30 концовок), но можно проходить не все, а насколько хватит желания. Данные, естественно, обезличены, прохождение не предполагает никаких обязательств, кроме, собственно, прохождения 🌝
После защит обязательно расскажу, что у Ани в итоге получилось!
Post #62
2.44K
- 🔥 25
- 👏 4
- ❤ 1