1️⃣«LLM-Independent Adaptive RAG: Let the Question Speak for Itself»
В этой работе мы показали, что можно делать адаптивный RAG без доступа к внутренним представлениям модели для оценки ее неуверенности — по внешним признакам вопроса: типу вопроса, частоте упоминания сущностей и др. Несмотря на простоту подхода, он часто не уступает методам на основе неопределённости. Минус — для качественной работы нужно учитывать много внешних факторов
📍Hall C Session 5
🕓 Wed. Nov 5 16:30-18:00
📎930-Main
2️⃣«Will It Still Be True Tomorrow? Multilingual Evergreen Question Classification to Improve Trustworthy QA»
В этой работе мы использовали единственный признак вопросов — их вечнозелёность для адаптивного RAG. Вечнозелёные вопросы — это такие, на которые ответы не зависят от времени (например, «Кто был первым президентом США?»). Для таких вопросов RAG не нужен — достаточно знаний самой LLM. Об этом подробнее я писал на Хабр
📍 Hall C Session 11
🕓 Thu. Nov 6 16:30-18:00
📎923-Main
3️⃣ «When Models Lie, We Learn: Multilingual Span-Level Hallucination Detection with PsiloQA»
В этой работе мы предложили метод генерации синтетических данных для обучения моделей детекции галлюцинаций на уровне токенов. С помощью модели, обученной на нашем датасете, мы заняли призовое место в соревновании SHROOM по постановочной детекции галлюцинаций в многоязычном сеттинге.
📍 Hall C Session 3
🕓 Wed. Nov 5 13:00-14:00
📎2080-Find
4️⃣«When Punctuation Matters: A Large-Scale Comparison of Prompt Robustness Methods for LLMs»
В статье проведено сравнительное исследование пяти методов повышения устойчивости LLM к изменениям формата и пунктуации в промптах. Авторы сравнили fine-tuning и in-context learning на 8 моделях из семейств Llama, Qwen, Gemma и сравнили их на 52 задачах из Natural Instructions
📍 Hall C Session 3
🕓 Wed. Nov 5 13:00-14:00
📎3533-Find
🌐Рандомные галлюцинации
