Сегодня хочу поделиться мыслями о недавнем исследовании по оценке reasoning у LLM через Bayesian inference.
Авторы предлагают рассматривать работу модели через призму байесовского подхода: модель должна аккуратно обновлять свои вероятности, используемые для генерации ответа, при изменении входного контекста. Идея в том, что LLM может галлюцинировать и менять результаты в зависимости от порядка примеров или кусков текста (chunks).
По сути, это ещё один угол зрения на процесс генерации: насколько модель устойчива к изменению порядка фактов и насколько предсказуемо обновляет свои ответы.
Но есть нюанс: такая метрика оценивает не качество финального результата, а сам процесс рассуждений. Чтобы проверить её на практике, нужно уметь вручную менять порядок контекста и отслеживать, насколько сильно меняется ответ. В большинстве случаев итоговая релевантность останется прежней, поэтому ценность метрики может быть ограниченной, особенно если у нас уже используется reranking и порядок chunk’ов фиксирован.
Кстати, исследование проводилось на GPT-3, и пока не очевидно, насколько та же проблема проявляется в более современных моделях.
Как можно тестировать в таком духе:
1. Задаем один и тот же вопрос, но меняем порядок документов. Смотрим, насколько стабилен ответ. Байесовский агент должен выдавать одинаковый результат.
2. Добавляем документы по одному: сначала А документы → спрашиваем, потом А+B документы → спрашиваем, потом А+B+C документы. Байесовский ИИ агент в этом случае будет аккуратно накапливать знания, а не перескакивать между разными интерпретациями.
В итоге скажу, что это не метрика качества ответа, а скорее инструмент для проверки предсказуемости reasoning. Полезно для исследований, но в реальных проектах нужно взвешивать трудозатраты и реальную пользу.
Ссылка на исследование
Полезная информация:
Курс по evaluation AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #45
687

- 👍 6
- 🔥 1