Как мы знаем, многократная генерация и majority vote — это надёжный, но вычислительно затратный способ получить фактологичную генерацию (self-consistency). Авторы статьи Confidence Improves Self-Consistency in LLMs из Google предложили подход под названием Confidence-Informed Self-Consistency (CISC), где происходит взвешенный majority vote на основе confidence модели.
⚙️Чем отличаются CISC от простого self-confidence
1️⃣ Оба метода получают множество генерации
2️⃣ При self-consistency просто выбирается наиболее часто встречающийся ответ
3️⃣ CISC добавляет self-assessment step, где каждой генерации модели назначается уверенность (confidence)
4️⃣ Для CISC выбирается ответ путём взвешенного majority vote на основе self-assessment
💻Что использовалось в качестве self-assessment
1️⃣ Response Probability — нормализованная вероятность всей генерации
2️⃣ Verbal Confidence мы просим LLM оценить уверенность в ранее сгенерированном выводе
3️⃣ P(True) мы просим модель оценить уверенность в бинарном формате (либо 0, либо 1) и вычисляем вероятность, которую модель присваивает токену 1
📦 Бенчмарки и Модели
GSM8K, MATH, MMLU-Pro, Big-Bench-Hard
GEMMA2, QWEN2.5, Mistral
📈Результаты
Метод P(True) даёт наилучшие результаты, обеспечивая среднее сокращение вычислительных затрат на 41% и 46% при бюджете в 5 и 10 генерации соответственно.
🌐Рандомные галлюцинации
Post #54
489

- 🔥 5