🧠 Модель выбирает правду или просто то, что проще выучить?
Спросите LLM, правда ли, что человек использует только 10% мозга. Для некоторых моделей ответ скорее всего будет утвердительным. Хотя в претрейне они видели и этот факт, и опровержения. Откуда выбор, если претрейн противоречит сам себе?
На AI RnD Day Константин Крестников, лидер GigaChain и автор канала @robofuture, рассказал, как проверял свою гипотезу: "модель тянется к истине потому, что истиной дешевле объяснять окружающий мир". Также у Кости приняли в основной трек NeurIPS 2026 статью "Truth as a Compression Artifact in Language Model Training" 🌿, на которой построено его выступление! Поздравляем! 🎉
📌 TLDR
Чтобы не гадать по ответам готовых ассистентов, он собрал синтетические учебники по математике, где сам задавал верные и ложные правила, и обучал на этом модели. Случайные ошибки модель действительно вымывает: верное решение получает больше вероятности даже при 10% правильных примеров в корпусе. Но стоит сделать ошибку согласованной или вычислимой из условия — предпочтение исчезает. Таким образом, обучение убирает не ложь, а непредсказуемость. Оговорка: окончательного подтверждения гипотезы пока нет, исследования продолжаются.
🧪 Эксперименты
Четыре типа математических задач:
• цепочки арифметики
• разложение на множители
• линейные уравнения
• производные многочленов
Все решения проверяются программно, поэтому для каждой задачи точно известно, где правда. Половина решений верные, половина — с ошибкой в одном шаге.
Далее добавляется контролируемая вариация ошибок:
1. Случайная — сдвиг числа на случайную величину, около 18 вариантов на задачу.
2. Ложное правило, например: a × b = a × (b − 1).
3. Выучиваемая ошибка — снова сдвиг, но какой именно, решает последняя цифра числа в условии по фиксированной таблице.
4. Несколько ложных правил до 10 штук, а выбор случайный и не угадывается по условию.
Метрика на новых задачах — доля вероятности, которую модель отдаёт верному решению против ложных.
📊 Что получилось
Случайные ошибки проигрывают. Против всей системы ошибок правда vs случайность получает 55% vs 45%.
Согласованную математику проще выучить, чем запоминать разброс. А если есть одно ложное правило — то будет примерно 50/50 на всех размерах моделей. Модель не отличает согласованную ложь от правды.
Выучиваемая ошибка получает 57% vs 43%. А если правило выбора усложнить, картина возвращается к случайной. Значит, дело именно в предсказуемости.
🔬 Ищем зависимости
Длина ответа. Костя отдельно проверил влияние длины ответа модели. Вероятность текста зависит не только от содержания, но и от количества токенов, поэтому более короткая запись может получить преимущество. Поэтому основные сравнения проводили для решений с одинаковой длиной выхода.
Умение считать. Может быть, модель делит вероятность между правильным и ошибочным решениями примерно поровну просто потому, что плохо умеет решать такие задачи? Для проверки модели тех же размеров обучили только на правильных примерах. Тогда при сравнении верного решения с набором ошибочных на него приходилось 96–99% их суммарной вероятности.
На реальном тексте (20K абзацев Википедии) случайная подмена сущностей проигрывает оригинальному тексту в 70–71% случаев, а четкая замена France → Japan по всему корпусу — метрика на уровне 46–49%, то есть явного преимущества исходного текста не обнаружено.
🔚 Выводы
Модели предпочитали закономерность случайному шуму, но устойчивое неверное правило усваивали наряду с правильным. Поэтому хорошее предсказание текста само по себе не гарантирует истинности ответа. Следующий шаг исследований — проверить, помогут ли независимые наблюдения, противоречащие ложному правилу.
🔗 Более подробно — в презентации (в комментариях файлом и в канале @robofuture) и в записи выступления (тайминг: 5:02:26).
📖 Статья на arXiv
🖥 Репозиторий на GitHub
🗒 Презентация
#llm #interpretability #conference #paperwatch
Post #496
1.06K

- ❤ 10
- ⚡ 4
- 🔥 3
- 🐳 2