TGViewer
RnD ML Team RnD ML Team @rndml_team · 4.16K subscribers
Post #496 1.06K
🧠 Модель выбирает правду или просто то, что проще выучить?

Спросите LLM, правда ли, что человек использует только 10% мозга. Для некоторых моделей ответ скорее всего будет утвердительным. Хотя в претрейне они видели и этот факт, и опровержения. Откуда выбор, если претрейн противоречит сам себе?

На AI RnD Day Константин Крестников, лидер GigaChain и автор канала @robofuture, рассказал, как проверял свою гипотезу: "модель тянется к истине потому, что истиной дешевле объяснять окружающий мир". Также у Кости приняли в основной трек NeurIPS 2026 статью "Truth as a Compression Artifact in Language Model Training" 🌿, на которой построено его выступление! Поздравляем! 🎉

📌 TLDR
Чтобы не гадать по ответам готовых ассистентов, он собрал синтетические учебники по математике, где сам задавал верные и ложные правила, и обучал на этом модели. Случайные ошибки модель действительно вымывает: верное решение получает больше вероятности даже при 10% правильных примеров в корпусе. Но стоит сделать ошибку согласованной или вычислимой из условия — предпочтение исчезает. Таким образом, обучение убирает не ложь, а непредсказуемость. Оговорка: окончательного подтверждения гипотезы пока нет, исследования продолжаются.

🧪 Эксперименты
Четыре типа математических задач:
• цепочки арифметики
• разложение на множители
• линейные уравнения
• производные многочленов

Все решения проверяются программно, поэтому для каждой задачи точно известно, где правда. Половина решений верные, половина — с ошибкой в одном шаге.

Далее добавляется контролируемая вариация ошибок:
1. Случайная — сдвиг числа на случайную величину, около 18 вариантов на задачу.
2. Ложное правило, например: a × b = a × (b − 1).
3. Выучиваемая ошибка — снова сдвиг, но какой именно, решает последняя цифра числа в условии по фиксированной таблице.
4. Несколько ложных правил до 10 штук, а выбор случайный и не угадывается по условию.

Метрика на новых задачах — доля вероятности, которую модель отдаёт верному решению против ложных.

📊 Что получилось
Случайные ошибки проигрывают. Против всей системы ошибок правда vs случайность получает 55% vs 45%.
Согласованную математику проще выучить, чем запоминать разброс. А если есть одно ложное правило — то будет примерно 50/50 на всех размерах моделей. Модель не отличает согласованную ложь от правды.
Выучиваемая ошибка получает 57% vs 43%. А если правило выбора усложнить, картина возвращается к случайной. Значит, дело именно в предсказуемости.

🔬 Ищем зависимости
Длина ответа. Костя отдельно проверил влияние длины ответа модели. Вероятность текста зависит не только от содержания, но и от количества токенов, поэтому более короткая запись может получить преимущество. Поэтому основные сравнения проводили для решений с одинаковой длиной выхода.

Умение считать. Может быть, модель делит вероятность между правильным и ошибочным решениями примерно поровну просто потому, что плохо умеет решать такие задачи? Для проверки модели тех же размеров обучили только на правильных примерах. Тогда при сравнении верного решения с набором ошибочных на него приходилось 96–99% их суммарной вероятности.

На реальном тексте (20K абзацев Википедии) случайная подмена сущностей проигрывает оригинальному тексту в 70–71% случаев, а четкая замена France → Japan по всему корпусу — метрика на уровне 46–49%, то есть явного преимущества исходного текста не обнаружено.

🔚 Выводы
Модели предпочитали закономерность случайному шуму, но устойчивое неверное правило усваивали наряду с правильным. Поэтому хорошее предсказание текста само по себе не гарантирует истинности ответа. Следующий шаг исследований — проверить, помогут ли независимые наблюдения, противоречащие ложному правилу.

🔗 Более подробно — в презентации (в комментариях файлом и в канале @robofuture) и в записи выступления (тайминг: 5:02:26).

📖 Статья на arXiv
🖥 Репозиторий на GitHub
🗒 Презентация

#llm #interpretability #conference #paperwatch
  • ❤ 10
  • ⚡ 4
  • 🔥 3
  • 🐳 2
More from @rndml_team
  1. Oct 2, 2026⚡️ FRIDA-Decisions: роутинг, гардрейлы и интенты по русскому тексту за ≈30 мс На хайпе наш…
  2. Oct 2, 2026📌 10 докладов AI RnD Day в одном посте 🎙 Где это видано, где это слыхано: управляемые Fu…
  3. Oct 1, 2026🧠 Долгосрочная омнимодальная память Нужный факт может остаться в старом диалоге, быть на…
  4. Sep 30, 2026🔎 Агент SMITH для поиска: маленькая модель ищет, большая — отвечает На AI RnD Day Артём С…
  5. Sep 29, 2026🔎 Модель говорит по-русски. А понимает? Пять новых линеек бенчмарков На AI RnD Day наша у…
  6. Sep 28, 2026🎬 Как дать VLM понять длинное видео и не потерять смысл 5 минут видео при одном кадре в с…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →