Я еще давно сделал удивительное для себя наблюдение. Хотя всякие нейросети могут ошибаться в деталях, глючить и выдавать неправильные цитаты и ссылки, они по умолчанию не хотят принимать всевозможные лженауки и мифы*. См. скрин.
Объяснения этому наблюдению у меня не было. Но тут мне написал автор интересной работы и скинул свой доклад, в котором он изучал ровно это.
Я пропущу основные детали, но перескажу главную идею статьи и выступления, как я ее понял.
А что, если нейросеть выбирает правду не потому, что умеет отличать правду от лжи? В новой работе Truth as a Compression Artifact (правда, как артефакт сжатия) Константин Крестников предлагают необычную гипотезу: истина может быть побочным эффектом сжатия информации.
Модель стремится найти простое правило, которое объясняет как можно больше данных. Случайные ошибки плохо сжимаются — они выглядят как набор несвязанных исключений. А истинные факты часто образуют согласованную систему, которую можно описать небольшим количеством правил. Поэтому модель, которая просто пытается найти компактное объяснение данных, может автоматически начать чаще выбирать правду.
Любопытно, что ложь тоже можно сделать компактной. Искусственно. Исследователи создали внутренне согласованные альтернативные системы правил, и модели уже не всегда могли отличить их от правильной. Более того, когда появлялось несколько конкурирующих ложных систем, модели снова чаще выбирали правильную версию. Получается парадоксальная идея: возможно, то, что выглядит как способность нейросети находить истину, на самом деле является следствием её стремления сжимать информацию — находить самое простое объяснение наблюдаемого мира.
Мне нравится эта концепция тем, что в ней передан дух науки. Наука тоже пытается найти такое объяснение, которое при наименьшем числе допущений описывает как можно больше наблюдаемых фактов. Без противоречий. А вот всякие лженауки, религии и т.д. с этим справляются очень плохо.
*Правда иногда бывает конфликт с желанием подлизаться человеку.
Выступление:
https://www.youtube.com/watch?v=Dc98b88qdJg
Публикация:
https://arxiv.org/abs/2603.11749
Пост автора:
https://t.me/robofuture/173
Post #1668
11.7K

- ❤ 425
- 👍 162
- 🔥 74
- 🤔 23
- 🤡 20
- 😁 4
- 🤮 3
- 🏆 3
- 👌 2
- 🌭 1