🎤 Выложил запись доклада "Сжатие приводит к истине? Как LLM выбирает, во что верить". Это рассказ про исследование, про которое уже писал, плюс все что накопал с тех пор
И сразу мега крутая новость: вчера мою статью "Truth as a Compression Artifact in Language Model Training", на которой построен доклад, приняли в основной трек NeurIPS 2026!
Моя первая серьезная научная статья - и сразу на одну из главных конференций по ИИ в мире!!!1 🎉🎉🎉
Насколько я смог найти, это вообще первый случай, когда в основной трек взяли работу независимого автора-одиночки из России
Началось все с простого вопроса. Почему модели из разных стран одинаково не верят в астрологию, гомеопатию и в то, что на одной китайской площади ничего не произошло? В обучающих данных миллионы сайтов с гороскопами и весь китайский интернет. Чтобы разобраться, пришлось вступить на скользкую дорожку борца с мифами и лженаукой
Главная мысль - обучение вымывает из данных непредсказуемость. Из научных данных можно последовательно делать предсказуемые выводы, поэтому наука хорошо сжимается. Астрология нет: по одной натальной карте разные астрологи выдают абсолютно разные прогнозы. Чтобы это проверить, обучил с нуля 300+ LLM-моделей разной архитектуры от 3.5M до 3B параметров. Никаких инициализаций открытыми весами, чистый рандом. Начал на своем маке, а закончил на кластере из восьми H100. Было дорого
В докладе:
- 1:14 - миф про 10% мозга (который так любят бизнес-коучи)
- 3:20 - Кеплер и эпициклы
- 4:47 - плоскоземельщик на ток-шоу
- 6:34 - из лжи следует что угодно, или как Рассел доказал, что он Папа Римский
- 11:12 - случайные ошибки модель вымывает, даже когда правильных ответов всего 10%
- 12:33 - одно согласованное ложное правило - и предпочтение правды пропадает
- 13:29 - с несколькими ложными правилами модель вдруг неожиданно начала предпочитать сложную ложь обычной математике. Потом рецензенты нашли ошибку в подсчетах
- 15:05 - разбавил математику текстами из FineWeb так, что ее осталось 8%
- 16:05 - случайно меняем географию в Википедии, так что в истории Франции появляется Уссурийск
- 17:19 - что нашли рецензенты NeurIPS
- 18:26 - главный вывод
В посте про расцензуренный DeepSeek я писал, что алайнмент полностью снялся правкой 0,06% весов, а во что модель верит по-настоящему, решает претрейн. Когда китайская модель в чате уходит от ответа - это работа алайнмента, картина мира у нее может быть совсем другой. А вот для претрейна согласованная дезинформация неотличима от истины. Спасает то, что настоящие фейки редко бывают согласованными до конца
Статья на arXiv | Код и данные на GitHub | Презентация из доклада
P.S. Первое, что мне написали рецензенты: "парень, у тебя какая-то ерунда в данных". Они были правы - и теперь это статья на NeurIPS 😄
P.P.S. Число подписчиков моего канала превысило 5000 человек (или агентов, тут уж не знаю). Мне очень приятно, спасибо 🙏
Post #173
3.44K