🧠 Язык теряет числа, и это не лечится размером модели
LLM обучаются на человеческих описаниях мира, а описание — это кодирование количественных данных с потерями. Потеря необратима: никакая последующая модель, сколь угодно большая, не восстановит из текста то, что в текст не попало. Это свойство представления, а не ёмкости модели — такова рамка статьи от 10 сентября на arXiv.
Авторы добавляют три требования, которые язык не даёт по построению: воспроизводимость, прослеживаемость каждого вывода до исходных числовых записей и калиброванная неопределённость. Для ценообразования рисков, распределения капитала и медицинской сортировки это не опции, а условия допуска в эксплуатацию. Отсюда — отдельный класс Large Quantitative Model (LQM).
Для практиков это значит: если система требует аудита решения, LLM поверх таблиц и отчётов не даст ни происхождения данных, ни честной уверенности — сколько бы вы ни дообучали модель. Нужна модель, которая держит прямую связь с исходными числовыми записями, а не с их пересказом.
Пока это манифест, а не метод: архитектуры и реализации LQM в статье нет, только формальное определение. Но аргумент о необратимой потере легко проверить на простом эксперименте — если векторные представления таблиц восстанавливают распределения не лучше текстового пересказа, то в регулируемых областях LLM останется интерфейсом, а не механизмом принятия решений.
arXiv
#LLM #LQM #quantitativeAI #аудит
Post #265
6