Why Large Language Models Fail at Tabular Prediction
Marta Garnelo, Wojciech M. Czarnecki
Paper: https://arxiv.org/abs/2608.02412v1
Review: https://arxiviq.substack.com/p/why-large-language-models-fail-at
Code: N/A
Model: N/A
# TL;DR
ЧТО сделали: Авторы проверили пять популярных гипотез о причинах провала больших языковых моделей (LLM) на задачах классификации табличных данных в режиме чистого инференса. Используя жёсткую проверку на заучивание данных из предобучения (memorisation probe), контролируемые манипуляции с признаками и проекции случайными матрицами, исследователи опровергли четыре традиционных объяснения — перекрытие классов, текстовый CSV-формат, токенизацию чисел и число тестовых запросов за раз. Единственной реальной причиной деградации качества моделей вроде
claude-opus-4-6 оказалась высокая размерность признакового пространства.ПОЧЕМУ это важно: Работа даёт первое причинно-следственное объяснение тому, почему универсальные языковые модели до сих пор проигрывают классическому ML на таблицах. Способности LLM катастрофически деградируют с ростом числа колонок — даже если объём полезной информации в них остаётся неизменным. Это устанавливает чёткие архитектурные ограничения для табличного ризонинга, доказывает бесполезность банального промпт-инжиниринга и подтверждает необходимость специализированных табличных фундаментных моделей.
Для практиков: Разработчики часто замечают, что топовые LLM уступают алгоритмам полувековой давности на простых числовых таблицах. Вместо того чтобы обвешивать модель сложными агентскими пайплайнами и промптами, авторы протестировали «голую» модель. Выяснилось, что проблемы вовсе не в «неудобном» форматировании CSV, специфической токенизации чисел или зашумлённых границах классов. LLM отлично работают как локальные классификаторы на основе расстояний в 2D-пространстве, но их работа рушится, как только размерность признаков выходит за рамки нескольких измерений. Попытки починить это промптингом бесполезны — нужны специализированные архитектуры.
Работать с таблицами тут: https://t.me/gonzo_ML_podcasts/4788