TGViewer
gonzo-обзоры ML статей gonzo-обзоры ML статей @gonzo_ml · 24.5K subscribers
Post #5917 4.48K
Любопытный результат про работу LLM с табличными данными, где LLM довольно хреновы и сильно уступают классике ML. Предположительные источники проблем в виде перекрытия классов, проблем парсинга CSV, токенизации чисел и размера батча оказались неважными. Зато размерность данных очень важна, из-за неё все проблемы. Вроде как на подходе новые фундаментальные табличные модели, та же свежая гугловая TabFM. С другой стороны, я не уверен, что будущее всё же за прямой работой LLM/FM с таблицами. Оно конечно удобно с точки зрения универсальности, но там где важен реальный перформанс нужны специалисты. Сгенерить специализированную RF/GDBM может быть быстрее и эффективнее, уж с генерацией такого кода LLM-то справится.

Why Large Language Models Fail at Tabular Prediction

Marta Garnelo, Wojciech M. Czarnecki
Paper: https://arxiv.org/abs/2608.02412v1
Review: https://arxiviq.substack.com/p/why-large-language-models-fail-at
Code: N/A
Model: N/A

# TL;DR

ЧТО сделали: Авторы проверили пять популярных гипотез о причинах провала больших языковых моделей (LLM) на задачах классификации табличных данных в режиме чистого инференса. Используя жёсткую проверку на заучивание данных из предобучения (memorisation probe), контролируемые манипуляции с признаками и проекции случайными матрицами, исследователи опровергли четыре традиционных объяснения — перекрытие классов, текстовый CSV-формат, токенизацию чисел и число тестовых запросов за раз. Единственной реальной причиной деградации качества моделей вроде claude-opus-4-6 оказалась высокая размерность признакового пространства.

ПОЧЕМУ это важно: Работа даёт первое причинно-следственное объяснение тому, почему универсальные языковые модели до сих пор проигрывают классическому ML на таблицах. Способности LLM катастрофически деградируют с ростом числа колонок — даже если объём полезной информации в них остаётся неизменным. Это устанавливает чёткие архитектурные ограничения для табличного ризонинга, доказывает бесполезность банального промпт-инжиниринга и подтверждает необходимость специализированных табличных фундаментных моделей.

Для практиков: Разработчики часто замечают, что топовые LLM уступают алгоритмам полувековой давности на простых числовых таблицах. Вместо того чтобы обвешивать модель сложными агентскими пайплайнами и промптами, авторы протестировали «голую» модель. Выяснилось, что проблемы вовсе не в «неудобном» форматировании CSV, специфической токенизации чисел или зашумлённых границах классов. LLM отлично работают как локальные классификаторы на основе расстояний в 2D-пространстве, но их работа рушится, как только размерность признаков выходит за рамки нескольких измерений. Попытки починить это промптингом бесполезны — нужны специализированные архитектуры.

Работать с таблицами тут: https://t.me/gonzo_ML_podcasts/4788
arXiv.org Why Large Language Models Fail at Tabular Prediction Large language models (LLMs) have become the default tool for a remarkable range of tasks, yet they have had conspicuously little success at one of the most common machine learning workloads:...
  • 👍 19
  • 😁 3
  • ❤ 2
More from @gonzo_ml
  1. Oct 4, 2026photo post
  2. Oct 4, 2026По свежим запросам читателей. Это какая-то интересная статья — получается, что достаточно…
  3. Oct 4, 2026photo post
  4. Oct 4, 2026photo post
  5. Oct 4, 2026Недавно писал про прикольный подход Recirculation, а тут уже и его развитие подоспело (от…
  6. Oct 3, 2026photo post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →