SELECT group, SUM(value) FROM data GROUP BY group, но без использования кода, и наблюдал, как результаты разваливаются по мере роста объёма данных.https://wesmckinney.com/blog/llms-arithmetic/
Со своей стороны могу добавить, что на моей практике LLM демонстрировали бестолковую работу с CSV-данными в принципе. Они даже с трудом обращались к ячейкам таблицы по заданным координатам (X, Y). В моём случае мне помогла трансформация данных к JSON-формату типа
[{"row": "X", "column": "Y", "value": Z}, ...]. После этого они хотя бы переставали промахиваться ячейками.С другой стороны, не понятно, почему в этом исследовании автор запрещал использование кода. Наверняка LLM-ка сгенерировала бы корректный SQL и дала бы правильный ответ. Но даже если и смогла бы, скармливать сырые данные LLM кажется как минимум пустой тратой токенов.