👋 Привет всем!
В чем сложность обработки данных лингвистическими моделями типа GPT?
Анализ данных - это работа с таблицами и более сложными базами данных.
При этом GPT и таблицы — это не всегда дружба. Модели, обученные на текстах, с трудом понимают двухмерные структуры, как строки и столбцы. Например, найти значение в колонке или пропущенную ячейку для них уже сложная задача.
Проверим эмпирически:
ChatGPT:
🟦 Missing-value-identification: Модель должна была найти пустую ячейку. Даже с примерами (Few-shot prompting) точность составила всего 5️⃣1️⃣🔣.
📊 Column-Finding: Здесь требовалось определить, в каком столбце находится уникальное значение. Точность упала ещё ниже — до 4️⃣6️⃣🔣.
👎 Почему так?
Таблицы имеют уникальные особенности: короткие названия в ячейках, однородность значений в столбцах и сложные взаимосвязи между данными, что делает их принципиально отличными от текстов.
🛠️ Что делать?
- Работать над few-shot промптами,
- Использовать специализированные GPT типа TabNet, Tabbie или Table-GPT,
- Бить таблицу на текстовые фрагменты (например, строку или колонку) и работать с ними отдельно.
- Использовать скрипты для проверки и корректировки результатов GPT.
Подпишись на канал ПРОМПТ-ИНЖЕНЕР 🧠
Post #14
212

- 👍 6
- ❤ 4
- 😢 3