Захотелось собрать общую базу по всем SKU (лекарственные средства, БАДы) работодателя. Огромный плюс в том, что вся информация есть в публичном доступе, так что ни конфиденциальность, ни коммерческую тайну я нарушить не смогу.
Решила не заморачиваться с редактором и не скачивать программы на рабочий ноутбук. Открыла Google Colab и начала работать.
Мне надо было вытащить из подобранных 63 файлов .pdf текстовый слой. Потом порезать его на смысловые части и уже в итоге сформировать таблицу.
Если вы думаете, что 63 файла — это весь наш ассортимент, то нет. Я сама не ожидала таких объемов: это только товары на буквы с «А» по «Г»! Начало многообещающее 🙂
Как выглядели шаги:
1. Собрала все файлы в одну папку и загрузила их на Google Диск.
2. Загрузила библиотеку
PyMuPDF в Google Colab.3. Массово извлекла текст из всех файлов. Получилась одна таблица с текстом.
4. С помощью регулярных выражений (RegEx) нарезала текст на смысловые разделы (чанки). Пришлось резать в несколько подходов, так как с первого раза куски получились слишком объемными.
ТА-ДАМ ⭐️
В итоге получилась таблица на 521 строку. Сразу скормила ее своему RAG-боту для теста работоспособности. И знаете что? Даже без изменения старого промпта ответы бота стали точнее в части «оснований».
Теперь надо доделать таблицу на все SKU и изменить промт для итогового ответа в раг-боте. Но я наконец сама поработала руками вайб-кодера 🙃
