📦 کد اسکریپت
import pandas as pd
import tabula
import os
def pdf_to_excel(pdf_path, excel_path=None):
"""
تبدیل جداول PDF به فایل Excel
"""
# اگر مسیر Excel مشخص نشده باشه
if excel_path is None:
excel_path = pdf_path.replace('.pdf', '.xlsx')
try:
# استخراج جداول از PDF
tables = tabula.read_pdf(pdf_path, pages='all')
if tables:
# ذخیره اولین جدول در Excel
tables[0].to_excel(excel_path, index=False)
print(f"✅ فایل با موفقیت تبدیل شد!")
print(f"📁 مسیر فایل: {excel_path}")
else:
print("❌ هیچ جدولی در PDF پیدا نشد")
except Exception as e:
print(f"❌ خطا: {e}")
# استفاده از اسکریپت
if __name__ == "__main__":
pdf_file = input("مسیر فایل PDF: ")
pdf_to_excel(pdf_file)
🎯 نحوه استفاده
۱. نصب کتابخانههای مورد نیاز:
pip install pandas tabula-py openpyxl
۲. نصب Java (برای tabula):
• Windows: https://www.java.com
• Mac:
brew install openjdk• Linux:
sudo apt install default-jre۳. اجرای اسکریپت:
python pdf_to_excel.py
⚠️ نکات مهم
• فایلهای اسکن شده: این اسکریپت فقط برای PDFهای متنی کار میکنه
• جداول پیچیده: ممکنه نیاز به تنظیمات بیشتری داشته باشه
• ؛Java: حتماً Java نصب باشه
💡 پیشنهاد :
برای PDFهای اسکن شده، از OCR استفاده کن:
# نصب: pip install pytesseract pillow pdf2image
import pytesseract
from PIL import Image
import pdf2image
def pdf_to_text(pdf_path):
images = pdf2image.convert_from_path(pdf_path)
text = ""
for img in images:
text += pytesseract.image_to_string(img, lang='fas')
return text
📚 منابع بیشتر
1. مستندات tabula: https://tabula-py.readthedocs.io
2. مستندات pandas: https://pandas.pydata.org
3. آموزشهای پایتون: https://www.python.org
🆔 @python4all_pro
🧩لینک کانال در بله 👇👇
https://ble.ir/Python4all_pro