استخراج داده های برداری از PDF در Python

نحوه استخراج داده های برداری از PDF با استفاده از Python

Aspose.PDF for Python for .NET Logo

نحوه استخراج داده های برداری از PDF با استفاده از Aspose.PDF برای ابزار Python for .NET

آیا نیاز به استخراج داده های برداری از PDF دارید؟ اصلاح برنامه نویسی اسناد PDF بخش مهمی از گردش کار دیجیتال مدرن است. با کتابخانه های پایتون مانند Aspose.PDF، توسعه دهندگان می توانند داده های برداری را از PDF استخراج کنند. این کتابخانه‌ها راه حل‌های مستقل هستند که به نرم‌افزارهای دیگر تکیه ندارند و برای استفاده تجاری آماده هستند. آنها تمام نیازهای احتمالی توسعه دهندگان حرفه ای پایتون را پوشش می دهند.

  • استخراج متن از PDF
  • استخراج تصاویر از PDF
  • استخراج فونت از PDF
  • استخراج داده ها از فرم
  • استخراج متن از تمبر
  • استخراج داده ها از جدول

به منظور استخراج داده های برداری از فایل PDF، از API Aspose.PDF for .NET استفاده خواهیم کرد که یک API دستکاری اسناد غنی از ویژگی، قدرتمند و آسان برای استفاده برای پلت فرم python-net است. مدیر بسته NuGet را باز کنید، Aspose.PDF را جستجو کنید و نصب کنید. همچنین می توانید از دستور زیر از کنسول مدیریت بسته استفاده کنید.

Console

pip install aspose-pdf

استخراج داده های برداری از PDF در Python


برای امتحان کد در محیط خود، به نیاز دارید Aspose.PDF برای پایتون.

۱. سند PDF را باز کنید. ۱. یک جاذب گرافیکی ایجاد کنید. ۱. به صفحه هدف مراجعه کنید. ۱. بازیابی عناصر گرافیکی استخراج شده.

استخراج داده های برداری از PDF با Python

این کد نمونه نحوه استخراج داده های برداری از اسناد PDF را نشان می دهد

Input file:

File not added

Output format:

PDF

Output file:


import aspose.pdf as ap
from os import path

from config import set_license, initialize_data_dir

def extract_graphics_elements(infile, outfile):
    """
    Extract vector graphic elements from a specified page of a PDF and log basic element properties.
    Args:
        infile (str): Path to input PDF file.
        outfile (str): Path to output text file for logging element info.
    """
    document = ap.Document(infile)

    gr_absorber = ap.vector.GraphicsAbsorber()
    # Visit page 2 (pages collection is 1-indexed; document.pages[1] is the second page)
    gr_absorber.visit(document.pages[1])

    elements = gr_absorber.elements
    with open(outfile, "w", encoding="utf-8") as f:
        for idx, elem in enumerate(elements, start=1):
            # Basic properties
            rect = elem.rectangle
            pos = elem.position
            ops_count = len(elem.operators)
            f.write(f"Element {idx}: Rectangle = {rect}, Position = {pos}, Operators = {ops_count}\n")

درباره Aspose.PDF for Python for .NET API

Aspose.PDF برای پایتون از طریق.NET API از اکثر استانداردهای PDF و مشخصات PDF پشتیبانی می کند. این اجازه می دهد تا توسعه دهندگان برای قرار دادن جداول، نمودار، تصاویر، لینک ها، فونت های سفارشی - و بیشتر - به اسناد PDF. علاوه بر این، امکان فشرده سازی اسناد PDF نیز وجود دارد. Aspose.PDF برای پایتون از طریق.NET فراهم می کند ویژگی های امنیتی عالی برای توسعه اسناد PDF امن است. برخی از ویژگی های مهم Aspose.PDF برای پایتون از طریق.API NET شامل:

  • امکان خواندن و صادرات PDF در فرمت های تصویری متعدد از جمله BMP، GIF، JPEG و PNG.
  • تنظیم اطلاعات اولیه (به عنوان مثال نویسنده، خالق) سند PDF.
  • ویژگی های تبدیل: تبدیل PDF به ورد، اکسل و پاورپوینت. تبدیل PDF به فرمت های تصویری. تبدیل فایل های PDF به فرمت HTML و برعکس. تبدیل PDF به EPUB، متن، XPS، و غیره.

در استفاده از API، می توانید اطلاعات بیشتری در مورد Aspose.PDF برای پایتون از طریق.NET API در ما مستندات.