Ekstrak data vektor dari PDF dalam Python

Cara Mengekstrak data vektor dari PDF menggunakan Python

Aspose.PDF for Python for .NET Logo

Cara mengekstrak data vektor dari PDF menggunakan Aspose.PDF untuk alat Python for .NET

Apakah Anda perlu mengekstrak data vektor dari PDF? Modifikasi terprogram dokumen PDF adalah bagian penting dari alur kerja digital modern. Dengan pustaka Python seperti Aspose.PDF, pengembang dapat mengekstrak data vektor dari PDF. Perpustakaan ini adalah solusi yang berdiri sendiri yang tidak bergantung pada perangkat lunak lain dan siap untuk penggunaan komersial. Mereka mencakup semua kemungkinan kebutuhan pengembang Python profesional.

  • Ekstrak teks dari PDF
  • Ekstrak Gambar dari PDF
  • Ekstrak Font dari PDF
  • Ekstrak Data dari Formulir
  • Ekstrak Teks Dari Perangko
  • Ekstrak Data dari Tabel

Untuk mengekstrak data vektor dari file PDF, kita akan menggunakan API Aspose.PDF untuk.NET yang merupakan API manipulasi dokumen yang kaya fitur, kuat, dan mudah digunakan untuk platform python-net. Buka manajer paket NuGet, cari Aspose.PDF dan instal. Anda juga dapat menggunakan perintah berikut dari Package Manager Console.

Console

pip install aspose-pdf

Ekstrak data vektor dari PDF dalam Python


Untuk mencoba kode di lingkungan Anda, Anda memerlukan Aspose.PDF untuk Python.

  1. Buka Dokumen PDF.
  2. Buat penyerap grafis.
  3. Kunjungi halaman target.
  4. Ambil elemen grafis yang diekstraksi.

Ekstrak data vektor dari PDF dengan Python

Kode sampel ini menunjukkan cara mengekstrak data vektor dari dokumen PDF

Input file:

File not added

Output format:

PDF

Output file:


import aspose.pdf as ap
from os import path

from config import set_license, initialize_data_dir

def extract_graphics_elements(infile, outfile):
    """
    Extract vector graphic elements from a specified page of a PDF and log basic element properties.
    Args:
        infile (str): Path to input PDF file.
        outfile (str): Path to output text file for logging element info.
    """
    document = ap.Document(infile)

    gr_absorber = ap.vector.GraphicsAbsorber()
    # Visit page 2 (pages collection is 1-indexed; document.pages[1] is the second page)
    gr_absorber.visit(document.pages[1])

    elements = gr_absorber.elements
    with open(outfile, "w", encoding="utf-8") as f:
        for idx, elem in enumerate(elements, start=1):
            # Basic properties
            rect = elem.rectangle
            pos = elem.position
            ops_count = len(elem.operators)
            f.write(f"Element {idx}: Rectangle = {rect}, Position = {pos}, Operators = {ops_count}\n")

Tentang API Aspose.PDF for Python for .NET

Aspose.PDF untuk Python melalui .NET API mendukung standar PDF yang paling mapan dan spesifikasi PDF. Ini memungkinkan pengembang untuk menyisipkan tabel, grafik, gambar, hyperlink, font khusus - dan banyak lagi - ke dalam dokumen PDF. Selain itu, dimungkinkan juga untuk mengompres dokumen PDF. Aspose.PDF untuk Python melalui .NET menyediakan fitur keamanan yang sangat baik untuk mengembangkan dokumen PDF yang aman. Beberapa fitur penting Aspose.PDF untuk Python melalui .NET API meliputi:

  • Kemampuan untuk membaca & mengekspor PDF dalam berbagai format gambar termasuk BMP, GIF, JPEG & PNG.
  • Tetapkan informasi dasar (misalnya penulis, pembuat) dokumen PDF.
  • Fitur Konversi: Konversi PDF ke Word, Excel, dan PowerPoint. Konversi PDF ke format Gambar. Konversi file PDF ke format HTML dan sebaliknya. Konversi PDF ke EPUB, Teks, XPS, dll.

Tentang penggunaan API, Anda dapat menemukan informasi lebih lanjut tentang Aspose.PDF untuk Python melalui .NET API di dokumentasi kami .