Estrai dati vettoriali da PDF in Python

Come estrarre dati vettoriali da PDF utilizzando Python

Aspose.PDF for Python for .NET Logo

Come estrarre dati vettoriali da PDF utilizzando Aspose.PDF for Python for .NET Tool

Hai bisogno di estrarre dati vettoriali da PDF? La modifica programmatica dei documenti PDF è una parte essenziale dei moderni flussi di lavoro digitali. Con le librerie Python come Aspose.PDF, gli sviluppatori possono estrarre dati vettoriali dai PDF. Queste librerie sono soluzioni autonome che non si basano su altri software e sono pronte per l’uso commerciale. Coprono tutte le possibili esigenze degli sviluppatori Python professionisti.

  • Estrai testo da PDF
  • Estrai immagini da PDF
  • Estrai caratteri da PDF
  • Estrai dati dal modulo
  • Estrai testo dai timbri
  • Estrai dati dalla tabella

Per estrarre dati vettoriali da file PDF, utilizzeremo l’API Aspose.PDF for .NET, un’API di manipolazione dei documenti ricca di funzionalità, potente e facile da usare per la piattaforma python-net. Apri il gestore di pacchetti NuGet, cerca Aspose.PDF e installa. È inoltre possibile utilizzare il seguente comando dalla console di Package Manager.

Console

pip install aspose-pdf

Estrai dati vettoriali da PDF in Python


Per provare il codice nel tuo ambiente, hai bisogno di Aspose.PDF for Python.

  1. Apri il documento PDF.
  2. Crea un assorbitore grafico.
  3. Visita la pagina di destinazione.
  4. Recupera gli elementi grafici estratti.

Estrai dati vettoriali da PDF con Python

Questo codice di esempio mostra come estrarre dati vettoriali da documenti PDF

Input file:

File not added

Output format:

PDF

Output file:


import aspose.pdf as ap
from os import path

from config import set_license, initialize_data_dir

def extract_graphics_elements(infile, outfile):
    """
    Extract vector graphic elements from a specified page of a PDF and log basic element properties.
    Args:
        infile (str): Path to input PDF file.
        outfile (str): Path to output text file for logging element info.
    """
    document = ap.Document(infile)

    gr_absorber = ap.vector.GraphicsAbsorber()
    # Visit page 2 (pages collection is 1-indexed; document.pages[1] is the second page)
    gr_absorber.visit(document.pages[1])

    elements = gr_absorber.elements
    with open(outfile, "w", encoding="utf-8") as f:
        for idx, elem in enumerate(elements, start=1):
            # Basic properties
            rect = elem.rectangle
            pos = elem.position
            ops_count = len(elem.operators)
            f.write(f"Element {idx}: Rectangle = {rect}, Position = {pos}, Operators = {ops_count}\n")

Informazioni sull'API Aspose.PDF for Python for .NET

Aspose.PDF per Python tramite .NET API supporta gli standard PDF e le specifiche PDF più consolidati. Consente agli sviluppatori di inserire tabelle, grafici, immagini, collegamenti ipertestuali, caratteri personalizzati e altro ancora nei documenti PDF. Inoltre, è anche possibile comprimere documenti PDF. Aspose.PDF per Python via .NET offre eccellenti funzionalità di sicurezza per sviluppare documenti PDF sicuri. Alcune delle funzionalità critiche di Aspose.PDF for Python tramite .NET API includono:

  • Capacità di leggere ed esportare PDF in più formati di immagine tra cui BMP, GIF, JPEG e PNG.
  • Imposta le informazioni di base (ad esempio autore, creatore) del documento PDF.
  • Funzionalità di conversione: converti PDF in Word, Excel e PowerPoint. Converti PDF in formati di immagine. Converti i file PDF in formato HTML e viceversa. Converti PDF in EPUB, Text, XPS, ecc.

Sull’uso delle API, puoi trovare ulteriori informazioni su Aspose.PDF per Python tramite .NET API nella nostra documentazione.