Extraire des données vectorielles d’un PDF dans Python

Comment extraire des données vectorielles d’un PDF à l’aide de Python

Aspose.PDF for Python for .NET Logo

Comment extraire des données vectorielles d'un PDF à l'aide de l'outil Aspose.PDF pour Python for .NET

Avez-vous besoin d’extraire des données vectorielles d’un PDF ? La modification programmatique de documents PDF est un élément essentiel des flux de travail numériques modernes. Avec les bibliothèques Python telles que Aspose.PDF, les développeurs peuvent extraire des données vectorielles à partir d’un PDF. Ces bibliothèques sont des solutions autonomes qui ne dépendent d’aucun autre logiciel et sont prêtes pour un usage commercial. Ils couvrent tous les besoins possibles des développeurs Python professionnels.

  • Extraire le texte du PDF
  • Extraire des images d’un PDF
  • Extraire des polices d’un PDF
  • Extraire les données du formulaire
  • Extraire le texte des timbres
  • Extraire les données du tableau

Afin d’extraire des données vectorielles à partir d’un fichier PDF, nous utiliserons l’API Aspose.PDF pour .NET qui est une API de manipulation de documents riche en fonctionnalités, puissante et facile à utiliser pour la plate-forme python-net. Ouvrez le gestionnaire de packages NuGet, recherchez Aspose.PDF et installez-le. Vous pouvez également utiliser la commande suivante depuis la console Package Manager.

Console

pip install aspose-pdf

Extraire des données vectorielles d’un PDF dans Python


Pour essayer le code dans votre environnement, vous avez besoin de Aspose.PDF pour Python.

  1. Ouvrez le document PDF.
  2. Créez un absorbeur graphique.
  3. Visitez la page cible.
  4. Récupérez les éléments graphiques extraits.

Extraire des données vectorielles d'un PDF avec Python

Cet exemple de code montre comment extraire des données vectorielles à partir de documents PDF

Input file:

File not added

Output format:

PDF

Output file:


import aspose.pdf as ap
from os import path

from config import set_license, initialize_data_dir

def extract_graphics_elements(infile, outfile):
    """
    Extract vector graphic elements from a specified page of a PDF and log basic element properties.
    Args:
        infile (str): Path to input PDF file.
        outfile (str): Path to output text file for logging element info.
    """
    document = ap.Document(infile)

    gr_absorber = ap.vector.GraphicsAbsorber()
    # Visit page 2 (pages collection is 1-indexed; document.pages[1] is the second page)
    gr_absorber.visit(document.pages[1])

    elements = gr_absorber.elements
    with open(outfile, "w", encoding="utf-8") as f:
        for idx, elem in enumerate(elements, start=1):
            # Basic properties
            rect = elem.rectangle
            pos = elem.position
            ops_count = len(elem.operators)
            f.write(f"Element {idx}: Rectangle = {rect}, Position = {pos}, Operators = {ops_count}\n")

À propos de Aspose.PDF pour l'API Aspose.PDF for Python for .NET

Aspose.PDF for Python via l’API .NET prend en charge les normes PDF et les spécifications PDF les plus établies. Il permet aux développeurs d’insérer des tableaux, des graphiques, des images, des hyperliens, des polices personnalisées, etc., dans des documents PDF. De plus, il est également possible de compresser des documents PDF. Aspose.PDF for Python via .NET fournit d’excellentes fonctionnalités de sécurité pour développer des documents PDF sécurisés. Certaines des fonctionnalités critiques de Aspose.PDF for Python via l’API .NET incluent :

  • Possibilité de lire et d’exporter des PDF dans plusieurs formats d’image, notamment BMP, GIF, JPEG et PNG.
  • Définissez les informations de base (par exemple, auteur, créateur) du document PDF.
  • Fonctionnalités de conversion : convertissez un PDF en Word, Excel et PowerPoint. Convertissez des PDF en formats d’image. Convertissez des fichiers PDF au format HTML et vice versa. Convertissez un PDF en EPUB, texte, XPS, etc.

En ce qui concerne l’utilisation de l’API, vous pouvez trouver plus d’informations sur Aspose.PDF for Python via l’API .NET sur notre documentation.