Extraiga datos vectoriales de un PDF en Python

Cómo extraer datos vectoriales de un PDF usando Python

Aspose.PDF for Python for .NET Logo

Cómo extraer datos vectoriales de un PDF con la herramienta Aspose.PDF for Python for .NET

¿Necesita extraer datos vectoriales de un PDF? La modificación programática de los documentos PDF es una parte esencial de los flujos de trabajo digitales modernos. Con bibliotecas de Python como Aspose.PDF, los desarrolladores pueden extraer datos vectoriales de PDF. Estas bibliotecas son soluciones independientes que no dependen de otro software y están listas para su uso comercial. Cubren todas las necesidades posibles de los desarrolladores profesionales de Python.

  • Extraer texto de PDF
  • Extraer imágenes de PDF
  • Extraer fuentes de PDF
  • Extraer datos del formulario
  • Extraer texto de sellos
  • Extraer datos de la tabla

Para extraer datos vectoriales de un archivo PDF, utilizaremos la API Aspose.PDF for .NET, que es una API de manipulación de documentos rica en funciones, potente y fácil de usar para la plataforma python-net. Abra el administrador de paquetes NuGet, busque Aspose.PDF e instálelo. También puede usar el siguiente comando desde la consola del administrador de paquetes.

Console

pip install aspose-pdf

Extraiga datos vectoriales de un PDF en Python


Para probar el código en su entorno, necesita Aspose.PDF para Python.

  1. Abra el documento PDF.
  2. Cree un absorbedor de gráficos.
  3. Visita la página de destino.
  4. Recupera los elementos gráficos extraídos.

Extrae datos vectoriales de un PDF con Python

Este código de ejemplo muestra cómo extraer datos vectoriales de documentos PDF

Input file:

File not added

Output format:

PDF

Output file:


import aspose.pdf as ap
from os import path

from config import set_license, initialize_data_dir

def extract_graphics_elements(infile, outfile):
    """
    Extract vector graphic elements from a specified page of a PDF and log basic element properties.
    Args:
        infile (str): Path to input PDF file.
        outfile (str): Path to output text file for logging element info.
    """
    document = ap.Document(infile)

    gr_absorber = ap.vector.GraphicsAbsorber()
    # Visit page 2 (pages collection is 1-indexed; document.pages[1] is the second page)
    gr_absorber.visit(document.pages[1])

    elements = gr_absorber.elements
    with open(outfile, "w", encoding="utf-8") as f:
        for idx, elem in enumerate(elements, start=1):
            # Basic properties
            rect = elem.rectangle
            pos = elem.position
            ops_count = len(elem.operators)
            f.write(f"Element {idx}: Rectangle = {rect}, Position = {pos}, Operators = {ops_count}\n")

Acerca de Aspose.PDF for la API de Python

Aspose.PDF for Python a través de la API de.NET es compatible con los estándares y especificaciones de PDF más establecidos. Permite a los desarrolladores insertar tablas, gráficos, imágenes, hipervínculos, fuentes personalizadas (y mucho más) en documentos PDF. Además, también es posible comprimir documentos PDF. Aspose.PDF for Python a través de.NET proporciona excelentes funciones de seguridad para desarrollar documentos PDF seguros. Algunas de las funciones fundamentales de Aspose.PDF for Python a través de la API.NET incluyen:

  • Posibilidad de leer y exportar PDF en múltiples formatos de imagen, incluidos BMP, GIF, JPEG y PNG.
  • Establezca la información básica (por ejemplo, autor, creador) del documento PDF.
  • Funciones de conversión: convierte PDF a Word, Excel y PowerPoint. Convierte PDF a formatos de imagen. Convierte archivos PDF a formato HTML y viceversa. Convierte PDF a EPUB, texto, XPS, etc.

Sobre el uso de la API, puedes encontrar más información sobre Aspose.PDF for Python a través de la API.NET en nuestra documentación.