Extraia dados vetoriais do PDF em Python

Como extrair dados vetoriais de um PDF usando Python

Aspose.PDF for Python for .NET Logo

Como extrair dados vetoriais de um PDF usando o Aspose.PDF para a ferramenta Python for .NET

Você precisa extrair dados vetoriais do PDF? A modificação programática de documentos PDF é uma parte essencial dos fluxos de trabalho digitais modernos. Com bibliotecas Python como Aspose.PDF, os desenvolvedores podem extrair dados vetoriais do PDF. Essas bibliotecas são soluções independentes que não dependem de outros softwares e estão prontas para uso comercial. Eles cobrem todas as necessidades possíveis dos desenvolvedores profissionais de Python.

  • Extrair texto do PDF
  • Extrair imagens do PDF
  • Extrair fontes do PDF
  • Extrair dados do formulário
  • Extrair texto de carimbos
  • Extrair dados da tabela

Para extrair dados vetoriais do arquivo PDF, usaremos a API Aspose.PDF for.NET, que é uma API de manipulação de documentos rica em recursos, poderosa e fácil de usar para a plataforma python-net. Abra o gerenciador de pacotes NuGet, pesquise Aspose.PDF e instale. Você também pode usar o seguinte comando no console do gerenciador de pacotes.

Console

pip install aspose-pdf

Extraia dados vetoriais do PDF em Python


Para testar o código em seu ambiente, você precisa de Aspose.PDF para Python.

  1. Abra o documento PDF.
  2. Crie um absorvedor gráfico.
  3. Visite a página de destino.
  4. Recupere elementos gráficos extraídos.

Extraia dados vetoriais do PDF com Python

Este exemplo de código mostra como extrair dados vetoriais de documentos PDF

Input file:

File not added

Output format:

PDF

Output file:


import aspose.pdf as ap
from os import path

from config import set_license, initialize_data_dir

def extract_graphics_elements(infile, outfile):
    """
    Extract vector graphic elements from a specified page of a PDF and log basic element properties.
    Args:
        infile (str): Path to input PDF file.
        outfile (str): Path to output text file for logging element info.
    """
    document = ap.Document(infile)

    gr_absorber = ap.vector.GraphicsAbsorber()
    # Visit page 2 (pages collection is 1-indexed; document.pages[1] is the second page)
    gr_absorber.visit(document.pages[1])

    elements = gr_absorber.elements
    with open(outfile, "w", encoding="utf-8") as f:
        for idx, elem in enumerate(elements, start=1):
            # Basic properties
            rect = elem.rectangle
            pos = elem.position
            ops_count = len(elem.operators)
            f.write(f"Element {idx}: Rectangle = {rect}, Position = {pos}, Operators = {ops_count}\n")

Sobre o Aspose.PDF for a API Python

O Aspose.PDF for Python via API.NET suporta os padrões e especificações de PDF mais estabelecidos. Ele permite que os desenvolvedores insiram tabelas, gráficos, imagens, hiperlinks, fontes personalizadas e muito mais em documentos PDF. Além disso, também é possível compactar documentos PDF. O Aspose.PDF for Python via .NET fornece excelentes recursos de segurança para desenvolver documentos PDF seguros. Alguns dos recursos essenciais do Aspose.PDF for Python via API.NET incluem:

  • Capacidade de ler e exportar PDF em vários formatos de imagem, incluindo BMP, GIF, JPEG e PNG.
  • Defina as informações básicas (por exemplo, autor, criador) do documento PDF.
  • Recursos de conversão: converta PDF em Word, Excel e PowerPoint. Converta PDF em formatos de imagem. Converta arquivos PDF em formato HTML e vice-versa. Converta PDF em EPUB, texto, XPS, etc.

Sobre o uso da API, você pode encontrar mais informações sobre o Aspose.PDF for Python por meio da API.NET em nossa documentação.