Extraia tabelas do PDF em Python

Como extrair tabelas de um PDF usando Python

Aspose.PDF for Python for .NET Logo

Como extrair tabelas de um PDF usando o Aspose.PDF para a ferramenta Python for .NET

Você precisa extrair tabelas do PDF? A modificação programática de documentos PDF é uma parte essencial dos fluxos de trabalho digitais modernos. Com bibliotecas Python como Aspose.PDF, os desenvolvedores podem extrair tabelas do PDF. Essas bibliotecas são soluções independentes que não dependem de outros softwares e estão prontas para uso comercial. Eles cobrem todas as necessidades possíveis dos desenvolvedores profissionais de Python.

  • Extrair texto do PDF
  • Extrair imagens do PDF
  • Extrair fontes do PDF
  • Extrair dados do formulário
  • Extrair texto de carimbos
  • Extrair dados da tabela

Para extrair tabelas do arquivo PDF, usaremos a API Aspose.PDF for.NET, que é uma API de manipulação de documentos rica em recursos, poderosa e fácil de usar para a plataforma python-net. Abra o gerenciador de pacotes NuGet, pesquise Aspose.PDF e instale. Você também pode usar o seguinte comando no console do gerenciador de pacotes.

Console

pip install aspose-pdf

Extraia tabelas do PDF em Python


Para testar o código em seu ambiente, você precisa de Aspose.PDF para Python.

  1. Abra o documento PDF.
  2. Percorra todas as páginas do documento.
  3. Crie um absorvedor de mesa para a página.
  4. Monte a saída de texto da linha.

Extraia tabelas do PDF com Python

Este exemplo de código mostra como extrair tabelas de documentos PDF

Input file:

File not added

Output format:

PDF

Output file:


import aspose.pdf as ap
from os import path

from config import set_license, initialize_data_dir

def extract_tables_from_pdf(infile):
    # Open PDF document
    document = ap.Document(infile)

    # Iterate through each page in the document
    for page in document.pages:
        absorber = ap.text.TableAbsorber()
        absorber.visit(page)

        for table in absorber.table_list:
            print("Table")
            for row in table.row_list:
                row_text = []
                for cell in row.cell_list:
                    cell_text = []
                    for fragment in cell.text_fragments:
                        cell_text.append("".join(seg.text for seg in fragment.segments))
                    row_text.append("|".join(cell_text))
                print("|".join(row_text))

Sobre o Aspose.PDF for a API Python

O Aspose.PDF for Python via API.NET suporta os padrões e especificações de PDF mais estabelecidos. Ele permite que os desenvolvedores insiram tabelas, gráficos, imagens, hiperlinks, fontes personalizadas e muito mais em documentos PDF. Além disso, também é possível compactar documentos PDF. O Aspose.PDF for Python via .NET fornece excelentes recursos de segurança para desenvolver documentos PDF seguros. Alguns dos recursos essenciais do Aspose.PDF for Python via API.NET incluem:

  • Capacidade de ler e exportar PDF em vários formatos de imagem, incluindo BMP, GIF, JPEG e PNG.
  • Defina as informações básicas (por exemplo, autor, criador) do documento PDF.
  • Recursos de conversão: converta PDF em Word, Excel e PowerPoint. Converta PDF em formatos de imagem. Converta arquivos PDF em formato HTML e vice-versa. Converta PDF em EPUB, texto, XPS, etc.

Sobre o uso da API, você pode encontrar mais informações sobre o Aspose.PDF for Python por meio da API.NET em nossa documentação.