Extrahieren Sie Tabellen aus PDF in Python

So extrahieren Sie Tabellen aus PDF mit Python

Aspose.PDF for Python for .NET Logo

So extrahieren Sie Tabellen aus PDF mit Aspose.PDF für das Python for .NET Tool

Müssen Sie Tabellen aus PDF extrahieren? Die programmatische Änderung von PDF-Dokumenten ist ein wesentlicher Bestandteil moderner digitaler Workflows. Mit Python-Bibliotheken wie Aspose.PDF können Entwickler Tabellen aus PDF extrahieren. Diese Bibliotheken sind eigenständige Lösungen, die nicht auf andere Software angewiesen sind und für den kommerziellen Einsatz bereit sind. Sie decken alle möglichen Bedürfnisse professioneller Python-Entwickler ab.

  • Text aus PDF extrahieren
  • Extrahieren Sie Bilder aus PDF
  • Extrahieren Sie Schriften aus PDF
  • Extrahieren Sie Daten aus dem Formular
  • Text aus Stempeln extrahieren
  • Extrahieren Sie Daten aus der Tabelle

Um Tabellen aus einer PDF-Datei zu extrahieren, verwenden wir die API Aspose.PDF for .NET, eine funktionsreiche, leistungsstarke und benutzerfreundliche API zur Dokumentenbearbeitung für die python-net -Plattform. Öffnen Sie den Paketmanager NuGet, suchen Sie nach Aspose.PDF und installieren Sie. Sie können auch den folgenden Befehl von der Package Manager Console aus verwenden.

Console

pip install aspose-pdf

Extrahieren Sie Tabellen aus PDF in Python


Um den Code in Ihrer Umgebung auszuprobieren, benötigen Sie Aspose.PDF für Python.

  1. Öffnen Sie das PDF-Dokument.
  2. Durchlaufen Sie alle Seiten des Dokuments.
  3. Erstellen Sie einen Tabellenabsorber für die Seite.
  4. Stellen Sie die Zeilentextausgabe zusammen.

Extrahieren Sie Tabellen aus PDF mit Python

Dieser Beispielcode zeigt, wie Tabellen aus PDF-Dokumenten extrahiert werden

Input file:

File not added

Output format:

PDF

Output file:


import aspose.pdf as ap
from os import path

from config import set_license, initialize_data_dir

def extract_tables_from_pdf(infile):
    # Open PDF document
    document = ap.Document(infile)

    # Iterate through each page in the document
    for page in document.pages:
        absorber = ap.text.TableAbsorber()
        absorber.visit(page)

        for table in absorber.table_list:
            print("Table")
            for row in table.row_list:
                row_text = []
                for cell in row.cell_list:
                    cell_text = []
                    for fragment in cell.text_fragments:
                        cell_text.append("".join(seg.text for seg in fragment.segments))
                    row_text.append("|".join(cell_text))
                print("|".join(row_text))

Über Aspose.PDF for Python for .NET API

Aspose.PDF for Python über .NET-API unterstützt die meisten etablierten PDF-Standards und PDF-Spezifikationen. Es ermöglicht Entwicklern, Tabellen, Grafiken, Bilder, Hyperlinks, benutzerdefinierte Schriftarten — und mehr — in PDF-Dokumente einzufügen. Darüber hinaus ist es auch möglich, PDF-Dokumente zu komprimieren. Aspose.PDF for Python über.NET bietet hervorragende Sicherheitsfunktionen für die Entwicklung sicherer PDF-Dokumente. Zu den wichtigen Funktionen von Aspose.PDF for Python via .NET-API gehören:

  • Fähigkeit, PDF in mehreren Bildformaten wie BMP, GIF, JPEG und PNG zu lesen und zu exportieren.
  • Legen Sie grundlegende Informationen (z. B. Autor, Ersteller) des PDF-Dokuments fest.
  • Konvertierungsfunktionen: Konvertiere PDF in Word, Excel und PowerPoint. Konvertiere PDF in Bildformate. Konvertieren Sie PDF-Dateien in das HTML-Format und umgekehrt. Konvertieren Sie PDF in EPUB, Text, XPS usw.

Zur API-Verwendung finden Sie weitere Informationen zu Aspose.PDF for Python via .NET-API in unserer Dokumentation.