Tabloları PDF’den Python içinde ayıklayın

Python kullanarak PDF’den tablolar nasıl çıkarılır

Aspose.PDF for Python for .NET Logo

Python for .NET Aracı için Aspose.PDF kullanarak PDF'den tablolar nasıl çıkarılır

PDF’den tabloları çıkarmanız gerekiyor mu? PDF belgelerinin programlı olarak değiştirilmesi, modern dijital iş akışlarının önemli bir parçasıdır. Aspose.PDF gibi Python kütüphaneleri ile geliştiriciler PDF’den tabloları ayıklayabilir. Bu kütüphaneler, diğer yazılımlara güvenmeyen ve ticari kullanıma hazır bağımsız çözümlerdir. Profesyonel Python geliştiricilerinin tüm olası ihtiyaçlarını karşılarlar.

  • PDF’den metin ayıklayın
  • PDF’den Görüntüleri Çıkarın
  • PDF’den Yazı Tiplerini Çıkarın
  • Formdan Verileri Çıkarın
  • Pullardan Metin Çıkarın
  • Tablodan Verileri Çıkarın

PDF dosyasından tabloları çıkarmak için, python-net platformu için zengin özelliklere sahip, güçlü ve kullanımı kolay bir belge işleme API’si olan Aspose.PDF for .NET API’sini kullanacağız. NuGet paket yöneticisini açın, Aspose.PDF öğesini arayın ve yükleyin. Paket Yöneticisi Konsolu’ndan aşağıdaki komutu da kullanabilirsiniz.

Console

pip install aspose-pdf

Tabloları PDF’den Python içinde ayıklayın


Kodu ortamınızda denemek için Aspose.PDF for Python gerekir.

  1. PDF Belgesini açın.
  2. Belgedeki tüm sayfalarda yineleyin.
  3. Sayfa için bir tablo emici oluşturun.
  4. Satır metin çıktısını birleştirin.

Python ile PDF'den tabloları ayıklayın

Bu örnek kod, PDF belgelerinden tabloların nasıl çıkarılacağını gösterir

Input file:

File not added

Output format:

PDF

Output file:


import aspose.pdf as ap
from os import path

from config import set_license, initialize_data_dir

def extract_tables_from_pdf(infile):
    # Open PDF document
    document = ap.Document(infile)

    # Iterate through each page in the document
    for page in document.pages:
        absorber = ap.text.TableAbsorber()
        absorber.visit(page)

        for table in absorber.table_list:
            print("Table")
            for row in table.row_list:
                row_text = []
                for cell in row.cell_list:
                    cell_text = []
                    for fragment in cell.text_fragments:
                        cell_text.append("".join(seg.text for seg in fragment.segments))
                    row_text.append("|".join(cell_text))
                print("|".join(row_text))

Aspose.PDF for Python for .NET API'si Hakkında

.NET API aracılığıyla Python için Aspose.PDF, en yerleşik PDF standartlarını ve PDF özelliklerini destekler. Geliştiricilerin PDF belgelerine tablolar, grafikler, resimler, köprüler, özel yazı tipleri ve daha fazlasını eklemelerine olanak tanır. Ayrıca, PDF belgelerini sıkıştırmak da mümkündür. .NET üzerinden Python için Aspose.PDF, güvenli PDF belgeleri geliştirmek için mükemmel güvenlik özellikleri sağlar. .NET API aracılığıyla Python için Aspose.PDF uygulamasının kritik özelliklerinden bazıları şunlardır:

  • PDF’yi BMP, GIF, JPEG ve PNG dahil olmak üzere birden fazla görüntü formatında okuma ve dışa aktarma yeteneği.
  • PDF belgesinin temel bilgilerini (örn. yazar, yaratıcı) ayarlayın.
  • Dönüştürme Özellikleri: PDF’yi Word, Excel ve PowerPoint’e Dönüştürün. PDF’yi Resim formatlarına dönüştürün. PDF dosyalarını HTML biçimine dönüştürün ve bunun tersi de geçerlidir. PDF’yi EPUB, Metin, XPS vb. dosyalara dönüştürün

API kullanımı hakkında, Python için Aspose.PDF hakkında .NET API aracılığıyla daha fazla bilgiyi dokümantasyon adresinde bulabilirsiniz.