Vektör verilerini PDF’den Python içinde ayıklayın

Python kullanarak PDF’den vektör verileri nasıl çıkarılır

Aspose.PDF for Python for .NET Logo

Python for .NET Aracı için Aspose.PDF kullanarak PDF'den vektör verileri nasıl çıkarılır

PDF’den vektör verilerini çıkarmanız gerekiyor mu? PDF belgelerinin programlı olarak değiştirilmesi, modern dijital iş akışlarının önemli bir parçasıdır. Aspose.PDF gibi Python kütüphaneleri ile geliştiriciler PDF’den vektör verilerini ayıklayabilir. Bu kütüphaneler, diğer yazılımlara güvenmeyen ve ticari kullanıma hazır bağımsız çözümlerdir. Profesyonel Python geliştiricilerinin tüm olası ihtiyaçlarını karşılarlar.

  • PDF’den metin ayıklayın
  • PDF’den Görüntüleri Çıkarın
  • PDF’den Yazı Tiplerini Çıkarın
  • Formdan Verileri Çıkarın
  • Pullardan Metin Çıkarın
  • Tablodan Verileri Çıkarın

PDF dosyasından vektör verilerini çıkarmak için, python-net platformu için zengin özelliklere sahip, güçlü ve kullanımı kolay bir belge işleme API’si olan Aspose.PDF for .NET API’sini kullanacağız. NuGet paket yöneticisini açın, Aspose.PDF öğesini arayın ve yükleyin. Paket Yöneticisi Konsolu’ndan aşağıdaki komutu da kullanabilirsiniz.

Console

pip install aspose-pdf

Vektör verilerini PDF’den Python içinde ayıklayın


Kodu ortamınızda denemek için Aspose.PDF for Python gerekir.

  1. PDF Belgesini açın.
  2. Bir grafik emici oluşturun.
  3. Hedef sayfayı ziyaret edin.
  4. Çıkarılan grafik öğelerini alın.

Python ile PDF'den vektör verilerini ayıklayın

Bu örnek kod, PDF belgelerinden vektör verilerinin nasıl çıkarılacağını gösterir

Input file:

File not added

Output format:

PDF

Output file:


import aspose.pdf as ap
from os import path

from config import set_license, initialize_data_dir

def extract_graphics_elements(infile, outfile):
    """
    Extract vector graphic elements from a specified page of a PDF and log basic element properties.
    Args:
        infile (str): Path to input PDF file.
        outfile (str): Path to output text file for logging element info.
    """
    document = ap.Document(infile)

    gr_absorber = ap.vector.GraphicsAbsorber()
    # Visit page 2 (pages collection is 1-indexed; document.pages[1] is the second page)
    gr_absorber.visit(document.pages[1])

    elements = gr_absorber.elements
    with open(outfile, "w", encoding="utf-8") as f:
        for idx, elem in enumerate(elements, start=1):
            # Basic properties
            rect = elem.rectangle
            pos = elem.position
            ops_count = len(elem.operators)
            f.write(f"Element {idx}: Rectangle = {rect}, Position = {pos}, Operators = {ops_count}\n")

Aspose.PDF for Python for .NET API'si Hakkında

.NET API aracılığıyla Python için Aspose.PDF, en yerleşik PDF standartlarını ve PDF özelliklerini destekler. Geliştiricilerin PDF belgelerine tablolar, grafikler, resimler, köprüler, özel yazı tipleri ve daha fazlasını eklemelerine olanak tanır. Ayrıca, PDF belgelerini sıkıştırmak da mümkündür. .NET üzerinden Python için Aspose.PDF, güvenli PDF belgeleri geliştirmek için mükemmel güvenlik özellikleri sağlar. .NET API aracılığıyla Python için Aspose.PDF uygulamasının kritik özelliklerinden bazıları şunlardır:

  • PDF’yi BMP, GIF, JPEG ve PNG dahil olmak üzere birden fazla görüntü formatında okuma ve dışa aktarma yeteneği.
  • PDF belgesinin temel bilgilerini (örn. yazar, yaratıcı) ayarlayın.
  • Dönüştürme Özellikleri: PDF’yi Word, Excel ve PowerPoint’e Dönüştürün. PDF’yi Resim formatlarına dönüştürün. PDF dosyalarını HTML biçimine dönüştürün ve bunun tersi de geçerlidir. PDF’yi EPUB, Metin, XPS vb. dosyalara dönüştürün

API kullanımı hakkında, Python için Aspose.PDF hakkında .NET API aracılığıyla daha fazla bilgiyi dokümantasyon adresinde bulabilirsiniz.