Python で PDF からベクターデータを抽出する

Python を使用して PDF からベクターデータを抽出する方法

Aspose.PDF for Python for .NET Logo

Aspose.PDF for Python for .NET ツールを使用して PDF からベクターデータを抽出する方法

PDFからベクターデータを抽出する必要がありますか?プログラムによるPDF文書の修正は、現代のデジタルワークフローに欠かせないものです。Aspose.PDF のような Python ライブラリを使用すると、開発者は PDF からベクターデータを抽出できます。これらのライブラリは、他のソフトウェアに依存しないスタンドアロンソリューションであり、すぐに商用利用が可能です。これらはプロのPython開発者のあらゆるニーズをカバーしています。

  • PDF からテキストを抽出
  • PDFから画像を抽出
  • PDF からフォントを抽出
  • フォームからデータを抽出
  • スタンプからテキストを抽出
  • テーブルからデータを抽出

PDF ファイルからベクターデータを抽出するには、python-net プラットフォーム用の機能が豊富で強力で使いやすいドキュメント操作 API である Aspose.PDF for .NET API を使用します。NuGet パッケージマネージャーを開き、Aspose.PDF を検索してインストールします。パッケージマネージャーコンソールから次のコマンドを使用することもできます。

Console

pip install aspose-pdf

Python で PDF からベクターデータを抽出する


ご使用の環境でコードを試すには、Aspose.PDF for Python が必要です。

1。PDF ドキュメントを開きます。 1。グラフィックアブソーバーを作成します。 1。ターゲットページにアクセスしてください。 1。抽出されたグラフィック要素を取得します。

Python を使って PDF からベクターデータを抽出する

このサンプルコードは、PDF ドキュメントからベクターデータを抽出する方法を示しています。

Input file:

File not added

Output format:

PDF

Output file:


import aspose.pdf as ap
from os import path

from config import set_license, initialize_data_dir

def extract_graphics_elements(infile, outfile):
    """
    Extract vector graphic elements from a specified page of a PDF and log basic element properties.
    Args:
        infile (str): Path to input PDF file.
        outfile (str): Path to output text file for logging element info.
    """
    document = ap.Document(infile)

    gr_absorber = ap.vector.GraphicsAbsorber()
    # Visit page 2 (pages collection is 1-indexed; document.pages[1] is the second page)
    gr_absorber.visit(document.pages[1])

    elements = gr_absorber.elements
    with open(outfile, "w", encoding="utf-8") as f:
        for idx, elem in enumerate(elements, start=1):
            # Basic properties
            rect = elem.rectangle
            pos = elem.position
            ops_count = len(elem.operators)
            f.write(f"Element {idx}: Rectangle = {rect}, Position = {pos}, Operators = {ops_count}\n")

Aspose.PDF for Python for .NET API について

.NET API 経由の Python 用 Aspose.PDF は、確立されている PDF 標準と PDF 仕様のほとんどをサポートしています。開発者は表、グラフ、画像、ハイパーリンク、カスタムフォントなどを PDF ドキュメントに挿入できます。さらに、PDF 文書を圧縮することもできます。.NET 経由の Python 用 Aspose.PDF は、安全な PDF 文書を開発するための優れたセキュリティ機能を備えています。.NET API 経由の Aspose.PDF for Python の重要な機能には、次のようなものがあります。

  • BMP、GIF、JPEG、PNG を含む複数のイメージフォーマットで PDF を読み取ったりエクスポートしたりすることができます。
  • PDF ドキュメントの基本情報 (作成者、作成者など) を設定します。
  • 変換機能:PDF をワード、エクセル、パワーポイントに変換します。PDF を画像形式に変換します。PDF ファイルを HTML 形式に、またはその逆に変換します。PDF を EPUB、テキスト、XPS などに変換します。

API の使用については、.NET API 経由の Aspose.PDF for Python に関する詳細情報を当社の ドキュメント で確認できます。