在 Python 中从 PDF 中提取矢量数据

如何使用 Python 从 PDF 中提取矢量数据

Aspose.PDF for Python for .NET Logo

如何使用适用于 Python for .NET 工具的 Aspose.PDF 从 PDF 中提取矢量数据

你需要从 PDF 中提取矢量数据吗?PDF 文档的编程修改是现代数字工作流程的重要组成部分。使用像 Aspose.PDF 这样的 Python 库,开发人员可以从 PDF 中提取矢量数据。这些库是独立的解决方案,不依赖其他软件,可以用于商业用途。它们涵盖了专业 Python 开发人员的所有可能需求。

  • 从 PDF 中提取文本
  • 从 PDF 中提取图像
  • 从 PDF 中提取字体
  • 从表单中提取数据
  • 从邮票中提取文本
  • 从表中提取数据

为了从 PDF 文件中提取矢量数据,我们将使用 Aspose.PDF for .NET API,这是一款功能丰富、强大且易于使用的文档操作 API,适用于 python-net 平台。打开 NuGet 软件包管理器,搜索 Aspose.PDF 并安装。您也可以使用包管理器控制台中的以下命令。

Console

pip install aspose-pdf

在 Python 中从 PDF 中提取矢量数据


要在你的环境中试用代码,你需要 Aspose.PDF for Python

1。打开 PDF 文档。 1。创建图形减震器。 1。访问目标页面。 1。检索提取的图形元素。

使用 Python 从 PDF 中提取矢量数据

此示例代码显示如何从 PDF 文档中提取矢量数据

Input file:

File not added

Output format:

PDF

Output file:


import aspose.pdf as ap
from os import path

from config import set_license, initialize_data_dir

def extract_graphics_elements(infile, outfile):
    """
    Extract vector graphic elements from a specified page of a PDF and log basic element properties.
    Args:
        infile (str): Path to input PDF file.
        outfile (str): Path to output text file for logging element info.
    """
    document = ap.Document(infile)

    gr_absorber = ap.vector.GraphicsAbsorber()
    # Visit page 2 (pages collection is 1-indexed; document.pages[1] is the second page)
    gr_absorber.visit(document.pages[1])

    elements = gr_absorber.elements
    with open(outfile, "w", encoding="utf-8") as f:
        for idx, elem in enumerate(elements, start=1):
            # Basic properties
            rect = elem.rectangle
            pos = elem.position
            ops_count = len(elem.operators)
            f.write(f"Element {idx}: Rectangle = {rect}, Position = {pos}, Operators = {ops_count}\n")

关于 Aspose.PDF for Python for .NET API

通过 .NET API for Python 的 Aspose.PDF 支持大多数既定的 PDF 标准和 PDF 规范。它允许开发人员将表格、图表、图像、超链接、自定义字体等插入到 PDF 文档中。此外,还可以压缩 PDF 文档。通过.NET for Python 的 Aspose.PDF 为开发安全的 PDF 文档提供了出色的安全功能。通过 .NET API 实现的 Aspose.PDF for Python 的一些关键功能包括:

  • 能够读取和导出多种图像格式的 PDF,包括 BMP、GIF、JPEG 和 PNG。
  • 设置 PDF 文档的基本信息(例如作者、创建者)。
  • 转换功能:将 PDF 转换为 Word、Excel 和 PowerPoint。将 PDF 转换为图像格式。将 PDF 文件转换为 HTML 格式,反之亦然。将 PDF 转换为 EPUB、文本、XPS 等

关于 API 的使用,你可以在我们的 文档 中通过.NET API 找到有关 Aspose.PDF for Python 的更多信息。