Извлечение векторных данных из PDF в Python

Как извлечь векторные данные из PDF с помощью Python

Aspose.PDF for Python for .NET Logo

Как извлечь векторные данные из PDF с помощью инструмента Aspose.PDF для Python for .NET

Вам нужно извлечь векторные данные из PDF? Программная модификация PDF-документов является неотъемлемой частью современных цифровых рабочих процессов. С помощью библиотек Python, таких как Aspose.PDF, разработчики могут извлекать векторные данные из PDF. Эти библиотеки представляют собой автономные решения, которые не зависят от другого программного обеспечения и готовы к коммерческому использованию. Они охватывают все возможные потребности профессиональных разработчиков Python.

  • Извлечение текста из PDF
  • Извлечение изображений из PDF
  • Извлечение шрифтов из PDF
  • Извлечение данных из формы
  • Извлечение текста из штампов
  • Извлечение данных из таблицы

Чтобы извлечь векторные данные из PDF-файла, мы будем использовать API Aspose.PDF for .NET, который представляет собой многофункциональный, мощный и простой в использовании API для работы с документами для платформы python-net. Откройте диспетчер пакетов NuGet, найдите aSpose.pdf и установите. Вы также можете использовать следующую команду из консоли диспетчера пакетов.

Console

pip install aspose-pdf

Извлечение векторных данных из PDF в Python


Чтобы попробовать код в своей среде, вам понадобится Aspose.PDF для Python.

  1. Откройте PDF-документ.
  2. Создайте поглотитель графики.
  3. Посетите целевую страницу.
  4. Извлеките извлеченные графические элементы.

Извлеките векторные данные из PDF с помощью Python

В этом примере кода показано, как извлекать векторные данные из PDF-документов

Input file:

File not added

Output format:

PDF

Output file:


import aspose.pdf as ap
from os import path

from config import set_license, initialize_data_dir

def extract_graphics_elements(infile, outfile):
    """
    Extract vector graphic elements from a specified page of a PDF and log basic element properties.
    Args:
        infile (str): Path to input PDF file.
        outfile (str): Path to output text file for logging element info.
    """
    document = ap.Document(infile)

    gr_absorber = ap.vector.GraphicsAbsorber()
    # Visit page 2 (pages collection is 1-indexed; document.pages[1] is the second page)
    gr_absorber.visit(document.pages[1])

    elements = gr_absorber.elements
    with open(outfile, "w", encoding="utf-8") as f:
        for idx, elem in enumerate(elements, start=1):
            # Basic properties
            rect = elem.rectangle
            pos = elem.position
            ops_count = len(elem.operators)
            f.write(f"Element {idx}: Rectangle = {rect}, Position = {pos}, Operators = {ops_count}\n")

О файле Aspose.PDF для API Python for .NET

Aspose.PDF для Python через API.NET поддерживает большинство устоявшихся стандартов PDF и спецификаций PDF. Он позволяет разработчикам вставлять таблицы, графики, изображения, гиперссылки, пользовательские шрифты и многое другое в PDF-документы. Кроме того, можно сжимать PDF-документы. Aspose.PDF для Python через .NET предоставляет отличные функции безопасности для разработки защищенных PDF-документов. Некоторые из важнейших функций Aspose.PDF для Python с помощью .NET API включают в себя:

  • Возможность чтения и экспорта PDF в нескольких форматах изображений, включая BMP, GIF, JPEG и PNG.
  • Задайте основную информацию (например, об авторе, создателе) PDF-документа.
  • Функции конвертации: конвертируйте PDF в Word, Excel и PowerPoint. Конвертируйте PDF в форматы изображений. Конвертируйте PDF-файлы в формат HTML и наоборот. Конвертируйте PDF в EPUB, текст, XPS и т. д.

Подробнее об использовании API вы можете найти дополнительную информацию о Aspose.PDF для Python через API.NET в нашей документации.