Wyodrębnij tekst ze stempla w formacie PDF przez Python

Jak wyodrębnić tekst ze stempla w formacie PDF przy użyciu Python

Aspose.PDF for Python for .NET Logo

Jak wyodrębnić tekst z adnotacji znaczków w formacie PDF za pomocą narzędzia Aspose.PDF dla Python for .NET

Czy musisz wyodrębnić tekst ze stempla w formacie PDF? Programowa modyfikacja dokumentów PDF jest istotną częścią nowoczesnych cyfrowych przepływów pracy. Dzięki bibliotekom Pythona, takim jak Aspose.PDF, programiści mogą wyodrębnić czcionki z pliku PDF. Biblioteki te są samodzielnymi rozwiązaniami, które nie opierają się na innym oprogramowaniu i są gotowe do użytku komercyjnego. Obejmują one wszystkie możliwe potrzeby profesjonalnych programistów Pythona.

  • Wyodrębnij tekst z pliku PDF
  • Wyodrębnij obrazy z PDF
  • Wyodrębnij czcionki z PDF
  • Wyodrębnij dane z formularza
  • Wyodrębnij tekst ze znaczków
  • Wyodrębnij dane z tabeli

Aby wyodrębnić czcionki z pliku PDF, użyjemy interfejsu API Aspose.PDF for .NET, który jest bogatym w funkcje, potężnym i łatwym w użyciu interfejsem API do manipulacji dokumentami dla platformy python-net. Otwórz menedżera pakietów NuGet, wyszukaj Aspose.PDF i zainstaluj. Można również użyć następującego polecenia z konsoli Menedżera pakietów.

Console

pip install aspose-pdf

Wyodrębnij tekst ze stempla w formacie PDF przez Python


Aby wypróbować kod w swoim środowisku, potrzebujesz Aspose.PDF dla Pythona.

  1. Otwórz dokument PDF
  2. Uzyskaj dostęp do pierwszej strony dokumentu.
  3. Iteruj wszystkie adnotacje na stronie.
  4. Filtruj tylko adnotacje stempli.

Wyodrębnij tekst ze stempla w formacie PDF przez Python

Ten przykładowy kod pokazuje, jak wyodrębnić tekst ze stempla w dokumentach PDF

Input file:

File not added

Output format:

PDF

Output file:


import aspose.pdf as apdf
from os import path

path_infile = path.join(self.data_dir, infile)
path_outfile = path.join(self.data_dir, outfile)

document = apdf.Document(path_infile)
# Create TextAbsorber object to extract text
textAbsorber = apdf.text.TextAbsorber()
document.pages.accept(textAbsorber)
extractedText = textAbsorber.text

with open(path_outfile, 'w') as f:
    f.write(extractedText)

Informacje o Aspose.PDF for Python for .NET API

Aspose.PDF dla Pythona poprzez API .NET obsługuje większość ustalonych standardów PDF i specyfikacji PDF. Umożliwia programistom wstawianie tabel, wykresów, obrazów, hiperłączy, niestandardowych czcionek - i nie tylko - do dokumentów PDF. Ponadto możliwe jest również kompresowanie dokumentów PDF. Aspose.PDF dla Pythona poprzez .NET zapewnia doskonałe funkcje bezpieczeństwa do tworzenia bezpiecznych dokumentów PDF. Niektóre z krytycznych funkcji Aspose.PDF dla Pythona za pośrednictwem interfejsu API .NET obejmują:

  • Możliwość odczytu i eksportu plików PDF w wielu formatach obrazu, w tym BMP, GIF, JPEG i PNG.
  • Ustaw podstawowe informacje (np. autor, twórca) dokumentu PDF.
  • Funkcje konwersji: Konwertuj PDF na Word, Excel i PowerPoint. Konwertuj PDF na formaty graficzne. Konwertuj pliki PDF do formatu HTML i odwrotnie. Konwertuj PDF na EPUB, tekst, XPS itp.

Jeśli chodzi o korzystanie z interfejsu API, można znaleźć więcej informacji na temat Aspose.PDF dla Pythona za pośrednictwem interfejsu API .NET w naszej dokumentacji.