แยกข้อมูลเวกเตอร์จาก PDF ใน Python

วิธีแยกข้อมูลเวกเตอร์จาก PDF โดยใช้ Python

Aspose.PDF for Python for .NET Logo

วิธีแยกข้อมูลเวกเตอร์จาก PDF โดยใช้ Aspose.PDF สำหรับเครื่องมือ Python for .NET

คุณจำเป็นต้องแยกข้อมูลเวกเตอร์จาก PDF หรือไม่การปรับเปลี่ยนเอกสาร PDF แบบโปรแกรมเป็นส่วนสำคัญของเวิร์กโฟลว์ดิจิทัลที่ทันสมัยด้วยไลบรารี Python เช่น Aspose.PDF นักพัฒนาสามารถแยกข้อมูลเวกเตอร์จาก PDFไลบรารีเหล่านี้เป็นโซลูชันแบบสแตนด์อโลนที่ไม่พึ่งพาซอฟต์แวร์อื่น ๆ และพร้อมสำหรับการใช้งานเชิงพาณิชย์ครอบคลุมความต้องการที่เป็นไปได้ทั้งหมดของนักพัฒนา Python มืออาชีพ

  • แยกข้อความจาก PDF
  • แยกรูปภาพจาก PDF
  • แยกแบบอักษรจาก PDF
  • แยกข้อมูลจากแบบฟอร์ม
  • แยกข้อความจากแสตมป์
  • แยกข้อมูลจากตาราง

ในการแยกข้อมูลเวกเตอร์จากไฟล์ PDF เราจะใช้ Aspose.PDF for .NET API ซึ่งเป็นAPI ที่อุดมไปด้วยคุณสมบัติ ทรงพลัง และใช้งานง่ายสำหรับแพลตฟอร์ม python-netเปิดตัวจัดการแพคเกจ NuGet ค้นหาAspose.PDF และติดตั้งคุณอาจใช้คำสั่งต่อไปนี้จากคอนโซลตัวจัดการแพคเกจ

Console

pip install aspose-pdf

แยกข้อมูลเวกเตอร์จาก PDF ใน Python


ในการลองใช้รหัสในสภาพแวดล้อมของคุณคุณต้อง Aspose.PDF for Python

1.เปิดเอกสาร PDF 1.สร้างตัวดูดซับกราฟิก 1.เยี่ยมชมหน้าเป้าหมาย 1.ดึงองค์ประกอบกราฟิกที่แยกออกมา

แยกข้อมูลเวกเตอร์จาก PDF ด้วย Python

รหัสตัวอย่างนี้แสดงวิธีแยกข้อมูลเวกเตอร์จากเอกสาร PDF

Input file:

File not added

Output format:

PDF

Output file:


import aspose.pdf as ap
from os import path

from config import set_license, initialize_data_dir

def extract_graphics_elements(infile, outfile):
    """
    Extract vector graphic elements from a specified page of a PDF and log basic element properties.
    Args:
        infile (str): Path to input PDF file.
        outfile (str): Path to output text file for logging element info.
    """
    document = ap.Document(infile)

    gr_absorber = ap.vector.GraphicsAbsorber()
    # Visit page 2 (pages collection is 1-indexed; document.pages[1] is the second page)
    gr_absorber.visit(document.pages[1])

    elements = gr_absorber.elements
    with open(outfile, "w", encoding="utf-8") as f:
        for idx, elem in enumerate(elements, start=1):
            # Basic properties
            rect = elem.rectangle
            pos = elem.position
            ops_count = len(elem.operators)
            f.write(f"Element {idx}: Rectangle = {rect}, Position = {pos}, Operators = {ops_count}\n")

เกี่ยวกับ Aspose.PDF for Python for .NET API

Aspose.PDF สำหรับ Python ผ่าน.NET API รองรับมาตรฐาน PDF และข้อมูลจำเพาะ PDF ที่กำหนดไว้มากที่สุดช่วยให้นักพัฒนาสามารถแทรกตารางกราฟรูปภาพไฮเปอร์ลิงก์แบบอักษรที่กำหนดเองและอื่น ๆ ลงในเอกสาร PDFนอกจากนี้ยังเป็นไปได้ที่จะบีบอัดเอกสาร PDFAspose.PDF สำหรับ Python ผ่าน .NET มีคุณสมบัติความปลอดภัยที่ยอดเยี่ยมในการพัฒนาเอกสาร PDF ที่ปลอดภัยคุณสมบัติที่สำคัญบางอย่างของ Aspose.PDF สำหรับ Python ผ่าน.NET API ได้แก่:

  • ความสามารถในการอ่านและส่งออก PDF ในรูปแบบภาพหลายรูปแบบ รวมถึง BMP, GIF, JPEG และ PNG
  • ตั้งค่าข้อมูลพื้นฐาน (เช่นผู้เขียนผู้สร้าง) ของเอกสาร PDF
  • คุณสมบัติการแปลง: แปลง PDF เป็น Word, Excel และ PowerPointแปลง PDF เป็นรูปแบบภาพแปลงไฟล์ PDF เป็นรูปแบบ HTML และในทางกลับกันแปลง PDF เป็น EPUB, ข้อความ, XPS ฯลฯ

ในการใช้ API คุณสามารถค้นหาข้อมูลเพิ่มเติมเกี่ยวกับ Aspose.PDF สำหรับ Python ผ่าน.NET API ใน ของเรา เอกสาร