HTML JPG OCR XML BMP
Aspose.OCR  para .NET
XML

Converter PDF em XML em C#

Execute o reconhecimento óptico de caracteres no documento PDF e salve o texto como documento PDF usando a biblioteca Aspose.OCR fro .NET.

Como converter PDF para XML usando C#

Aspose.OCR para .NET é uma biblioteca poderosa, mas fácil de usar e econômica para converter imagens PDF em documentos XML. Suportando 26 idiomas baseados em latim, cirílico e chinês, seu mecanismo de reconhecimento óptico de caracteres de última geração fornece velocidade e precisão de reconhecimento superiores, enquanto isola você de fórmulas, redes neurais e outros detalhes técnicos complexos. Ele permite que você adicione a funcionalidade OCR aos seus aplicativos .NET em menos de 10 linhas de código.

Aspose.OCR para .NET

processa imagens digitalizadas ou até mesmo fotos de smartphones no formato PDF e cria documentos PDF contendo texto reconhecido. Para adicioná-lo ao seu projeto, você só precisa instalar o Aspose.OCR

NuGet

package em seu projeto com o seguinte comando:

Package Manager Console Command


  PM> Install-Package Aspose.OCR

Etapas para converter PDF em XML

Com o OCR .NET e apenas algumas linhas de código, você pode criar um aplicativo completo que converte uma imagem PDF em um documento XML:

  • Crie uma instância da classe AsposeOcr
  • Chamar o método AsposeOCR.RecognizeImage
  • Passe o caminho do arquivo PDF como parâmetro
  • AsposeOCR.RecognizeImage retorna uma String ou arquivo do tipo XML

Requisitos de sistema

Antes de executar o exemplo, certifique-se de que a API .NET compatível com a especificação NET Standard 2.0 esteja instalada em seu sistema e todas as [dependências externas]( https://docs.aspose.com/ocr/net/system-requirements/#external- dependencies) do pacote Aspose.OCR são referenciados em seu projeto.

  • Solução compatível com NET Standard 2.0+
  • Aspose.OCR para .NET referenciado em seu projeto.

Este código de amostra mostra a conversão de PDF para XML .NET


// initialize an instance of AsposeOcr
AsposeOcr ocr = new AsposeOcr();
// recognize image
string riText = ocr.RecognizeImage("template.PDF");
// print text
File. File.WriteAllText("document.XML", riText);
  • PDF O que é PDF Formato de arquivo

    Portable Document Format (PDF) é um tipo de documento criado pela Adobe na década de 1990. O objetivo deste formato de arquivo foi introduzir um padrão para representação de documentos e outros materiais de referência em um formato independente do software aplicativo, hardware e sistema operacional. O formato de arquivo PDF tem capacidade total para conter informações como texto, imagens, hiperlinks, campos de formulário, rich media, assinaturas digitais, anexos, metadados, recursos geoespaciais e objetos 3D que podem se tornar parte do documento de origem.

    consulte Mais informação

    XML O que é XML Formato de arquivo

    XML significa Extensible Markup Language que é semelhante ao HTML, mas diferente no uso de tags para definir objetos. A ideia por trás da criação do formato de arquivo XML era armazenar e transportar dados sem depender de ferramentas de software ou hardware. Sua popularidade se deve ao fato de ser tanto humano quanto legível por máquina. Isso permite que ele crie protocolos de dados comuns na forma de objetos a serem armazenados e compartilhados em rede, como a World Wide Web (WWW). O “X” em XML é extensível, o que implica que a linguagem pode ser estendida a qualquer número de símbolos conforme os requisitos do usuário. É para esses recursos que muitos formatos de arquivo padrão fazem uso dele, como Microsoft Open XML, LibreOffice OpenDocument, XHTML e SVG.

    consulte Mais informação

    Outras conversões compatíveis

    Usando C#, pode-se converter facilmente diferentes formatos, incluindo.

    TXT (Arquivo de documento de texto)
    Text (Arquivo de documento de texto)
    DOC (Documentos gerados pelo Microsoft Word)
    DOCX (Documentos do Microsoft Word)
    XLS (Formato de arquivo binário do Microsoft Excel)
    XLSX (Documentos do Microsoft Excel)
    PDF (Formato de Documento Portátil (PDF))
    Searchable PDF (Gráficos de rede portáteis pesquisáveis)
    XML (Extensible Markup Language)
    JSON (Notação de Objeto JavaScript)