Extração de texto

Extraia texto para converter documentos comerciais de alta qualidade em um formato de arquivo mais simples que possa ser usado por modelos de IA ou para localizar e isolar informações importantes de documentos como contratos.

A extração de texto é uma ferramenta poderosa para casos em que se deseja extrair entidades específicas ou categorias de informação de um documento com base na estrutura do mesmo.

Compatibilidade e especificações

Tipos de arquivos de entrada suportados

Você pode extrair texto de documentos em diferentes idiomas ou de um documento que tenha uma mistura de vários idiomas. Extraia texto dos seguintes tipos de arquivo:

Formatos de documentos compatíveis:

Tipo de arquivo Extensão Suporte à extração de texto Extração semântica de pares chave-valor
arquivo PDF .pdf True True
Powerpoint .pptx.ppt True True
Documento do Word .docx.doc True True
Excel .xlsx True Não

Formatos de imagem compatíveis:

Tipo de arquivo Extensão Suporte à extração de texto Extração semântica de pares chave-valor
Imagem BMP .bmp True True
Imagem HEIC/HEIF .heic.heif True True
Imagem JFIF .jfif True True
Imagem JPEG .jpeg.jpg True True
Imagem PNG .png True True
Imagem TIFF/imagens múltiplas .tif.tiff True True

Outros formatos compatíveis:

Tipo de arquivo Extensão Suporte à extração de texto Extração semântica de pares chave-valor
HTML .html True True
Marcação .md True Não
Observação: não é possível usar a API de extração de texto para extrair dados em pares chave-valor de documentos XLSX.
Tipos de arquivos de saída suportados

Você pode armazenar o texto extraído nos seguintes formatos de arquivo:

  • JSON
  • Marcação
  • HTML
  • TXT

Para obter detalhes sobre o conteúdo do resultado extraído em cada tipo de arquivo de saída, consulte Especificação do formato de saída.

Tipos de armazenamento compatíveis

Você pode armazenar seus documentos de entrada nos seguintes tipos de armazenamento conectados:

  • IBM Cloud Object Storage
  • Amazon S3
  • Qualquer armazenamento genérico compatível com o site Amazon S3
  • Caixa
  • Microsoft OneDrive
  • Microsoft Azure Blob Storage
  • Microsoft Azure File Storage
  • IBM watsonx.data SharePoint
  • IBM FileNet P8 Content Manager
  • Folga
  • Confluence
  • Google Drive
  • NFS

Você pode armazenar os arquivos de saída da extração de texto nos seguintes tipos de armazenamento conectados:

  • IBM Cloud Object Storage

  • Amazon S3

  • Qualquer armazenamento genérico compatível com o site Amazon S3

  • Caixa

  • Microsoft OneDrive

  • Microsoft Azure Blob Storage

  • Microsoft Azure File Storage

  • NFS

    Observação:A API de extração de texto é certificada para uso com o armazenamento de objetos genérico compatível com Amazon S3 MinIO.

Para obter detalhes sobre como criar uma conexão com os vários tipos de armazenamentos de dados em seu projeto, consulte Conectores para watsonx.ai.

Você também pode armazenar seus documentos e resultados de extração de texto em um contêiner associado a um projeto ou espaço de implementação.

Modelos de fundação com suporte

A API de extração de texto é certificada para usar o modelo mistral-small-3-1-24b-instruct-2503 para extração de pares de valores-chave e verbalização de imagens. Você também pode usar modelos alternativos capazes de processar entradas visuais e responder no formato JSON, tais como:

  • llama-4-maverick-17b-128e-instruct-fp8
  • mistral-medium-2505
  • mistral-medium-2508

A API de extração de texto também é certificada para utilizar o pixtral-12b modelo na extração de pares chave-valor e na verbalização de imagens. No entanto, o modelo está obsoleto a partir da versão 2.3.0 e será removido em uma versão futura. Mude suas cargas de trabalho da API de extração de texto para os modelos mais recentes recomendados.

Para obter detalhes do modelo de fundação, consulte Modelos de fundação compatíveis.

Idiomas suportados
  • No caso de documentos em PDF digitalizados e imagens, a extração de texto utiliza o Reconhecimento Ótico de Caracteres (OCR). Os idiomas suportados dependem dos modelos de idioma do OCR.
  • Para documentos de formato programático, como HTML, Markdown e arquivos do Microsoft Word, do PowerPoint, e do Excel, a extração de texto é compatível com todos os idiomas.

A conversão de imagens em texto é compatível com documentos em todos os idiomas. No entanto, as descrições das imagens geradas são apresentadas em inglês, independentemente do idioma do documento de entrada.

A extração semântica de pares chave-valor é oficialmente compatível com as seguintes linguagens:

  • Chinês
  • Inglês
  • Francês
  • Alemão
  • Italiano
  • Japonês
  • Português
  • Espanhol

Ao usar a API, especifique o código do idioma correspondente ou o alfabeto compatível com o OCR.

Restrições

  • Você pode extrair texto de tipos específicos de arquivos de entrada e armazenar a saída extraída em determinados tipos de arquivos. Nem todo tipo de arquivo de entrada pode ser extraído para todos os formatos de saída suportados. A tabela a seguir fornece detalhes sobre qual tipo de arquivo de entrada é compatível com os vários formatos de saída:

    Compatibilidade do tipo de arquivo de entrada e do formato de saída extraído para a API de extração de texto
    Tipo de arquivo de entrada Formatos de arquivo de saída compatíveis
    PDF programático Todos os formatos
    PDF digitalizado Todos os formatos
    Imagem Todos os formatos
    Arquivo Microsoft PowerPoint Todos os formatos
    Arquivo do Microsoft Word Todos os formatos
    Marcação Todos os formatos
    Arquivo do Microsoft Excel Markdown, JSON, texto simples
    Arquivo HTML Markdown, JSON, texto simples
  • Os resultados da extração de pares chave-valor são retornados apenas no formato de saída da montagem; portanto, os dados dos pares chave-valor não são incluídos nos formatos de saída HTML, Markdown ou texto simples.

Formas de trabalho

É necessário gerar credenciais para se autenticar nas APIs d watsonx.ai. Para mais detalhes, consulte Geração de um token de portador.

Você pode extrair texto de documentos armazenados em seu projeto watsonx.ai com esses métodos programáticos:

API de REST

Você pode extrair texto de arquivos em IBM watsonx.ai programaticamente usando o método de extração de texto da API REST de watsonx.ai.

Para obter detalhes sobre como personalizar uma solicitação de extração de texto, consulte Parâmetros de extração de texto.

Para obter detalhes sobre o método da API, consulte a documentação de referência da API watsonx.ai.

Python

Você pode extrair texto de arquivos em IBM watsonx.ai programaticamente usando a biblioteca Python.

Consulte a classe TextExtractionsV2 da biblioteca watsonx.ai Python.

Experimente o notebook de amostra: Use o serviço watsonx.ai Text Extraction V2 para extrair o texto do arquivo.

Node.js

Você pode extrair texto de arquivos em IBM watsonx.ai programaticamente usando o Node.js SDK. Para obter mais informações, consulte os recursos a seguir:

Para saber mais, consulte o exemplo de código.

Saiba mais