Extração de texto
Extraia texto para converter documentos comerciais de alta qualidade em um formato de arquivo mais simples que possa ser usado por modelos de IA ou para localizar e isolar informações importantes de documentos como contratos.
A extração de texto é uma ferramenta poderosa para casos em que se deseja extrair entidades específicas ou categorias de informação de um documento com base na estrutura do mesmo.
Compatibilidade e especificações
- Tipos de arquivos de entrada suportados
Você pode extrair texto de documentos em diferentes idiomas ou de um documento que tenha uma mistura de vários idiomas. Extraia texto dos seguintes tipos de arquivo:
Formatos de documentos compatíveis:
Tipo de arquivo Extensão Suporte à extração de texto Extração semântica de pares chave-valor arquivo PDF .pdf True True Powerpoint .pptx.ppt True True Documento do Word .docx.doc True True Excel .xlsx True Não Formatos de imagem compatíveis:
Tipo de arquivo Extensão Suporte à extração de texto Extração semântica de pares chave-valor Imagem BMP .bmp True True Imagem HEIC/HEIF .heic.heif True True Imagem JFIF .jfif True True Imagem JPEG .jpeg.jpg True True Imagem PNG .png True True Imagem TIFF/imagens múltiplas .tif.tiff True True Outros formatos compatíveis:
Tipo de arquivo Extensão Suporte à extração de texto Extração semântica de pares chave-valor HTML .html True True Marcação .md True Não Observação: não é possível usar a API de extração de texto para extrair dados em pares chave-valor de documentos XLSX.- Tipos de arquivos de saída suportados
Você pode armazenar o texto extraído nos seguintes formatos de arquivo:
- JSON
- Marcação
- HTML
- TXT
Para obter detalhes sobre o conteúdo do resultado extraído em cada tipo de arquivo de saída, consulte Especificação do formato de saída.
- Tipos de armazenamento compatíveis
Você pode armazenar seus documentos de entrada nos seguintes tipos de armazenamento conectados:
- IBM Cloud Object Storage
- Amazon S3
- Qualquer armazenamento genérico compatível com o site Amazon S3
- Caixa
- Microsoft OneDrive
- Microsoft Azure Blob Storage
- Microsoft Azure File Storage
- IBM watsonx.data SharePoint
- IBM FileNet P8 Content Manager
- Folga
- Confluence
- Google Drive
- NFS
Você pode armazenar os arquivos de saída da extração de texto nos seguintes tipos de armazenamento conectados:
IBM Cloud Object Storage
Amazon S3
Qualquer armazenamento genérico compatível com o site Amazon S3
Caixa
Microsoft OneDrive
Microsoft Azure Blob Storage
Microsoft Azure File Storage
NFS
Observação:A API de extração de texto é certificada para uso com o armazenamento de objetos genérico compatível com Amazon S3 MinIO.
Para obter detalhes sobre como criar uma conexão com os vários tipos de armazenamentos de dados em seu projeto, consulte Conectores para watsonx.ai.
Você também pode armazenar seus documentos e resultados de extração de texto em um contêiner associado a um projeto ou espaço de implementação.
- Modelos de fundação com suporte
A API de extração de texto é certificada para usar o modelo
mistral-small-3-1-24b-instruct-2503para extração de pares de valores-chave e verbalização de imagens. Você também pode usar modelos alternativos capazes de processar entradas visuais e responder no formato JSON, tais como:llama-4-maverick-17b-128e-instruct-fp8mistral-medium-2505mistral-medium-2508
A API de extração de texto também é certificada para utilizar o
pixtral-12bmodelo na extração de pares chave-valor e na verbalização de imagens. No entanto, o modelo está obsoleto a partir da versão 2.3.0 e será removido em uma versão futura. Mude suas cargas de trabalho da API de extração de texto para os modelos mais recentes recomendados.Para obter detalhes do modelo de fundação, consulte Modelos de fundação compatíveis.
- Idiomas suportados
- No caso de documentos em PDF digitalizados e imagens, a extração de texto utiliza o Reconhecimento Ótico de Caracteres (OCR). Os idiomas suportados dependem dos modelos de idioma do OCR.
- Para documentos de formato programático, como HTML, Markdown e arquivos do Microsoft Word, do PowerPoint, e do Excel, a extração de texto é compatível com todos os idiomas.
A conversão de imagens em texto é compatível com documentos em todos os idiomas. No entanto, as descrições das imagens geradas são apresentadas em inglês, independentemente do idioma do documento de entrada.
A extração semântica de pares chave-valor é oficialmente compatível com as seguintes linguagens:
- Chinês
- Inglês
- Francês
- Alemão
- Italiano
- Japonês
- Português
- Espanhol
Ao usar a API, especifique o código do idioma correspondente ou o alfabeto compatível com o OCR.
Restrições
Você pode extrair texto de tipos específicos de arquivos de entrada e armazenar a saída extraída em determinados tipos de arquivos. Nem todo tipo de arquivo de entrada pode ser extraído para todos os formatos de saída suportados. A tabela a seguir fornece detalhes sobre qual tipo de arquivo de entrada é compatível com os vários formatos de saída:
Compatibilidade do tipo de arquivo de entrada e do formato de saída extraído para a API de extração de texto Tipo de arquivo de entrada Formatos de arquivo de saída compatíveis PDF programático Todos os formatos PDF digitalizado Todos os formatos Imagem Todos os formatos Arquivo Microsoft PowerPoint Todos os formatos Arquivo do Microsoft Word Todos os formatos Marcação Todos os formatos Arquivo do Microsoft Excel Markdown, JSON, texto simples Arquivo HTML Markdown, JSON, texto simples Os resultados da extração de pares chave-valor são retornados apenas no formato de saída da montagem; portanto, os dados dos pares chave-valor não são incluídos nos formatos de saída HTML, Markdown ou texto simples.
Formas de trabalho
É necessário gerar credenciais para se autenticar nas APIs d watsonx.ai. Para mais detalhes, consulte Geração de um token de portador.
Você pode extrair texto de documentos armazenados em seu projeto watsonx.ai com esses métodos programáticos:
API de REST
Você pode extrair texto de arquivos em IBM watsonx.ai programaticamente usando o método de extração de texto da API REST de watsonx.ai.
Para obter detalhes sobre como personalizar uma solicitação de extração de texto, consulte Parâmetros de extração de texto.
Para obter detalhes sobre o método da API, consulte a documentação de referência da API watsonx.ai.
Python
Você pode extrair texto de arquivos em IBM watsonx.ai programaticamente usando a biblioteca Python.
Consulte a classe TextExtractionsV2 da biblioteca watsonx.ai Python.
Experimente o notebook de amostra: Use o serviço watsonx.ai Text Extraction V2 para extrair o texto do arquivo.
Node.js
Você pode extrair texto de arquivos em IBM watsonx.ai programaticamente usando o Node.js SDK. Para obter mais informações, consulte os recursos a seguir:
Para saber mais, consulte o exemplo de código.