Comprendere i documenti in watsonx.ai

Conversione di documenti aziendali di alta qualità in un formato di file più semplice, utilizzabile dai modelli di intelligenza artificiale grazie alle molteplici API di elaborazione del testo presenti nella libreria di comprensione dei documenti. Elaborare il testo dei documenti per trovare e isolare le informazioni chiave da documenti come i contratti.

Semplificare i documenti aziendali convertendoli in un formato testuale è particolarmente utile per le attività di retrieval-augmented generation, in cui si desidera trovare informazioni rilevanti per una query dell'utente e includerle nell'input di un modello di fondazione. L'inclusione di informazioni contestuali accurate nell'input del modello aiuta il modello di fondazione a incorporare informazioni concrete e aggiornate nell'output del modello.

Funzionalità

È possibile utilizzare una combinazione di più API della libreria di comprensione dei documenti per analizzare i documenti. Con l'API di classificazione è possibile classificare il documento in uno dei diversi tipi di documenti comuni supportati senza eseguire un'attività di estrazione più lunga. È quindi possibile utilizzare i risultati della fase di pre-elaborazione per estrarre in modo efficiente i dati non strutturati e i dati strutturati limitati al tipo di documento classificato con l'API di estrazione.

È possibile utilizzare le API di elaborazione del testo con documenti che hanno caratteristiche diverse, come ad esempio:

La tecnologia di comprensione dei documenti utilizza le seguenti funzionalità per la scansione e l'elaborazione dei documenti:

Riconoscimento ottico del carattere
Il riconoscimento ottico dei caratteri (OCR) rileva il testo da immagini, documenti scansionati e tabelle ed è utile per conservare le informazioni contenute in immagini, diagrammi o testo incorporato in file come i PDF scansionati. Sebbene l'OCR sia in grado di estrarre il testo da immagini rumorose, la qualità dei file immagine deve soddisfare il requisito minimo di 80 DPI (punti per pollice).
Identificazione della struttura del documento
Le API elaborano il contenuto del documento da varie strutture di dati, tra cui tabelle, titoli di sezione, elenchi puntati, paragrafi e note a piè di pagina. L'API identifica e rimuove anche i contenuti comunemente utilizzati, come le intestazioni e i piè di pagina.
Classificazione ed estrazione delle coppie chiave-valore
Utilizzate l'estrazione di coppie chiave-valore per elaborare documenti che contengono dati strutturati generici o specifici del dominio, come fatture, bollette e altro. La modalità di estrazione classifica i documenti in base al tipo di documento. Il testo estratto viene memorizzato in una struttura di dati chiamata schema, dove ogni dato (il valore) è associato a un identificatore unico (la chiave). La modalità utilizza uno schema predefinito o uno schema personalizzato definito dall'utente. Le coppie chiave-valore vengono estratte con modelli linguistici di grandi dimensioni (LLM) e un'elaborazione avanzata del linguaggio della visione.

È possibile configurare le varie funzionalità di comprensione dei documenti utilizzando impostazioni comuni alle API di classificazione ed estrazione del testo. Per ulteriori informazioni, vedere Parametri comuni di elaborazione del testo.

Limitazioni

  • L'API di classificazione del testo può essere utilizzata solo con documenti in lingua inglese.
  • L'estrazione delle coppie chiave-valore è supportata solo per i documenti in lingua inglese.

Modi di lavorare

È possibile elaborare i documenti memorizzati nel progetto watsonx.ai in modo programmatico con i seguenti metodi API REST di elaborazione del testo:

  • Classificazione del testo : Utilizzare l'API di classificazione del testo per scoprire se un documento può essere classificato in uno schema predefinito supportato per un tipo di documento comune.
  • Estrazione del testo : Utilizzare l'API di estrazione del testo per estrarre entità specifiche o tipi di informazioni in base alla struttura del documento.

Flusso di lavoro

Per elaborare i documenti con la libreria di comprensione dei documenti, è possibile utilizzare i seguenti passaggi di alto livello:

  1. Memorizzare il documento di input in un tipo di archiviazione supportato e definire una connessione al tipo di archiviazione per accedere al documento in un progetto watsonx.ai.

  2. Opzionale: Classificare il documento con l'API di classificazione del testo di watsonx.ai in uno dei tipi di documento comuni supportati o in un tipo di documento personalizzato. Vedere Classificazione del testo nei documenti

  3. Estraete vari tipi di informazioni dal vostro documento con l'API di estrazione del testo di watsonx.ai. Nella richiesta di estrazione del testo, specificare il tipo di archiviazione del progetto in cui memorizzare i risultati estratti. Vedere Estrazione di testo dai documenti.

    Se applicabile, utilizzare i risultati della classificazione per configurare accuratamente la richiesta di estrazione del testo per estrarre in modo efficiente i dati strutturati dal documento.

  4. Utilizzare i risultati del processo di estrazione del testo in una soluzione RAG. Vedere Aggiunta di testo estratto alla soluzione RAG.