Text-Extraktion

Extrahieren Sie Text, um hochwertige Geschäftsdokumente in ein einfacheres Dateiformat zu konvertieren, das von KI-Modellen verwendet werden kann, oder um wichtige Informationen aus Dokumenten wie Verträgen zu finden und zu isolieren.

Die Textextraktion ist besonders nützlich für Anwendungsfälle, in denen Sie bestimmte Entitäten oder Informationskategorien anhand der Dokumentstruktur aus einem Dokument extrahieren möchten.

Kompatibilität und technische Daten

Unterstützte Eingabedateitypen

Sie können Text aus Dokumenten in verschiedenen Sprachen oder aus einem Dokument, das mehrere Sprachen enthält, extrahieren. Extrahieren Sie Text aus den folgenden Dateitypen:

Unterstützte Dokumentformate:

Dateityp Erweiterung Unterstützung bei der Textextraktion Semantische Extraktion von Schlüssel-Wert-Paaren
PDF-Datei .pdf Ja Ja
Powerpoint .pptx.ppt Ja Ja
Word-Dokument .docx.doc Ja Ja
Excel .xlsx Ja Nein

Unterstützte Bildformate:

Dateityp Erweiterung Unterstützung bei der Textextraktion Semantische Extraktion von Schlüssel-Wert-Paaren
BMP-Bild .bmp Ja Ja
HEIC-/HEIF-Bild .heic.heif Ja Ja
JFIF-Bild .jfif Ja Ja
JPEG-Bild .jpeg.jpg Ja Ja
PNG-Bild .png Ja Ja
TIFF-Bild/Mehrfachbild .tif.tiff Ja Ja

Weitere unterstützte Formate:

Dateityp Erweiterung Unterstützung bei der Textextraktion Semantische Extraktion von Schlüssel-Wert-Paaren
HTML .html Ja Ja
Preisabschlag .md Ja Nein
Hinweis: Mit der Text-Extraktions-API können keine Schlüssel-Wert-Paare aus XLSX-Dokumenten extrahiert werden.
Unterstützte Ausgabedateitypen

Sie können den extrahierten Text in den folgenden Dateiformaten speichern:

  • JSON
  • Preisabschlag
  • HTML
  • TXT

Einzelheiten über den Inhalt des extrahierten Ergebnisses in den einzelnen Ausgabedateitypen finden Sie unter Festlegen des Ausgabeformats.

Unterstützte Speichertypen

Sie können Ihre Eingabedokumente in den folgenden angeschlossenen Speichertypen speichern:

  • IBM Cloud Object Storage
  • Amazon S3
  • Jeder generische Amazon S3 -kompatible Speicher
  • Box
  • Microsoft OneDrive
  • Microsoft Azure Blob Storage
  • Microsoft Azure File Storage
  • IBM watsonx.data SharePoint
  • IBM FileNet P8 Content Manager
  • Slack
  • Confluence
  • Google Drive
  • NFS

Sie können die Ausgabedateien der Textextraktion in den folgenden verbundenen Speichertypen speichern:

  • IBM Cloud Object Storage

  • Amazon S3

  • Jeder generische Amazon S3 -kompatible Speicher

  • Box

  • Microsoft OneDrive

  • Microsoft Azure Blob Storage

  • Microsoft Azure File Storage

  • NFS

    Hinweis:Die Textextraktions-API ist für die Verwendung mit dem generischen Amazon S3 -kompatiblen MinIO Objektspeicher zertifiziert.

Einzelheiten zum Erstellen einer Verbindung zu den verschiedenen Arten von Datenspeichern in Ihrem Projekt finden Sie unter Konnektoren für watsonx.ai.

Sie können Ihre Dokumente und Textextraktionsergebnisse auch in einem Container speichern, der mit einem Projekt oder einem Bereitstellungsbereich verbunden ist.

Unterstützte Stiftungsmodelle

Die Textextraktions-API ist für die Verwendung des Modells mistral-small-3-1-24b-instruct-2503 für die Extraktion von Schlüssel-Wert-Paaren und die Verbalisierung von Bildern zertifiziert. Sie können auch alternative Modelle verwenden, die visuelle Eingaben verarbeiten und im JSON-Format antworten können, wie zum Beispiel:

  • llama-4-maverick-17b-128e-instruct-fp8
  • mistral-medium-2505
  • mistral-medium-2508

Die Text-Extraktions-API ist zudem für die Verwendung des pixtral-12b Modells zur Extraktion von Schlüssel-Wert-Paaren und zur Bildbeschreibung zertifiziert. Das Modell ist jedoch ab Version 2.3.0 veraltet und wird in einer zukünftigen Version entfernt. Stellen Sie Ihre Workloads für die Text-Extraktions-API auf die neuesten empfohlenen Modelle um.

Einzelheiten zu den Fundamentmodellen finden Sie unter Unterstützte Fundamentmodelle.

Unterstützte Sprachen
  • Bei gescannten PDF-Dokumenten und Bildern erfolgt die Texterfassung mittels optischer Zeichenerkennung (OCR). Die unterstützten Sprachen hängen von den OCR-Sprachmodellen ab.
  • Bei programmierbaren Dokumenten wie HTML, Markdown sowie Microsoft Word-, „ PowerPoint, “- und Excel-Dateien unterstützt die Textextraktion alle Sprachen.

Die Bildbeschriftung wird für Dokumente in allen Sprachen unterstützt. Die generierten Bildbeschreibungen werden jedoch unabhängig von der Sprache des Eingabedokuments auf Englisch ausgegeben.

Die semantische Extraktion von Schlüssel-Wert-Paaren wird offiziell für die folgenden Sprachen unterstützt:

  • Chinesisch
  • Englisch
  • Französisch
  • Deutsch
  • Italienisch
  • Japanisch
  • Portugiesisch
  • Spanisch

Geben Sie bei der Verwendung der API den entsprechenden Sprachcode oder das von der OCR unterstützte Schriftsystem an.

Einschränkungen

  • Sie können Text aus bestimmten Eingabedateitypen extrahieren und die extrahierte Ausgabe in bestimmten Dateitypen speichern. Nicht jeder Eingabedateityp kann in jedes unterstützte Ausgabeformat extrahiert werden. Die folgende Tabelle enthält Einzelheiten darüber, welcher Eingabedateityp mit den verschiedenen Ausgabeformaten kompatibel ist:

    Kompatibilität von Eingabedateityp und extrahiertem Ausgabeformat für die Textextraktions-API
    Typ der Eingabedatei Kompatible Ausgabedateiformate
    Programmatische PDF Alle Formate
    Gescanntes PDF Alle Formate
    Bild Alle Formate
    Microsoft PowerPoint Datei Alle Formate
    Microsoft Word-Datei Alle Formate
    Preisabschlag Alle Formate
    Microsoft Excel-Datei Markdown, JSON, einfacher Text
    HTML-Datei Markdown, JSON, einfacher Text
  • Die Ergebnisse der Schlüssel-Wert-Paar-Extraktion werden ausschließlich im Assembly-Ausgabeformat zurückgegeben, sodass Schlüssel-Wert-Paar-Daten nicht in den Ausgabeformaten HTML, Markdown oder Klartext enthalten sind.

Wege zur Arbeit

Sie müssen Anmeldedaten erstellen, um sich bei den APIs von „ watsonx.ai “ zu authentifizieren. Weitere Informationen finden Sie unter „Erstellen eines Bearer-Tokens “.

Mit diesen programmatischen Methoden können Sie Text aus Dokumenten extrahieren, die in Ihrem watsonx.ai Projekt gespeichert sind:

REST-API

Sie können Text aus Dateien in IBM watsonx.ai programmatisch extrahieren, indem Sie die Textextraktionsmethode der watsonx.ai REST API verwenden.

Einzelheiten zum Anpassen einer Textextraktionsanfrage finden Sie unter Textextraktionsparameter.

Einzelheiten zu den API-Methoden finden Sie in der API-Referenzdokumentation watsonx.ai.

Python

Sie können Text aus Dateien in IBM watsonx.ai programmatisch extrahieren, indem Sie die Bibliothek Python verwenden.

Siehe die Klasse TextExtractionsV2 der Bibliothek watsonx.ai Python.

Probieren Sie das Beispiel-Notizbuch aus: Verwenden Sie den Dienst watsonx.ai Text Extraction V2, um Text aus einer Datei zu extrahieren.

Node.js

Sie können Text aus Dateien in IBM watsonx.ai programmatisch extrahieren, indem Sie das Node.js SDK verwenden. Weitere Informationen finden Sie in den folgenden Ressourcen:

Weitere Informationen finden Sie im Codebeispiel.

Weitere Informationen