Text-Extraktion
Extrahieren Sie Text, um hochwertige Geschäftsdokumente in ein einfacheres Dateiformat zu konvertieren, das von KI-Modellen verwendet werden kann, oder um wichtige Informationen aus Dokumenten wie Verträgen zu finden und zu isolieren.
Die Textextraktion ist besonders nützlich für Anwendungsfälle, in denen Sie bestimmte Entitäten oder Informationskategorien anhand der Dokumentstruktur aus einem Dokument extrahieren möchten.
Kompatibilität und technische Daten
- Unterstützte Eingabedateitypen
Sie können Text aus Dokumenten in verschiedenen Sprachen oder aus einem Dokument, das mehrere Sprachen enthält, extrahieren. Extrahieren Sie Text aus den folgenden Dateitypen:
Unterstützte Dokumentformate:
Dateityp Erweiterung Unterstützung bei der Textextraktion Semantische Extraktion von Schlüssel-Wert-Paaren PDF-Datei .pdf Ja Ja Powerpoint .pptx.ppt Ja Ja Word-Dokument .docx.doc Ja Ja Excel .xlsx Ja Nein Unterstützte Bildformate:
Dateityp Erweiterung Unterstützung bei der Textextraktion Semantische Extraktion von Schlüssel-Wert-Paaren BMP-Bild .bmp Ja Ja HEIC-/HEIF-Bild .heic.heif Ja Ja JFIF-Bild .jfif Ja Ja JPEG-Bild .jpeg.jpg Ja Ja PNG-Bild .png Ja Ja TIFF-Bild/Mehrfachbild .tif.tiff Ja Ja Weitere unterstützte Formate:
Dateityp Erweiterung Unterstützung bei der Textextraktion Semantische Extraktion von Schlüssel-Wert-Paaren HTML .html Ja Ja Preisabschlag .md Ja Nein Hinweis: Mit der Text-Extraktions-API können keine Schlüssel-Wert-Paare aus XLSX-Dokumenten extrahiert werden.- Unterstützte Ausgabedateitypen
Sie können den extrahierten Text in den folgenden Dateiformaten speichern:
- JSON
- Preisabschlag
- HTML
- TXT
Einzelheiten über den Inhalt des extrahierten Ergebnisses in den einzelnen Ausgabedateitypen finden Sie unter Festlegen des Ausgabeformats.
- Unterstützte Speichertypen
Sie können Ihre Eingabedokumente in den folgenden angeschlossenen Speichertypen speichern:
- IBM Cloud Object Storage
- Amazon S3
- Jeder generische Amazon S3 -kompatible Speicher
- Box
- Microsoft OneDrive
- Microsoft Azure Blob Storage
- Microsoft Azure File Storage
- IBM watsonx.data SharePoint
- IBM FileNet P8 Content Manager
- Slack
- Confluence
- Google Drive
- NFS
Sie können die Ausgabedateien der Textextraktion in den folgenden verbundenen Speichertypen speichern:
IBM Cloud Object Storage
Amazon S3
Jeder generische Amazon S3 -kompatible Speicher
Box
Microsoft OneDrive
Microsoft Azure Blob Storage
Microsoft Azure File Storage
NFS
Hinweis:Die Textextraktions-API ist für die Verwendung mit dem generischen Amazon S3 -kompatiblen MinIO Objektspeicher zertifiziert.
Einzelheiten zum Erstellen einer Verbindung zu den verschiedenen Arten von Datenspeichern in Ihrem Projekt finden Sie unter Konnektoren für watsonx.ai.
Sie können Ihre Dokumente und Textextraktionsergebnisse auch in einem Container speichern, der mit einem Projekt oder einem Bereitstellungsbereich verbunden ist.
- Unterstützte Stiftungsmodelle
Die Textextraktions-API ist für die Verwendung des Modells
mistral-small-3-1-24b-instruct-2503für die Extraktion von Schlüssel-Wert-Paaren und die Verbalisierung von Bildern zertifiziert. Sie können auch alternative Modelle verwenden, die visuelle Eingaben verarbeiten und im JSON-Format antworten können, wie zum Beispiel:llama-4-maverick-17b-128e-instruct-fp8mistral-medium-2505mistral-medium-2508
Die Text-Extraktions-API ist zudem für die Verwendung des
pixtral-12bModells zur Extraktion von Schlüssel-Wert-Paaren und zur Bildbeschreibung zertifiziert. Das Modell ist jedoch ab Version 2.3.0 veraltet und wird in einer zukünftigen Version entfernt. Stellen Sie Ihre Workloads für die Text-Extraktions-API auf die neuesten empfohlenen Modelle um.Einzelheiten zu den Fundamentmodellen finden Sie unter Unterstützte Fundamentmodelle.
- Unterstützte Sprachen
- Bei gescannten PDF-Dokumenten und Bildern erfolgt die Texterfassung mittels optischer Zeichenerkennung (OCR). Die unterstützten Sprachen hängen von den OCR-Sprachmodellen ab.
- Bei programmierbaren Dokumenten wie HTML, Markdown sowie Microsoft Word-, „ PowerPoint, “- und Excel-Dateien unterstützt die Textextraktion alle Sprachen.
Die Bildbeschriftung wird für Dokumente in allen Sprachen unterstützt. Die generierten Bildbeschreibungen werden jedoch unabhängig von der Sprache des Eingabedokuments auf Englisch ausgegeben.
Die semantische Extraktion von Schlüssel-Wert-Paaren wird offiziell für die folgenden Sprachen unterstützt:
- Chinesisch
- Englisch
- Französisch
- Deutsch
- Italienisch
- Japanisch
- Portugiesisch
- Spanisch
Geben Sie bei der Verwendung der API den entsprechenden Sprachcode oder das von der OCR unterstützte Schriftsystem an.
Einschränkungen
Sie können Text aus bestimmten Eingabedateitypen extrahieren und die extrahierte Ausgabe in bestimmten Dateitypen speichern. Nicht jeder Eingabedateityp kann in jedes unterstützte Ausgabeformat extrahiert werden. Die folgende Tabelle enthält Einzelheiten darüber, welcher Eingabedateityp mit den verschiedenen Ausgabeformaten kompatibel ist:
Kompatibilität von Eingabedateityp und extrahiertem Ausgabeformat für die Textextraktions-API Typ der Eingabedatei Kompatible Ausgabedateiformate Programmatische PDF Alle Formate Gescanntes PDF Alle Formate Bild Alle Formate Microsoft PowerPoint Datei Alle Formate Microsoft Word-Datei Alle Formate Preisabschlag Alle Formate Microsoft Excel-Datei Markdown, JSON, einfacher Text HTML-Datei Markdown, JSON, einfacher Text Die Ergebnisse der Schlüssel-Wert-Paar-Extraktion werden ausschließlich im Assembly-Ausgabeformat zurückgegeben, sodass Schlüssel-Wert-Paar-Daten nicht in den Ausgabeformaten HTML, Markdown oder Klartext enthalten sind.
Wege zur Arbeit
Sie müssen Anmeldedaten erstellen, um sich bei den APIs von „ watsonx.ai “ zu authentifizieren. Weitere Informationen finden Sie unter „Erstellen eines Bearer-Tokens “.
Mit diesen programmatischen Methoden können Sie Text aus Dokumenten extrahieren, die in Ihrem watsonx.ai Projekt gespeichert sind:
REST-API
Sie können Text aus Dateien in IBM watsonx.ai programmatisch extrahieren, indem Sie die Textextraktionsmethode der watsonx.ai REST API verwenden.
Einzelheiten zum Anpassen einer Textextraktionsanfrage finden Sie unter Textextraktionsparameter.
Einzelheiten zu den API-Methoden finden Sie in der API-Referenzdokumentation watsonx.ai.
Python
Sie können Text aus Dateien in IBM watsonx.ai programmatisch extrahieren, indem Sie die Bibliothek Python verwenden.
Siehe die Klasse TextExtractionsV2 der Bibliothek watsonx.ai Python.
Probieren Sie das Beispiel-Notizbuch aus: Verwenden Sie den Dienst watsonx.ai Text Extraction V2, um Text aus einer Datei zu extrahieren.
Node.js
Sie können Text aus Dateien in IBM watsonx.ai programmatisch extrahieren, indem Sie das Node.js SDK verwenden. Weitere Informationen finden Sie in den folgenden Ressourcen:
Weitere Informationen finden Sie im Codebeispiel.