Extraction de texte
Extraire du texte pour convertir des documents commerciaux de haute qualité en un format de fichier plus simple pouvant être utilisé par des modèles d'IA ou pour trouver et isoler des éléments d'information clés dans des documents tels que des contrats.
L'extraction de texte est particulièrement utile dans les cas où l'on souhaite extraire des entités spécifiques ou des catégories d'informations d'un document en s'appuyant sur la structure de ce dernier.
Compatibilité et caractéristiques techniques
- Types de fichiers d'entrée pris en charge
Vous pouvez extraire du texte de documents rédigés dans différentes langues, ou d'un document contenant un mélange de plusieurs langues. Extraire du texte à partir des types de fichiers suivants :
Formats de documents pris en charge :
Type de fichier Poste Prise en charge de l'extraction de texte Extraction sémantique de paires clé-valeur Fichier PDF .pdf Oui Oui PowerPoint .pptx.ppt Oui Oui Document Word .docx.doc Oui Oui Excel .xlsx Oui Non Formats d'image pris en charge :
Type de fichier Poste Prise en charge de l'extraction de texte Extraction sémantique de paires clé-valeur Image BMP .bmp Oui Oui Image HEIC/HEIF .heic.heif Oui Oui Image JFIF .jfif Oui Oui Image JPEG .jpeg.jpg Oui Oui Image au format PNG .png Oui Oui Image TIFF / images multiples .tif.tiff Oui Oui Autres formats pris en charge :
Type de fichier Poste Prise en charge de l'extraction de texte Extraction sémantique de paires clé-valeur langage HTML .html Oui Oui Démarque .md Oui Non Remarque : vous ne pouvez pas utiliser l'API d'extraction de texte pour extraire des données sous forme de paires clé-valeur à partir de documents XLSX.- Types de fichiers de sortie pris en charge
Vous pouvez enregistrer le texte extrait dans les formats de fichiers suivants :
- JavaScript Object Notation
- Démarque
- langage HTML
- TXT
Pour plus d'informations sur le contenu du résultat extrait dans chaque type de fichier de sortie, voir Spécification du format de sortie.
- Types de stockage pris en charge
Vous pouvez stocker vos documents d'entrée dans les types de stockage connectés suivants :
- IBM Cloud Object Storage
- Amazon S3
- Tout stockage générique compatible avec Amazon S3
- Zone
- Microsoft OneDrive
- Microsoft Azure Blob Storage
- Microsoft Azure File Storage
- IBM watsonx.data SharePoint
- IBM FileNet P8 Content Manager
- Citation
- Confluence
- Google Drive
- NFS
Vous pouvez stocker les fichiers de sortie de l'extraction de texte dans les types de stockage connectés suivants :
IBM Cloud Object Storage
Amazon S3
Tout stockage générique compatible avec Amazon S3
Zone
Microsoft OneDrive
Microsoft Azure Blob Storage
Microsoft Azure File Storage
NFS
Remarque :L'API d'extraction de texte est certifiée pour une utilisation avec le stockage d'objets génériques Amazon S3 - compatible MinIO.
Pour plus de détails sur la façon de créer une connexion aux différents types de magasins de données dans votre projet, voir Connecteurs pour watsonx.ai.
Vous pouvez également stocker vos documents et les résultats de l'extraction de texte dans un conteneur associé à un projet ou à un espace de déploiement.
- Modèles de fondations soutenus
L'API d'extraction de texte est certifiée pour utiliser le modèle
mistral-small-3-1-24b-instruct-2503pour l'extraction de paires clé-valeur et la verbalisation d'images. Vous pouvez également utiliser d'autres modèles capables de traiter des données visuelles et de renvoyer des réponses au format JSON, tels que :llama-4-maverick-17b-128e-instruct-fp8mistral-medium-2505mistral-medium-2508
L'API d'extraction de texte est également certifiée pour l'utilisation du
pixtral-12bmodèle d'extraction de paires clé-valeur et de verbalisation d'images. Toutefois, ce modèle est obsolète depuis la version 2.3.0 et sera supprimé dans une prochaine version. Faites évoluer vos charges de travail liées à l'API d'extraction de texte vers les derniers modèles recommandés.Pour plus de détails sur le modèle de fondation, voir Modèles de fondation pris en charge.
- Langues supportées
- Pour les documents PDF numérisés et les images, l'extraction de texte s'appuie sur la reconnaissance optique de caractères (OCR). Les langues prises en charge dépendent des modèles linguistiques de l'OCR.
- Pour les documents de type programmatique, tels que les fichiers HTML, Markdown, Microsoft Word, d' PowerPoint, s et d'Excel, l'extraction de texte prend en charge toutes les langues.
La conversion en texte des images est prise en charge pour les documents dans toutes les langues. Cependant, les descriptions d'images générées sont fournies en anglais, quelle que soit la langue du document d'origine.
L'extraction sémantique de paires clé-valeur est officiellement prise en charge pour les langues suivantes :
- Chinois
- Anglais
- Français
- Allemand
- Italien
- Japonais
- Portugais
- Espagnol
Lorsque vous utilisez l'API, indiquez le code de langue correspondant ou le script pris en charge par la reconnaissance optique de caractères (OCR).
Restrictions
Vous pouvez extraire du texte à partir de types de fichiers d'entrée spécifiques et stocker le résultat extrait dans certains types de fichiers. Tous les types de fichiers d'entrée ne peuvent pas être extraits dans tous les formats de sortie pris en charge. Le tableau suivant indique quel type de fichier d'entrée est compatible avec les différents formats de sortie :
Compatibilité entre le type de fichier d'entrée et le format de sortie extrait pour l'API d'extraction de texte Type de fichier d'entrée Formats de fichiers de sortie compatibles PDF programmatique Tous les formats PDF scanné Tous les formats Avancée Tous les formats Fichier Microsoft PowerPoint Tous les formats Fichier Microsoft Word Tous les formats Démarque Tous les formats Fichier Microsoft Excel Markdown, JSON, texte brut fichier HTML Markdown, JSON, texte brut Les résultats de l'extraction des paires clé-valeur ne sont fournis que dans le format de sortie « assembly »; par conséquent, les données de ces paires ne sont pas incluses dans les formats de sortie HTML, Markdown ou texte brut.
Façons de travailler
Vous devez générer des identifiants pour vous authentifier auprès des API d' watsonx.ai. Pour plus d'informations, consultez la section « Génération d'un jeton porteur ».
Ces méthodes programmatiques vous permettent d'extraire du texte des documents stockés dans votre projet watsonx.ai :
API REST
Vous pouvez extraire du texte des fichiers dans IBM watsonx.ai de manière programmatique en utilisant la méthode d'extraction de texte de l'API REST watsonx.ai.
Pour plus d'informations sur la personnalisation d'une demande d'extraction de texte, voir Paramètres d'extraction de texte.
Pour plus de détails sur les méthodes de l'API, voir la documentation de référence de l'API watsonx.ai.
Python
Vous pouvez extraire du texte des fichiers dans IBM watsonx.ai de manière programmatique en utilisant la bibliothèque Python.
Voir la classe TextExtractionsV2 de la bibliothèque watsonx.ai Python.
Essayez l'exemple de carnet de notes : Utilisez le service d'extraction de texte watsonx.ai V2 pour extraire le texte d'un fichier.
Node.js
Vous pouvez extraire du texte des fichiers dans IBM watsonx.ai de manière programmatique en utilisant le SDK Node.js. Pour obtenir plus d'informations, consultez les ressources suivantes :
Pour en savoir plus, consultez l' exemple de code.