Extraction de texte

Extraire du texte pour convertir des documents commerciaux de haute qualité en un format de fichier plus simple pouvant être utilisé par des modèles d'IA ou pour trouver et isoler des éléments d'information clés dans des documents tels que des contrats.

L'extraction de texte est particulièrement utile dans les cas où l'on souhaite extraire des entités spécifiques ou des catégories d'informations d'un document en s'appuyant sur la structure de ce dernier.

Compatibilité et caractéristiques techniques

Types de fichiers d'entrée pris en charge

Vous pouvez extraire du texte de documents rédigés dans différentes langues, ou d'un document contenant un mélange de plusieurs langues. Extraire du texte à partir des types de fichiers suivants :

Formats de documents pris en charge :

Type de fichier Poste Prise en charge de l'extraction de texte Extraction sémantique de paires clé-valeur
Fichier PDF .pdf Oui Oui
PowerPoint .pptx.ppt Oui Oui
Document Word .docx.doc Oui Oui
Excel .xlsx Oui Non

Formats d'image pris en charge :

Type de fichier Poste Prise en charge de l'extraction de texte Extraction sémantique de paires clé-valeur
Image BMP .bmp Oui Oui
Image HEIC/HEIF .heic.heif Oui Oui
Image JFIF .jfif Oui Oui
Image JPEG .jpeg.jpg Oui Oui
Image au format PNG .png Oui Oui
Image TIFF / images multiples .tif.tiff Oui Oui

Autres formats pris en charge :

Type de fichier Poste Prise en charge de l'extraction de texte Extraction sémantique de paires clé-valeur
langage HTML .html Oui Oui
Démarque .md Oui Non
Remarque : vous ne pouvez pas utiliser l'API d'extraction de texte pour extraire des données sous forme de paires clé-valeur à partir de documents XLSX.
Types de fichiers de sortie pris en charge

Vous pouvez enregistrer le texte extrait dans les formats de fichiers suivants :

  • JavaScript Object Notation
  • Démarque
  • langage HTML
  • TXT

Pour plus d'informations sur le contenu du résultat extrait dans chaque type de fichier de sortie, voir Spécification du format de sortie.

Types de stockage pris en charge

Vous pouvez stocker vos documents d'entrée dans les types de stockage connectés suivants :

  • IBM Cloud Object Storage
  • Amazon S3
  • Tout stockage générique compatible avec Amazon S3
  • Zone
  • Microsoft OneDrive
  • Microsoft Azure Blob Storage
  • Microsoft Azure File Storage
  • IBM watsonx.data SharePoint
  • IBM FileNet P8 Content Manager
  • Citation
  • Confluence
  • Google Drive
  • NFS

Vous pouvez stocker les fichiers de sortie de l'extraction de texte dans les types de stockage connectés suivants :

  • IBM Cloud Object Storage

  • Amazon S3

  • Tout stockage générique compatible avec Amazon S3

  • Zone

  • Microsoft OneDrive

  • Microsoft Azure Blob Storage

  • Microsoft Azure File Storage

  • NFS

    Remarque :L'API d'extraction de texte est certifiée pour une utilisation avec le stockage d'objets génériques Amazon S3 - compatible MinIO.

Pour plus de détails sur la façon de créer une connexion aux différents types de magasins de données dans votre projet, voir Connecteurs pour watsonx.ai.

Vous pouvez également stocker vos documents et les résultats de l'extraction de texte dans un conteneur associé à un projet ou à un espace de déploiement.

Modèles de fondations soutenus

L'API d'extraction de texte est certifiée pour utiliser le modèle mistral-small-3-1-24b-instruct-2503 pour l'extraction de paires clé-valeur et la verbalisation d'images. Vous pouvez également utiliser d'autres modèles capables de traiter des données visuelles et de renvoyer des réponses au format JSON, tels que :

  • llama-4-maverick-17b-128e-instruct-fp8
  • mistral-medium-2505
  • mistral-medium-2508

L'API d'extraction de texte est également certifiée pour l'utilisation du pixtral-12b modèle d'extraction de paires clé-valeur et de verbalisation d'images. Toutefois, ce modèle est obsolète depuis la version 2.3.0 et sera supprimé dans une prochaine version. Faites évoluer vos charges de travail liées à l'API d'extraction de texte vers les derniers modèles recommandés.

Pour plus de détails sur le modèle de fondation, voir Modèles de fondation pris en charge.

Langues supportées
  • Pour les documents PDF numérisés et les images, l'extraction de texte s'appuie sur la reconnaissance optique de caractères (OCR). Les langues prises en charge dépendent des modèles linguistiques de l'OCR.
  • Pour les documents de type programmatique, tels que les fichiers HTML, Markdown, Microsoft Word, d' PowerPoint, s et d'Excel, l'extraction de texte prend en charge toutes les langues.

La conversion en texte des images est prise en charge pour les documents dans toutes les langues. Cependant, les descriptions d'images générées sont fournies en anglais, quelle que soit la langue du document d'origine.

L'extraction sémantique de paires clé-valeur est officiellement prise en charge pour les langues suivantes :

  • Chinois
  • Anglais
  • Français
  • Allemand
  • Italien
  • Japonais
  • Portugais
  • Espagnol

Lorsque vous utilisez l'API, indiquez le code de langue correspondant ou le script pris en charge par la reconnaissance optique de caractères (OCR).

Restrictions

  • Vous pouvez extraire du texte à partir de types de fichiers d'entrée spécifiques et stocker le résultat extrait dans certains types de fichiers. Tous les types de fichiers d'entrée ne peuvent pas être extraits dans tous les formats de sortie pris en charge. Le tableau suivant indique quel type de fichier d'entrée est compatible avec les différents formats de sortie :

    Compatibilité entre le type de fichier d'entrée et le format de sortie extrait pour l'API d'extraction de texte
    Type de fichier d'entrée Formats de fichiers de sortie compatibles
    PDF programmatique Tous les formats
    PDF scanné Tous les formats
    Avancée Tous les formats
    Fichier Microsoft PowerPoint Tous les formats
    Fichier Microsoft Word Tous les formats
    Démarque Tous les formats
    Fichier Microsoft Excel Markdown, JSON, texte brut
    fichier HTML Markdown, JSON, texte brut
  • Les résultats de l'extraction des paires clé-valeur ne sont fournis que dans le format de sortie « assembly »; par conséquent, les données de ces paires ne sont pas incluses dans les formats de sortie HTML, Markdown ou texte brut.

Façons de travailler

Vous devez générer des identifiants pour vous authentifier auprès des API d' watsonx.ai. Pour plus d'informations, consultez la section « Génération d'un jeton porteur ».

Ces méthodes programmatiques vous permettent d'extraire du texte des documents stockés dans votre projet watsonx.ai :

API REST

Vous pouvez extraire du texte des fichiers dans IBM watsonx.ai de manière programmatique en utilisant la méthode d'extraction de texte de l'API REST watsonx.ai.

Pour plus d'informations sur la personnalisation d'une demande d'extraction de texte, voir Paramètres d'extraction de texte.

Pour plus de détails sur les méthodes de l'API, voir la documentation de référence de l'API watsonx.ai.

Python

Vous pouvez extraire du texte des fichiers dans IBM watsonx.ai de manière programmatique en utilisant la bibliothèque Python.

Voir la classe TextExtractionsV2 de la bibliothèque watsonx.ai Python.

Essayez l'exemple de carnet de notes : Utilisez le service d'extraction de texte watsonx.ai V2 pour extraire le texte d'un fichier.

Node.js

Vous pouvez extraire du texte des fichiers dans IBM watsonx.ai de manière programmatique en utilisant le SDK Node.js. Pour obtenir plus d'informations, consultez les ressources suivantes :

Pour en savoir plus, consultez l' exemple de code.

En savoir plus