Laboratoire de règles
Le « Rule Lab » est un outil interactif intégré à Text Analytics Workbench. Vous le trouverez dans l'onglet « Éditeur de ressources ». Utilisez-le pour tester et affiner les règles d'analyse des liens textuels (TLA) avant de les appliquer à l'ensemble de vos données.
Si vous souhaitez créer de nouvelles règles de liens textuels ou comprendre comment certaines phrases sont identifiées lors de l'analyse des liens textuels, vous pouvez utiliser un extrait de texte pour effectuer des simulations avec ces règles. Vous pouvez effectuer des simulations dans le laboratoire de règles. Il offre un environnement de test qui vous permet de vérifier la façon dont vos règles TLA s'appliquent à des exemples de données textuelles. Le « Rule Lab » vous aide à comprendre le comportement des règles et à les affiner afin de vous assurer qu'elles reflètent bien les schémas que vous souhaitez. Vous pouvez utiliser Rule Lab pour modifier rapidement les règles et relancer des simulations afin d'améliorer la correspondance des modèles sans avoir à traiter l'intégralité de votre ensemble de données.
Utilisation du laboratoire « Rule »
Pour effectuer des tests dans le laboratoire de règles, saisissez des données textuelles d'exemple, puis lancez le processus d'extraction sur cet échantillon. Le laboratoire Rule utilise le même ensemble de ressources linguistiques et les mêmes paramètres d'extraction que le processus d'analyse des liens en texte intégral. Ces paramètres similaires permettent de garantir que les résultats des tests reflètent fidèlement la manière dont les règles seront ensuite appliquées à l'ensemble de vos données. Vous pouvez ensuite consulter les résultats de l'analyse des liens textuels pour le texte d'exemple afin de mieux comprendre comment s'effectue la mise en correspondance.
Au cours du processus d'extraction, le texte de l'échantillon est décomposé en phrases. Ces phrases sont ensuite décomposées en tokens. Vos règles TLA sont ensuite appliquées pour identifier les motifs correspondants dans le texte tokenisé. Les résultats finaux indiquent les tokens de chaque échantillon ainsi que les règles TLA qui correspondent à un motif extrait du texte.
- Jetons
Les tokens sont des mots ou des expressions identifiés au cours du processus d'extraction. Par exemple, dans la phrase My uncle works in New York, les éléments suivants pourraient être identifiés lors de l'extraction : my, uncle, works in,, et new york. De même, uncle pourrait être extrait en tant que concept et saisi sous la forme
<Unknown>, et new york pourrait également être extrait en tant que concept et saisi sous la forme<Location>. Tous les concepts sont des entités, mais toutes les entités ne sont pas des concepts. Les jetons peuvent également être d'autres macros, des chaînes littérales et des mots non extraits. Seuls les mots ou les expressions tapés peuvent constituer des concepts.- Macros
Une macro est un ensemble réutilisable d'éléments de règles d'analyse de liens textuels qui combine des types, des chaînes littérales, d'autres macros et des valeurs similaires à l'aide de
ORl'opérateur (|). La valeur d'une macro est sensible à la cassemChaque macro porte un nom unique, précédé d'un «. » en minuscules, par exemplemTopic. Lorsqu'une règle d'analyse des liens textuels fait référence à une macro, le nom de cette dernière est précédé du préfixe$« », par exemple$mTopic. Le nom de la macro est sensible à la casse.Vous réutilisez des macros dans plusieurs règles TLA. Si vous créez des règles TLA à l'aide de macros, cela peut vous aider à simplifier ces règles en décomposant les règles complexes en éléments réutilisables. Vous pouvez alors mettre à jour la logique commune dans une seule macro au lieu de modifier plusieurs règles TLA.
Création de nouvelles règles TLA
Vous pouvez générer automatiquement de nouvelles règles à partir des résultats de la simulation en cliquant sur « Générer une règle ». La nouvelle règle utilise les tokens et les types réels identifiés dans votre exemple de texte. SPSS Modeler procède comme suit pour créer la nouvelle règle TLA :
- Il utilise le texte d'exemple comme illustration de la règle TLA.
- Il utilise automatiquement les six premiers tokens correspondants pour générer la sortie de manière séquentielle. Cette automatisation vous évite d'avoir à saisir manuellement les informations de base de la règle. Toutefois, cette règle devra probablement faire l'objet de modifications supplémentaires.
Par exemple, dans la phrase « Pas de télévision, d'Internet ni de Wi-Fi », chaque token est analysé (
<wifi><or><internet><,><TV><no><provided>). Ces tokens sont ensuite classés par type et utilisés dans le résultat de la règle, dans l'ordre exact où ils apparaissent :#@# no TV, internet or wifi provided [pattern(40)] name=generated_rule_40 value=$mMiscNeg $mTopic $SEP $mTopic $mCoord $mTopic $mSupport output(1)=$1\t#1\t$2\t#2\t$3\t#3\t$4\t#4\t$5\t#5\t$6\t#6 - Il insère dans la définition de la règle les jetons qui ont été saisis ou associés à des macros au cours de la simulation.
- Elle donne la priorité aux macros par rapport aux valeurs de type lorsqu'un token correspond aux deux, ce qui simplifie la structure des règles. Par exemple, dans la phrase « J'aime la pizza », le mot « pizza » est saisi sous la forme
<Unknown>et est associé à la macromTopic. Dans ce cas,mTopicest utilisé comme élément de la règle générée.
Une fois la règle créée, vous pouvez vérifier qu'elle correspond bien au modèle en retournant dans le « Rule lab » pour tester la nouvelle règle sur votre échantillon.