Details zur Umsetzung der Datenimputation bei Zeitreihen-Experimenten

Die Experimenteinstellungen für die Datenimputation in Zeitreihenexperimenten.

Datenimputationsmethoden

Wenden Sie eine dieser Datenimputationsmethoden in Experimenteinstellungen an, um fehlende Werte in einem Dataset bereitzustellen.

Datenimputationsmethoden für Klassifizierungs-und Regressionsexperimente
Imputationsverfahren Beschreibung
FlattenIterative Zeitreihendaten werden zuerst abgeflacht, dann werden fehlende Werte mit dem iterativen Imputer von Scikit-learn imputiert.
Linear Lineare Interpolationsmethode wird verwendet, um den fehlenden Wert zu imputieren.
Kubisch Kubische Interpolationsmethode wird verwendet, um den fehlenden Wert zu imputieren.
Zurück Fehlender Wert wird mit dem vorherigen Wert imputiert.
Weiter Fehlender Wert wird mit dem nächsten Wert imputiert.
Füllung Fehlender Wert wird mithilfe eines benutzerdefinierten Werts, eines Stichprobenmittelwerts oder eines Stichprobenmedian imputiert.

Eingabeeinstellungen

Mit diesen Befehlen wird die Datenimputation für Zeitreihenexperimente in einem Notebook unterstützt.

Datenimputationsmethoden für Zeitreihenexperimente
Ihren Namen Beschreibung Wert DefaultValue
use_imputation Flag zum Ein-oder Ausschalten der Imputation. Richtig oder falsch Ja
Liste der Imputatoren Liste der zu suchenden Imputernamen (Zeichenfolgen). Wenn keine Liste angegeben wird, werden alle Standard-Imputatoren durchsucht. Wird eine leere Liste übergeben, werden alle Imputatoren durchsucht. "FlattenIterative", „Linear“, „Kubisch“, „Zurück“, „Füllen“, „Weiter“ "FlattenIterative", „Linear“, „Kubisch“, „Zurück“
imputer_fill_type Kategorien des „Fill“-Imputers „Mittelwert“/„Median“/„Wert“ "wert"
imputer_fill_value Ein einziger numerischer Wert, der für alle fehlenden Werte eingetragen werden soll. Dies gilt nur, wenn „imputer_fill_type“ auf „value“ gesetzt ist. Wird ignoriert, wenn für „imputer_fill_type“ „mean“ oder „median“ angegeben ist. (Negative Unendlichkeit, Positive Unendlichkeit) 0
Zurechnungsschwelle Schwellenwert für die Imputation. Der Anteil der fehlenden Werte darf in keiner Spalte den Schwellenwert überschreiten. Andernfalls kommt es zu einem Fehler. (0, 1) 0.25

Hinweise zur Verwendung von use_imputation

  • Wenn die Methode use_imputation als True angegeben ist und die Eingabedaten fehlende Werte enthalten:

    • imputation_threshold tritt in Kraft.
    • Die Imputationskandidaten in imputer_list würden zur Suche nach dem besten Imputator herangezogen.
    • Wenn der beste Imputer Fillist, werden imputer_fill_type und imputer_fill_value angewendet; andernfalls werden sie ignoriert.
  • Wenn die Methode use_imputation als True angegeben ist und die Eingabedaten keine fehlenden Werte aufweisen:

    • imputation_threshold wird ignoriert.
    • Imputer-Kandidaten in imputer_list werden für die Suche nach dem besten Imputer verwendet. Wenn der beste Imputer Fillist, werden imputer_fill_type und imputer_fill_value angewendet; andernfalls werden sie ignoriert.
  • Wenn die Methode use_imputation als False angegeben ist, die Eingabedaten jedoch fehlende Werte enthalten:

    • use_imputation wird mit einer Warnung aktiviert, dann folgt die Methode dem Verhalten für das erste Szenario.
  • Wenn die Methode use_imputation als False angegeben ist und die Eingabedaten keine fehlenden Werte enthalten, ist keine weitere Verarbeitung erforderlich.

Zum Beispiel:

"pipelines": [
      {
        "id": "automl",
        "runtime_ref": "hybrid",
        "nodes": [
          {
            "id": "automl-ts",
            "type": "execution_node",
            "op": "kube",
            "runtime_ref": "automl",
            "parameters": {
              "del_on_close": true,
              "optimization": {
	          "target_columns": [2,3,4],
	          "timestamp_column": 1,
	          "use_imputation": true
              }
            }
          }
        ]
      }
    ]