GUI-Operationen in Data Refinery

Data Refinery unterstützt die folgenden Kategorien von GUI-Operationen:

Klicken Sie auf „Neuer Schritt“, um einen GUI-Vorgang auszuwählen.

Ein Teil der Funktionen ist über das Überlauf -Symbol jeder Spalte Überlaufmenü verfügbar. Sie können eine Spalte umbenennen, indem Sie auf das Bear beitungssymbol Symbol „Bearbeiten“ in der Spaltenüberschrift klicken.

CLEANSE (BEREINIGEN)

Spaltentyp
konvertieren Wenn Sie eine Datei in „ Data Refinery “ öffnen, wird im ersten Schritt automatisch die Funktion „Spaltentyp konvertieren“ angewendet, sofern in den Daten Datentypen erkannt werden, die keine Zeichenfolgen sind. Datentypen werden automatisch in abgeleitete Datentypen konvertiert. Um die automatische Konvertierung für eine ausgewählte Spalte zu ändern, klicken Sie auf das Über laufsymbol Überlaufmenü für den Schritt und wählen Sie „Bearbeiten “. Wie bei jeder anderen Operation auch können Sie den Schritt rückgängig machen. Die Operation Convert column type (Spaltentyp konvertieren) wird bei jedem Öffnen der Datei in Data Refinery erneut angewendet. Die automatische Konvertierung wird nur bei Bedarf auf dateibasierte Datenquellen angewendet. (Dies gilt nicht für eine Datenquelle aus einer Datenbankverbindung.)

Um zu überprüfen, in welchen Datentyp die Daten jeder Spalte konvertiert wurden, wählen Sie über das Überlauf -Symbol die Option Überlaufmenü „Bearbeiten“ aus, um die Datentypen anzuzeigen. Die Informationen umfassen das Format für Datums- oder Zeitstempeldaten.

Wenn die Daten in einen Datentyp 'Integer' oder 'Decimal' konvertiert werden, können Sie das Dezimalzeichen und das Tausendertrennzeichen für alle zutreffenden Spalten angeben. Zeichenfolgen, die in den Datentyp 'Decimal' konvertiert werden, verwenden einen Punkt als Dezimalzeichen und ein Komma als Tausendertrennzeichen. Alternativ können Sie das Komma als Dezimalzeichen und den Punkt als Tausendertrennzeichen auswählen. Das Dezimalzeichen und das Tausendertrennzeichen dürfen nicht identisch sein.

Ganzzahlwerte aus Microsoft Excel-Dateien werden möglicherweise als Dezimalzahlen interpretiert. Dies ist das erwartete Verhalten, und die tatsächlichen Werte werden nicht konvertiert. Optional können Sie den Spaltentyp manuell in „Integer“ umwandeln, indem Sie die Funktion „Spaltentyp konvertieren“ verwenden.

Die Quellendaten werden von links nach rechts gelesen, bis ein Abschlusszeichen oder ein unbekanntes Zeichen auftritt. Wenn Sie beispielsweise die Zeichenfolgedaten 12,834 in den Datentyp 'Decimal' konvertieren und nicht angeben, wie das Komma gehandhabt werden soll, werden die Daten auf 12 abgeschnitten. Wenn die Quellendaten mehrere Punkte (.) enthalten und Sie den Punkt als Dezimalzeichen auswählen, wird der erste Punkt als Dezimaltrennzeichen verwendet und die auf den zweiten Punkt folgenden Ziffern werden abgeschnitten. Eine Quellzeichenfolge von 1.834.230,000 wird in den Wert 1.834umgewandelt.

Die Operation Convert column type (Spaltentyp konvertieren) konvertiert die folgenden Datums- und Zeitmarkenformate automatisch:

  • Datum: ymd, ydm
  • Zeitmarke: ymdHMS, ymdHM, ydmHMS, ydmHM

Datums- und Zeitstempel-Zeichenfolgen müssen das Jahr vierstellig angeben.

Durch manuelles Anwenden der Operation Convert column type (Spaltentyp konvertieren) können Sie den Datentyp einer Spalte an jeder beliebigen Stelle im Data Refinery-Ablauf ändern. Sie können eine neue Spalte erstellen, die künftig das Ergebnis dieser Operation enthält, oder Sie lassen die vorhandene Spalte überschreiben.

Tipp: Der Datentyp einer Spalte bestimmt, welche Operationen Sie verwenden können. Eine Änderung des Datentyps kann sich darauf auswirken, welche Operationen für die betreffende Spalte relevant sind.


Video: Vorgang „Spaltentyp konvertieren“

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Durch die Operation des Spaltentyps „Convert“ wurde die erste Spalte automatisch von „String“ in „Integer“ umgewandelt. Ändern wir nun die Datentypen der anderen drei Spalten.
  2. Um den Datentyp der Spalte „european“ von „Zeichenkette“ in „Dezimal“ zu ändern, wählen Sie die Spalte aus und bearbeiten Sie anschließend den Schritt „Spaltentyp konvertieren“.
  3. Um den Datentyp der Spalte „european“ von „Zeichenkette“ in „Dezimal“ zu ändern, wählen Sie die Spalte aus und bearbeiten Sie anschließend den Schritt „Spaltentyp konvertieren“.
  4. Wählen Sie „Dezimal“ aus.
  5. Da die Spalte das Komma als Trennzeichen verwendet, wählen Sie bitte „Komma (,)” als Dezimalzeichen aus.
  6. Wählen Sie die nächste Spalte aus: DATETIME. Wählen Sie einen Zeitstempel und ein Format aus.
  7. Klicken Sie auf Apply.
  8. Die Spalten haben nun die Datentypen „Integer“, „Decimal“, „Date“ und „Timestamp“. Der Schritt „Spaltentyp konvertieren“ im Bereich „Schritte“ wurde aktualisiert.

Spaltenwert in fehlenden Wert umwandeln Werte in
der ausgewählten Spalte werden in fehlende Werte umgewandelt, wenn sie mit Werten in der angegebenen Spalte übereinstimmen oder einem bestimmten Wert entsprechen.


Video: Operation „Spaltenwert in fehlenden Wert umwandeln“

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Die Operation „Spaltenwert in fehlenden Wert umwandeln“ wandelt die Werte in einer ausgewählten Spalte in fehlende Werte um, wenn sie mit den Werten in einer angegebenen Spalte übereinstimmen oder wenn sie einem angegebenen Wert entsprechen.
  2. Ein fehlender Wert entspricht einem SQL-NULL-Wert, also einem Feld ohne Wert. Es unterscheidet sich von einem Wert von Null oder einem Wert, der Leerzeichen enthält.
  3. Sie können die Funktion „Spaltenwert in fehlende Werte umwandeln“ verwenden, wenn Sie der Meinung sind, dass die Daten besser als fehlende Werte dargestellt werden sollten. Beispielsweise, wenn Sie fehlende Werte in einer Operation zum Ersetzen fehlender Werte oder in einer Filteroperation verwenden möchten.
  4. Verwenden wir die Funktion „Spaltenwert in fehlenden Wert umwandeln“, um Werte basierend auf einem übereinstimmenden Wert in fehlende Werte umzuwandeln.
  5. Beachten Sie, dass die Spalte „DESC“ viele Zeilen mit dem Wert „CANCELLED ORDER“ enthält. Lassen Sie uns die Zeichenfolgen „CANCELLED ORDER“ in fehlende Werte umwandeln.
  6. Die Funktion „Spaltenwert in fehlenden Wert umwandeln“ befindet sich in der Kategorie „CLEANSE“.
  7. Geben Sie die Zeichenfolge ein, die durch fehlende Werte ersetzt werden soll.
  8. Die Werte, die zuvor als „Auftrag storniert“ gekennzeichnet waren, sind nun fehlende Werte.

Datums- oder Zeitwert
extrahieren Extrahieren Sie einen ausgewählten Teil eines Datums- oder Zeitwerts aus einer Spalte mit dem Datentyp „Datum“ oder „Zeitstempel“.


Video: Vorgang „Datums- oder Zeitwert extrahieren“

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Die Operation „Datums- oder Zeitwert extrahieren“ extrahiert einen ausgewählten Teil eines Datums- oder Zeitwerts aus einer Spalte, die den Datentyp „Datum“ oder „Zeitstempel“ hat.
  2. Die Spalte „DATE“ hat den Datentyp „Zeichenkette“. Zunächst wandeln wir den Datentyp mithilfe der Operation „Spaltentyp konvertieren“ in den Datentyp „Datum“ um.
  3. Wählen Sie im Menü der Spalte „DATE“ die Option „Spaltentyp konvertieren“ aus. Datum auswählen.
  4. Wählen Sie ein Datumsformat aus.
  5. Die Spalte „DATE“ ist nun vom Datentyp „Datum“.
  6. Das ISO-Datumsformat wird verwendet, wenn der Datentyp „String“ in den Datentyp „Date“ konvertiert wurde. Beispielsweise wurde die Zeichenfolge „01/08/2018“ in das Datum „2018-01-08“ umgewandelt.
  7. Nun können wir den Jahresteil des Datums in eine neue Spalte extrahieren.
  8. Die Operation „Datum- oder Zeitwert extrahieren“ befindet sich in der Kategorie „CLEANSE“.
  9. Wählen Sie „Jahr“ als den zu extrahierenden Teil des Datums aus und geben Sie „YEAR“ als Namen für die neue Spalte ein.
  10. Der Jahresanteil der Spalte „DATE“ befindet sich in der neuen Spalte „YEAR“.
  11. Im Bereich „Schritte“ wird der Vorgang „Datum oder Uhrzeit extrahieren“ angezeigt.

Filter:
Filtern Sie die Zeilen nach den ausgewählten Spalten. Sie können Zeilen mit ausgewählten Spaltenwerten beibehalten und alle anderen Zeilen herausfiltern.

Setzen Sie bei diesen String -Filter operatoren den Wert nicht in Anführungszeichen. Wenn der Wert Anführungszeichen enthält, müssen diese mit einem Schrägstrich maskiert werden. Zum Beispiel: \"text\":

  • Enthält
  • Enthält nicht
  • Beginnt mit
  • Beginnt nicht mit
  • Beenden mit
  • Endet nicht mit

Im Folgenden sind die Operatoren für numerische, Zeichenfolgen- und boolesche (logische) sowie Datums- und Zeitstempel-Spalten aufgeführt:

Bediener Numerisch Zeichenfolge boolesch Datum und Zeitmarke
Enthält
Enthält nicht
Endet nicht mit
Beginnt nicht mit
Endet mit
Liegt zwischen zwei Werten
Ist leer
Ist gleich
Ist falsch
Ist größer als
Ist größer oder gleich
Ist in
Ist kleiner als
Ist kleiner oder gleich
Ist nicht leer
Ist nicht gleich
Ist nicht in
Ist nicht null
Ist Null
Ist wahr
Beginnt mit

Video: Funktionsweise des Filters

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Verwenden Sie die Filterfunktion, um Zeilen nach den ausgewählten Spalten zu filtern. Sie können mehrere Bedingungen in einem Filtervorgang anwenden.
  2. Verwenden Sie einen regulären Ausdruck, um alle Zeilen herauszufiltern, außer denen, bei denen die Zeichenfolge in der Spalte „Emp ID“ mit 8 beginnt.
  3. Filtere die Zeilen nach den Abkürzungen zweier Bundesstaaten.
  4. Klicken Sie auf Apply. Die Tabelle enthält nur die Zeilen, bei denen die Mitarbeiter-ID mit 8 beginnt und der Bundesstaat AR oder TX ist.
  5. Die Zeilen sind nun nach AR und PA gefiltert. Der Schritt „Filter“ im Bereich „Schritte“ wird aktualisiert.

Spalte entfernen Die
ausgewählte Spalte entfernen.


Video: Vorgang „Spalte entfernen“

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Verwenden Sie die Funktion „Spalte entfernen“, um eine Spalte schnell aus einem Datenobjekt zu entfernen.
  2. Am schnellsten lässt sich eine Spalte über das Spaltenmenü entfernen.
  3. Der Name der entfernten Spalte wird im Bereich „Schritte“ angezeigt.
  4. Eine weitere Spalte entfernen.
  5. Der Name der entfernten Spalte wird im Bereich „Schritte“ angezeigt.

Duplikate entfernen – Zeilen mit
doppelten Spaltenwerten entfernen.


Video: Vorgang „Duplikate entfernen“

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Der Vorgang „Duplikate entfernen“ entfernt Zeilen, die doppelte Spaltenwerte enthalten.
  2. Der Datensatz umfasst 43 Zeilen. Viele Zeilen in der Spalte „APPLYCODE“ enthalten doppelte Werte. Wir möchten den Datensatz auf die Zeilen reduzieren, in denen jeder Wert in der Spalte „APPLYCODE“ nur einmal vorkommt.
  3. Wählen Sie im Menü der Spalte „APPLYCODE“ die Funktion „Duplikate entfernen“ aus.
  4. Durch den Vorgang „Duplikate entfernen“ wurde jedes Vorkommen eines doppelten Werts entfernt. Der Datensatz umfasst nun 4 Zeilen.

Leere Zeilen
entfernen Zeilen entfernen, die in der ausgewählten Spalte einen leeren oder fehlenden Wert enthalten.


Video: Vorgang „Leere Zeilen entfernen“

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Der Vorgang „Leere Zeilen entfernen“ entfernt Zeilen, in denen die ausgewählte Spalte einen leeren oder fehlenden Wert enthält.
  2. Ein fehlender Wert entspricht einem SQL-NULL-Wert, also einem Feld ohne Wert. Es unterscheidet sich von einem Wert von Null oder einem Wert, der Leerzeichen enthält.
  3. Der Datensatz umfasst 43 Zeilen. In vielen Zeilen der Spalte „TRACK“ fehlen Werte. Wir möchten den Datensatz auf die Zeilen reduzieren, die einen Wert in der Spalte „TRACK“ enthalten.
  4. Wählen Sie im Menü der Spalte „TRACK“ die Option „Leere Zeilen entfernen“ aus.
  5. Durch den Vorgang „Leere Zeilen entfernen“ wurden alle Zeilen entfernt, die in der Spalte „TRACK“ einen leeren oder fehlenden Wert enthielten. Der Datensatz umfasst nun 21 Zeilen.

Fehlende Werte ersetzen
Ersetzen Sie fehlende Werte in der Spalte durch einen angegebenen Wert oder durch den Wert aus einer angegebenen Spalte in derselben Zeile.


Video: Vorgang „Fehlende Werte ersetzen“

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Die Operation „Fehlende Werte ersetzen“ ersetzt fehlende Werte in einer Spalte durch einen angegebenen Wert oder durch den Wert aus einer angegebenen Spalte in derselben Zeile.
  2. Die Spalte „STATE“ enthält viele Zeilen mit leeren Werten. Wir möchten diese leeren Werte durch eine Zeichenfolge ersetzen.
  3. Die Operation „Fehlende Werte ersetzen“ befindet sich in der Kategorie „BEREINIGEN“.
  4. Ersetzen Sie in der Spalte „Status“ die fehlenden Werte durch den Text „Unvollständig“.
  5. Die fehlenden Werte haben nun den Wert „Unvollständig“.
  6. Im Bereich „Schritte“ wird der Vorgang „Fehlende Werte ersetzen“ angezeigt.

Teilstring ersetzen
: Ersetzt den angegebenen Teilstring durch den angegebenen Text.


Video: Operation „Teilzeichenfolge ersetzen“

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Mit der Funktion „Teilstring ersetzen“ wird ein Teilstring durch einen von Ihnen angegebenen Text ersetzt.
  2. Die Spalte „DECLINE“ enthält viele Zeilen, die die Zeichenfolge „BANC“ enthalten. Wir möchten diese Zeichenfolge durch „BANK“ ersetzen.
  3. Die Operation „Teilstring ersetzen“ befindet sich in der Kategorie „CLEANSE“.
  4. Geben Sie die zu ersetzende Zeichenfolge und die Ersatzzeichenfolge ein.
  5. Alle Vorkommen der Zeichenfolge „BANC“ wurden durch „BANK“ ersetzt.
  6. Im Bereich „Schritte“ wird die Operation „Teilstring ersetzen“ angezeigt.

Verbergen Sie
vertrauliche Informationen, indem Sie die tatsächlichen Daten in der ausgewählten Spalte durch eine zufällige Zeichenfolge ersetzen.


Video: Substitutionsoperation

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Die Operation „Ersetzen“ verschleiert sensible Informationen, indem sie die Daten in der ausgewählten Spalte durch eine zufällige Zeichenfolge ersetzt.
  2. Der schnellste Weg, die Daten in einer Spalte zu ersetzen, ist, im Menü der Spalte die Option „Ersetzen“ auszuwählen.
  3. Der Ersetzungsvorgang wird im Schritt-Fenster angezeigt.
  4. Ersetze die Werte in einer anderen Spalte.
  5. Der zweite Ersetzungsvorgang wird im Schritt-Fenster angezeigt.

Text

Sie können Textoperationen nur auf Zeichenfolgespalten anwenden. Sie können eine neue Spalte erstellen, um das Ergebnis einer Operation zu speichern, oder Sie können die vorhandene Spalte überschreiben.

Text > Leerzeichen zusammenfassen Mehrere aufeinanderfolgende
Leerzeichen im Text zu einem einzigen Leerzeichen zusammenfassen.

Text > Zeichenfolge verketten Füge beliebige
Zeichenfolgen an den Text an. Sie können die Zeichenfolge dem Text voranstellen, die Zeichenfolge an den Text anhängen oder beides.

Text > Kleinbuchstaben: Den Text in
Kleinbuchstaben umwandeln.

Text > Zeichenanzahl
Gibt die Anzahl der Zeichen im Text zurück.

Text > Zeichen auffüllen Füllt den Text mit
der angegebenen Zeichenfolge auf. Geben Sie an, ob der Text auf der linken, auf der rechten oder auf beiden Seiten aufgefüllt werden soll.

Text > Teilzeichenfolge
Erzeugt Teilzeichenfolgen aus dem Text, die an der angegebenen Position beginnen und die angegebene Länge haben.

Text > Groß- und Kleinschreibung: Text in Groß-
und Kleinschreibung umwandeln.

Text > Anführungszeichen entfernen
Entfernen Sie einfache oder doppelte Anführungszeichen aus dem Text.

Text > Leerzeichen entfernen
Entfernt führende, nachgestellte und überflüssige Leerzeichen aus dem Text.

Text > Großbuchstaben: Den Text in
Großbuchstaben umwandeln.


Video: Textbearbeitung

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Sie können eine Textoperation auf Zeichenfolgen-Spalten anwenden. Erstellen Sie eine neue Spalte für das Ergebnis oder überschreiben Sie die vorhandene Spalte.
  2. Füge zunächst eine Zeichenfolge an die Werte in der Spalte „WORD“ an.
  3. Verfügbare Textfunktionen.
  4. Füge die Zeichenfolge rechts an, füge ein Leerzeichen hinzu und gib den Text ein.
  5. Den Werten in der Spalte „WORD“ werden ein Leerzeichen und das Wort „up“ angehängt.
  6. Die Textoperation wird im Schritt-Fenster angezeigt.
  7. Als Nächstes fügen Sie den Werten in der Spalte „ANIMAL“ eine Zeichenfolge als Vorzeichen hinzu.
  8. Füllen Sie die Werte in der Spalte „ANIMAL“ rechts mit dem Und-Zeichen (&) auf, bis mindestens 7 Zeichen erreicht sind.
  9. Die Werte in der Spalte „ANIMAL“ werden mit dem Symbol „&“ aufgefüllt, sodass jede Zeichenfolge mindestens sieben Zeichen lang ist.
  10. Beachte, dass die Werte für Opossum, Pangolin, Platypus und Hedgehog kein Auffüllzeichen enthalten, da diese Zeichenfolgen bereits sieben oder mehr Zeichen lang waren.
  11. Verwenden Sie anschließend die Funktion „Substring“, um das Zeichen „t“ aus der Spalte „ID“ zu entfernen.
  12. Wählen Sie Position 2, um die neue Zeichenfolge an dieser Stelle zu beginnen. Wählen Sie „Länge 4“ für eine Zeichenfolge mit vier Zeichen.
  13. Das führende „t“ in der Spalte „ID“ wird in der Spalte „NEW-ID“ entfernt.

BERECHNEN

Berechnen
Führen Sie eine Berechnung mit einer anderen Spalte oder einem bestimmten Wert durch. Die folgenden Operatoren sind verfügbar:

  • Addition
  • Geschäftsbereich
  • Potenzierung
  • Liegt zwischen zwei Werten
  • Ist gleich
  • Ist größer als
  • Ist größer oder gleich
  • Ist kleiner als
  • Ist kleiner oder gleich
  • Ist nicht gleich
  • Modulus
  • Multiplikation
  • Subtraktion

Video: Rechenoperation

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Die Operation „Berechnen“ führt eine Berechnung durch, beispielsweise eine Addition oder Subtraktion, mit einer anderen Spalte oder einem angegebenen Wert.
  2. Wählen Sie die Spalte aus, mit der Sie beginnen möchten.
  3. Verfügbare Berechnungen
  4. Wählen Sie nun die zweite Spalte für die Additionsberechnung aus.
  5. Und übernehmen Sie die Änderung.
  6. Die Spalte „ID“ wird aktualisiert, und im Bereich „Schritte“ wird der abgeschlossene Vorgang angezeigt.
  7. Sie können die Funktionen auch über das Menü der Spalte aufrufen.
  8. Wählen Sie diesmal „Liegt zwischen zwei Zahlen“ aus. Geben Sie den Bereich an und erstellen Sie eine neue Spalte für die Ergebnisse.
  9. Die neue Spalte wird in der Tabelle angezeigt, und die neue Berechnungsoperation wird im Bereich „Schritte“ angezeigt.
  10. Wählen Sie diesmal „Ist gleich“ aus, um zwei Spalten zu vergleichen, und erstellen Sie eine neue Spalte für die Ergebnisse.
  11. Die neue Spalte wird in der Tabelle angezeigt, und die neue Berechnungsoperation wird im Bereich „Schritte“ angezeigt.

Mathematische Operationen

Sie können mathematische Operationen nur auf numerische Spalten anwenden. Sie können eine neue Spalte erstellen, um das Ergebnis einer Operation zu speichern, oder Sie können die vorhandene Spalte überschreiben.

Mathematik > Absolutwert
Berechne den Absolutwert einer Zahl.
Beispiel: Der Absolutwert von 4 und -4 ist 4.

Mathematik > Arkuskosinus
Berechne den Arkuskosinus eines Winkels.

Mathematik > Ceiling
Ermittelt die nächste ganze Zahl mit dem höheren Wert, auch als „Ceiling“ der Zahl bezeichnet.
Beispiele: Die Obergrenze von 2.31 beträgt 3. Die Obergrenze für „ -2.31 “ liegt bei -2.

Mathematik > Potenz
Berechnet eine Zahl, die mit dem Wert der Spalte potenziert wird.

Mathematik > Floor
Ermittelt die nächstkleinere ganze Zahl, auch als „Floor“ der Zahl bezeichnet.
Beispiel: Der Boden von „ 2.31 “ ist 2. Die Website von „ -2.31 “ lautet -3.

Mathematik > Runden
Ermittelt die ganze Zahl, die dem Spaltenwert am nächsten liegt. Ist der Spaltenwert eine Ganzzahl, wird dieser zurückgegeben.

Mathematik > Quadratwurzel
Berechne die Quadratwurzel des Spaltenwerts.


Video: Rechenoperation

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Wende eine mathematische Operation auf die Werte in einer Spalte an. Erstellen Sie eine neue Spalte für die Ergebnisse oder überschreiben Sie die vorhandene Spalte.
  2. Verfügbare mathematische Operationen
  3. Wende den Absolutwert auf die Werte der Spalte an.
  4. Erstelle eine neue Spalte für die Ergebnisse.
  5. Die neue Spalte wird der Tabelle hinzugefügt, und die mathematische Operation wird im Schritt-Fenster angezeigt.
  6. Sie können den Vorgang auch über das Menü der Spalte aufrufen.
  7. Wende die Rundungsfunktion auf die Werte der Spalte „ANGLE“ an.
  8. Erstellen Sie eine neue Spalte für die Ergebnisse.
  9. Die neue Spalte wird der Tabelle hinzugefügt, und die neue mathematische Operation wird im Schritt-Fenster angezeigt.

ORGANIZE (ORGANISIEREN)

Aggregieren:
Führen Sie zusammenfassende Berechnungen auf die Werte einer oder mehrerer Spalten an. Mit jeder Aggregation wird eine neue Spalte erstellt. Optional können Sie „Nach Spalten gruppieren“ auswählen, um die neue Spalte nach einer anderen Spalte zu gruppieren, die ein Merkmal der Gruppe definiert, beispielsweise eine Abteilung oder eine ID. Zum Gruppieren dieser Art können mehrere Spalten verwendet werden. Sie können mehrere Aggregationen in einer einzigen Operation miteinander kombinieren.

Welche Aggregatoperationen verfügbar sind, hängt jeweils vom Datentyp ab.

Numerische Daten:

  • Count unique values (Eindeutige Werte zählen)
  • Minimum
  • Maximum
  • Summe
  • Standardabweichung
  • Mittelwert

Zeichenfolgedaten:

  • Combine row values (Zeilenwerte kombinieren)
  • Count unique values (Eindeutige Werte zählen)

Video: Betrieb der Aufbereitungsanlage

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Die Aggregatfunktion wendet Zusammenfassungsberechnungen auf die Werte einer oder mehrerer Spalten an. Mit jeder Aggregation wird eine neue Spalte erstellt.
  2. Die verfügbaren Aggregationen hängen davon ab, ob es sich um numerische Daten oder Zeichenfolgen handelt.
  3. Die verfügbaren Operatoren hängen vom Datentyp der Spalte ab. Verfügbare Operatoren für numerische Daten.
  4. Wenn die Textspalte „ UniqueCarrier “ ausgewählt ist, werden die für Zeichenfolgendaten verfügbaren Operatoren angezeigt.
  5. Wir werden zählen, wie viele eindeutige Werte die Spalte „ UniqueCarrier “ enthält. Diese Zusammenfassung zeigt, wie viele Fluggesellschaften im Datensatz enthalten sind.
  6. In der neuen Spalte „Fluggesellschaften“ sind 22 Fluggesellschaften aufgeführt. Die übrigen Spalten werden gelöscht.
  7. Die Aggregatfunktion wird im Bereich „Schritte“ angezeigt.
  8. Fangen wir noch einmal von vorne an, um eine Aggregation numerischer Daten zu veranschaulichen.
  9. Geben Sie den Durchschnitt (Mittelwert) der Ankunftsverspätungen an.
  10. Der Durchschnittswert aller Ankunftsverspätungen ist in der neuen Spalte „ MeanArrDelay “ zu finden. Die übrigen Spalten werden gelöscht.
  11. Sie können die aggregierte Spalte auch nach einer anderen Spalte gruppieren, die ein Merkmal der Gruppe definiert.
  12. Bearbeiten wir den Schritt „Aggregieren“, indem wir eine „Gruppieren nach“-Auswahl hinzufügen, damit wir den Durchschnitt der Ankunftsverspätungen nach Fluggesellschaft sehen können.
  13. Gruppiere die Ergebnisse nach der Spalte „ UniqueCarrier “.
  14. Die durchschnittlichen Ankunftsverspätungen sind nun nach Fluggesellschaften geordnet.
  15. Im Bereich „Schritte“ wird die Aggregat-Operation angezeigt.

Verknüpfen
Verknüpfen Sie die Werte von zwei oder mehr Spalten.


Video: Verkettungsoperation

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Die Operation „Verknüpfen“ verknüpft die Werte von zwei oder mehr Spalten.
  2. Die Operation „Concatenate“ befindet sich in der Kategorie „ORGANIZE“.
  3. Wählen Sie die Spalten aus, die Sie verketten möchten.
  4. Wählen Sie ein Trennzeichen aus, das zwischen den verketteten Werten verwendet werden soll.
  5. Geben Sie einen Namen für die Spalte mit den verketteten Werten ein.
  6. Die neue Spalte kann als Spalte ganz rechts im Datensatz oder neben der ursprünglichen Spalte angezeigt werden.
  7. Behalten Sie die ursprünglichen Spalten bei und übernehmen Sie die Änderungen.
  8. Die neue Spalte „DATE“ zeigt die verketteten Werte der anderen drei Spalten, getrennt durch ein Semikolon.
  9. Die Operation „Verknüpfen“ wird im Bereich „Schritte“ angezeigt.
  10. Die Spalte „DATE“ hat den Datentyp „Zeichenkette“. Verwenden wir die Operation „Spaltentyp konvertieren“, um ihn in den Datentyp „Datum“ umzuwandeln.
  11. Wählen Sie im Menü der Spalte „DATE“ die Option „Spaltentyp konvertieren“ aus. Datum auswählen.
  12. Wählen Sie ein Datumsformat aus und erstellen Sie eine neue Spalte für das Ergebnis.
  13. Platzieren Sie die neue Spalte neben der ursprünglichen Spalte und übernehmen Sie die Änderungen.
  14. Die neue Spalte wird im konvertierten Datumsformat angezeigt.
  15. Die Operation für den Spaltentyp „Konvertieren“ wird im Bereich „Schritte“ angezeigt.
  16. Das ISO-Datumsformat wird verwendet, wenn der Datentyp „String“ in den Datentyp „Date“ konvertiert wurde. Beispielsweise wurde die Zeichenfolge „2004;2;3“ in das Datum „2004-02-03“ umgewandelt.

Bedingtes Ersetzen: Ersetzen
Sie die Werte in einer Spalte anhand von Bedingungen.


Video: Operation „Bedingtes Ersetzen“

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Verwenden Sie die Funktion „Bedingtes Ersetzen“, um die Werte in einer Spalte anhand von Bedingungen zu ersetzen.
  2. Zunächst legen wir die Bedingungen fest, unter denen Daten in der Spalte „CODE“ ersetzt werden sollen, und erstellen eine neue Spalte für die Ergebnisse.
  3. Verfügbare Bedingungsoperatoren für Zeichenfolgen.
  4. Füge die erste Bedingung hinzu – BEDINGUNG 1: CODE ist gleich dem Wert C; ersetze dies durch COMPLETE.
  5. Füge eine zweite Bedingung hinzu – BEDINGUNG 2: Wenn CODE dem Wert entspricht, ersetze ich ihn durch „UNVOLLSTÄNDIG“.
  6. Geben Sie an, wie mit Werten verfahren werden soll, die die Bedingungen nicht erfüllen. Hier geben wir zwei doppelte Anführungszeichen ein, um eine leere Zeichenkette anzugeben.
  7. Erstellen Sie eine neue Spalte für die Ergebnisse.
  8. Die neue Spalte „STATUS“ zeigt die bedingten Ersetzungen aus der Spalte „CODE“ an.
  9. Der Vorgang „Bedingtes Ersetzen“ wird im Bereich „Schritte“ angezeigt.
  10. Als Nächstes legen wir Bedingungen fest, um Daten in der Integer-Spalte „INPUT“ zu ersetzen, und erstellen eine neue Spalte für die Ergebnisse.
  11. Verfügbare Bedingungsoperatoren für numerische Daten.
  12. Füge die erste Bedingung hinzu – BEDINGUNG 1: Ist INPUT kleiner oder gleich dem Wert 3, ersetze ihn durch den Wert LOW.
  13. Füge eine zweite Bedingung hinzu – BEDINGUNG 2: Wenn INPUT die Werte 4, 5 oder 6 enthält, ersetze ihn durch den Wert MED.
  14. Füge eine dritte Bedingung hinzu – BEDINGUNG 3: Ist INPUT größer oder gleich dem Wert 7, ersetze ihn durch den Wert HIGH.
  15. Geben Sie an, wie mit Werten verfahren werden soll, die die Bedingungen nicht erfüllen.
  16. Erstellen Sie eine neue Spalte für die Ergebnisse.
  17. Die neue Spalte „RATING“ zeigt die bedingten Ersetzungen aus der Spalte „INPUT“ an.
  18. Der Vorgang „Bedingtes Ersetzen“ wird im Bereich „Schritte“ angezeigt.

K ombinieren
Sie Daten aus zwei Datensätzen auf der Grundlage eines Vergleichs der Werte in bestimmten Schlüsselspalten. Geben Sie an, welcher Typ von Verknüpfung erfolgen soll, wählen Sie die Spalten (Joinschlüssel) in den beiden Datasets aus, die Sie vergleichen möchten, und wählen Sie die Spalten aus, die das als Ergebnis hervorgehende Dataset enthalten soll.

Die Joinschlüsselspalten in den beiden Datasets müssen kompatible Datentypen aufweisen. Wenn die Joinoperation der erste Schritt ist, den Sie hinzufügen, müssen Sie prüfen, ob die Operation Convert column type (Spaltentyp konvertieren) den Datentyp der Joinschlüsselspalten im ersten Dataset automatisch konvertiert hat, als Sie die Datei in Data Refinery geöffnet haben. Je nachdem, an welcher Stelle im Ablauf von „ Data Refinery “ die Ver knüpfungsoperation stattfindet, können Sie zudem die Operation „Spaltentyp konvertieren“ verwenden, um sicherzustellen, dass die Datentypen der Verknüpfungsschlüsselspalten übereinstimmen. Klicken Sie im Bereich „Schritte“ auf einen vorherigen Schritt, um die Momentaufnahme dieses Schritts anzuzeigen.

Es gibt die folgenden Jointypen:

Jointyp Beschreibung
Left join (Linker Join) Gibt alle Zeilen im ursprünglichen Dataset und nur die übereinstimmenden Zeilen in dem für die Verknüpfung verwendeten Dataset zurück. Gibt für jede übereinstimmende Zeile in dem für die Verknüpfung verwendeten Dataset eine Zeile im ursprünglichen Dataset zurück.
Right join (Rechter Join) Gibt alle Zeilen im für die Verknüpfung verwendeten Dataset und nur die übereinstimmenden Zeilen im ursprünglichen Dataset zurück. Gibt für jede übereinstimmende Zeile im ursprünglichen Dataset eine Zeile in dem für die Verknüpfung verwendeten Dataset zurück.
Inner join (Innerer Join) Gibt nur die Zeilen in jedem Dataset zurück, die mit Zeilen in dem anderen Dataset übereinstimmen. Gibt für jede übereinstimmende Zeile in dem für die Verknüpfung verwendeten Dataset eine Zeile im ursprünglichen Dataset zurück.
Full join (Vollständiger Join) Gibt alle Zeilen in beiden Datasets zurück. Vermischt Zeilen im ursprünglichen Dataset mit übereinstimmenden Zeilen in dem für die Verknüpfung verwendeten Dataset.
Semi-Join Gibt nur die Zeilen im ursprünglichen Dataset zurück, die mit Zeilen in dem für die Verknüpfung verwendeten Dataset übereinstimmen. Gibt für alle übereinstimmenden Zeilen in dem für die Verknüpfung verwendeten Dataset eine Zeile im ursprünglichen Dataset zurück.
Anti join (Anti-Join) Gibt nur die Zeilen im ursprünglichen Dataset zurück, die nicht mit Zeilen in dem für die Verknüpfung verwendeten Dataset übereinstimmen.

Video: Zusammenfügen

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Der Datensatz „ customers.csv “ enthält Informationen über die Kunden Ihres Unternehmens, und der Datensatz „ sales.csv “ enthält Informationen über die Vertriebsmitarbeiter Ihres Unternehmens.
  2. Die Datensätze haben die Spalte „SALESREP_ID“ gemeinsam.
  3. Der Datensatz „ customers.csv “ ist unter Data Refinery verfügbar.
  4. Die Join-Operation kann die Daten dieser beiden Datensätze auf der Grundlage eines Vergleichs der Werte in der Spalte „SALESREP_ID“ zusammenführen.
  5. Sie möchten einen Inner Join durchführen, um nur die Zeilen aus jedem Datensatz zurückzugeben, die mit denen des anderen Datensatzes übereinstimmen.
  6. Sie können ein benutzerdefiniertes Suffix hinzufügen, das an Spalten angehängt wird, die in beiden Datensätzen vorhanden sind, um den Quelldatensatz für diese Spalte anzuzeigen.
  7. Wählen Sie den Datensatz „ sales.csv “ aus, um ihn mit dem Datensatz „ customers.csv “ zu verknüpfen.
  8. Geben Sie für den Verknüpfungsschlüssel den Spaltennamen ein, um eine gefilterte Liste anzuzeigen. Die Spalte „SALESREP_ID“ verknüpft die beiden Datensätze.
  9. Wählen Sie als Nächstes die Spalten aus, die Sie einbeziehen möchten. Bei doppelten Spalten wird das Suffix angehängt.
  10. Wenden Sie nun die Änderungen an.
  11. Die Verknüpfungsoperation wird im Schritt-Fenster angezeigt.
  12. Der Datensatz wurde nun um die Spalten aus den Datensätzen „ customers.csv “ und „ sales.csv “ erweitert.

Spalte umbenennen Die
ausgewählte Spalte umbenennen.


Video: Vorgang „Spalte umbenennen“

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Verwenden Sie die Funktion „Spalte umbenennen“, um eine Spalte schnell umzubenennen.
  2. Am schnellsten lässt sich eine Spalte umbenennen, indem man den Spaltennamen in der Tabelle bearbeitet.
  3. Ändere den Namen und drücke die Eingabetaste auf deiner Tastatur.
  4. Der Schritt „Spalte umbenennen“ zeigt den alten und den neuen Namen an.
  5. Benenne nun eine weitere Spalte um.
  6. Im Bereich „Schritte“ ist zu sehen, dass die Spalte „BANKS“ in „DOGS“ umbenannt wurde.
  7. Benenne nun die letzte Spalte um.
  8. Im Bereich „Schritte“ ist zu sehen, dass die Spalte „RATIOS“ in „BIRDS“ umbenannt wurde.

Beispiel
Erstellen Sie mithilfe einer der folgenden Methoden eine Teilmenge Ihrer Daten. Die Stichproben-Schritte aus den UI-Operationen gelten nur, wenn der Ablauf ausgeführt wird.

  • Zufallsstichprobe: Jeder Datensatz der Teilmenge hat die gleiche Wahrscheinlichkeit, ausgewählt zu werden.
  • Geschichtete Stichprobe: Unterteilen Sie die Daten in eine oder mehrere Untergruppen, die als Schichten bezeichnet werden. Erzeugen Sie dann eine Zufallsstichprobe, die Daten aus jeder Untergruppe enthält.

Video: Beispiel für den Betrieb

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Die Funktion „Sample“ erzeugt eine Teilmenge Ihrer Daten.
  2. Verwenden Sie die Funktion „Stichprobe“, wenn Sie über große Datenmengen verfügen und zur Beschleunigung der Prototypenentwicklung mit einer repräsentativen Stichprobe arbeiten möchten.
  3. Die Operation „Sample“ gehört zur Kategorie „ORGANIZE“.
  4. Wählen Sie eine der beiden Methoden zum Erstellen eines Beispiels.
  5. Bei einer Zufallsstichprobe hat jede Zeile die gleiche Wahrscheinlichkeit, in die Stichprobendaten aufgenommen zu werden.
  6. Sie können eine Zufallsstichprobe nach der Anzahl der Zeilen oder nach dem prozentualen Anteil der Daten auswählen.
  7. Eine geschichtete Stichprobe basiert auf einer Zufallsstichprobe. Wie bei einer Zufallsstichprobe legen Sie den Umfang der Stichprobe fest (Anzahl der Zeilen oder Prozentsatz).
  8. Bei einer geschichteten Stichprobe unterteilt man die Daten in eine oder mehrere Untergruppen, die als Schichten bezeichnet werden. Anschließend generieren Sie eine Zufallsstichprobe, die angepasste Daten aus jeder Untergruppe enthält.
  9. Wenn Sie bei „Methode“ die Option „Auto“ wählen, wählen Sie eine Spalte für die Schichten aus.
  10. Wenn Sie „Manuell“ wählen, geben Sie eine oder mehrere Schichten an und legen für jede Schicht Filterbedingungen fest, die die Zeilen in der jeweiligen Schicht definieren.
  11. In diesem Beispiel mit Flugdaten werden wir zwei Schichten erstellen. In einer Schicht werden 50 % der Flüge als Flüge zu Zielflughäfen in New York City definiert, in der zweiten Schicht werden die restlichen 50 % als Flüge mit einer bestimmten Flugstrecke definiert.
  12. Geben Sie im Feld „Details für diese Schicht angeben“ den Prozentsatz der Stichprobe ein, der die Bedingungen repräsentieren soll, die Sie in dieser ersten Schicht festlegen. Die Anteile der einzelnen Schichten müssen zusammen 100 % ergeben.
  13. Verfügbare Operatoren für Zeichenfolgen.
  14. 50 % der Stichprobe werden Zielflughäfen im Großraum New York City haben.
  15. Klicken Sie auf „Speichern“, um die erste Schicht zu speichern.
  16. Die erste Schicht, die als „ Strata0 “ bezeichnet wird, weist eine Bedingung auf. In dieser Schicht müssen 50 % der Stichprobe die Bedingung erfüllen.
  17. Geben Sie im Feld „Details für diese Schicht angeben“ den Prozentsatz der Stichprobe ein, der die Bedingungen repräsentieren soll, die Sie in der zweiten Schicht angeben werden.
  18. Verfügbare Operatoren für numerische Daten.
  19. 50 % der Stichprobe entfallen auf Flüge mit einer Entfernung von mehr als 500 km.
  20. Klicken Sie auf „Speichern“, um die zweite Schicht zu speichern.
  21. Die zweite Schicht, die als „ Strata1 “ bezeichnet wird, weist eine Bedingung auf. In dieser Schicht müssen 50 % der Stichprobe die Bedingung erfüllen.
  22. Wenn Sie mehrere Schichten verwenden, wendet die Operation „Sample“ intern eine Filteroperation mit einer ODER-Bedingung auf die Schichten an. Je nach Daten, Bedingungen und Stichprobengröße können die Ergebnisse bei der Verwendung einer Schicht mit mehreren Bedingungen von denen bei der Verwendung mehrerer Schichten abweichen.
  23. Im Gegensatz zu den anderen Vorgängen unter „ Data Refinery “ ändert der Vorgang „Sample“ den Datensatz erst, nachdem Sie einen Job für den Ablauf „ Data Refinery “ erstellt und ausgeführt haben.
  24. Der Schritt „Sample“ wird im Schritt-Fenster angezeigt.
  25. Der Datensatz umfasst mehr als 10.000 Zeilen.
  26. Speichern Sie den Job für den „ Data Refinery “-Ablauf und erstellen Sie ihn.
  27. Die neue Asset-Datei wird dem Projekt für die Ausgabe des „ Data Refinery “-Ablaufs hinzugefügt.
  28. Öffnen Sie die Ausgabedatei.
  29. Es gibt 10 Zeilen (50 % der Stichprobe), in denen in der Spalte „Dest“ Flughäfen in New York City aufgeführt sind, aber 17 Zeilen in der Spalte „Distance“ mit Werten über 500.
  30. Diese Ergebnisse sind darauf zurückzuführen, dass die Schichten unter einer OR-Bedingung angewendet wurden und es bei den in der ersten Schicht festgelegten Bedingungen zu Datenüberschneidungen kam, da die Zeilen, die nach „Dest“ gefiltert wurden und Flughäfen in New York City enthielten, Entfernungswerte von mehr als 500 aufwiesen.
  31. Die Ausgabedatei unter „ Data Refinery “ zeigt die reduzierte Größe an.

Aufsteigend sortieren Alle Zeilen der Tabelle nach der ausgewählten
Spalte in aufsteigender Reihenfolge sortieren.

Absteigend sortieren Alle Zeilen der Tabelle nach der ausgewählten
Spalte in absteigender Reihenfolge sortieren.


Video: Sortiervorgang

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Sortieren Sie alle Zeilen in einem Datensatz schnell, indem Sie die Zeilen in einer ausgewählten Spalte sortieren.
  2. Am schnellsten lassen sich Spalten über das Spaltenmenü sortieren.
  3. Sie können die Zeilen in aufsteigender oder absteigender Reihenfolge sortieren.
  4. Aufsteigend sortieren.
  5. Die Reihenfolge aller Zeilen in der Tabelle wird durch die Sortieroperation der ersten Spalte aktualisiert.
  6. Der Sortiervorgang wird im Schritt-Fenster angezeigt.
  7. Absteigend sortieren.
  8. Durch die Sortierfunktion der zweiten Spalte wird die Reihenfolge aller Zeilen in der Tabelle geändert.
  9. Der zweite Sortiervorgang wird im Schritt-Fenster angezeigt.
  10. Aufsteigend sortieren.
  11. Durch die Sortierfunktion der dritten Spalte wird die Reihenfolge aller Zeilen in der Tabelle geändert.
  12. Die dritte Sortieroperation wird im Schritt-Fenster angezeigt.

Spalte teilen
Teilen Sie die Spalte nach nicht-alphanumerischen Zeichen, Position, Muster oder Text.

Einschränkung: Die Operation „Split column“ wird nicht unterstützt, wenn Sie einen „ Data Refinery “-Flow auf einem „ Hadoop “-Cluster ausführen.


Video: Vorgang „Spalte teilen“

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Mit der Funktion „Spalte teilen“ wird eine Spalte anhand von nicht-alphanumerischen Zeichen, Text, Mustern oder der Position in zwei oder mehr Spalten aufgeteilt.
  2. Zunächst teilen wir die Spalte „YMD“ in die Spalten „YEAR“, „MONTH“ und „DAY“ auf.
  3. Die Funktion „Spalte teilen“ gehört zur Kategorie „ORGANISIEREN“.
  4. Wählen Sie zunächst die Spalte „YMD“ aus, die Sie aufteilen möchten.
  5. Die Registerkarten bieten vier Optionen für die Aufteilung der Spalte.
  6. DEFAULT verwendet jedes nicht-alphanumerische Zeichen in den Spaltenwerten, um die Spalte zu teilen.
  7. In „TEXT“ wählen Sie ein Zeichen aus oder geben Text ein, um die Spalte zu teilen.
  8. In PATTERN geben Sie einen regulären Ausdruck in R-Syntax ein, um festzulegen, wo die Spalte geteilt werden soll.
  9. Unter „POSITION“ geben Sie an, an welcher Stelle die Spalte geteilt werden soll.
  10. Wir möchten die Spalte „YMD“ anhand des Sternchens (*) aufteilen, da es sich um ein nicht-alphanumerisches Zeichen handelt; daher wählen wir die Registerkarte „DEFAULT“ aus.
  11. Teilen Sie die Spalte „YMD“ in drei neue Spalten auf: „YEAR“, „MONTH“ und „DAY“.
  12. Dem Datensatz werden die drei neuen Spalten „YEAR“, „MONTH“ und „DAY“ hinzugefügt.
  13. Der Vorgang „Spalte teilen“ wird im Schritt-Fenster angezeigt.
  14. Teilen Sie anschließend die Spalte „FLIGHT“ in zwei Spalten auf – eine für den Airline-Code und eine für die Flugnummer. Da Flugliniencodes aus zwei Zeichen bestehen, können wir die Spalte nach Position aufteilen.
  15. Klicken Sie auf die Registerkarte „POSITION“ und geben Sie dann im Feld „Positionen“ die Zahl 2 ein.
  16. Teilen Sie die Spalte „FLIGHT“ in zwei neue Spalten auf: „AIRLINE“ und „FLTNMBR“.
  17. Die beiden neuen Spalten „AIRLINE“ und „FLIGHTNBR“ werden dem Datensatz hinzugefügt.
  18. Der Vorgang „Spalte teilen“ wird im Schritt-Fenster angezeigt.

Vereinigen
Fügt die Zeilen aus zwei Datensätzen zusammen, die dasselbe Schema haben, und filtert die Duplikate heraus. Wenn Sie Allow a different number of columns and allow duplicate values (Abweichend Anzahl Spalten und doppelte Werte zulassen) auswählen, entspricht die Operation einem UNION ALL-Befehl.


Video: Gewerkschaftsaktion

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Die Union-Operation vereint die Zeilen aus zwei Datensätzen, die dasselbe Schema aufweisen.
  2. Dieser Datensatz umfasst vier Spalten und sechs Zeilen. Die Datentypen von links nach rechts sind String, String, Decimal, String.
  3. Als der Datensatz in „ Data Refinery “ geladen wurde, hat die Funktion „AUTOMATIC Convert column type“ die Spalte „PRICE“ automatisch in den Datentyp „Decimal“ konvertiert.
  4. Die Spalten im zweiten Datensatz müssen mit den Datentypen in diesem Datensatz kompatibel sein.
  5. Wählen Sie den Datensatz aus, den Sie mit dem aktuellen Datensatz zusammenführen möchten.
  6. Wenn Sie eine Vorschau des neuen Datensatzes anzeigen, sehen Sie, dass er ebenfalls vier Spalten enthält. Die Spalte „PRICE“ hat jedoch den Datentyp „String“.
  7. Bevor Sie die Verknüpfung „Vereinigen“ anwenden, müssen Sie den Schritt „Spaltentyp automatisch konvertieren“ löschen, damit die Spalte „PRICE“ denselben Datentyp wie die Spalte „PRICE“ im neuen Datensatz hat (Zeichenkette).
  8. Die Spalte „PRICE“ enthält nun Zeichenfolgen.
  9. Wiederhole nun die Vereinigungsoperation.
  10. Der neue Datensatz wird dem aktuellen Datensatz hinzugefügt. Der Datensatz wird auf 12 Zeilen erweitert.
  11. Die Verknüpfungsoperation wird im Bereich „Schritte“ angezeigt.
  12. Fügen Sie nun einen Datensatz hinzu, der eine andere Anzahl von Spalten hat. Die entsprechenden Spalten müssen weiterhin kompatible Datentypen aufweisen.
  13. Wählen Sie den Datensatz aus, den Sie mit dem aktuellen Datensatz zusammenführen möchten.
  14. Wenn Sie eine Vorschau des neuen Datensatzes anzeigen, sehen Sie, dass er eine Spalte mehr enthält als der ursprüngliche Datensatz. Die fünfte Spalte ist „TYPE“.
  15. Wählen Sie „Andere Spaltenanzahl zulassen“ und „Doppelte Werte zulassen“.
  16. Wende die Vereinigungsoperation an.
  17. Der neue Datensatz wird dem aktuellen Datensatz hinzugefügt. Der Datensatz wurde auf 18 Zeilen erweitert.
  18. Dem Datensatz wird die zusätzliche Spalte „TYPE“ hinzugefügt.
  19. Die Verknüpfungsoperation wird im Bereich „Schritte“ angezeigt.

Tipp für die Union -Operation: Wenn eine Fehlermeldung wegen inkompatibler Schemata angezeigt wird, überprüfen Sie, ob die automatische Um wandlung des Spaltentyps die Datentypen des ersten Datensatzes geändert hat. Löschen Sie den Schritt Convert column type (Spaltentyp konvertieren) und versuchen Sie es erneut.

Natürliche Sprache

Stoppwörter entfernen Entfernen Sie gebräuchliche Wörter der englischen Sprache, wie beispielsweise „the“ oder „and“ Stoppwörter haben für Algorithmen und Modelle der Textanalyse in der Regel nur einen geringen semantischen Wert. Entfernen Sie die Stoppwörter, um das Datenvolumen zu reduzieren und die Qualität der Daten zu verbessern, die Sie zum Trainieren von Modellen für maschinelles Lernen verwenden.

Optional: Um zu überprüfen, welche Wörter entfernt wurden, wenden Sie die Operation „Tokenize“ (nach Wörtern) auf die ausgewählte Spalte an und sehen Sie sich anschließend die Statistiken für die Wörter auf der Registerkarte „Profil“ an. Sie können den Schritt „Tokenize“ später im Ablauf „ Data Refinery “ rückgängig machen.


Video: Vorgang „Stoppwörter entfernen“

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Die Funktion „Stoppwörter entfernen“ entfernt gebräuchliche Wörter der englischen Sprache aus dem Datensatz. Stoppwörter haben für Algorithmen und Modelle der Textanalyse in der Regel nur einen geringen semantischen Wert. Entfernen Sie die Stoppwörter, um das Datenvolumen zu reduzieren und die Datenqualität zu verbessern.
  2. Die Funktion „Stoppwörter entfernen“ entfernt folgende Wörter: a, an, and, are, as, at, be, but, by, for, from, if, in, into, is, it, no, not, of, on, or, such, that, the, their, then, there, these, they, this, to, was, will, with.
  3. Die Funktion „Stoppwörter entfernen“ befindet sich in der Kategorie „NATÜRLICHE SPRACHE“.
  4. Wählen Sie die Spalte „STRING“ aus.
  5. Klicken Sie auf „Übernehmen“, um die Stoppwörter zu entfernen.
  6. Die Stoppwörter werden aus der Spalte „STRING“ entfernt.
  7. Der Vorgang „Stoppwörter entfernen“ wird im Bereich „Schritte“ angezeigt.

Tokenisieren Englischen Text in Wörter, Sätze, Absätze,
Zeilen, Zeichen oder anhand regulärer Ausdrücke zerlegen.

Einschränkung: Die Operation „Tokenize“ wird nicht unterstützt, wenn Sie einen „ Data Refinery “-Ablauf in einem „ Hadoop “-Cluster ausführen.


Video: Tokenisierung

Dieses Video bietet eine anschauliche Möglichkeit, die Konzepte und Aufgaben in dieser Dokumentation kennenzulernen.

Videotranskript

  1. Die Funktion „Tokenize“ zerlegt englischen Text in Wörter, Sätze, Absätze, Zeilen, Zeichen oder nach regulären Ausdrücken.
  2. Die Operation „Tokenize“ ist in der Kategorie „NATURAL LANGUAGE“ zu finden.
  3. Wählen Sie die Spalte „STRING“ aus.
  4. Verfügbare Optionen für die Tokenisierung.
  5. Erstellen Sie eine neue Spalte mit dem Namen WORDS.
  6. Die Operation „Tokenize“ hat die Wörter aus der Spalte „STRING“ übernommen und eine neue Spalte namens „WORDS“ erstellt, die für jedes Wort eine eigene Zeile enthält.
  7. Der Vorgang „Tokenisieren“ wird im Bereich „Schritte“ angezeigt.