Big Data Wrangling
Schnelle Datenaufbereitung für BI & Analytik
In einer Welt großer Datenmengen kommt es auf die Zeit bis zur Einsicht, Datenqualität und -sicherheit an.
Je größer die Quelldaten, desto größer sind die Probleme, sie für die heutigen Business Intelligence (BI) und Analysetools vorzubereiten:
Volumen
In Bezug auf die Performance können BI- und Analysewerkzeuge keine großen Datensätze verarbeiten. Wenn sie überhaupt funktionieren, dauert es lange bis die Ergebnisse angezeigt werden.
Vielfalt
Geschwindigkeit
BI-Tools können in der Regel nicht ohne Vorverarbeitung mit Echtzeit- oder vermittelten Daten umgehen. Und wenn möglich, schafft die Speisung einzelner Displays und nicht einer geregelten Umgebung Redundanz und Unsicherheit.
Wahrheitsgehalt
Datenschutz
Komplexität
Das Design und die Modifikation von Berichts- und Dashboard-Layouts sind bereits kompliziert. Die Integration von Daten aus unterschiedlichen Quellen für jeden neuen Bericht ist eine weitere Herausforderung für Daten- und ETL-Architekten, DBAs und Geschäftsanwender. Datensilos stellen auch Herausforderungen an die Datenqualität, Sicherheit, Speicherung und Synchronisation.
Gibt es eine Möglichkeit all diese Probleme auf einmal zu lösen…. all diese Daten zu integrieren, zu bereinigen und zu maskieren, damit Ihr Analyse- oder Datenvisualisierungstool sie nutzen kann?
Ja, diese Bereitstellung von wiederverwendbaren Daten für die Nutzung und Anzeige von BI und Analysewerkzeugen wird als Data Blending, Datenaufbereitung, Data Franchising, Data Munging oder Datenwrangling bezeichnet. Dies ist ein so wichtiger Prozess, dass kürzlich mehrere VC-gestützte Tools auf den Markt gebracht wurden, nur um diese Herausforderung zu bewältigen.
Datenintegration, Bereinigung und Maskierung laufen alle gleichzeitig in einem konsolidierten SortCL-Programm (der standardmäßigen CoSort und Voracity-Engine). Verwenden Sie es, um schnell und zuverlässig unterschiedliche Datenquellen für die Verwendung und Wiederverwendung durch Ihre BI- oder Analyseplattform zu verwalten. Wählen Sie aus mehreren Optionen für die Datenaufbereitung in der kostenlosen Eclipse™ GUI für Voracity und verarbeiten Sie diese Daten in Windows-, Unix- oder Hadoop-Dateisystemen, ohne weitere Hardware zu kaufen oder eine Datenbank zu belasten.
Datenaufbereitung (Wrangling)
Bei der Datenaufbereitung oder dem Franchising werden unterschiedliche Datenquellen erfasst, gefiltert, de-normalisiert, sortiert, aggregiert, geschützt und neu formatiert. Mit diesem Ansatz kann Ihr BI-Tool nur die Daten importieren, die es benötigt, und zwar in das Tabellen- oder Flatfile-Format (z.B. CSV, XML), das es benötigt.
Datenvisualisierungen – und damit Antworten auf Ihre Geschäftsfragen – werden schneller, wenn Sie Voracity oder CoSort verwenden:
Filtern, Scrubben, Sortieren, Zusammenführen, Aggregieren und anderweitiges Transformieren großer Daten in einem einzigen Auftragsskript und I/O-Pass.
Erstellen Sie die Teilmengen, die Dashboard, Streudiagramm, Scorecard oder andere Analysetools benötigen und verarbeiten können.
Die zentralisierte Datenaufbereitung vermeidet auch die Reproduktion oder Synchronisation von Daten, wenn ein anderer Bericht benötigt wird.
Datenschutz (Maskierung)
Deidentifizieren Sie mit PII gefütterte BI- und Analyseapplikationen mit integrierten Anonymisierungsfunktionen auf Feldebene wie:
Kodierung
Verschlüsselung (formaterhaltend oder nicht)
Ausdrücke
Hashing
Maskierung (Verschleierung)
Randomisierung
redaktionelle Bearbeitung
Manipulation von Teilstrings
Wenden Sie die gewünschte Funktion an – unter Verwendung von Datenklassen und Regeln – basierend auf Aussehen, Reversibilität und Autorisierung.
Wussten Sie auch?
Die kostenlose grafische IDE für das Jobdesign über alle IRI-Softwareprodukte hinweg heißt IRI Workbench. Die auf Eclipse™ basierende IRI Workbench unterstützt:- automatische Datenprofilierung, Klassifizierung, ERD und Metadatenerstellung
- Erzeugung von Jobskripten (oder Flow) mit mehreren Modifikationsverfahren
- Batch-, Remote- und HDFS-Exe Kürzungen
- Daten, Metadaten und Auftragsversionskontrolle
- Stammdatenverwaltung