EIN ETL-Verfahren in drei Etappen (Extraktion, Transformation und Laden) und einige ETL-Tools die richtige Umsetzung dieses Konzepts, sind die Lösung für die Bedürfnisse der Institutionen, um Verwalten Sie Ihre Daten richtig.

Bildnachweis: wikinger75
Es geht um Informationen effizient speichern. Nicht klassifizierte Daten verursachen Probleme, wenn sie gefunden werden. Der Benutzer muss wissen, welche Daten er verwaltet, wo sie sind und wie man sie extrahiert.. Es mag den Anschein haben, dass die schwierige Sache darin besteht, Entscheidungen auf der Grundlage von Daten zu treffen, aber nein, Das Finden der Daten selbst ist oft viel komplizierter.
Aber trotzdem, ETL-Tools sind die Lösung für dieses Problem.
Was ist ein ETL?
Das Akronym ETL kommt von Extracting, Transformieren, Wird geladen, was die Idee von dem sehr gut beschreibt Was ist ein ETL?. Das ETL-Tools Sie wurden entwickelt, um die Datenspeicherung zu fördern und zu erleichtern.
Um herauszufinden, was eine ETL ist, am besten prüfen Wie ist ein ETL-Verfahren?. Es geht um die nächsten Schritte:
- Start
- Referenzdaten erstellen
- Quellenauszug
- Bestätigen
- Umformen
- In Tabellen laden
- Auditberichte erstellen
- Zum Posten
- Verfahren
- Aufräumen
Manchmal, diese Schritte werden indirekt überwacht und durchgeführt, aber sie sind zeitaufwendig und das Ergebnis kann nicht genau sein. Der Zweck der Verwendung von ETL-Tools besteht darin, Zeit zu sparen und das gesamte Verfahren zuverlässiger zu machen.
Was sind die traditionellen Hauptfunktionen von ETL-Tools??
ETL-Tools automatisieren Datenextraktionsvorgänge aus Quellsystemen, Transformation für Analyse- und Verarbeitungszwecke und anschließende Verladung am Bestimmungsort. unabhängig vom ausgewählten System und unabhängig von der Art der Umgebung. Ihr Eingreifen vereinfacht das ETL-Verfahren im Vergleich zu manuellen Integrationsskripten in SQL oder anderen Programmiersprachen.
Um herauszufinden, was eine ETL ist, Sie müssen die interne Konfiguration verstehen, die Fähigkeiten und Funktionen von ETL-Tools.. Zu den wichtigsten, es lohnt sich, folgendes hervorzuheben:
- Kompatibilität mit der Integration von Daten, die in lokalen Systemen und in der Cloud gespeichert sind, einschließlich hybrider Cloud-Umgebungen.
- Möglichkeit, Daten aus einer Reihe von Quellen zu verbinden und zu extrahieren. wie Bewerbungen, Datenbanken, Big-Data-Systeme basierend auf Technologien wie Hadoop und Spark und Flat-File-Repositorys, unter anderen.
- Funktionen zur Datenprofilerstellung, die es ermöglichen, bereits an der Quelle und vor dem Start des ETL-Verfahrens eine Analyse der Konsistenz der Daten durchzuführen, in der Lage zu sein, auch das Vorhandensein von Abhängigkeiten und anderen Attributen der Daten zu untersuchen.
- Entwicklungsmöglichkeiten teambasiert, um eine effektive Zusammenarbeit bei Integrationsinitiativen zu ermöglichen.
- Qualitäts- und Datenbereinigungsfunktionen, die die Zuverlässigkeit erhöhen.
- Funktionen zur Datensynchronisation um die Konsistenz zwischen den Systemen aufrechtzuerhalten.
- Datentransformationsfunktionen, das kann alles beinhalten, von der Neuformatierung bis zur Konvertierung und von der Workflow-Orchestrierung bis zum Daten-Mapping.
- Unterstützung bei der Metadatenverwaltung.
Verwechseln Sie ETL nicht mit einer gleichwertigen Definition, ELT, was die letzten Phasen des Verfahrens umkehrt, Durchführen des Ladens vor der Transformation. Eine Option, die die Manipulation der Daten übernimmt, sobald sie sich bereits auf dem Zielsystem befinden.
Es ist eine Kapazität besonders empfehlenswert für Big-Data-Anwendungen wo oft große Mengen an Rohdaten in Hadoop geladen werden, Spark oder andere Repositorys, und dann nach den Bedürfnissen verschiedener analytischer Anwendungen gefiltert.
Kann Big Data zum Verschwinden von ETL-Tools führen??
Kurzfristig, ETL-Tools werden nicht verschwinden, aber der Fokus der ETL-Tools wird sich ändern von „Website zu Daten“.. Es wird noch einen Platz für ETL-Tools geben, entweder als eigenständige ETL-Tools oder, seltener, als verbleibende ETL-Tools auf mittlerer Ebene.
Zunehmend, Dieses aufkommende Modell benötigt ein einziges zentrales Repository für alle Geschäftsinformationen. Mit anderen Worten, ein Platz für Massenspeicher. Das könnte sein Hadoop, Cassandra oder Spark, funcionando como un Verteiltes DateisystemEin verteiltes Dateisystem (DFS) Ermöglicht die Speicherung und den Zugriff auf Daten auf mehreren Servern, Erleichterung der Verwaltung großer Informationsmengen. Diese Art von System verbessert die Verfügbarkeit und Redundanz, da Dateien an verschiedene Speicherorte repliziert werden, Reduzierung des Risikos von Datenverlusten. Was ist mehr, Ermöglicht Benutzern den Zugriff auf Dateien von verschiedenen Plattformen und Geräten aus, die Zusammenarbeit zu fördern und..., oder eigentlich, ein Cloud-Speicherdienst wie S3. Es ist auch notwendig, die Bewegung kleinerer abgeleiteter Datensätze zu betonen., aus diesem Repository, zu den Quellsystemen, aus denen es besteht.
Die Rolle von ETL-Tools wird weiter zunehmen, nicht nur proportional zur Datenmenge, aber auch Es sollte auch die Explosion der Datenvielfalt umfassen, die maschinell generierte Daten verursachen... Zur selben Zeit, mit der Notwendigkeit, die Geschwindigkeit der analysebasierten Entscheidungsfindung zu erhöhen, die ETL-Tools-Pipeline sollte vom Batch-Betrieb zu wechseln so nah wie möglich an echtzeit.
Traditionelle ETL-Tools und Datenintegrationsanbieter wie Informatica passen ihre Produkte und Engines an Hadoop verwenden, Spark und andere Big-Data-Plattformen, und fügen Sie die Möglichkeit hinzu, Daten in und aus Hadoop zu verschieben.



