
Hadoop, das erfolgreiche Open-Source-Projekt, das von der Apache Software Foundation betreut wird, ist eine kostengünstige Technologie, mit der Sie große Mengen unterschiedlichster Daten verarbeiten können. Ihr riesige Vorteile Im Vergleich zu typischen verteilten Systemen, bedeutet nicht, dass es keine Nachteile hat, wie Latenz- oder Streaming- und Batch-Datei-Kompatibilitätsprobleme, aber das macht keine kompromisse Robustheit von diesem Rahmen.
Wie bekannt, Hadoop ist ein Java-basiertes Framework, das zwei einfachen Konzepten folgt: Daten speichern in dem Verteiltes DateisystemEin verteiltes Dateisystem (DFS) Ermöglicht die Speicherung und den Zugriff auf Daten auf mehreren Servern, Erleichterung der Verwaltung großer Informationsmengen. Diese Art von System verbessert die Verfügbarkeit und Redundanz, da Dateien an verschiedene Speicherorte repliziert werden, Reduzierung des Risikos von Datenverlusten. Was ist mehr, Ermöglicht Benutzern den Zugriff auf Dateien von verschiedenen Plattformen und Geräten aus, die Zusammenarbeit zu fördern und... die Hadoop (HDF) und sie verarbeiten durch Karte verkleinernMapReduce ist ein Programmiermodell, das entwickelt wurde, um große Datensätze effizient zu verarbeiten und zu generieren. Unterstützt von Google, Bei diesem Ansatz wird die Arbeit in kleinere Aufgaben aufgeteilt, die auf mehrere Knoten in einem Cluster verteilt sind. Jeder Knoten verarbeitet seinen Teil und dann werden die Ergebnisse kombiniert. Mit dieser Methode können Sie Anwendungen skalieren und große Informationsmengen verarbeiten, in der Welt von Big Data von grundlegender Bedeutung zu sein...., das Programmiermodell für verteilte Datenverarbeitung.
MapReduce y HDFS
MapReduce macht die berühmte römische Maxime von Teile und herrsche (teilen und erobern), da es ein komplexes Problem nimmt und es parallel in umsetzbare Teile zerlegt. Jedes dieser Teile wird an einen KnotenNodo ist eine digitale Plattform, die die Verbindung zwischen Fachleuten und Unternehmen auf der Suche nach Talenten erleichtert. Durch ein intuitives System, Ermöglicht Benutzern das Erstellen von Profilen, Erfahrungen austauschen und Zugang zu Stellenangeboten erhalten. Der Fokus auf Zusammenarbeit und Networking macht Nodo zu einem wertvollen Werkzeug für diejenigen, die ihr berufliches Netzwerk erweitern und Projekte finden möchten, die mit ihren Fähigkeiten und Zielen übereinstimmen.... des Clusters oder Servers gesendet, um damit in den Mapping-Phasen zu arbeiten (Karte) Ja Reduzieren, In diesem Fall nehmen Sie die in der erhaltenen Listen als Eingabe Karte und eine Sammlung von Werten generieren.
Was ist mehr, HDFSHDFS, o Verteiltes Hadoop-Dateisystem, Es ist eine Schlüsselinfrastruktur für die Speicherung großer Datenmengen. Entwickelt für die Ausführung auf gängiger Hardware, HDFS ermöglicht die Datenverteilung über mehrere Knoten, Sicherstellung einer hohen Verfügbarkeit und Fehlertoleranz. Seine Architektur basiert auf einem Master-Slave-Modell, wobei ein Master-Knoten das System verwaltet und Slave-Knoten die Daten speichern, Erleichterung der effizienten Verarbeitung von Informationen.. ist ein verteiltes Dateisystem, das große Datenmengen und kostengünstige Hardware speichert. Leistung wird durch das Verbinden von Knoten mit dem Cluster erreicht, nämlich, Ausrüstung, die keine außergewöhnlichen Eigenschaften hat, was den Austausch im Pannenfall erleichtert.
Wenn Sie Hadoop mit Programmen wie HDFS oder MapReduce verwenden, können Sie parallel mit Big Data arbeiten, bietet eine integrierte und leicht skalierbare Lösung. In „Hadoop. Der endgültige Leitfaden“, Tom Whites berühmtes Buch, Hadoop ist definiert als linear skalierbar (Knoten können nach Bedarf hinzugefügt werden), mit einem hohe Verfügbarkeit (Dateien werden so oft wie nötig repliziert, was macht es zuverlässig) und Fehlertoleranz.
Eigentlich, beim Arbeiten mit MapReduce und HDFS in Hadoop werden die Ausfälle von ClusterEin Cluster ist eine Gruppe miteinander verbundener Unternehmen und Organisationen, die im selben Sektor oder geografischen Gebiet tätig sind, und die zusammenarbeiten, um ihre Wettbewerbsfähigkeit zu verbessern. Diese Gruppierungen ermöglichen die gemeinsame Nutzung von Ressourcen, Wissen und Technologien, Förderung von Innovation und Wirtschaftswachstum. Cluster können sich über eine Vielzahl von Branchen erstrecken, Von der Technologie bis zur Landwirtschaft, und sind von grundlegender Bedeutung für die regionale Entwicklung und die Schaffung von Arbeitsplätzen.... Server, nämlich, das Framework hat das gleiche Verhalten bei Serverausfällen, damit die Berechnungsprozesse nicht abgebrochen werden.
Diese Fehlertoleranz übersetzt sich in a Robustheit für Hadoop was weitere unbestreitbare Vorteile wie niedrige Lagerkosten hinzufügt, Benutzerfreundlichkeit, Leistung, Geschwindigkeit und Flexibilität bei der Analyse strukturierter und unstrukturierter Daten.
Angenommen, kein verteiltes System kann Maximalwerte in erreichen Konsistenz, Verfügbarkeit und Fehlertoleranz, laut der lehrerin Eric Brewer, Hadoop kommt diesen drei Anforderungen ziemlich nahe, man kann also sagen, dass es sich um ein verteiltes System mit sehr hoher Performance handelt.
Die Zukunft von MapReduce
Die Entwicklung von Hadoop schreitet weiter voran mit neue Beiträge die die Benutzerfreundlichkeit verbessern, als rahmen Apache Funke, was die Leistung von MapReduce verbessern kann, deinen Kernel bereichern. Obwohl Spark MapReduce ersetzen oder sogar unabhängig agieren könnte, Nachfolger von Hadoop werden, die Wahrheit ist, dass es ein großes Potenzial hat, mit ihnen zusammenzuarbeiten, um Probleme wie Latenz zu verbessern, Echtzeit-Datenanalyse und höhere Effizienz bei Abfragen, die wiederholt Daten anfordern. .
Die Vielseitigkeit von Spark könnte als Gefahr für die Zukunft von Hadoop, das seinerzeit den Unterschied zu relationalen Datenbanken ausmachte (RDBMS) als verteiltes Lager- und Verarbeitungssystem. Zur Zeit, viele Analysten halten ihn für den Hauptkandidaten als Nachfolger von MapReduce oder Hadoop selbst. In jedem Fall, die Wahrheit ist, dass Spark ein autonomes Framework ist, aber sein Design ermöglicht es, mit dem verteilten Hadoop-Dateisystem zu arbeiten. Speziell, kann direkt auf HDFS ausgeführt werden, innerhalb von MapReduce oder parallel zu MapReduce im selben Cluster zu arbeiten.
Verwandter Beitrag:
Databricks zertifiziert Drittanbieter-Software für Spark Apache
Hadoop si o nein? Die Fragen zur Entscheidungshilfe
Hadoop-API 1.0.3: Wolkenreise
Bildnachweis: Cubie-Team
(Funktion(D, S, Ich würde) {
var js, fjs = d.getElementsByTagName(S)[0];
Wenn (d.getElementById(Ich würde)) Rückkehr;
js = d.createElement(S); js.id = id;
js.src = „//connect.facebook.net/es_ES/all.js#xfbml=1&Status=0“;
fjs.parentNode.insertBefore(js, fjs);
}(dokumentieren, ‚Skript‘, ‚facebook-jssdk‘));



