
Um die Latenz von Big-Data-Verarbeitungsvorgängen zu reduzieren und eine Reihe von Verbesserungen zu erzielen, Apache Software Foundation (ASF) hat die Verfügbarkeit der ersten Version von Spark . angekündigt, eine Open-Source-Analysesoftware, die beschleunigt Aufgabenausführung Echtzeitanalyse über die Hadoop-Datenverarbeitungsplattform.
Bekannt als „das Hadoop Schweizer Taschenmesser“, So funktioniert dieses neue Tool bereichert das Ökosystem von diesem verteilten Rechenmodell, das eine interessante Alternative zu bietet Karte verkleinernMapReduce ist ein Programmiermodell, das entwickelt wurde, um große Datensätze effizient zu verarbeiten und zu generieren. Unterstützt von Google, Bei diesem Ansatz wird die Arbeit in kleinere Aufgaben aufgeteilt, die auf mehrere Knoten in einem Cluster verteilt sind. Jeder Knoten verarbeitet seinen Teil und dann werden die Ergebnisse kombiniert. Mit dieser Methode können Sie Anwendungen skalieren und große Informationsmengen verarbeiten, in der Welt von Big Data von grundlegender Bedeutung zu sein..... Ihr Ersatz bedeutet Vorteile, da Echtzeitanalysen auf Hadoop-Clustern möglich sind und Geschwindigkeit multiplizieren mit 100 im Speicher im Vergleich zu MapReduce und bis zu 10 mehrmals auf der Festplatte.
Anstatt die Jobs im Batch-Modus auszuführen, macht Echtzeitanalysen zwischen Clustern unmöglich, Funke arbeitet in Mikrochargen Intervalle von fünf Sekunden oder weniger, die auch mehr Stabilität bietet als andere Echtzeit-Behandlungstools.
Echtzeitanalyse und Benutzerfreundlichkeit
Mit dieser Version 1.0 der Funke, Apache bietet eine stabile Anwendungsprogrammierschnittstelle unter Apache-Lizenz 2.0, wie bei all der Software, die aus der fieberhaften Tätigkeit des Gründerzentrums der Stiftung hervorgegangen ist. des Weiteren, Databriks vertreibt es in seiner kommerziellen Version.
Für seine Kompatibilität, Entwickler können damit auch MapReduce-Code in ihre eigenen Anwendungen eingeben, sowie um andere geschriebene in . zu erstellen Java, Scala oder Python, drei der häufigsten Sprachen.
Strukturierte Daten zusammen mit anderen unstrukturierten Daten im selben Analysevorgang gemeinsam analysieren können und deren Verwendung in kleine und große Teams o CPDs sind ein weiteres herausragendes Merkmal dieser Version.
Zusätzlich zur Unterstützung der Datenquellen des Dateisystems HDFSHDFS, o Verteiltes Hadoop-Dateisystem, Es ist eine Schlüsselinfrastruktur für die Speicherung großer Datenmengen. Entwickelt für die Ausführung auf gängiger Hardware, HDFS ermöglicht die Datenverteilung über mehrere Knoten, Sicherstellung einer hohen Verfügbarkeit und Fehlertoleranz. Seine Architektur basiert auf einem Master-Slave-Modell, wobei ein Master-Knoten das System verwaltet und Slave-Knoten die Daten speichern, Erleichterung der effizienten Verarbeitung von Informationen.. (Das verteilte Dateisystem von Hadoop), ist es mit einigen seiner Komponenten kompatibel wie GARNYARN ist ein Paketmanager für JavaScript, der die effiziente Installation und Verwaltung von Abhängigkeiten in Entwicklungsprojekten ermöglicht. Unterstützt von Facebook, Es zeichnet sich durch seine Schnelligkeit und Sicherheit im Vergleich zu anderen Managern aus. YARN verwendet ein Cache-System, um Installationen zu optimieren, und stellt eine Sperrdatei bereit, um die Konsistenz der Abhängigkeitsversionen in verschiedenen Entwicklungsumgebungen zu gewährleisten.... (Noch ein weiterer Ressourcen-Netotiator) oder mit der DatenbankEine Datenbank ist ein organisierter Satz von Informationen, mit dem Sie, Effizientes Verwalten und Abrufen von Daten. Einsatz in verschiedenen Anwendungen, Von Unternehmenssystemen bis hin zu Online-Plattformen, Datenbanken können relational oder nicht-relational sein. Das richtige Design ist entscheidend für die Optimierung der Leistung und die Gewährleistung der Informationsintegrität, und erleichtert so eine fundierte Entscheidungsfindung in verschiedenen Kontexten.... verteilt HBaseHBase ist eine NoSQL-Datenbank, die für die Verarbeitung großer Datenmengen entwickelt wurde, die in Clustern verteilt sind. Basierend auf dem Spaltenmodell, Ermöglicht einen schnellen, skalierbaren Zugriff auf Informationen. HBase lässt sich problemlos in Hadoop integrieren, Dies macht es zu einer beliebten Wahl für Anwendungen, die eine massive Datenspeicherung und -verarbeitung erfordern. Seine Flexibilität und Wachstumsfähigkeit machen es ideal für Big-Data-Projekte...., eine der Hadoop-Datenbanken. .
Eine auf die permanente Analyse von Daten in Echtzeit ausgerichtete Nutzung kommt hinzu, weitere Funktionalitäten rund um seine Softwarebibliothek, neben anderen grafischen Behandlungen oder eingehenden Berechnungen mit maschinellem Lernen, sowie interaktive Datenabfragen.
Das AMP-Labor (Algorithmen, Maschinen und Menschen) Berkeley initiierte die Gründung von Spark, und im Juni 2013, vor einem Jahr, das Die ASF-Community hat das Projekt übernommen um dir den maximalen Schub zu geben. Heutzutage, Spark ist in Unternehmen auf der ganzen Welt im Einsatz, wie IBM, Cloudera Intel oder Pivotal haben Spark bereits in ihre Hadoop-Distributionen integriert, Daher sind die Erwartungen hoch, dass diese neue Software eine wichtige Rolle in der Big-Data-Datenverarbeitung spielen wird..
Erstellt in 1999, Die Foundation betreut Dutzende von Open-Source-Projekten und hat Tausende von Softwarelösungen beigesteuert, die unter der Apache-Lizenz vertrieben werden., einschließlich des berühmten Apache HTTP-Server-Frameworks, das weltweit beliebteste verteilte Datenverarbeitungssystem.
Verwandter Beitrag:
Bildquelle: renjith krishnan / FreeDigitalPhotos.net
(Funktion(D, S, Ich würde) {
var js, fjs = d.getElementsByTagName(S)[0];
Wenn (d.getElementById(Ich würde)) Rückkehr;
js = d.createElement(S); js.id = id;
js.src = „//connect.facebook.net/es_ES/all.js#xfbml=1&Status=0“;
fjs.parentNode.insertBefore(js, fjs);
}(dokumentieren, ‚Skript‘, ‚facebook-jssdk‘));



