Große Daten | Blogs von Big Data | Big Data lernen

Inhalt

Betrachten Sie die folgende Tatsache:

Facebook hat derzeit jeden Monat mehr als eine Milliarde aktive Nutzer

Nehmen wir uns ein paar Sekunden Zeit, um darüber nachzudenken, welche Informationen Facebook normalerweise über seine Benutzer speichert. Einiges davon ist:

  • Demografische Basisdaten (als Beispiel, Geburtsdatum, Sex, Aktueller Standort, vorheriger Standort, Universität)
  • Pakt der Aktivitäten und Benutzer-Updates (ihre Fotos, Bemerkungen, ich mag das, Anwendungen, die Sie verwendet haben, Spiele, die du gespielt hast, Mitteilungen, Chats, etc.)
  • Ihr soziales Netzwerk (deine Freunde, ihre Kreise, Wie seid ihr verwandt, etc.)
  • Nutzerinteressen (Bücher lesen, Filme gesehen, setzt, etc.)

Große Daten

Verwenden Sie diese und viele andere Informationen (als Beispiel, worauf ein Benutzer geklickt hat, was hast du gelesen und wie lange hast du damit verbracht), Facebook macht folgendes in Echtzeit:

  • Empfehle Menschen, die du kennst, und gemeinsame Verbindungen mit ihnen.
  • Verwenden Sie Ihre aktuellen und vergangenen Aktivitäten, um zu verstehen, was Sie interessiert
  • Kontaktieren Sie Sie mit Updates, Aktivitäten und Ankündigungen, die Sie mehr interessieren könnten.

Gleichzeitig von diesen, es gibt Aktivitäten in der Nähe (in Batches und nicht in Echtzeit aktualisiert) als die Anzahl der Personen, die über eine Seite sprechen, Personen in einer Woche erreicht.

Jetzt, Stellen Sie sich die Art der Dateninfrastruktur vor, die für den Betrieb von Facebook erforderlich ist, die Größe Ihres Rechenzentrums, die erforderliche Rechenleistung, um die Benutzeranforderungen zu erfüllen. Das Ausmaß kann aufregend oder erschreckend sein, je nachdem wie man es betrachtet.

Die kommende Infografik von IBM zeigt das Ausmaß der Anforderungen / Datenverarbeitung für einige ähnliche Institutionen:

big-data_ibm

Diese Art von Größe und Größenordnung wurde bis vor einigen Jahren von keinem Analysten gehört und die Dateninfrastruktur, in die einige dieser Institute investiert hatten, war nicht auf diese Größenordnung vorbereitet.. Dies wird oft als Big-Data-Problem bezeichnet..

Dann, Was ist Big Data??

Big Data sind zu große Daten, komplex und dynamisch für jedes konventionelle Datentool zu erfassen, Geschäft, verwalten und analysieren. Herkömmliche Werkzeuge wurden im Hinblick auf die Skalierung entwickelt. Als Beispiel, wenn ein Unternehmen in eine Business Intelligence-Lösung investieren möchte, Umsetzungspartner würde kommen, Geschäftsanforderungen studieren und dann eine Lösung erstellen, um diese Anforderungen zu erfüllen.

Wenn der Bedarf an dieser Organisation im Laufe der Zeit steigt oder Sie eine detailliertere Analyse durchführen möchten, musste in Dateninfrastruktur reinvestieren. Die Kosten der Ressourcen, die mit der Skalierung der Ressourcen verbunden sind, die regelmäßig verwendet werden, steigen exponentiell. Zur selben Zeit, es würde eine Beschränkung der Größe geben, auf die es skaliert werden könnte (als Beispiel, Maschinengröße, Zentralprozessor, RAM, etc.). Diese traditionellen Systeme konnten den von einigen Internetunternehmen geforderten Umfang nicht unterstützen..

Wie unterscheidet sich Big Data von herkömmlichen Daten??

Zum Glück oder leider, es gibt keine größenbeschränkung / parametrisch, um zu wählen, ob die Daten „Große Daten“ oder nicht. Big Data wird typischerweise auf der Grundlage dessen charakterisiert, was im Volksmund als . bekannt ist 3 VS:

  • Volumen – Heutzutage, es gibt Institutionen, die an einem Tag Terabyte an Daten produzieren. Mit steigenden Daten, Sie müssen einige Daten unanalysiert lassen, wenn Sie traditionelle Werkzeuge verwenden möchten. Wenn die Größe der Daten noch größer wird, wird immer mehr Daten unanalysiert lassen. Das bedeutet, Werte auf dem Tisch zu lassen. Es enthält alle Informationen darüber, was der Kunde tut und sagt, Kann es aber nicht verstehen! – ein sicheres Zeichen dafür, dass Sie mit größeren Datenmengen zu tun haben, als Ihr System unterstützt.
  • Vielfalt – Obwohl die Lautstärke nur der Anfang ist, Vielfalt macht traditionelle Werkzeuge sehr schwierig. Herkömmliche Tools funktionieren am besten mit strukturierten Daten. Daten müssen eine bestimmte Struktur und ein bestimmtes Format haben, um Sinn zu machen. Trotz dieses, die Datenflut aus E-Mails, Kundenbewertung, Social-Media-Foren, die Customer Journey auf dem Webportal und Callcentern ist nicht von Natur aus strukturiert oder, Im besten Fall, sie sind halbstrukturiert.
  • Geschwindigkeit – Die Geschwindigkeit, mit der die Daten generiert werden, ist ebenso entscheidend wie die anderen beiden Faktoren. Die Geschwindigkeit, mit der ein Unternehmen Daten analysieren kann, würde für sie schließlich zu einem Wettbewerbsvorteil werden.. Es ist die Geschwindigkeit der Analyse, die es Google ermöglicht, den Standort von Grippepatienten nahezu in Echtzeit vorherzusagen. Deswegen, wenn Sie Daten nicht schneller analysieren können als Ihr Eingabestream, Sie benötigen möglicherweise eine Big-Data-Lösung.

Individuell, Jedes dieser Vs kann immer noch mit Hilfe traditioneller Lösungen behoben werden. Als Beispiel, wenn die meisten Ihrer Daten strukturiert sind, du kannst immer noch von 80% al 90% von kommerziellem Wert durch traditionelle Werkzeuge. Trotz dieses, wenn du mit den drei Vs vor einer Herausforderung stehst, du wirst wissen, dass es darum geht „Große Daten“.

Tres V

Wann brauchen Sie eine Big-Data-Lösung?

Obwohl die 3 V wird Ihnen sagen, ob Sie es mit "Big Data" zu tun haben oder nicht, ob Sie je nach Bedarf eine Big-Data-Lösung benötigen. Nachfolgend sind Szenarien aufgeführt, in denen Big-Data-Lösungen von Natur aus besser geeignet sind:

  • Wenn es um semi-strukturierte oder unstrukturierte Big Data aus mehreren Quellen geht
  • Sie müssen alle Ihre Daten analysieren und können nicht mit Stichproben arbeiten.
  • Das Verfahren ist iterativ angelegt (als Beispiel, sucht in der Google-Suchmaschine, Suche nach Grafiken auf Facebook)

Wie funktioniert die Big-Data-Antwort?

Obwohl die Grenzen traditioneller Lösungen klar sind, Wie lösen Big-Data-Lösungen sie?? Big-Data-Lösungen arbeiten auf einer grundlegend anderen Architektur, die auf folgenden Merkmalen basiert (veranschaulichend unten):

  • Datenverteilung und Parallelverarbeitung: Big-Data-Lösungen arbeiten mit verteilter Speicherung und paralleler Verarbeitung. Knapp, Dateien werden in mehrere kleine Blöcke unterteilt und auf verschiedenen Laufwerken gespeichert (Anrufe hinter den Kulissen). Nach, in diesen Blöcken erfolgt die Verarbeitung parallel und die Ergebnisse werden wieder zusammengeführt. Der erste Teil der Operation heißt normalerweise Verteiltes Dateisystem (DFS) während der zweite Teil heißt Kleine Karte.
  • Fehlertoleranz: Durch die Natur seines Designs, Big Data Response hat eingebaute Redundanz. Als Beispiel, Hadoop erstellt 3 Kopien jedes Datenblocks in mindestens 2 Regale. Deswegen, auch wenn ein komplettes Rack ausfällt oder nicht aktiviert ist, die antwort funktioniert noch. Warum ist es integriert?? Dank dieser Funktion können Big-Data-Lösungen auf kostengünstige Einstiegshardware anstelle von teuren SAN-Festplatten skaliert werden..
  • Skalierbarkeit und Flexibilität: Dies ist die Genese des kompletten Paradigmas von Big-Data-Lösungen. Puede agregar o quitar racks fácilmente del Cluster sin preocuparse por el tamaño para el que se diseñó esta solución.
  • Kosteneffektivität: Durch den Einsatz von Basishardware, Die Kosten für die Erstellung dieser Infrastruktur sind viel geringer als der Kauf teurer Server mit fehlerresistenten Festplatten (als Beispiel, SAN)

HDFS illustrative_v2

Zusammenfassend, Was wäre, wenn das alles in der Cloud wäre??

Obwohl die Entwicklung einer Big-Data-Architektur profitabel ist, Die richtigen Ressourcen zu finden ist schwierig, was die Implementierungskosten erhöht.

Stellen Sie sich eine Situation vor, in der sich ein Cloud-Dienstleister auch um alle Ihre IT-Angelegenheiten kümmert / Infrastruktur. Sie konzentrieren sich darauf, Analysen durchzuführen und Ergebnisse an das Unternehmen zu liefern, anstatt die Racks zu organisieren und sich um den Umfang ihrer Verwendung zu kümmern.

Alles, was Sie tun müssen, ist nach Ihrem Verbrauch zu bezahlen. Heutzutage, End-to-End-Lösungen sind auf dem Markt verfügbar, wo Sie Ihre Daten nicht nur in der Cloud speichern können, sondern auch in der Cloud konsultieren und analysieren. Sie können Terabyte an Daten in Sekunden abfragen und die Sorgen um diese Infrastruktur anderen überlassen!!

Obwohl ich einen Überblick über Big-Data-Lösungen gegeben habe, das deckt bei weitem nicht das ganze spektrum ab. Der Zweck ist, die Reise zu beginnen und auf die Revolution vorbereitet zu sein, die im Gange ist..

Wenn Ihnen das, was Sie gerade gelesen haben, gefällt und Sie weiter über Analytics lernen möchten, kann abonnieren Sie unsere E-Mails oder wie bei uns Seite auf Facebook

Abonniere unseren Newsletter

Wir senden Ihnen keine SPAM-Mail. Wir hassen es genauso wie du.

Datenlautsprecher