Explorative Analyse | Univariate Analyse, bivariat und multivariat

Inhalt

Einführung

Daten sind überall um uns herum, in Tabellenkalkulationen, auf verschiedenen Social-Media-Plattformen, in Umfrageformularen und mehr. Der Reinigungsprozess, Transformation, Deutung, Die Analyse und Visualisierung dieser Daten, um nützliche Erkenntnisse zu gewinnen und wertvolle Erkenntnisse zu gewinnen, um effektivere Geschäftsentscheidungen zu treffen, wird als Datenanalyse bezeichnet.

Die Datenanalyse kann organisiert werden in 6 Typen

  1. Explorative Analyse
  2. Beschreibende Analyse
  3. Inferenzanalyse
  4. Prädiktive Analysen
  5. Ursachenanalyse
  6. mechanistische Analyse

Hier, wir werden tief eintauchen Explorative Analyse,

Explorative Analyse

Vorläufige Datenanalyse, um Zusammenhänge zwischen Maßnahmen in den Daten zu entdecken und sich ein Bild von Trends zu machen, Muster und Beziehungen zwischen verschiedenen im Datensatz vorhandenen Entitäten mit Hilfe von Statistiken und Visualisierungswerkzeugen wird als explorative Datenanalyse bezeichnet (EDA). .

Die explorative Datenanalyse wird auf zwei verschiedene Arten kreuzklassifiziert, wobei jede Methode grafisch oder nicht grafisch ist. Und später, jede Methode ist univariat, bivariat oder multivariat.

Univariate Analyse

Uni bedeutet eins und variabel bedeutet variabel, also in der univariaten Analyse, Es gibt nur eine zuverlässige Variable. Das Ziel der univariaten Analyse ist es, die Daten abzuleiten, definieren und zusammenfassen und die darin enthaltenen Muster analysieren. in einem Datensatz, Untersuchen Sie jede Variable separat. Es ist für zwei Arten von Variablen möglich: kategorisch und numerisch.

Einige Muster, die mit der univariaten Analyse leicht identifiziert werden können, sind die zentrale Tendenz (Medien, Modus und Median), Dispersion (Rang, Abweichung), Quartile (Interquartilbereich) und Standardabweichung.

Univariate Daten können beschrieben werden durch:

Ö Häufigkeitsverteilungstabellen

Die Häufigkeitsverteilungstabelle gibt die Häufigkeit wieder, mit der ein Ereignis in den Daten aufgetreten ist.. Gibt einen kurzen Einblick in die Daten und erleichtert das Auffinden von Mustern.

Beispiel:

Die Liste der IQ-Werte ist: 118, 139, 124, 125, 127, 128, 129, 130, 130, 133, 136, 138, 141, 142, 149, 130, 154.

IQ-Rang Nummer
118-125 3
126-133 7
134-141 4
142-149 2
150-157 1

Ö Balkendiagramm

Das Balkendiagramm ist sehr praktisch, wenn Sie Datenkategorien oder verschiedene Datengruppen vergleichen. Hilft, Änderungen im Laufe der Zeit zu verfolgen. Am besten geeignet für die Visualisierung diskreter Daten.

Bild10-9478352

Ö Histogramme

Histogramme ähneln Balkendiagrammen und zeigen dieselben kategorialen Variablen in der Datenkategorie an. Histogramme zeigen diese Kategorien als Bins an, die die Anzahl der Datenpunkte in einem Bereich angeben. Am besten geeignet für die Visualisierung kontinuierlicher Daten.

Bild11-3900034

Ö Kreisdiagramme

Tortendiagramme werden hauptsächlich verwendet, um zu verstehen, wie eine Gruppe in kleinere Teile unterteilt ist. Der ganze Kuchen repräsentiert die 100 Prozent und Portionen geben die relative Größe dieser bestimmten Kategorie an.

Bild 14-5304008

Ö Frequenzpolygone

Ähnlich wie Histogramme, ein Häufigkeitspolygon wird verwendet, um Datensätze zu vergleichen oder die kumulierte Häufigkeitsverteilung anzuzeigen.

image6-1-3679285

Bivariate Analyse

Bi bedeutet zwei und variabel bedeutet variabel, somit Hier sind zwei Variablen. Die Analyse bezieht sich auf die Ursache und die Beziehung zwischen den beiden Variablen. Es gibt drei Arten bivariater Analysen.

Bivariate Analyse zweier numerischer Variablen (Numerisch-Numerisch)

Ö Streudiagramm

EIN Das Streudiagramm stellt einzelne Daten anhand von Punkten dar. Diese Diagramme machen es einfach zu erkennen, ob zwei Variablen miteinander in Beziehung stehen.. Das resultierende Muster gibt den Typ an (linear oder nichtlinear) und die Stärke der Beziehung zwischen zwei Variablen.

Bild 8-2-1095367

Ö linearer Zusammenhang

Linear Correlation repräsentiert die Stärke einer linearen Beziehung zwischen zwei numerischen Variablen. Wenn es keine Korrelation zwischen den beiden Variablen gibt, es gibt keine Tendenz, sich zusammen mit den Werten der zweiten Größe zu ändern.

Bild 13-8709111

Hier, R misst die Stärke einer linearen Beziehung und liegt immer dazwischen -1 Ja 1 wo -1 bezeichnet eine perfekte negative lineare Korrelation und +1 bezeichnet eine perfekte positive lineare Korrelation und Null zeigt keine lineare Korrelation an.Bild4-1-4052764

Bivariate Analyse zweier kategorialer Variablen (Kategorisch-kategorisch)

Ö Chi-Quadrat-Test

Der Chi-Quadrat-Test wird verwendet, um die Assoziation zwischen kategorialen Variablen zu bestimmen. Sie wird basierend auf der Differenz zwischen den erwarteten Häufigkeiten und den beobachteten Häufigkeiten in einer oder mehreren Kategorien der Häufigkeitstabelle berechnet. Eine Wahrscheinlichkeit von Null zeigt eine vollständige Abhängigkeit zwischen zwei kategorialen Variablen an und eine Wahrscheinlichkeit von eins zeigt an, dass zwei kategoriale Variablen vollständig unabhängig sind..

Hier, der Index c gibt die Freiheitsgrade an, O gibt den beobachteten Wert und E den erwarteten Wert an.

Bild12-8200380

Bivariate Analyse eines Variable numerisch und kategorial (Numerisch-kategorisch)

Ö Z-Test und t-Test

Z- und t-Tests sind wichtig, um zu berechnen, ob der Unterschied zwischen einer Stichprobe und einer Grundgesamtheit erheblich ist..

image1-8687716

Wenn die Wahrscheinlichkeit von Z klein ist, der Unterschied zwischen den beiden Durchschnittswerten ist signifikanter.

Test T

image9-2150508

Wenn die Stichprobengröße groß genug ist, Wir verwenden einen Z-Test, und für eine kleine Stichprobengröße, Wir verwenden einen t-Test.

Ö VARIANZANALYSE (ANOVA)

Der ANOVA-Test wird verwendet, um festzustellen, ob es einen signifikanten Unterschied zwischen den Mittelwerten von mehr als zwei Gruppen gibt, die sich statistisch voneinander unterscheiden.. Diese Analyse ist geeignet, um die Mittelwerte einer numerischen Variablen für mehr als zwei Kategorien einer kategorialen Variablen zu vergleichen..

image2-1-2645045

Analyse multivariabel

Eine multivariate Analyse ist erforderlich, wenn mehr als zwei Variablen gleichzeitig analysiert werden müssen. Es ist eine ungeheuer schwierige Aufgabe für das menschliche Gehirn, eine Beziehung zwischen zu visualisieren 4 Variablen in einem Diagramm und, Daher, Die multivariate Analyse wird verwendet, um komplexere Datensätze zu untersuchen. Zu den Arten der multivariaten Analyse gehört die Clusteranalyse, Faktoranalyse, Multiple Regressionsanalyse, Hauptkomponentenanalyse, etc. Es gibt mehr als 20 Es gibt verschiedene Möglichkeiten zur Durchführung multivariater Analysen, und welche zu wählen ist, hängt von der Art der Daten und dem endgültigen Ziel ab, das erreicht werden soll. Die häufigsten Formen sind:

Ø Clusteranalyse

Die Clusteranalyse klassifiziert verschiedene Objekte in Cluster, sodass die Ähnlichkeit zwischen zwei Objekten in derselben Gruppe maximal und ansonsten minimal ist.. Es wird verwendet, wenn die Zeilen und Spalten der Die Datentabelle stellt dieselben Einheiten dar und die Messung stellt den Abstand oder die Ähnlichkeit dar.

Bild7-3792319

Ö Hauptkomponentenanalyse (PCA)

Hauptkomponentenanalyse (o PCA) Wird verwendet, um die Dimensionalität einer Datentabelle mit einer großen Anzahl miteinander verbundener Maße zu reduzieren. Hier, Die ursprünglichen Variablen werden zu einem neuen Satz von Variablen, die als bekannt sind „Hauptbestandteile“ der Hauptkomponentenanalyse.

PCA wird für den Datensatz verwendet, der Multikollinearität zeigt. Obwohl die Schätzungen der kleinsten Quadrate verzerrt sind, Der Abstand zwischen den Abweichungen und ihrem wahren Wert kann sehr groß sein. Dann, PCA fügt eine gewisse Verzerrung hinzu und reduziert den Standardfehler für das Regressionsmodell.

image3-1-1482659

Ö Korrespondenzanalyse

Die Korrespondenzanalyse mit Daten aus einer Kontingenztabelle zeigt die relativen Beziehungen zwischen zwei verschiedenen Gruppen von Variablen. Eine Kontingenztabelle ist eine 2D-Tabelle mit Zeilen und Spalten als Gruppen von Variablen..

Bild5-1-7331464

Fazit

Ich hoffe, Sie haben jetzt ein besseres Verständnis für die verschiedenen Techniken, die in der univariaten Analyse verwendet werden., bivariat und multivariat.

Die in diesem Artikel gezeigten Medien sind nicht Eigentum von DataPeaker und werden nach Ermessen des Autors verwendet.

Abonniere unseren Newsletter

Wir senden Ihnen keine SPAM-Mail. Wir hassen es genauso wie du.

Datenlautsprecher