Einführung

Wie wir alle wissen, Es gibt bestimmte Prozesse, um Daten zu analysieren. Zuerst, Wir definieren das Problem, dann extrahieren wir die Daten und bereiten sie für die Analyse vor. Vor Zukunftstechnik und Modellbau, es gibt einen wichtigen schritt.

Explorative Datenanalyse bezieht sich auf den kritischen Prozess der Durchführung erster Datenrecherchen, um Muster zu entdecken, erkennen Sie Anomalien und überprüfen Sie Annahmen mit Hilfe von zusammenfassenden Statistiken und grafischen Darstellungen. Die explorative Datenanalyse ist ein wichtiger Schritt, bevor Sie mit der Analyse oder Modellierung Ihrer Daten beginnen.. Bietet den notwendigen Kontext, um ein geeignetes Modell zu entwickeln und die Ergebnisse richtig zu interpretieren.
Sehen wir uns eine Beispiel-R-Implementierung an.
1. Datenermittlung
In diesem Teil, Wir entdecken die Variablentypen und ihre zusammenfassenden Statistiken in den Daten. Zuerst, wir laden den USArrests-Datensatz in R. Dann drucken wir den Datensatz mit der Funktion „KopfSchwanz“ die den Datensatz des ersten druckt 4 und zuletzt 4 Zeilen standardmäßig.

Dann suchen wir nach Variablentypen und zusammenfassenden Statistiken der Variablen.
Die Funktionen „Blick“ Ja „str“ Sie geben uns Arten von Variablen.

Die Funktion „profiling_num“ in der funModeling-Bibliothek gibt uns detaillierte Statistiken wie Mittelwert, die Standardabweichung, Asymmetrie, kurtosis, der Interquartilsabstand, etc.

Lassen Sie uns einige Ergebnisse als Beispiel interpretieren:
- Im Durchschnitt, Mord in jeder Stadt ist 7.788.
- Die Standardabweichung der Runde ist 83,34. Ist groß. Eine hohe Standardabweichung weist darauf hin, dass die Datenpunkte über einen weiten Wertebereich verteilt sind.
Asymmetrie bedeutet, dass sie in einem VariableIn Statistik und Mathematik, ein "Variable" ist ein Symbol, das einen Wert darstellt, der sich ändern oder variieren kann. Es gibt verschiedene Arten von Variablen, und qualitativ, die nicht-numerische Eigenschaften beschreiben, und quantitative, numerische Größen darstellen. Variablen sind grundlegend in Experimenten und Studien, da sie die Analyse von Beziehungen und Mustern zwischen verschiedenen Elementen ermöglichen, das Verständnis komplexer Phänomene zu erleichtern.....

- Wenn Asymmetrie> 0 -> Verteilung nach rechts schief
- Bei Schieflage ist die Verteilung nach links schief
- Wenn schief = 0 -> symmetrische Verteilung.
Deswegen, während die städtische Bevölkerung nach links verzerrt ist, Vergewaltigung ist nach rechts verdreht.
Die Kurtosis zeigt, ob die Verteilung scharf oder abgeflacht ist.

- Wenn die Kurtosis> 3 -> Verteilung ist scharf
- Wenn die Kurtosis flacht die Verteilung ab
- Wenn die Kurtosis = 3 -> Verteilung ist Standard normal
A) Ja, während die städtische Bevölkerung stark verteilt ist, der Angriff wird zerquetscht verteilt.
2. Fehlende Werte erkennen

- Wie in der Abbildung"Abbildung" ist ein Begriff, der in verschiedenen Zusammenhängen verwendet wird, Von der Kunst zur Anatomie. Im künstlerischen Bereich, bezieht sich auf die Darstellung menschlicher oder tierischer Formen in Skulpturen und Gemälden. In der Anatomie, bezeichnet die Form und Struktur des Körpers. Was ist mehr, in der Mathematik, "Abbildung" Es hängt mit geometrischen Formen zusammen. Seine Vielseitigkeit macht es zu einem grundlegenden Konzept in mehreren Disziplinen...., es gibt keine fehlenden Werte in den Daten.
3. Erkennung atypischer Werte
Eine Kombination ungewöhnlicher Werte in mindestens zwei Variablen ist ein multivariater Ausreißer. Die Wirkung statistischer Studien kann durch alle Arten von Ausreißern beeinflusst werden. Sie können statistische Analysen verzerren und Ihre Annahmen verletzen.
Beweisen wir sowohl multivariate als auch individuelle Ausreißer.
Die Funktion „plot_outlier“ es ist eine sehr nützliche Funktion in der Bibliothek „dlookr“. Zeigt an BoxplotsBox-Diagramme, Auch bekannt als Box- und Whisker-Diagramme, sind statistische Werkzeuge, die die Verteilung eines Datensatzes darstellen. Diese Diagramme zeigen den Median, Quartile und Ausreißer, Ermöglicht die Visualisierung von Datenvariabilität und -symmetrie. Sie sind nützlich für den Vergleich zwischen verschiedenen Gruppen und in der explorativen Analyse, So lassen sich Trends und Muster in den Daten leichter erkennen.... e HistogrammeHistogramme sind grafische Darstellungen, die die Verteilung eines Datensatzes darstellen. Sie werden konstruiert, indem der Wertebereich in Intervalle unterteilt wird, Ö "Behälter", und zählen, wie viele Daten in jedem Intervall fallen. Diese Visualisierung ermöglicht es Ihnen, Muster zu erkennen, Trends und Variabilität von Daten effektiv, Erleichterung statistischer Analysen und fundierter Entscheidungsfindung in verschiedenen Disziplinen.... aller numerischen Variablen mit Ausreißern und ohne Ausreißer. Der Grund für Boxplots-Shows ist, dass sie sehr nützliche Werkzeuge sind, um Ausreißer zu visualisieren.




Wie in den Diagrammen zu sehen, nur Verletzungsvariablen haben Ausreißer. Was ist mehr, wenn wir uns das Histogramm ohne Ausreißer ansehen, seine Form ist symmetrischer.
Werfen wir einen Blick auf multivariate Ausreißer. (ist sehr nützlich in der multivariaten Analyse, nur ein beispiel lass es uns dir zeigen)

Wie es aussieht, Es gibt 7 Ausreißer in den Daten.
4. Annahmen prüfen
Weiter mit statistischen Methoden, Es ist wichtig, die Normalität einzuschätzen. Diese Annahme ermöglicht es uns, Konfidenzintervalle zu konstruieren und Hypothesentests durchzuführen.. Um die Normalität zu überprüfen, Es gibt keine beste Methode, die unter allen Bedingungen richtig ist. Es ist sehr praktisch, grafische Ansätze zu verwenden, um die multivariate Normalität zu bestimmen, zusätzlich zu den numerischen Ergebnissen. Es kann sinnvoll sein, sie zu kombinieren, um genauere Optionen anzubieten.




- Keine der Variablen erscheint normal, wenn man sich das Histogramm und das QQ-Diagramm ansieht, und Histogramme sehen nach Quadrat- und logarithmischer Wurzeltransformation nicht normal aus.
4. Visualisierungen
In diesem Teil, Wir können verschiedene Graphen von Variablen und die Beziehung zwischen Variablen visuell beobachten. Lass uns ein paar Forschungsfragen schreiben.
4.1. In welcher Stadt gibt es mehr Morde?
Zu dieser Frage, Wir können Karte oder BalkengrafikDas Balkendiagramm ist eine visuelle Darstellung von Daten, die rechteckige Balken verwendet, um Vergleiche zwischen verschiedenen Kategorien anzuzeigen. Jeder Balken stellt einen Wert dar, und seine Länge ist proportional zu ihm. Diese Art von Diagramm ist nützlich, um Trends zu visualisieren und zu analysieren, Erleichterung der Interpretation quantitativer Informationen. Es ist in verschiedenen Disziplinen weit verbreitet, wie z.B. Statistiken, Marketing und Forschung, Aufgrund seiner Einfachheit und Effektivität.....

Der R-Code für das Diagramm unten ist:

! Funktion () {„streng tragen“; window.addEventListener („Botschaft“, (Funktion (ein) {Wenn (Leere 0! == a.daten[„Datenwrapper-Höhe“]) zu (var e en a.data[„Datenwrapper-Höhe“]) {var t = document.getElementById („datawrapper-Diagramm -“ + e) || document.querySelector („iframe[src*=’“+e+“‘]”); T && (t.style.height = a.data[„Datenwrapper-Höhe“][e]+ ”Px”)}}))} ();
- Wie du siehst, Die meisten Morde wurden in Georgien begangen.
4.2. Was sind die Werte aller Variablen in jeder Stadt??

4.3. Was ist der Zusammenhang zwischen Körperverletzung und Mord??
Zu dieser Frage, wir können ein interaktives Diagramm wie das oben gezeigte zeichnen, um die Namen der Staaten zu sehen.
Die R-Codes für den interaktiven Rahmen sind:

! Funktion () {„streng tragen“; window.addEventListener („Botschaft“, (Funktion (ein) {Wenn (Leere 0! == a.daten[„Datenwrapper-Höhe“]) zu (var e en a.data[„Datenwrapper-Höhe“]) {var t = document.getElementById („datawrapper-Diagramm -“ + e) || document.querySelector („iframe[src*=’“+e+“‘]”); T && (t.style.height = a.data[„Datenwrapper-Höhe“][e]+ ”Px”)}}))} ();
Oder wir können es mit ggplot eintauchen.

Wie es aussieht, Es besteht ein positiver Zusammenhang zwischen Mord und Körperverletzung.
4.4. Welche Beziehung besteht zwischen Stadtbevölkerung und Vergewaltigung??


- Linie und Streuung zeigen die Beziehung zwischen zwei Variablen und am Rand sehen wir den Boxplot von zwei Variablen.
- Wir können sagen, dass es eine positive Beziehung zwischen der städtischen Bevölkerung und Vergewaltigung gibt.
4.5. Wie sind die Beziehungen der Variablen zueinander??
Sehen wir uns die Korrelation zwischen den Variablen an. Um das zu sehen, Wir können Hutkarten zeichnen.

Positive Korrelationen werden blau und negative Korrelationen rot dargestellt. Die Farbintensität ist proportional zu den Korrelationskoeffizienten. Betrachten wir die Korrelationsmatrix, Es zeigt sich, dass zwischen einigen Variablen ein starker positiver Zusammenhang besteht, wie z. B. Körperverletzung und Vergewaltigung, Körperverletzung und Mord.
Fazit
Fertigstellen, In diesem Artikel untersuchen wir die erklärende Datenanalyse und welche Arten von Visualisierungen wir für die erklärende Datenanalyse verwenden können. Wie oben erwähnt, Dies ist ein sehr entscheidender Schritt und sollte vor dem zukünftigen Engineering und der Modellerstellung durchgeführt werden, um die Daten besser zu verstehen. Sie können auf die Codes über den folgenden Link zugreifen.
https://github.com/iremtanriverdi/R_codes
Die in diesem Artikel zur explorativen Datenanalyse gezeigten Medien sind nicht Eigentum von DataPeaker und werden nach Ermessen des Autors verwendet.



