Es ist das Kennzeichen einer wirklich intelligenten Person, dass sie von Statistik bewegt wird.
Der wichtigste Aspekt eines jeden Ansatzes in der Datenwissenschaft ist, wie Informationen verarbeitet werden. Wenn wir darüber sprechen, Wissen aus Daten zu entwickeln, geht es im Grunde darum, die Möglichkeiten zu erkunden. Diese Möglichkeiten in der Datenwissenschaft sind bekannt als Statistische Analyse.
Die meisten von uns fragen sich, wie Modelle des maschinellen Lernens leicht Daten in Form von Text, Bilder, Videos und anderen stark unstrukturierten Formaten verarbeiten können. Aber, Die Wahrheit ist, dass wir diese Daten tatsächlich in eine numerische Form umwandeln, die nicht genau unsere Daten sind, sondern ihr numerisches Äquivalent. Dann, Das führt uns zum sehr wichtigen Aspekt der Datenwissenschaft.
Mit Daten im numerischen Format, bietet es uns unendliche Möglichkeiten, die daraus gewonnenen Informationen zu verstehen. Statistiken dienen als Mittel, um Ihre Daten zu verstehen und zu verarbeiten, um erfolgreiche Ergebnisse zu erzielen. Die Macht der Statistik beschränkt sich nicht nur darauf, Daten zu verstehen, sondern bietet auch Methoden, um den Erfolg unseres Wissens zu messen, verschiedene Ansätze für dasselbe Problem zu erhalten und den richtigen mathematischen Ansatz für Ihre Daten zu finden.
Bedeutung der Statistik für die Datenwissenschaft
Die meisten Data Scientists investieren immer mehr in die Datenvorverarbeitung. Dies erfordert ein gutes Verständnis der Statistik. Es gibt einige allgemeine Schritte, die immer durchgeführt werden müssen, um beliebige Daten zu verarbeiten.
- Bestimmen Sie die Bedeutung der Merkmale mittels verschiedener statistischer Tests.
- Finden Sie die Beziehung zwischen den Funktionen, um die Möglichkeit der Duplizierung von Funktionen auszuschließen.
- Umwandlung der Funktionen in das erforderliche Format.
- Daten normalisieren und skalieren. Dieser Schritt beinhaltet auch die Identifizierung der Datenverteilung und der Art der Daten.
- Daten für die weitere Verarbeitung unter Verwendung der erforderlichen Anpassungen vorbereiten.
- Nach der Verarbeitung der Daten, Ansatz identifizieren / das richtige mathematische Modell.
- Sobald die Ergebnisse vorliegen, werden die Ergebnisse in den verschiedenen Maßstabsbereichen der Genauigkeit überprüft.
Die Datenverarbeitung vom Anfang bis zum Ende des gesamten Zyklus ist eine Voraussetzung für Statistiken in jedem Schritt. Deshalb kann ein guter Statistiker auch ein guter Data Scientist sein.
Leitfaden zum Erlernen von Statistik
Es ist immer notwendig, alle grundlegenden Aspekte der Statistik zu verstehen. Aber trotzdem, Die meisten Menschen wissen nicht genau, wo sie anfangen sollen.
Dies sind die wenigen Schlüsselkonzepte, die erforderlich sind, um die Grundlagen der Statistik für Data Science zu beschleunigen und zu verstehen:
Wahrscheinlichkeit
Wahrscheinlichkeit ist die grundlegende Notwendigkeit, um Möglichkeiten zu verstehen. um anzufangen, Lassen Sie uns ein sehr einfaches Beispiel nehmen: Wie stehen die Chancen, dass Team A das Fußballspiel gegen Team B gewinnt. Para obtener esta respuesta, podríamos requerir que 100 personas den sus respectivos votos? Número de muestras. Basándonos en esos votos, podemos tener la posibilidad de qué equipo puede ganar el juego.
Aber, in diesem Beispiel, nos encontramos con otro concepto muy importante que se conoce como muestreo: identificar el conjunto correcto de personas para votar por los resultados. Dann, la probabilidad es la posibilidad de que el evento ocurra o no. Dependiendo del escenario, podemos construir diferentes soluciones en torno a esto.
Probenahme
El muestreo, como discutimos en el ejemplo anterior, identifica al grupo correcto de personas. La pregunta es cuál es el grupo de personas adecuado. Continuemos con nuestro ejemplo anterior para el escenario anterior, necesitamos a esas 100 personas que tienen un buen conocimiento del fútbol, die die Geschichte der Teams A und B kennen, die nicht aufgrund persönlicher Vorlieben zugunsten eines Teams voreingenommen sein sollten. Deswegen, die korrekte Identifizierung der Stichprobe kann durch verschiedene statistische Ansätze erfolgen. Es gibt verschiedene Arten von Stichprobenmethoden: Einfache Zufallsstichprobe, Systematische Stichprobe, Geschichtete Stichprobe, Clusterstichprobe, etc.
Datenverteilung und -tendenz
Die Datenverteilung ist ein sehr wichtiger Aspekt. Die berühmte Verteilung wie die Normalverteilung ist sehr bedeutsam. Zum Beispiel, wenn wir über die Verteilung von Größe und Gewicht der Welt sprechen, es handelt sich um normalverteilte Daten, die die Symmetrie der Natur zeigen. Die Normalverteilung hat Mittelwert, Modus und MedianDer Median ist ein statistisches Maß, das den zentralen Wert eines Satzes geordneter Daten darstellt. Um es zu berechnen, Die Daten werden von der niedrigsten zur höchsten sortiert und die Zahl in der Mitte wird identifiziert. Wenn es eine gerade Anzahl von Beobachtungen gibt, Die beiden Kernwerte werden gemittelt. Dieser Indikator ist besonders nützlich bei asymmetrischen Verteilungen, da es nicht von Extremwerten beeinflusst wird.... stimmen an der zentralen Spitze überein. Es wird angenommen, dass diese Daten sehr genau sind. Deswegen, Die Verteilung und die Schiefe der Daten zu identifizieren, ist ein sehr wichtiges Konzept.
Hypothesentest
Wenn wir wissen, ob eine Handlung durchgeführt werden soll oder nicht. Ob diese Handlungen ein positives oder negatives Ergebnis bringen werden, Dann können wir den zusätzlichen Vorteil haben, die richtigen Dinge zu tun. Der Hypothesentest liefert die Identifizierung der Situation, in der basierend auf den Ergebnissen gehandelt werden sollte oder nicht. Es gibt neben den A-Tests noch andere Tests / B, Z-Test, T-Test, NullhypotheseDie Nullhypothese ist ein grundlegendes Konzept in der Statistik, das eine anfängliche Aussage über einen Populationsparameter festlegt. Sein Zweck ist es,, falls widerlegt, ermöglicht es uns, die Alternativhypothese zu akzeptieren. Dieser Ansatz ist für die wissenschaftliche Forschung unerlässlich, da sie einen Rahmen für die Bewertung empirischer Evidenz und das Treffen datengestützter Entscheidungen bietet. Seine Formulierung und Analyse sind für statistische Studien von entscheidender Bedeutung.... mit ähnlicher Relevanz.
Variationen
Wenn wir über verschiedene Variationen in den Daten sprechen. Sprechen wir über Verzerrung, Error, Datenverschiebung. Zusammen mit den Variationen in den Daten, der Datenbereich, die Beziehung innerhalb der Daten. Todo esto explica la variabilidad de los datos. Algunos de los términos clave para comprender aquí son: Abweichung, Rang, Standardabweichung, desviación de error, kovarianza, Korrelation, causalidad, etc.
Rückschritt
La regresión en términos simples es encontrar una relación entre las variables independientes y dependientes. La regresión puede ser de dos tipos en términos generales: lineare Regression, multiple lineare Regression.
Lineare Regression – Y = aX + C
Regresión multilineal – Y = aX + bX1 + cX2 +.... + C
La estadística es un concepto amplio que se limita no solo a lo que existe, sino a lo que se puede derivar de las técnicas existentes para construir algo nuevo. Deswegen, la estadística es muy importante para la ciencia de datos, ya que ayuda a comprender las soluciones existentes y a descubrir nuevos desarrollos.
Siempre hay una manera de hacerlo mejor: encuéntrelo y conviértase en un innovador

Die in diesem Artikel gezeigten Medien sind nicht Eigentum von DataPeaker und werden nach Ermessen des Autors verwendet.



