Statistiques pour la science des données | Comprendre les statistiques

Contenu

C'est la marque d'une personne vraiment intelligente que la statistique influence.

L'aspect le plus important de toute approche de la science des données est la façon dont l'information est traitée. Lorsque nous parlons de développer des connaissances à partir des données, il s'agit essentiellement d'explorer les possibilités. Ces possibilités en science des données sont connues sous le nom de Analyse statistique.

La plupart d'entre nous se demandent comment les modèles d'apprentissage automatique peuvent traiter facilement des données sous forme de texte, images, de vidéos et d'autres formats très non structurés. Mais, la vérité est qu'en réalité nous convertissons ces données en une forme numérique qui n'est pas exactement nos données, mais leur équivalent numérique. Ensuite, cela nous amène à un aspect très important de la science des données.

Avec des données au format numérique, cela nous offre d'innombrables possibilités pour comprendre les informations qu'elles contiennent. Les statistiques servent de moyen pour comprendre vos données et les traiter afin d'obtenir des résultats réussis. Le pouvoir des statistiques ne se limite pas seulement à comprendre les données, elles fournissent également des méthodes pour mesurer le succès de nos connaissances, obtenir différentes approches pour le même problème et trouver l'approche mathématique correcte pour vos données.

Importance des statistiques pour la science des données

La plupart des data scientists investissent toujours davantage dans le prétraitement des données. Cela nécessite une bonne compréhension des statistiques. Il y a quelques étapes générales qui doivent toujours être effectuées pour traiter n'importe quelle donnée.

  1. Identifier l'importance des caractéristiques en utilisant diverses tests statistiques.
  2. Trouver la relation entre les fonctions afin d'éliminer la possibilité de duplication des fonctions.
  3. Conversion des fonctions au format requis.
  4. Normaliser et mettre à l'échelle les données. Cette étape implique également l'identification de la distribution des données et de la nature des données.
  5. Prendre les données pour un traitement ultérieur en utilisant les ajustements nécessaires des données.
  6. Après traitement des données, Identifier l'approche / Modèle mathématique correct.
  7. Une fois que les résultats sont obtenus, Les résultats sont vérifiés selon les différentes échelles de mesure de précision.

Le traitement des données du début à la fin du cycle complet est une exigence en statistiques à chaque étape. C'est pourquoi un bon statisticien peut aussi être un bon data scientist.

Guide pour apprendre les statistiques

Il est toujours nécessaire de comprendre tous les aspects fondamentaux de la statistique. Cependant, la plupart des gens ne savent pas vraiment par où commencer.

Voici quelques concepts clés nécessaires pour accélérer la compréhension des fondamentaux de la statistique pour la science des données:

Probabilité

La probabilité est le besoin fondamental pour comprendre les chances. Pour commencer, Prenons un exemple très basique: Quelles sont les chances que l'équipe A gagne le match de football contre l'équipe B. Pour obtenir cette réponse, podríamos requerir que 100 personas den sus respectivos votos? Número de muestras. Basándonos en esos votos, podemos tener la posibilidad de qué equipo puede ganar el juego.

Mais, dans cet exemple, nos encontramos con otro concepto muy importante que se conoce como muestreo: identificar el conjunto correcto de personas para votar por los resultados. Ensuite, la probabilidad es la posibilidad de que el evento ocurra o no. Dependiendo del escenario, podemos construir diferentes soluciones en torno a esto.

Échantillonnage

El muestreo, como discutimos en el ejemplo anterior, identifica al grupo correcto de personas. La pregunta es cuál es el grupo de personas adecuado. Continuemos con nuestro ejemplo anterior para el escenario anterior, necesitamos a esas 100 personas que tienen un buen conocimiento del fútbol, qui connaissent l'histoire de l'équipe A et B, qui ne doivent pas être biaisés envers une équipe en raison de leurs préférences personnelles. Donc, l'identification de l'échantillon correct peut être réalisée par plusieurs approches statistiques. Il existe plusieurs types de méthodes d'échantillonnage: Échantillonnage aléatoire simple, Échantillonnage systématique, Échantillonnage stratifié, Échantillonnage par grappes, etc.

Tendance et distribution des données

La distribution des données est un aspect très important. La célèbre distribution comme la distribution normale est très significative. Par exemple, lorsque nous parlons de la distribution de la taille et du poids dans le monde, il s'agit de données distribuées normalement qui montrent la symétrie de la nature. La distribution normale doit avoir la moyenne, Mode et Médian coïncident au sommet central. On suppose que ces données sont des données très précises. Donc, Identifier la distribution et l'asymétrie des données est un concept très important.

Tests d'hypothèses

Si nous savons s'il faut entreprendre une action ou non. Si ces actions donneront un résultat positif ou négatif, alors nous pouvons avoir l'avantage supplémentaire de faire les bonnes choses. Le test d'hypothèse permet d'identifier la situation dans laquelle il faut ou non agir en fonction des résultats qu'elle produira. Il existe d'autres tests en plus des tests A / B, essai Z, Test T, hypothèse nulle avec une pertinence similaire.

Variations

Lorsque nous parlons de différentes variations dans les données. Nous parlons de distorsion, Erreur, déplacement des données. Avec les variations des données, l'étendue des données, la relation à l'intérieur des données. Tout cela explique la variabilité des données. Quelques-uns des termes clés à comprendre ici sont: variance, rang, écart-type, écart d'erreur, covariance, corrélation, causalité, etc.

Régression

La régression, en termes simples, consiste à trouver une relation entre les variables indépendantes et dépendantes. La régression peut être de deux types en termes généraux: régression linéaire, la régression linéaire multiple.

Régression linéaire – Y = aX + C

Régression multiple – Y = aX + bX1 + cX2 +…. + C

La statistique est un concept vaste qui ne se limite pas seulement à ce qui existe, mais à ce qui peut être dérivé des techniques existantes pour construire quelque chose de nouveau. Donc, La statistique est très importante pour la science des données, car elle aide à comprendre les solutions existantes et à découvrir de nouveaux développements.

Il y a toujours une manière de faire mieux: Trouvez-la et devenez un innovateur

31026images2016-1374449

Les médias présentés dans cet article ne sont pas la propriété de DataPeaker et sont utilisés à la discrétion de l'auteur.

Abonnez-vous à notre newsletter

Nous ne vous enverrons pas de courrier SPAM. Nous le détestons autant que vous.

Haut-parleur de données