C'est la marque d'une personne vraiment intelligente que la statistique influence.
L'aspect le plus important de toute approche de la science des données est la façon dont l'information est traitée. Lorsque nous parlons de développer des connaissances à partir des données, il s'agit essentiellement d'explorer les possibilités. Ces possibilités en science des données sont connues sous le nom de Analyse statistique.
La plupart d'entre nous se demandent comment les modèles d'apprentissage automatique peuvent traiter facilement des données sous forme de texte, images, de vidéos et d'autres formats très non structurés. Mais, la vérité est qu'en réalité nous convertissons ces données en une forme numérique qui n'est pas exactement nos données, mais leur équivalent numérique. Ensuite, cela nous amène à un aspect très important de la science des données.
Avec des données au format numérique, cela nous offre d'innombrables possibilités pour comprendre les informations qu'elles contiennent. Les statistiques servent de moyen pour comprendre vos données et les traiter afin d'obtenir des résultats réussis. Le pouvoir des statistiques ne se limite pas seulement à comprendre les données, elles fournissent également des méthodes pour mesurer le succès de nos connaissances, obtenir différentes approches pour le même problème et trouver l'approche mathématique correcte pour vos données.
Importance des statistiques pour la science des données
La plupart des data scientists investissent toujours davantage dans le prétraitement des données. Cela nécessite une bonne compréhension des statistiques. Il y a quelques étapes générales qui doivent toujours être effectuées pour traiter n'importe quelle donnée.
- Identifier l'importance des caractéristiques en utilisant diverses tests statistiques.
- Trouver la relation entre les fonctions afin d'éliminer la possibilité de duplication des fonctions.
- Conversion des fonctions au format requis.
- Normaliser et mettre à l'échelle les données. Cette étape implique également l'identification de la distribution des données et de la nature des données.
- Prendre les données pour un traitement ultérieur en utilisant les ajustements nécessaires des données.
- Après traitement des données, Identifier l'approche / Modèle mathématique correct.
- Une fois que les résultats sont obtenus, Les résultats sont vérifiés selon les différentes échelles de mesure de précision.
Le traitement des données du début à la fin du cycle complet est une exigence en statistiques à chaque étape. C'est pourquoi un bon statisticien peut aussi être un bon data scientist.
Guide pour apprendre les statistiques
Il est toujours nécessaire de comprendre tous les aspects fondamentaux de la statistique. Cependant, la plupart des gens ne savent pas vraiment par où commencer.
Voici quelques concepts clés nécessaires pour accélérer la compréhension des fondamentaux de la statistique pour la science des données:
Probabilité
La probabilité est le besoin fondamental pour comprendre les chances. Pour commencer, Prenons un exemple très basique: Quelles sont les chances que l'équipe A gagne le match de football contre l'équipe B. Pour obtenir cette réponse, podríamos requerir que 100 personas den sus respectivos votos? Número de muestras. Basándonos en esos votos, podemos tener la posibilidad de qué equipo puede ganar el juego.
Mais, dans cet exemple, nos encontramos con otro concepto muy importante que se conoce como muestreo: identificar el conjunto correcto de personas para votar por los resultados. Ensuite, la probabilidad es la posibilidad de que el evento ocurra o no. Dependiendo del escenario, podemos construir diferentes soluciones en torno a esto.
Échantillonnage
El muestreo, como discutimos en el ejemplo anterior, identifica al grupo correcto de personas. La pregunta es cuál es el grupo de personas adecuado. Continuemos con nuestro ejemplo anterior para el escenario anterior, necesitamos a esas 100 personas que tienen un buen conocimiento del fútbol, qui connaissent l'histoire de l'équipe A et B, qui ne doivent pas être biaisés envers une équipe en raison de leurs préférences personnelles. Donc, l'identification de l'échantillon correct peut être réalisée par plusieurs approches statistiques. Il existe plusieurs types de méthodes d'échantillonnage: Échantillonnage aléatoire simple, Échantillonnage systématique, Échantillonnage stratifié, Échantillonnage par grappes, etc.
Tendance et distribution des données
La distribution des données est un aspect très important. La célèbre distribution comme la distribution normale est très significative. Par exemple, lorsque nous parlons de la distribution de la taille et du poids dans le monde, il s'agit de données distribuées normalement qui montrent la symétrie de la nature. La distribution normale doit avoir la moyenne, Mode et MédianLa médiane est une mesure statistique qui représente la valeur centrale d’un ensemble de données ordonnées. Pour le calculer, Les données sont organisées de la plus basse à la plus élevée et le numéro au milieu est identifié. S’il y a un nombre pair d’observations, La moyenne des deux valeurs fondamentales est calculée. Cet indicateur est particulièrement utile dans les distributions asymétriques, puisqu’il n’est pas affecté par les valeurs extrêmes.... coïncident au sommet central. On suppose que ces données sont des données très précises. Donc, Identifier la distribution et l'asymétrie des données est un concept très important.
Tests d'hypothèses
Si nous savons s'il faut entreprendre une action ou non. Si ces actions donneront un résultat positif ou négatif, alors nous pouvons avoir l'avantage supplémentaire de faire les bonnes choses. Le test d'hypothèse permet d'identifier la situation dans laquelle il faut ou non agir en fonction des résultats qu'elle produira. Il existe d'autres tests en plus des tests A / B, essai Z, Test T, hypothèse nulleL’hypothèse nulle est un concept fondamental en statistique qui établit une déclaration initiale sur un paramètre de population. Son but est d’être testé et, s’il est réfuté, nous permet d’accepter l’hypothèse alternative. Cette approche est essentielle dans la recherche scientifique, car il fournit un cadre pour évaluer les preuves empiriques et prendre des décisions fondées sur des données. Sa formulation et son analyse sont cruciales dans les études statistiques.... avec une pertinence similaire.
Variations
Lorsque nous parlons de différentes variations dans les données. Nous parlons de distorsion, Erreur, déplacement des données. Avec les variations des données, l'étendue des données, la relation à l'intérieur des données. Tout cela explique la variabilité des données. Quelques-uns des termes clés à comprendre ici sont: variance, rang, écart-type, écart d'erreur, covariance, corrélation, causalité, etc.
Régression
La régression, en termes simples, consiste à trouver une relation entre les variables indépendantes et dépendantes. La régression peut être de deux types en termes généraux: régression linéaire, la régression linéaire multiple.
Régression linéaire – Y = aX + C
Régression multiple – Y = aX + bX1 + cX2 +…. + C
La statistique est un concept vaste qui ne se limite pas seulement à ce qui existe, mais à ce qui peut être dérivé des techniques existantes pour construire quelque chose de nouveau. Donc, La statistique est très importante pour la science des données, car elle aide à comprendre les solutions existantes et à découvrir de nouveaux développements.
Il y a toujours une manière de faire mieux: Trouvez-la et devenez un innovateur

Les médias présentés dans cet article ne sont pas la propriété de DataPeaker et sont utilisés à la discrétion de l'auteur.
En rapport
Articles Similaires:
- Délimiteurs dans Pandas read_csv | Comprendre les délimiteurs chez les pandas
- Système de recommandations: comprendre les bases
- Statistiques pour la science des données | Guide du débutant en statistiques pour la science des données
- Statistiques de commande | Quelles sont les statistiques de commande?



