É a marca de uma pessoa verdadeiramente inteligente que a estatística comanda.
O aspeto mais importante de qualquer abordagem de ciência de dados é como a informação é processada. Quando falamos de desenvolver conhecimento a partir de dados, basicamente trata-se de explorar as possibilidades. Essas possibilidades na ciência de dados são conhecidas como Análise estatística.
A maioria de nós pergunta-se como os modelos de aprendizagem automática podem processar facilmente dados em forma de texto, imagens, vídeos e outros formatos altamente desestruturados. Mas, a verdade é que na realidade convertemos esses dados numa forma numérica que não é exatamente os nossos dados, mas o seu equivalente numérico. Então, esto nos lleva al aspect muy importante de la science de datos.
Con datos en formato numérico, nos brinda infinitas posibilidades para compreender la información que sale de ellos. Las estadísticas actúan como una vía para compreender sus datos y processarlos para obter resultados exitosos. No solo el poder de las estadísticas se limita a comprender los datos, sino que también proporciona métodos para medir el éxito de nuestros conocimientos, obtener diferentes enfoques para el mismo problema y obter el enfoque matemático correcto para sus datos.
Importancia de las estadísticas para la ciencia de datos
La mayoría de los científicos de datos siempre invierten más en el preprocesamiento de datos. Esto requiere una buena compreensão de las estadísticas. Hay algunos pasos gerais que sempre devem realizarse para processar qualquer dato.
- Identifique la importancia de las características mediante el uso de varias pruebas estadísticas.
- Encontrar la relación entre las funciones para eliminar la posibilidad de que se dupliquen las funciones.
- Conversion de las funciones al formato requerido.
- Normalizar y escalar los datos. Este paso también implica la identificación de la distribución de datos y la naturaleza de los datos.
- Tomando los datos para su posterior procesamiento mediante el uso de los ajustes necesarios en los datos.
- Após o processamento dos dados, identifique el enfoque / modelo matemático correcto.
- Una vez que se obtienen los resultados, os resultados verificam-se nas diferentes escalas de medição de precisão.
O processamento de dados desde o início até ao fim do ciclo completo é um requisito da estatística em cada etapa. É por isso que um bom estatístico também pode ser um bom cientista de dados.
Guia para aprender estatística
É sempre necessário compreender todos os aspetos fundamentais da estatística. Porém, a maior parte das pessoas não tem bem claro por onde começar.
Estes são os poucos conceitos-chave que são necessários para acelerar e compreender os fundamentos da estatística para a ciência de dados:
Probabilidade
A probabilidade é a necessidade básica para compreender as possibilidades. Para começar, vamos tomar um exemplo muito básico: ¿Cuáles son las posibilidades de que el equipo A gane el partido de fútbol contra el equipo B. Para obtener esta respuesta, podríamos requerir que 100 personas den sus respectivos votos? Número de muestras. Basándonos en esos votos, podemos tener la posibilidad de qué equipo puede ganar el juego.
Mas, neste exemplo, nos encontramos con otro concepto muy importante que se conoce como muestreo: identificar el conjunto correcto de personas para votar por los resultados. Então, la probabilidad es la posibilidad de que el evento ocurra o no. Dependiendo del escenario, podemos construir diferentes soluciones en torno a esto.
Amostragem
El muestreo, como discutimos en el ejemplo anterior, identifica al grupo correcto de personas. La pregunta es cuál es el grupo de personas adecuado. Continuemos con nuestro ejemplo anterior para el escenario anterior, necesitamos a esas 100 personas que tienen un buen conocimiento del fútbol, que conhecemos la historia da equipa A y B, que não devem estar sesgadas contra um equipo debido a suas preferências pessoais. Portanto, a identificação da mostra correta se pode realizar mediante vários enfoques estatísticas. Existem vários tipos de métodos de mostrar: Muestreo aleatória simples, Muestreo sistemático, Muestreo estratificado, Muestreo agrupado, etc.
Tendencia y distribución de datos
A distribuição de dados é um aspecto muy importante. La famosa distribución como Distribución Normal es muy significativa. Por exemplo, quando falamos de la distribución de la altura y el peso del mundo, se trata de dados distribuídos normalmente que mostram a simetría de la naturaleza. La distribución normal tiene que Media, Moda y MedianaA mediana é uma medida estatística que representa o valor central de um conjunto de dados ordenados. Para calculá-lo, Os dados são organizados do menor para o maior e o número no meio é identificado. Se houver um número par de observações, Os dois valores principais são calculados em média. Este indicador é especialmente útil em distribuições assimétricas, uma vez que não é afetado por valores extremos.... coinciden en el pico central. Se supone que estes datos son datos muy precisos. Portanto, identificar la distribución y la asimetría de los datos es un conceito muy importante.
Testando hipóteses
Si sabemos si realizar alguma ação o não. Si esas ações darán un resultado positivo o negativo, entonces podemos tener la ventaja adicional de hacer las cosas correctas. La prueba de hipótesis proporciona la identificação de la situation en la que se debe tomar o no la action en función de los resultados que producirá. Hay otras pruebas además de las pruebas A / B, Teste Z, Teste t, hipótese nulaA hipótese nula é um conceito fundamental em estatística que estabelece uma declaração inicial sobre um parâmetro populacional. Seu objetivo é ser testado e, se refutado, nos permite aceitar a hipótese alternativa. Essa abordagem é essencial na pesquisa científica, pois fornece uma estrutura para avaliar evidências empíricas e tomar decisões baseadas em dados. Sua formulação e análise são cruciais em estudos estatísticos.... con relevancia similar.
Variaciones
Cuando hablamos de diferentes variaciones en los datos. Falamos de distorção, erro, deslocamento de dados. Juntamente com as variações nos dados, o intervalo dos dados, a relação dentro dos dados. Tudo isto explica a variabilidade dos dados. Alguns dos termos-chave para compreender aqui são: variância, classificação, Desvio padrão, desvio de erro, Covarianza, correlação, causalidade, etc.
Regressão
A regressão, em termos simples, é encontrar uma relação entre as variáveis independentes e dependentes. A regressão pode ser de dois tipos em termos gerais: regressão linear, Regressão linear múltipla.
Regressão linear – Y = aX + C
Regressão múltipla – Y = aX + bX1 + cX2 +.... + C
A estatística é um conceito amplo que não se limita apenas ao que existe, mas também ao que se pode derivar das técnicas existentes para construir algo novo. Portanto, A estatística é muito importante para a ciência de dados, já que ajuda a compreender as soluções existentes e a descobrir novos desenvolvimentos.
Há sempre uma maneira de fazer melhor: encontre-a e torne-se um inovador

A mídia mostrada neste artigo não é propriedade da DataPeaker e é usada a critério do autor.



