Análise exploratória de dados | Guia para iniciantes em análise de dados explicativos

Conteúdo

Introdução

908751t8d6pcrhaz3gzn31y-u0pa-9973427

Como todos sabemos, existem certos processos para analisar dados. Primeiro, nós definimos o problema, então extraímos os dados e os preparamos para análise. Antes da futura engenharia e construção de modelos, há um passo importante.

336660wunzpjh43habilcy-3656588

A análise exploratória de dados refere-se ao processo crítico de realização de pesquisas iniciais de dados para descobrir padrões, detectar anomalias e verificar suposições com a ajuda de estatísticas resumidas e representações gráficas. A análise exploratória de dados é uma etapa importante antes de você começar a analisar ou modelar seus dados.. Fornece o contexto necessário para desenvolver um modelo apropriado e interpretar os resultados corretamente.

Vejamos um exemplo de implementação de R.

1. Descoberta de dados

Nesta parte, descobrimos os tipos de variáveis ​​e suas estatísticas de resumo nos dados. Primeiro, carregamos o conjunto de dados USArests em R. Em seguida, imprimimos o conjunto de dados usando a função “headTail” que imprime o conjunto de dados do primeiro 4 e por ultimo 4 linhas por padrão.

37971ekran20resmi202021-04-212013-22-17-2966598

Em seguida, procuramos por tipos de variáveis ​​e estatísticas de resumo das variáveis.

As funções “vislumbrar” e “str” Eles nos fornecem tipos de variáveis.

44948ekran20resmi202021-04-212013-26-20-2006313

A função “profiling_num” na biblioteca funModeling nos dá estatísticas detalhadas como média, o desvio padrão, assimetria, curtose, o intervalo interquartil, etc.

41825ekran20resmi202021-04-212013-28-24-3489380

Vamos interpretar alguns resultados como um exemplo:

  • Em média, assassinato em cada cidade é 7.788.
  • O desvio padrão da rodada é 83,34. É alto. Um alto desvio padrão indica que os pontos de dados são distribuídos em uma ampla gama de valores.

Assimetria não é ser simétrico em um variável.

20998fórmula de assimetria-7011098
  • Se assimetria> 0 -> distribuição enviesada certa
  • Se a inclinação da distribuição for para a esquerda
  • Se assimetria = 0 -> distribuição simétrica.

Portanto, enquanto a população urbana está inclinada para a esquerda, O estupro é inclinado para a direita.

A curtose mostra se a distribuição é nítida ou achatada.

15816fórmula de curtose-3940283
  • Se a curtose> 3 -> distribuição é nítida
  • Se a curtose a distribuição achatar
  • Se a curtose = 3 -> distribuição é normal padrão

A) Sim, enquanto a população urbana é fortemente distribuída, o ataque é distribuído esmagado.

2. Detectar valores ausentes

73260ekran20resmi202021-04-212013-52-00-3669889
  • Como visto no figura, não há valores ausentes nos dados.

3. Detecção de valores atípicos

Uma combinação de valores incomuns em pelo menos duas variáveis ​​é um outlier multivariado. O efeito dos estudos estatísticos pode ser afetado por todos os tipos de outliers. Eles podem distorcer as análises estatísticas e violar suas suposições.

Vamos provar outliers multivariados e individuais.

A função “plot_outlier” é uma função muito útil na biblioteca “dlookr”. Shows plotagens de caixa e histogramas de todas as variáveis numéricas com valores atípicos e sem valores anómalos. O motivo dos shows do Boxplots é que eles são ferramentas muito úteis para visualizar valores discrepantes.

21982ekran20resmi202021-04-212013-59-38-7625782
51775ekran20resmi202021-04-212013-59-47-6163278
91703ekran20resmi202021-04-212013-59-56-1152529
78480ekran20resmi202021-04-212014-00-03-7373866

Como pode ser visto nos gráficos, apenas as variáveis ​​de violação têm outliers. O que mais, quando olhamos para o histograma sem outliers, sua forma é mais simétrica.

Vamos dar uma olhada em outliers multivariados. (é muito útil em análises multivariadas, apenas um exemplo, deixe-nos mostrar a você)

80834ekran20resmi202021-04-212014-06-35-3228285

Como se vê, existem 7 outliers nos dados.

4. Verificando suposições

Para continuar com os métodos estatísticos, é importante avaliar a normalidade. Essa suposição nos permite construir intervalos de confiança e realizar testes de hipóteses.. Para verificar a normalidade, não há melhor método que seja correto em todas as condições. É muito conveniente usar abordagens gráficas para decidir a normalidade multivariada, além dos resultados numéricos. Pode ser útil combiná-los para oferecer opções mais precisas.

15701ekran20resmi202021-04-212014-10-40-6488305
26028ekran20resmi202021-04-212014-10-46-1014085
40118ekran20resmi202021-04-212014-10-53-2188309
12054ekran20resmi202021-04-212014-10-59-7145667
  • Nenhuma das variáveis ​​parece normal ao olhar para o histograma e o gráfico QQ, e os histogramas não parecem normais após a transformação de raiz quadrada e logarítmica.

4. Visualizações

Nesta parte, podemos observar diferentes gráficos de variáveis ​​e a relação entre as variáveis ​​visualmente. Vamos escrever algumas questões de pesquisa.

4.1. Em que cidade ocorrem mais assassinatos?

Para esta questão, Podemos usar mapa ou gráfico de barras.

54783ekran20resmi202021-04-212014-30-16-9216523

O código R para o gráfico abaixo é:

39523ekran20resmi202021-04-212015-06-49-2639564

! função () {“usar rigoroso”; window.addEventListener (“mensagem”, (Função (uma) {E se (vazio 0! == a.data[“Datawrapper-height”]) para (var e en a.data[“Datawrapper-height”]) {var t = document.getElementById (“datawrapper-chart -” + e) ​​|| document.querySelector (“iframe[src * = ’” + e + ”‘]”); T && (t.style.height = a.data[“Datawrapper-height”][e]+ ”Px”)}}))} ();

  • Como você pode ver, a maioria dos assassinatos foi cometida na Geórgia.

4.2. Quais são os valores de todas as variáveis ​​em cada cidade?

69707ekran20resmi202021-04-212021-08-25-2055521

4.3. Qual é a relação entre agressão e assassinato?

Para esta questão, podemos desenhar um gráfico interativo como o mostrado acima para ver os nomes dos estados.

Os códigos R para o quadro interativo são:

85910ekran20resmi202021-04-212015-45-01-1835458

! função () {“usar rigoroso”; window.addEventListener (“mensagem”, (Função (uma) {E se (vazio 0! == a.data[“Datawrapper-height”]) para (var e en a.data[“Datawrapper-height”]) {var t = document.getElementById (“datawrapper-chart -” + e) ​​|| document.querySelector (“iframe[src * = ’” + e + ”‘]”); T && (t.style.height = a.data[“Datawrapper-height”][e]+ ”Px”)}}))} ();

Ou podemos mergulhar usando ggplot.

93494ekran20resmi202021-04-212015-23-48-9681282

Como se vê, existe uma relação positiva entre assassinato e agressão.

4.4. Qual é a relação entre população urbana e estupro?

79208ekran20resmi202021-04-212015-29-11-9001486
70991ekran20resmi202021-04-212015-29-20-3103869
  • A linha e a dispersão mostram a relação entre duas variáveis ​​e nas margens vemos o gráfico de caixa de duas variáveis.
  • Podemos dizer que existe uma relação positiva entre a população urbana e o estupro.

4.5. Quais são as relações das variáveis ​​entre si?

Vamos ver a correlação entre as variáveis. Para ver isso, podemos desenhar mapas de chapéus.

71125ekran20resmi202021-04-212015-36-03-7633276

Correlações positivas são mostradas em azul e correlações negativas em vermelho. A intensidade da cor é proporcional aos coeficientes de correlação. Quando olhamos para a matriz de correlação, Vê-se que entre algumas variáveis ​​existe uma forte relação positiva como agressão e estupro, agressão e assassinato.

conclusão

Para concluir, Neste artigo, examinamos a análise de dados explicativos e quais tipos de visualização podemos usar para a análise de dados explicativos. Como afirmado acima, é uma etapa muito crucial e deve ser realizada antes da futura engenharia e construção de modelo para melhor compreender os dados. Você pode acessar os códigos no link abaixo.

https://github.com/iremtanriverdi/R_codes

A mídia mostrada neste artigo de análise exploratória de dados não é propriedade da DataPeaker e é usada a critério do autor.

Assine a nossa newsletter

Nós não enviaremos SPAM para você. Nós odiamos isso tanto quanto você.

Datapeaker