Introdução

Como todos sabemos, existem certos processos para analisar dados. Primeiro, nós definimos o problema, então extraímos os dados e os preparamos para análise. Antes da futura engenharia e construção de modelos, há um passo importante.

A análise exploratória de dados refere-se ao processo crítico de realização de pesquisas iniciais de dados para descobrir padrões, detectar anomalias e verificar suposições com a ajuda de estatísticas resumidas e representações gráficas. A análise exploratória de dados é uma etapa importante antes de você começar a analisar ou modelar seus dados.. Fornece o contexto necessário para desenvolver um modelo apropriado e interpretar os resultados corretamente.
Vejamos um exemplo de implementação de R.
1. Descoberta de dados
Nesta parte, descobrimos os tipos de variáveis e suas estatísticas de resumo nos dados. Primeiro, carregamos o conjunto de dados USArests em R. Em seguida, imprimimos o conjunto de dados usando a função “headTail” que imprime o conjunto de dados do primeiro 4 e por ultimo 4 linhas por padrão.

Em seguida, procuramos por tipos de variáveis e estatísticas de resumo das variáveis.
As funções “vislumbrar” e “str” Eles nos fornecem tipos de variáveis.

A função “profiling_num” na biblioteca funModeling nos dá estatísticas detalhadas como média, o desvio padrão, assimetria, curtose, o intervalo interquartil, etc.

Vamos interpretar alguns resultados como um exemplo:
- Em média, assassinato em cada cidade é 7.788.
- O desvio padrão da rodada é 83,34. É alto. Um alto desvio padrão indica que os pontos de dados são distribuídos em uma ampla gama de valores.
Assimetria não é ser simétrico em um variávelEm estatística e matemática, uma "variável" é um símbolo que representa um valor que pode mudar ou variar. Existem diferentes tipos de variáveis, e qualitativo, que descrevem características não numéricas, e quantitativo, representando quantidades numéricas. Variáveis são fundamentais em experimentos e estudos, uma vez que permitem a análise de relações e padrões entre diferentes elementos, facilitando a compreensão de fenômenos complexos.....

- Se assimetria> 0 -> distribuição enviesada certa
- Se a inclinação da distribuição for para a esquerda
- Se assimetria = 0 -> distribuição simétrica.
Portanto, enquanto a população urbana está inclinada para a esquerda, O estupro é inclinado para a direita.
A curtose mostra se a distribuição é nítida ou achatada.

- Se a curtose> 3 -> distribuição é nítida
- Se a curtose a distribuição achatar
- Se a curtose = 3 -> distribuição é normal padrão
A) Sim, enquanto a população urbana é fortemente distribuída, o ataque é distribuído esmagado.
2. Detectar valores ausentes

- Como visto no figura"Figura" é um termo usado em vários contextos, Da arte à anatomia. No campo artístico, refere-se à representação de formas humanas ou animais em esculturas e pinturas. Em anatomia, designa a forma e a estrutura do corpo. O que mais, em matemática, "figura" está relacionado a formas geométricas. Sua versatilidade o torna um conceito fundamental em várias disciplinas...., não há valores ausentes nos dados.
3. Detecção de valores atípicos
Uma combinação de valores incomuns em pelo menos duas variáveis é um outlier multivariado. O efeito dos estudos estatísticos pode ser afetado por todos os tipos de outliers. Eles podem distorcer as análises estatísticas e violar suas suposições.
Vamos provar outliers multivariados e individuais.
A função “plot_outlier” é uma função muito útil na biblioteca “dlookr”. Shows plotagens de caixaDiagramas de caixa, Também conhecido como diagramas de caixa e bigode, são ferramentas estatísticas que representam a distribuição de um conjunto de dados. Esses diagramas mostram a mediana, Quartis e outliers, permitindo que a variabilidade e a simetria dos dados sejam visualizadas. Eles são úteis na comparação entre diferentes grupos e na análise exploratória, facilitando a identificação de tendências e padrões nos dados.... e histogramasHistogramas são representações gráficas que mostram a distribuição de um conjunto de dados. Eles são construídos dividindo o intervalo de valores em intervalos, o "Caixas", e contando quantos dados caem em cada intervalo. Essa visualização permite identificar padrões, tendências e variabilidade de dados de forma eficaz, facilitando a análise estatística e a tomada de decisões informadas em várias disciplinas.... de todas as variáveis numéricas com valores atípicos e sem valores anómalos. O motivo dos shows do Boxplots é que eles são ferramentas muito úteis para visualizar valores discrepantes.




Como pode ser visto nos gráficos, apenas as variáveis de violação têm outliers. O que mais, quando olhamos para o histograma sem outliers, sua forma é mais simétrica.
Vamos dar uma olhada em outliers multivariados. (é muito útil em análises multivariadas, apenas um exemplo, deixe-nos mostrar a você)

Como se vê, existem 7 outliers nos dados.
4. Verificando suposições
Para continuar com os métodos estatísticos, é importante avaliar a normalidade. Essa suposição nos permite construir intervalos de confiança e realizar testes de hipóteses.. Para verificar a normalidade, não há melhor método que seja correto em todas as condições. É muito conveniente usar abordagens gráficas para decidir a normalidade multivariada, além dos resultados numéricos. Pode ser útil combiná-los para oferecer opções mais precisas.




- Nenhuma das variáveis parece normal ao olhar para o histograma e o gráfico QQ, e os histogramas não parecem normais após a transformação de raiz quadrada e logarítmica.
4. Visualizações
Nesta parte, podemos observar diferentes gráficos de variáveis e a relação entre as variáveis visualmente. Vamos escrever algumas questões de pesquisa.
4.1. Em que cidade ocorrem mais assassinatos?
Para esta questão, Podemos usar mapa ou gráfico de barrasO gráfico de barras é uma representação visual de dados que usa barras retangulares para mostrar comparações entre diferentes categorias. Cada barra representa um valor e seu comprimento é proporcional a ele. Esse tipo de gráfico é útil para visualizar e analisar tendências, facilitar a interpretação de informações quantitativas. É amplamente utilizado em várias disciplinas, como estatísticas, Marketing e pesquisa, devido à sua simplicidade e eficácia.....

O código R para o gráfico abaixo é:

! função () {“usar rigoroso”; window.addEventListener (“mensagem”, (Função (uma) {E se (vazio 0! == a.data[“Datawrapper-height”]) para (var e en a.data[“Datawrapper-height”]) {var t = document.getElementById (“datawrapper-chart -” + e) || document.querySelector (“iframe[src * = ’” + e + ”‘]”); T && (t.style.height = a.data[“Datawrapper-height”][e]+ ”Px”)}}))} ();
- Como você pode ver, a maioria dos assassinatos foi cometida na Geórgia.
4.2. Quais são os valores de todas as variáveis em cada cidade?

4.3. Qual é a relação entre agressão e assassinato?
Para esta questão, podemos desenhar um gráfico interativo como o mostrado acima para ver os nomes dos estados.
Os códigos R para o quadro interativo são:

! função () {“usar rigoroso”; window.addEventListener (“mensagem”, (Função (uma) {E se (vazio 0! == a.data[“Datawrapper-height”]) para (var e en a.data[“Datawrapper-height”]) {var t = document.getElementById (“datawrapper-chart -” + e) || document.querySelector (“iframe[src * = ’” + e + ”‘]”); T && (t.style.height = a.data[“Datawrapper-height”][e]+ ”Px”)}}))} ();
Ou podemos mergulhar usando ggplot.

Como se vê, existe uma relação positiva entre assassinato e agressão.
4.4. Qual é a relação entre população urbana e estupro?


- A linha e a dispersão mostram a relação entre duas variáveis e nas margens vemos o gráfico de caixa de duas variáveis.
- Podemos dizer que existe uma relação positiva entre a população urbana e o estupro.
4.5. Quais são as relações das variáveis entre si?
Vamos ver a correlação entre as variáveis. Para ver isso, podemos desenhar mapas de chapéus.

Correlações positivas são mostradas em azul e correlações negativas em vermelho. A intensidade da cor é proporcional aos coeficientes de correlação. Quando olhamos para a matriz de correlação, Vê-se que entre algumas variáveis existe uma forte relação positiva como agressão e estupro, agressão e assassinato.
conclusão
Para concluir, Neste artigo, examinamos a análise de dados explicativos e quais tipos de visualização podemos usar para a análise de dados explicativos. Como afirmado acima, é uma etapa muito crucial e deve ser realizada antes da futura engenharia e construção de modelo para melhor compreender os dados. Você pode acessar os códigos no link abaixo.
https://github.com/iremtanriverdi/R_codes
A mídia mostrada neste artigo de análise exploratória de dados não é propriedade da DataPeaker e é usada a critério do autor.



