Regressão linear | Introdução à regressão linear para ciência de dados

Conteúdo

Este artigo foi publicado como parte do Data Science Blogathon

Introdução

Se você está lendo este artigo, Acho que você já está no mundo da ciência de dados e tem uma ideia sobre aprendizado de máquina. Sim, não é assim, não há problema. Vou começar com as terminologias básicas que você precisa saber antes de entender o principal tópico de discussão, quer dizer, regressão linear.

Este artigo cobrirá tudo que você precisa saber sobre regressão linear., o primeiro algoritmo de aprendizado de máquina de ciência de dados.

Tabela de conteúdos

  1. Breve introdução ao aprendizado de máquina e seus tipos
  2. Compreendendo a regressão linear
  3. Suposições de regressão linear.
  4. Como lidar com a violação das premissas
  5. Métricas de avaliação para problemas de regressão

Introdução ao aprendizado de máquina

O aprendizado de máquina é um ramo da inteligência artificial (ELE) focado na construção de aplicativos que aprendem com os dados e melhoram a precisão ao longo do tempo, sem serem programados para isso.

Tipos de aprendizado de máquina:

Aprendizado de máquina supervisionado: É uma técnica de ML em que os modelos são treinados com dados rotulados, quer dizer, Um variável de saída neste tipo de problema. Aqui, modelos encontram função de mapeamento para mapear variáveis ​​de entrada para variáveis ​​de saída ou rótulos.
Regressão e classificação Os problemas fazem parte do aprendizado de máquina supervisionado.

Aprendizado de máquina não supervisionado: É a técnica em que os modelos não recebem os dados rotulados e têm que encontrar os padrões e a estrutura dos dados para conhecer os dados.
Agrupamento e associação Algoritmos fazem parte do ML não supervisionado.

Compreendendo a regressão linear

Nas palavras mais simples Regressão linear é o modelo de aprendizado de máquina supervisionado em que o modelo encontra a linha linear de melhor ajuste entre a variável independente e dependente quer dizer, encontre a relação linear entre as variáveis ​​dependentes e independentes.

A regressão linear é de dois tipos: Simples e múltiplo. Regressão linear simples é onde apenas uma variável independente está presente e o modelo tem que encontrar sua relação linear com a variável dependente

Enquanto em Regressão linear múltipla há mais de uma variável independente para o modelo encontrar a relação.

Equação de regressão linear simples, onde bo é o cruzamento, b1 é coeficiente ou inclinação, x é a variável independente ey é a variável dependente.

2-1-9135305

Equação de regressão linear múltipla, onde bo é o cruzamento, b1,B2,B3,B4…,BNorte são coeficientes ou inclinações das variáveis ​​independentes x1,X2,X3,X4…,XNorte e y é a variável dependente.

2-2-300x39-5775745

O objetivo principal de um modelo de regressão linear é encontrar a linha linear que melhor se ajusta e os valores ótimos de interseção e coeficientes de uma forma que minimize o erro.
O erro é a diferença entre o valor real e o valor previsto e o objetivo é reduzir essa diferença.

Vamos entender isso com a ajuda de um diagrama.

2-3-1215882

Fonte da imagem: ferramentas estatísticas para análise de dados de alto desempenho

No diagrama acima,

  • x é a nossa variável dependente que é plotada no eixo x ey é a variável dependente que é plotada no eixo y.
  • Os pontos pretos são os pontos de dados, quer dizer, os valores reais.
  • Bo é a interseção que é 10 e B1 é a inclinação da variável x.
  • A linha azul é a linha de melhor ajuste prevista pelo modelo, quer dizer, os valores previstos estão na linha azul.

A distância vertical entre o ponto de dados e a linha de regressão é conhecida como o erro ou residual. Cada ponto de dados tem um resto e a soma de todas as diferenças é conhecida como a soma dos residuais / erros.

Abordagem matemática:

Residual / Erro = valores reais – Valores preditos

Soma dos residuais / erros = soma (valores reais esperados)

Quadrado da soma dos resíduos / erros = (Soma (valores reais esperados))2

quer dizer

2-4-1419051

Para uma compreensão profunda da matemática por trás da regressão linear, ver anexo explicação de vídeo.

Suposições de regressão linear

Os pressupostos básicos da regressão linear são os seguintes:

1. Linearidade: Estabelece que a variável dependente Y deve estar linearmente relacionada às variáveis ​​independentes. Esta suposição pode ser verificada desenhando um diagrama de dispersão entre ambas as variáveis.

96503relações não lineares lineares-8007237

2. Normal: As variáveis ​​X e Y devem ter uma distribuição normal. Histogramas podem ser usados, Gráficos KDE e gráficos QQ para verificar a suposição de normalidade.

Veja meu blog em anexo para uma explicação detalhada sobre como verificar a normalidade e transformar variáveis ​​que violam a suposição.

64526normalidade-7611479

Fonte: https://heljves.com/gallery/vol_1_issue_1_2019_8.pdf

3. Homocedasticidade: A variação dos termos de erro deve ser constante, quer dizer, a dispersão dos resíduos deve ser constante para todos os valores de X. Esta suposição pode ser verificada desenhando um gráfico residual. Se a suposição for violada, os pontos formarão um funil, caso contrário, eles serão constantes.

51367residuais-2302682

Fonte: OriginLab

4. Independência / Sem multicolinearidade: As variáveis ​​devem ser independentes umas das outras, quer dizer, não deve haver correlação entre as variáveis ​​independentes. Para verificar a suposição, podemos usar uma matriz de correlação ou uma pontuação VIF. Se a pontuação VIF for maior que 5, as variáveis ​​são altamente correlacionadas.

Na imagem abaixo, existe uma alta correlação entre as variáveis ​​x5 e x6.

99214correlação-8680177

Fonte: em direção à ciência de dados

5. a os termos de erro devem ser distribuídos normalmente. Gráficos QQ e histogramas podem ser usados ​​para verificar a distribuição de termos de erro.

79532normalidade20of20error-9183414

Fonte: http://rstudio-pubs-static.s3.amazonaws.com

6. Sem autocorrelação: Os termos de erro devem ser independentes uns dos outros. A autocorrelação pode ser testada usando o teste Durbin Watson. A hipótese nula assume que não há autocorrelação. O valor do teste está entre 0 e 4. Se o valor do teste for 2, sem autocorrelação.

38946dw-3811699

Fonte: itfeature.com

Como lidar com a violação de qualquer uma das premissas

A violação das premissas leva a uma diminuição na precisão do modelo, então as previsões não são precisas e o erro também é alto.
Por exemplo, se o pressuposto de independência for violado, a relação entre a variável independente e dependente não pode ser determinada com precisão.

Existem vários métodos e técnicas disponíveis para lidar com a violação das premissas. Vamos analisar alguns deles abaixo.

Violação da suposição de normalidade das variáveis ​​ou termos de erro

Para tratar este problema, podemos transformar as variáveis ​​para a distribuição normal usando várias funções de transformação como transformação logarítmica, Transformação Recíproca Box-Cox.
Todas as funções são discutidas neste meu artigo: Como transformar para distribuição normal

Violação do pressuposto de multicolinearidade

Pode ser tratado por:

  • Não fazer nada (se não houver grande diferença na precisão)
  • Eliminando algumas das variáveis ​​independentes altamente correlacionadas.
  • Derive uma nova característica combinando linearmente as variáveis ​​independentes, como adicioná-los ou realizar alguma operação matemática.
  • Realizando uma análise projetada para variáveis ​​altamente correlacionadas, como a análise de componentes principais.

Métricas de avaliação para análise de regressão

Para entender o desempenho do modelo de regressão, uma avaliação do modelo é necessária. Algumas das métricas de avaliação usadas para análise de regressão são:

1. R ao quadrado ou coeficiente de determinação: A métrica mais usada para avaliação de modelo em análise de regressão é R ao quadrado. Pode ser definido como uma razão de variação para variação total. O valor de R ao quadrado está entre 0 e 1, quanto mais perto de 1, melhor o modelo.

74264r2-5691830

Fonte: medium.datadriveninvestor.com

onde SSRES é a soma residual dos quadrados e SSTOT é a soma total dos quadrados

2. R quadrado ajustado: É a melhoria de R ao quadrado. O problema / desvantagem do R2 é que conforme os recursos aumentam, o valor de R2 também aumenta, o que dá a ilusão de um bom modelo. Então, R2 ajustado resolve o problema de R2. Ele considera apenas os recursos que são importantes para o modelo e mostra a melhoria real do modelo.
R2 ajustado é sempre menor que R2.

80741ajustado 20r2-7837635

Fonte: stats.stackexchange.com

3. Raiz do erro quadrático médio (MSE): Outra métrica comum para avaliação é a raiz do erro quadrático médio., que é a média da diferença quadrática dos valores reais versus os previstos.

42113mse-6996035

Fonte: cppsecrets.com

4. Raiz do erro quadrático médio (RMSE): É a raiz do MSE, quer dizer, a raiz da diferença média dos valores reais e previstos. RMSE penaliza grandes erros, enquanto MSE não.

69457rmse-7374608

Fonte: community.qlik.com

Notas finais

Cobrimos a maioria dos conceitos de modelo de regressão neste blog. Se você quiser explorar mais sobre a matemática por trás do modelo, veja os links anexados ao blog.

Por favor, sinta-se à vontade para se conectar comigo no LinkedIn e compartilhe sua valiosa contribuição. Por favor, verifique meus outros artigos aqui.

Sobre o autor :

Soy Deepanshi Dhingra, Atualmente trabalho como pesquisador de ciência de dados e tenho formação em análise, Análise exploratória de dados, aprendizado de máquina e aprendizado profundo.

Este artigo foi publicado como parte do Data Science Blogathon

Assine a nossa newsletter

Nós não enviaremos SPAM para você. Nós odiamos isso tanto quanto você.

Datapeaker