Modelagem estatística | Introdução à Modelagem Estatística

Conteúdo

Este artigo foi publicado como parte do Data Science Blogathon.

O que é um modelo estatístico?

“A modelação é uma arte, bem como uma ciência, e é dirigida a encontrar um bom modelo aproximado … como base para a inferência estatística” – Burnham & Anderson

Um modelo estatístico é um tipo de modelo matemático que faz parte das suposições realizadas para descrever o processo de geração de dados.

Vamos focar-nos nos dois termos destacados acima:

  1. Tipo de modelo matemático? O modelo estatístico não é determinista, ao contrário de outros modelos matemáticos, onde as variáveis têm valores específicos. As variáveis nos modelos estatísticos são estocásticas, quer dizer, têm distribuições de probabilidade.
  2. Suposições? Mas, Como é que esses pressupostos nos ajudam a compreender as propriedades ou características dos dados reais? Em poucas palavras, estes pressupostos facilitam o cálculo da probabilidade de um evento.

Citação um exemplo para compreender melhor o papel dos pressupostos estatísticos na modelação de dados:

Suposição 1: Supondo que temos 2 dados justos e que cada face tem a mesma probabilidade de aparecer, quer dizer, 1/6. Agora, podemos calcular a probabilidade de que dois dados mostrem 5 O que 1/6 * 1/6. Como podemos calcular a probabilidade de cada evento, constitui um modelo estatístico.

Suposição 2: Os dados estão viciados e tudo o que sabemos é que a probabilidade da face 5 isto é 1/8, o que facilita o cálculo da probabilidade de que ambos os dados mostrem 5 O que 1/8 * 1/8. Mas não conhecemos a probabilidade das outras faces, portanto, não podemos calcular a probabilidade de cada evento. Por tanto, esta suposição não constitui um modelo estatístico.

Por que precisamos da modelação estatística?

O modelo estatístico desempenha um papel fundamental na realização de inferências estatísticas que ajudam a fazer proposições sobre as propriedades e características desconhecidas da população, como mostrado abaixo:

1) Estimativa:

É a ideia central por trás do aprendizado automático, quer dizer, descobrir o número que pode estimar os parametros de distribuição.

Observe que o Estimador é uma variável aleatória em si mesma, enquanto uma estimativa é um número único que nos dá uma ideia da distribuição do processo de geração de dados. Por exemplo, a média e sigma da distribuição gaussiana

2) Intervalo de confiança:

Dar uma barra de erro em torno do número da estimativa única, quer dizer, um intervalo de valores para indicar a confiança na estimativa obtida com base em várias amostras. Por exemplo, a estimativa A é calculada a partir de 100 amostras e tem um intervalo de confiança mais amplo, enquanto a estimativa B é calculada a partir de 10000 amostras e, portanto, tem um intervalo de confiança mais estreito.

3) Testando hipóteses

É uma declaração de procura por evidência estatística. Vamos compreender melhor a necessidade de realizar modelos estatísticos com a ajuda do exemplo abaixo.

51737research_paers-2486221
Fonte: Autor

O objetivo é compreender a distribuição subjacente para calcular a probabilidade de que um investigador selecionado aleatoriamente tivesse escrito, Digamos, 3 artigos de pesquisa.

Temos uma variável aleatória discreta com 8 (9-1) parámetros para aprender, quer dizer, probabilidad de 0,1,2 .. trabajos de investigación. A medida que aumenta el número de parámetros a estimar, también lo es la necesidad de tener tantas observaciones, pero este no es el propósito del modelado de datos.

Então, podemos reducir el número de incógnitas de 8 parámetros a solo 1 parámetro lambda, simplemente asumiendo que los datos siguen la distribución de Poisson.

Nuestra suposición de que los datos siguen la distribución de Poisson podría ser una simplificación en comparación con el proceso de generación de datos reales, pero es una buena aproximación.

Tipos de supuestos de modelado:

Ahora que entendemos la importancia del modelado estadístico, entendamos el tipos de supuestos de modelado:

1) Paramétrico: Assume um conjunto finito de parâmetros que capturam tudo o que está relacionado com os dados. Se conhecermos o parâmetro θ que representa muito bem o processo de geração de dados, então as previsões (x) são independentes dos dados observados (D)

2) Não paramétrico: Assume que nenhum conjunto finito de parâmetros pode definir a distribuição dos dados. A complexidade do modelo é ilimitada e cresce com a quantidade de dados

3) Semiparamétrico: É um modelo híbrido cujas suposições se situam entre abordagens paramétricas e não paramétricas. Consta de dos componentes: estrutural (paramétrico) e variação aleatória (não paramétrico). O modelo de risco proporcional de Cox é um exemplo popular de suposições semiparamétricas.

Definição de um modelo estatístico: (S, P)

S: Suponhamos que temos uma coleção de cópias N iid como X1, X2, X3… Xn através de um experimento estatístico (é o processo de gerar ou recolher dados). Todos estes As variáveis aleatórias podem ser medidas num espaço amostral que se denota por S.

PAG: É o conjunto de distribuições de probabilidade em S que contém a distribuição que é uma representação aproximada da nossa distribuição real.

Internalizemos o conceito de espaço amostral antes de compreender como se poderia representar um modelo estatístico para estas distribuições.

1) Bernoulli: {0,1}

2) Gaussiano: (-∞, + ∞)

Então, agora vimos alguns exemplos de espaço amostral de algumas das famílias de distribuição, agora vejamos como se define um modelo estatístico:

1) Bernoulli: ({0,1}, (Ber (p)) p∈ (0,1))

2) Gaussiano: ((-∞, + ∞), (N (𝜇, 0.3)) 𝜇∈R)

Nós vamos, modelos especificados e mal especificados:

¿Qué es la especificación del modelo? De acordo com Wikipedia definição:

Especificación del modelo consiste en selecionar una forma funcional adecuada para el modelo. Por exemplo, dados “ingreso personal” (e) junto com “años de escolaridad” (s) e “experiencia en el trabajo” (x), podríamos especificar una relación funcional y = f (s, x)} Como segue:

98761specify_model-7543196

Modelo de especificación incorreta: ¿Alguna vez le ha sucedido que el modelo converge corretamente en datos simulados, pero en el momento en que llegan los datos reales, su robustez se degrada y ya no converge? Nós vamos, esto podría suceder normalmente si el modelo que desarrolló no coincide con los datos, lo que generalmente se conoce como Modelo de especificación incorreta. Pode dever-se ao facto de a classe de distribuição assumida para a modelagem não conter a distribuição de probabilidade desconhecida p de onde é extraída a amostra, quer dizer, o verdadeiro processo de geração de dados.

21963capture-9498034

Fonte: Autor

Espero que este artigo lhe tenha proporcionado uma compreensão do que é um modelo estatístico, porque precisamos de tais modelos, que papel os pressupostos desempenham e como esses pressupostos podem determinar a qualidade do nosso modelo.

*O processo de distribuição / a geração de dados real ou verdadeira a que se faz referência ao longo deste artigo implica que existe uma distribuição de probabilidade que é induzida pelo processo que gera os dados observados.

Referências:

https://mc-stan.org/docs/2_22/stan-users-guide/well-specified-models.html

http://mlss.tuebingen.mpg.de/2015/slides/ghahramani/gp-neural-nets15.pdf

https://courses.edx.org/courses/course-v1:MITx+18.6501x+3T2019/course/

Assine a nossa newsletter

Nós não enviaremos SPAM para você. Nós odiamos isso tanto quanto você.

Datapeaker