objetivo
- Quando falamos sobre o modelo pré-treinado no domínio da visão computacional, Alexnet está emergindo como uma arquitetura líder.
- Vamos entender a arquitetura da iniciativa Alexnet por seus autores.
Introdução
Alexnet venceu o desafio de credenciamento visual em grande escala da Imagenet em 2012. O modelo foi proposto em 2012 no posto de pesquisa chamado Classificação Imagenet com rede neural de convolução profunda por Alex Krizhevsky e colegas.
Neste modelo, profundidade da rede aumentou em comparação com Lenet-5. Caso queira saber mais sobre Lenet-5, Vou recomendar que você consulte o seguinte artigo-
Observação: Se você está mais interessado em aprender conceitos em formato audiovisual, temos essa postagem completa explicada no vídeo abaixo. Sim, não é assim, você pode continuar lendo.
Alexnet tem oito camadas com parametroso "parametros" são variáveis ou critérios usados para definir, medir ou avaliar um fenômeno ou sistema. Em vários domínios, como a estatística, Ciência da Computação e Pesquisa Científica, Os parâmetros são essenciais para estabelecer normas e padrões que orientam a análise e interpretação dos dados. Sua seleção e manuseio adequados são cruciais para obter resultados precisos e relevantes em qualquer estudo ou projeto.... que pode ser aprendido. O modelo consiste em cinco camadas com uma combinação de agrupamento máximo seguido por 3 camadas absolutamente conectadas e ativação do uso ReluA função de ativação do ReLU (Unidade linear retificada) É amplamente utilizado em redes neurais devido à sua simplicidade e eficácia. Definido como ( f(x) = máx.(0, x) ), O ReLU permite que os neurônios disparem apenas quando a entrada é positiva, o que ajuda a mitigar o problema do desbotamento do gradiente. Seu uso demonstrou melhorar o desempenho em várias tarefas de aprendizado profundo, tornando o ReLU uma opção... em cada uma dessas camadas, exceto no Camada de saídao "Camada de saída" é um conceito utilizado no campo da tecnologia da informação e design de sistemas. Refere-se à última camada de um modelo ou arquitetura de software que é responsável por apresentar os resultados ao usuário final. Essa camada é crucial para a experiência do usuário, uma vez que permite a interação direta com o sistema e a visualização dos dados processados.....
Eles descobriram que usar relu como um função de despertarA função de ativação é um componente chave em redes neurais, uma vez que determina a saída de um neurônio com base em sua entrada. Seu principal objetivo é introduzir não linearidades no modelo, permitindo que você aprenda padrões complexos em dados. Existem várias funções de ativação, como o sigmóide, ReLU e tanh, cada um com características particulares que afetam o desempenho do modelo em diferentes aplicações.... acelerou a velocidade do TreinamentoO treinamento é um processo sistemático projetado para melhorar as habilidades, Conhecimento ou habilidades físicas. É aplicado em várias áreas, como esporte, Educação e desenvolvimento profissional. Um programa de treinamento eficaz inclui planejamento de metas, prática regular e avaliação do progresso. A adaptação às necessidades individuais e a motivação são fatores-chave para alcançar resultados bem-sucedidos e sustentáveis em qualquer disciplina.... em quase seis vezes. Eles também usaram as camadas de abandono, que impediu seu modelo de overfitting. Ao mesmo tempo, o modelo é treinado no conjunto de dados Imagenet. O conjunto de dados Imagenet está quase 14 milhões de imagens em mil classes.
Vamos ver os detalhes arquitetônicos neste post.
Arquitetura Alexnet
Uma coisa para prestar atenção aqui, já que Alexnet é arquitetura profunda, os autores introduziram preenchimento para evitar que o tamanho dos mapas de características fosse drasticamente reduzido. A entrada para este modelo são as imagens de tamanho 227X227X3.

Camadas de convolução e agrupamento máximo
Em seguida, aplicamos a primeira camada de convolução com 96 Filtros de tamanho 11X11 com passada 4. A função de ativação usada nesta camada é relu. O mapa de características de saída é 55X55X96.
Caso você não saiba como calcular o tamanho de saída de uma camada de convolução
output = ((Tamanho do filtro de entrada) / passo largo) +1
Ao mesmo tempo, o número de filtros torna-se o canal no mapa de características de saída.
A seguir, nós temos a primeira camada de Maxpool, Tamanho 3X3 e passo 2. Depois de, obtemos o mapa de recursos resultante com o tamanho 27X27X96.
Depois disso, aplicamos a segunda operação de convolução. Desta vez, o tamanho do filtro é reduzido para 5X5 e temos 256 filtros deste tipo. O passo é 1 e o enchimento 2. A função de ativação usada é novamente relu. Agora, o tamanho de saída que obtemos é 27X27X256.
De novo, aplicamos uma camada de agrupamento máximo de tamanho 3X3 com passada 2. O mapa de características resultante tem o formato 13X13X256.
Agora aplicamos a terceira operação de convolução com 384 Filtros de tamanho de passada 3X3 1 e também preenchimento 1. Novamente, a função de ativação usada é relu. O mapa de recursos de saída tem o formato 13X13X384.
Então temos a quarta operação de convolução com 384 Filtros de tamanho 3X3. O passo junto com o preenchimento é 1. Ao mesmo tempo, a função de ativação usada é relu. Agora o tamanho da saída permanece inalterado, Em outras palavras, 13X13X384.
Depois disso, temos a camada de convolução de tamanho 3X3 final com 256 filtros deste tipo. Stride e padding são definidos como um e a função de gatilho é relu. O mapa de características resultante tem o formato 13X13X256.
Então, se você olhar para a arquitetura até agora, o número de filtros aumenta à medida que vamos mais fundo. Por isso, está extraindo mais recursos à medida que avançamos para a arquitetura. Ao mesmo tempo, o tamanho do filtro está diminuindo, o que significa que o filtro inicial era maior e, enquanto nós vamos, o tamanho do filtro diminui, resultando em uma diminuição na forma do mapa de feições.
A seguir, aplicamos a terceira camada de agrupamento máximo de tamanho 3X3 e passada 2. Resultando no mapa de características da forma 6X6X256.
Camadas absolutamente conectadas e abandonadas

Depois disso, nós temos nossa primeira camada de abandono. A taxa de rotatividade é definida para 0,5.
Então temos a primeira camada absolutamente conectada com um Função de ativação ReluA função de ativação do ReLU (Unidade linear retificada) É amplamente utilizado em redes neurais devido à sua simplicidade e eficácia. é definido como ( f(x) = máx.(0, x) ), o que significa que produz uma saída de zero para valores negativos e um incremento linear para valores positivos. Sua capacidade de mitigar o problema de desvanecimento de gradiente o torna a escolha preferida em arquiteturas profundas..... O tamanho da saída é 4096. Em seguida, vem outra camada de rotatividade com a taxa de rotatividade definida para 0,5.
Isso seguido por uma segunda camada absolutamente conectada com 4096 neurônios e ativação relu.
Em conclusão, temos a última camada absolutamente conectada ou camada de saída com 1000 neurônios, desde que temos 10000 classes no conjunto de dados. A função de ativação usada nesta camada é Softmax.
Esta é a arquitetura do modelo Alexnet. Tem um total de 62,3 milhões de parâmetros aprendíveis.
Notas finais
Para resumir rapidamente a arquitetura que vimos nesta postagem.
- Tenho 8 camadas com parâmetros que podem ser aprendidos.
- A entrada para o modelo são imagens RGB.
- Tenho 5 camadas de convolução com uma combinação de camadas máximas de agrupamento.
- Então tem 3 camadas absolutamente conectadas.
- A função de ativação usada em todas as camadas é Relu.
- Usou duas camadas de abandono.
- A função de ativação usada na camada de saída é Softmax.
- O número total de parâmetros nesta arquitetura é 62,3 milhões.
Então, tudo isso era sobre Alexnet. Se você tiver alguma dúvida, Deixe-me saber nos comentários abaixo.



