Architecture d'Alexnet | Introduction à l'architecture Alexnet

Contenu

Cibler

  • Quand on parle du modèle pré-entraîné dans le domaine de la vision par ordinateur, Alexnet est en train de devenir une architecture de premier plan.
  • Comprenons l'architecture de l'initiative Alexnet par ses auteurs.

introduction

Alexnet a remporté le défi d'accréditation visuelle à grande échelle d'Imagenet en 2012. Le modèle a été proposé en 2012 dans le poste de recherche appelé Classification Imagenet avec réseau de neurones à convolution profonde par Alex Krizhevsky et ses collègues.

Dans ce modèle, profondeur du réseau augmentée par rapport à Lenet-5. Au cas où vous voudriez en savoir plus sur Lenet-5, Je vous recommande de consulter l'article suivant-

Noter: Si vous êtes plus intéressé par l'apprentissage de concepts dans un format audiovisuel, nous avons ce post complet expliqué dans la vidéo ci-dessous. Si ce n'est pas comme ça, tu peux continuer à lire.

Alexnet tiene ocho capas con paramètres que se pueden aprender. Le modèle se compose de cinq couches avec une combinaison de regroupement maximum suivi de 3 capas absolutamente conectadas y usan la activación reprendre en cada una de estas capas, excepto en la Couche de sortie.

Descubrieron que el uso de relu como fonction de réveil aceleraba la velocidad del procedimiento de entraînement en casi seis veces. Ils ont également utilisé les couches d'abandon, qui a empêché votre modèle de surajuster. En même temps, le modèle est entraîné sur le jeu de données Imagenet. L'ensemble de données Imagenet est presque 14 millions d'images dans mille classes.

Voyons les détails architecturaux dans ce post.

Architecture Alexnet

Une chose à faire attention ici, car Alexnet est une architecture profonde, les auteurs ont introduit un rembourrage pour éviter que la taille des cartes de caractéristiques ne soit considérablement réduite. L'entrée de ce modèle sont les images de taille 227X227X3.

Architecture en couches Alexnet

Couches de convolution et regroupement maximal

Ensuite, nous appliquons la première couche de convolution avec 96 Filtres taille 11X11 avec foulée 4. La fonction d'activation utilisée dans cette couche est relu. La carte des caractéristiques de sortie est 55X55X96.

Si vous ne savez pas comment calculer la taille de sortie d'une couche de convolution

sortie = ((Taille du filtre d'entrée) / foulée) +1

En même temps, le nombre de filtres devient le canal dans la carte des caractéristiques de sortie.

Ensuite, nous avons la première couche de Maxpooling, Taille et foulée 3X3 2. Après, nous obtenons la carte des caractéristiques résultante avec la taille 27X27X96.

Après cela, on applique la seconde opération de convolution. Cette fois, la taille du filtre est réduite à 5X5 et nous avons 256 filtres de ce type. La foulée est 1 et le rembourrage 2. La fonction d'activation utilisée est à nouveau relu. Maintenant, la taille de sortie que nous obtenons est 27X27X256.

De nouveau, nous appliquons une couche de regroupement maximum de taille 3X3 avec foulée 2. La carte des caractéristiques résultante a la forme 13X13X256.

Nous appliquons maintenant la troisième opération de convolution avec 384 Filtres de taille de foulée 3X3 1 et aussi le rembourrage 1. Encore une fois la fonction d'activation utilisée est relu. La carte des caractéristiques en sortie a la forme 13X13X384.

On a alors la quatrième opération de convolution avec 384 Filtres de taille 3X3. La foulée avec le rembourrage est 1. En même temps que la fonction d'activation utilisée est relu. Maintenant, la taille de sortie reste inchangée, En d'autres termes, 13X13X384.

Après cela, nous avons la couche de convolution finale de taille 3X3 avec 256 filtres de ce type. La foulée et le rembourrage sont réglés sur un et la fonction de déclenchement est relu. La carte des caractéristiques résultante a la forme 13X13X256.

Ensuite, si vous regardez l'architecture jusqu'à présent, le nombre de filtres augmente au fur et à mesure que nous approfondissons. Pour cela, extrait plus de fonctionnalités à mesure que nous passons à l'architecture. En même temps, la taille du filtre diminue, ce qui signifie que le filtre initial était plus gros et, comme nous allons, la taille du filtre diminue, résultant en une diminution de la forme de la carte des caractéristiques.

Ensuite, nous appliquons la troisième couche de regroupement maximum de taille 3X3 et foulée 2. D'où la carte des caractéristiques de la forme 6X6X256.

Des couches absolument connectées et abandonnées

Architecture Alexnet de couches entièrement connectées et abandonnées

Après cela, nous avons notre première couche d'abandon. Le taux de désabonnement est fixé à 0,5.

Después tenemos la primera capa absolutamente conectada con una Fonction d’activation Relu. La taille de sortie est 4096. Vient ensuite une autre couche de désabonnement avec le taux de désabonnement réglé sur 0,5.

Ceci suivi d'une deuxième couche absolument liée à 4096 neurones et activation relu.

En conclusion, nous avons la dernière couche ou couche de sortie absolument connectée avec 1000 neurones, depuis que nous avons 10000 classes dans l'ensemble de données. La fonction d'activation utilisée dans cette couche est Softmax.

C'est l'architecture du modèle Alexnet. A un total de 62,3 des millions de paramètres apprenables.

Remarques finales

Pour résumer rapidement l'architecture que nous avons vue dans ce post.

  • Possède 8 couches avec des paramètres qui peuvent être appris.
  • Les entrées du modèle sont des images RVB.
  • Possède 5 couches de convolution avec une combinaison de couches de regroupement maximales.
  • a alors 3 couches absolument connectées.
  • La fonction d'activation utilisée dans toutes les couches est Relu.
  • Utilisé deux couches d'abandon.
  • La fonction d'activation utilisée dans la couche de sortie est Softmax.
  • Le nombre total de paramètres dans cette architecture est 62,3 des millions.

C'était donc tout à propos d'Alexnet. Si vous avez des doutes, faites le moi savoir dans les commentaires ci-dessous.

Abonnez-vous à notre newsletter

Nous ne vous enverrons pas de courrier SPAM. Nous le détestons autant que vous.

Haut-parleur de données