Cibler
- Quand on parle du modèle pré-entraîné dans le domaine de la vision par ordinateur, Alexnet est en train de devenir une architecture de premier plan.
- Comprenons l'architecture de l'initiative Alexnet par ses auteurs.
introduction
Alexnet a remporté le défi d'accréditation visuelle à grande échelle d'Imagenet en 2012. Le modèle a été proposé en 2012 dans le poste de recherche appelé Classification Imagenet avec réseau de neurones à convolution profonde par Alex Krizhevsky et ses collègues.
Dans ce modèle, profondeur du réseau augmentée par rapport à Lenet-5. Au cas où vous voudriez en savoir plus sur Lenet-5, Je vous recommande de consulter l'article suivant-
Noter: Si vous êtes plus intéressé par l'apprentissage de concepts dans un format audiovisuel, nous avons ce post complet expliqué dans la vidéo ci-dessous. Si ce n'est pas comme ça, tu peux continuer à lire.
Alexnet tiene ocho capas con paramètresLes "paramètres" sont des variables ou des critères qui sont utilisés pour définir, mesurer ou évaluer un phénomène ou un système. Dans divers domaines tels que les statistiques, Informatique et recherche scientifique, Les paramètres sont essentiels à l’établissement de normes et de standards qui guident l’analyse et l’interprétation des données. Leur sélection et leur manipulation correctes sont cruciales pour obtenir des résultats précis et pertinents dans toute étude ou projet.... que se pueden aprender. Le modèle se compose de cinq couches avec une combinaison de regroupement maximum suivi de 3 capas absolutamente conectadas y usan la activación reprendreLa fonction d’activation ReLU (Unité linéaire rectifiée) Il est largement utilisé dans les réseaux neuronaux en raison de sa simplicité et de son efficacité. Défini comme suit : ( F(X) = max(0, X) ), ReLU permet aux neurones de se déclencher uniquement lorsque l’entrée est positive, ce qui permet d’atténuer le problème de l’évanouissement en pente. Il a été démontré que son utilisation améliore les performances dans diverses tâches d’apprentissage profond, faire de ReLU une option.. en cada una de estas capas, excepto en la Couche de sortieLa "Couche de sortie" est un concept utilisé dans le domaine des technologies de l’information et de la conception de systèmes. Il s’agit de la dernière couche d’un modèle logiciel ou d’une architecture qui est chargée de présenter les résultats à l’utilisateur final. Cette couche est cruciale pour l’expérience utilisateur, puisqu’il permet une interaction directe avec le système et la visualisation des données traitées.....
Descubrieron que el uso de relu como fonction de réveilLa fonction d’activation est un composant clé des réseaux de neurones, puisqu’il détermine la sortie d’un neurone en fonction de son entrée. Son objectif principal est d’introduire des non-linéarités dans le modèle, vous permettant d’apprendre des modèles complexes dans les données. Il existe différentes fonctions d’activation, comme le sigmoïde, ReLU et tanh, chacun avec des caractéristiques particulières qui affectent les performances du modèle dans différentes applications.... aceleraba la velocidad del procedimiento de entraînementLa formation est un processus systématique conçu pour améliorer les compétences, connaissances ou aptitudes physiques. Il est appliqué dans divers domaines, Comme le sport, Éducation et développement professionnel. Un programme d’entraînement efficace comprend la planification des objectifs, Pratique régulière et évaluation des progrès. L’adaptation aux besoins individuels et la motivation sont des facteurs clés pour obtenir des résultats réussis et durables dans toutes les disciplines.... en casi seis veces. Ils ont également utilisé les couches d'abandon, qui a empêché votre modèle de surajuster. En même temps, le modèle est entraîné sur le jeu de données Imagenet. L'ensemble de données Imagenet est presque 14 millions d'images dans mille classes.
Voyons les détails architecturaux dans ce post.
Architecture Alexnet
Une chose à faire attention ici, car Alexnet est une architecture profonde, les auteurs ont introduit un rembourrage pour éviter que la taille des cartes de caractéristiques ne soit considérablement réduite. L'entrée de ce modèle sont les images de taille 227X227X3.

Couches de convolution et regroupement maximal
Ensuite, nous appliquons la première couche de convolution avec 96 Filtres taille 11X11 avec foulée 4. La fonction d'activation utilisée dans cette couche est relu. La carte des caractéristiques de sortie est 55X55X96.
Si vous ne savez pas comment calculer la taille de sortie d'une couche de convolution
sortie = ((Taille du filtre d'entrée) / foulée) +1
En même temps, le nombre de filtres devient le canal dans la carte des caractéristiques de sortie.
Ensuite, nous avons la première couche de Maxpooling, Taille et foulée 3X3 2. Après, nous obtenons la carte des caractéristiques résultante avec la taille 27X27X96.
Après cela, on applique la seconde opération de convolution. Cette fois, la taille du filtre est réduite à 5X5 et nous avons 256 filtres de ce type. La foulée est 1 et le rembourrage 2. La fonction d'activation utilisée est à nouveau relu. Maintenant, la taille de sortie que nous obtenons est 27X27X256.
De nouveau, nous appliquons une couche de regroupement maximum de taille 3X3 avec foulée 2. La carte des caractéristiques résultante a la forme 13X13X256.
Nous appliquons maintenant la troisième opération de convolution avec 384 Filtres de taille de foulée 3X3 1 et aussi le rembourrage 1. Encore une fois la fonction d'activation utilisée est relu. La carte des caractéristiques en sortie a la forme 13X13X384.
On a alors la quatrième opération de convolution avec 384 Filtres de taille 3X3. La foulée avec le rembourrage est 1. En même temps que la fonction d'activation utilisée est relu. Maintenant, la taille de sortie reste inchangée, En d'autres termes, 13X13X384.
Après cela, nous avons la couche de convolution finale de taille 3X3 avec 256 filtres de ce type. La foulée et le rembourrage sont réglés sur un et la fonction de déclenchement est relu. La carte des caractéristiques résultante a la forme 13X13X256.
Ensuite, si vous regardez l'architecture jusqu'à présent, le nombre de filtres augmente au fur et à mesure que nous approfondissons. Pour cela, extrait plus de fonctionnalités à mesure que nous passons à l'architecture. En même temps, la taille du filtre diminue, ce qui signifie que le filtre initial était plus gros et, comme nous allons, la taille du filtre diminue, résultant en une diminution de la forme de la carte des caractéristiques.
Ensuite, nous appliquons la troisième couche de regroupement maximum de taille 3X3 et foulée 2. D'où la carte des caractéristiques de la forme 6X6X256.
Des couches absolument connectées et abandonnées

Après cela, nous avons notre première couche d'abandon. Le taux de désabonnement est fixé à 0,5.
Después tenemos la primera capa absolutamente conectada con una Fonction d’activation ReluLa fonction d’activation ReLU (Unité linéaire rectifiée) Il est largement utilisé dans les réseaux neuronaux en raison de sa simplicité et de son efficacité. est défini comme ( F(X) = max(0, X) ), ce qui signifie qu’il produit une sortie de zéro pour les valeurs négatives et un incrément linéaire pour les valeurs positives. Sa capacité à atténuer le problème de l’évanouissement en pente en fait un choix privilégié dans les architectures profondes..... La taille de sortie est 4096. Vient ensuite une autre couche de désabonnement avec le taux de désabonnement réglé sur 0,5.
Ceci suivi d'une deuxième couche absolument liée à 4096 neurones et activation relu.
En conclusion, nous avons la dernière couche ou couche de sortie absolument connectée avec 1000 neurones, depuis que nous avons 10000 classes dans l'ensemble de données. La fonction d'activation utilisée dans cette couche est Softmax.
C'est l'architecture du modèle Alexnet. A un total de 62,3 des millions de paramètres apprenables.
Remarques finales
Pour résumer rapidement l'architecture que nous avons vue dans ce post.
- Possède 8 couches avec des paramètres qui peuvent être appris.
- Les entrées du modèle sont des images RVB.
- Possède 5 couches de convolution avec une combinaison de couches de regroupement maximales.
- a alors 3 couches absolument connectées.
- La fonction d'activation utilisée dans toutes les couches est Relu.
- Utilisé deux couches d'abandon.
- La fonction d'activation utilisée dans la couche de sortie est Softmax.
- Le nombre total de paramètres dans cette architecture est 62,3 des millions.
C'était donc tout à propos d'Alexnet. Si vous avez des doutes, faites le moi savoir dans les commentaires ci-dessous.



