Alexnet-Architektur | Einführung in die Alexnet-Architektur

Inhalt

Ziel

  • Wenn wir über das vortrainierte Modell im Bereich Computer Vision sprechen, Alexnet entwickelt sich zu einer führenden Architektur.
  • Lassen Sie uns die Architektur der Alexnet-Initiative ihrer Autoren verstehen.

Einführung

Alexnet gewann die groß angelegte Herausforderung der visuellen Akkreditierung von Imagenet in 2012. Das Modell wurde vorgeschlagen in 2012 im Forschungspost namens Imagenet-Klassifizierung mit Deep Convolution Neural Network von Alex Krizhevsky und Kollegen.

Bei diesem Modell, Netzwerktiefe im Vergleich zu Lenet-5 . erhöht. Falls Sie mehr über Lenet-5 erfahren möchten, Ich empfehle Ihnen, den folgenden Artikel zu konsultieren-

Notiz: Wenn Sie mehr daran interessiert sind, Konzepte in einem audiovisuellen Format zu lernen, wir haben diesen vollständigen Beitrag im Video unten erklärt. Wenn dies nicht der Fall ist, du kannst weiterlesen.

Alexnet tiene ocho capas con Parameter que se pueden aprender. Das Modell besteht aus fünf Schichten mit einer Kombination aus maximaler Gruppierung gefolgt von 3 capas absolutamente conectadas y usan la activación Lebenslauf en cada una de estas capas, excepto en la Ausgabe-Layer.

Descubrieron que el uso de relu como Weckfunktion aceleraba la velocidad del procedimiento de Ausbildung en casi seis veces. Sie nutzten auch die Schichten der Verlassenheit, das verhinderte, dass Ihr Modell überangepasst wurde. Zur selben Zeit, das Modell wird auf dem Imagenet-Datensatz trainiert. Der Imagenet-Datensatz ist fast 14 Millionen Bilder in tausend Klassen.

Sehen wir uns die architektonischen Details in diesem Beitrag an.

Alexnet-Architektur

Hier ist eines zu beachten, da Alexnet Deep Architecture ist, die Autoren führten Padding ein, um zu verhindern, dass die Größe der Feature-Maps drastisch reduziert wird. Die Eingabe für dieses Modell sind die Bilder der Größe 227X227X3.

Alexnet-Schichtenarchitektur

Faltungsschichten und maximale Gruppierung

Dann wenden wir die erste Faltungsschicht an mit 96 Filter der Größe 11X11 mit Schrittweite 4. Die in dieser Schicht verwendete Aktivierungsfunktion ist relu. Das Ausgangskennfeld ist 55X55X96.

Falls Sie nicht wissen, wie man die Ausgabegröße einer Faltungsschicht berechnet

Ausgang = ((Einlassfiltergröße) / schreiten) +1

Zur selben Zeit, die Anzahl der Filter wird zum Kanal im Ausgangskennfeld.

Dann, wir haben die erste Schicht von Maxpooling, 3X3 Größe und Schrittlänge 2. Nach, wir erhalten die resultierende Feature-Map mit der Größe 27X27X96.

Nachdem, wir wenden die zweite Faltungsoperation an. Diesmal, die Filtergröße wird auf 5X5 reduziert und wir haben 256 Filter dieser Art. Der Schritt ist 1 und die polsterung 2. Die verwendete Aktivierungsfunktion ist wieder relu. Jetzt erhalten wir eine Ausgabegröße von 27X27X256.

Nochmal, Wir tragen einen maximalen Gruppierungsmantel der Größe 3X3 mit Schritt auf 2. Die resultierende Feature-Map hat die Form 13X13X256.

Nun wenden wir die dritte Faltungsoperation mit an 384 3X3 Schrittgrößenfilter 1 und auch polsterung 1. Auch hier ist die verwendete Aktivierungsfunktion relu. Die Ausgabe-Feature-Map hat die Form 13X13X384.

Dann haben wir die vierte Faltungsoperation mit 384 Filter der Größe 3X3. Der Schritt zusammen mit der Polsterung ist 1. Gleichzeitig ist die verwendete Aktivierungsfunktion relu. Jetzt bleibt die Ausgabegröße unverändert, Mit anderen Worten, 13X13X384.

Nachdem, Wir haben die letzte Faltungsschicht der Größe 3X3 mit 256 Filter dieser Art. Stride und Padding sind auf eins eingestellt und die Triggerfunktion ist relu. Die resultierende Feature-Map hat die Form 13X13X256.

Dann, wenn man sich die architektur so weit anschaut, die Anzahl der Filter nimmt zu, wenn wir tiefer gehen. Deswegen, extrahiert mehr Funktionen, während wir in die Architektur einsteigen. Zur selben Zeit, Filtergröße schrumpft, was bedeutet, dass der anfängliche Filter größer war und, während wir gehen, Filtergröße nimmt ab, was zu einer Abnahme der Form der Feature-Map führt.

Dann, Wir wenden die dritte Schicht der maximalen Gruppierung der Größe 3X3 und Schritt an 2. Daraus ergibt sich das Kennfeld der Form 6X6X256.

Absolut verbundene und verlassene Schichten

Alexnet-Architektur von vollständig verbundenen und verlassenen Schichten

Nachdem, Wir haben unsere erste Schicht der Verlassenheit. Die Abwanderungsrate ist auf eingestellt 0,5.

Después tenemos la primera capa absolutamente conectada con una Aktivierungsfunktion von Relu. Die Ausgabegröße ist 4096. Dann kommt eine weitere Abwanderungsebene, wobei die Abwanderungsrate auf eingestellt ist 0,5.

Darauf folgt eine zweite Schicht absolut verbunden mit 4096 Neuronen und Relu-Aktivierung.

Abschließend, wir haben die letzte absolut verbundene Schicht oder Ausgabeschicht mit 1000 Neuronen, Seit wir ... Haben 10000 Klassen im Datensatz. Die in dieser Schicht verwendete Aktivierungsfunktion ist Softmax.

Dies ist die Architektur des Alexnet-Modells. Hat insgesamt 62,3 Millionen lernbarer Parameter.

Abschließende Anmerkungen

Um die Architektur, die wir in diesem Beitrag gesehen haben, schnell zusammenzufassen.

  • Verfügt über 8 Layer mit erlernbaren Parametern.
  • Die Eingabe in das Modell sind RGB-Bilder.
  • Verfügt über 5 Faltungsschichten mit einer Kombination von maximalen Gruppierungsschichten.
  • Dann hat 3 absolut verbundene Schichten.
  • Die in allen Schichten verwendete Aktivierungsfunktion ist Relu.
  • Verwendet zwei Schichten von Verzicht.
  • Die in der Ausgabeschicht verwendete Aktivierungsfunktion ist Softmax.
  • Die Gesamtzahl der Parameter in dieser Architektur beträgt 62,3 Millionen.

Das war also alles über Alexnet. Wenn Sie Zweifel haben, lass es mich in den Kommentaren unten wissen.

Abonniere unseren Newsletter

Wir senden Ihnen keine SPAM-Mail. Wir hassen es genauso wie du.

Datenlautsprecher