Ziel
- Wenn wir über das vortrainierte Modell im Bereich Computer Vision sprechen, Alexnet entwickelt sich zu einer führenden Architektur.
- Lassen Sie uns die Architektur der Alexnet-Initiative ihrer Autoren verstehen.
Einführung
Alexnet gewann die groß angelegte Herausforderung der visuellen Akkreditierung von Imagenet in 2012. Das Modell wurde vorgeschlagen in 2012 im Forschungspost namens Imagenet-Klassifizierung mit Deep Convolution Neural Network von Alex Krizhevsky und Kollegen.
Bei diesem Modell, Netzwerktiefe im Vergleich zu Lenet-5 . erhöht. Falls Sie mehr über Lenet-5 erfahren möchten, Ich empfehle Ihnen, den folgenden Artikel zu konsultieren-
Notiz: Wenn Sie mehr daran interessiert sind, Konzepte in einem audiovisuellen Format zu lernen, wir haben diesen vollständigen Beitrag im Video unten erklärt. Wenn dies nicht der Fall ist, du kannst weiterlesen.
Alexnet tiene ocho capas con ParameterDas "Parameter" sind Variablen oder Kriterien, die zur Definition von, ein Phänomen oder System zu messen oder zu bewerten. In verschiedenen Bereichen wie z.B. Statistik, Informatik und naturwissenschaftliche Forschung, Parameter sind entscheidend für die Etablierung von Normen und Standards, die die Datenanalyse und -interpretation leiten. Ihre richtige Auswahl und Handhabung sind entscheidend, um genaue und relevante Ergebnisse in jeder Studie oder jedem Projekt zu erhalten.... que se pueden aprender. Das Modell besteht aus fünf Schichten mit einer Kombination aus maximaler Gruppierung gefolgt von 3 capas absolutamente conectadas y usan la activación LebenslaufDie Aktivierungsfunktion von ReLU (Gleichgerichtete Lineareinheit) Es wird aufgrund seiner Einfachheit und Effektivität häufig in neuronalen Netzen verwendet. Definiert als ( F(x) = max(0, x) ), ReLU lässt Neuronen nur dann feuern, wenn die Eingabe positiv ist, Dies hilft, das Problem des Gradientenverblassens zu mildern. Es hat sich gezeigt, dass seine Verwendung die Leistung bei verschiedenen Deep-Learning-Aufgaben verbessert, ReLU zu einer Option machen.. en cada una de estas capas, excepto en la Ausgabe-LayerDas "Ausgabe-Layer" ist ein Konzept, das im Bereich der Informationstechnologie und des Systemdesigns verwendet wird. Es bezieht sich auf die letzte Schicht eines Softwaremodells oder einer Architektur, die für die Präsentation der Ergebnisse für den Endbenutzer verantwortlich ist. Diese Schicht ist entscheidend für die Benutzererfahrung, Da es eine direkte Interaktion mit dem System und die Visualisierung der verarbeiteten Daten ermöglicht.....
Descubrieron que el uso de relu como WeckfunktionDie Aktivierungsfunktion ist eine Schlüsselkomponente in neuronalen Netzen, da es den Output eines Neurons auf der Grundlage seiner Eingabe bestimmt. Sein Hauptzweck besteht darin, Nichtlinearitäten in das Modell einzuführen, Ermöglicht das Erlernen komplexer Muster in Daten. Es gibt verschiedene Aktivierungsfunktionen, wie das Sigmoid, ReLU und tanh, jedes mit besonderen Eigenschaften, die sich auf die Leistung des Modells in verschiedenen Anwendungen auswirken.... aceleraba la velocidad del procedimiento de AusbildungTraining ist ein systematischer Prozess zur Verbesserung der Fähigkeiten, körperliche Kenntnisse oder Fähigkeiten. Es wird in verschiedenen Bereichen angewendet, wie Sport, Aus- und Weiterbildung. Zu einem effektiven Trainingsprogramm gehört auch die Zielplanung, Regelmäßiges Üben und Bewerten der Fortschritte. Anpassung an individuelle Bedürfnisse und Motivation sind Schlüsselfaktoren, um in jeder Disziplin erfolgreiche und nachhaltige Ergebnisse zu erzielen.... en casi seis veces. Sie nutzten auch die Schichten der Verlassenheit, das verhinderte, dass Ihr Modell überangepasst wurde. Zur selben Zeit, das Modell wird auf dem Imagenet-Datensatz trainiert. Der Imagenet-Datensatz ist fast 14 Millionen Bilder in tausend Klassen.
Sehen wir uns die architektonischen Details in diesem Beitrag an.
Alexnet-Architektur
Hier ist eines zu beachten, da Alexnet Deep Architecture ist, die Autoren führten Padding ein, um zu verhindern, dass die Größe der Feature-Maps drastisch reduziert wird. Die Eingabe für dieses Modell sind die Bilder der Größe 227X227X3.

Faltungsschichten und maximale Gruppierung
Dann wenden wir die erste Faltungsschicht an mit 96 Filter der Größe 11X11 mit Schrittweite 4. Die in dieser Schicht verwendete Aktivierungsfunktion ist relu. Das Ausgangskennfeld ist 55X55X96.
Falls Sie nicht wissen, wie man die Ausgabegröße einer Faltungsschicht berechnet
Ausgang = ((Einlassfiltergröße) / schreiten) +1
Zur selben Zeit, die Anzahl der Filter wird zum Kanal im Ausgangskennfeld.
Dann, wir haben die erste Schicht von Maxpooling, 3X3 Größe und Schrittlänge 2. Nach, wir erhalten die resultierende Feature-Map mit der Größe 27X27X96.
Nachdem, wir wenden die zweite Faltungsoperation an. Diesmal, die Filtergröße wird auf 5X5 reduziert und wir haben 256 Filter dieser Art. Der Schritt ist 1 und die polsterung 2. Die verwendete Aktivierungsfunktion ist wieder relu. Jetzt erhalten wir eine Ausgabegröße von 27X27X256.
Nochmal, Wir tragen einen maximalen Gruppierungsmantel der Größe 3X3 mit Schritt auf 2. Die resultierende Feature-Map hat die Form 13X13X256.
Nun wenden wir die dritte Faltungsoperation mit an 384 3X3 Schrittgrößenfilter 1 und auch polsterung 1. Auch hier ist die verwendete Aktivierungsfunktion relu. Die Ausgabe-Feature-Map hat die Form 13X13X384.
Dann haben wir die vierte Faltungsoperation mit 384 Filter der Größe 3X3. Der Schritt zusammen mit der Polsterung ist 1. Gleichzeitig ist die verwendete Aktivierungsfunktion relu. Jetzt bleibt die Ausgabegröße unverändert, Mit anderen Worten, 13X13X384.
Nachdem, Wir haben die letzte Faltungsschicht der Größe 3X3 mit 256 Filter dieser Art. Stride und Padding sind auf eins eingestellt und die Triggerfunktion ist relu. Die resultierende Feature-Map hat die Form 13X13X256.
Dann, wenn man sich die architektur so weit anschaut, die Anzahl der Filter nimmt zu, wenn wir tiefer gehen. Deswegen, extrahiert mehr Funktionen, während wir in die Architektur einsteigen. Zur selben Zeit, Filtergröße schrumpft, was bedeutet, dass der anfängliche Filter größer war und, während wir gehen, Filtergröße nimmt ab, was zu einer Abnahme der Form der Feature-Map führt.
Dann, Wir wenden die dritte Schicht der maximalen Gruppierung der Größe 3X3 und Schritt an 2. Daraus ergibt sich das Kennfeld der Form 6X6X256.
Absolut verbundene und verlassene Schichten

Nachdem, Wir haben unsere erste Schicht der Verlassenheit. Die Abwanderungsrate ist auf eingestellt 0,5.
Después tenemos la primera capa absolutamente conectada con una Aktivierungsfunktion von ReluDie Aktivierungsfunktion von ReLU (Gleichgerichtete Lineareinheit) Es wird aufgrund seiner Einfachheit und Effektivität häufig in neuronalen Netzen verwendet. ist definiert als ( F(x) = max(0, x) ), Das bedeutet, dass es eine Ausgabe von Null für negative Werte und ein lineares Inkrement für positive Werte erzeugt. Seine Fähigkeit, das Problem des Gradient Fading zu mildern, macht es zu einer bevorzugten Wahl in tiefen Architekturen..... Die Ausgabegröße ist 4096. Dann kommt eine weitere Abwanderungsebene, wobei die Abwanderungsrate auf eingestellt ist 0,5.
Darauf folgt eine zweite Schicht absolut verbunden mit 4096 Neuronen und Relu-Aktivierung.
Abschließend, wir haben die letzte absolut verbundene Schicht oder Ausgabeschicht mit 1000 Neuronen, Seit wir ... Haben 10000 Klassen im Datensatz. Die in dieser Schicht verwendete Aktivierungsfunktion ist Softmax.
Dies ist die Architektur des Alexnet-Modells. Hat insgesamt 62,3 Millionen lernbarer Parameter.
Abschließende Anmerkungen
Um die Architektur, die wir in diesem Beitrag gesehen haben, schnell zusammenzufassen.
- Verfügt über 8 Layer mit erlernbaren Parametern.
- Die Eingabe in das Modell sind RGB-Bilder.
- Verfügt über 5 Faltungsschichten mit einer Kombination von maximalen Gruppierungsschichten.
- Dann hat 3 absolut verbundene Schichten.
- Die in allen Schichten verwendete Aktivierungsfunktion ist Relu.
- Verwendet zwei Schichten von Verzicht.
- Die in der Ausgabeschicht verwendete Aktivierungsfunktion ist Softmax.
- Die Gesamtzahl der Parameter in dieser Architektur beträgt 62,3 Millionen.
Das war also alles über Alexnet. Wenn Sie Zweifel haben, lass es mich in den Kommentaren unten wissen.



