Klassifikationsmodelle im maschinellen Lernen

Inhalt

Dieser Artikel wurde im Rahmen der Data Science Blogathon.

Einführung

Klassifikation-Maschinen-Lernalgorithmen-6195900

Und wir lernen nebenbei.

Die Unternehmen, ähnlich, wenden ihre Erfahrungen aus der Vergangenheit auf die Entscheidungsfindung in Bezug auf Operationen und neue Initiativen an, zum Beispiel, bezogen auf die Kundenklassifizierung, Produkte, etc. Aber trotzdem, Hier wird es etwas komplexer, da mehrere Stakeholder beteiligt sind. Was ist mehr, Entscheidungen müssen aufgrund ihrer Breitenwirkung genau sein.

Mit der Entwicklung der digitalen Technologie, Menschen haben mehrere Vermögenswerte entwickelt; Maschinen sind eine davon. Wir haben gelernt (und wir machen weiter) Maschinen zu verwenden, um Daten mithilfe von Statistiken zu analysieren, um nützliche Informationen zu generieren, die bei der Entscheidungsfindung und Prognose helfen.

Maschinen zaubern nicht mit Daten, sie wenden einfache Statistiken an.

In diesem Kontext, Sehen wir uns einige häufig verwendete Algorithmen für maschinelles Lernen zur Klassifizierung an und versuchen wir zu verstehen, wie sie funktionieren und miteinander verglichen werden. Aber zuerst, Lassen Sie uns einige verwandte Konzepte verstehen.

Grundlegendes Konzept

Das überwachtes Lernen se define como la categoría de análisis de datos donde el resultado objetivo es conocido o etiquetado, zum Beispiel, ob der Kunde oder die Kunden ein Produkt gekauft haben oder nicht. Aber trotzdem, wenn die Absicht besteht, sie basierend auf dem, was jeder gekauft hat, zu gruppieren, dann wird es unbeaufsichtigt. Dies kann getan werden, um die Beziehung zwischen Kunden und dem, was sie kaufen, zu erkunden.

Sowohl Klassifikation als auch Regression gehören zum überwachten Lernen, aber das erste gilt, wenn das Ergebnis endlich ist, während letzteres für unendlich mögliche Ergebniswerte gilt (zum Beispiel, den Dollarwert des Kaufs vorhersagen).

La distribución normal es la conocida distribución en forma de campana de una Variable continua. Dies ist eine natürliche Erweiterung der Werte, die ein Parameter normalerweise annimmt.

Da Prädiktoren unterschiedliche Wertebereiche haben können, zum Beispiel, Das menschliche Gewicht kann bis zu . betragen 150 (kg), aber die typische höhe ist nur bis zu 6 (Kuchen); Werte brauchen Skala (um den jeweiligen Mittelwert) um sie vergleichbar zu machen.

Kollinearität liegt vor, wenn zwei oder mehr Prädiktoren verwandt sind, nämlich, ihre Werte rücken zusammen.
Ausreißer sind außergewöhnliche Werte eines Prädiktors, das kann stimmen oder nicht.

Regression-gegen-Klassifikation-im-Maschinenlernen-4568442

Logistische Regression

Die logistische Regression nutzt die Kraft der Regression, um eine Klassifikation durchzuführen, und macht dies seit mehreren Jahrzehnten sehr gut., um unter den beliebtesten Modellen zu bleiben. Einer der Hauptgründe für den Erfolg des Modells ist seine Erklärbarkeit, nämlich, weisen Sie auf den Beitrag einzelner Prädiktoren hin, quantitativ.

Im Gegensatz zur Regression, die kleinste Quadrate verwendet, das Modell verwendet die maximale Wahrscheinlichkeit, um eine Sigmoid-Kurve in die Verteilung der Zielvariablen einzupassen.

Angesichts der Anfälligkeit des Modells für Multikollinearität, Die schrittweise Anwendung stellt sich als besserer Ansatz heraus, um die gewählten Prädiktoren des Modells zu finalisieren.

Der Algorithmus ist eine beliebte Wahl bei vielen Aufgaben zur Verarbeitung natürlicher Sprache, zum Beispiel, toxische Spracherkennung, Klassifizierung von Themen, etc.

Grundstück-3541612

Künstliche neurale Netzwerke

Künstliche neurale Netzwerke (ANN), so genannt, weil sie versuchen, das menschliche Gehirn nachzuahmen, eignen sich für große und komplexe Datensätze. Seine Struktur besteht aus Schichten von Zwischenknoten (ähnlich wie Neuronen) die zusammen auf die mehreren Eingänge und den Zielausgang abgebildet werden.

Es ist ein selbstlernender Algorithmus, da es mit einer ersten Zuordnung beginnt (zufällig) Ja, seit damals, Passen Sie bezogene Gewichtungen iterativ automatisch an, um die gewünschte Ausgabe für alle Register fein abzustimmen. Las múltiples capas brindan una capacidad de tiefes Lernen para poder extraer características de nivel superior de los datos sin procesar.

Der Algorithmus bietet eine hohe Vorhersagegenauigkeit, aber es ist notwendig, numerische Eigenschaften zu skalieren. Es hat breite Anwendungen in zukünftigen Bereichen, einschließlich Computer Vision, PNL, Spracherkennung, etc.

künstliches-neuronales-netzwerk-3501528_960_720-5695969

Zufälliger Wald

Ein Random Forest ist ein zuverlässiger Satz von mehreren Entscheidungsbäumen (o WARENKORB); obwohl beliebter für die Klassifizierung als Regressions-Apps. Hier, einzelne Bäume werden durch Absacken gebaut (nämlich, Aggregation von Bootstraps, die nichts anderes als mehrere Stream-Datensätze sind, die durch Datensatz-Sampling mit Ersetzung erstellt wurden) und mit weniger Funktionen aufteilen. Der vielfältige Wald, der aus unkorrelierten Bäumen resultiert, weist eine reduzierte Variation auf; Daher, ist robuster gegenüber Datenänderungen und verlagert seine Vorhersagegenauigkeit auf neue Daten.

Aber trotzdem, der Algorithmus funktioniert nicht gut für Datensätze mit vielen Ausreißern, etwas, das vor dem Erstellen des Modells angegangen werden muss.

Es hat breite Anwendungsmöglichkeiten im Finanzbereich, Einzelhändler, Luftfahrt und viele andere.

Wald7-3591004

Bayes ingenuo

Auch wenn wir dies vielleicht nicht erkennen, Dies ist der am häufigsten verwendete Algorithmus zum Filtern von Spam-E-Mails!!

Wenden Sie die sogenannte Posterior-Wahrscheinlichkeit an, indem Sie den Satz von Bayes verwenden, um unstrukturierte Daten zu kategorisieren. Und dabei, nimmt naiv an, dass Prädiktoren unabhängig sind, was kann nicht wahr sein.

El modelo funciona bien con un pequeño conjunto de datos de Ausbildung, vorausgesetzt, dass alle Klassen des kategorialen Prädiktors vorhanden sind.

naiv-2432706

KNN

Der K-Nemost Neighbor Algorithmus (KNN) prognostiziert basierend auf der angegebenen Zahl (k) der nächsten benachbarten Datenpunkte. Hier, Die Datenvorverarbeitung ist von Bedeutung, da sie sich direkt auf Entfernungsmessungen auswirkt. Nicht wie andere, das Modell hat keine mathematische Formel, noch beschreibende Fähigkeit.

Hier, der Parameter ‚k‘ muss mit Bedacht gewählt werden; da ein niedriger als optimaler Wert zu einem Bias führt, während ein höherer Wert die Genauigkeit der Vorhersage beeinflusst.

Es ist ein einfaches und ziemlich genaues Modell, das meistens für kleinere Datensätze bevorzugt wird, aufgrund der umfangreichen Berechnungen, die bei kontinuierlichen Prädiktoren erforderlich sind.

Auf einer einfachen Ebene, KNN kann in einer bivariaten Vorhersageumgebung verwendet werden, zum Beispiel, Größe und Gewicht, um das Geschlecht anhand einer Probe zu bestimmen.

knn2-8013361

Alles zusammenfügen

Die Leistung eines Modells hängt hauptsächlich von der Art der Daten ab. Da Geschäftsdatensätze mehrere Prädiktoren haben und komplex sind, Es ist schwierig, einen Algorithmus zu finden, der immer gut funktioniert. Deswegen, die übliche Praxis ist, mehrere Modelle auszuprobieren und das richtige zu finden.

Als High-Level-Vergleich, Los aspectos más destacados que se encuentran generalmente para cada uno de los algoritmos anteriores se anotan a continuación en algunos Parameter comunes; als schnelle Referenz-Schnappschuss dienen.

32753Screenshot2020-11-2820at2010-09-4020pm-9816822

Was ist mehr, es gibt mehrere hebel, zum Beispiel, Datenausgleich, Zurechnung, Kreuzvalidierung, zwischen Algorithmen setzen, größter Zugdatensatz, etc. plus Modell-Hyperparameter-Tuning, das kann verwendet werden, um Präzision zu gewinnen. Während Vorhersagegenauigkeit am wünschenswertesten sein kann, Unternehmen suchen auch nach prominenten Prädiktoren, die dazu beitragen (nämlich, ein beschreibendes Modell oder seine daraus resultierende Erklärbarkeit).

Schließlich, maschinelles Lernen ermöglicht es dem Menschen, quantitativ zu entscheiden, vorhersagen und über das Offensichtliche hinausschauen, wenn auch manchmal in bisher unbekannten Aspekten.

Abonniere unseren Newsletter

Wir senden Ihnen keine SPAM-Mail. Wir hassen es genauso wie du.

Datenlautsprecher