K steht für vereinfachte Gruppierung in Python

Inhalt

Überblick

  • Was ist K steht für Clustering?
  • Umsetzung von K steht für Clustering
  • WCSS- und Ellbogen-Methode, um die Anzahl der Cluster zu ermitteln
  • Python-Implementierung von K bedeutet Clustering

K mean ist einer der beliebtesten unüberwachten maschinellen Lernalgorithmen zur Lösung von Klassifikationsproblemen. K bedeutet, dass die nicht gekennzeichneten Daten in mehrere Gruppen unterteilt werden, sogenannte Cluster, basierend auf ähnlichen Eigenschaften, gängige Muster.

46668k-means-clustering-algorithm-in-machine-learning-3507448

Inhaltsverzeichnis

  1. Was ist Clustering??
  2. Was bedeutet der K-Algorithmus?
  3. Schematische Implementierung von KMeans Clustering
  4. Wählen Sie die richtige Anzahl von Clustern
  5. Python-Implementierung

1. Was ist Clustering??

Angenommen, wir haben eine Anzahl N von unmarkierten multivariaten Datensätzen von verschiedenen Tieren wie Hunden, gatos, Vögel, etc. Die Technik zum Aufteilen von Datensätzen in mehrere Gruppen, basierend auf ähnlichen Eigenschaften und Eigenschaften, es heißt Clustering..

Die gebildeten Gruppen werden als Cluster bezeichnet. Die Clustering-Technik wird in mehreren Bereichen eingesetzt, wie Bilderkennung, Spam-Filterung

Clustering wird im Algorithmus von Unüberwachtes Lernen im maschinellen Lernen als Multivariate Daten können in mehrere Gruppen unterteilt werden, ohne Vorgesetzten, basierend auf einem gemeinsamen Muster, das in Datensätzen verborgen ist.

2. Was bedeutet der K-Algorithmus?

Der Kmeans-Algorithmus ist ein iterativer Algorithmus, der eine Gruppe von n Datensätzen in k Untergruppen aufteilt / Cluster basierend auf Ähnlichkeit und ihrem mittleren Abstand vom Schwerpunkt dieser Untergruppe / insbesondere gebildet..

K, hier ist die vordefinierte Anzahl von Clustern, die der Algorithmus bildet. Wenn K = 3, bedeutet, dass die Anzahl der Cluster, die aus dem Datensatz gebildet werden, ist 3

Schritte des Mean-K-Algorithmus

Die Funktionsweise des K-Means-Algorithmus wird in den folgenden Schritten erklärt:

Paso 1: Wählen Sie den Wert von K aus, um die Anzahl der zu bildenden Cluster zu bestimmen.

Paso 2: Wählen Sie K zufällige Punkte aus, die als Schwerpunkt fungieren.

Paso 3: Jeden Datenpunkt zuordnen, basierend auf seiner Entfernung von zufällig ausgewählten Punkten (Schwerpunkt), zum nächsten Schwerpunkt / schließen, das die vordefinierten Gruppen bildet.

Paso 4: Platziere einen neuen Schwerpunkt jeder Gruppe.

Paso 5: Schritt wiederholen 3, wodurch jeder Datenpunkt dem neuen nächstgelegenen Schwerpunkt jeder Gruppe neu zugewiesen wird.

Paso 6: Wenn eine Neuzuweisung auftritt, gehe zu Schritt 4; andererseits, gehe zu Schritt 7.

Paso 7: ENDEN

3. Schematische Implementierung von K bedeutet Clustering

PASO 1:Wählen wir die Anzahl k von Clustern, nämlich, K = 2, den Datensatz zu trennen und in verschiedene Cluster zu platzieren. Wir werden einige auswählen 2 zufällige Punkte, die als Zentroide fungieren, um die Gruppe zu bilden.

PASO 2: Jetzt weisen wir jeden Datenpunkt einem Ausbreitungsdiagramm basierend auf seiner Entfernung zum nächstgelegenen K-Punkt oder Zentrum zu. Dies wird durch Zeichnen eines Median zwischen beiden Zentroiden. Betrachten Sie das folgende Bild:

PASO 3: die Punkte auf der linken Seite der Linie befinden sich in der Nähe des blauen Schwerpunkts und die Punkte auf der rechten Seite der Linie befinden sich in der Nähe des gelben Schwerpunkts. Der linke bildet eine Gruppe mit blauem Schwerpunkt und der rechte mit gelbem Schwerpunkt..

PASO 4:wiederholen Sie den Vorgang ein neuer Schwerpunkt. So wählen Sie die neuen Schwerpunkte, wir finden den neuen Schwerpunkt dieser Schwerpunkte, unten gezeigt:

PASO 5: Dann, wir werden jeden Datenpunkt dem neuen Schwerpunkt neu zuweisen. Wir werden den gleichen vorherigen Vorgang wiederholen (mit einer Mittellinie). Der gelbe Datenpunkt auf der blauen Seite der Medianlinie wird in die blaue Gruppe aufgenommen

19873tb6-8189281

PASO 6: Da die Umverteilung erfolgt ist, Wir wiederholen den vorherigen Schritt zum Finden neuer Schwerpunkte.

38346tb5-8462174

PASO 7: Wir wiederholen den vorherigen Vorgang zur Ermittlung des Schwerpunkts der Schwerpunkte, wie im Folgenden gezeigt.

49556tb4-5325801

PASO 8: Nach dem Finden der neuen Schwerpunkte, wir werden die Medianlinie erneut zeichnen und die Datenpunkte neu zuweisen, wie in den vorherigen Schritten.

35981tb3-3268103

PASO 9: Schließlich, Wir werden Punkte basierend auf der Medianlinie trennen, so dass zwei Gruppen gebildet werden und keine unterschiedlichen Punkte in einer einzigen Gruppe enthalten sind.

40672tb2-7670322

Die letzte Gruppe, die gebildet wird, ist die folgende

96395pq-2152300

4. Wählen Sie die richtige Anzahl von Clustern

Die Anzahl der Cluster, die wir für den Algorithmus wählen, darf nicht zufällig sein. Jeder einzelne Cluster wird gebildet, indem die mittleren Entfernungen jedes Datenpunkts innerhalb eines Clusters von seinem Schwerpunkt berechnet und verglichen werden.

Wir können die richtige Anzahl von Clustern mithilfe der Summe der Quadrate innerhalb des Clusters bestimmen Cluster (WCSS).

WCSS Repräsentiert die Summe der Quadrate der Abstände der Datenpunkte in jeder einzelnen Gruppe von ihrem Schwerpunkt.

Die Hauptidee besteht darin, den Abstand zwischen den Datenpunkten und dem Schwerpunkt der Cluster zu minimieren. Der Prozess wird iteriert, bis ein Mindestwert für die Summe der Distanzen erreicht ist.

So finden Sie den optimalen Wert von Clustern, Ellenbogenmethode folgen Sie den folgenden Schritten:

1 Führen Sie die Gruppierung von K-Means in einem gegebenen Datensatz für verschiedene K-Werte (das geht von 1 al 10).

2 Für jeden Wert von K, berechnet den WCSS-Wert.

3 Zeichnen Sie eine Grafik / Kurve zwischen WCSS-Werten und jeweiliger Clusteranzahl K.

4 Der spitze Krümmungspunkt oder ein Punkt (das sieht aus wie ein Ellenbogengelenk) des Rahmens wie ein Arm, wird als das Beste angesehen / optimaler K-Wert

5. Python-Implementierung

Importieren Sie relevante Bibliotheken

numpy als np importieren
Pandas als pd importieren
importiere statsmodels.api als sm
import matplotlib.pyplot als plt
Seegeboren als sns importieren
sns.set()
aus sklearn.cluster importieren KMeans

Laden der Daten

data = pd.read_csv('Countryclusters.csv')
Daten
63374snip1-8657293

Die Daten grafisch darstellen

plt.streuung(Daten['Längengrad'],Daten['Breitengrad'])
plt.xlim(-180,180)
plt.ylim(-90,90)
plt.zeigen()
48681herunterladen208-2988085

Funktion auswählen

 x = data.iloc[:,1:3] # 1t für Zeilen und zweitens für Spalten
x
46942snip2-9206832

Gruppierung

kmeans = KMeans(3)
bedeutet.fit(x)

Clustering-Ergebnisse

identifizierte_cluster = kmeans.fit_predict(x)
identifizierte_cluster
Array([1, 1, 0, 0, 0, 2])
data_with_clusters = data.copy()
data_with_clusters['Cluster'] = identifizierte_cluster
plt.streuung(data_with_clusters['Längengrad'],data_with_clusters['Breitengrad'],c=data_with_clusters['Cluster'],cmap='rainbow')
73075herunterladen209-8093241

Versuchen Sie es mit einer anderen Methode (zu finden in. Von Gruppen zur Auswahl)

WCSS und Ellenbogenmethode

wcss=[]
für mich in Reichweite(1,7):
kmeans = KMeans(ich)
kmeans.fit(x)
wcss_iter = kmeans.inertia_
wcss.append(wcss_iter)

number_clusters = Bereich(1,7)
plt.plot(number_cluster,WC)
plt.titel('Der Elbow-Titel')
plt.xlabel('Anzahl der Cluster')
plt.ylabel('WCSS')
38785herunterladen2010-9638209

wir können wählen 3 selbstverständlich. Konglomerate, Diese Methode zeigt die gute Anzahl von Clustern.

Damit beende ich diesen Blog.
Hallo allerseits, Namasté
Mein Name ist Pranshu Sharma und ich bin ein Data Science-Enthusiast
Vielen Dank, dass Sie sich Ihre wertvolle Zeit genommen haben, um diesen Blog zu lesen.. Auf Fehler gerne hinweisen (schließlich, ich bin lehrling) und hinterlasse die entsprechenden Kommentare oder hinterlasse einen Kommentar.
Dhanyvaad !!
Rückmeldung:
Email: [E-Mail geschützt]

Die in diesem Artikel gezeigten Medien sind nicht Eigentum von DataPeaker und werden nach Ermessen des Autors verwendet.

Abonniere unseren Newsletter

Wir senden Ihnen keine SPAM-Mail. Wir hassen es genauso wie du.

Datenlautsprecher