SQL-Techniken | Datenanalyse mit SQL

Inhalt

Überblick

  • SQL ist eine unverzichtbare Sprache für jeden in der Datenwissenschaft oder Analytik.
  • Hier gibt es 8 ingeniosas técnicas de SQL para el análisis de datos con las que los profesionales de la Analyse y la ciencia de datos adorarán trabajar

Einführung

SQL ist ein Schlüsselelement im Arsenal eines Data-Science-Profis. ich spreche aus erfahrung: Sie können einfach nicht hoffen, eine erfolgreiche Karriere in Data Science oder Analytics aufzubauen, wenn Sie noch nicht SQL gelernt haben.

Und warum ist SQL so wichtig?

Auf dem Weg in ein neues Jahrzehnt, Die Geschwindigkeit, mit der wir Daten produzieren und verbrauchen, steigt von Tag zu Tag in die Höhe. Um intelligente datengesteuerte Entscheidungen zu treffen, Unternehmen auf der ganzen Welt stellen Datenexperten wie Business-Analysten und Datenwissenschaftler ein, um Erkenntnisse aus dem riesigen Datenschatz zu gewinnen und zu gewinnen.

Und eines der wichtigsten Werkzeuge dafür ist, Ich schätze es, SQL!

datenanalyse-mit-sql-8937988

Die strukturierte Abfragesprache (SQL) gibt es schon seit Jahrzehnten. Es ist eine Programmiersprache, die verwendet wird, um Daten zu verwalten, die in relationalen Datenbanken gespeichert sind. SQL wird von den meisten großen Unternehmen weltweit verwendet. Ein Datenanalyst kann SQL verwenden, um auf, lesen, manipular y analizar los datos almacenados en una Datenbank y generar información útil para impulsar un proceso de toma de decisiones informado.

In diesem Artikel, Ich werde diskutieren 8 Techniken / SQL-Abfragen, die Sie auf alle fortgeschrittenen Datenanalyseprobleme vorbereiten. Bitte beachten Sie, dass dieser Artikel ein sehr grundlegendes Verständnis von SQL voraussetzt.

Ich würde vorschlagen, die folgenden Kurse zu besuchen, wenn Sie neu in SQL sind und / oder Geschäftsanalyse:

Inhaltsverzeichnis

  1. Lassen Sie uns zuerst den Datensatz verstehen
  2. SQL-Technik n. ° 1: Zeilen und Elemente zählen
  3. SQL-Technik n. ° 2: Aggregationsfunktionen
  4. SQL-Technik # 3: Identifikation von Extremwerten
  5. SQL-Technik n. ° 4: Datenschnitt
  6. SQL-Technik n. ° 5: Datenbeschränkung
  7. SQL-Technik n. ° 6: Datenklassifizierung
  8. SQL-Technik n. ° 7: Filtermuster
  9. SQL-Technik n. ° 8: Cluster, Datensammlung und -filterung in Gruppen

Lassen Sie uns zuerst den Datensatz verstehen

Wie lernt man am besten, Daten zu analysieren?? Tun Sie es Seite an Seite an einem Datensatz!! Für diesen Zweck, Ich habe einen Dummy-Datensatz eines Einzelhandelsgeschäfts erstellt. Die Kundendatentabelle wird dargestellt durch VerbraucherDetails.

Unser Datensatz besteht aus den folgenden Spalten:

  • Name – Der Name des Verbrauchers
  • Standort – Der Standort des Kunden
  • Total_amt_spend – Der Gesamtbetrag, den der Verbraucher im Geschäft ausgegeben hat.
  • Industrie – Es bedeutet die Branche, zu der der Verbraucher gehört

Notiz: – Ich werde MySQL verwenden 5.7 im Artikel vorankommen. Sie können es hier herunterladen – Descargas von My SQL 5.7.

0-Daten-6-9265872

SQL-Technik n. ° 1: Zeilen- und Artikelanzahl

Wir beginnen unsere Analyse mit der einfachsten Abfrage, nämlich, Zählen der Zeilen in unserer Tabelle. Wir machen das mit der Funktion – ZÄHLEN ().

1-count-4504295

Exzellent! Jetzt kennen wir die Anzahl der Zeilen in unserer Tabelle, Was ist es 10. Es mag Spaß machen, diese Funktion für einen kleinen Satz von Testdaten zu verwenden, Aber es kann einen langen Weg gehen, wenn Ihre Ränge in die Millionen gehen!!

Viele Male, unsere Datentabelle ist voller doppelter Werte. Um den einzigartigen Wert zu erreichen, usamos la función UNTERSCHEIDBAR.

In unserem Datensatz, Wie können wir die einzigartigen Branchen finden, zu denen Kunden gehören??

Du hast es richtig erraten. Wir können dies mit der DISTINCT-Funktion tun.

2-deutlich-300x151-7977259

Sie können sogar die Anzahl der eindeutigen Zeilen zählen, indem Sie das Zählen in Verbindung mit verschiedenen verwenden. Sie können sich auf die folgende Abfrage beziehen:

3-countdistinct-6591535

SQL-Technik # 2 – Aggregationsfunktionen

Aggregationsfunktionen sind die Grundlage jeder Art von Datenanalyse. Sie geben uns einen Überblick über den Datensatz. Einige der Funktionen, die wir besprechen werden, sind: SUMME (), AVG () und STDDEV ().

Wir nehmen das SUMME() Funktion zum Berechnen der Summe der numerischen Spalte in einer Tabelle.

Lassen Sie uns die Summe der von jedem Kunden ausgegebenen Beträge herausfinden:

4-Summe-5865741

Im obigen Beispiel, sum_all ist der Variable en la que se almacena el valor de la suma. Die Summe des von den Verbrauchern ausgegebenen Geldbetrags beträgt Rs. 12.560.

So berechnen Sie den Durchschnitt numerischer Spalten, wir nehmen das AVG () Funktion. Lassen Sie uns die durchschnittlichen Verbraucherausgaben für unser Einzelhandelsgeschäft ermitteln:

5-Durchschn.-4303079

Der durchschnittliche Betrag, den Kunden im Einzelhandelsgeschäft ausgeben, beträgt Rs. 1256.

  • Berechnen Sie die Standardabweichung

Wenn Sie sich den Datensatz und dann den Durchschnittswert der Verbraucherausgaben angesehen haben, Sie werden bemerkt haben, dass etwas fehlt. Durchschnitt liefert kein vollständiges Bild, Suchen wir also nach einer anderen wichtigen Metrik: die Standardabweichung. Die Funktion ist STDDEV ().

6-stddev-4210362

Die Standardabweichung ergibt sich zu 829,7, was bedeutet, dass es eine große Diskrepanz zwischen den Konsumausgaben gibt.

SQL-Technik # 3 – Identifikation von Extremwerten

Die nächste Art der Analyse besteht darin, Extremwerte zu identifizieren, die Ihnen helfen, die Daten besser zu verstehen..

Der maximale Zahlenwert kann durch die MAX-Funktion ermittelt werden (). Mal sehen, wie man es anwendet:

7-max-7006437

Der maximale Geldbetrag, den der Verbraucher im Einzelhandel ausgibt, beträgt Rs. 3000.

Ähnlich der Max-Funktion, wir haben die MIN-Funktion () um den minimalen numerischen Wert in einer bestimmten Spalte zu identifizieren:

8-min-2344496

Der Mindestbetrag, der vom Verbraucher im Einzelhandelsgeschäft ausgegeben wird, beträgt Rs. 350.

SQL-Technik n. ° 4: Datenschnitt

Jetzt, Konzentrieren wir uns auf einen der wichtigsten Teile der Datenanalyse: Teile die Daten. Dieser Abschnitt der Analyse bildet die Grundlage für erweiterte Abfragen und hilft Ihnen, Daten basierend auf einer bestimmten Bedingung abzurufen.

  • Nehmen wir an, das Einzelhandelsgeschäft möchte Kunden finden, die aus einem Ort stammen, speziell Shakti Nagar und Shanti Vihar. Was wird die Abfrage dafür sein??

9-Filterlokalität-5941816

¡Genial, haben 3 Kunden! Hemos utilizado la cláusula WO para filtrar los datos en función de la condición de que los consumidores deberían vivir en la localidad: Shakti Nagar und Shanti Vihar. Ich habe hier nicht die ODER-Bedingung verwendet. Stattdessen, Ich habe den IN-Operator verwendet, mit dem wir mehrere Werte in der WHERE-Klausel angeben können.

  • Wir müssen Kunden finden, die an bestimmten Orten leben (Shakti Nagar und Shanti Vihar) und einen Betrag von mehr als Rs . ausgeben. 2000.

10-filter-lokalität2-2780627

In unserem Datensatz, nur Shantanu und Natasha erfüllen diese Bedingungen. Wie beide Bedingungen erfüllt sein müssen, die UND-Bedingung ist hier am besten geeignet. Sehen wir uns ein weiteres Beispiel an, um unsere Daten aufzuteilen.

  • Diesmal, Das Einzelhandelsgeschäft möchte alle Verbraucher zurückgewinnen, die zwischen Rs . ausgeben. 1000 y Rs. 2000 um spezielle Marketingangebote zu fördern. Was wird die Abfrage dafür sein??

11-filter-total_amt_spend-5493003

Eine andere Möglichkeit, dieselbe Aussage zu schreiben, wäre:

12-filter-total_amt_spend2-6211844

Nur Rohan klärt dieses Kriterium!!

Exzellent! Wir haben die Mitte unserer Reise erreicht. Lasst uns mehr auf dem bisher gewonnenen Wissen aufbauen.

SQL-Technik n. ° 5: Datenbeschränkung

Nehmen wir an, wir möchten die Datentabelle sehen, die aus Millionen von Datensätzen besteht. No podemos usar la instrucción AUSWÄHLEN directamente ya que esto volcaría la tabla completa en nuestra pantalla, das ist umständlich und rechenintensiv. Stattdessen, wir können das gebrauchen GRENZE Klausel:

14-begrenzen-4072710

Der obige SQL-Befehl hilft uns, die erste zu zeigen 5 Tabellenzeilen.

Was tun Sie, wenn Sie nur die vierte und fünfte Reihe auswählen möchten?? Wir verwenden die OFFSET-Klausel. Die OFFSET-Klausel überspringt die angegebene Anzahl von Zeilen. Mal sehen wie es funktioniert:

15-Offset-mit-Limit-4108178

SQL-Technik n. ° 6: Datenklassifizierung

Das Sortieren von Daten hilft uns, unsere Daten ins rechte Licht zu rücken. Wir können den Klassifizierungsprozess mit dem Schlüsselwort . durchführen – SORTIEREN NACH.

Das Schlüsselwort kann verwendet werden, um die Daten in aufsteigender oder absteigender Reihenfolge zu sortieren. Das Schlüsselwort ORDER BY sortiert die Daten standardmäßig in aufsteigender Reihenfolge.

Sehen wir uns ein Beispiel an, in dem wir die Daten nach der Spalte Total_amt_spend in aufsteigender Reihenfolge sortieren:

16-sort-1-5168163

Beeindruckend! So sortieren Sie den Datensatz in absteigender Reihenfolge, wir können dem folgenden Befehl folgen:

17-sort2-2698815

SQL-Technik # 7 – Filtermuster

In den vorherigen Abschnitten, Wir haben gelernt, wie man Daten basierend auf einer oder mehreren Bedingungen filtert. Hier, wir lernen, wie man die Spalten filtert, die einem bestimmten Muster entsprechen. Um damit weiterzumachen, Zuerst werden wir den LIKE-Operator und die Platzhalterzeichen verstehen.

Der LIKE-Operator wird in einer WHERE-Klausel verwendet, um ein bestimmtes Muster in einer Spalte zu finden.

Das Platzhalterzeichen wird verwendet, um ein oder mehrere Zeichen in einer Zeichenfolge zu ersetzen. Diese werden in Verbindung mit dem LIKE-Operator verwendet. Die beiden häufigsten Platzhalterzeichen sind:

    • %: Es repräsentiert 0 oder mehr Zeichen
    • _ – Stellt ein einzelnes Zeichen dar

In unserem fiktiven Einzelhandelsdatensatz, sagen wir, wir wollen alle Orte, die mit "Nagar" enden. Nehmen Sie sich einen Moment Zeit, um die Problemstellung zu verstehen und überlegen Sie, wie wir sie lösen können.

Versuchen wir das Problem zu lösen. Wir benötigen alle Orte, die mit enden „Nagar“ und sie können eine beliebige Anzahl von Zeichen vor dieser bestimmten Zeichenfolge haben. Deswegen, wir können die Wildcard nutzen „%“ Vor „Nagar“:

18-filter_pattern1-3145307

Beeindruckend, haben 6 Orte die auf diesen Namen enden. Beachten Sie, dass wir den LIKE-Operator verwenden, um einen Mustervergleich durchzuführen.

Dann, Wir werden versuchen, ein weiteres Problem anhand von Mustern zu lösen. Wir wollen die Namen von Verbrauchern, deren zweites Zeichen hat „ein“ in ihren jeweiligen Namen. Nochmal, Ich schlage vor, Sie nehmen sich einen Moment Zeit, um das Problem zu verstehen und sich eine Logik zu überlegen, um es zu lösen.

Lass uns das Problem analysieren. Hier, das zweite Zeichen muss sein „ein“. Das erste Zeichen kann alles sein, Also ersetzen wir diesen Buchstaben durch den Platzhalter "_". Nach dem zweiten Zeichen, es kann eine beliebige Anzahl von Zeichen geben, Also ersetzen wir diese Zeichen durch den Platzhalter „%“. Die endgültige Musterübereinstimmung wird so aussehen:

19-filter_pattern2-4206682

Verfügen über 6 Menschen, die diese seltsame Bedingung erfüllen!

SQL-Technik n. ° 8: Cluster, Datensammlung und -filterung in Gruppen

Endlich sind wir bei einem der mächtigsten Analysetools in SQL angekommen: la agrupación de datos que se realiza utilizando la instrucción GRUPPIEREN NACH. Die nützlichste Anwendung dieser Aussage besteht darin, die Verteilung kategorialer Variablen zu finden. Dies geschieht mit der GROUP BY-Anweisung in Verbindung mit Aggregationsfunktionen wie – ZÄHLEN, SUMME, AVG, etc.

Versuchen wir, dies besser zu verstehen, indem wir eine Erklärung des Problems machen. Das Einzelhandelsgeschäft möchte die Anzahl der Kunden ermitteln, die der Branche entspricht, zu der es gehört:

20-groupby1-6562280

Wir beobachten, dass die Anzahl der Kunden aus den verschiedenen Branchen mehr oder weniger gleich ist. Dann, Lassen Sie uns die Summe der Ausgaben der Kunden nach Branche gruppieren, zu der sie gehören:

21-groupby2-8094823

Wir können sehen, dass der maximale Geldbetrag von Kunden ausgegeben wird, die zu den . gehören Herstellung Industrie. Das scheint ein bisschen einfach zu sein, Wahrheit? Lasst uns einen Schritt nach vorne machen und es komplizierter machen.

Jetzt, der Einzelhändler möchte die Branchen finden, deren Gesamtsumme ist größer als 2500. Um dieses Problem zu lösen, volveremos a agrupar los datos según la industria y luego usaremos la cláusula HABEN.

Die HAVING-Klausel ist wie die WHERE-Klausel, aber nur zum Filtern gruppierter Daten. Erinnern, kommt immer nach der GROUP BY-Anweisung.

22-groupby-3-8445702

Wir haben nur 3 Kategorien, die die Bedingungen erfüllen: Luftfahrt, Verteidigen, Ja Herstellung. Aber um es klarer zu machen, Ich werde auch das Schlüsselwort ORDER BY hinzufügen, um es intuitiver zu machen:

23-groupby4-4805299

Abschließende Anmerkungen

Ich freue mich, dass du es bis hierher geschafft hast. Dies sind die Bausteine ​​aller Datenanalyseabfragen in SQL. Mit diesen Grundlagen können Sie auch erweiterte Abfragen durchführen. In diesem Artikel, ich habe mysql benutzt 5.7 um die Beispiele zu setzen.

Ich hoffe wirklich, dass diese SQL-Abfragen Ihnen bei der täglichen Analyse komplexer Daten helfen. Haben Sie einen Ihrer Tipps und Tricks zum Analysieren von Daten in SQL? Lass es mich in den Kommentaren wissen!!

Abonniere unseren Newsletter

Wir senden Ihnen keine SPAM-Mail. Wir hassen es genauso wie du.

Datenlautsprecher