Erstellen Sie ein lineares Regressionsmodell in Qlik Sense

Inhalt

Überblick

  • Qlik wird häufig mit leistungsstarken Business-Intelligence-Dashboards und -Berichten in Verbindung gebracht.
  • Wussten Sie, dass Sie die Leistungsfähigkeit von Qlik nutzen können, um Vorhersagemodelle durchzuführen und Modelle zu erstellen??
  • Erfahren Sie in dieser wirklich coolen Anleitung, wie Sie mit Qlik Sense ein lineares Regressionsmodell erstellen.

Einführung

„Kann ich Qlik Sense verwenden, um eine JA JA-Analyse zu erstellen, ein einfaches lineares Regressionsmodell zu erstellen, damit meine Geschäftsanwender zukünftige Einnahmen basierend auf den Zielverkäufen vorhersagen können??“

Eine spannende Frage! Qlik wird häufig mit der Erstellung von Business-Intelligence-Dashboards und -Berichten in Verbindung gebracht., nicht mit prädiktiver Modellierung. Wenn du den gleichen Gedanken hast, du bist nicht allein!

Qlik ist für jeden Unternehmensführer wie ein Wind im Rücken. Macht das Analysieren und Präsentieren von Daten für Endbenutzer extrem einfach und schnell. Es überrascht nicht, dass Qlik regelmäßig als Leader im Gartner Magic Quadrant for Business Intelligence and Analytics Platforms ausgezeichnet wird..

Foto-1542744173-05336fcc7ad4-300x217-5080903

Was ich an Qlik wirklich mag, ist, dass sein assoziatives Modell eine Freiform-Datenerkennung bietet. Dies hilft unseren Endbenutzern, Trends und Ausreißer schnell zu finden und wertvolle Erkenntnisse zu gewinnen.. Qlik ist bekannt für sein assoziatives Modell und für die unglaubliche Geschwindigkeit, mit der es Assoziationen zwischen Feldern innerhalb eines Datenmodells aufdeckt..

Mit seinem Paradigmenwechsel, alle Daten anzuzeigen, inklusive Ausreißer, unsere Kunden und Stakeholder können schnell Informationen finden, um wichtige Geschäftsentscheidungen zu treffen. Qlik-Anwendungen umfassen mehrere Branchen, wie z:

  • Im Gesundheitswesen, eine Versicherungsgesellschaft möchte möglicherweise die zukünftigen Kosten der Patientenversorgung anhand der Kosten vorhersagen, demografische Daten und Vordiagnosen.
  • Produktfehler können anhand der Effizienz des Prozesses basierend auf den vorherigen Fehlern und der Präzision der Ausrüstung im Fertigungsbereich vorhergesagt werden.
  • Im Personalwesen, Wir können die zukünftigen Kosten der Gehaltsabrechnung eines Mitarbeiters basierend auf seinem Alter und seiner Erfahrung vorhersagen.

Überlege dir die Möglichkeiten, Sie sind unendlich!

Nach dem Lesen dieses Artikels, wird den Hut eines Data Scientists aufsetzen können, da sowohl QlikView als auch Qlik Sense eine große Anzahl statistischer Funktionen bieten, die Sie nutzen können, um Ihr erstes Vorhersagemodell mit linearer Regression zu erstellen. Lasst uns beginnen!

Inhaltsverzeichnis

  1. Einführung in die einfache lineare Regression
  2. Implementieren der linearen Regression in Qlik
  3. Vergleich unserer Ergebnisse mit einem mit Python erstellten Modell

Einführung in die einfache lineare Regression

blog-1-300x172-7884159
Quelle: xkcd.com

Beginnen wir mit dem Konzept der Regressionsanalyse. Es handelt sich um eine Form der prädiktiven Modellierung, die die Beziehung zwischen einem Variable unabhängig und abhängig. Dies ist vielleicht die gebräuchlichste Technik, die angehende Data-Science-Profis zuerst lernen..

Regression wird verwendet, um den Beitrag einer oder mehrerer Variablen zu bewerten „verursachend“ (unabhängige Variablen) zu einer Variablen „verursacht“ (abhängig). Wir können es auch verwenden, um den Wert der abhängigen Variablen aus den Werten der unabhängigen Variablen vorherzusagen. Einige beliebte Beispiele sind die Vorhersage des Preises eines Hauses, das Gehalt eines Mitarbeiters, etc. (Ich bin sicher, Ihr Kopf muss voller Ideen sein!!).

Wenn es nur eine unabhängige Variable gibt und die Beziehung als gerade Linie ausgedrückt werden kann, das Verfahren heißt einfache lineare Regression.

Eine Gerade kann durch die mathematische Gleichung y = mx . definiert werden + B:

blog-2-300x145-7277095

  • y ist eine abhängige Variable und wird auf der vertikalen Achse dargestellt
  • x ist eine unabhängige Variable und wird auf der horizontalen Achse dargestellt
  • m ist die Steigung (Betrag der Änderung in y entsprechend der Zunahme um eine Einheit in x)
  • b ist der Schnittpunkt

blog-3-150x150-5194477Quelle: http://www.statstutor.ac.uk

Das Regressionsverfahren passt die bestmögliche Gerade an eine Matrix von Datenpunkten an. Wenn eine einzelne Linie nicht so gezeichnet werden kann, dass alle Punkte darauf fallen, was ist das „Beste“ Linie? Denken Sie darüber nach, bevor Sie die Antwort lesen.

Die beste Linie ist diejenige, die den Abstand aller Datenpunkte zur Linie minimiert.

Der Korrelationskoeffizient gibt die Stärke der Beziehung zwischen den unabhängigen und abhängigen Variablen an., während das Bestimmtheitsmaß (R Quadrat) erklärt, inwieweit die Varianz der unabhängigen Variablen die Varianz der abhängigen Variablen erklärt.

Ein Korrelationskoeffizient nahe 1 zeigt eine positive Beziehung zwischen der unabhängigen und der abhängigen Variablen und einem Bestimmtheitsmaß näher an 1 zeigt eine gute Anpassung der Daten an das Vorhersagemodell an.

Ausgestattet mit diesem Wissen, wir können unser erstes einfaches lineares Regressionsmodell in Qlik Sense oder QlikView erstellen.

Implementieren der linearen Regression in Qlik

Vor kurzem, Ich bin ... über den Weg gelaufen dieser sehr interessante artikel zeigt den Zusammenhang zwischen Teenagerschwangerschaften und der Armutsrate in den Vereinigten Staaten. Diese Fakten sind es wert, über die Gründe nachgedacht zu werden, warum Teenagerschwangerschaften zu einer höheren Armutsrate führen:

  • Nur der 38 Prozent der Mädchen, die schon einmal ein Kind bekommen haben 18 Jahre erwerben ihr Abitur an 22
  • Zwei Drittel der jugendlichen Mütter, die aus dem Elternhaus ausziehen, leben in Armut und ein ähnlicher Anteil erhält im ersten Lebensjahr ihres Kindes staatliche Leistungen..
  • 78 Prozent der Kinder von unverheirateten Teenagermüttern, die keinen Highschool-Abschluss gemacht haben, leben unterhalb der bundesstaatlichen Armutsgrenze.

Es ist ein Problem, das uns allen bewusst sein sollte und wenn wir irgendwie helfen können, wir sollten es zumindest versuchen. Ich hatte das Glück, einen Datensatz dazu zu finden bei Statistik-Website der Pennsylvania State University, STAT462.

Dann, wir werden verwenden dieser Datensatz um ein einfaches lineares Regressionsmodell in Qlik Sense zu erstellen. Fahren Sie fort und speichern Sie es auf Ihrem Computer. Hier ist eine Momentaufnahme des Datensatzes:

blog-4-300x185-2729365
Dieser Datensatz der Größe n = 51 ist für die 50 Bundesstaaten und der District of Columbia in den Vereinigten Staaten.

Dann, Schauen wir uns die Schritte an und ich möchte, dass Sie sie in Qlik Sense verfolgen, während wir sie durchgehen.

Paso 1: ein Streudiagramm erstellen

blog-5-300x277-3381989

Paso 2: Berechnen Sie den Korrelationskoeffizienten

Erstellen Sie ein Text- und Bilddiagramm mit dem folgenden Ausdruck:

blog-6-8735251

Paso 3: Berechnen Sie das Bestimmtheitsmaß.

Erstellen Sie ein Text- und Bilddiagramm mit diesem Ausdruck:

blog-7-8042729

Paso 4: Berechnen Sie die Steigung

blog-8-7447975

Paso 5: Finden Sie den y-Achsenabschnitt

blog-9-6885799

Paso 6: erzeuge eine Variable x mit dem Anfangswert = 0

Diese Variable ermöglicht es uns, den Wert der unabhängigen Variablen zu ändern, Geburtenrate (15 ein 17), um die Armutsrate vorherzusagen. Klicken Sie auf die Variablenoption in der unteren linken Ecke des Blatteditors:

blog-10-300x145-2804694

Paso 7: Berechnen Sie die erwartete Geburtenrate für die Teenagergruppe (15 ein 17)

blog-11-300x67-8753542

Wie hier angegeben, unser lineares Regressionsmodell von Qlik Sense entspricht der Anpassungsliniengleichung:

Y = 1,373X + 4,267

Mit einer Armutsquote von 0%, die jugendliche Geburtenrate wäre 4,27%. Eine Änderung des Wertes der unabhängigen Variablen um eine Einheit entspricht einer Änderung von 1,373 im Wert der abhängigen Variablen.

blog-12-300x143-7909805

Wie hoch wäre die Geburtenrate bei Jugendlichen, wenn die Armutsrate 15%? Das ist die Antwort:

blog-13-300x264-3386121

Jetzt kann ich die Kraft des assoziativen Motors kombinieren, um die Liste der Staaten einzugrenzen und die Geburtenrate für eine Altersgruppe von Frauen vorherzusagen 15 ein 17 Jahren basierend auf meiner Auswahl unter Verwendung der Armutsquote der 15%:

blog-14-300x144-2580284

Fabelhaft! Liebst du nicht die Kraft von Qlik?

Vergleich unserer Ergebnisse mit einem mit Python erstellten Modell

Dann, Wir werden ein ähnliches einfaches Regressionsmodell in Python unter Verwendung der Pandas- und scikit-learn-Bibliotheken erstellen. Ich möchte die Genauigkeit des Vorhersagemodells, das wir in Qlik Sense erstellen, mit einem Modell vergleichen, das wir in Python erstellen werden.

blog-15-300x146-6124358

Das Ergebnis unseres einfachen Python-Regressionsmodells entspricht dem von Qlik Sense. Vergleichen wir den Vorhersagewert unseres linearen Regressionsmodells von Qlik Sense mit dem, das wir in Python erstellt haben:

blog-16-300x114-9650905

Abschließende Anmerkungen

Wir können ein einfaches Regressionsmodell erstellen, um das Szenario zu zeigen „Was ist, wenn“ in Qlik Sense, solange wir zuerst mithilfe einer integrierten Korrelationsfunktion überprüfen, ob die Beziehung zwischen der unabhängigen und der abhängigen Variable positiv oder negativ ist, um die Beziehung zu sehen .

Was ist mehr, Stellen Sie sicher, dass die Daten für die Modellierung mit dem Bestimmtheitsmaß geeignet sind (R Quadrat). Wenn ein Wert näher an liegt 1, dann eignen sich unsere Daten für die einfache Regressionsmodellierung in Qlik Sense.

Teilen Sie mir Ihre Vorschläge und Kommentare zu diesem Artikel im Kommentarbereich unten mit..

Über den Autor

Shilpan Patel – Mitgründer, Analyticshub.io Y Qlik-Leuchte 2018, 2019

shilpan_patel-4078935

Shilpan ist eine Qlik Luminary und setzt sich leidenschaftlich dafür ein, Schülern zu ermöglichen, ihr volles Potenzial durch lebenslanges Lernen und Mentoring zu entfalten. Er glaubt, dass der beste Weg, eine Fähigkeit zu erlernen und zu beherrschen, darin besteht, etwas zu tun. Hat mehr als 15 Jahre Erfahrung im Bereich Daten und Analyse, und hat Tausende von Schülern unterrichtet und betreut.

Abonniere unseren Newsletter

Wir senden Ihnen keine SPAM-Mail. Wir hassen es genauso wie du.

Datenlautsprecher