Statistiken 101 | Arten von T-Tests

Inhalt

Einführung

„Man kann eine Hypothese nicht testen; du kannst es nur verbessern oder widerlegen „. – Christopher Monckton

Jeden Tag probieren wir neue Ideen aus, Den schnellsten Weg zum Büro finden, der schnellste Weg, unsere Arbeit zu beenden oder einfach einen besseren Weg zu finden, um etwas zu tun, das wir lieben. Die kritische Frage, dann, ist, wenn unsere Idee deutlich besser ist als das, was wir zuvor getestet haben.

Diese Ideen, die uns so regelmäßig einfallen, das ist im Wesentlichen eine Hypothese. Und probieren Sie diese Ideen aus, um herauszufinden, welche funktioniert und welche am besten zurückgelassen wird., es heißt Hypothesentest.

Hypothesentests sind eines der faszinierendsten Dinge, die wir tun Datenwissenschaftler. In dieser Phase unseres Projekts ist keine Idee tabu. Persönlich, Ich habe gesehen, wie viele Ideen aus Hypothesentests hervorgegangen sind, Ideen, die die meisten von uns verpasst hätten, wenn diese Etappe nicht gewesen wäre!!

t-test-4953551

Eine der beliebtesten Methoden zum Testen einer Hypothese ist ein Konzept namens t-Test.. Es gibt verschiedene Arten von t-Tests, wie wir gleich sehen werden, und jeder hat seine eigene einzigartige Anwendung. Wenn Sie ein angehender Datenwissenschaftler sind, Sie müssen wissen, was ein T-Test ist und wann Sie ihn nutzen können.

Dann, In diesem Artikel, Wir lernen die verschiedenen Nuancen eines t-Tests kennen und schauen uns dann die drei verschiedenen Arten von t-Tests an.. Zuckerglasur auf dem Kuchen? Wir werden jede Art von t-Test in R implementieren, um zu visualisieren, wie sie in praktischen Szenarien funktionieren. Lass uns gehen!

Notiz: Sie sollten den folgenden Artikel lesen, wenn Sie die Konzepte zum Testen von Hypothesen auffrischen müssen:

Inhaltsverzeichnis

  1. Wann sollten wir einen t-Test durchführen?
  2. Annahmen für die Durchführung eines t-Tests
  3. Arten von t-Tests (mit in R . ausgearbeiteten Beispielen)
    • T-Test für eine Probe
    • Unabhängiger t-Test für zwei Stichproben
    • Gepaarte Stichproben t-Test

Wann sollten wir einen t-Test durchführen?

Lassen Sie uns zuerst verstehen, wo ein t-Test verwendet werden kann, bevor wir uns mit seinen verschiedenen Typen und Implementierungen befassen.. Ich bin fest davon überzeugt, dass der beste Weg, ein Konzept zu lernen, darin besteht, es durch ein Beispiel zu visualisieren. Nehmen wir also ein einfaches Beispiel, um zu sehen, wo ein t-Test nützlich ist.

Betrachten Sie ein Telekommunikationsunternehmen mit zwei Servicezentren in der Stadt. Das Unternehmen möchte wissen, ob die durchschnittliche Zeit, die für die Bedienung eines Kunden benötigt wird, in beiden Geschäften gleich ist.

nar-retail-store-4-4051053

Quelle: Werkstatt

Das Unternehmen misst die durchschnittliche Zeit, die es braucht 50 zufällige Kunden in jedem Geschäft. Speicher A nimmt 22 Protokoll, während Store B durchschnittlich 25 Protokoll. Können wir sagen, dass Store A in Bezug auf den Kundenservice effizienter ist als Store B??

Es sieht so aus, Nein? Aber trotzdem, wir haben nur analysiert 50 zufällige Kunden der vielen Leute, die die Geschäfte besuchen. Allein der Blick auf die durchschnittliche Probenahmezeit ist möglicherweise nicht repräsentativ für alle Kunden, die beide Geschäfte besuchen.

Hier kommt der t-Test ins Spiel.. Es hilft uns zu verstehen, ob der Unterschied zwischen zwei Stichprobenmitteln wirklich real ist oder einfach auf Zufall beruht.

Annahmen für die Durchführung eines t-Tests

Es gibt bestimmte Annahmen, die wir berücksichtigen müssen, bevor wir einen t-Test durchführen:

  1. Die Daten müssen einer kontinuierlichen oder ordinalen Skala folgen (IQ-Testergebnisse der Schüler, zum Beispiel)
  2. Beobachtungen in den Daten sollten zufällig ausgewählt werden
  3. Die Daten sollten beim Plotten wie eine glockenförmige Kurve aussehen, nämlich, sollte normalverteilt sein. Sie können diesen Artikel lesen, um die Normalverteilung besser zu verstehen
  4. Es muss eine große Stichprobengröße gewählt werden, um die Daten einer Normalverteilung anzunähern (einobwohl der t-Test für kleine Stichproben unerlässlich ist, da seine Verteilungen nicht normal sind)
  5. Abweichungen zwischen den Gruppen müssen gleich sein (Foder unabhängiger t-Test bei zwei Stichproben)

Dann, Welche verschiedenen Arten von t-Tests gibt es?? Wann sollten wir jeden Typ ausführen?? Wir werden diese Fragen im nächsten Abschnitt beantworten und sehen, wie wir jede Art von t-Test in R . durchführen können.

Arten von t-Tests (mit in R . ausgearbeiteten Beispielen)

Es gibt drei Arten von t-Tests, die wir basierend auf den verfügbaren Daten durchführen können:

  • Einstichproben-t-Test
  • Unabhängiger t-Test bei zwei Stichproben
  • Gepaarte Stichproben t-Test

In diesem Abschnitt, Wir werden jeden dieser Typen im Detail sehen. Ich habe auch den R-Code für jede Art von t-Test bereitgestellt, damit Sie sie verfolgen können, während wir sie implementieren. Es ist eine großartige Möglichkeit, zu lernen und zu sehen, wie nützlich diese T-Tests sind!!

T-Test für eine Probe

In einem Einstichproben-t-Test, Wir vergleichen den Durchschnitt (oder Durchschnitt) einer Gruppe mit dem Durchschnitt (oder Durchschnitt) niedergelassen. Dieser festgelegte Durchschnitt kann ein beliebiger theoretischer Wert sein (oder es kann der Bevölkerungsdurchschnitt sein).

Burger-2235141

Betrachten Sie das folgende Beispiel: Ein Forscher möchte herausfinden, ob die durchschnittliche Zeit zum Essen eines Hamburgers (Standardgröße) weicht von einem eingestellten Wert ab. Nehmen wir an, dieser Wert ist 10 Protokoll. Wie kann der Forscher das Ihrer Meinung nach feststellen??

Er / sie kann die folgenden Schritte ausführlich befolgen:

  • Wählen Sie eine Personengruppe aus
  • Erfassen Sie die individuelle Einnahmezeit eines Hamburgers in Standardgröße.
  • Berechnen Sie die durchschnittliche Essenszeit der Gruppe.
  • Schließlich, vergleiche diesen Durchschnittswert mit dem eingestellten Wert von 10

In einer Nussschale, So können wir einen t-Test einer Probe durchführen. Hier ist die Formel, um dies zu berechnen:

26-8457424

wo,

  • t = t-Statistik
  • m = Gruppenmittelwert
  • µ = theoretischer Wert oder Bevölkerungsdurchschnitt
  • s = Standardabweichung der Gruppe
  • n = Gruppengröße oder Stichprobengröße

Notiz: Wie oben in den Annahmen erwähnt, dass eine große Stichprobengröße genommen werden muss, damit sich die Daten einer Normalverteilung annähern. (Obwohl der t-Test für kleine Stichproben unerlässlich ist, da seine Verteilungen nicht normal sind).

Nachdem wir den Wert der Statistik t . berechnet haben, die nächste Aufgabe besteht darin, ihn mit dem kritischen Wert des t-Tests zu vergleichen. Wir finden dies in der folgenden Tabelle des Tests t gegen den Freiheitsgrad (n-1) und das Signifikanzniveau:

t-tisch-2928962

Diese Methode hilft uns zu überprüfen, ob die Differenz zwischen den Mittelwerten statistisch signifikant ist oder nicht.. Lassen Sie uns unser Verständnis eines t-Tests bei einer Stichprobe weiter festigen, indem wir ihn auf R . durchführen.

Implementierung des Einstichproben-t-Tests in R

Ein Hersteller von Mobiltelefonen hat eine Stichprobe von Mobiltelefonen desselben Modells aus den Daten des Vormonats gezogen. Sie wollen überprüfen, ob die mittlere Bildschirmgröße der Stichprobe von der gewünschten Länge von . abweicht 10 cm. Sie können die Daten herunterladen hier.

Paso 1: Zuerst, Importieren Sie die Daten.

Paso 2: Bestätigen Sie, dass es in R . korrekt ist:

Produktion:

#Anzahl der Zeilen und Spalten
[1] 1000    1
> #Ansicht nach oben 10 Zeilen des Datensatzes
   Bildschirmgröße.in.cm.
1           10.006692
2           10.081624
3           10.072873
4            9.954496
5            9.994093
6            9.952208
7            9.947936
8            9.988184
9            9.993365
10          10.016660

Paso 3: Denken Sie an die Annahmen, die wir zuvor besprochen haben? Wir müssen sie überprüfen:

Wir erhalten den folgenden Graphen QQ:

rplot5-1465299

Fast alle Werte liegen auf der roten Linie. Wir können mit Sicherheit sagen, dass die Daten einer Normalverteilung folgen.

Paso 4: Führen Sie einen Einstichproben-t-Test durch:

Produktion:

	Ein Stichproben-t-Test

Daten:  data$Screen_size.in.cm.
t = -0.39548, df = 999, p-Wert = 0.6926
alternative Hypothese: wahrer Mittelwert ist nicht gleich 10
95 Prozent Konfidenzintervall:
  9.996361 10.002418
Beispielschätzungen:
Mittelwert von x 
  9.99939

Die t-Statistik ist -0,39548. Beachten Sie, dass wir hier negative Werte als ihr positives Gegenstück behandeln können. Jetzt, den kritischen t-Wert finden Sie in der oben genannten Tabelle. Der Freiheitsgrad ist hier 999 und das Konfidenzintervall ist 95%.

Der t-kritische Wert ist 1,962. Da die t-Statistik kleiner ist als der kritische t-Wert, Wir lehnen die Nullhypothese und wir können daraus schließen, dass sich die durchschnittliche Bildschirmgröße der Stichprobe nicht von der 10 cm.

Wir können dies auch anhand des p-Wertes verifizieren, was größer ist als 0.05. Deswegen, wir lehnen die Nullhypothese in einem Konfidenzintervall der 95%.

Unabhängiger t-Test bei zwei Stichproben

Der t-Test bei zwei Stichproben wird verwendet, um die Mittelwerte zweier verschiedener Stichproben zu vergleichen.

Nehmen wir an, wir wollen die durchschnittliche Körpergröße männlicher Mitarbeiter mit der durchschnittlichen Körpergröße von Frauen vergleichen. Natürlich, die Anzahl der Männchen und Weibchen sollte für diesen Vergleich gleich sein. Hier wird ein t-Test mit zwei Stichproben verwendet.

Hier ist die Formel zur Berechnung der t-Statistik für einen t-Test mit zwei Stichproben:

27-4547646

wo,

  • MetroEIN y MB sind die Mittelwerte von zwei verschiedenen Stichproben
  • NordenEIN und NB sind die Stichprobengrößen
  • S2 es ist ein schätzer der gemeinsamen Varianz zweier Stichproben, Was:

28-2101211

Hier, der Freiheitsgrad ist nEIN + nB – 2.

Wir werden der gleichen Logik folgen, die wir in einem Einstichproben-t-Test gesehen haben, um zu überprüfen, ob sich der Mittelwert einer Gruppe signifikant von einer anderen unterscheidet.. So ist es, Wir vergleichen die berechnete t-Statistik mit dem kritischen t-Wert.

Nehmen wir ein Beispiel für einen unabhängigen t-Test bei zwei Stichproben und lösen ihn in R.

Implementierung des Zweistichproben-t-Tests in R

Für diesen Abschnitt, Wir werden mit Daten von zwei Beispielen der verschiedenen Modelle eines Mobiltelefons arbeiten. Wir möchten überprüfen, ob die durchschnittliche Bildschirmgröße der Stichprobe 1 weicht von der durchschnittlichen Bildschirmgröße der Probe ab 2. Sie können die Daten herunterladen hier.

Paso 1: Nochmal, zuerst die Daten importieren.

Paso 2: Bestätigen Sie, dass es in R . korrekt ist:

Paso 3: Wir müssen die Annahmen wie oben überprüfen. Ich werde diese Übung jetzt in deinen Händen lassen.

Was ist mehr, in diesem Fall, Wir prüfen die Homogenität der Varianz:

Produktion:

 #Homogenität der Varianz
> wo(data$screensize_sample1)
[1] 0.00238283
> wo(data$screensize_sample2)
[1] 0.002353585

Genial, die Variationen sind gleich. Wir können weitermachen.

Paso 4: Führen Sie den t-Test mit zwei unabhängigen Stichproben durch:

Notiz: Schreiben Sie den obigen Code mit "var.equal = F" um, wenn Sie ungerade oder unbekannte Variationen erhalten. Dies wird ein Fall sein Welchs t-Test die verwendet wird, um die Mittelwerte zweier Stichproben mit ungleichen Varianzen zu vergleichen.

Produktion:

t-Test mit zwei Stichproben

Daten: data$screensize_sample1 und data$screensize_sample2
t = 1.3072, df = 1998, p-Wert = 0.1913
alternative Hypothese: wahre Differenz der Mittelwerte ist nicht gleich 0
95 Prozent Konfidenzintervall:
-0.001423145 0.007113085
Beispielschätzungen:
Mittelwert von x Mittelwert von y 
10.000976 9.998131

Was können Sie aus dem obigen Ergebnis schließen?? Wir können bestätigen, dass die t-Statistik wieder kleiner ist als der kritische Wert t, also lehnen wir die Nullhypothese nicht ab. Deswegen, Wir können daraus schließen, dass es keinen Unterschied zwischen der durchschnittlichen Bildschirmgröße beider Stichproben gibt.

Wir können dies noch einmal mit dem p-Wert verifizieren. Stellt sich als größer heraus als 0.05, Daher, wir lehnen die Nullhypothese in einem Konfidenzintervall der 95%. Es gibt keinen Unterschied zwischen dem Mittelwert der beiden Stichproben.

Gepaarte Stichproben t-Test

Der t-Test mit gepaarten Stichproben ist ziemlich faszinierend. Hier, Wir messen eine Gruppe zu zwei verschiedenen Zeiten. Wir vergleichen separate Mittelwerte für eine Gruppe zu zwei verschiedenen Zeiten oder unter zwei verschiedenen Bedingungen. Verwirrt? Lassen Sie mich erklären.

Ein gewisser Manager bemerkte, dass das Produktivitätsniveau seiner Mitarbeiter deutlich nach unten tendierte. Dieser Manager beschloss, ein Schulungsprogramm für alle seine Mitarbeiter durchzuführen, um deren Produktivität zu steigern.Produktivität-4046785

Wie wird der Manager messen, ob das Produktivitätsniveau gestiegen ist?? Es ist einfach: Vergleichen Sie einfach das Produktivitätsniveau der Mitarbeiter vor und nach dem Schulungsprogramm.

Hier, Wir vergleichen die gleiche Probe (die Angestellten) zu zwei verschiedenen Zeiten (vor und nach dem Training). Dies ist ein Beispiel für einen gepaarten t-Test. Die Formel zur Berechnung der t-Statistik für einen gepaarten t-Test lautet:

29-9508578

wo,

  • t = t-Statistik
  • m = Gruppenmittelwert
  • µ = theoretischer Wert oder Bevölkerungsdurchschnitt
  • s = Standardabweichung der Gruppe
  • n = Gruppengröße oder Stichprobengröße

Wir können den Freiheitsgrad in diesem Test als n . nehmen – 1 da nur eine Gruppe beteiligt ist. Jetzt, lösen wir ein Beispiel in R.

Implementierung des gepaarten t-Tests in R

Der Manager eines Reifenherstellers möchte das Gummimaterial zweier Reifenpartien vergleichen. Eine Möglichkeit, dies zu tun: Überprüfen Sie die Differenz zwischen den durchschnittlichen Kilometern, die von einer Reifencharge gefahren wurden, bis sie abgenutzt sind.

Sie können die Daten herunterladen von hier. ich habe es bekommen!

Paso 1: Zuerst, Importieren Sie die Daten.

Paso 2: Bestätigen Sie, dass es in R . korrekt ist:

Paso 3: Jetzt überprüfen wir die Annahmen genau wie bei einem Einstichproben-t-Test. Nochmal, das überlasse ich dir.

Paso 4: Führen Sie den gepaarten t-Test durch:

Produktion:

Gepaarter t-Test

Daten: data$tyre_1 und data$tyre_2
t = -5.2662, df = 24, p-Wert = 2.121e-05
alternative Hypothese: wahre Differenz der Mittelwerte ist nicht gleich 0
95 Prozent Konfidenzintervall:
-2201.6929 -961.8515
Beispielschätzungen:
Mittelwert der Unterschiede 
-1581.772

Sie müssen jetzt ein Experte sein, der diese Ausgabe entschlüsselt!! Der p-Wert ist kleiner als 0.05. Wir können die Nullhypothese mit einem Konfidenzintervall von . verwerfen 95% und schlussfolgern, dass es einen signifikanten Unterschied zwischen den Reifendurchschnitten vor und nach dem Austausch des Gummimaterials gibt.

Der negative Mittelwert der Differenz zeigt, dass die durchschnittlich gefahrenen Kilometer des Reifens 2 sind mehr als die durchschnittlichen Kilometer, die der Reifen zurückgelegt hat 1.

Abschließende Anmerkungen

In diesem Artikel, wir haben das Konzept des t-Tests kennengelernt, seine Annahmen und auch die drei verschiedenen Arten von t-Tests mit ihren Implementierungen in R. Der t-Test hat sowohl statistische Signifikanz als auch praktische Anwendungen in der realen Welt.. .

Wenn Sie neu in der Statistik sind, du deine Grundlagen abdecken und auch in Data Science durchstarten willst, Ich empfehle dir, die zu nehmen Einführungskurs in die Datenwissenschaft. Bietet Ihnen einen vollständigen Überblick über deskriptive und inferenzielle Statistiken, bevor Sie in Data Science-Techniken eintauchen.

Fanden Sie diesen Artikel nützlich?? Können Sie sich andere Anwendungen des t-Tests vorstellen?? Lass es mich im Kommentarbereich unten wissen und wir können weitere Ideen haben!!

Abonniere unseren Newsletter

Wir senden Ihnen keine SPAM-Mail. Wir hassen es genauso wie du.

Datenlautsprecher