MR

MR

MR


Alexander Wurm
Ce fichier d'apprentissage aborde les méthodes de diagnostic et d'analyse des résidus dans les modèles de régression, un sujet avancé pour les étudiants en psychologie. Il couvre des concepts clés comme la dummy-kodierung, l'effet-kodierung, les résidus standardisés, et les techniques pour identifier les valeurs aberrantes. Les utilisateurs apprendront à diagnostiquer la normalité des résidus, à évaluer l'influence des variables prédictives, et à appliquer des méthodes comme le LOWESS pour vérifier la linéarité. Ce fichier d'apprentissage est particulièrement utile pour les chercheurs et les étudiants qui doivent analyser des données complexes et interpréter les résultats des modèles de régression.
Cartes-fiches
21
Utilisateurs
1
Langue
Français
Catégorie
Psychologie
Niveau
Université
Créé / Mis à jour
30.05.2020 / 10.02.2021

Cartes-fiches

Wie diagnostiziert man, ob Linearität angenommen werden kann, oder nicht? (LOWESS-Verfahren)?

LOWESS-Verfahren (LOcally WEighted Scatterplot Smoother)

  • Für eine konkrete Merkmalsausprägung xm wählt man einen Teil der Messwerte (z.B. 10% aller Werte) aus, die um diesen Wert herum liegen.
  • Für diese Werte fittet man eine lineare Regression und ordnet dem Wert xm einen vorhergesagten Wert ŷm zu
  • Dies wiederholt man nun für alle anderen Werte.
  • Die resultierende Funktion wird dann geglättet und kann inspiziert werden (z.B. darauf hin, ob sie mehr oder weniger linear ist).

Wie diagnostiziert man Ausreißer auf der Prädiktorseite? Wie heißt die Distanz?

Ausreißer und einflussreiche Datenpunkte:
--> Gemeint sind einzelne Fälle, die die Schätzung der Regressionskoeffizienten stark beeinflussen. Das sind typischerweise Fälle, deren Werte xm weit von ihrem Mittelwert abweichen.

--> Identifiziert werden können sie mit Hilfe der Mahalanobis-Distanz:

--> Auf der Basis dieser Distanz kann jeder Person ein „Hebelwert“ (leverage) zugeordnet werden (--> nur das muss man wissen) Hebelwerte über 3 mal k / n gelten als „auffällig“. bei großen Stichproben kann man auch 2 mal k / n nehmen

Wie diagnostiziert man Ausreißer auf der abhängigen Variablen?

Ausreißer auf der abhängigen Variablen: Ausreißer auf der AV (Kriterium) können identifiziert werden, indem man die Residuen (ym – ŷm) inspiziert:

  • Unstandardisierte Residuen
  • Standardisierte Residuen (standardisiert an der geschätzten Populationsstandardabweichung der Residuen; dem Standardschätzfehler der Regression)
  • Studentisierte Residuen (standardisiert am Standardschätzfehler, aber unter Berücksichtigung des Hebelwertes einer Person)
  • Gelöschtes Residuen (der vorhergesagte Wert für eine Person wird ohne diese Person im Datensatz berechnet)
  • Studentisierte ausgeschlossene Residuen (s.o.; folgt einer t-Verteilung mit df = n – k – 1 Freiheitsgraden; Werte > +/-3 gelten als „auffällig“)

Was ist der Standardschätzfehler?

Standardisierte Residuen (standardisiert an der geschätzten Populationsstandardabweichung der Residuen; dem Standardschätzfehler der Regression)

Was sind studentisierte Residuen?

Studentisierte Residuen (standardisiert am Standardschätzfehler, aber unter Berücksichtigung des Hebelwertes einer Person)

 

sollte man verwenden für Ausreißer auf der Kriteriumsseite

Was sind gelöschte Residuen?

der vorhergesagte Wert für eine Person wird ohne diese Person im Datensatz berechnet

Was sind „DifBeta“ (für unstandardisierte Variablen) bzw. „DifBetaS“ (für standardisierte Variablen)? (bezieht sich auf Prädiktor)

 

steht für difference in beta --> Unterschied im geschätzten Regressionskoeffizienten

Ausmaß, in dem sich die Schätzung der Regressionskoeffizienten durch Ausschluss von einzelnen Fällen verändert: kann für jede Person auf jeder Prädiktorvariablen berechnet werden. Werte mit DifBetaS > +/-2 gelten als auffällig

Was sind „DifFit“ (für unstandardisierte Variablen) bzw. „DifFitS“ (für standardisierte Variablen)? --> Hier betrachtet man den Determinationskoeffizienten

Ausmaß, in dem sich die vorhergesagten Werte durch Ausschluss von einzelnen Fällen verändern

 

kann für jede Person berechnet werden. Werte mit DifFitS > +/- 1 sind auffällig.
Cooks Distanz (approximativ F-verteilt mit df1 = k + 1 und df2 = n − k − 1; kritische Schwelle: 0,50-Quantil)

Wie ist die Cook's Distanz verteilt?

F-verteilt, bezieht sich auf das 50% Quantil

Was sagen

a) DifBeta

b) DifFit

voraus?

a) Ausmaß, in dem sich die Schätzung der Regressionskoeffizienten durch Ausschluss von einzelnen Fällen verändert

 

b) Ausmaß, in dem sich die vorhergesagten Werte durch Ausschluss von einzelnen Fällen verändern

Welche Werte sollten nicht über-/unterschritten werden:

a) für DifBetaS?

b) für DifFitS?

a) DifBetaS > +/- 2

b) DifFitS > +/- 1

Wie funktioniert die Effektkodierung?

Was bildet der Intercept bei der Effektkodierung ab?

Was bildet das Regressionsgewicht von E1/E2 ab ? (Bei drei Gruppen: Experimentalgruppe EG1, EG2 und KG)

Beispiel – polytomer kategorialer Prädiktor
--> Experimentelles Design: EG1, EG2, KG
-->  c = 3; 3 − 1 = 2 Kodiervariablen erforderlich


Prinzip der Effekt-Kodierung:
(1) Wähle eine der c Kategorien des Prädiktors als Basiskategorie aus. Beispiel: KG


(2) Bilde die erste Kodiervariable E1, Personen, die in der „EG1“ sind, erhalten in dieser Variablen eine "1", Mitglieder der "Basiskategorie" eine "-1", alle anderen eine „0“


(3)Bilde die zweite Kodiervariable E2, Personen, die in der „EG2“ sind, erhalten in dieser Variablen eine „1“, Mitglieder der "Basiskat." eine "-1", alle anderen eine „0“.
Hinweis: Eine Kodiervariable für die „Basiskategorie“ wird nicht benötigt, da die Zugehörigkeit zu dieser Kategorie aus einer „-1“ in beiden Kodiervariablen folgt


(4) Die beiden Kodiervariablen werden als Prädiktoren in die multiple Regression aufgenommen


(5) Der Intercept bildet den Gesamtmittelwert ab, das Regressionsgewicht von E1 bildet die Differenz zw. „EG1" und dem Gesamtmittelwert aller Kategorien ab, das Regressionsgewicht von E2 bildet die Differenz zw. „EG2" und dem Gesamtmittelwert aller Kategorien ab.

Wie funktioniert die Dummy-Kodierung?

Was bilden Intercept und die einzelnen Regressionsgewichte ab?

Beispiel – polytomer kategorialer Prädiktor
--> Experimentelles Design: EG1, EG2, KG
-->  c = 3; 3 − 1 = 2 Kodiervariablen erforderlich


Prinzip der Dummy-Kodierung:
(1) Wähle eine der c Kategorien des Prädiktors als Referenzkategorie aus. Beispiel: KG


(2) Bilde die erste Kodiervariable D1, Personen, die in der „EG1“ sind, erhalten in dieser Variablen eine „1“, alle anderen eine „0“


(3) Bilde die zweite Kodiervariable D2, Personen, die in der „EG2“ sind, erhalten in dieser Variablen eine „1“, alle anderen eine "0"


Hinweis: Eine Kodiervariable für die Referenzkategorie wird nicht benötigt, da die Zugehörigkeit zu dieser Kategorie aus einer „0“ in beiden Kodiervariablen folgt


(4) Die beiden Kodiervariablen werden als Prädiktoren in die multiple Regression aufgenommen


(5) Der Intercept bildet den Mittelwert der Referenzkategorie „KG“ ab, das Regressionsgewicht von D1 bildet die Differenz zw. „EG1“ und der Referenzkategorie „KG“ ab, das Regressionsgewicht von D2 bildet die Differenz zw. „EG2“ und der Referenzkategorie „KG“ ab.

Étudier