PHB WS18/19
-
- 1 / 52
-
Flashcards
Wie lassen sich die Regressionsgewichte bei einer moderierten Regression interpretieren?
a) Gewichte einfacher Regression, bei denen alle anderen UVs = 0 sind
--> meistens keine sinnvolle Interpretation möglich, deswegen werden Variablen zentriert, dann:
b) Gewichte einfacher Regression bei durchschnittlicher Ausprägung aller anderen UVs
Zentriert man die Variablen bei einer moderierten Regression, ...
a) ...verändert sich der Achsenabschnitt, sowie b1 und b2 (UV) Regressionsgewichte und deren Standardfehler
b) ...bleibt gleich:
1. b3 Regressionsgewicht der Produktvariablen, sowie sein Standardfehler
2. bedingte Regressionsgeraden
3. Korrelation zwischen UVs X1 und X2
c) ...wird geringer:
1. Standardfehler von b1 und b2, da Schätzung in Mitte der Verteilung präziser
2. Korrelation der Produktvariablen mit den UVs
Welche beiden äquivalenten Strategien zur Prüfung eines Moderatoreffektes gibt es?
1. Prüfung des Regressionsgewichts b3 der Produktvariablen anhand t-verteilter Prüfgröße
--> H0 = Es gibt keinen Moderatoreffekt (b3 = 0)
2. Determinationskoeffizient R² im Modellvergleich anhand F-verteilter Prüfgröße
--> eingeschränktes Modell (ohne Produktvariable) vs uneingeschränktes Modell (mit Produktvariable)
Wann wird die polynomische Regression verwendet?
Wenn ein nicht-linearer Zusammenhang zwischen X1 und Y besteht.
--> kann quadratisch (u-förmig) oder kubisch sein
---> z.B. Zusammenhang zwischen Zufriedenheit mit dem Seminar und wahrgenommener Anforderung
Welche Voraussetzungen für die Durchführung einer Regressionsanalyse müssen erfüllt sein?
1. Korrekte Spezifikation des Modells
2. Messfehlerfreiheit der UVs
3. Homoskedastizität
4. Unabhängigkeit der Residuen
5. Normalverteilung der Residuen
Ein problematische Datensituation äußert sich durch...
1. Ausreißer und einflussreiche Datenpunkte
2. Multikollinearität
3. fehlende Werte
Wie kann geprüft werden, ob ein Modell korrekt spezifiziert ist?
- es darf keine relevanten Variablen auslassen ("underfitting")
- es darf keine irrelevanten Variablen aufnehmen ("overfitting")
--> Konsequenz wäre eine falsche Spezifikation
Welche Konsequenzen einer falschen Spezifikation ergeben sich?
1. verzerrte Schätzung der Regressionsgewichte
2. erhöhter Prognosefehler (PRESS Summe der quadrierten Abweichungen zwischen vorhergesagtem und beobachteten Wert)
3. verringerte Teststärke
4. falsche Schlussfolgerungen
Welche Konsequenzen können sich durch Messfehler in den UVs ergeben und wie können diese berücksichtigt werden?
Konsequenzen:
- Unterschätzung der wahren Regressionsgewichte (in einfacher Regression)
- verzerrte Schätzung der Regressionsgewichte (in multipler Regression)
Aufdeckung:
- Bestimmung der Reliabilitäten der UVs
Umgang:
Verwendung von Modellen mit latenten Variablen
Was versteht man unter Heteroskedastizität und wie erkennt man sie?
= Gegenteil von Homoskedastizität = Varianz der Residuen in der Population hängt nicht von den Ausprägungen der UVs ab
Konsequenzen:
1. Schätzungen der Parameter weiterhin erwartungstreu
2. aber Standardfehler verzerrt
Bestimmung:
- Residuenplots (metrische UVs) oder Levene-test (kategoriale UVs, darf nicht signifikant werden, sonst Heteroskedastizität)
- Breusch-Pagan-Test
--> Nullhypothese = Homo- / Alternativhypothese = Heteroskedastizität
----> darf also nicht signifikant werden!
Wie wird mit Heteroskedastizität umgegangen?
Bei sehr großen Stichproben und gravierender Verletzung:
Rückgriff auf das Gewichtete-Kleinste-Quadrate-Schätzverfahren (weightet least square, WLS)
-> jeder quadrierte Abweichungswert wird mit einem individuellen Wert w_m gewichtet und die Summe der gewichteten quadrierten Abweichungen minimiert
--> das Gewicht w_m entspricht 1 geteilt durch die Residualvarianz, die für die jeweilige Konstellation von Werten auf den UVs geschätzt wird (ziemlich aufwendig)
Wo ist das Risiko einer Verletzung der Unabhängigkeit der Residuen besonders groß?
In Klumpenstichproben oder mehrstufigen Auswahlverfahren und
in Einzelfalluntersuchen, wo seriale Abhängigkeit vorliegt
Unabhängigkeit der Residuen bei Klumpenstichproben oder mehrstufigen Auswahlverfahren
Konsequenzen bei Verletzung:
1. Schätzung der Parameter weiterhin erwartungstreu
2. Standardfehler unterschätzt (sodass Effekte fälschlicherweise signifikant werden)
--> optimalerweise HLM verwenden!
--> bei wenigen Klumpen kann Zugehörigkeit auch anhand von Kodiervariablen kodiert und als UV aufgenommen werden
Unabhängigkeit der Residuen bei Einzelfalluntersuchungen / serialer Abhängigkeit
Autokorrelation = Korrelation eines Merkmals mit seiner zeitversetzt wiederholten Messung
Konsequenzen:
1. Regressionsgewichte werden unverzerrt geschätzt
2. Standardfehler nicht korrekt
--> optimalerweise zeitreihenanalytische Verfahren verwenden
Wie kann die Normalverteilung von Residuen geprüft werden?
Entweder Shapiro-Wilk-Test oder heuristische Verfahren, wie:
1. Histogramm der studentisierten Residuen
--> x-Achse: studentisiertes Residuum, y-Achse: Häufigkeit
2. Probability-Probability-Plot
--> x-Achse: geschätzte kumulierte Wahrscheinlichkeiten der studentisierten Residuen
--> y-Achse: gemäß Normalverteilung erwartete kumulierte Wahrscheinlichkeiten der studentisierten Residuen
3. Quantile-Quantile-Plot
--> wie PP-Plot, nur dass statt kumulierten Wahrscheinlichkeiten die Quantile der Verteilung verwendet werden
Wie sollte man mit einer verletzten Normalverteilungsannahme umgehen?
Konsequenzen:
- Regressionsgewichte unverzerrt geschätzt
- bei kleinen Stichproben Standardfehler nicht korrekt
--> wenn Fehlspezifikation des Modells ausgeschlossen, dann:
----> Datentransformation (logarithmische Transformation um Abweichung von Normalverteilung zu verringern)
----> Rückgriff auf andere Regressionsmodelle (Poisson-Regression bei individuellen Häufigkeiten)
Was sind Ausreißer und wie können diese identifiziert werden?
Werte, die...
- sich stark von den restlichen Werten unterscheiden
- sowohl in UVs als auch in AVs auftreten
- Parameterschätzung verzerren können
--> Aufdeckung auf UVs durch Mahalanobis-Distanz und zentrierten Hebelwert
--> Aufdeckung auf AVs durch Betrachtung der Verteilung der Residuen (studentisiertes ausgeschlossenes Residuum sollte bei absolutem Wert > 3 genauer inspiziert werden)
Was sind einflussreiche Datenpunkte und wie können diese identifiziert werden?
...Wertekombinationene einer Person, deren Entfernung aus dem Datensatz die Schätzung der Regressionsparameter stark verändert
Aufdeckung durch:
1. Änderung der Regressionskoeffizienten (DfBETA, DfBETAS-Werte)
2. Änderung der vorhergesagten Werte (DfFIT, DfFITS-Werte)
3. Cooks Distanz (quadrierte DfFITS-Werte)
Wie kann man mit Ausreißern und einflussreichen Datenpunkten umgehen?
1. Ausschluss
- wenn Werte auf Fehler zurückführbar sind (z.B. Eingabefehler, Boykott, Missverständnisse)
- wenn für Person vermutlich andere Prozesse gelten als für Rest der Stichprobe (z.B. Bill Gates bei Einkommen)
2. Einschluss
- wenn Ausreißer selten, aber zulässig und wenig einflussreich ist
3. Klären:
- ob Modell fehlspezifiziert ist
4. Wahl eines robusten Regressionsverfahrens
- reagiert wenig sensitiv auf Ausreißer und einflussreiche Werte
Was versteht man unter Multikollinearität und wie wird sie identifiziert?
= hohe multiple Korrelation einer UV mit anderen UVs
Kosequenzen:
- führt zu großem Standardfehler des Regressionsgewichts
- unpräzise Schätzung
Aufdeckung:
- Toleranzfaktor (TOL) < .10
- Varianzinflationsfaktor (VIF) > 10
Vier Schritte zur Behebung des Multikollinearitätsproblems:
1. Zentrierung von UVs
2. Eliminierung von UVs
3. Aggregation von UVs
4. Faktorenanalytische Regression
Warum klärt die Moderatorvariable immer nur 3-8% Varianz auf?
- die Produktvariablen sind messfehlerbehafteter
-> führt zu Verringerung der Teststärke
---> vorhandene Moderatoreffekte werden manchmal nicht entdeckt