PHB WS18/19


D. J.
Diese Lernkarten vermitteln Grundlagen und fortgeschrittene Konzepte der multiplen Regression im universitären Kontext. Sie behandeln zentrale Begriffe wie Regressionsgewichte, Varianzaufklärung und Korrelation, gehen auf praktische Herausforderungen wie Multikollinearität, Ausreißer und Heteroskedastizität ein und erklären Prüfverfahren sowie Lösungsstrategien. Studierende und Forschende profitieren von diesem Überblick, um statistische Analysen korrekt durchzuführen und Ergebnisse valide zu interpretieren.
Cartes-fiches
52
Utilisateurs
15
Langue
Allemand
Catégorie
Psychologie
Niveau
Université
Créé / Mis à jour
19.01.2019 / 14.07.2026

Cartes-fiches

Wie lassen sich die Regressionsgewichte bei einer moderierten Regression interpretieren?

a) Gewichte einfacher Regression, bei denen alle anderen UVs = 0 sind

--> meistens keine sinnvolle Interpretation möglich, deswegen werden Variablen zentriert, dann:

b) Gewichte einfacher Regression bei durchschnittlicher Ausprägung aller anderen UVs

Zentriert man die Variablen bei einer moderierten Regression, ...

a) ...verändert sich der Achsenabschnitt, sowie b1 und b2 (UV) Regressionsgewichte und deren Standardfehler

 

b) ...bleibt gleich:

1. b3 Regressionsgewicht der Produktvariablen, sowie sein Standardfehler

2. bedingte Regressionsgeraden

3. Korrelation zwischen UVs X1 und X2

 

c) ...wird geringer:

1. Standardfehler von b1 und b2, da Schätzung in Mitte der Verteilung präziser

2. Korrelation der Produktvariablen mit den UVs

Welche beiden äquivalenten Strategien zur Prüfung eines Moderatoreffektes gibt es?

1. Prüfung des Regressionsgewichts b3 der Produktvariablen anhand t-verteilter Prüfgröße

--> H0 = Es gibt keinen Moderatoreffekt (b3 = 0)

2. Determinationskoeffizient R² im Modellvergleich anhand F-verteilter Prüfgröße

--> eingeschränktes Modell (ohne Produktvariable) vs uneingeschränktes Modell (mit Produktvariable)

Wann wird die polynomische Regression verwendet?

Wenn ein nicht-linearer Zusammenhang zwischen X1 und Y besteht.

--> kann quadratisch (u-förmig) oder kubisch sein

---> z.B. Zusammenhang zwischen Zufriedenheit mit dem Seminar und wahrgenommener Anforderung

Wie sieht die Gleichung der polynomischen Regression aus?

Welche Voraussetzungen für die Durchführung einer Regressionsanalyse müssen erfüllt sein?

1. Korrekte Spezifikation des Modells

2. Messfehlerfreiheit der UVs

3. Homoskedastizität

4. Unabhängigkeit der Residuen

5. Normalverteilung der Residuen

Ein problematische Datensituation äußert sich durch...

1. Ausreißer und einflussreiche Datenpunkte

2. Multikollinearität

3. fehlende Werte

Wie kann geprüft werden, ob ein Modell korrekt spezifiziert ist?

- es darf keine relevanten Variablen auslassen ("underfitting")

- es darf keine irrelevanten Variablen aufnehmen ("overfitting")

--> Konsequenz wäre eine falsche Spezifikation

Welche Konsequenzen einer falschen Spezifikation ergeben sich?

1. verzerrte Schätzung der Regressionsgewichte

2. erhöhter Prognosefehler (PRESS Summe der quadrierten Abweichungen zwischen vorhergesagtem und beobachteten Wert)

3. verringerte Teststärke

4. falsche Schlussfolgerungen

Wozu dient das LOWESS-Anpassungsverfahren?

- Glättungsverfahren zur Aufdeckung von underfitting

--> für jeden Wert xm werden z.B. 20% anderer Werte drumherum betrachtet und eine mini-Regressionsgerade hindurchgelegt

--> es entsteht im besten Fall ein der erwarteten Kurve entsprechendes Bild

Welche Konsequenzen können sich durch Messfehler in den UVs ergeben und wie können diese berücksichtigt werden?

Konsequenzen:

- Unterschätzung der wahren Regressionsgewichte (in einfacher Regression)

- verzerrte Schätzung der Regressionsgewichte (in multipler Regression)

 

Aufdeckung:

- Bestimmung der Reliabilitäten der UVs

 

Umgang:

Verwendung von Modellen mit latenten Variablen

Was versteht man unter Heteroskedastizität und wie erkennt man sie?

= Gegenteil von Homoskedastizität = Varianz der Residuen in der Population hängt nicht von den Ausprägungen der UVs ab

Konsequenzen:

1. Schätzungen der Parameter weiterhin erwartungstreu

2. aber Standardfehler verzerrt

Bestimmung:

- Residuenplots (metrische UVs) oder Levene-test (kategoriale UVs, darf nicht signifikant werden, sonst Heteroskedastizität)

- Breusch-Pagan-Test

--> Nullhypothese = Homo- / Alternativhypothese = Heteroskedastizität

----> darf also nicht signifikant werden!

 

Wie wird mit Heteroskedastizität umgegangen?

Bei sehr großen Stichproben und gravierender Verletzung:

Rückgriff auf das Gewichtete-Kleinste-Quadrate-Schätzverfahren (weightet least square, WLS)

-> jeder quadrierte Abweichungswert wird mit einem individuellen Wert w_m gewichtet und die Summe der gewichteten quadrierten Abweichungen minimiert

--> das Gewicht w_m entspricht 1 geteilt durch die Residualvarianz, die für die jeweilige Konstellation von Werten auf den UVs geschätzt wird (ziemlich aufwendig)

Wo ist das Risiko einer Verletzung der Unabhängigkeit der Residuen besonders groß?

In Klumpenstichproben oder mehrstufigen Auswahlverfahren und

in Einzelfalluntersuchen, wo seriale Abhängigkeit vorliegt

Unabhängigkeit der Residuen bei Klumpenstichproben oder mehrstufigen Auswahlverfahren

Konsequenzen bei Verletzung:

1. Schätzung der Parameter weiterhin erwartungstreu

2. Standardfehler unterschätzt (sodass Effekte fälschlicherweise signifikant werden)

--> optimalerweise HLM verwenden!

--> bei wenigen Klumpen kann Zugehörigkeit auch anhand von Kodiervariablen kodiert und als UV aufgenommen werden

Unabhängigkeit der Residuen bei Einzelfalluntersuchungen / serialer Abhängigkeit

Autokorrelation = Korrelation eines Merkmals mit seiner zeitversetzt wiederholten Messung

Konsequenzen:

1. Regressionsgewichte werden unverzerrt geschätzt

2. Standardfehler nicht korrekt

--> optimalerweise zeitreihenanalytische Verfahren verwenden

Wie kann die Normalverteilung von Residuen geprüft werden?

Entweder Shapiro-Wilk-Test oder heuristische Verfahren, wie:

1. Histogramm der studentisierten Residuen

--> x-Achse: studentisiertes Residuum, y-Achse: Häufigkeit

2. Probability-Probability-Plot

--> x-Achse: geschätzte kumulierte Wahrscheinlichkeiten der studentisierten Residuen

--> y-Achse: gemäß Normalverteilung erwartete kumulierte Wahrscheinlichkeiten der studentisierten Residuen

3. Quantile-Quantile-Plot

--> wie PP-Plot, nur dass statt kumulierten Wahrscheinlichkeiten die Quantile der Verteilung verwendet werden

Wie sollte man mit einer verletzten Normalverteilungsannahme umgehen?

Konsequenzen:

- Regressionsgewichte unverzerrt geschätzt

- bei kleinen Stichproben Standardfehler nicht korrekt

 

--> wenn Fehlspezifikation des Modells ausgeschlossen, dann:

----> Datentransformation (logarithmische Transformation um Abweichung von Normalverteilung zu verringern)

----> Rückgriff auf andere Regressionsmodelle (Poisson-Regression bei individuellen Häufigkeiten)

Was sind Ausreißer und wie können diese identifiziert werden?

Werte, die...

- sich stark von den restlichen Werten unterscheiden

- sowohl in UVs als auch in AVs auftreten

- Parameterschätzung verzerren können

--> Aufdeckung auf UVs durch Mahalanobis-Distanz und zentrierten Hebelwert

--> Aufdeckung auf AVs durch Betrachtung der Verteilung der Residuen (studentisiertes ausgeschlossenes Residuum sollte bei absolutem Wert > 3 genauer inspiziert werden)

Was sind einflussreiche Datenpunkte und wie können diese identifiziert werden?

...Wertekombinationene einer Person, deren Entfernung aus dem Datensatz die Schätzung der Regressionsparameter stark verändert

Aufdeckung durch:

1. Änderung der Regressionskoeffizienten (DfBETA, DfBETAS-Werte)

2. Änderung der vorhergesagten Werte (DfFIT, DfFITS-Werte)

3. Cooks Distanz (quadrierte DfFITS-Werte)

Wie kann man mit Ausreißern und einflussreichen Datenpunkten umgehen?

1. Ausschluss

- wenn Werte auf Fehler zurückführbar sind (z.B. Eingabefehler, Boykott, Missverständnisse)

- wenn für Person vermutlich andere Prozesse gelten als für Rest der Stichprobe (z.B. Bill Gates bei Einkommen)

2. Einschluss

- wenn Ausreißer selten, aber zulässig und wenig einflussreich ist

3. Klären:

- ob Modell fehlspezifiziert ist

4. Wahl eines robusten Regressionsverfahrens

- reagiert wenig sensitiv auf Ausreißer und einflussreiche Werte

Was versteht man unter Multikollinearität und wie wird sie identifiziert?

= hohe multiple Korrelation einer UV mit anderen UVs

Kosequenzen: 

- führt zu großem Standardfehler des Regressionsgewichts

- unpräzise Schätzung

Aufdeckung:

- Toleranzfaktor (TOL) < .10

- Varianzinflationsfaktor (VIF) > 10

Vier Schritte zur Behebung des Multikollinearitätsproblems:

1. Zentrierung von UVs

2. Eliminierung von UVs

3. Aggregation von UVs

4. Faktorenanalytische Regression

Warum klärt die Moderatorvariable immer nur 3-8% Varianz auf?

- die Produktvariablen sind messfehlerbehafteter

-> führt zu Verringerung der Teststärke

---> vorhandene Moderatoreffekte werden manchmal nicht entdeckt

Tabelle bei Dummycodierung

Referenzkategorie wird auf Null gesetzt

Tabelle bei ungewichteter Effektkodierung

Referenzkategorie auf -1

Tabelle bei gewichteter Effektkodierung

Referenzkategorie wird auf berechneten Wert gesetzt

APA-Interpretation in R bei Dummycodierung

Étudier