Stat
istik
istik
-
- 1 / 71
-
Cartes-fiches
Warum ist Stastik in GG wichtig?
- Entscheidungshilfe (Quantifizierung der Ungewissheit)
- Beschreiben, Erklären und Vorhersagen
- basierend auf wissenschaftlichen Modellen
--> Statistische Modelle quantifizieren die Ungewissheit und erlauben bessere Rückschlüsse und Vorhersagen
Warum sind Raumdaten besonders?
- Masstatabsabhängigkeit
- Zonierungsabhängigkeit
- NAchbarschaftsabhängigkeit
Eigenschaften von Geodaten
statistisches Analyserezept von A-E
A: Fragestellung, Hypothese
B: Datenerhebung (Stichprobenerhebung, Typen, Elemente, Kriterien, Merkmale)
C: Statistische Analyse (Spezifieren, schätzen, Diagnose)
D: Interpretation
E: Kommunkiation
Komponenten einer statistischen Datenmatrix
- Zufallsvariable
- Merkmalsausrägung (value) --> erhobener Wert: 4000m
- Merkmalsträger (case) --> Berg
- Stichprobe (sample) --> 10 Berge
- Variable --> Höhe
Prinzip der statistischer Analyse
Der Vorgang des Messens (Beobachtung) bedeutet die Zuordnung genau eines Messwertes (Ergebnis Beobachtung), um die Verhältnisse der Merkmalsträger (Gesamtheit Beobachtung) bezüglich des Merkmals (1 Aspekt des Beobachteten) wiederzugeben
Geburtsort (ZH, GR), Geschlecht (m,f)
Temp (C°), Studienbeginn (2012, 2013)
Noten (1-6), Einkommen (hoch, niedrig), Weg zur Uni (kurz, lang)
Temperatur (K), Alter (1,2), Wegzeit zur Uni (34min)
Mass dafür, wie weit einzelne Objekte voneinander entfernt sind (Summe der quadratischen Abweichung der einzelnen Werte vom Mittelwert dividiert durch Anzahl Beobachtungen)
Wurzel aus der Varianz (hat die gleiche MAsseneinheit wie die Daten selbst)
Beschreibt den Maximalabstand zwischen Werten (Differenz zw. grösstem und kleinsten Wert, hängt stark von einzelnen Werten ab)
mittlere 80% einer Verteilung
mittlere 50% einer Verteilung (zwischen 25% und 75% Quartil)
Inferenzstatistik: Punktschätzung
Berechnung von Schätzwerten für die Kennwerte der Grundgesamtheit
Bsp: gegen MEI: In welchem Bereich liegt der Ja-Anteil voraussichtlich in der Grundgesamtheit?
Inferenzstatistik: Intervallschätzung
Kennwert der Grundgesamtheit durch Intervall beschrieben. Innerhalb dieses Intervalls liegt der Kennwert mit einer bestimmten Wahrscheinlichkeit (nahe1)--> Konfidenzintervall ( Je grösser die Stichprobe, desto kleiner das Konfidenzintervall und je kleiner die Variabilität der Grundgesamtheit, desto kleiner das Konfidenzintervall)
Inferenzstatistik: Signifikanztest
Beim Testen ist die Grundgesamtheit (hypothetisch) bekannt. Man fragt, wie wahrscheinlich es ist, dass eine vorliegende Zufallsstichprobe aus dieser Grundgesamtheit stammt
Bsp: MEI: Stimmt der JA und NEIN Anteil in der Befragung mit der Grundgesamtheit überein?
Statistische Hypotheses, deren Gültigkeit mit statistischen Tests geprüft wird
Ablauf Signifikanztest (1-5)
1. Formulierung Arbeitshypothese
2. Auswahr der statistischen Prüfgrössen
3. Formulierung der Null- und Alternativhypothese
4. Irrtumswahrscheinlichkeit (5%)
5. Berechnung und Entscheid, ob Ho angenommen wird
Zurückweisen der Nullhypothese, obwohl sie wahr ist
Annahme der Nullhypothese, obwohl die Alternativhypothese korrekt ist
Einseitige und zweiseitige Hypothese:
Einseitig: Ho enthält eine Richtung
Zweiseitig: sowohl Abweichunge nach unten als auch nach oben werden toleriert
Was prüfen Anpassungstests?
Prüfen, ob die (eigentliche) unbekannte Wahrscheinlichkeitsverteilung einer Zufallsvariable einem bestimmtem Verteilungsmodell folgt.
Die Anpassungsgüte beschreibt, wie gut ein statistisches Modell eine Menge Beobachtungen trifft. Es beschreibt die Diskrepanz zwischen Beobachtungen und erwarteten Werte.
Test auf Übereinstimmung von Verteilungen (minestens nominal, grosse Stichprobe, unabhängige Stichprobenvariablen)
Test auf Normalverteilung
Testet, ob Verteilung einer Stichprobenvariable mit einer theoretisch angenommenen Verteilung übereinstimmen
Testet, ob ein prozentualer Häufigkeitsanteil für eine binäre Varible in der Stichprobe mit der Grundgesamtheit vereinbar sind. Bsp: H0 Der Anteil männlicher Studierenden beträgt 49%
Test auf Zufälligkeit
Beobachtungwerte werden in der Reihenfolge ihres Auftretens aufgeschrieben.
one sample t-Test (independet t-test)
- kleine Stichproben folgen nicht einer Normalverteilung, sondern einer Normalverteilung
- basierend auf den Mittelwerten der Stichproben und dem Standardfehler
- abhängig von der Grösse der Stichprobe
- metrisch skalliert, zufällig ausgewählt, unabhängig
--> gerichtete Hypotheses (einseitiger Test) --> Versuchen H0 zu verwerfen
two sample t-Test
- unabhängige Stichproben
- Ho: die SNP-Mittelwerte sind aus der gleichen Population
--> ungerichtete Hypothese
- Wenn t-Wert aus der Tabelle grösser ist als berechneter t-Wert, dann Ho verwerfen
- t-Test zeugt keinen signifikanten Unterschied, Ho annehmen
Dependent t-Test
- Variablen haben Werte, die aus mehrere MEssungen stammen (Bsp. Messstation)
- Ziel: Vergleicht Mittelwerte von kleinen, abhängigen Stichproben mit my von Modell
- Ho: Mittelwerte der Messpaardifferenzen unterscheiden sich nicht
Varianzanalyse
Fragen, die ANOVA beantworten kann_
- gibt es Gruppenunterschiede in der Stichprobe?
- welchen Anteil haben die Gruppen zur Gesamtvarianz der Beobachtungen in der Stichprobe?
One Way Anova
Vergleich der Mittelwerte von unabhängigen Gruppen in einer Stichprobe mit my vom Modell
- Ho: Die Gruppen-Mittelwerte unterscheiden sich nicht (d.h. es gibt keine Gruppen in der Population)
- ungerichtet, zweiseitig
- \(F = {Streuung^2 zwischen den Gruppen \over Streuung^2 innerhalb der Gruppen}\)
Non parametic ANOVA Test
wenn die Daten nicht normalverteilt sind und mindestens intervallskalliert sind.
Chi-Quadrat-Unabhängigkeitstest
Kovarianz
- beschreibt den Zusammenhang zwischen 2 Variablen
- positiv: X und Y besitzen einen gleichläufigen, linearen Zusammenhang
- negativ: A und B besitzen einen gegenläufigen, linearen Zusammenhang
- nahe 0: kein linearer Zusammenhang