Stat

istik

istik


V. A.
Diese Lernkarten behandeln statistische Methoden auf Universitätsniveau, mit Fokus auf Clusterverfahren, Regressionen und Hypothesentests. Sie erklären Konzepte wie Mittelwert, Stichproben und Verteilungen, sowie Verfahren zur Analyse von Ähnlichkeiten und Distanzen. Die Karteikarten sind besonders nützlich für Studierende der Geographie, die statistische Analysen durchführen und räumliche Daten interpretieren müssen.
Karten
71
Lernende
1
Sprache
Deutsch
Kategorie
Geographie
Stufe
Universität
Erstellt / Aktualisiert
21.05.2015 / 30.05.2015

Lernkarten

Warum ist Stastik in GG wichtig?

- Entscheidungshilfe (Quantifizierung der Ungewissheit)

- Beschreiben, Erklären und Vorhersagen

- basierend auf wissenschaftlichen Modellen

--> Statistische Modelle quantifizieren die Ungewissheit und erlauben bessere Rückschlüsse und Vorhersagen

Warum sind Raumdaten besonders?

- Masstatabsabhängigkeit

- Zonierungsabhängigkeit

- NAchbarschaftsabhängigkeit

Eigenschaften von Geodaten

statistisches Analyserezept von A-E

A: Fragestellung, Hypothese

B: Datenerhebung (Stichprobenerhebung, Typen, Elemente, Kriterien, Merkmale)

C: Statistische Analyse (Spezifieren, schätzen, Diagnose)

D: Interpretation

E: Kommunkiation

Komponenten einer statistischen Datenmatrix

- Zufallsvariable

- Merkmalsausrägung (value) --> erhobener Wert: 4000m

- Merkmalsträger (case) --> Berg

- Stichprobe (sample) --> 10 Berge

- Variable --> Höhe

Prinzip der statistischer Analyse

Der Vorgang des Messens (Beobachtung) bedeutet die Zuordnung genau eines Messwertes (Ergebnis Beobachtung), um die Verhältnisse der Merkmalsträger (Gesamtheit Beobachtung) bezüglich des Merkmals (1 Aspekt des Beobachteten) wiederzugeben

Geburtsort (ZH, GR), Geschlecht (m,f)

Temp (C°), Studienbeginn (2012, 2013)

Noten (1-6), Einkommen (hoch, niedrig), Weg zur Uni (kurz, lang)

Temperatur (K), Alter (1,2), Wegzeit zur Uni (34min)

Mass dafür, wie weit einzelne Objekte voneinander entfernt sind (Summe der quadratischen Abweichung der einzelnen Werte vom Mittelwert dividiert durch Anzahl Beobachtungen)

Wurzel aus der Varianz (hat die gleiche MAsseneinheit wie die Daten selbst)

Beschreibt den Maximalabstand zwischen Werten (Differenz zw. grösstem und kleinsten Wert, hängt stark von einzelnen Werten ab)

mittlere 80% einer Verteilung

mittlere 50% einer Verteilung (zwischen 25% und 75% Quartil)

Graphische Darstellungsmöglichkeiten für Verteilungen

- Häufigkeitstabellen

- Säulendiagramm, Kuchendiagramm

- Histogramm (Wölbung: Mass für Steilgipfligkeit der Verteilung)

- Boxplot 

Inferenzstatistik: Punktschätzung

Berechnung von Schätzwerten für die Kennwerte der Grundgesamtheit

Bsp: gegen MEI: In welchem Bereich liegt der Ja-Anteil voraussichtlich in der Grundgesamtheit?

Inferenzstatistik: Intervallschätzung

Kennwert der Grundgesamtheit durch Intervall beschrieben. Innerhalb dieses Intervalls liegt der Kennwert mit einer bestimmten Wahrscheinlichkeit (nahe1)--> Konfidenzintervall ( Je grösser die Stichprobe, desto kleiner das Konfidenzintervall und je kleiner die Variabilität der Grundgesamtheit, desto kleiner das Konfidenzintervall)

Inferenzstatistik: Signifikanztest

Beim Testen ist die Grundgesamtheit (hypothetisch) bekannt. Man fragt, wie wahrscheinlich es ist, dass eine vorliegende Zufallsstichprobe aus dieser Grundgesamtheit stammt

Bsp: MEI: Stimmt der JA und NEIN Anteil in der Befragung mit der Grundgesamtheit überein?

Normalverteilung

Binomialvertreilung

- Verteilung der Erfolge in einer Serie von gleichartigen, unabhängigen Versuchen

- Wahrscheinlichkeit für n-faches Auftreten eines von genau zwei möglichen Ereignissen

- diskrete Verteilung

- Bsp Münzwurf

Statistische Hypotheses, deren Gültigkeit mit statistischen Tests geprüft wird

Ablauf Signifikanztest (1-5)

1. Formulierung Arbeitshypothese

2. Auswahr der statistischen Prüfgrössen

3. Formulierung der Null- und Alternativhypothese

4. Irrtumswahrscheinlichkeit (5%)

5. Berechnung und Entscheid, ob Ho angenommen wird

Zurückweisen der Nullhypothese, obwohl sie wahr ist

Annahme der Nullhypothese, obwohl die Alternativhypothese korrekt ist

Einseitige und zweiseitige  Hypothese:

Einseitig: Henthält eine Richtung

Zweiseitig: sowohl Abweichunge nach unten als auch nach oben werden toleriert

Was prüfen Anpassungstests?

Prüfen, ob die (eigentliche) unbekannte Wahrscheinlichkeitsverteilung einer Zufallsvariable einem bestimmtem Verteilungsmodell folgt. 

Die Anpassungsgüte beschreibt, wie gut ein statistisches Modell eine Menge Beobachtungen trifft. Es beschreibt die Diskrepanz zwischen Beobachtungen und erwarteten Werte. 

Test auf Übereinstimmung von Verteilungen (minestens nominal, grosse Stichprobe, unabhängige Stichprobenvariablen)

Test auf Normalverteilung

Testet, ob Verteilung einer Stichprobenvariable mit einer theoretisch angenommenen Verteilung übereinstimmen

Testet, ob ein prozentualer Häufigkeitsanteil für eine binäre Varible in der Stichprobe mit der Grundgesamtheit vereinbar sind. Bsp: HDer Anteil männlicher Studierenden beträgt 49%

Test auf Zufälligkeit

Beobachtungwerte werden in der Reihenfolge ihres Auftretens aufgeschrieben. 

one sample t-Test (independet t-test)

- kleine Stichproben folgen nicht einer Normalverteilung, sondern einer Normalverteilung

- basierend auf den Mittelwerten der Stichproben und dem Standardfehler

- abhängig von der Grösse der Stichprobe

- metrisch skalliert, zufällig ausgewählt, unabhängig

--> gerichtete Hypotheses (einseitiger Test) --> Versuchen Hzu verwerfen

two sample t-Test

- unabhängige Stichproben

- Ho: die SNP-Mittelwerte sind aus der gleichen Population

--> ungerichtete Hypothese

- Wenn t-Wert aus der Tabelle grösser ist als berechneter t-Wert, dann Ho verwerfen

- t-Test zeugt keinen signifikanten Unterschied, Ho annehmen

Dependent t-Test

- Variablen haben Werte, die aus mehrere MEssungen stammen (Bsp. Messstation)

- Ziel: Vergleicht Mittelwerte von kleinen, abhängigen Stichproben mit my von Modell

- Ho: Mittelwerte der Messpaardifferenzen unterscheiden sich nicht

Varianzanalyse

Fragen, die ANOVA beantworten kann_

- gibt es Gruppenunterschiede in der Stichprobe?

- welchen Anteil haben die Gruppen zur Gesamtvarianz der Beobachtungen in der Stichprobe?

One Way Anova

Vergleich der Mittelwerte von unabhängigen Gruppen in einer Stichprobe mit my vom Modell

- Ho: Die Gruppen-Mittelwerte unterscheiden sich nicht (d.h. es gibt keine Gruppen in der Population)

- ungerichtet, zweiseitig

\(F = {Streuung^2 zwischen den Gruppen \over Streuung^2 innerhalb der Gruppen}\)

Non parametic ANOVA Test

wenn die Daten nicht normalverteilt sind und mindestens intervallskalliert sind. 

Chi-Quadrat-Unabhängigkeitstest

Kovarianz

- beschreibt den Zusammenhang zwischen 2 Variablen

- positiv: X und Y besitzen einen gleichläufigen, linearen Zusammenhang

- negativ: A und B besitzen einen gegenläufigen, linearen Zusammenhang

- nahe 0: kein linearer Zusammenhang

Pearsons Korrelationskoeffizient

Lernen