Lineær regression og R²
Matematik A · STX · A-niveau · Statistik og sandsynlighed
🧮 Lineær regression og R²
Lineær regression er et af statistikkens vigtigste værktøjer — det findes overalt fra hverdagsanalyse til avanceret machine learning.
Hvad er lineær regression?
Finde den bedste rette linje $y = a \\cdot x + b$ der passer til datapunkter $(x_i, y_i)$.
Eksempler:
- Sammenhæng mellem træningstimer og karakter
- Sammenhæng mellem temperatur og iskremsalg
- Sammenhæng mellem alder og blodtryk
Mindste kvadraters metode
Udviklet af Carl Friedrich Gauss (1795). Vi vil minimere kvadratet af fejlene:
$$\\min \\sum (y_i - (a x_i + b))^2$$
Formler:
$$a = \\frac{\\sum (x_i - \\bar{x})(y_i - \\bar{y})}{\\sum (x_i - \\bar{x})^2}$$
$$b = \\bar{y} - a \\bar{x}$$
hvor $\\bar{x}, \\bar{y}$ er gennemsnit.
Determinationskoefficient R²
$$R^2 = 1 - \\frac{SSE}{SST}$$
hvor:
- SSE = Sum of Squared Errors = $\\sum (y_i - \\hat{y}_i)^2$
- SST = Total Sum of Squares = $\\sum (y_i - \\bar{y})^2$
R²-fortolkning
| R² | Tolkning |
|---|---|
| 1,0 | Perfekt lineær |
| 0,9-0,99 | Meget stærk |
| 0,7-0,9 | Stærk |
| 0,5-0,7 | Moderat |
| 0,3-0,5 | Svag |
| <0,3 | Meget svag/ikke-lineær |
R² = 0,8 betyder: modellen forklarer 80% af variansen i data.
Korrelationskoefficient r
$$r = \\text{signed} \\sqrt{R^2}$$
- $r > 0$: positiv sammenhæng (a > 0)
- $r < 0$: negativ sammenhæng (a < 0)
- $r = 0$: ingen lineær sammenhæng
- $r \\in [-1, 1]$
Antagelser bag lineær regression
1. Lineær sammenhæng mellem x og y
2. Normalfordelte residualer
3. Homoskedasticitet (konstant varians af fejl)
4. Uafhængige observationer
Hvis disse er brudte, er regressionen muligvis ikke pålidelig.
Korrelation ≠ kausalitet ⚠️
Den klassiske fejl i statistik:
Eksempel: Iskremomsætning korrelerer stærkt med drukneulykker.
- ❌ "Iskremsalg forårsager drukneulykker"
- ✅ Fælles tredje variabel: sommer (varme får både flere til at købe is og bade)
Korrelation viser sammenhæng, ikke årsag.
Begrænsninger
- Outliere kan dominere regressionen — én ekstrem værdi kan ændre linjen helt
- Ikke-lineær sammenhæng giver dårlig fit selv om R² er højt
- Ekstrapolering uden for data-området er farligt
- Skjulte variable kan give vildledende resultater
Robust regression
Når outliere er et problem:
- Huber regression — vægter outliere mindre
- RANSAC — vælger bedste subset af data
- Median-regression — bruger median i stedet for gennemsnit
Multipel regression
Flere uafhængige variable:
$$y = b + a_1 x_1 + a_2 x_2 + ... + a_n x_n$$
Dette er fundamentet for machine learning og avanceret dataanalyse.
Værktøjer
| Værktøj | Bruges til |
|---|---|
| Excel | LINEST, SLOPE, INTERCEPT, RSQ |
| GeoGebra | Fit({punkter}, x) |
| R | lm() |
| Python | scikit-learn, statsmodels |
| Maple/Mathematica | Symbolsk regression |
Vidste du at...
📊 Lineær regression opfandt Francis Galton i 1880-erne — han studerede arvelighed af højde mellem forældre og børn
🤖 Machine learning er på mange måder avanceret lineær regression — neurale netværk er kombinationer af mange små regressioner
⚠️ "Lying with statistics" — fejlagtig brug af lineær regression er en af de mest almindelige måder, statistikker manipuleres på
📚 Carl Friedrich Gauss udviklede mindste kvadraters metode som 18-årig (1795) — først publiceret af Legendre 1805, så Gauss måtte slås for prioriteten
Læringsmål
- Bestemme regressionslinjen y = ax + b ved mindste kvadraters metode
- Beregne og fortolke determinationskoefficienten R²
- Forklare forskellen mellem korrelation og kausalitet med konkrete eksempler
- Vurdere antagelserne bag lineær regression (linearitet, residualer, outliere)
- Anvende CAS/Excel til at finde regressionslinje og R² for et datasæt
Sådan kan du arbejde med emnet
- Indtast et datasæt i CAS og find regressionslinjens forskrift samt R²-værdien
- Forklar hvad det betyder, hvis R² ligger tæt på 1
- Brug en regressionslinje til at lave en forudsigelse og diskutér, hvor sikker den er
Træningsforslag
- Indsaml eller find et datasæt (fx træningstimer vs. karakter) og find regressionslinjen i CAS.
- Beregn R² for et datasæt og forklar, hvor stor en del af variansen modellen forklarer.
- Forklar "is og drukneulykker"-eksemplet: hvorfor er der korrelation uden kausalitet?
- Diskutér: hvornår er det farligt at ekstrapolere en regressionslinje uden for datas område?
Brobygning
Lineær regression er broen til statistisk modellering generelt — den genbruges i Modellering-kategorien og er fundamentet for moderne machine learning.
Øv dette emne med AI — quizzer, forklaringer og feedback tilpasset dit niveau.
Prøv Fagportalen gratis