Matematické základy lineárnej regresie metódou najmenších štvorcov
Lineárna regresia hľadá optimálnu priamku, ktorá popisuje vzťah medzi nezávislou premennou (prediktorom x) a závislou premennou (odozvou y). Kalkulačka lineárnej regresie využíva metódu najmenších štvorcov (OLS), ktorej cieľom je minimalizovať súčet štvorcov vertikálnych odchýlok (rezíduí) medzi skutočnými bodmi a preloženou priamkou.
Aby sa predišlo strate presnosti pri práci s číslami s výrazne odlišnými rádovými veľkosťami, kalkulačka vykonáva výpočty súčtov odchýlok od priemerov v dvoch fázach s využitím kompenzovaného sčítania:
- Sxx = Σ(xᵢ − x̄)²
- Syy = Σ(yᵢ − ȳ)²
- Sxy = Σ(xᵢ − x̄)(yᵢ − ȳ)
Kde x̄ a ȳ predstavujú výberové priemery oboch premenných. Na základe týchto hodnôt kalkulačka odvodzuje základné parametre regresnej priamky:
- Smernica b: Vyjadruje sklon priamky a vypočíta sa ako podiel
b = Sxy ÷ Sxx. - Priesečník a: Určuje bod, v ktorom priamka pretína os y, podľa vzťahu
a = ȳ − b·x̄.
Výsledná rovnica regresnej priamky má tvar ŷ = a + b·x.
Interpretácia koeficientov a štatistická významnosť
Získané koeficienty majú priamy praktický význam pre interpretáciu správania údajov:
- Smernica b: Vyjadruje priemernú zmenu závislej premennej. V priemere sa y mení o
‹slope›na každé zvýšenie x o 1. - Priesečník a: Definuje počiatočnú hodnotu na osi odozvy. Tam, kde je x rovné 0, leží priamka na hodnote y =
‹intercept›.
Pre posúdenie spoľahlivosti týchto odhadov kalkulačka zostavuje tabuľku s názvom Koeficienty, ktorá obsahuje stĺpce Člen (Term), Odhad, Smerodajná chyba, t, p a Interval spoľahlivosti ‹level›% (Interval).
Smerodajná chyba smernice sa vypočíta ako SE(b) = s ÷ √Sxx, kde s je smerodajná odchýlka rezíduí. Smerodajná chyba priesečníka je definovaná ako SE(a) = s · √(1÷n + x̄² ÷ Sxx). Testovacia štatistika t preveruje nulovú hypotézu, že daný koeficient je rovný nule. Príslušná obojstranná hodnota p sa určuje pomocou regularizovanej neúplnej beta funkcie s n − 2 stupňami voľnosti. Ak je hodnota p nízka, nulovú hypotézu o nulovosti koeficientu môžeme zamietnuť.
Rozptyl a miera tesnosti: r, R² a ANOVA
Na vyhodnotenie kvality regresného modelu slúžia ukazovatele tesnosti preloženia a analýza rozptylu (ANOVA). Kalkulačka poskytuje tieto kľúčové štatistiky:
- Korelácia r: Vyjadruje silu a smer lineárneho vzťahu. Vypočíta sa ako
Sxy ÷ √(Sxx·Syy)a nesie znamienko smernice. - R² (Koeficient determinácie): Predstavuje podiel celkového rozptylu odozvy, ktorý je vysvetlený regresným modelom. Vzorec je
R² = SSR ÷ SST, kdeSST = Syyje celková suma štvorcov aSSR = SST − SSEje suma štvorcov vysvetlená regresnou priamkou. - Upravené R² (Adjusted R²): Koriguje koeficient determinácie o počet stupňov voľnosti podľa vzťahu
1 − (1 − R²)(n − 1) ÷ (n − 2). - Smerodajná odchýlka rezíduí s: Určuje priemernú veľkosť odchýlok bodov od priamky, vypočítanú ako
s = √(SSE ÷ (n − 2)).
Tabuľka Vysvetlený rozptyl (ANOVA) rozdeľuje celkovú variabilitu do troch riadkov: Vysvetlené priamkou (Regression), Zostávajúce (Residual) a Celkovo (Total). Stĺpce tabuľky sú Zdroj (Source), df (stupne voľnosti), Suma štvorcov, Priemerný štvorec, F a p. Pri modeli s jedným prediktorom platí, že celková hodnota štatistiky F sa rovná druhej mocnine štatistiky t pre smernicu, čo vedie k identickej hodnote p v oboch testoch.
Predikcie a intervaly spoľahlivosti
Kalkulačka umožňuje predpovedať hodnoty odozvy pre špecifické hodnoty prediktoru x. Pre každé zadané x₀ vypočíta bodový odhad ŷ₀ = a + b·x₀ a priradí k nemu dva typy intervalov spoľahlivosti na zvolenej hladine (90 %, 95 % alebo 99 %):
- Priemerný
‹level›% (Mean interval): Určuje interval spoľahlivosti pre strednú hodnotu odozvy. Jeho smerodajná chyba je definovaná akos · √(1÷n + (x₀ − x̄)² ÷ Sxx). - Individuálny
‹level›% (Individual interval): Určuje predikčný interval pre jedno nové budúce pozorovanie. Smerodajná chyba tohto intervalu jes · √(1 + 1÷n + (x₀ − x̄)² ÷ Sxx).
Vzhľadom na prítomnosť dodatočného člena 1 pod odmocninou, ktorý reprezentuje variabilitu jednotlivých bodov okolo priamky, je individuálny interval vždy širší ako priemerný interval. Oba intervaly sa postupne rozširujú, čím viac sa hodnota x₀ vzďaľuje od výberového priemeru x̄. Ak zadaná hodnota predikcie leží mimo rozsahu vstupných dát, kalkulačka zobrazí označenie mimo údajov (outside range) s upozornením, že priamka sa predlžuje za hranicu toho, čo ukazujú údaje.
Pravidlá zadávania údajov a hraničné stavy
Nástroj spracováva údaje lokálne priamo vo webovom prehliadači používateľa a žiadne dáta sa neodosielajú na externé servery. Výpočty prebiehajú okamžite počas písania bez nutnosti stláčať tlačidlo na odoslanie.
Možnosti vstupu a formátovanie
- Rozloženie: Používateľ si môže vybrať Párové riadky (jedno x a y na riadok) alebo Dva zoznamy (samostatné polia pre x a y).
- Desatinné oddeľovače: Podporovaná je bodka (napr.
12.5) aj čiarka (napr.12,5). Pri voľbe bodky sa hodnoty v zoznamoch oddeľujú medzerami, čiarkami alebo novými riadkami. Pri voľbe čiarky sa ako oddeľovač hodnôt používa medzera, bodkočiarka alebo nový riadok. - Kopírovanie z tabuliek: Pri vkladaní dvoch stĺpcov z tabuľkového procesora kalkulačka automaticky preskočí prvý riadok, ak obsahuje nečíselné texty (hlavičky stĺpcov).
- Zmena smeru: Funkcia Zameniť x a y prehodí stĺpce. Keďže metóda najmenších štvorcov minimalizuje iba vertikálne odchýlky, výsledná priamka po zámene bude mať inú smernicu aj priesečník; hodnoty r a R² však zostanú nezmenené.
Obmedzenia a chybové stavy
Kalkulačka bezpečne spracuje maximálne 50 000 bodov a 1 MB textu na vstupe, pričom umožňuje zadať najviac 50 hodnôt pre predikciu naraz. Pri výpočtoch môžu nastať tieto špecifické stavy:
- Nedostatok dát: Ak zadáte menej ako 2 body, zobrazí sa chyba: „Zadajte aspoň 2 body; jeden bod nedefinuje priamku.“.
- Presne dva body: Ak zadáte presne dva body, priamka je určená jednoznačne a kalkulačka zobrazí stav: „Dva body určujú priamku presne, takže nezostáva nič, z čoho by sa dala odhadnúť neistota.“.
- Dokonalá zhoda: Ak všetky body ležia presne na priamke, nevzniká žiadne rezíduum a kalkulačka oznámi: „Body ležia presne na priamke, takže neexistuje žiadny rozptyl rezíduí a nie je možné odhadnúť interval ani hodnotu p.“.
- Konštantné hodnoty Y: Ak sú všetky hodnoty y rovnaké, priamka je vodorovná a zobrazí sa stav: „Každé y je rovnaké, takže priamka je vodorovná a r, R² a test významnosti nie sú definované.“.
- Vertikálna priamka (Konštantné hodnoty X): Ak sú všetky hodnoty x rovnaké, výpočet sa zastaví s chybou: „Každé x je rovnaké, takže priamka by bola vertikálna a pri výpočte smernice by dochádzalo k deleniu nulou.“.
Často kladené otázky (FAQ)
Záleží na tom, do ktorého stĺpca vložím x?
Áno. Metóda najmenších štvorcov minimalizuje vertikálne odchýlky, takže s y zaobchádza ako s vysvetľovanou premennou a s x ako s vysvetľujúcou premennou. Ak ich zameníte, získate inú smernicu a iný priesečník — iba r a R² zostanú rovnaké. Premennú, ktorú chcete predpovedať, vložte do y; ak ste stĺpce zadali opačne, tlačidlo na zámenu ich prepíše priamo na mieste.
Čo mi vlastne hovorí R²?
R² je podiel vertikálneho pohybu v y, ktorý priamka vysvetľuje: 0,96 znamená, že 96 % z neho sa zhoduje s x a 4 % nie. Nehovorí nič o tom, či bola priamka správnym tvarom — aj výrazná krivka môže dosiahnuť vysoké skóre — preto ho interpretujte spoločne s grafom rezíduí. Korelácia r je druhá odmocnina z R² so znamienkom smernice, čo je dôvod, prečo je r pre klesajúcu priamku záporné.
Prečo sa k predikciám uvádzajú dva intervaly?
Odpovedajú na rôzne otázky. Priemerný interval zisťuje, kde sa nachádza priemerná hodnota y pre všetkých pri danom x, takže sa berie do úvahy len neistota samotnej priamky. Individuálny interval zisťuje, kde skončí jedno nové pozorovanie, čo pridáva rozptyl bodov okolo priamky — tento dodatočný člen je dôvodom, prečo je vždy širší z týchto dvoch. Oba sa rozširujú, keď sa x vzďaľuje od stredu vašich údajov.
Znamená malá hodnota p, že x zapríčiňuje y?
Nie. Hodnota p odpovedá len na jednu úzku otázku: ak by bola skutočná smernica 0, ako často by výber tejto veľkosti vyprodukoval smernicu aspoň takto vzdialenú od 0? Malá hodnota robí z vysvetlenia „žiadny vzťah“ nepravdepodobnú možnosť, nič viac. Príčinnosť si vyžaduje správny návrh štúdie — tretí faktor ovplyvňujúci oba stĺpce alebo výber, ktorý nebol zhromaždený nezávisle, vyprodukuje malé hodnoty p rovnako ľahko.