Kalkulačka lineárnej regresie

Preložte priamku najmenších štvorcov cez párové údaje a prečítajte si jej smernicu, R², hodnotu p, intervaly spoľahlivosti, rezíduá a predikcie na jednom mieste.

Údaje

Zadajte najprv x, potom y. Dva stĺpce skopírované z tabuľkového hárka sa vložia priamo, vrátane riadka s hlavičkou. Pre desatinné miesta použite čiarku, napríklad 12,5.
Voliteľné. Najviac 50 hodnôt, oddelených medzerami.

Regresná priamka

Priamka najmenších štvorcov

Koeficienty

ČlenOdhadSmerodajná chybatpInterval spoľahlivosti {level}%

Vysvetlený rozptyl

ZdrojdfSuma štvorcovPriemerný štvorecFp

Preloženie a rezíduá

Predikcie

Priemerný interval pokrýva priemerné y pri danom x. Individuálny interval pokrýva jedno nové pozorovanie, takže je vždy širší.

xŷPriemerný {level}%Individuálny {level}%

Bod po bode

xyŷy − ŷ

Vzorec a dosadenie

b = Σ(x − x̄)(y − ȳ) ÷ Σ(x − x̄)²

a = ȳ − b·x̄

SSE = Σ(y − ŷ)²

SST = Σ(y − ȳ)²

R² = 1 − SSE ÷ SST

s = √(SSE ÷ (n − 2))

SE(b) = s ÷ √Σ(x − x̄)²

    Vaše dátové body a všetky štatistiky zostávajú v tomto prehliadači a nikdy sa neodosielajú.

    Časté otázky

    Čo mi vlastne hovorí R²?

    R² je podiel vertikálneho pohybu v y, ktorý priamka vysvetľuje: 0,96 znamená, že 96 % z neho sa zhoduje s x a 4 % nie. Nehovorí nič o tom, či bola priamka správnym tvarom — aj výrazná krivka môže dosiahnuť vysoké skóre — preto ho interpretujte spoločne s grafom rezíduí. Korelácia r je druhá odmocnina z R² so znamienkom smernice, čo je dôvod, prečo je r pre klesajúcu priamku záporné.

    Znamená malá hodnota p, že x zapríčiňuje y?

    Nie. Hodnota p odpovedá len na jednu úzku otázku: ak by bola skutočná smernica 0, ako často by výber tejto veľkosti vyprodukoval smernicu aspoň takto vzdialenú od 0? Malá hodnota robí z vysvetlenia „žiadny vzťah“ nepravdepodobnú možnosť, nič viac. Príčinnosť si vyžaduje správny návrh štúdie — tretí faktor ovplyvňujúci oba stĺpce alebo výber, ktorý nebol zhromaždený nezávisle, vyprodukuje malé hodnoty p rovnako ľahko.

    Prečo sa k predikciám uvádzajú dva intervaly?

    Odpovedajú na rôzne otázky. Priemerný interval zisťuje, kde sa nachádza priemerná hodnota y pre všetkých pri danom x, takže sa berie do úvahy len neistota samotnej priamky. Individuálny interval zisťuje, kde skončí jedno nové pozorovanie, čo pridáva rozptyl bodov okolo priamky — tento dodatočný člen je dôvodom, prečo je vždy širší z týchto dvoch. Oba sa rozširujú, keď sa x vzďaľuje od stredu vašich údajov.

    Záleží na tom, do ktorého stĺpca vložím x?

    Áno. Metóda najmenších štvorcov minimalizuje vertikálne odchýlky, takže s y zaobchádza ako s vysvetľovanou premennou a s x ako s vysvetľujúcou premennou. Ak ich zameníte, získate inú smernicu a iný priesečník — iba r a R² zostanú rovnaké. Premennú, ktorú chcete predpovedať, vložte do y; ak ste stĺpce zadali opačne, tlačidlo na zámenu ich prepíše priamo na mieste.

    Matematické základy lineárnej regresie metódou najmenších štvorcov

    Lineárna regresia hľadá optimálnu priamku, ktorá popisuje vzťah medzi nezávislou premennou (prediktorom x) a závislou premennou (odozvou y). Kalkulačka lineárnej regresie využíva metódu najmenších štvorcov (OLS), ktorej cieľom je minimalizovať súčet štvorcov vertikálnych odchýlok (rezíduí) medzi skutočnými bodmi a preloženou priamkou.

    Aby sa predišlo strate presnosti pri práci s číslami s výrazne odlišnými rádovými veľkosťami, kalkulačka vykonáva výpočty súčtov odchýlok od priemerov v dvoch fázach s využitím kompenzovaného sčítania:

    • Sxx = Σ(xᵢ − x̄)²
    • Syy = Σ(yᵢ − ȳ)²
    • Sxy = Σ(xᵢ − x̄)(yᵢ − ȳ)

    Kde a ȳ predstavujú výberové priemery oboch premenných. Na základe týchto hodnôt kalkulačka odvodzuje základné parametre regresnej priamky:

    • Smernica b: Vyjadruje sklon priamky a vypočíta sa ako podiel b = Sxy ÷ Sxx.
    • Priesečník a: Určuje bod, v ktorom priamka pretína os y, podľa vzťahu a = ȳ − b·x̄.

    Výsledná rovnica regresnej priamky má tvar ŷ = a + b·x.


    Interpretácia koeficientov a štatistická významnosť

    Získané koeficienty majú priamy praktický význam pre interpretáciu správania údajov:

    • Smernica b: Vyjadruje priemernú zmenu závislej premennej. V priemere sa y mení o ‹slope› na každé zvýšenie x o 1.
    • Priesečník a: Definuje počiatočnú hodnotu na osi odozvy. Tam, kde je x rovné 0, leží priamka na hodnote y = ‹intercept›.

    Pre posúdenie spoľahlivosti týchto odhadov kalkulačka zostavuje tabuľku s názvom Koeficienty, ktorá obsahuje stĺpce Člen (Term), Odhad, Smerodajná chyba, t, p a Interval spoľahlivosti ‹level›% (Interval).

    Smerodajná chyba smernice sa vypočíta ako SE(b) = s ÷ √Sxx, kde s je smerodajná odchýlka rezíduí. Smerodajná chyba priesečníka je definovaná ako SE(a) = s · √(1÷n + x̄² ÷ Sxx). Testovacia štatistika t preveruje nulovú hypotézu, že daný koeficient je rovný nule. Príslušná obojstranná hodnota p sa určuje pomocou regularizovanej neúplnej beta funkcie s n − 2 stupňami voľnosti. Ak je hodnota p nízka, nulovú hypotézu o nulovosti koeficientu môžeme zamietnuť.


    Rozptyl a miera tesnosti: r, R² a ANOVA

    Na vyhodnotenie kvality regresného modelu slúžia ukazovatele tesnosti preloženia a analýza rozptylu (ANOVA). Kalkulačka poskytuje tieto kľúčové štatistiky:

    • Korelácia r: Vyjadruje silu a smer lineárneho vzťahu. Vypočíta sa ako Sxy ÷ √(Sxx·Syy) a nesie znamienko smernice.
    • (Koeficient determinácie): Predstavuje podiel celkového rozptylu odozvy, ktorý je vysvetlený regresným modelom. Vzorec je R² = SSR ÷ SST, kde SST = Syy je celková suma štvorcov a SSR = SST − SSE je suma štvorcov vysvetlená regresnou priamkou.
    • Upravené R² (Adjusted R²): Koriguje koeficient determinácie o počet stupňov voľnosti podľa vzťahu 1 − (1 − R²)(n − 1) ÷ (n − 2).
    • Smerodajná odchýlka rezíduí s: Určuje priemernú veľkosť odchýlok bodov od priamky, vypočítanú ako s = √(SSE ÷ (n − 2)).

    Tabuľka Vysvetlený rozptyl (ANOVA) rozdeľuje celkovú variabilitu do troch riadkov: Vysvetlené priamkou (Regression), Zostávajúce (Residual) a Celkovo (Total). Stĺpce tabuľky sú Zdroj (Source), df (stupne voľnosti), Suma štvorcov, Priemerný štvorec, F a p. Pri modeli s jedným prediktorom platí, že celková hodnota štatistiky F sa rovná druhej mocnine štatistiky t pre smernicu, čo vedie k identickej hodnote p v oboch testoch.


    Predikcie a intervaly spoľahlivosti

    Kalkulačka umožňuje predpovedať hodnoty odozvy pre špecifické hodnoty prediktoru x. Pre každé zadané x₀ vypočíta bodový odhad ŷ₀ = a + b·x₀ a priradí k nemu dva typy intervalov spoľahlivosti na zvolenej hladine (90 %, 95 % alebo 99 %):

    1. Priemerný ‹level›% (Mean interval): Určuje interval spoľahlivosti pre strednú hodnotu odozvy. Jeho smerodajná chyba je definovaná ako s · √(1÷n + (x₀ − x̄)² ÷ Sxx).
    2. Individuálny ‹level›% (Individual interval): Určuje predikčný interval pre jedno nové budúce pozorovanie. Smerodajná chyba tohto intervalu je s · √(1 + 1÷n + (x₀ − x̄)² ÷ Sxx).

    Vzhľadom na prítomnosť dodatočného člena 1 pod odmocninou, ktorý reprezentuje variabilitu jednotlivých bodov okolo priamky, je individuálny interval vždy širší ako priemerný interval. Oba intervaly sa postupne rozširujú, čím viac sa hodnota x₀ vzďaľuje od výberového priemeru . Ak zadaná hodnota predikcie leží mimo rozsahu vstupných dát, kalkulačka zobrazí označenie mimo údajov (outside range) s upozornením, že priamka sa predlžuje za hranicu toho, čo ukazujú údaje.


    Pravidlá zadávania údajov a hraničné stavy

    Nástroj spracováva údaje lokálne priamo vo webovom prehliadači používateľa a žiadne dáta sa neodosielajú na externé servery. Výpočty prebiehajú okamžite počas písania bez nutnosti stláčať tlačidlo na odoslanie.

    Možnosti vstupu a formátovanie

    • Rozloženie: Používateľ si môže vybrať Párové riadky (jedno x a y na riadok) alebo Dva zoznamy (samostatné polia pre x a y).
    • Desatinné oddeľovače: Podporovaná je bodka (napr. 12.5) aj čiarka (napr. 12,5). Pri voľbe bodky sa hodnoty v zoznamoch oddeľujú medzerami, čiarkami alebo novými riadkami. Pri voľbe čiarky sa ako oddeľovač hodnôt používa medzera, bodkočiarka alebo nový riadok.
    • Kopírovanie z tabuliek: Pri vkladaní dvoch stĺpcov z tabuľkového procesora kalkulačka automaticky preskočí prvý riadok, ak obsahuje nečíselné texty (hlavičky stĺpcov).
    • Zmena smeru: Funkcia Zameniť x a y prehodí stĺpce. Keďže metóda najmenších štvorcov minimalizuje iba vertikálne odchýlky, výsledná priamka po zámene bude mať inú smernicu aj priesečník; hodnoty r a však zostanú nezmenené.

    Obmedzenia a chybové stavy

    Kalkulačka bezpečne spracuje maximálne 50 000 bodov a 1 MB textu na vstupe, pričom umožňuje zadať najviac 50 hodnôt pre predikciu naraz. Pri výpočtoch môžu nastať tieto špecifické stavy:

    • Nedostatok dát: Ak zadáte menej ako 2 body, zobrazí sa chyba: „Zadajte aspoň 2 body; jeden bod nedefinuje priamku.“.
    • Presne dva body: Ak zadáte presne dva body, priamka je určená jednoznačne a kalkulačka zobrazí stav: „Dva body určujú priamku presne, takže nezostáva nič, z čoho by sa dala odhadnúť neistota.“.
    • Dokonalá zhoda: Ak všetky body ležia presne na priamke, nevzniká žiadne rezíduum a kalkulačka oznámi: „Body ležia presne na priamke, takže neexistuje žiadny rozptyl rezíduí a nie je možné odhadnúť interval ani hodnotu p.“.
    • Konštantné hodnoty Y: Ak sú všetky hodnoty y rovnaké, priamka je vodorovná a zobrazí sa stav: „Každé y je rovnaké, takže priamka je vodorovná a r, R² a test významnosti nie sú definované.“.
    • Vertikálna priamka (Konštantné hodnoty X): Ak sú všetky hodnoty x rovnaké, výpočet sa zastaví s chybou: „Každé x je rovnaké, takže priamka by bola vertikálna a pri výpočte smernice by dochádzalo k deleniu nulou.“.

    Často kladené otázky (FAQ)

    Záleží na tom, do ktorého stĺpca vložím x?

    Áno. Metóda najmenších štvorcov minimalizuje vertikálne odchýlky, takže s y zaobchádza ako s vysvetľovanou premennou a s x ako s vysvetľujúcou premennou. Ak ich zameníte, získate inú smernicu a iný priesečník — iba r a R² zostanú rovnaké. Premennú, ktorú chcete predpovedať, vložte do y; ak ste stĺpce zadali opačne, tlačidlo na zámenu ich prepíše priamo na mieste.

    Čo mi vlastne hovorí R²?

    R² je podiel vertikálneho pohybu v y, ktorý priamka vysvetľuje: 0,96 znamená, že 96 % z neho sa zhoduje s x a 4 % nie. Nehovorí nič o tom, či bola priamka správnym tvarom — aj výrazná krivka môže dosiahnuť vysoké skóre — preto ho interpretujte spoločne s grafom rezíduí. Korelácia r je druhá odmocnina z R² so znamienkom smernice, čo je dôvod, prečo je r pre klesajúcu priamku záporné.

    Prečo sa k predikciám uvádzajú dva intervaly?

    Odpovedajú na rôzne otázky. Priemerný interval zisťuje, kde sa nachádza priemerná hodnota y pre všetkých pri danom x, takže sa berie do úvahy len neistota samotnej priamky. Individuálny interval zisťuje, kde skončí jedno nové pozorovanie, čo pridáva rozptyl bodov okolo priamky — tento dodatočný člen je dôvodom, prečo je vždy širší z týchto dvoch. Oba sa rozširujú, keď sa x vzďaľuje od stredu vašich údajov.

    Znamená malá hodnota p, že x zapríčiňuje y?

    Nie. Hodnota p odpovedá len na jednu úzku otázku: ak by bola skutočná smernica 0, ako často by výber tejto veľkosti vyprodukoval smernicu aspoň takto vzdialenú od 0? Malá hodnota robí z vysvetlenia „žiadny vzťah“ nepravdepodobnú možnosť, nič viac. Príčinnosť si vyžaduje správny návrh štúdie — tretí faktor ovplyvňujúci oba stĺpce alebo výber, ktorý nebol zhromaždený nezávisle, vyprodukuje malé hodnoty p rovnako ľahko.