Lineārās regresijas kalkulators

Aproksimējiet mazāko kvadrātu taisni pāru datiem un vienuviet skatiet tās slīpumu, R², p-vērtību, ticamības intervālus, atlikumus un prognozes.

Dati

Ievadiet vispirms x, pēc tam y. Divas kolonnas, kas nokopētas no izklājlapas, var ielīmēt tieši, ieskaitot galvenes rindu. Decimāldaļām izmantojiet komatu, piemēram, 12,5.
Pēc izvēles. Līdz 50 vērtībām, atdalītām ar atstarpēm.

Regresijas taisne

Mazāko kvadrātu taisne

Koeficienti

LoceklisNovērtējumsStandartkļūdatp{level}% intervāls

Dispersijas analīze

AvotsdfKvadrātu summaVidējais kvadrātsFp

Aproksimācija un atlikumi

Prognozes

Vidējais intervāls aptver vidējo y pie attiecīgā x. Individuālais intervāls aptver vienu jaunu novērojumu, tāpēc tas vienmēr ir platāks.

xŷVidējais {level}%Individuālais {level}%

Pa punktiem

xyŷy − ŷ

Formula un aizvietošana

b = Σ(x − x̄)(y − ȳ) ÷ Σ(x − x̄)²

a = ȳ − b·x̄

SSE = Σ(y − ŷ)²

SST = Σ(y − ȳ)²

R² = 1 − SSE ÷ SST

s = √(SSE ÷ (n − 2))

SE(b) = s ÷ √Σ(x − x̄)²

    Jūsu datu punkti un visi aprēķini paliek šajā pārlūkprogrammā un nekad netiek augšupielādēti.

    BUJ

    Ko tieši man izsaka R²?

    R² ir y augšupvērstās un lejupvērstās kustības daļa, ko izskaidro taisne: 0,96 nozīmē, ka 96% no tās sakrīt ar x, bet 4% nesakrīt. Tas neko nepasaka par to, vai taisne bija pareizā forma — arī izteikta līkne joprojām var uzrādīt augstu rezultātu —, tāpēc vērtējiet to kopā ar atlikumu diagrammu. Korelācija r ir kvadrātsakne no R², kas saglabā slīpuma zīmi, tāpēc lejupvērstai taisnei r ir negatīvs.

    Vai maza p-vērtība nozīmē, ka x izraisa y?

    Nē. p-vērtība atbild tikai uz vienu šauru jautājumu: ja patiesais slīpums būtu 0, cik bieži šāda izmēra izlase dotu slīpumu, kas ir vismaz tik tālu no 0? Maza vērtība vienkārši padara skaidrojumu “nav nekādas saistības” par neērtu, nevis ko vairāk. Cēloņsakarībai ir nepieciešams pētījuma dizains — trešais faktors, kas ietekmē abas kolonnas, vai izlase, kas netika ievākta neatkarīgi, tikpat viegli rada mazas p-vērtības.

    Kāpēc prognozēm tiek nodrošināti divi intervāli?

    Tie atbild uz dažādiem jautājumiem. Vidējais intervāls jautā, kur atrodas vidējā y vērtība visiem novērojumiem pie konkrētā x, tāpēc tiek ņemta vērā tikai pašas taisnes nenoteiktība. Individuālais intervāls jautā, kur nonāks viens jauns novērojums, kas pieskaita punktu izkliedi ap taisni — šis papildu loceklis ir iemesls, kāpēc tas vienmēr ir platāks no abiem. Abi intervāli paplašinās, x attālinoties no jūsu datu vidusdaļas.

    Vai ir nozīme tam, kurā kolonnā es ievadu x?

    Jā. Mazāko kvadrātu metode minimizē vertikālās starpības, tāpēc tā uzskata y par skaidrojamo lielumu un x par skaidrojošo lielumu. Apmainiet tos vietām, un jūs iegūsiet citu slīpumu un citu krustpunktu — tikai r un R² paliek nemainīgi. Ievietojiet mainīgo, kuru vēlaties prognozēt, y kolonnā; ja kolonnas tika ievadītas nepareizā secībā, apmaiņas poga tās pārrakstīs turpat uz vietas.

    Mazāko kvadrātu metodes matemātiskie pamati

    Vienkāršā lineārā regresija izmanto parasto mazāko kvadrātu (OLS) metodi, lai divdimensionālu datu kopai pielāgotu taisni, kas vislabāk raksturo sakarību starp neatkarīgo mainīgo (prognozētāju x) un atkarīgo mainīgo (rezultatīvo rādītāju y). Šīs metodes mērķis ir minimizēt vertikālo attālumu kvadrātu summu starp novērotajiem punktiem un aprēķināto taisni.

    Lai novērstu noapaļošanas kļūdas un saglabātu augstu precizitāti pat tad, ja datu vērtību lielumi stipri atšķiras, kalkulators veic summu aprēķinus ap vidējām vērtībām divos gājienos, izmantojot kompensētās summēšanas principu. Aprēķinu pamatā ir šādas formulas:

    • Vidējās vērtības: x̄ = Σ xᵢ ÷ n un ȳ = Σ yᵢ ÷ n
    • Izkliede un kopīgā mainība: Sxx = Σ(xᵢ − x̄)² un Sxy = Σ(xᵢ − x̄)(yᵢ − ȳ)
    • Slīpums: b = Sxy ÷ Sxx
    • Y ass krustpunkts: a = ȳ − b · x̄

    Iegūtā taisne tiek attēlota formā ŷ = a + b · x, kur ŷ ir prognozētā vērtība. Tā kā mazāko kvadrātu metode minimizē tieši vertikālās novirzes, šis modelis ir izteikti virzīts. Ja tiek izmantota funkcija "Apmainīt x un y vietām", dati tiek pārrakstīti ar apmainītām kolonnām. Tā kā tagad tiek minimizētas horizontālās novirzes, jaunajai taisnei būs cits slīpums un krustpunkts, kamēr korelācijas rādītāji paliks nemainīgi.

    Regresijas koeficientu un rādītāju interpretācija

    Kalkulatora sniegtie rezultāti ļauj precīzi raksturot sakarību starp mainīgajiem:

    • Slīpums b: Norāda uz vidējo izmaiņu apjomu. Rezultātos tas tiek paskaidrots ar frāzi: "Vidēji y mainās par ‹slope› uz katru x pieaugumu par 1 vienību.".
    • Y ass krustpunkts a: Parāda teorētisko vērtību, kad prognozētājs ir nulle: "Kur x ir 0, taisne atrodas pie y = ‹intercept›.".
    • Korelācija r: Raksturo lineārās saistības stiprumu un virzienu, saglabājot slīpuma zīmi.
    • R² (Determinācijas koeficients): Parāda, kādu daļu no y mainības izskaidro modelis (R² = SSR ÷ SST).
    • Koriģētais R²: Pielāgo determinācijas koeficientu, ņemot vērā brīvības pakāpes, un ir noderīgs modeļu salīdzināšanai.

    Sadaļā "Dispersijas analīze" (ANOVA) tiek sadalīta kopējā kvadrātu summa (SST) daļā, ko "Skaidro taisne" (SSR), un daļā, kas paliek "Atlikusī (neskaidrotā)" (SSE).

    Hipotēžu pārbaude un statistiskā nozīmība

    Lai noteiktu, vai novērotā sakarība nav radusies nejaušības dēļ, kalkulators veic koeficientu hipotēžu pārbaudi, izmantojot t-statistiku. Tabulā "Koeficienti" tiek parādīti šādi lielumi rindām "Slīpums b" un "Y ass krustpunkts a":

    • Novērtējums: Aprēķinātā koeficienta vērtība.
    • Standartkļūda: Novērtējuma precizitātes mērs (SE(b) = s ÷ √(Sxx)).
    • t: t-statistika, ko aprēķina kā novērtējuma dalījumu ar tā standartkļūdu.
    • p: Divpusējā p-vērtība, kas noteikta ar n - 2 brīvības pakāpēm.
    • ‹level›% intervāls: Ticamības intervāls izvēlētajā līmenī (90%, 95% vai 99%).

    Tā kā vienkāršajā lineārajā regresijā ir tikai viens prognozētājs, kopējais ANOVA tabulas F-tests un slīpuma t-tests sniedz identisku p-vērtību.

    Atlikumu analīze un vizualizācija

    Atlikums jeb reziduāls (y − ŷ) ir starpība starp faktisko novēroto vērtību un modeļa prognozēto vērtību. Kalkulators piedāvā divus grafikus sadaļā "Aproksimācija un atlikumi":

    1. Aproksimējošā taisne: "Punktu izkliedes diagramma ar mazāko kvadrātu taisni un joslu ap tās vidējo vērtību".
    2. Atlikumi: "Atlikumu diagramma pret x, izkliedēta ap nulles līniju".

    Atlikumu analīze ir kritiska, lai pārbaudītu lineārā modeļa pieņēmumus. Ja atlikumu diagrammā punkti ir izkliedēti nejauši ap nulles līniju, lineārais modelis ir piemērots. Ja diagrammā redzama izteikta līkne vai vēdekļveida izkliede (heteroskedastitāte), lineāras sakarības pieņēmums var būt kļūdains.

    Prognozes un ticamības intervāli

    Kalkulators ļauj prognozēt y vērtības pie konkrētiem x punktiem, piedāvājot divu veidu intervālus:

    • Vidējais ‹level›%: Ticamības intervāls, kas raksturo vidējās y vērtības atrašanās vietu pie dotā x. Tas ietver tikai pašas taisnes novērtējuma nenoteiktību.
    • Individuālais ‹level›%: Prognozes intervāls vienam jaunam novērojumam. Tas ietver gan taisnes nenoteiktību, gan datu punktu izkliedi ap to, tādēļ šis intervāls vienmēr ir platāks.

    Ja prognozēšanai ievadītais x atrodas ārpus sākotnējo datu diapazona, kalkulators pievieno norādi "ārpus datiem" un brīdinājumu: "Atzīmētajās rindās tiek izmantots x, kas ir ārpus jūsu ievadītajām vērtībām, tāpēc taisne tiek pagarināta ārpus tā, ko rāda dati.".

    Datu ievades nosacījumi un ierobežojumi

    Kalkulators darbojas tieši lietotāja tīmekļa pārlūkprogrammā, un dati netiek augšupielādēti serveros. Tiek atbalstīti divi izkārtojumi:

    • Pāru rindas: Katrā rindā ievada x un tad y. Var kopēt datus tieši no izklājlapas; ja pirmā rinda satur tekstu, tā tiek uztverta kā galvene un izlaista.
    • Divi saraksti: Atsevišķi lauki "x vērtības (prognozētājs)" un "y vērtības (rezultatīvais rādītājs)".

    Ierobežojumi un kļūdu paziņojumi:

    • Minimālais apjoms ir 2 punkti, pretējā gadījumā parādās kļūda: "Ievadiet vismaz 2 punktus; viens punkts nedefinē taisni.".
    • Maksimālais apjoms ir 50 000 punktu (un 1 MB teksta), pārsniedzot parādās: "Saglabājiet datu apjomu zem ‹max› punktiem.".
    • Prognozēšanai var ievadīt līdz 50 vērtībām, pretējā gadījumā tiek parādīts: "Prognozējiet ne vairāk kā ‹max› vērtības vienlaicīgi.".
    • Ja sarakstu garumi nesakrīt: "Ir ‹countX› x vērtības un ‹countY› y vērtības — sarakstiem jābūt vienāda garuma.".

    Matemātiskie izņēmuma gadījumi:

    • Tieši divi punkti: "Divi punkti precīzi fiksē taisni, tāpēc nekas nepaliek pāri, lai novērtētu nenoteiktību.".
    • Ideāla sakritība: "Punkti atrodas tieši uz taisnes, tāpēc nav atlikumu izkliedes un nevar novērtēt ne intervālu, ne p-vērtību.".
    • Konstants Y: "Katra y vērtība ir vienāda, tāpēc taisne ir horizontāla un r, R² un nozīmības tests nav definēti.".
    • Vertikāla taisne (konstants X): "Katra x vērtība ir vienāda, tāpēc taisne būtu vertikāla un slīpuma aprēķinā notiktu dalīšana ar nulli.".

    Biežāk uzdotie jautājumi (FAQ)

    Kāpēc prognozēm tiek nodrošināti divi intervāli? Tie atbild uz dažādiem jautājumiem. Vidējais intervāls jautā, kur atrodas vidējā y vērtība visiem novērojumiem pie konkrētā x, tāpēc tiek ņemta vērā tikai pašas taisnes nenoteiktība. Individuālais intervāls jautā, kur nonāks viens jauns novērojums, kas pieskaita punktu izkliedi ap taisni — šis papildu loceklis ir iemesls, kāpēc tas vienmēr ir platāks no abiem. Abi intervāli paplašinās, x attālinoties no jūsu datu vidusdaļas.

    Vai maza p-vērtība nozīmē, ka x izraisa y? Nē. p-vērtība atbild tikai uz vienu šauru jautājumu: ja patiesais slīpums būtu 0, cik bieži šāda izmēra izlase dotu slīpumu, kas ir vismaz tik tālu no 0? Maza vērtība vienkārši padara skaidrojumu “nav nekādas saistības” par neērtu, nevis ko vairāk. Cēloņsakarībai ir nepieciešams pētījuma dizains — trešais faktors, kas ietekmē abas kolonnas, vai izlase, kas netika ievākta neatkarīgi, tikpat viegli rasa mazas p-vērtības.

    Ko tieši man izsaka R²? R² ir y augšupvērstās un lejupvērstās kustības daļa, ko izskaidro taisne: 0,96 nozīmē, ka 96% no tās sakrīt ar x, bet 4% nesakrīt. Tas neko nepasaka par to, vai taisne bija pareizā forma — arī izteikta līkne joprojām var uzrādīt augstu rezultātu —, tāpēc vērtējiet to kopā ar atlikumu diagrammu. Korelācija r ir kvadrātsakne no R², kas saglabā slīpuma zīmi, tāpēc lejupvērstai taisnei r ir negatīvs.

    Vai ir nozīme tam, kurā kolonnā es ievadu x? Jā. Mazāko kvadrātu metode minimizē vertikālās starpības, tāpēc tā uzskata y par skaidrojamo lielumu un x par skaidrojošo lielumu. Apmainiet tos vietām, un jūs iegūsiet citu slīpumu un citu krustpunktu — tikai r un R² paliek nemainīgi. Ievietojiet mainīgo, kuru vēlaties prognozēt, y kolonnā; ja kolonnas tika ievadītas nepareizā secībā, apmaiņas poga tās pārrakstīs turpat uz vietas.