Calculator de regresie liniară

Ajustați o linie a celor mai mici pătrate pentru date pereche și citiți panta, R², valoarea p, intervalele de încredere, reziduurile și predicțiile într-un singur loc.

Date

Puneți mai întâi x, apoi y. Două coloane copiate dintr-un tabel se lipesc direct, inclusiv rândul de antet. Folosiți virgula pentru zecimale, de exemplu 12,5.
Opțional. Până la 50 valori, separate prin spații.

Linie de regresie

Linia celor mai mici pătrate

Coeficienți

TermenEstimareEroare std.tpInterval {level}%

Variație explicată

SursădfSuma pătratelorMedie pătraticăFp

Ajustare și reziduuri

Predicții

Intervalul mediei acoperă valoarea medie y la acel x. Intervalul individual acoperă o nouă observație, deci este întotdeauna mai larg.

xŷMedie {level}%Individual {level}%

Punct cu punct

xyŷy − ŷ

Formulă și înlocuire

b = Σ(x − x̄)(y − ȳ) ÷ Σ(x − x̄)²

a = ȳ − b·x̄

SSE = Σ(y − ŷ)²

SST = Σ(y − ȳ)²

R² = 1 − SSE ÷ SST

s = √(SSE ÷ (n − 2))

SE(b) = s ÷ √Σ(x − x̄)²

    Punctele de date și toate statisticile dumneavoastră rămân în acest browser și nu sunt încărcate niciodată.

    Întrebări frecvente

    Ce îmi spune de fapt R²?

    R² este ponderea mișcării ascendente și descendente a lui y pe care o explică linia: 0,96 înseamnă că 96% din aceasta se aliniază cu x și 4% nu. Nu spune nimic despre faptul dacă o linie dreaptă a fost forma corectă — o curbă clară poate obține în continuare un scor ridicat — așa că citiți-l alături de graficul reziduurilor. Corelația r este rădăcina pătrată a lui R² purtând semnul pantei, motiv pentru care r este negativ pentru o linie descendentă.

    O valoare p mică înseamnă că x îl cauzează pe y?

    Nu. Valoarea p răspunde doar la o singură întrebare îngustă: dacă panta reală ar fi 0, cât de des ar produce un eșantion de această dimensiune o pantă cel puțin la fel de îndepărtată de 0? O valoare mică face ca explicația „nicio relație” să fie una incomodă, nimic mai mult. Cauzalitatea are nevoie de designul studiului în spate — un al treilea factor care deplasează ambele coloane, sau un eșantion care nu a fost colectat în mod independent, produce valori p mici la fel de ușor.

    De ce predicțiile vin cu două intervale?

    Acestea răspund la întrebări diferite. Intervalul mediei întreabă unde se află valoarea medie y pentru toți subiecții la acel x, astfel încât contează doar incertitudinea din linia însăși. Intervalul individual întreabă unde va cădea o nouă observație, ceea ce adaugă împrăștierea punctelor în jurul liniei — acest termen suplimentar este motivul pentru care este întotdeauna cel mai larg dintre cele două. Ambele se lărgesc pe măsură ce x se îndepărtează de mijlocul datelor dumneavoastră.

    Contează în ce coloană pun x?

    Da. Metoda celor mai mici pătrate minimizează diferențele verticale, așa că tratează y ca fiind lucrul explicat și x ca fiind lucrul care explică. Inversați-le și veți obține o pantă diferită și o intersecție diferită — doar r și R² rămân neschimbate. Puneți variabila pe care doriți să o preziceți în y; dacă coloanele au fost introduse invers, butonul de inversare le rescrie pe loc.

    Fundamentele matematice ale regresiei liniare prin metoda celor mai mici pătrate

    Metoda celor mai mici pătrate (Ordinary Least Squares - OLS) reprezintă standardul matematic pentru determinarea liniei drepte care descrie cel mai bine relația dintre o variabilă independentă (predictorul x) și o variabilă dependentă (răspunsul y). Această metodă minimizează suma pătratelor diferențelor verticale dintre punctele de date observate și linia de regresie rezultată.

    Pentru a asigura o precizie numerică ridicată, calculele sunt efectuate în două etape utilizând sume compensate, prevenind pierderea preciziei în cazul unor diferențe mari de mărime între valori. Etapele matematice pornesc de la calcularea mediilor și a dispersiei:

    • Medii: x̄ = Σxᵢ ÷ n și ȳ = Σyᵢ ÷ n
    • Dispersie și co-mișcare: Sxx = Σ(xᵢ − x̄)² și Sxy = Σ(xᵢ − x̄)(yᵢ − ȳ)

    Pe baza acestor indicatori, se determină coeficienții liniei de regresie:

    • Panta b: b = Sxy ÷ Sxx
    • Intersecția a: a = ȳ − b·x̄

    Ecuația finală a liniei de regresie este ŷ = a + b·x, unde ŷ reprezintă valoarea estimată a lui y.

    Interpretarea coeficienților de regresie și a indicatorilor de ajustare

    Fiecare valoare derivată din modelul de regresie oferă informații specifice despre structura datelor analizate:

    • Panta b: Indică rata de schimbare a variabilei dependente. În termeni practici, „În medie, y se modifică cu ‹slope› pentru fiecare creștere cu 1 a lui x.”.
    • Intersecția a: Reprezintă valoarea de pornire a modelului pe axa verticală: „Acolo unde x este 0, linia se află la y = ‹intercept›.”.
    • Corelația r: Măsoară direcția și forța legăturii liniare, fiind calculată ca r = Sxy ÷ √(Sxx·Syy). Semnul său coincide întotdeauna cu cel al pantei.
    • R² (Coeficientul de determinare): Reprezintă ponderea variației totale din y care este explicată de modelul liniar, definit ca R² = SSR ÷ SST.
    • R² ajustat: Corectează valoarea R² în funcție de numărul de grade de libertate, fiind calculat ca 1 − (1 − R²)(n − 1) ÷ (n − 2).
    • Împrăștierea reziduurilor s: Reprezintă abaterea standard a erorilor din model, s = √(SSE ÷ (n − 2)), oferind o măsură a dispersiei punctelor în jurul liniei ajustate.

    Testarea ipotezelor și semnificația statistică

    Pentru a evalua dacă relația liniară observată este semnificativă din punct de vedere statistic și nu a apărut din întâmplare, se efectuează un test t pe panta b. Ipoteza nulă presupune că panta reală este egală cu zero (lipsa unei relații liniare).

    Eroarea standard a pantei se calculează ca SE(b) = s ÷ √Sxx. Valoarea testului statistic este t = b ÷ SE(b), testată bidirecțional pe n − 2 grade de libertate. Valoarea p asociată este determinată prin funcția beta incompletă regularizată. În cazul regresiei liniare simple cu un singur predictor, testul F din tabelul de analiză a variației (ANOVA) este echivalent cu pătratul testului t al pantei, ambele raportând exact aceeași valoare p.

    Tabelul ANOVA împarte variația totală în:

    1. Explicat de linie (Regresie): Suma pătratelor datorată modelului (SSR).
    2. Rămas (Reziduuri): Suma pătratelor erorilor (SSE).
    3. Total: Suma totală a pătratelor (SST).

    Analiza reziduurilor și importanța verificării grafice

    O analiză statistică riguroasă necesită verificarea ipotezelor fundamentale ale regresiei liniare. Graficele generate oferă două perspective vizuale esențiale:

    • Linie ajustată: O diagramă de împrăștiere a punctelor cu linia celor mai mici pătrate și banda din jurul mediei sale. Aceasta permite observarea directă a distribuției datelor reale în raport cu modelul liniar.
    • Reziduuri: Reprezentarea grafică a erorilor (y − ŷ) în funcție de x, dispersate în jurul liniei zero.

    O linie dreaptă este rezumatul corect doar atunci când punctele o urmează cu adevărat. Utilizatorul trebuie să verifice graficul reziduurilor pentru a detecta eventuale abateri de la liniaritate (cum ar fi modele curbe) sau heteroscedasticitate (erori care se lărgesc sub formă de evantai).

    Intervalele de încredere și intervalele de predicție

    Atunci când se estimează valori viitoare ale lui y pentru o anumită coordonată x₀, modelul calculează două tipuri de intervale, ambele devenind mai largi pe măsură ce x₀ se îndepărtează de media x̄:

    1. Intervalul de încredere pentru media răspunsului: Estimează locația valorii medii a lui y pentru un x₀ dat. Eroarea sa standard este s · √(1÷n + (x₀ − x̄)² ÷ Sxx).
    2. Intervalul de predicție individual: Estimează intervalul în care va cădea o singură observație viitoare. Eroarea sa standard este s · √(1 + 1÷n + (x₀ − x̄)² ÷ Sxx). Deoarece include și variația individuală a punctelor în jurul liniei (reprezentată de acel 1 suplimentar sub radical), intervalul individual este întotdeauna mai larg decât intervalul mediei.

    Reguli de introducere a datelor și gestionarea erorilor

    Calculatorul acceptă introducerea datelor în două formate: „Rânduri pereche” (un x și y pe rând) sau „Două liste” (valori x și y separate). Procesarea datelor respectă reguli stricte pentru a preveni erorile de calcul:

    • Separatori zecimali: Sunt acceptate atât punctul (de exemplu, 12.5), cât și virgula (de exemplu, 12,5). În cazul utilizării punctului ca separator zecimal, listele pot fi separate prin spații, virgule sau linii noi. În cazul utilizării virgulei, listele trebuie separate prin spații, punct și virgulă sau linii noi.
    • Antete de tabel: Dacă primul rând introdus în formatul de rânduri pereche conține caractere non-numerice, acesta este tratat automat ca antet de tabel și este ignorat, permițând copierea directă din foi de calcul.
    • Limite de date: Sunt acceptate între 2 și 50.000 de puncte de date, cu o limită de 1 MB de text introdus. Se pot efectua maximum 50 de predicții simultane.

    Mesaje de eroare și cazuri limită

    • Fiecare x este identic: „Fiecare x este identic, deci linia ar fi verticală, iar panta ar împărți la zero.”.
    • Fiecare y este identic: „Fiecare y este identic, deci linia este plată, iar r, R² și testul de semnificație sunt nedefinite.”.
    • Exact două puncte: „Două puncte fixează linia exact, deci nu mai rămâne nimic din care să se estimeze incertitudinea.”.
    • Potrivire perfectă: „Punctele se află exact pe linie, deci nu există dispersie a reziduurilor și nu se poate estima niciun interval sau valoare p.”.
    • Date insuficiente: „Introduceți cel puțin 2 puncte; un singur punct nu definește o linie.”.
    • Lungimi inegale ale listelor: „Există ‹countX› valori x și ‹countY› valori y — listele trebuie să aibă aceeași lungime.”.
    • Valori non-numerice: „„‹token›” nu este un număr (rândul ‹position›).” sau „„‹token›” nu este un număr (valoarea ‹position›).”.
    • Depășire numerică: „O valoare sau un rezultat intermediar depășește intervalul de numere acceptat.”.

    Confidențialitatea datelor și procesarea locală

    Toate punctele de date introduse și statisticile calculate sunt procesate în întregime în browserul web al utilizatorului. Datele nu sunt încărcate pe servere externe, asigurând confidențialitatea analizelor efectuate.

    Întrebări frecvente (FAQ)

    Contează în ce coloană pun x?

    Da. Metoda celor mai mici pătrate minimizează diferențele verticale, așa că tratează y ca fiind lucrul explicat și x ca fiind lucrul care explică. Inversați-le și veți obține o pantă diferită și o intersecție diferită — doar r și R² rămân neschimbate. Puneți variabila pe care doriți să o preziceți în y; dacă coloanele au fost introduse invers, butonul de inversare le rescrie pe loc.

    Ce îmi spune de fapt R²?

    R² este ponderea mișcării ascendente și descendente a lui y pe care o explică linia: 0,96 înseamnă că 96% din aceasta se aliniază cu x și 4% nu. Nu spune nimic despre faptul dacă o linie dreaptă a fost forma corectă — o curbă clară poate obține în continuare un scor ridicat — așa că citiți-l alături de graficul reziduurilor. Corelația r este rădăcina pătrată a lui R² purtând semnul pantei, motiv pentru care r este negativ pentru o linie descendentă.

    De ce predicțiile vin cu două intervale?

    Acestea răspund la întrebări diferite. Intervalul mediei întreabă unde se află valoarea medie y pentru toți subiecții la acel x, astfel încât contează doar incertitudinea din linia însăși. Intervalul individual întreabă unde va cădea o nouă observație, ceea ce adaugă împrăștierea punctelor în jurul liniei — acest termen suplimentar este motivul pentru care este întotdeauna cel mai larg dintre cele două. Ambele se lărgesc pe măsură ce x se îndepărtează de mijlocul datelor dumneavoastră.

    O valoare p mică înseamnă că x îl cauzează pe y?

    Nu. Valoarea p răspunde doar la o singură întrebare îngustă: dacă panta reală ar fi 0, cât de des ar produce un eșantion de această dimensiune o pantă cel puțin la fel de îndepărtată de 0? O valoare mică face ca explicația „nicio relație” să fie una incomodă, nimic mai mult. Cauzalitatea are nevoie de designul studiului în spate — un al treilea factor care deplasează ambele coloane, sau un eșantion care nu a fost colectat în mod independent, produce valori p mici la fel de ușor.