Ang Pamamaraang Least-Squares para sa Pag-akma ng Linya
Ang linear regression ay isang pangunahing pamamaraan sa istatistika na naghahanap ng pinakamahusay na tuwid na linya upang ilarawan ang relasyon sa pagitan ng dalawang variable. Ang "Kalkulador ng Linear Regression" ay gumagamit ng ordinary least squares (OLS) upang i-fit ang isang linya sa magkapares na data points. Sa pamamaraang ito, ang pinakamahusay na linya ay ang nagpapaliit sa kabuuan ng mga squared residual—ang mga patayong distansya sa pagitan ng mga aktwal na y value at ng mga tinantyang value (ŷ) sa linya.
Upang matiyak ang katumpakan ng kalkulasyon kahit sa malalaking dataset, ang tool ay gumagamit ng compensated summation sa dalawang magkahiwalay na pass. Iniiwasan nito ang pagkawala ng katumpakan kapag ang mga magnitude ng data ay may malaking pagkakaiba. Ang mga pangunahing sum na kinukuha ay:
- Sxx = Σ(xᵢ − x̄)²
- Syy = Σ(yᵢ − ȳ)²
- Sxy = Σ(xᵢ − x̄)(yᵢ − ȳ)
Mula sa mga sum na ito, kinakalkula ang slope (b) at ang intercept (a). Ang slope ay b = Sxy ÷ Sxx, at ang intercept naman ay a = ȳ − b·x̄. Ang kalkulasyong ito ay nangangailangan ng hindi bababa sa 2 points upang makabuo ng linya. Kung eksaktong dalawang puntos lamang ang ibinigay, ang linya ay magiging eksakto at ang tool ay magpapakita ng status message na: "Eksaktong itinatakda ng dalawang point ang linya, kaya walang natitira upang matantya ang kawalan ng katiyakan.".
Pag-unawa sa mga Coefficient ng Regression
Ang bawat kalkulasyon ay naglalabas ng buod ng linya ng regression na naglalaman ng mga sumusunod na interpretasyon:
- Slope b: Ipinapakita nito ang direksyon at bilis ng pagbabago ng y. Sa interface, inilalarawan ito bilang: "Sa average, nagbabago ang y nang
‹slope›para sa bawat 1 karagdagang x.". - Intercept a: Ito ang punto kung saan tinatawid ng linya ang y-axis. Inilalarawan ito bilang: "Kung saan ang x ay 0, ang linya ay matatagpuan sa y =
‹intercept›.".
Ang talahanayan ng "Mga coefficient" ay nagpapakita ng mga hilera para sa "Slope b" at "Intercept a" kasama ang kanilang "Tantya", "Std. error", "t", "p", at ang "Agwat na ‹level›%". Ang standard error ng slope ay kinakalkula bilang SE(b) = s ÷ √Sxx, habang ang para sa intercept ay SE(a) = s · √(1÷n + x̄² ÷ Sxx). Ang t-value ay ang ratio ng tantya sa standard error nito, na sinusuri gamit ang two-sided test sa n − 2 degrees of freedom. Ang p-value ay nagmumula sa regularized incomplete beta function.
Pagsusuri ng Korelasyon at R²
Upang masukat kung gaano kaayos naipapaliwanag ng linya ang variation ng data, ginagamit ang mga sumusunod na istatistika:
- Korelasyon r: Ang lakas at direksyon ng linear na relasyon. Ito ay may halagang mula -1 hanggang 1.
- R² (Coefficient of Determination): Ang bahagi ng kabuuang variation sa y na ipinapaliwanag ng regression line. Kinakalkula ito bilang R² = SSR ÷ SST, kung saan ang SSR ay ang sum of squares ng regression at ang SST ay ang kabuuang sum of squares.
- Inayos na R²: Isang bersyon ng R² na isinasaayos batay sa bilang ng mga predictor at sample size, gamit ang pormulang 1 − (1 − R²)(n − 1) ÷ (n − 2).
Kung ang lahat ng points ay perpektong nakalinya, walang matitirang pagkakaiba. Sa ganitong sitwasyon, ipapakita ng tool ang: "Eksaktong nakaupo ang mga point sa linya, kaya walang residual spread at walang agwat o p-value ang maaaring matantya.". Kung ang lahat naman ng y value ay magkakapareho, ang linya ay magiging patag at ipapakita ang: "Magkakapareho ang bawat y, kaya patag ang linya at hindi matukoy ang r, R² at ang pagsusuri sa kabuluhan.".
Pagsusuri ng Variance (ANOVA) at Mga residual
Ang talahanayan ng "Naipaliwanag na variance" (ANOVA) ay naghahati-hati sa pinagmulan ng pagkakaiba-iba sa data. Naglalaman ito ng mga kolum para sa "Pinagmulan", "df", "Sum ng mga square", "Mean square", "F", at "p". Ang mga hilera ay nahahati sa:
- "Naipaliwanag ng linya" (Regression)
- "Natira" (Residual)
- "Kabuuan" (Total)
Dahil mayroon lamang isang predictor, ang kabuuang F-statistic ay katumbas ng square ng t-statistic ng slope, kaya pareho silang nagbibigay ng magkaparehong p-value.
Ang pagsusuri sa mga residual (y − ŷ) ay mahalaga upang matiyak kung angkop ang linear model. Nagbibigay ang tool ng dalawang tsart sa ilalim ng "Fit at mga residual":
- "Inakmang linya": Isang "Scatter plot ng mga point kasama ang least-squares line at ang band sa paligid ng mean nito".
- "Mga residual": Isang tsart ng "Mga residual na naka-plot laban sa x, na nakakalat sa paligid ng zero na linya".
Ang mga legend ng tsart ay naglalaman ng "mga point", "inakmang linya", "‹level›% na band para sa mean", at "zero na linya".
Paggawa ng mga Prediction at mga Agwat
Maaari ding maglagay ng mga partikular na x value sa "Hulaan ang y sa x" upang makalkula ang mga tinantyang ŷ. Ang talahanayan ng "Mga prediction" ay nagpapakita ng mga kolum para sa "x", "ŷ", "Mean ‹level›%", at "Indibidwal ‹level›%".
May pagkakaiba ang dalawang agwat na ito:
- Mean Interval: Sinasaklaw ang average na y sa partikular na x na iyon gamit ang standard error na s · √(1÷n + (x₀ − x̄)² ÷ Sxx).
- Indibidwal na Agwat: Sinasaklaw ang isang bagong solong obserbasyon gamit ang standard error na s · √(1 + 1÷n + (x₀ − x̄)² ÷ Sxx). Dahil isinasama nito ang kalat ng mga indibidwal na puntos, palagi itong mas malawak kaysa sa mean interval.
Kung ang inilagay na x para sa prediction ay lumampas sa saklaw ng orihinal na data, lalabas ang label na "nasa labas ng data" kasama ang tala na: "Ang mga minarkahang hilera ay gumagamit ng x na lampas sa mga inilagay mong value, kaya ang linya ay pinapahaba lampas sa ipinapakita ng data.".
Mga Panuntunan sa Paggamit at Pagproseso ng Data
Ang tool ay nagbibigay-daan sa mabilis na pag-input ng data gamit ang dalawang layout: "Magkapares na hilera" o "Dalawang listahan".
- Magkapares na hilera: Angkop para sa direktang pag-paste mula sa mga spreadsheet. Kung ang unang hilera ay naglalaman ng hindi numerong teksto, awtomatiko itong itinuturing na header at nilalagpasan.
- Dalawang listahan: Nangangailangan ng magkahiwalay na listahan para sa "mga x value (predictor)" at "mga y value (response)". Dapat ay magkapareho ang haba ng dalawang listahan.
Depende sa napiling decimal separator, may sinusunod na panuntunan sa paghihiwalay ng mga numero:
- Kapag tuldok ang decimal separator (hal.
12.5), ang mga separator sa listahan ay space, kuwit, o bagong linya. - Kapag kuwit ang decimal separator (hal.
12,5), ang mga separator ay space, semicolon, o bagong linya.
Ang lahat ng pagproseso at kalkulasyon ay lokal na nangyayari sa loob ng web browser ng user. Ang iyong mga data point at bawat istatistika ay nananatili sa browser na ito at hindi kailanman ia-upload sa anumang external na server.
Mga Madalas Itanong (FAQ)
May pagkakaiba ba kung aling kolum ang ilalagay ko sa x?
Oo. Pinaliliit ng least squares ang mga patayong agwat, kaya itinuturing nito ang y bilang ang bagay na ipinapaliwanag at ang x bilang ang bagay na nagpapaliwanag. Pagpalitin ang mga ito at makakakuha ka ng ibang slope at ibang intercept — tanging r at R² ang mananatiling pareho. Ilagay ang variable na gusto mong hulaan sa y; kung nagkapalit ang pagkakalagay ng mga kolum, muling isusulat ng swap button ang mga ito sa mismong kinalalagyan nito.
Ano ba talaga ang sinasabi sa akin ng R²?
Ang R² ay ang bahagi ng pataas at pababang paggalaw sa y na isinasaalang-alang ng linya: ang 0.96 ay nangangahulugang 96% nito ay nakahanay sa x at 4% ay hindi. Wala itong sinasabi tungkol sa kung ang isang tuwid na linya ay ang tamang hugis — ang isang malinaw na kurba ay maaari pa lingering makakuha ng mataas na marka — kaya basahin ito kasabay ng residual plot. Ang correlation r ay ang square root ng R² na nagdadala ng sign ng slope, kung kaya't negatibo ang r para sa pababang linya.
Bakit may kasamang dalawang agwat ang mga prediction?
Sinasagot ng mga ito ang magkaibang tanong. Tinatanong ng mean interval kung saan matatagpuan ang average na y para sa lahat sa x na iyon, kaya ang kawalan ng katiyakan sa mismong linya lamang ang binibilang. Tinatanong naman ng indibidwal na agwat kung saan papatak ang isang bagong obserbasyon, na nagdaragdag sa kalat ng mga point sa paligid ng linya — ang karagdagang terminong iyon ang dahilan kung bakit palagi itong mas malawak sa dalawa. Parehong lumalawak ang mga ito habang lumalayo ang x mula sa gitna ng iyong data.
Nangangahulugan ba ang maliit na p-value na ang x ang sanhi ng y?
Hindi. Sinasagot lamang ng p-value ang isang makitid na tanong: kung ang totoong slope ay 0, gaano kadalas makakagawa ang isang sample na may ganitong laki ng slope na kahit papaano ay ganito kalayo sa 0? Ang isang maliit na value ay ginagawang isang awkward na paliwanag ang “walang relasyon sa pangkalahatan”, wala nang iba pa. Ang sanhi ay nangangailangan ng disenyo ng pag-aaral sa likod nito — ang ikatlong salik na nagpapagalaw sa parehong kolum, o isang sample na hindi nakolekta nang hiwalay, ay madali ring makakagawa ng maliliit na p-value.