Kalkulator Regresi Linear

Suaikan garis kuasa dua terkecil pada data berpasangan dan baca kecerunan, R², nilai-p, selang keyakinan, sisaan serta ramalannya di satu tempat.

Data

Letakkan x dahulu, kemudian y. Dua lajur yang disalin daripada hamparan boleh ditampal terus, termasuk baris pengepala. Gunakan titik untuk perpuluhan, seperti 12.5.
Pilihan. Sehingga 50 nilai, dipisahkan dengan ruang.

Garis regresi

Garis kuasa dua terkecil

Pekali

SebutanAnggaranRalat piawaitpSelang {level}%

Varians dijelaskan

SumberdfHasil tambah kuasa duaKuasa dua minFp

Penyuaian dan sisaan

Ramalan

Selang min merangkumi purata y pada x tersebut. Selang individu merangkumi satu pemerhatian baharu, jadi ia sentiasa lebih lebar.

xŷMin {level}%Individu {level}%

Titik demi titik

xyŷy − ŷ

Formula dan penggantian

b = Σ(x − x̄)(y − ȳ) ÷ Σ(x − x̄)²

a = ȳ − b·x̄

SSE = Σ(y − ŷ)²

SST = Σ(y − ȳ)²

R² = 1 − SSE ÷ SST

s = √(SSE ÷ (n − 2))

SE(b) = s ÷ √Σ(x − x̄)²

    Titik data dan setiap statistik anda kekal dalam penyemak imbas ini dan tidak akan sekali-kali dimuat naik.

    Soalan Lazim

    Apakah yang sebenarnya diberitahu oleh R² kepada saya?

    R² ialah bahagian pergerakan naik turun dalam y yang dijelaskan oleh garis tersebut: 0.96 bermakna 96% daripadanya sejajar dengan x dan 4% lagi tidak. Ia tidak menyatakan sama ada garis lurus ialah bentuk yang betul — lengkung yang jelas masih boleh mendapat skor yang tinggi — jadi bacalah ia bersama-sama dengan plot sisaan. Korelasi r ialah punca kuasa dua bagi R² yang membawa tanda kecerunan, itulah sebabnya r adalah negatif untuk garis yang menurun.

    Adakah nilai-p yang kecil bermakna x menyebabkan y?

    Tidak. Nilai-p hanya menjawab satu soalan sempit: jika kecerunan sebenar ialah 0, seberapa kerapkah sampel bersaiz ini akan menghasilkan kecerunan sekurang-kurangnya sejauh ini dari 0? Nilai yang kecil menjadikan “tiada hubungan langsung” sebagai penjelasan yang janggal, tidak lebih daripada itu. Hubungan sebab akibat memerlukan reka bentuk kajian di sebaliknya — faktor ketiga yang menggerakkan kedua-dua lajur, atau sampel yang tidak dikumpul secara bebas, boleh menghasilkan nilai-p yang kecil dengan mudah juga.

    Mengapakah ramalan disertakan dengan dua selang?

    Kedua-duanya menjawab soalan yang berbeza. Selang min bertanya di mana purata y berada untuk semua orang pada x tersebut, jadi hanya ketidakpastian dalam garis itu sendiri yang diambil kira. Selang individu pula bertanya di mana satu pemerhatian baharu akan mendarat, yang menambah serakan titik di sekitar garis — sebutan tambahan itulah sebabnya ia sentiasa lebih lebar antara kedua-duanya. Kedua-dua selang akan melebar apabila x menjauhi bahagian tengah data anda.

    Adakah penting lajur mana yang saya letakkan dalam x?

    Ya. Kuasa dua terkecil meminimumkan jurang menegak, jadi ia menganggap y sebagai perkara yang dijelaskan dan x sebagai perkara yang menjelaskan. Tukar kedudukannya dan anda akan mendapat kecerunan serta pintasan yang berbeza — hanya r dan R² yang kekal sama. Letakkan pemboleh ubah yang ingin anda ramalkan dalam y; jika lajur dimasukkan dalam kedudukan yang salah, butang tukar kedudukan akan menulis semula lajur tersebut di tempatnya.

    Kaedah Kuasa Dua Terkecil dalam Regresi Linear

    Analisis regresi linear ringkas bertujuan untuk mencari garis lurus terbaik yang menerangkan hubungan antara pemboleh ubah peramal (x) dan pemboleh ubah respons (y). Kaedah yang paling kerap digunakan untuk tujuan ini ialah kaedah kuasa dua terkecil biasa (Ordinary Least Squares atau OLS). Pendekatan matematik ini meminimumkan hasil tambah kuasa dua sisaan, iaitu jarak menegak antara titik data sebenar dengan garis lurus yang disuaikan.

    Kalkulator Regresi Linear menggunakan algoritma pengiraan dua fasa dengan penjumlahan berkompensasi (compensated summation) berdasarkan standard NIST/SEMATECH. Pendekatan ini memastikan kejituan angka yang tinggi dikekalkan walaupun data mengandungi nilai yang sangat besar atau sangat kecil. Pengiraan bermula dengan menentukan purata bagi setiap pemboleh ubah, diikuti dengan pengiraan jumlah sisihan kuasa dua:

    • Sxx = Σ(xᵢ − x̄)²
    • Syy = Σ(yᵢ − ȳ)²
    • Sxy = Σ(xᵢ − x̄)(yᵢ − ȳ)

    Daripada nilai-nilai sebaran dan pergerakan bersama ini, kecerunan (b) dan pintasan-y (a) bagi garis regresi dihitung seperti berikut:

    • Kecerunan b = Sxy ÷ Sxx
    • Pintasan a = ȳ − b·x̄

    Garis lurus yang terhasil memberikan anggaran terbaik bagi hubungan linear dalam sampel data anda. Walau bagaimanapun, model ini sangat sensitif terhadap arah analisis. Oleh sebab kaedah kuasa dua terkecil meminimumkan ralat menegak (pada paksi y), menukar peranan x dan y akan menghasilkan persamaan garis yang berbeza. Tindakan "Tukar kedudukan x dan y" akan menulis semula data anda dengan lajur yang ditukar untuk menyesuaikan model baharu. Hanya nilai korelasi r dan pekali penentuan R² yang akan kekal sama selepas pertukaran tersebut.

    Mentafsir Pekali dan Keertian Statistik

    Persamaan garis regresi dinyatakan melalui dua komponen utama yang mempunyai makna praktikal yang nyata:

    1. Kecerunan b: Menunjukkan perubahan purata pada y bagi setiap peningkatan satu unit dalam x. Kenyataan output alat ini berbunyi: "Secara purata, y berubah sebanyak ‹slope› bagi setiap peningkatan 1 dalam x."
    2. Pintasan a: Menunjukkan nilai ramalan y apabila x bersamaan dengan sifar. Kenyataan output alat ini berbunyi: "Apabila x ialah 0, garis berada pada y = ‹intercept›."

    Untuk menilai kekuatan dan kebolehpercayaan model, beberapa statistik penting dihitung:

    • Korelasi r: Mengukur kekuatan dan arah hubungan linear antara dua pemboleh ubah.
    • R² (Pekali Penentuan): Menunjukkan bahagian variasi dalam y yang dapat dijelaskan oleh model linear. Nilainya diperoleh daripada nisbah hasil tambah kuasa dua regresi (SSR) dengan hasil tambah kuasa dua jumlah (SST).
    • R² Terlaras: Menyelaraskan nilai R² berdasarkan bilangan darjah kebebasan, yang berguna untuk menilai kecekapan model.
    • Sebaran sisaan s: Mengukur sisihan piawai ralat rawak di sekitar garis regresi.

    Jadual Pekali memaparkan anggaran parameter bersama dengan ralat piawai, statistik t, dan nilai-p untuk menguji hipotesis bahawa kecerunan sebenar adalah sifar. Bagi model regresi linear ringkas dengan satu peramal, nilai-p daripada ujian t bagi kecerunan adalah sama dengan nilai-p daripada analisis varians (ANOVA) dalam jadual Varians dijelaskan.

    Input, Had dan Pengendalian Ralat

    Alat ini menyokong kemasukan data melalui dua pilihan susun atur:

    • Baris berpasangan: Membolehkan anda menampal dua lajur terus dari hamparan (termasuk baris pengepala yang akan diabaikan secara automatik jika baris pertama mengandungi teks bukan angka).
    • Dua senarai: Memisahkan input untuk "nilai x (peramal)" dan "nilai y (respons)".

    Sistem menyokong pemisah perpuluhan titik (e.g., 12.5) atau koma (e.g., 12,5). Bergantung pada pilihan ini, peraturan pemisahan nilai adalah seperti berikut:

    • Bagi perpuluhan titik: Nilai dipisahkan dengan ruang, koma, atau baris baharu.
    • Bagi perpuluhan koma: Nilai dipisahkan dengan ruang, koma bertitik, atau baris baharu.

    Had Input dan Keadaan Sempadan

    • Had Data: Minimum 2 titik diperlukan. Had maksimum ialah 50,000 titik atau saiz teks tampalan 1 MB.
    • Had Ramalan: Maksimum 50 nilai x boleh dimasukkan untuk ramalan y pada satu-satu masa.
    • Dua titik sahaja: Jika tepat dua titik dimasukkan, garis akan disesuaikan secara sempurna tanpa ralat. Alat akan memaparkan mesej: "Dua titik menetapkan garis secara tepat, jadi tiada baki yang tinggal untuk menganggarkan ketidakpastian."
    • Penyuaian Sempurna: Jika semua titik berada tepat pada garis lurus, alat memaparkan: "Titik-titik berada tepat pada garis, jadi tiada sebaran sisaan dan tiada selang atau nilai-p yang dapat dianggarkan."
    • Nilai Y Malar: Jika semua nilai y adalah sama, garis menjadi rata sepenuhnya. Alat memaparkan: "Setiap y adalah sama, jadi garis adalah rata dan r, R² serta ujian keertian tidak ditakrifkan."
    • Nilai X Malar: Jika semua nilai x adalah sama, garis menjadi menegak sepenuhnya. Pengiraan dihentikan dengan ralat: "Setiap x adalah sama, jadi garis akan menjadi menegak dan kecerunan membahagi dengan sifar."

    Mesej Ralat Lain

    • ‹token›” bukan nombor (baris ‹position›).
    • ‹token›” bukan nombor (nilai ‹position›).
    • Ramalan hanya menerima nombor; “‹token›” bukan nombor.
    • Baris ‹position› memerlukan tepat dua nombor: x kemudian y.
    • Terdapat ‹countX› nilai x dan ‹countY› nilai y — senarai mestilah sama panjang.
    • Masukkan sekurang-kurangnya 2 titik; satu titik tidak menentukan garis.
    • Pastikan data di bawah 50,000 titik.
    • Ramalkan paling banyak 50 nilai pada satu-satu masa.
    • Nilai atau keputusan perantaraan melebihi julat nombor yang disokong.

    Langkah Penggantian Formula

    Kalkulator ini memaparkan langkah demi langkah matematik yang digunakan untuk menerbitkan keputusan anda dalam bahagian Formula dan penggantian:

    • Purata: x̄ = ‹sumX› ÷ ‹n› = ‹meanX› dan ȳ = ‹sumY› ÷ ‹n› = ‹meanY›
    • Sebaran dan pergerakan bersama: Sxx = ‹sxx› dan Sxy = ‹sxy›
    • Kecerunan: b = Sxy ÷ Sxx = ‹sxy› ÷ ‹sxx› = ‹slope›
    • Pintasan: a = ȳ − b·x̄ = ‹meanY› − (‹slope›‹meanX› = ‹intercept›
    • Bahagian variasi yang dijelaskan: R² = SSR ÷ SST = ‹ssr› ÷ ‹sst› = ‹r2›
    • Sebaran sisaan: s = √(SSE ÷ (n − 2)) = √(‹sse› ÷ ‹df›) = ‹s›
    • Ralat piawai bagi kecerunan: SE(b) = s ÷ √Sxx = ‹s› ÷ √‹sxx› = ‹se›
    • Ujian keertian: t = b ÷ SE(b) = ‹slope› ÷ ‹se› = ‹t›, maka p = ‹p› pada ‹df› darjah kebebasan.

    Kepentingan Analisis Sisaan dan Selang Ramalan

    Penilaian model regresi tidak lengkap tanpa memeriksa sisaan (residual), iaitu perbezaan antara nilai sebenar y dengan nilai ramalan ŷ (y − ŷ). Alat ini menjana dua plot visual:

    1. Garis penyuaian: Plot serakan bagi titik-titik dengan garis kuasa dua terkecil dan jalur di sekitar minnya.
    2. Sisaan: Sisaan diplot berbanding x, tersebar di sekitar garis sifar.

    Pemeriksaan visual pada plot sisaan sangat penting untuk memastikan anda tidak terlepas pandang corak bukan linear atau heteroskedastisiti (keadaan di mana sebaran sisaan tidak malar merentasi nilai x).

    Apabila membuat ramalan untuk nilai x baharu, alat ini menyediakan dua jenis selang keyakinan:

    • Selang Min: Mengukur ketidakpastian di sekitar nilai purata y yang dijangkakan untuk nilai x tersebut.
    • Selang Individu: Mengukur ketidakpastian bagi satu pemerhatian baharu pada masa hadapan. Selang individu sentiasa lebih lebar kerana ia mengambil kira ralat anggaran garis serta variasi rawak titik data di sekitar garis tersebut.

    Jika anda memasukkan nilai x ramalan yang berada di luar julat data asal, sistem akan memaparkan label "di luar data" berserta nota: "Baris yang ditandakan menggunakan x di luar nilai yang anda masukkan, jadi garis tersebut dilanjutkan melebihi apa yang ditunjukkan oleh data."

    Privasi Data dan Pemprosesan

    Semua pengiraan dilakukan secara langsung di dalam pelayar web anda. Titik data dan setiap statistik anda kekal dalam penyemak imbas ini dan tidak akan sekali-kali dimuat naik ke mana-mana pelayan luaran. Keputusan akan dikira semula secara automatik semasa anda menaip tanpa memerlukan butang hantar.


    Soalan Lazim (FAQ)

    Adakah penting lajur mana yang saya letakkan dalam x?

    Ya. Kuasa dua terkecil meminimumkan jurang menegak, jadi ia menganggap y sebagai perkara yang dijelaskan dan x sebagai perkara yang menjelaskan. Tukar kedudukannya dan anda akan mendapat kecerunan serta pintasan yang berbeza — hanya r dan R² yang kekal sama. Letakkan pemboleh ubah yang ingin anda ramalkan dalam y; jika lajur dimasukkan dalam kedudukan yang salah, butang tukar kedudukan akan menulis semula lajur tersebut di tempatnya.

    Apakah yang sebenarnya diberitahu oleh R² kepada saya?

    R² ialah bahagian pergerakan naik turun dalam y yang dijelaskan oleh garis tersebut: 0.96 bermakna 96% daripadanya sejajar dengan x dan 4% lagi tidak. Ia tidak menyatakan sama ada garis lurus ialah bentuk yang betul — lengkung yang jelas masih boleh mendapat skor yang tinggi — jadi bacalah ia bersama-sama dengan plot sisaan. Korelasi r ialah punca kuasa dua bagi R² yang membawa tanda kecerunan, itulah sebabnya r adalah negatif untuk garis yang menurun.

    Mengapakah ramalan disertakan dengan dua selang?

    Kedua-duanya menjawab soalan yang berbeza. Selang min bertanya di mana purata y berada untuk semua orang pada x tersebut, jadi hanya ketidakpastian dalam garis itu sendiri yang diambil kira. Selang individu pula bertanya di mana satu pemerhatian baharu akan mendarat, yang menambah serakan titik di sekitar garis — sebutan tambahan itulah sebabnya ia sentiasa lebih lebar antara kedua-duanya. Kedua-dua selang akan melebar apabila x menjauhi bahagian tengah data anda.

    Adakah nilai-p yang kecil bermakna x menyebabkan y?

    Tidak. Nilai-p hanya menjawab satu soalan sempit: jika kecerunan sebenar ialah 0, seberapa kerapkah sampel bersaiz ini akan menghasilkan kecerunan sekurang-kurangnya sejauh ini dari 0? Nilai yang kecil menjadikan “tiada hubungan langsung” sebagai penjelasan yang janggal, tidak lebih daripada itu. Hubungan sebab akibat memerlukan reka bentuk kajian di sebaliknya — faktor ketiga yang menggerakkan kedua-dua lajur, atau sampel yang tidak dikumpul secara bebas, boleh menghasilkan nilai-p yang kecil dengan mudah juga.