மீச்சிறு வர்க்க நேரியல் பின்னடைவின் கணித அடிப்படைகள்
நேரியல் பின்னடைவு (Linear Regression) என்பது இரு மாறிகளுக்கு இடையே உள்ள தொடர்பை ஆராய்வதற்கான ஒரு அடிப்படை புள்ளிவிவர முறையாகும். இதில் சாதாரண மீச்சிறு வர்க்க முறை (Ordinary Least Squares - OLS) என்பது, தரவுப் புள்ளிகளுக்கும் பொருத்தப்படும் நேர்க்கோட்டிற்கும் இடையே உள்ள செங்குத்து விலகல்களின் வர்க்கங்களின் கூடுதலைக் (Sum of Squared எச்சங்கள்) குறைப்பதன் மூலம் ஒரு சிறந்த நேர்க்கோட்டை உருவாக்குகிறது.
இந்தக் கணக்கீடுகளைத் துல்லியமாகச் செய்ய, தரவுப் புள்ளிகளின் சராசரிகள் மற்றும் அவற்றின் விலகல்கள் கணக்கிடப்படுகின்றன. கணக்கீட்டுத் துல்லியத்தை உறுதிப்படுத்த, பரவல்கள் இருமுறை கணக்கிடும் முறை (Compensated Summation) மூலம் மதிப்பிடப்படுகின்றன. இதன் மூலம் பெரிய எண்களைக் கையாளும் போதும் துல்லியம் குறையாமல் பாதுகாக்கப்படுகிறது.
பயன்படுத்தப்படும் அடிப்படை சூத்திரங்கள் பின்வருமாறு:
- Sxx, Syy மற்றும் Sxy கணக்கீடு: Sxx = Σ(xᵢ − x̄)², Syy = Σ(yᵢ − ȳ)², Sxy = Σ(xᵢ − x̄)(yᵢ − ȳ)
- சாய்வு: b = Sxy ÷ Sxx
- வெட்டுத்துண்டு: a = ȳ − b·x̄
இங்கு x̄ மற்றும் ȳ என்பவை முறையே x மற்றும் y மாறிகளின் சராசரி மதிப்புகள் ஆகும்.
உள்ளீட்டுத் தரவு மற்றும் அமைப்புகள்
இந்தக் கால்குலேட்டர் பல்வேறு வடிவங்களில் தரவை உள்ளிட அனுமதிக்கிறது. பயனர்கள் தங்களின் தேவைக்கேற்ப அமைப்புகளைத் தேர்வு செய்து கொள்ளலாம்:
- அமைப்பு (Layout selection): "இணை வரிசைகள்" (ஒரு வரிசைக்கு ஒரு x மற்றும் y) அல்லது "இரண்டு பட்டியல்கள்" (x மதிப்புகள் மற்றும் y மதிப்புகள் தனித்தனியாக) ஆகிய இரு அமைப்புகளில் ஒன்றைத் தேர்ந்தெடுக்கலாம்.
- தரவுப் புள்ளிகள் (Data points):
- "இணை வரிசைகள்" அமைப்பில், விரிதாளில் (Spreadsheet) இருந்து நகலெடுக்கப்பட்ட இரு நெடுவரிசைகளைத் தலைப்பு வரிசை உட்பட நேரடியாக ஒட்டலாம். முதல் வரிசையில் எண்கள் அல்லாத உரை இருந்தால், அது தானாகவே தலைப்பாகக் கருதப்பட்டு தவிர்க்கப்படும்.
- "இரண்டு பட்டியல்கள்" அமைப்பில், x மதிப்புகள் (விளக்கும் மாறி) மற்றும் y மதிப்புகள் (விளக்கப்படும் மாறி) ஆகியவற்றைத் தனித்தனியாக உள்ளிட வேண்டும்.
- தசமப் பிரிப்பான்: பயனரின் அமைப்பைப் பொறுத்து புள்ளி (எ.கா.
12.5) அல்லது கமா (எ.கா.12,5) தசமப் பிரிப்பானாகப் பயன்படுத்தப்படலாம். புள்ளி அமைப்பில் மதிப்புகள் கமாக்கள், இடைவெளிகள் அல்லது புதிய வரிகள் மூலமும், கமா அமைப்பில் அரைப்புள்ளிகள் (Semicolons), இடைவெளிகள் அல்லது புதிய வரிகள் மூலமும் பிரிக்கப்பட வேண்டும். - வரம்புகள்: குறைந்தபட்சம் 2 புள்ளிகள் தேவை. அதிகபட்சமாக 50,000 புள்ளிகள் மற்றும் 1 MB அளவுள்ள உரை வரை உள்ளிடலாம்.
- x இல் y ஐக் கணித்தல்: குறிப்பிட்ட x மதிப்புகளில் y-ன் மதிப்பைத் துல்லியமாகக் கணிக்க, இடைவெளிகள் அல்லது கமாக்களால் பிரிக்கப்பட்ட 50 மதிப்புகள் வரை உள்ளிடலாம்.
- நம்பிக்கை எல்லை: 90%, 95% அல்லது 99% ஆகிய அளவுகளில் ஒன்றைத் தேர்ந்தெடுக்கலாம். இது கெழுக்கள் மற்றும் கணிப்புகளுக்கான இடைவெளிகளைத் தீர்மானிக்கிறது.
- காண்பிக்கப்படும் தசமங்கள்: முடிவுகளின் துல்லியத்தை 2, 4 அல்லது 6 தசம இடங்களாக மாற்றியமைக்கலாம்.
பின்னடைவுக் கெழுக்களின் விளக்கம்
பின்னடைவுக் கணக்கீட்டின் முடிவில் கிடைக்கும் முதன்மை மதிப்புகள் தரவின் தன்மையை விளக்குகின்றன:
- சாய்வு b: "சராசரியாக, x-ல் ஒவ்வொரு 1 அதிகரிக்கும்போதும் y மதிப்பானது
‹slope›அளவு மாறுகிறது." - வெட்டுத்துண்டு a: "x பூஜ்ஜியமாக இருக்கும்போது, கோடு y =
‹intercept›இல் அமைகிறது."
இவற்றுடன், மாதிரியின் துல்லியத்தை மதிப்பிடப் பின்வரும் புள்ளிவிவரங்கள் கணக்கிடப்படுகின்றன:
- ஒட்டுறவு r: இது இரு மாறிகளுக்கு இடையே உள்ள நேரியல் தொடர்பின் வலிமையைக் குறிக்கிறது. இதன் மதிப்பு −1 முதல் +1 வரை இருக்கும்.
- R² (Coefficient of Determination): இது y-ன் மொத்த மாறுபாட்டில் பின்னடைவுக் கோட்டினால் விளக்கப்படும் பங்கைக் காட்டுகிறது.
- சரிசெய்யப்பட்ட R² (Adjusted R²): மாதிரியில் உள்ள மாறிகளின் எண்ணிக்கையைக் கருத்தில் கொண்டு சரிசெய்யப்பட்ட R² மதிப்பு.
- எச்சப் பரவல் s: பொருத்தப்பட்ட கோட்டிலிருந்து புள்ளிகள் எவ்வளவு தூரம் விலகியிருக்கின்றன என்பதைக் காட்டும் திட்ட விலக்கம்.
புள்ளிவிவர அட்டவணைகள் மற்றும் சூத்திரப் பிரதியீடு
கால்குலேட்டர் கணக்கீடுகளின் ஒவ்வொரு படிநிலையையும் விரிவான சூத்திரப் பிரதியீடுகளுடன் காட்டுகிறது:
கெழுக்கள் அட்டவணை (கெழுக்கள் Table)
இந்த அட்டவணை சாய்வு மற்றும் வெட்டுத்துண்டின் புள்ளிவிவரத் தன்மையை விளக்குகிறது:
| உறுப்பு | மதிப்பீடு | திட்டப் பிழை | t | p | ‹level›% இடைவெளி |
|---|---|---|---|---|---|
| சாய்வு b | b | SE(b) | t | p | இடைவெளி வரம்பு |
| வெட்டுத்துண்டு a | a | SE(a) | t | p | இடைவெளி வரம்பு |
பரவற்படிப் பகுப்பாய்வு (ANOVA Table)
மாதிரியின் ஒட்டுமொத்த முக்கியத்துவத்தை மதிப்பிட ANOVA அட்டவணை உதவுகிறது:
| மூலம் | df | வர்க்கங்களின் கூடுதல் | சராசரி வர்க்கம் | F | p |
|---|---|---|---|---|---|
| கோட்டினால் விளக்கப்பட்டது | 1 | SSR | MSR | F | p |
| மீதமுள்ளது | n − 2 | SSE | MSE | ||
| மொத்தம் | n − 1 | SST |
சூத்திரப் பிரதியீட்டுப் படிகள்
கணக்கீடுகள் எவ்வாறு செய்யப்பட்டன என்பதைப் பயனர்கள் சரிபார்க்கப் பின்வரும் படிகள் காட்டப்படுகின்றன:
- சராசரிகள்: சராசரிகள்: x̄ =
‹sumX›÷‹n›=‹meanX›மற்றும் ȳ =‹sumY›÷‹n›=‹meanY› - பரவலும் இணை இயக்கமும்: பரவலும் இணை இயக்கமும்: Sxx =
‹sxx›மற்றும் Sxy =‹sxy› - சாய்வு: சாய்வு: b = Sxy ÷ Sxx =
‹sxy›÷‹sxx›=‹slope› - வெட்டுத்துண்டு: வெட்டுத்துண்டு: a = ȳ − b·x̄ =
‹meanY›− (‹slope›)·‹meanX›=‹intercept› - விளக்கப்பட்ட பரவற்படியின் பங்கு: விளக்கப்பட்ட பரவற்படியின் பங்கு: R² = SSR ÷ SST =
‹ssr›÷‹sst›=‹r2› - எச்சப் பரவல்: எச்சப் பரவல்: s = √(SSE ÷ (n − 2)) = √(
‹sse›÷‹df›) =‹s› - சாய்வின் திட்டப் பிழை: சாய்வின் திட்டப் பிழை: SE(b) = s ÷ √Sxx =
‹s›÷ √‹sxx›=‹se› - முக்கியத்துவ சோதனை: t = b ÷ SE(b) =
‹slope›÷‹se›=‹t›, எனவே‹df›கட்டின்மை கூறுகளில் p =‹p›.
எல்லை நிலைகளும் பிழைச் செய்திகளும்
தரவு உள்ளீட்டில் ஏற்படும் தவறுகள் மற்றும் கணித வரம்புகளைக் கையாளப் பின்வரும் விதிகள் பயன்படுத்தப்படுகின்றன:
- குறைந்த தரவு: "குறைந்தது 2 புள்ளிகளை உள்ளிடவும்; ஒரு புள்ளி ஒரு கோட்டை வரையறுக்காது."
- பொருந்தாத பட்டியல்கள்: "
‹countX›x மதிப்புகளும்‹countY›y மதிப்புகளும் உள்ளன — பட்டியல்கள் ஒரே நீளத்தில் இருக்க வேண்டும்." - செங்குத்துக் கோடு: அனைத்து x மதிப்புகளும் சமமாக இருந்தால், "ஒவ்வொரு x மதிப்பும் ஒன்றாகவே உள்ளது, எனவே கோடு செங்குத்தாக இருக்கும் மற்றும் சாய்வு பூஜ்ஜியத்தால் வகுக்கப்படும்."
- தட்டையான கோடு: அனைத்து y மதிப்புகளும் சமமாக இருந்தால், "ஒவ்வொரு y மதிப்பும் ஒன்றாகவே உள்ளது, எனவே கோடு தட்டையானது மற்றும் r, R² மற்றும் முக்கியத்துவ சோதனை ஆகியவை வரையறுக்கப்படவில்லை."
- துல்லியமான பொருத்தம்: இரண்டு புள்ளிகள் மட்டுமே உள்ளிடப்பட்டால், "இரண்டு புள்ளிகள் கோட்டைத் துல்லியமாகத் தீர்மானிக்கின்றன, எனவே நிச்சயமற்ற தன்மையை மதிப்பிடுவதற்கு எதுவும் மிஞ்சவில்லை."
- பூஜ்ஜிய எச்சம்: அனைத்துப் புள்ளிகளும் கோட்டின் மீது சரியாக அமைந்தால், "புள்ளிகள் சரியாக கோட்டின் மீது அமைகின்றன, எனவே எச்சப் பரவல் இல்லை மற்றும் எந்தவொரு இடைவெளியையோ அல்லது p-மதிப்பையோ மதிப்பிட முடியாது."
- தரவு வரம்பு மீறல்: "தரவை
‹max›புள்ளிகளுக்குள் வைத்திருக்கவும்." - எண் வரம்பு மீறல்: "ஒரு மதிப்பு அல்லது இடைநிலை முடிவு ஆதரிக்கப்படும் எண் வரம்பை மீறுகிறது."
தரவுப் பாதுகாப்பு மற்றும் செயலாக்கம்
இந்தக் கால்குலேட்டரைப் பயன்படுத்தும் போது தரவுப் பாதுகாப்பு முழுமையாகப் பேணப்படுகிறது. உங்கள் தரவுப் புள்ளிகளும் ஒவ்வொரு புள்ளிவிவரமும் இந்த உலாவியிலேயே இருக்கும், அவை ஒருபோதும் பதிவேற்றப்படாது. கணக்கீடுகள் அனைத்தும் பயனரின் கணினியிலேயே உள்ளூர் உலாவி (Local Web Browser) வழியாகச் செய்யப்படுவதால், தரவு கசிவுக்கான வாய்ப்புகள் இல்லை.
அடிக்கடி கேட்கப்படும் கேள்விகள் (FAQ)
கேள்வி: நான் எந்த நெடுவரிசையை x-ல் வைக்கிறேன் என்பது முக்கியமா?
பதில்: ஆம். மீச்சிறு வர்க்க முறை செங்குத்து இடைவெளிகளைக் குறைக்கிறது, எனவே இது y-ஐ விளக்கப்படும் பொருளாகவும் x-ஐ விளக்கும் பொருளாகவும் கருதுகிறது. அவற்றை மாற்றினால் நீங்கள் வேறுபட்ட சாய்வையும் வேறுபட்ட வெட்டுத்துண்டையும் பெறுவீர்கள் — r மற்றும் R² மட்டுமே மாறாமல் இருக்கும். நீங்கள் கணிக்க விரும்பும் மாறியை y-ல் வைக்கவும்; நெடுவரிசைகள் தவறான வரிசையில் இருந்தால், மாற்று பொத்தான் அவற்றை அந்த இடத்திலேயே மாற்றி அமைக்கும்.
கேள்வி: R² உண்மையில் எனக்கு என்ன சொல்கிறது?
பதில்: R² என்பது y-ன் ஏறு இறக்க இயக்கத்தில் கோடு விளக்கும் பங்காகும்: 0.96 என்பது அதில் 96% x உடன் ஒத்துப்போகிறது மற்றும் 4% ஒத்துப்போகவில்லை என்று பொருள்படும். நேர்க்கோடு தான் சரியான வடிவமா என்பதைப் பற்றி இது எதுவும் கூறாது — ஒரு தெளிவான வளைவும் அதிக மதிப்பெண் பெறலாம் — எனவே இதை எச்ச வரைபடத்துடன் சேர்த்துப் பார்க்கவும். ஒட்டுறவு r என்பது சாய்வின் குறியீட்டைக் கொண்ட R²-ன் வர்க்கமூலம் ஆகும், இதனால்தான் கீழ்நோக்கிய கோட்டிற்கு r எதிர்மறையாக இருக்கும்.
கேள்வி: கணிப்புகள் ஏன் இரண்டு இடைவெளிகளுடன் வருகின்றன?
பதில்: அவை வெவ்வேறு கேள்விகளுக்குப் பதிலளிக்கின்றன. சராசரி இடைவெளியானது, குறிப்பிட்ட x மதிப்பில் உள்ள அனைவருக்குமான சராசரி y எங்கு அமைகிறது என்பதைக் கேட்கிறது, எனவே கோட்டில் உள்ள நிச்சயமற்ற தன்மை மட்டுமே கணக்கில் கொள்ளப்படுகிறது. தனிநபர் இடைவெளியானது, ஒரு புதிய அவதானிப்பு எங்கு அமையும் என்பதைக் கேட்கிறது, இது கோட்டைச் சுற்றியுள்ள புள்ளிகளின் சிதறலையும் சேர்க்கிறது — இந்த கூடுதல் உறுப்பு காரணமாகவே இது எப்போதும் இரண்டில் அகலமானதாக இருக்கும். உங்கள் தரவின் நடுப்பகுதியிலிருந்து x விலகிச் செல்லச் செல்ல இரண்டுமே அகலமாகும்.
கேள்வி: சிறிய p-மதிப்பு என்பது x தான் y-க்குக் காரணம் என்று பொருள்படுமா?
பதில்: இல்லை. p-மதிப்பு ஒரு குறுகிய கேள்விக்கு மட்டுமே பதிலளிக்கிறது: உண்மையான சாய்வு 0 ஆக இருந்தால், இந்த அளவிலான ஒரு மாதிரி எவ்வளவு அடிக்கடி 0-விலிருந்து இவ்வளவு தூரத்தில் ஒரு சாய்வை உருவாக்கும்? ஒரு சிறிய மதிப்பு “எந்தவொரு தொடர்பும் இல்லை” என்பதை ஒரு பொருத்தமற்ற விளக்கமாக மாற்றுகிறது, அவ்வளவுதான். காரணத்தைக் கண்டறிய ஆய்வின் வடிவமைப்பு தேவைப்படுகிறது — இரு நெடுவரிசைகளையும் நகர்த்தும் ஒரு மூன்றாவது காரணி அல்லது தனித்தனியாகச் சேகரிக்கப்படாத ஒரு மாதிரி ஆகியவை மிக எளிதாகச் சிறிய p-மதிப்புகளை உருவாக்கிவிடும்.