సాధారణ కనిష్ట వర్గాల పద్ధతి మరియు గణిత పునాదులు
లీనియర్ రిగ్రెషన్ అనేది రెండు చరరాశుల మధ్య ఉండే సరళ సంబంధాన్ని విశ్లేషించడానికి ఉపయోగించే ఒక ప్రాథమిక గణాంక పద్ధతి. ఈ లీనియర్ రిగ్రెషన్ కాలిక్యులేటర్ సాధారణ కనిష్ట వర్గాల (Ordinary Least Squares - OLS) సూత్రాన్ని ఉపయోగించి పనిచేస్తుంది. ఈ పద్ధతిలో, వాస్తవ డేటా బిందువులకు మరియు అంచనా వేయబడిన రేఖకు మధ్య ఉండే నిలువు వ్యత్యాసాల (అవశేషాల) వర్గాల మొత్తాన్ని కనిష్ట స్థాయికి తగ్గించేలా ఒక సరళ రేఖను అమర్చడం జరుగుతుంది.
గణనల ఖచ్చితత్వాన్ని కాపాడటానికి, ఈ సాధనం ద్వి-దశల కాంపెన్సేటెడ్ సమ్మేషన్ (compensated summation) పద్ధతిని ఉపయోగిస్తుంది. దీనివల్ల విలువల పరిమాణాలలో పెద్ద వ్యత్యాసాలు ఉన్నప్పటికీ, ఖచ్చితత్వం కోల్పోకుండా స్థిరమైన ఫలితాలు వస్తాయి. గణన ప్రక్రియలో ఉపయోగించే ప్రాథమిక సూత్రాలు క్రింది విధంగా ఉంటాయి:
- సగటుల చుట్టూ వర్గాల మొత్తం:
- Sxx = Σ(xᵢ − x̄)²
- Syy = Σ(yᵢ − ȳ)²
- Sxy = Σ(xᵢ − x̄)(yᵢ − ȳ)
- వాలు = Sxy ÷ Sxx
- అంతరఖండం = ȳ − b·x̄
- వర్గాల మొత్తం విభజన:
- SSE (అవశేష వర్గాల మొత్తం) = Σ(yᵢ − ŷᵢ)²
- SST (మొత్తం వర్గాల మొత్తం) = Syy
- SSR (రిగ్రెషన్ వర్గాల మొత్తం) = SST − SSE
ఈ గణనల ఆధారంగా రిగ్రెషన్ రేఖ సమీకరణం ŷ = a + bx రూపంలో ఏర్పడుతుంది.
రిగ్రెషన్ గుణకాలు మరియు వాటి వివరణ
రిగ్రెషన్ విశ్లేషణలో లభించే గుణకాలు స్వతంత్ర చరరాశి (x) మరియు ఆధారిత చరరాశి (y) మధ్య గల సంబంధ స్వభావాన్ని వివరిస్తాయి. కాలిక్యులేటర్ అవుట్పుట్లో లభించే ప్రధాన గుణకాలను క్రింది విధంగా అర్థం చేసుకోవచ్చు:
వాలు b
వాలు అనేది x లో వచ్చే మార్పుకు y లో ఎలాంటి మార్పు వస్తుందో సూచిస్తుంది. సాధనం దీనిని "సగటున x లో ప్రతి 1 పెంపుదలకు y విలువ ‹slope› మేర మారుతుంది." అని వివరిస్తుంది. వాలు ధనాత్మకంగా ఉంటే x పెరిగేకొద్దీ y పెరుగుతుందని, రుణాత్మకంగా ఉంటే x పెరిగేకొద్దీ y తగ్గుతుందని అర్థం.
అంతరఖండం a
ఇది స్వతంత్ర చరరాశి x విలువ సున్నా అయినప్పుడు y యొక్క అంచనా విలువను సూచిస్తుంది. సాధనం దీనిని "x విలువ 0 ఉన్న చోట రేఖ y = ‹intercept› వద్ద ఉంటుంది." అని చూపిస్తుంది.
గుణకాల పట్టిక (గుణకాలు Table)
గుణకాల విశ్లేషణ కోసం కాలిక్యులేటర్ ఒక ప్రత్యేక పట్టికను అందిస్తుంది. ఇందులో క్రింది నిలువు వరుసలు ఉంటాయి:
- పదం (Term): వాలు b మరియు అంతరఖండం a వరుసలు.
- అంచనా: లెక్కించబడిన వాలు మరియు అంతరఖండం విలువలు.
- ప్రామాణిక దోషం: అంచనా వేసిన గుణకాలలో ఉండే అనిశ్చితి పరిమాణం.
- t: t-గణాంకం విలువ (estimate ÷ std. error).
- p: ద్వి-పార్శ్వ p-విలువ.
‹level›% అంతరం (‹level›% interval): ఎంచుకున్న విశ్వసనీయత స్థాయి ఆధారంగా గుణకాల పరిధి.
సహసంబంధం (r) మరియు నిర్ధారణ గుణకం (R²)
డేటా ఎంతవరకు రిగ్రెషన్ రేఖకు సరిపోతుందో తెలుసుకోవడానికి r మరియు R² విలువలు సహాయపడతాయి.
| గణాంకం | వివరణ | పరిధి మరియు అర్థం |
|---|---|---|
| సహసంబంధం r | రెండు చరరాశుల మధ్య గల సరళ సంబంధ బలాన్ని మరియు దిశను సూచిస్తుంది. | -1 నుండి +1 వరకు ఉంటుంది. వాలు యొక్క గుర్తును ఇది కలిగి ఉంటుంది. |
| R² | y లోని హెచ్చుతగ్గుల కదలికలో రిగ్రెషన్ రేఖ వివరించే వాటాను తెలుపుతుంది. | 0 నుండి 1 వరకు ఉంటుంది. R² = SSR ÷ SST సూత్రం ద్వారా లెక్కిస్తారు. |
| సర్దుబాటు చేసిన R² (Adjusted R²) | నమూనా పరిమాణం మరియు చరరాశుల సంఖ్యను పరిగణనలోకి తీసుకుని R² ని సర్దుబాటు చేస్తుంది. | 1 − (1 − R²)(n − 1) ÷ (n − 2) సూత్రం ద్వారా లెక్కిస్తారు. |
విచలన వివరణ (ANOVA) మరియు పరికల్పన పరీక్ష
లీనియర్ రిగ్రెషన్ మోడల్ యొక్క గణాంక ప్రాముఖ్యతను అంచనా వేయడానికి విచలన వివరణ (ANOVA) పట్టిక ఉపయోగపడుతుంది. ఈ పట్టికలో క్రింది విభాగాలు ఉంటాయి:
- మూలం (Source): "రేఖ ద్వారా వివరించబడినది" (Regression), "మిగిలిపోయినది" (Residual), మరియు "మొత్తం" (Total).
- df (స్వాతంత్ర్య డిగ్రీలు): రిగ్రెషన్ కోసం 1, అవశేషాల కోసం n − 2, మరియు మొత్తం కోసం n − 1.
- వర్గాల మొత్తం: SSR, SSE, మరియు SST విలువలు.
- సగటు వర్గం: వర్గాల మొత్తాన్ని వాటి స్వాతంత్ర్య డిగ్రీలతో భాగించగా వచ్చే విలువ (MSE = SSE ÷ (n − 2)).
- F: F-గణాంకం విలువ. ఒకే ఒక ప్రిడిక్టర్ ఉన్నప్పుడు, F విలువ వాలు యొక్క t-గణాంకం వర్గానికి (t²) సమానంగా ఉంటుంది.
- p: మోడల్ యొక్క మొత్తం ప్రాముఖ్యతను సూచించే p-విలువ.
వాలు యొక్క ప్రాముఖ్యతను పరీక్షించడానికి t-పరీక్షను నిర్వహిస్తారు. ఇక్కడ t = b ÷ SE(b) సూత్రాన్ని ఉపయోగిస్తారు. దీనికి సంబంధించిన p-విలువను రెగ్యులరైజ్డ్ ఇన్కంప్లీట్ బీటా ఫంక్షన్ ద్వారా లెక్కిస్తారు.
అవశేషాల విశ్లేషణ మరియు చార్టులు
రిగ్రెషన్ నమూనా యొక్క విశ్వసనీయతను కేవలం సంఖ్యాపరమైన కొలతల ద్వారానే కాకుండా, దృశ్యరూప ప్లాట్ల ద్వారా కూడా పరిశీలించడం ముఖ్యం. ఈ సాధనం రెండు రకాల చార్టులను అందిస్తుంది:
- సరిపోయే రేఖ: "కనిష్ట వర్గాల రేఖ మరియు దాని సగటు చుట్టూ ఉన్న బ్యాండ్తో కూడిన బిందువుల స్కాటర్ ప్లాట్". ఇందులో అసలు బిందువులు, సరిపోయే రేఖ మరియు సగటు కోసం ఎంచుకున్న విశ్వసనీయత బ్యాండ్ ప్రదర్శించబడతాయి.
- అవశేషాలు: "x కి వ్యతిరేకంగా ప్లాట్ చేయబడిన అవశేషాలు, సున్నా రేఖ చుట్టూ విస్తరించి ఉన్నాయి".
అవశేషాలు (y − ŷ) అనేవి వాస్తవ విలువలకు మరియు అంచనా విలువలకూ మధ్య గల వ్యత్యాసాలు. అవశేషాల ప్లాట్ సున్నా రేఖ చుట్టూ ఎటువంటి నిర్దిష్ట ఆకృతి లేకుండా యాదృచ్ఛికంగా విస్తరించి ఉండాలి. ఒకవేళ అవశేషాల ప్లాట్లో వక్రతలు లేదా ఫ్యాన్ ఆకృతి కనిపిస్తే, సరళ రేఖ నమూనా ఆ డేటాకు సరైనది కాదని అర్థం చేసుకోవచ్చు.
విశ్వసనీయత మరియు అంచనా అంతరాలు
భవిష్యత్తు విలువల అంచనా కోసం కాలిక్యులేటర్ రెండు రకాల అంతరాలను (Intervals) లెక్కిస్తుంది:
- సగటు
‹level›% అంతరం (Mean Interval): ఒక నిర్దిష్ట x₀ వద్ద సగటు y విలువ ఉండే పరిధిని ఇది సూచిస్తుంది. దీని ప్రామాణిక దోషం: s · √(1÷n + (x₀ − x̄)² ÷ Sxx). - వ్యక్తిగత
‹level›% అంతరం (Individual Interval): ఒక నిర్దిష్ట x₀ వద్ద ఒకే ఒక కొత్త పరిశీలన విలువ ఉండే పరిధిని ఇది సూచిస్తుంది. దీని ప్రామాణిక దోషం: s · √(1 + 1÷n + (x₀ − x̄)² ÷ Sxx).
వ్యక్తిగత అంతరంలో కొత్త పరిశీలనకు సంబంధించిన అదనపు విచలనం (1 అనే పదం రూపంలో) చేరి ఉండటం వల్ల, ఇది ఎల్లప్పుడూ సగటు అంతరం కంటే వెడల్పుగా ఉంటుంది. x₀ విలువ సగటు x̄ నుండి దూరంగా జరిగే కొద్దీ ఈ రెండు అంతరాల వెడల్పు పెరుగుతుంది.
డేటా నమోదు నియమాలు మరియు పరిమితులు
సాధనం సజావుగా పనిచేయడానికి మరియు ఖచ్చితమైన ఫలితాలను ఇవ్వడానికి కొన్ని నిర్దిష్ట నియమాలు మరియు పరిమితులు ఉన్నాయి:
- లేఅవుట్ ఎంపికలు: వినియోగదారులు "జత చేయబడిన వరుసలు" (ఒక వరుసకు ఒక x మరియు y) లేదా "రెండు జాబితాలు" (x విలువలు మరియు y విలువలు విడిగా) ఎంచుకోవచ్చు.
- దశాంశ సంకేతాలు: దశాంశాల కోసం చుక్క (12.5) ఉపయోగిస్తే, జాబితాలోని విలువలను స్పేస్లు, కామాలు లేదా కొత్త లైన్లతో వేరు చేయాలి. దశాంశాల కోసం కామా (12,5) ఉపయోగిస్తే, విలువలను స్పేస్లు, సెమీకోలన్లు లేదా కొత్త లైన్లతో వేరు చేయాలి.
- పరిమితులు: కనీసం 2 బిందువులు అవసరం. గరిష్టంగా 50,000 బిందువులు మరియు 1 MB టెక్స్ట్ వరకు పేస్ట్ చేయవచ్చు. అంచనాల కోసం గరిష్టంగా 50 విలువల వరకు నమోదు చేయవచ్చు.
- డేటా ప్రాసెసింగ్: మీ డేటా బిందువులు మరియు ప్రతి గణాంకం ఈ బ్రౌజర్లోనే ఉంటాయి మరియు ఎప్పటికీ అప్లోడ్ చేయబడవు.
ప్రత్యేక పరిస్థితులు మరియు దోష సందేశాలు
- రెండు బిందువులు మాత్రమే ఉన్నప్పుడు: "రెండు బిందువులు రేఖను ఖచ్చితంగా స్థిరపరుస్తాయి, కాబట్టి అనిశ్చితిని అంచనా వేయడానికి ఏమీ మిగలలేదు." అనే సందేశం కనిపిస్తుంది.
- ఖచ్చితమైన అమరిక: బిందువులన్నీ రేఖపైనే ఉంటే, "బిందువులు ఖచ్చితంగా రేఖపై ఉన్నాయి, కాబట్టి అవశేష వ్యాప్తి లేదు మరియు ఎటువంటి అంతరం లేదా p-విలువను అంచనా వేయలేము." అనే సందేశం వస్తుంది.
- స్థిరమైన Y విలువలు: అన్ని y విలువలు ఒకేలా ఉంటే, "ప్రతి y ఒకేలా ఉంది, కాబట్టి రేఖ ఫ్లాట్గా ఉంటుంది మరియు r, R² మరియు ప్రాముఖ్యత పరీక్ష నిర్వచించబడలేదు." అని చూపిస్తుంది.
- నిలువు రేఖ (స్థిరమైన X విలువలు): అన్ని x విలువలు ఒకేలా ఉంటే, "ప్రతి x ఒకేలా ఉంది, కాబట్టి రేఖ నిలువుగా ఉంటుంది మరియు వాలు సున్నాతో భాగించబడుతుంది." అనే దోషం వస్తుంది.
తరచుగా అడిగే ప్రశ్నలు (FAQ)
ప్రశ్న: నేను ఏ నిలువు వరుసను x లో ఉంచాలనేది ముఖ్యమా?
సమాధానం: అవును. కనిష్ట వర్గాలు నిలువు అంతరాలను తగ్గిస్తాయి, కాబట్టి ఇది y ని వివరించబడే అంశంగా మరియు x ని వివరించే అంశంగా పరిగణిస్తుంది. వాటిని పరస్పరం మార్చితే మీకు వేరొక వాలు మరియు వేరొక అంతరఖండం లభిస్తాయి — r మరియు R² మాత్రమే ఒకేలా ఉంటాయి. మీరు అంచనా వేయాలనుకుంటున్న చరరాశిని y లో ఉంచండి; ఒకవేళ నిలువు వరుసలు తప్పుగా నమోదు చేయబడితే, మార్పిడి బటన్ వాటిని ఉన్న స్థానంలోనే తిరిగి వ్రాస్తుంది.
ప్రశ్న: R² నాకు అసలు ఏమి చెబుతుంది?
సమాధానం: R² అనేది y లోని హెచ్చుతగ్గుల కదలికలో రేఖ వివరించే వాటా: 0.96 అంటే అందులో 96% x తో సరిపోలుతుందని మరియు 4% సరిపోలడం లేదని అర్థం. సరళ రేఖ సరైన ఆకృతి కాదా అనే దాని గురించి ఇది ఏమీ చెప్పదు — స్పష్టమైన వక్రరేఖ కూడా అధిక స్కోర్ను సాధించగలదు — కాబట్టి దీనిని అవశేష ప్లాట్తో పాటు చదవండి. సహసంబంధం r అనేది వాలు యొక్క గుర్తును కలిగి ఉండే R² యొక్క వర్గమూలం, అందుకే క్రిందికి ఉండే రేఖకు r రుణాత్మకంగా ఉంటుంది.
ప్రశ్న: చిన్న p-విలువ అంటే x వల్ల y సంభవిస్తుందని అర్థమా?
సమాధానం: లేదు. p-విలువ ఒక నిర్దిష్ట ప్రశ్నకు మాత్రమే సమాధానమిస్తుంది: నిజమైన వాలు 0 అయితే, ఈ పరిమాణం గల నమూనా ఎంత తరచుగా 0 నుండి కనీసం ఇంత దూరంలో ఉన్న వాలును ఉత్పత్తి చేస్తుంది? ఒక చిన్న విలువ “అసలు ఎటువంటి సంబంధం లేదు” అనే వివరణను అసౌకర్యంగా మారుస్తుంది, అంతకంటే ఏమీ లేదు. కారణాన్ని తెలుసుకోవడానికి అధ్యయనం యొక్క రూపకల్పన అవసరం — రెండు నిలువు వరుసలను కదిలించే మూడవ అంశం లేదా స్వతంత్రంగా సేకరించని నమూనా కూడా చాలా సులభంగా చిన్న p-విలువలను ఉత్పత్తి చేస్తుంది.
ప్రశ్న: అంచనాలు రెండు అంతరాలతో ఎందుకు వస్తాయి?
సమాధానం: అవి వేర్వేరు ప్రశ్నలకు సమాధానమిస్తాయి. సగటు అంతరం అనేది ఆ x వద్ద ప్రతి ఒక్కరికీ సగటు y ఎక్కడ ఉంటుందో అడుగుతుంది, కాబట్టి రేఖలోని అనిశ్చితి మాత్రమే పరిగణనలోకి వస్తుంది. వ్యక్తిగత అంతరం అనేది ఒక కొత్త పరిశీలన ఎక్కడ చేరుతుందో అడుగుతుంది, ఇది రేఖ చుట్టూ ఉన్న బిందువుల స్కాటర్ను జోడిస్తుంది — ఆ అదనపు పదం వల్లే ఇది ఎల్లప్పుడూ రెండింటిలోనూ వెడల్పుగా ఉంటుంది. మీ డేటా మధ్య భాగం నుండి x దూరంగా జరుగుతున్న కొద్దీ ఈ రెండూ వెడల్పు అవుతాయి.