સામાન્ય ન્યૂનતમ-વર્ગોની પદ્ધતિ અને રેખીય નિયતસંબંધ
સામાન્ય ન્યૂનતમ-વર્ગોની પદ્ધતિ (Ordinary Least Squares અથવા OLS) એ બે ચલો વચ્ચેના રેખીય સંબંધને સમજવા અને તેને ગાણિતિક મોડેલમાં ઢાળવા માટેની પાયાની પદ્ધતિ છે. આ પદ્ધતિ દ્વિ-ચલ ડેટા પોઇન્ટ્સ વચ્ચેથી એક એવી સીધી રેખા પસાર કરે છે, જે વાસ્તવિક બિંદુઓ અને રેખા વચ્ચેના શિરોલંબ અંતરના વર્ગોના સરવાળાને ન્યૂનતમ બનાવે છે. આ કેલ્ક્યુલેટર આંકડાકીય પદ્ધતિઓના NIST/SEMATECH ઇ-હેન્ડબુકના ધોરણોને અનુસરીને ગણતરીઓ કરે છે.
ગણતરીની ચોકસાઈ જાળવી રાખવા માટે, આ ટૂલ કમ્પન્સેટેડ સમેશન (compensated summation) સાથે બે તબક્કામાં મધ્યકની આસપાસના સરવાળાની ગણતરી કરે છે. આ પ્રક્રિયાને કારણે જ્યારે ડેટાના મૂલ્યો ખૂબ મોટા અથવા એકબીજાથી ઘણા અલગ હોય, ત્યારે પણ ગણતરીની ચોકસાઈ જળવાઈ રહે છે.
નિયતસંબંધ રેખાનું મૂળભૂત સમીકરણ નીચે મુજબ છે: ŷ = a + b·x
જ્યાં:
- b એ રેખાનો ઢાળ (Slope) છે, જે દર્શાવે છે કે x માં એક એકમનો ફેરફાર થતાં y માં સરેરાશ કેટલો ફેરફાર થાય છે.
- a એ y-અંતઃખંડ (Intercept) છે, જે દર્શાવે છે કે જ્યાં x નું મૂલ્ય 0 હોય ત્યાં રેખા y-અક્ષ પર કયા સ્થાને આવેલી છે.
ઇનપુટ સેટિંગ્સ અને ડેટા એન્ટ્રીના નિયમો
આ કેલ્ક્યુલેટર વપરાશકર્તાને તેમની અનુકૂળતા મુજબ ડેટા દાખલ કરવા માટે વિવિધ વિકલ્પો પ્રદાન કરે છે. ડેટા દાખલ કરતી વખતે નીચેના નિયમો અને મર્યાદાઓ લાગુ પડે છે:
- લેઆઉટ પસંદગી (Layout selection): વપરાશકર્તા "જોડી બનાવેલી રો" (દરેક રો માં એક x અને y) અથવા "બે યાદીઓ" (x અને y ના મૂલ્યો અલગ-અલગ ઇનપુટમાં) માંથી કોઈ પણ એક વિકલ્પ પસંદ કરી શકે છે.
- જોડી બનાવેલી રો: આ લેઆઉટમાં પહેલા x અને પછી y દાખલ કરવામાં આવે છે. સ્પ્રેડશીટમાંથી સીધી કોપી કરેલી બે કૉલમ અહીં પેસ્ટ કરી શકાય છે. જો પ્રથમ રો માં સંખ્યા સિવાયના અક્ષરો (જેમ કે હેડર ટેક્સ્ટ) હશે, તો ટૂલ તેને આપમેળે અવગણીને આગળ વધશે.
- બે યાદીઓ: આ લેઆઉટમાં "x મૂલ્યો (અનુમાનક)" અને "y મૂલ્યો (પ્રતિભાવ)" માટે અલગ ખાના મળે છે. બંને યાદીમાં સંખ્યા સમાન હોવી અનિવાર્ય છે.
- દશાંશ ચિહ્ન અને વિભાજક (Decimal separator):
- જો દશાંશ માટે ટપકાંનો ઉપયોગ (જેમ કે
12.5) કરવામાં આવે, તો યાદીના મૂલ્યોને સ્પેસ, અલ્પવિરામ (comma) અથવા નવી લાઇન વડે અલગ કરવાના રહેશે. - જો દશાંશ માટે અલ્પવિરામનો ઉપયોગ (જેમ કે
12,5) કરવામાં આવે, તો યાદીના મૂલ્યોને સ્પેસ, સેમિકોલન (semicolon) અથવા નવી લાઇન વડે અલગ કરવાના રહેશે.
- જો દશાંશ માટે ટપકાંનો ઉપયોગ (જેમ કે
- મર્યાદાઓ: કેલ્ક્યુલેટર ઓછામાં ઓછા 2 બિંદુઓથી લઈને વધુમાં વધુ 50,000 બિંદુઓ (અથવા 1 MB સુધીની પેસ્ટ કરેલી ટેક્સ્ટ) સપોર્ટ કરે છે.
- આગાહી: વપરાશકર્તા ચોક્કસ x મૂલ્યો પર y ની આગાહી મેળવવા માટે વધુમાં વધુ 50 મૂલ્યો સ્પેસ અથવા અલ્પવિરામ વડે અલગ કરીને દાખલ કરી શકે છે.
- વિશ્વાસનીયતા સ્તર: ગણતરીઓ અને ચાર્ટ બેન્ડ માટે 90%, 95% અથવા 99% નું સ્તર પસંદ કરી શકાય છે.
- દર્શાવેલ દશાંશ સ્થાનો: પરિણામોમાં ચોકસાઈ માટે 2, 4 અથવા 6 દશાંશ સ્થાનો સેટ કરી શકાય છે.
આ ટૂલ સંપૂર્ણપણે બ્રાઉઝર આધારિત છે. તમારા ડેટા બિંદુઓ અને દરેક આંકડા આ બ્રાઉઝરમાં જ રહે છે અને ક્યારેય અપલોડ થતા નથી, જેથી ડેટાની ગોપનીયતા જળવાઈ રહે છે. આ કેલ્ક્યુલેટરમાં કોઈ 'ગણતરી કરો' બટન નથી; તમે ડેટા દાખલ કરો કે તરત જ પરિણામો આપમેળે અપડેટ થાય છે.
ગાણિતિક સૂત્રો અને ગણતરીના તબક્કા
કેલ્ક્યુલેટર દ્વારા આંકડાકીય વિશ્લેષણ માટે નીચેના પ્રમાણિત સૂત્રોનો ઉપયોગ કરવામાં આવે છે:
૧. મધ્યક અને વિચલનની ગણતરી
- મધ્યક: x̄ = Σxᵢ ÷ n અને ȳ = Σyᵢ ÷ n
- વિચલન અને સહ-ચલન (Sums of Squares): Sxx = Σ(xᵢ − x̄)² Syy = Σ(yᵢ − ȳ)² Sxy = Σ(xᵢ − x̄)(yᵢ − ȳ)
૨. ઢાળ અને અંતઃખંડ
- ઢાળ (b): b = Sxy ÷ Sxx
- અંતઃખંડ (a): a = ȳ − b·x̄
૩. વિચરણ અને સહસંબંધ
- કુલ વર્ગોનો સરવાળો (SST): SST = Syy
- શેષ વર્ગોનો સરવાળો (SSE): SSE = Σ(yᵢ − ŷᵢ)²
- નિયતસંબંધ વર્ગોનો સરવાળો (SSR): SSR = SST − SSE
- સમજાવેલ વિચરણનો હિસ્સો (R²): R² = SSR ÷ SST
- સહસંબંધ (r): r = Sxy ÷ √(Sxx·Syy) (આ મૂલ્ય R² નું વર્ગમૂળ છે અને તે ઢાળની સંજ્ઞા ધરાવે છે)
- સમાયોજિત R² (Adjusted R²): Adjusted R² = 1 − (1 − R²)(n − 1) ÷ (n − 2)
- શેષ વિચલન (s): s = √(SSE ÷ (n − 2))
૪. પ્રમાણિત ભૂલ અને સાર્થકતા પરીક્ષણ (t-test)
- ઢાળની પ્રમાણિત ભૂલ: SE(b) = s ÷ √Sxx
- અંતઃખંડની પ્રમાણિત ભૂલ: SE(a) = s · √(1÷n + x̄² ÷ Sxx)
- t-આંકડો: t = અંદાજ ÷ પ્રમાણિત ભૂલ આ કિંમત n − 2 મુક્તિની માત્રા (degrees of freedom) પર દ્વિ-પક્ષીય પરીક્ષણ (two-sided test) માટે વપરાય છે. p-મૂલ્યની ગણતરી રેગ્યુલરાઇઝ્ડ ઇનકમ્પ્લીટ બીટા ફંક્શન દ્વારા થાય છે.
વિચરણનું વિભાજન (ANOVA)
કેલ્ક્યુલેટર મોડેલની સાર્થકતા ચકાસવા માટે ANOVA કોષ્ટક રજૂ કરે છે, જેમાં નીચે મુજબના સ્તંભો હોય છે:
| સ્ત્રોત (Source) | df (મુક્તિની માત્રા) | વર્ગોનો સરવાળો | મધ્યક વર્ગ | F | p |
|---|---|---|---|---|---|
| રેખા દ્વારા સમજાવેલ (Regression) | 1 | SSR | MSR = SSR ÷ 1 | MSR ÷ MSE | p-value |
| બાકી રહેલ (Residual) | n − 2 | SSE | MSE = SSE ÷ (n − 2) | - | - |
| કુલ (Total) | n − 1 | SST | - | - | - |
એક અનુમાનક ચલ હોવાને કારણે, સમગ્ર મોડેલનો F-આંકડો એ ઢાળના t-આંકડાના વર્ગ બરાબર થાય છે, તેથી બંને પરીક્ષણો હંમેશા સમાન p-મૂલ્ય દર્શાવે છે.
વિશિષ્ટ પરિસ્થિતિઓ અને ભૂલના સંદેશાઓ
ડેટાની સ્થિતિના આધારે કેલ્ક્યુલેટર ચોક્કસ ગાણિતિક મર્યાદાઓ અને ભૂલો દર્શાવે છે:
- બે બિંદુઓ (Exactly two points): જો માત્ર બે જ બિંદુઓ દાખલ કરવામાં આવે, તો રેખા બરાબર ફિટ થઈ જાય છે. આ સ્થિતિમાં કેલ્ક્યુલેટર સંદેશ દર્શાવે છે: "બે બિંદુઓ રેખાને બરાબર નિર્ધારિત કરે છે, તેથી અનિશ્ચિતતાનો અંદાજ લગાવવા માટે કંઈ બાકી રહેતું નથી."
- સંપૂર્ણ બંધબેસતી રેખા (Perfect fit): જો બધા બિંદુઓ રેખા પર જ આવેલા હોય, તો શેષ વિચલન શૂન્ય બને છે. આ સમયે સંદેશ દેખાય છે: "બિંદુઓ બરાબર રેખા પર જ આવેલા છે, તેથી કોઈ શેષ વિચલન નથી અને કોઈ અંતરાલ અથવા p-મૂલ્યનો અંદાજ લગાવી શકાતો નથી."
- સ્થિર Y મૂલ્યો (Constant Y): જો દરેક y મૂલ્ય સમાન હોય, તો રેખા સંપૂર્ણ સપાટ બને છે. આ સ્થિતિમાં સંદેશ દેખાય છે: "દરેક y સમાન છે, તેથી રેખા સપાટ છે અને r, R² તેમજ સાર્થકતા પરીક્ષણ અસ્પષ્ટ છે."
- શિરોલંબ રેખા (Constant X): જો દરેક x મૂલ્ય સમાન હોય, તો રેખા શિરોલંબ બને છે અને છેદમાં શૂન્ય આવતા ગણતરી અટકી જાય છે. આ સમયે ભૂલ દર્શાવાય છે: "દરેક x સમાન છે, તેથી રેખા શિરોલંબ બનશે અને ઢાળ શૂન્ય વડે ભાગાકાર કરશે."
અન્ય સામાન્ય ભૂલના સંદેશાઓ નીચે મુજબ છે:
- અપૂર્ણ જોડી: "રો
‹position›માં બરાબર બે સંખ્યાઓ હોવી જરૂરી છે: પહેલા x પછી y." - અસમાન યાદીઓ: "અહીં
‹countX›x મૂલ્યો અને‹countY›y મૂલ્યો છે — યાદીઓની લંબાઈ સમાન હોવી જોઈએ." - અપૂરતો ડેટા: "ઓછામાં ઓછા 2 બિંદુઓ દાખલ કરો; એક બિંદુ રેખા નક્કી કરતું નથી."
- મર્યાદા બહારનો ડેટા: "ડેટાને
‹max›બિંદુઓથી ઓછો રાખો." - ગાણિતિક ઓવરફ્લો: "મૂલ્ય અથવા મધ્યવર્તી પરિણામ સમર્થિત સંખ્યા શ્રેણી કરતાં વધી ગયું છે."
વારંવાર પૂછાતા પ્રશ્નો (FAQ)
R² મને વાસ્તવમાં શું જણાવે છે?
R² એ y માં થતી વધઘટનો તે હિસ્સો છે જે રેખા દ્વારા સ્પષ્ટ થાય છે: 0.96 નો અર્થ એ છે કે તેનો 96% ભાગ x સાથે સુસંગત છે અને 4% નથી. તે સીધી રેખા યોગ્ય આકાર હતી કે નહીં તે વિશે કંઈ કહેતું નથી — સ્પષ્ટ વક્ર પણ ઊંચો સ્કોર મેળવી શકે છે — તેથી તેને શેષ પ્લોટની સાથે વાંચો. સહસંબંધ r એ R² નું વર્ગમૂળ છે જે ઢાળની સંજ્ઞા ધરાવે છે, તેથી જ નીચે તરફ જતી રેખા માટે r ઋણ હોય છે.
હું કઈ કૉલમ x માં રાખું છું તેનાથી કોઈ ફરક પડે છે?
હા. ન્યૂનતમ વર્ગોની પદ્ધતિ શિરોલંબ અંતરને ન્યૂનતમ કરે છે, તેથી તે y ને સમજાવવામાં આવતી બાબત તરીકે અને x ને સમજાવનાર બાબત તરીકે ગણે છે. તેમને અરસપરસ બદલો અને તમને એક અલગ ઢાળ અને અલગ અંતઃખંડ મળશે — માત્ર r અને R² સમાન રહેશે. તમે જે ચલની આગાહી કરવા માંગો છો તેને y માં રાખો; જો કૉલમ ખોટી રીતે મુકાઈ ગઈ હોય, તો સ્વેપ બટન તેમને તે જ સ્થાને ફરીથી લખી દે છે.
આગાહીઓ બે અંતરાલ સાથે શા માટે આવે છે?
તેઓ અલગ-અલગ પ્રશ્નોના જવાબો આપે છે. મધ્યક અંતરાલ એ પૂછે છે કે તે x પર દરેક માટે સરેરાશ y ક્યાં આવેલો છે, તેથી માત્ર રેખાની પોતાની અનિશ્ચિતતા જ ગણતરીમાં લેવાય છે. વ્યક્તિગત અંતરાલ એ પૂછે છે કે એક નવું અવલોકન ક્યાં આવશે, જે રેખાની આસપાસના બિંદુઓના વિખેરણને ઉમેરે છે — તે વધારાના પદને કારણે જ તે હંમેશા બેમાંથી વધુ પહોળો હોય છે. જેમ જેમ x તમારા ડેટાની મધ્યથી દૂર જાય છે તેમ તેમ બંને પહોળા થાય છે.
શું નાના p-મૂલ્યનો અર્થ એ થાય કે x એ y નું કારણ બને છે?
ના. p-મૂલ્ય માત્ર એક મર્યાદિત પ્રશ્નનો જવાબ આપે છે: જો સાચો ઢાળ 0 હોત, તો આ કદનો નમૂનો કેટલી વાર 0 થી ઓછામાં ઓછો આટલો દૂરનો ઢાળ ઉત્પન્ન કરશે? નાનું મૂલ્ય “કોઈ સંબંધ જ નથી” તેવા ખુલાસાને અયોગ્ય બનાવે છે, બીજું કંઈ નહીં. કાર્યકારણ સંબંધ માટે અભ્યાસની ડિઝાઇન જવાબદાર હોવી જરૂરી છે — બંને કૉલમને અસર કરતું કોઈ ત્રીજું પરિબળ, અથવા સ્વતંત્ર રીતે એકત્રિત ન કરાયેલો નમૂનો પણ એટલી જ સરળતાથી નાના p-મૂલ્યો ઉત્પન્ન કરી શકે છે.