محاسبات ریاضی خط کمترین مربعات
روش کمترین مربعات معمولی (OLS) یک رویکرد استاندارد برای برازش مستقیم یک خط مستقیم بر روی دادههای جفتشده است. این روش با کمینهسازی مجموع مجذور تفاوتهای عمودی بین نقاط داده واقعی و خط برازششده کار میکند. برای دستیابی به بالاترین دقت محاسباتی، محاسبات آماری در دو مرحله با استفاده از الگوریتم جمع جبرانی انجام میشود تا مقادیر با اختلاف فاحش دچار کاهش دقت نشوند.
فرمولهای پایه برای استخراج ضرایب خط به شرح زیر است:
- مجموع مجذور انحرافات متغیر مستقل: Sxx = Σ(xᵢ − x̄)²
- مجموع مجذور انحرافات متغیر وابسته: Syy = Σ(yᵢ − ȳ)²
- مجموع ضرب انحرافات دو متغیر: Sxy = Σ(xᵢ − x̄)(yᵢ − ȳ)
با استفاده از این مقادیر، شیب خط (b) و عرض از مبدأ (a) محاسبه میشوند:
b = Sxy ÷ Sxx
a = ȳ − b·x̄
در این محاسبات، x̄ میانگین مقادیر x و ȳ میانگین مقادیر y است. پس از تعیین خط، مجموع مجذورات خطا (SSE)، مجموع مجذورات کل (SST) و مجموع مجذورات رگرسیون (SSR) برای ارزیابی کیفیت برازش به دست میآیند:
SSE = Σ(yᵢ − ŷᵢ)²
SST = Syy
SSR = SST − SSE
تفسیر ضرایب و معیارهای برازش
خروجیهای عددی این ابزار به شما امکان میدهد تا رفتار رابطه خطی بین دو متغیر را به طور دقیق تحلیل کنید. هر یک از این شاخصها مفهوم مشخصی را در دنیای واقعی نشان میدهند:
- شیب b: این ضریب نشاندهنده نرخ تغییرات است. به طور متوسط، به ازای هر ۱ واحد افزایش در x، مقدار y به اندازه
‹slope›تغییر میکند. - عرض از مبدأ a: نقطه تلاقی خط با محور عمودی را مشخص میکند. در جایی که x برابر با 0 است، خط در y =
‹intercept›قرار میگیرد. - همبستگی r: شدت و جهت رابطه خطی را نشان میدهد و علامت آن همواره با علامت شیب خط یکسان است.
- ضریب تعیین R²: سهمی از تغییرات متغیر پاسخ را که توسط خط رگرسیون توجیه میشود، اندازهگیری میکند.
- R² تعدیلشده: این معیار جریمهای را برای تعداد متغیرها اعمال میکند و به صورت زیر محاسبه میشود: Adjusted R² = 1 − (1 − R²)(n − 1) ÷ (n − 2)
- پراکندگی باقیمانده s: انحراف استاندارد خطاها را نشان میدهد که از فرمول زیر به دست میآید: s = √(SSE ÷ (n − 2))
راهنمای ورود دادهها و تنظیمات ابزار
این ابزار انعطافپذیری بالایی را برای وارد کردن دادهها فراهم کرده است و محاسبات را به صورت آنی و همزمان با تایپ یا جایگذاری دادهها انجام میدهد. برای کار با ابزار میتوانید تنظیمات زیر را اعمال کنید:
انتخاب چیدمان دادهها
شما میتوانید دادههای خود را به دو روش وارد کنید:
- ردیفهای جفتشده: در این حالت، در هر ردیف یک مقدار x و یک مقدار y وارد میشود. این حالت برای کپی و چسباندن مستقیم دو ستون داده از نرمافزارهای صفحهگسترده (مانند اکسل) بسیار مناسب است. اگر ردیف اول شامل متن (هدر ستونها) باشد، ابزار به طور خودکار آن را نادیده میگیرد.
- دو لیست: مقادیر متغیر پیشبینیکننده (x) و متغیر پاسخ (y) در دو جعبه متن مجزا وارد میشوند. تعداد اعضای هر دو لیست باید کاملاً برابر باشد.
قوانین جداسازی و محدودیتها
- جداکننده اعشار: ابزار از هر دو استاندارد نقطه (مانند
12.5) و کاما (مانند12,5) پشتیبانی میکند. - جداکننده مقادیر: در صورت استفاده از نقطه برای اعشار، مقادیر لیستها را با فاصله، کاما یا خط جدید جدا کنید. در صورت استفاده از کاما برای اعشار، از فاصله، نقطهویرگول یا خط جدید استفاده کنید.
- محدودیت حجم: ابزار حداقل به ۲ نقطه داده نیاز دارد و حداکثر تا ۵۰,۰۰۰ نقطه داده (یا ۱ مگابایت متن جایگذاریشده) را پشتیبانی میکند.
- تعداد ارقام اعشار: نمایش نتایج را میتوان روی ۲، ۴ یا ۶ رقم اعشار تنظیم کرد.
آزمون فرض و جدول آنالیز واریانس (ANOVA)
برای ارزیابی معناداری رابطه خطی، ابزار آزمون فرض را روی شیب خط انجام میدهد. فرض صفر بیان میکند که شیب خط برابر با صفر است (هیچ رابطه خطی وجود ندارد).
خطای استاندارد شیب خط به صورت زیر محاسبه میشود:
SE(b) = s ÷ √Sxx
آماره آزمون t از تقسیم برآورد شیب بر خطای استاندارد آن به دست میآید:
t = b ÷ SE(b)
مقدار p-value متناظر با این آماره بر اساس توزیع t با درجه آزادی n − 2 محاسبه میشود. در رگرسیون خطی ساده با یک متغیر پیشبینیکننده، آزمون F در جدول آنالیز واریانس (ANOVA) دقیقاً معادل مجذور آماره t است و هر دو آزمون یک مقدار p-value یکسان را گزارش میکنند. جدول ANOVA تغییرات کل را به دو بخش "توضیح داده شده توسط خط" (رگرسیون) و "باقیمانده" (خطا) تقسیم میکند.
شرایط مرزی و خطاهای محاسباتی
در هنگام تحلیل دادهها، برخی شرایط خاص ممکن است روند محاسبات ریاضی را متوقف کرده یا تغییر دهند:
- دقیقاً دو نقطه داده: در این حالت خط به طور کامل روی دو نقطه منطبق میشود. ابزار پیام زیر را نمایش میدهد: «دو نقطه خط را به طور دقیق مشخص میکنند، بنابراین چیزی برای برآورد عدم قطعیت باقی نمیماند.»
- انطباق کامل نقاط: اگر تمام نقاط بدون هیچ انحرافی روی خط قرار گیرند، پراکندگی باقیمانده صفر خواهد بود. پیام زیر نمایش داده میشود: «نقاط دقیقاً روی خط قرار دارند، بنابراین هیچ پراکندگی باقیماندهای وجود ندارد و هیچ بازه یا p-value قابل برآورد نیست.»
- مقادیر y یکسان: اگر تمام مقادیر متغیر پاسخ برابر باشند، خط کاملاً افقی میشود. پیام زیر نمایش داده میشود: «تمام مقادیر y یکسان هستند، بنابراین خط صاف است و r، R² و آزمون معناداری تعریفنشده هستند.»
- مقادیر x یکسان: اگر تمام مقادیر متغیر مستقل یکسان باشند، خط عمودی خواهد بود که مستلزم تقسیم بر صفر است. در این حالت محاسبات متوقف شده و خطای زیر نمایش داده میشود: «تمام مقادیر x یکسان هستند، بنابراین خط عمودی خواهد بود و شیب خط مستلزم تقسیم بر صفر است.»
حریم خصوصی و پردازش دادهها
امنیت اطلاعات کاربران در این ابزار به طور کامل رعایت میشود. تمامی فرآیندهای محاسباتی، پردازش دادهها و ترسیم نمودارها به طور مستقیم درون مرورگر وب کاربر انجام میگیرد. هیچ دادهای به سرورهای خارجی ارسال یا آپلود نمیشود.
پرسشهای متداول
چرا پیشبینیها با دو بازه ارائه میشوند؟
آنها به سوالات متفاوتی پاسخ میدهند. بازه میانگین میپرسد که میانگین y برای همه افراد در آن x کجاست، بنابراین فقط عدم قطعیت خود خط محاسبه میشود. بازه انفرادی میپرسد که یک مشاهده جدید در کجا قرار میگیرد، که پراکندگی نقاط حول خط را نیز اضافه میکند — این جمله اضافی دلیل آن است که این بازه همیشه پهنتر از دیگری است. هر دو بازه با دور شدن x از مرکز دادههای شما پهنتر میشوند.
ضریب R² دقیقاً چه چیزی را به من میگوید؟
ضریب R² سهمی از حرکت بالا و پایین در y است که خط آن را توجیه میکند: 0.96 یعنی ۹۶٪ آن با x همسو است و ۴٪ آن همسو نیست. این ضریب هیچ چیزی درباره اینکه آیا خط مستقیم شکل درستی بوده است یا خیر نمیگوید — یک منحنی واضح نیز همچنان میتواند نمره بالایی کسب کند — بنابراین آن را در کنار نمودار باقیماندهها بررسی کنید. ضریب همبستگی r ریشه دوم R² است که علامت شیب خط را به همراه دارد، به همین دلیل r برای یک خط رو به پایین منفی است.
آیا اهمیت دارد که کدام ستون را در x قرار دهم؟
بله. روش کمترین مربعات فاصلههای عمودی را به حداقل میرساند، بنابراین با y به عنوان متغیر توضیح داده شده و با x به عنوان متغیر توضیحدهنده رفتار میکند. اگر جای آنها را عوض کنید، شیب و عرض از مبدأ متفاوتی به دست خواهید آورد — فقط r و R² یکسان باقی میمانند. متغیری را که میخواهید پیشبینی کنید در y قرار دهید؛ اگر ستونها را برعکس وارد کردهاید، دکمه جابجایی آنها را در همانجا بازنویسی میکند.
آیا کوچک بودن p-value به این معنی است که x علت y است؟
خیر. مقدار p-value فقط به یک سوال محدود پاسخ میدهد: اگر شیب واقعی ۰ بود، هر چند وقت یکبار نمونهای با این اندازه شیبی حداقل به این دوری از ۰ ایجاد میکرد؟ یک مقدار کوچک صرفاً توضیح «عدم وجود هرگونه رابطه» را به فرضیهای دشوار تبدیل میکند، نه چیزی بیشتر. اثبات علیت به طراحی مطالعه بستگی دارد — یک عامل سوم که هر دو ستون را تغییر میدهد، یا نمونهای که به طور مستقل جمعآوری نشده است نیز به همین راحتی مقادیر p-value کوچکی تولید میکند.