Калькулятор линейной регрессии

Постройте линию наименьших квадратов по парным данным и получите угловой коэффициент, R², p-value, доверительные интервалы, остатки и прогнозы в одном месте.

Данные

Сначала укажите x, затем y. Две колонки, скопированные из таблицы, вставляются напрямую, включая строку заголовков. Используйте запятую для десятичных дробей, например 12,5.
Необязательно. До 50 значений, разделенных пробелами.

Уравнение регрессии

Линия наименьших квадратов

Коэффициенты

ЧленОценкаСтанд. ошибкаtp{level}% интервал

Объясненная дисперсия

ИсточникdfСумма квадратовСредний квадратFp

Соответствие и остатки

Прогнозы

Интервал для среднего оценивает среднее значение y при данном x. Интервал для индивидуального значения оценивает одно новое наблюдение, поэтому он всегда шире.

xŷСредний {level}%Индивидуальный {level}%

Поточечный анализ

xyŷy − ŷ

Формула и подстановка

b = Σ(x − x̄)(y − ȳ) ÷ Σ(x − x̄)²

a = ȳ − b·x̄

SSE = Σ(y − ŷ)²

SST = Σ(y − ȳ)²

R² = 1 − SSE ÷ SST

s = √(SSE ÷ (n − 2))

SE(b) = s ÷ √Σ(x − x̄)²

    Все ваши точки данных и статистические расчеты остаются в этом браузере и никогда не отправляются на сервер.

    Частые вопросы

    Что на самом деле показывает R²?

    R² — это доля изменчивости y, которая объясняется линией регрессии: 0,96 означает, что 96% изменений соответствуют x, а 4% — нет. Он ничего не говорит о том, была ли прямая линия правильной формой связи (выраженная кривая все равно может показать высокий результат), поэтому оценивайте его вместе с графиком остатков. Коэффициент корреляции r — это квадратный корень из R² со знаком углового коэффициента, поэтому r отрицателен для убывающей линии.

    Означает ли малое значение p-value, что x является причиной y?

    Нет. Значение p-value отвечает только на один узкий вопрос: если бы истинный угловой коэффициент был равен 0, как часто выборка такого размера давала бы коэффициент, настолько удаленный от 0? Малое значение лишь делает гипотезу об «отсутствии какой-либо связи» сомнительной, и ничего более. Для установления причинно-следственной связи необходим правильный дизайн исследования — третий фактор, влияющий на обе колонки, или неслучайная выборка могут так же легко давать малые значения p-value.

    Почему прогнозы содержат два интервала?

    Они отвечают на разные вопросы. Доверительный интервал для среднего оценивает, где находится среднее значение y для всех объектов при данном x, поэтому учитывается только неопределенность самой линии. Интервал для индивидуального значения оценивает, куда попадет одно новое наблюдение, что добавляет разброс точек вокруг линии — из-за этого дополнительного слагаемого он всегда шире. Оба интервала расширяются по мере удаления x от центра ваших данных.

    Имеет ли значение, какую колонку я помещу в x?

    Да. Метод наименьших квадратов минимизирует вертикальные отклонения, поэтому он рассматривает y как объясняемую переменную, а x — как объясняющую. Поменяйте их местами, и вы получите другой угловой коэффициент и другой свободный член — неизменными останутся только r и R². Помещайте переменную, которую хотите спрогнозировать, в y; если колонки были введены неверно, кнопка смены мест перезапишет их прямо на месте.

    Метод наименьших квадратов и линейная зависимость

    В основе линейной регрессии лежит метод наименьших квадратов (OLS), который находит прямую линию, минимизирующую сумму квадратов вертикальных отклонений (остатков) между наблюдаемыми точками данных и предсказанными значениями. Этот математический подход позволяет объективно описать взаимосвязь между независимой переменной (предиктором x) и зависимой переменной (откликом y).

    Расчет параметров регрессии начинается с вычисления средних значений выборки и сумм квадратов отклонений. Чтобы избежать потери точности при работе с числами разного порядка, вычисления производятся в два прохода с использованием компенсированного суммирования:

    • Средние значения: x̄ = Σ xᵢ ÷ n и ȳ = Σ yᵢ ÷ n
    • Суммы квадратов отклонений: Sₓₓ = Σ(xᵢ - x̄)², S_yy = Σ(yᵢ - ȳ)², Sₓy = Σ(xᵢ - x̄)(yᵢ - ȳ)

    На основе этих величин вычисляются ключевые коэффициенты уравнения прямой y = a + bx:

    • Угловой коэффициент (направление и крутизна наклона): b = Sₓy ÷ Sₓₓ
    • Свободный член (пересечение с осью ординат): a = ȳ - b · x̄

    Инструмент мгновенно выполняет эти расчеты по мере ввода данных, избавляя от необходимости нажимать кнопку вычисления. Все операции выполняются локально: ваши точки данных и статистические расчеты остаются в этом браузере и никогда не отправляются на сервер.

    Интерпретация коэффициентов и показателей связи

    Полученные коэффициенты уравнения регрессии имеют конкретное практическое значение для анализа данных:

    • Угловой коэффициент b: показывает интенсивность изменения отклика. В среднем y изменяется на ‹slope› при увеличении x на 1.
    • Свободный член a: определяет стартовую точку модели. В точке, где x равен 0, линия находится на уровне y = ‹intercept›.

    Для оценки тесноты связи и качества построенной модели используются следующие статистические показатели:

    • Корреляция r: коэффициент корреляции Пирсона, отражающий силу и направление линейной связи. Он рассчитывается как r = Sₓy ÷ √(Sₓₓ · S_yy) и сохраняет знак углового коэффициента.
    • R² (Коэффициент детерминации): доля дисперсии зависимой переменной, объясненная моделью. Вычисляется через отношение суммы квадратов регрессии (SSR) к общей сумме квадратов (SST): R² = SSR ÷ SST, где SST = S_yy и SSR = SST - SSE.
    • Скорректированный R²: корректирует значение R² с учетом числа степеней свободы, что важно для объективной оценки моделей: Adjusted R² = 1 - (1 - R²)(n - 1) ÷ (n - 2).
    • Стандартная ошибка остатков s: мера разброса наблюдаемых точек вокруг построенной линии регрессии, рассчитываемая как s = √(SSE ÷ (n - 2)).

    Проверка гипотез и статистическая значимость

    Для определения того, является ли выявленная взаимосвязь статистически значимой или она возникла случайно, калькулятор выполняет проверку гипотез. Нулевая гипотеза предполагает, что истинный угловой коэффициент равен нулю (связь отсутствует).

    В таблице «Коэффициенты» для каждого параметра рассчитываются:

    1. Станд. ошибка (SE): стандартная ошибка оценки коэффициента. Для наклона она равна SE(b) = s ÷ √(Sₓₓ), а для свободного члена — SE(a) = s · √(1 ÷ n + x̄² ÷ Sₓₓ).
    2. t-статистика: отношение оценки коэффициента к его стандартной ошибке.
    3. p-value: двусторонний уровень значимости, рассчитываемый на основе регулярной неполной бета-функции с n - 2 степенями свободы.
    4. ‹level›% интервал: доверительный интервал для параметров, определяемый как Оценка ± t_(1-α/2, n-2) × Станд. ошибка.

    Также строится таблица дисперсионного анализа (ANOVA) с колонками: Источник, df, Сумма квадратов, Средний квадрат, F и p. Строки таблицы включают категории: «Объяснено линией», «Остаток» и «Итого». Поскольку в модели присутствует только один предиктор, критерий F и критерий t для углового коэффициента всегда дают одинаковое p-value.


    Анализ остатков и диагностика модели

    Качественный регрессионный анализ невозможен без исследования остатков (y - ŷ). Калькулятор строит два типа графиков в разделе «Соответствие и остатки»:

    • Линия регрессии: Диаграмма рассеяния точек с линией наименьших квадратов и доверительной полосой вокруг ее среднего значения.
    • Остатки: График остатков относительно x, распределенных вокруг нулевой линии.

    Анализ этих графиков позволяет выявить систематические отклонения. Если остатки распределены хаотично и равномерно вокруг нулевой линии, предпосылки регрессионного анализа выполняются. Наличие выраженных изгибов указывает на нелинейный характер связи, а расширение разброса (веерообразная форма) свидетельствует о гетероскедастичности, что делает стандартные оценки ошибок ненадежными.


    Прогнозирование и доверительные интервалы

    Калькулятор позволяет рассчитывать прогнозные значения y₀ для заданных значений x₀. Для каждого прогноза рассчитываются два типа интервалов с выбранным уровнем доверия (90%, 95% или 99%):

    • Средний ‹level›% (Доверительный интервал для среднего): оценивает неопределенность положения самой линии регрессии. Стандартная ошибка среднего отклика рассчитывается как s · √(1 ÷ n + (x₀ - x̄)² ÷ Sₓₓ).
    • Индивидуальный ‹level›% (Прогнозный интервал): оценивает диапазон значений для одного нового наблюдения. Его стандартная ошибка равна s · √(1 + 1 ÷ n + (x₀ - x̄)² ÷ Sₓₓ).

    Поскольку прогнозный интервал учитывает как неопределенность положения линии, так и случайный разброс точек вокруг нее, он всегда шире доверительного интервала для среднего. Оба интервала закономерно расширяются по мере удаления x₀ от выборочного среднего x. Если вводимое значение x выходит за пределы исходных данных, калькулятор выводит предупреждение «вне диапазона данных».


    Правила подготовки и ввода данных

    Для корректной работы калькулятора необходимо соблюдать следующие правила:

    • Формат ввода: Доступны режимы «Парные строки» (удобно для копирования двух колонок из таблиц, первая строка с текстом автоматически распознается как заголовок и пропускается) и «Два списка».
    • Разделители: При использовании точки в качестве десятичного разделителя списки разделяются пробелами, запятыми или переносом строки. При выборе запятой в качестве десятичного разделителя элементы списков разделяются пробелами, точкой с запятой или переносом строки.
    • Ограничения: Минимальный объем данных — 2 точки. Максимальный объем — 50 000 точек (размер текста до 1 МБ). Для прогнозирования можно указать до 50 значений x одновременно.

    Особые математические случаи и ошибки

    Ситуация Поведение калькулятора / Сообщение об ошибке
    Введено ровно две точки Две точки точно определяют линию, поэтому не остается данных для оценки неопределенности.
    Все точки лежат строго на одной прямой Точки лежат точно на линии, поэтому остаточный разброс отсутствует, и невозможно оценить интервалы или p-value.
    Все значения y идентичны Все значения y одинаковы, поэтому линия горизонтальна, а r, R² и тест на значимость не определены.
    Все значения x идентичны Все значения x одинаковы, поэтому линия была бы вертикальной, а при расчете углового коэффициента происходит деление на ноль.
    Некорректный символ в строке «‹token›» не является числом (строка ‹position›).
    Неполная пара данных Строка ‹position› должна содержать ровно два числа: сначала x, затем y.
    Разная длина списков x и y Обнаружено ‹countX› значений x и ‹countY› значений y — списки должны быть одинаковой длины.

    Часто задаваемые вопросы

    Имеет ли значение, какую колонку я помещу в x?
    Да. Метод наименьших квадратов минимизирует вертикальные отклонения, поэтому он рассматривает y как объясняемую переменную, а x — как объясняющую. Поменяйте их местами, и вы получите другой угловой коэффициент и другой свободный член — неизменными останутся только r и R². Помещайте переменную, которую хотите спрогнозировать, в y; если колонки были введены неверно, кнопка смены мест перезапишет их прямо на месте.

    Что на самом деле показывает R²?
    R² — это доля изменчивости y, которая объясняется линией регрессии: 0,96 означает, что 96% изменений соответствуют x, а 4% — нет. Он ничего не говорит о том, была ли прямая линия правильной формой связи (выраженная кривая все равно может показать высокий результат), поэтому оценивайте его вместе с графиком остатков. Коэффициент корреляции r — это квадратный корень из R² со знаком углового коэффициента, поэтому r отрицателен для убывающей линии.

    Почему прогнозы содержат два интервала?
    Они отвечают на разные вопросы. Доверительный интервал для среднего оценивает, где находится среднее значение y для всех объектов при данном x, поэтому учитывается только неопределенность самой линии. Интервал для индивидуального значения оценивает, куда попадет одно новое наблюдение, что добавляет разброс точек вокруг линии — из-за этого дополнительного слагаемого он всегда шире. Оба интервала расширяются по мере удаления x от центра ваших данных.

    Означает ли малое значение p-value, что x является причиной y?
    Нет. Значение p-value отвечает только на один узкий вопрос: если бы истинный угловой коэффициент был равен 0, как часто выборка такого размера давала бы коэффициент, настолько удаленный от 0? Малое значение лишь делает гипотезу об «отсутствии какой-либо связи» сомнительной, и ничего более. Для установления причинно-следственной связи необходим правильный дизайн исследования — третий фактор, влияющий на обе колонки, или неслучайная выборка могут так же легко давать малые значения p-value.