선형 회귀 계산기

쌍으로 된 데이터에 최소제곱선을 적합시키고 기울기, R², p-값, 신뢰구간, 잔차 및 예측값을 한곳에서 확인해 보세요.

데이터

x를 먼저 입력한 다음 y를 입력하세요. 스프레드시트에서 복사한 두 열을 머리글 행을 포함하여 그대로 붙여넣을 수 있습니다. 소수점은 12.5와 같이 마침표를 사용하세요.
선택 사항. 최대 50개의 값을 공백으로 구분하여 입력하세요.

회귀선

최소제곱선

계수

추정치표준오차tp{level}% 구간

분산 분석

요인df제곱합평균제곱Fp

적합도 및 잔차

예측

평균 신뢰구간은 해당 x에서의 평균 y 범위를 나타냅니다. 개별 예측구간은 하나의 새로운 관측값 범위를 나타내므로 항상 더 넓습니다.

xŷ평균 {level}%개별 {level}%

포인트별 상세 정보

xyŷy − ŷ

공식 및 대입

b = Σ(x − x̄)(y − ȳ) ÷ Σ(x − x̄)²

a = ȳ − b·x̄

SSE = Σ(y − ŷ)²

SST = Σ(y − ȳ)²

R² = 1 − SSE ÷ SST

s = √(SSE ÷ (n − 2))

SE(b) = s ÷ √Σ(x − x̄)²

    모든 데이터 포인트와 통계치는 이 브라우저 내에 머무르며 외부로 전송되지 않습니다.

    자주 묻는 질문

    R²은 실제로 무엇을 알려주나요?

    R²(결정계수)은 y의 전체 변동 중 회귀선이 설명하는 비율을 나타냅니다. 예를 들어 0.96은 변동의 96%가 x와 정렬되어 있고 4%는 그렇지 않음을 의미합니다. R²은 직선이 데이터의 형태에 적합한 모형인지에 대해서는 아무것도 말해주지 않으므로(명확한 곡선 형태의 데이터도 높은 R² 점수를 얻을 수 있음), 반드시 잔차 산점도와 함께 확인해야 합니다. 상관계수 r은 R²의 제곱근에 기울기의 부호를 붙인 값이며, 이 때문에 우하향하는 선의 경우 r은 음수가 됩니다.

    작은 p-값은 x가 y의 원인임을 의미하나요?

    아닙니다. p-값은 오직 한 가지 좁은 질문에만 답합니다. 만약 실제 기울기가 0이라면, 이 정도 크기의 표본에서 기울기가 0으로부터 최소 이만큼 떨어진 결과가 얼마나 자주 나올 것인가 하는 점입니다. p-값이 작다는 것은 '아무런 관계가 없다'는 가설이 어색한 설명이 된다는 것을 의미할 뿐, 그 이상을 증명하지는 않습니다. 인과관계를 밝히려면 연구 설계가 뒷받침되어야 합니다. 두 열 모두에 영향을 주는 제3의 요인이 존재하거나 표본이 독립적으로 수집되지 않은 경우에도 p-값은 쉽게 작게 나타날 수 있습니다.

    예측 결과에 왜 두 가지 구간이 제공되나요?

    두 구간은 서로 다른 질문에 답합니다. 평균 신뢰구간은 해당 x 위치에서 모든 데이터의 평균 y가 어디에 위치하는지 묻는 것이므로, 회귀선 자체의 불확실성만 반영됩니다. 반면 개별 예측구간은 하나의 새로운 관측값이 어디에 떨어질지 묻는 것이므로, 회귀선 주변의 데이터 포인트들이 가지는 퍼짐 정도(잔차)가 추가됩니다. 이 추가적인 변동성 때문에 개별 예측구간이 항상 더 넓습니다. 두 구간 모두 x가 입력 데이터의 중심에서 멀어질수록 넓어집니다.

    어느 열을 x에 넣는지가 중요한가요?

    네, 그렇습니다. 최소제곱법은 수직 오차를 최소화하므로 y를 설명되는 대상(반응 변수)으로, x를 설명하는 도구(설명 변수)로 취급합니다. 두 변수를 바꾸면 기울기와 y절편이 달라지며, 오직 r과 R²만 동일하게 유지됩니다. 따라서 예측하고자 하는 변수를 y에 넣어야 합니다. 만약 열이 반대로 입력되었다면, 'x와 y 바꾸기' 버튼을 눌러 그 자리에서 바로 바꿀 수 있습니다.

    최소제곱법을 이용한 선형 회귀 분석

    선형 회귀 분석은 두 변수 사이의 선형 관계를 모델링하는 가장 기본적인 통계 방법입니다. 선형 회귀 계산기는 입력된 데이터 포인트들에 대해 잔차의 제곱합을 최소화하는 최소제곱선(least-squares line)을 구합니다. 이 과정에서 독립 변수인 x는 설명 변수(predictor)가 되고, 종속 변수인 y는 반응 변수(response)가 됩니다.

    최소제곱법은 각 데이터 포인트에서 회귀선까지의 수직 거리(잔차)를 제곱하여 합산한 값을 최소화하는 방식으로 기울기와 y절편을 결정합니다. 계산기는 수치적 정밀도를 유지하기 위해 두 번의 패스를 거치는 보상 합산(compensated summation) 방식을 사용하여 편차제곱합 Sxx, Syy 및 편차곱합 Sxy를 계산합니다. 이를 통해 크기 차이가 매우 큰 데이터가 입력되더라도 정밀도 손실 없이 정확한 결과를 도출합니다.

    입력 데이터 구성 및 제약 조건

    데이터는 사용자의 편의에 따라 두 가지 레이아웃 중 하나를 선택하여 입력할 수 있습니다. "쌍으로 된 행" 레이아웃은 한 행에 하나의 x와 y를 공백이나 쉼표로 구분하여 입력하는 방식이며, 스프레드시트에서 두 개의 열을 머리글 행을 포함하여 그대로 복사하고 붙여넣을 수 있습니다. 첫 번째 행의 두 입력값이 모두 숫자가 아닌 경우 머리글로 인식하여 자동으로 제외합니다. "두 개의 목록" 레이아웃은 x 값과 y 값을 각각 독립된 입력란에 나열하는 방식입니다.

    안정적인 계산을 위해 도구는 다음과 같은 입력 규칙과 한계치를 적용합니다.

    • 데이터 크기 제한: 최소 2개의 포인트가 필요하며, 최대 50,000개의 포인트(텍스트 용량 기준 1 MB)까지 입력할 수 있습니다.
    • 구분자 규칙: 소수점 기호로 마침표(dot)를 사용할 때는 공백, 쉼표, 줄바꿈으로 값을 구분합니다. 소수점 기호로 쉼표(comma)를 사용할 때는 공백, 세미콜론, 줄바꿈으로 값을 구분해야 합니다.
    • 예측 입력: "x에 대한 y 예측" 칸에 최대 50개 이하의 x 값을 입력하면 해당 위치에서의 y 예측값과 신뢰구간을 동시에 계산합니다.

    특정 데이터 분포에서는 수학적 한계로 인해 계산이 제한되거나 경고 메시지가 표시됩니다.

    • 수직선 오류: 모든 x 값이 동일한 경우, 회귀선이 수직선이 되어 분모가 0이 되므로 "모든 x 값이 동일하여 수직선이 되므로, 기울기 계산 시 0으로 나누게 됩니다."라는 오류가 발생하고 계산이 중단됩니다.
    • 상수 Y 값: 모든 y 값이 동일하면 회귀선이 완전히 평평해지며, "모든 y 값이 동일하여 회귀선이 평평하므로 r, R² 및 유의성 검정을 정의할 수 없습니다."라는 상태 메시지가 표시됩니다.
    • 정확히 두 개의 포인트: 데이터가 단 2개뿐인 경우 선이 완벽하게 결정되므로 "두 개의 포인트는 선을 정확히 결정하므로, 불확실성을 추정하기 위한 잔차가 남지 않습니다."라는 메시지가 나타납니다.
    • 완벽한 적합: 모든 포인트가 회귀선 위에 정확히 일치하여 오차가 없는 경우 "포인트들이 회귀선 위에 정확히 위치하므로 잔차의 퍼짐이 없으며, 신뢰구간이나 p-값을 추정할 수 없습니다."라는 메시지가 표시됩니다.

    회귀 분석 결과의 통계적 해석

    계산이 완료되면 회귀 모델의 특성을 설명하는 다양한 통계 지표가 제공됩니다.

    회귀선 요약 및 계수

    • 기울기 b: "평균적으로 x가 1만큼 증가할 때마다 y는 ‹slope›만큼 변합니다."라는 의미를 가집니다.
    • y절편 a: "x가 0일 때 회귀선은 y = ‹intercept›에 위치합니다."를 나타냅니다.
    • 상관계수 r 및 결정계수 R²: r은 두 변수 간의 선형 관계 강도와 방향을 나타내며, R²은 y의 전체 변동 중 회귀선이 설명하는 비율을 의미합니다. "조정된 R²"은 자유도를 고려하여 보정된 값입니다.

    계수 테이블

    "기울기 b"와 "y절편 a"에 대해 각각 "추정치", "표준오차", "t", "p", 그리고 선택한 신뢰수준에 따른 "‹level›% 구간"이 제공됩니다. t-통계량은 추정치를 표준오차로 나눈 값이며, p-값은 자유도 n − 2에서의 양측 검정을 통해 계산됩니다.

    분산 분석 (ANOVA) 테이블

    전체 변동을 회귀선으로 설명되는 부분("회귀선으로 설명됨")과 설명되지 않는 오차 부분("잔차 (설명되지 않음)")으로 나누어 분석합니다. "요인", "df"(자유도), "제곱합", "평균제곱", "F", "p" 열을 통해 모델의 전반적인 유의성을 검정합니다. 단일 설명 변수를 사용하는 단순 선형 회귀에서 F-검정의 p-값은 기울기 t-검정의 p-값과 항상 일치합니다.

    공식 및 단계별 대입 과정

    계산기는 투명한 검증을 위해 다음과 같은 수학적 대입 단계를 순서대로 보여줍니다.

    1. 평균 계산: 평균: x̄ = ‹sumX› ÷ ‹n› = ‹meanX› 및 ȳ = ‹sumY› ÷ ‹n› = ‹meanY›
    2. 편차곱 계산: 편차제곱합 및 편차곱합: Sxx = ‹sxx› 및 Sxy = ‹sxy›
    3. 기울기 도출: 기울기: b = Sxy ÷ Sxx = ‹sxy› ÷ ‹sxx› = ‹slope›
    4. y절편 도출: y절편: a = ȳ − b·x̄ = ‹meanY› − (‹slope›)·‹meanX› = ‹intercept›
    5. 결정계수: 설명된 변동의 비율: R² = SSR ÷ SST = ‹ssr› ÷ ‹sst› = ‹r2›
    6. 잔차 표준편차: 잔차의 퍼짐 정도: s = √(SSE ÷ (n − 2)) = √(‹sse› ÷ ‹df›) = ‹s›
    7. 기울기 표준오차: 기울기의 표준오차: SE(b) = s ÷ √Sxx = ‹s› ÷ √‹sxx› = ‹se›
    8. 유의성 검정: t = b ÷ SE(b) = ‹slope› ÷ ‹se› = ‹t›, 자유도 ‹df›에서 p = ‹p›입니다.

    데이터 프라이버시 및 처리 방식

    모든 데이터 포인트와 통계치는 이 브라우저 내에 머무르며 외부로 전송되지 않습니다.

    자주 묻는 질문 (FAQ)

    Q: 어느 열을 x에 넣는지가 중요한가요?
    A: 네, 그렇습니다. 최소제곱법은 수직 오차를 최소화하므로 y를 설명되는 대상(반응 변수)으로, x를 설명하는 도구(설명 변수)로 취급합니다. 두 변수를 바꾸면 기울기와 y절편이 달라지며, 오직 r과 R²만 동일하게 유지됩니다. 따라서 예측하고자 하는 변수를 y에 넣어야 합니다. 만약 열이 반대로 입력되었다면, 'x와 y 바꾸기' 버튼을 눌러 그 자리에서 바로 바꿀 수 있습니다.

    Q: R²은 실제로 무엇을 알려주나요?
    A: R²(결정계수)은 y의 전체 변동 중 회귀선이 설명하는 비율을 나타냅니다. 예를 들어 0.96은 변동의 96%가 x와 정렬되어 있고 4%는 그렇지 않음을 의미합니다. R²은 직선이 데이터의 형태에 적합한 모형인지에 대해서는 아무것도 말해주지 않으므로(명확한 곡선 형태의 데이터도 높은 R² 점수를 얻을 수 있음), 반드시 잔차 산점도와 함께 확인해야 합니다. 상관계수 r은 R²의 제곱근에 기울기의 부호를 붙인 값이며, 이 때문에 우하향하는 선의 경우 r은 음수가 됩니다.

    Q: 작은 p-값은 x가 y의 원인임을 의미하나요?
    A: 아닙니다. p-값은 오직 한 가지 좁은 질문에만 답합니다. 만약 실제 기울기가 0이라면, 이 정도 크기의 표본에서 기울기가 0으로부터 최소 이만큼 떨어진 결과가 얼마나 자주 나올 것인가 하는 점입니다. p-값이 작다는 것은 '아무런 관계가 없다'는 가설이 어색한 설명이 된다는 것을 의미할 뿐, 그 이상을 증명하지는 않습니다. 인과관계를 밝히려면 연구 설계가 뒷받침되어야 합니다. 두 열 모두에 영향을 주는 제3의 요인이 존재하거나 표본이 독립적으로 수집되지 않은 경우에도 p-값은 쉽게 작게 나타날 수 있습니다.

    Q: 예측 결과에 왜 두 가지 구간이 제공되나요?
    A: 두 구간은 서로 다른 질문에 답합니다. 평균 신뢰구간은 해당 x 위치에서 모든 데이터의 평균 y가 어디에 위치하는지 묻는 것이므로, 회귀선 자체의 불확실성만 반영됩니다. 반면 개별 예측구간은 하나의 새로운 관측값이 어디에 떨어질지 묻는 것이므로, 회귀선 주변의 데이터 포인트들이 가지는 퍼짐 정도(잔차)가 추가됩니다. 이 추가적인 변동성 때문에 개별 예측구간이 항상 더 넓습니다. 두 구간 모두 x가 입력 데이터의 중심에서 멀어질수록 넓어집니다.