Calculateur de régression linéaire

Ajustez une droite des moindres carrés à des données appariées et lisez sa pente, son R², sa valeur p, ses intervalles de confiance, ses résidus et ses prédictions au même endroit.

Données

Saisissez x en premier, puis y. Deux colonnes copiées depuis un tableur se collent directement, ligne d'en-tête incluse. Utilisez une virgule pour les décimales, comme 12,5.
Facultatif. Jusqu'à 50 valeurs, séparées par des espaces.

Droite de régression

Droite des moindres carrés

Coefficients

TermeEstimationErreur-typetpIntervalle {level} %

Variance expliquée

Source des donnéesddlSomme des carrésCarré moyenFp

Ajustement et résidus

Prédictions

L'intervalle moyen couvre le y moyen à ce x. L'intervalle individuel couvre une nouvelle observation unique, il est donc toujours plus large.

xŷMoyen {level} %Individuel {level} %

Point par point

xyŷy − ŷ

Formule et substitution

b = Σ(x − x̄)(y − ȳ) ÷ Σ(x − x̄)²

a = ȳ − b·x̄

SSE = Σ(y − ŷ)²

SST = Σ(y − ȳ)²

R² = 1 − SSE ÷ SST

s = √(SSE ÷ (n − 2))

SE(b) = s ÷ √Σ(x − x̄)²

    Vos points de données et chaque statistique restent dans ce navigateur et ne sont jamais téléversés.

    FAQ

    Que m'indique réellement le R² ?

    Le R² représente la part de la variation verticale de y expliquée par la droite : 0,96 signifie que 96 % de cette variation s'aligne avec x et que 4 % n'y est pas lié. Il ne dit pas si une ligne droite était la forme appropriée — une courbe prononcée peut tout de même obtenir un score élevé — lisez-le donc en parallèle avec le graphique des résidus. La corrélation r est la racine carrée de R² portant le signe de la pente, c'est pourquoi r est négatif pour une droite descendante.

    Une petite valeur p signifie-t-elle que x cause y ?

    Non. La valeur p ne répond qu'à une seule question étroite : si la vraie pente était de 0, à quelle fréquence un échantillon de cette taille produirait-il une pente au moins aussi éloignée de 0 ? Une petite valeur rend simplement l'explication « aucun lien du tout » peu plausible, rien de plus. La causalité nécessite une étude bien conçue — un troisième facteur influençant les deux colonnes, ou un échantillon qui n'a pas été collecté de manière indépendante, produit tout aussi facilement de petites valeurs p.

    Pourquoi les prédictions sont-elles accompagnées de deux intervalles ?

    Ils répondent à des questions différentes. L'intervalle moyen cherche à savoir où se situe le y moyen pour l'ensemble de la population à ce x donné, de sorte que seule l'incertitude de la droite elle-même compte. L'intervalle individuel cherche à savoir où se situera une nouvelle observation unique, ce qui ajoute la dispersion des points autour de la droite — cette incertitude supplémentaire explique pourquoi il est toujours le plus large des deux. Les deux s'élargissent à mesure que x s'éloigne du centre de vos données.

    L'attribution des colonnes à x ou y a-t-elle une importance ?

    Oui. La méthode des moindres carrés minimise les écarts verticaux, elle traite donc y comme la variable expliquée et x comme la variable explicative. Si vous les inversez, vous obtiendrez une pente et une ordonnée à l'origine différentes — seuls r et R² restent inchangés. Placez la variable que vous souhaitez prédire dans y ; si les colonnes ont été saisies dans le mauvais sens, le bouton d'inversion les réécrit directement sur place.

    Les fondements mathématiques de la régression linéaire par les moindres carrés

    La régression linéaire simple est une méthode statistique qui permet de modéliser la relation entre une variable explicative x et une variable expliquée y. Le principe de la méthode des moindres carrés ordinaires (MCO) consiste à ajuster une droite d'équation y = a + b · x de manière à minimiser la somme des carrés des écarts verticaux entre les points observés et la droite.

    Pour garantir une précision maximale lors des calculs, les sommes des carrés sont évaluées en deux passes à l'aide d'un algorithme de sommation compensée. Cette approche évite la perte de précision numérique lorsque les ordres de grandeur des données sont très éloignés. Les formules de base s'appuient sur les écarts aux moyennes x et y:

    • Sₓₓ = Σ(xᵢ - x̄)²
    • S_yy = Σ(yᵢ - ȳ)²
    • Sₓy = Σ(xᵢ - x̄)(yᵢ - ȳ)

    À partir de ces sommes, la pente b et l'ordonnée à l'origine a sont définies par:

    b = Sₓy / Sₓₓ a = ȳ - b · x̄

    Le calcul de la dispersion des données s'effectue en séparant la variabilité totale. La somme totale des carrés (SST = S_yy) mesure la variation globale de y. La somme des carrés des résidus (SSE = Σ(yᵢ - ŷᵢ)²) quantifie la part non expliquée, tandis que la somme des carrés de la régression (SSR = SST - SSE) représente la part expliquée par la droite.

    Interprétation des coefficients et de la variance

    Chaque coefficient de la droite de régression possède une signification concrète:

    • Pente b: En moyenne, y varie de ‹slope› pour chaque augmentation de 1 unité de x.
    • Ordonnée à l'origine a: Lorsque x vaut 0, la droite se situe à y = ‹intercept›.

    Pour évaluer la qualité de l'ajustement, l'outil calcule plusieurs indicateurs de corrélation et de variance:

    • Corrélation r: Ce coefficient mesure la force et la direction de la relation linéaire. Il équivaut à Sₓy ÷ √(Sₓₓ · S_yy) et porte le signe de la pente.
    • R² (Coefficient de détermination): Il représente la part de la variation expliquée par la droite (R² = SSR ÷ SST).
    • R² ajusté: Il ajuste le R² en fonction du nombre de degrés de liberté, calculé par la formule 1 - (1 - R²)(n - 1) ÷ (n - 2).
    • Dispersion des résidus s: Elle correspond à l'écart-type des résidus, défini par s = √(MSE) = √(SSE ÷ (n - 2)).

    Tests d'hypothèse et intervalles de confiance

    L'analyse de la signification statistique de la pente et de l'ordonnée à l'origine repose sur le calcul de leurs erreurs-types respectives:

    SE(b) = s / (√(Sₓₓ)) SE(a) = s · √(1 / n + (x̄²) / Sₓₓ)

    La statistique de test t est le rapport entre l'estimation du coefficient et son erreur-type. Elle suit une loi de Student à n - 2 degrés de liberté. La valeur p bilatérale associée est calculée via la fonction bêta incomplète régularisée I_{ u/( u+t^2)}( u/2, 1/2) où u = n - 2. Dans le cadre d'une régression linéaire simple, le test F global de la table d'analyse de la variance (ANOVA) équivaut au carré de la statistique t de la pente, ce qui explique pourquoi les deux tests affichent toujours la même valeur p.

    L'intervalle de confiance pour chaque coefficient à un niveau de confiance choisi (90%, 95% ou 99%) est déterminé par:

    Estimation ± t_(1-α/2, n-2) × Erreur-type


    Analyse des résidus et prédictions

    La prédiction d'une valeur y₀ pour une coordonnée spécifique x₀ s'accompagne de deux types d'intervalles de confiance, dont la précision dépend de la distance entre x₀ et la moyenne x:

    1. Intervalle moyen: Il encadre la réponse moyenne de la population pour un x₀ donné. Son erreur-type est s · √(1/n + (x₀ - x̄)² ÷ Sₓₓ).
    2. Intervalle individuel: Il estime la valeur d'une nouvelle observation unique. Son erreur-type intègre la variabilité résiduelle supplémentaire, soit s · √(1 + 1/n + (x₀ - x̄)² ÷ Sₓₓ). C'est pourquoi l'intervalle individuel est systématiquement plus large que l'intervalle moyen.

    Le graphique des résidus, qui représente les écarts y - ŷ par rapport à la ligne zéro, est indispensable pour valider les hypothèses du modèle (homoscédasticité, absence de structure non linéaire).


    Fonctionnalités et limites du calculateur

    Le calculateur traite l'intégralité des données localement. Vos points de données et chaque statistique restent dans ce navigateur et ne sont jamais téléversés. Les résultats se mettent à jour en temps réel au fil de la saisie, sans bouton de validation.

    Options de saisie et de mise en page

    • Disposition: Vous pouvez choisir entre "Lignes appariées", dont le champ est intitulé "Un x et un y par ligne" (un couple x et y par ligne, idéal pour copier-coller depuis un tableur) ou "Deux listes" (les valeurs de x et de y séparées).
    • Gestion des en-têtes: Si la première ligne saisie contient des caractères non numériques, elle est automatiquement ignorée et traitée comme une ligne d'en-tête.
    • Inverser x et y: Cette action permet d'échanger instantanément les variables. La méthode des moindres carrés minimisant les écarts verticaux, l'inversion modifie la pente et l'ordonnée à l'origine; seuls r et R² restent inchangés.
    • Limites physiques: Le calculateur accepte entre 2 et 50 000 points (dans la limite de 1 Mo de texte) et jusqu'à 50 prédictions simultanées.

    Cas particuliers et messages d'erreur

    • Deux points exacts: L'outil affiche "Deux points définissent exactement la droite, il ne reste donc rien pour estimer l'incertitude.".
    • Ajustement parfait: Si tous les points sont alignés, le message "Les points se situent exactement sur la droite, il n'y a donc aucune dispersion des résidus et aucun intervalle ni valeur p ne peut être estimé." apparaît.
    • Y constant: Si toutes les valeurs de y sont identiques, la droite est horizontale. L'outil indique: "Toutes les valeurs y sont identiques, la droite est donc plate et r, R² ainsi que le test de significativité ne sont pas définis.".
    • X constant: Si toutes les valeurs de x sont identiques, la droite serait verticale, provoquant une division par zéro. Le calcul s'interrompt avec l'erreur: "Toutes les valeurs x sont identiques, la droite serait donc verticale et la pente diviserait par zéro.".
    • Valeurs hors plage: Pour toute prédiction au-delà des bornes des données saisies, la mention "hors des données" s'affiche pour signaler l'extrapolation.

    Questions fréquemment posées

    L'attribution des colonnes à x ou y a-t-elle une importance?
    Oui. La méthode des moindres carrés minimise les écarts verticaux, elle traite donc y comme la variable expliquée et x comme la variable explicative. Si vous les inversez, vous obtiendrez une pente et une ordonnée à l'origine différentes — seuls r et R² restent inchangés. Placez la variable que vous souhaitez prédire dans y; si les colonnes ont été saisies dans le mauvais sens, le bouton d'inversion les réécrit directement sur place.

    Que m'indique réellement le R²?
    Le R² représente la part de la variation verticale de y expliquée par la droite: 0,96 signifie que 96 % de cette variation s'aligne avec x et que 4 % n'y est pas lié. Il ne dit pas si une ligne droite était la forme appropriée — une courbe prononcée peut tout de même obtenir un score élevé — lisez-le donc en parallèle avec le graphique des résidus. La corrélation r est la racine carrée de R² portant le signe de la pente, c'est pourquoi r est négatif pour une droite descendante.

    Une petite valeur p signifie-t-elle que x cause y?
    Non. La valeur p ne répond qu'à une seule question étroite: si la vraie pente était de 0, à quelle fréquence un échantillon de cette taille produirait-il une pente au moins aussi éloignée de 0? Une petite valeur rend simplement l'explication « aucun lien du tout » peu plausible, rien de plus. La causalité nécessite une étude bien conçue — un troisième facteur influençant les deux colonnes, ou un échantillon qui n'a pas été collecté de manière indépendante, produit tout aussi facilement de petites valeurs p.

    Pourquoi les prédictions sont-elles accompagnées de deux intervalles?
    Ils répondent à des questions différentes. L'intervalle moyen cherche à savoir où se situe le y moyen pour l'ensemble de la population à ce x donné, de sorte que seule l'incertitude de la droite elle-même compte. L'intervalle individuel cherche à savoir où se situera une nouvelle observation unique, ce qui ajoute la dispersion des points autour de la droite — cette incertitude supplémentaire explique pourquoi il est toujours le plus large des deux. Les deux s'élargissent à mesure que x s'éloigne du centre de vos données.