Principes mathématiques de la régression linéaire par les moindres carrés
La régression linéaire simple cherche à modéliser la relation entre une variable explicative (notée x) et une variable expliquée (notée y) en ajustant une droite à travers un nuage de points. Le « Calculateur de régression linéaire » utilise la méthode classique des moindres carrés ordinaires (OLS). Cette approche consiste à déterminer la droite qui minimise la somme des carrés des écarts verticaux (les résidus) entre les points observés et la droite d'ajustement.
Pour garantir une précision numérique maximale, même lorsque les données comportent des valeurs d'ordres de grandeur très différents, les calculs de dispersion s'effectuent en deux passes à l'aide d'un algorithme de sommation compensée. Les formules fondamentales s'appuient sur les sommes des carrés des écarts par rapport aux moyennes:
- Sxx = Σ(xᵢ − x̄)²
- Syy = Σ(yᵢ − ȳ)²
- Sxy = Σ(xᵢ − x̄)(yᵢ − ȳ)
À partir de ces sommes, le calculateur détermine la pente (b) et l'ordonnée à l'origine (a) de la droite d'équation ŷ = a + bx:
- Pente b = Sxy ÷ Sxx
- Ordonnée à l'origine a = ȳ − b·x̄
Ces coefficients permettent ensuite de décomposer la variabilité totale des données. La somme totale des carrés (SST = Syy) mesure la dispersion globale de y. Elle se divise en deux parties: la somme des carrés expliquée par la régression (SSR = SST − SSE) et la somme des carrés des résidus (SSE = Σ(yᵢ − ŷᵢ)²), qui représente la part de variabilité non capturée par le modèle.
Interprétation des coefficients et de la variance
Chaque valeur calculée par l'outil possède une signification concrète pour l'analyse des données:
- Pente b: Elle indique la variation moyenne de la variable expliquée pour chaque augmentation d'une unité de la variable explicative. L'outil affiche cette interprétation sous la forme: « En moyenne, y varie de
‹slope›pour chaque augmentation de 1 de x. ». - Ordonnée à l'origine a: Elle représente la valeur théorique de y lorsque x est égal à zéro. Elle est présentée ainsi: « Là où x vaut 0, la droite se situe à y =
‹intercept›. ». - Corrélation r: Ce coefficient mesure la force et la direction de la relation linéaire. Il équivaut à Sxy ÷ √(Sxx·Syy) et prend le signe de la pente.
- R² (Coefficient de détermination): Il représente la proportion de la variance de y expliquée par la variable x (R² = SSR ÷ SST).
- R² ajusté: Il ajuste le R² en fonction du nombre de degrés de liberté, calculé par la formule 1 − (1 − R²)(n − 1) ÷ (n − 2). Il s'avère utile pour comparer la qualité de l'ajustement.
- Dispersion des résidus s: Elle correspond à la racine carrée du carré moyen des résidus (s = √(SSE ÷ (n − 2))) et quantifie l'écart type des points autour de la droite d'ajustement.
Analyse de l'incertitude et tests d'hypothèses
L'évaluation de la fiabilité de la droite repose sur des tests statistiques rigoureux. Pour chaque coefficient, l'outil calcule une erreur type:
- SE(b) = s ÷ √Sxx
- SE(a) = s · √(1÷n + x̄² ÷ Sxx)
Ces erreurs types permettent de calculer la statistique t pour tester l'hypothèse nulle selon laquelle le coefficient est égal à zéro (t = estimation ÷ erreur type). La valeur p associée est calculée à l'aide de la fonction bêta incomplète régularisée I_{ν/(ν+t²)}(ν/2, ½) avec ν = n − 2 degrés de liberté. Avec un seul prédicteur, le test F global de la table « Variance expliquée » est équivalent au carré de la statistique t de la pente, ce qui signifie que les deux tests affichent exactement la même valeur p.
Les intervalles de confiance à 90 %, 95 % ou 99 % pour la pente et l'ordonnée à l'origine sont construits selon la formule: estimation ± t_{1−α/2, n−2} × erreur type.
Prédictions et intervalles de confiance
Lorsque vous saisissez des valeurs dans le champ « Prédire y pour x », le calculateur évalue la valeur attendue ŷ₀ = a + b·x₀ et génère deux types d'intervalles distincts:
- Intervalle moyen (Moyen
‹level›%): Il estime l'incertitude liée à la position de la droite elle-même. Son erreur type est s · √(1÷n + (x₀ − x̄)² ÷ Sxx). - Intervalle individuel (Individuel
‹level›%): Il estime la plage dans laquelle se situera une future observation unique. Son calcul intègre la variabilité des points individuels autour de la droite: s · √(1 + 1÷n + (x₀ − x̄)² ÷ Sxx).
L'intervalle individuel est donc systématiquement plus large que l'intervalle moyen. Ces deux intervalles s'élargissent à mesure que la valeur x₀ s'éloigne de la moyenne x̄. Si une valeur x prédite se situe en dehors de la plage des données d'origine, l'outil applique l'étiquette « en dehors des données » et affiche l'avertissement: « Les lignes marquées utilisent une valeur x au-delà des valeurs saisies, la droite est donc prolongée au-delà de ce que montrent les données. ».
Fonctionnalités et limites d'utilisation
Le calculateur s'adapte à vos données grâce à plusieurs options de configuration et règles de gestion:
- Modes de saisie: Vous pouvez choisir la disposition « Lignes appariées » (idéale pour copier-coller deux colonnes depuis un tableur) ou « Deux listes ».
- Gestion des décimales et séparateurs: L'outil prend en charge le point décimal (ex.
12.5, les listes étant alors séparées par des espaces, des virgules ou des sauts de ligne) ou la virgule décimale (ex.12,5, les listes étant alors séparées par des espaces, des points-virgules ou des sauts de ligne). - En-têtes de colonnes: Si la première ligne copiée dans le mode « Lignes appariées » contient des caractères non numériques, elle est automatiquement traitée comme une ligne d'en-tête et ignorée.
- Inversion des variables: L'action « Inverser x et y » échange instantanément les colonnes. Puisque la méthode des moindres carrés minimise uniquement les écarts verticaux, la droite obtenue après inversion sera différente, bien que les valeurs de r et R² restent identiques.
- Limites de volume: L'outil accepte un minimum de 2 points, jusqu'à un maximum de 50 000 points (limite de 1 Mo de texte collé). Vous pouvez demander jusqu'à 50 prédictions simultanées.
Cas particuliers et messages d'erreur
Le calculateur gère de manière transparente les configurations de données particulières:
- Exactement deux points: La droite est parfaitement ajustée. L'outil affiche: « Deux points définissent la droite de manière exacte, il ne reste donc rien pour estimer l'incertitude. ».
- Ajustement parfait: Si tous les points sont alignés, la dispersion des résidus est nulle. Le message suivant apparaît: « Les points se situent exactement sur la droite, il n'y a donc aucune dispersion des résidus et aucun intervalle ni valeur p ne peut être estimé. ».
- Valeurs Y constantes: Si toutes les valeurs y sont identiques, la droite est horizontale. L'outil indique: « Toutes les valeurs y sont identiques, la droite est donc plate et r, R² ainsi que le test de signification ne sont pas définis. ».
- Valeurs X constantes: Si toutes les valeurs x sont identiques, la droite serait verticale, provoquant une division par zéro. Le calcul s'interrompt avec l'erreur: « Toutes les valeurs x sont identiques, la droite serait donc verticale et la pente diviserait par zéro. ».
D'autres messages d'erreur s'affichent en cas de saisie incorrecte, notamment:
- « “
‹token›” n'est pas un nombre (ligne‹position›). » - « Il y a
‹countX›valeurs x et‹countY›valeurs y — les listes doivent être de la même longueur. » - « La ligne
‹position›doit contenir exactement deux nombres: x puis y. »
Confidentialité et traitement des données
La confidentialité de vos données est préservée lors de l'utilisation de cet outil. Tous les calculs, l'ajustement de la droite, la génération des graphiques et l'évaluation des prédictions sont effectués localement, directement dans le navigateur Web de l'utilisateur. Vos points de données et toutes les statistiques restent dans ce navigateur et ne sont jamais téléversés vers un serveur externe.
Foire aux questions
Est-ce important de savoir quelle colonne je place dans x?
Oui. La méthode des moindres carrés minimise les écarts verticaux, elle traite donc y comme la variable expliquée et x comme la variable explicative. Si vous les inversez, vous obtiendrez une pente et une ordonnée à l'origine différentes — seuls r et R² restent inchangés. Placez la variable que vous souhaitez prédire dans y; si les colonnes ont été saisies dans le mauvais sens, le bouton d'inversion les réécrit directement sur place.
Que m'indique réellement le R²?
Le R² représente la part du mouvement vertical de y qui est expliquée par la droite: 0,96 signifie que 96 % de ce mouvement s'aligne avec x et que 4 % ne s'y aligne pas. Il ne dit pas si une ligne droite était la forme appropriée — une courbe prononcée peut tout de même obtenir un score élevé — lisez-le donc en parallèle avec le graphique des résidus. La corrélation r est la racine carrée de R² portant le signe de la pente, c'est pourquoi r est négatif pour une droite descendante.
Une petite valeur p signifie-t-elle que x cause y?
Non. La valeur p ne répond qu'à une seule question étroite: si la vraie pente était de 0, à quelle fréquence un échantillon de cette taille produirait-il une pente au moins aussi éloignée de 0? Une petite valeur rend simplement l'explication « aucun lien du tout » peu plausible, sans plus. Établir un lien de causalité nécessite une étude bien conçue — un troisième facteur qui influence les deux colonnes, ou un échantillon qui n'a pas été collecté de manière indépendante, produit tout aussi facilement de petites valeurs p.
Pourquoi les prédictions sont-elles fournies avec deux intervalles?
Ils répondent à des questions différentes. L'intervalle moyen cherche à savoir où se situe la moyenne de y pour l'ensemble de la population à cette valeur x, de sorte que seule l'incertitude de la droite elle-même compte. L'intervalle individuel cherche à savoir où se situera une nouvelle observation unique, ce qui ajoute la dispersion des points autour de la droite — ce terme supplémentaire explique pourquoi il est toujours le plus large des deux. Les deux s'élargissent à mesure que x s'éloigne du centre de vos données.