Calculateur de régression linéaire

Droite de meilleur ajustement
Résultats

La régression linéaire ajuste la ligne droite unique y = mx + b qui minimise la somme des erreurs verticales au carré des données. C’est le premier outil à utiliser lorsque vous soupçonnez qu’une variable en influence une autre, dépenses publicitaires vs. inscriptions, température vs. ventes de glaces, taille vs. pointure. Collez des paires (x, y) et le calculateur renvoie la pente, l’intercept, R-carré et le coefficient de corrélation de Pearson.

Comment ajuster une ligne de régression

  1. 1

    Collez les données

    Une paire par ligne : x et y séparés par une virgule, une tabulation ou un espace. Les en-têtes sont ignorés.

  2. 2

    Lisez la pente et l'intercept

    Pente m = changement dans y par changement de 1 unité dans x. Intercept b = y quand x = 0.

  3. 3

    Vérifiez R²

    R² ∈ [0, 1], la part de variance dans y expliquée par x. 0.7+ est généralement fort dans les données sociales.

  4. 4

    Prédisez de nouvelles valeurs

    Insérez n'importe quel x dans y = m·x + b pour obtenir la prédiction du modèle.

Les formules derrière l'ajustement

Étant donné N points de données (x_i, y_i), la pente et l’intercept des moindres carrés ordinaires sont :

m = Σ((x_i − x̄)(y_i − ȳ)) / Σ((x_i − x̄)²)
b = ȳ − m · x̄

R², le coefficient de détermination, est la part de variance dans y expliquée par x :

R² = 1 − SS_res / SS_tot

où SS_res est la somme des résidus au carré et SS_tot est la somme des écarts au carré de y par rapport à sa moyenne. Pearson r est ±√R², portant le signe de la pente.

Exemple travaillé

Cinq points de données :

x y
1 2
2 4
3 5
4 4
5 6

x̄ = 3, ȳ = 4.2. Numérateur de la covariance = (1-3)(2-4.2) + (2-3)(4-4.2) + (3-3)(5-4.2) + (4-3)(4-4.2) + (5-3)(6-4.2) = 4.4 + 0.2 + 0 − 0.2 + 3.6 = 8.0. Numérateur de la variance de x = 4 + 1 + 0 + 1 + 4 = 10.

  • Pente m = 8.0 / 10 = 0.8
  • Intercept b = 4.2 − 0.8 × 3 = 1.8
  • Équation : y = 0.8x + 1.8
  • R² ≈ 0.727

Ce que les chiffres vous disent (et ne vous disent pas)

  • Pente m répond à “combien y varie par unité de x”. Elle a les unités de y/x.
  • Intercept b répond à “quelle est y quand x est 0”. Seulement significatif si x = 0 est plausible pour vos données.
  • mesure la qualité de l’ajustement, pas la causalité. Un R² élevé sur des données proxy sans bruit peut encore être sans signification.
  • Pearson r capture l’association linéaire. r proche de 0 avec une forte relation courbée signifie toujours “pas d’ajustement linéaire”, pas “pas de relation”.

Pièges

  • Valeurs aberrantes déforment fortement les ajustements OLS car la perte est au carré. Un point hors norme peut faire pivoter la ligne de 20 degrés.
  • Non-linéarité n’est pas détectée par R² seul, tracez toujours les résidus par rapport à x.
  • La régression n’est pas symétrique : ajuster y sur x donne une ligne différente que d’ajuster x sur y.
  • Extrapolation au-delà de la plage de vos données est de la spéculation. L’ajustement ne connaît que la plage qu’il a vue.

Questions fréquentes

40% de la variation dans y est expliquée par la relation linéaire avec x. Les 60% restants proviennent du bruit, d’autres variables ou de la non-linéarité. En physique, c’est faible ; dans les données sociales ou économiques, c’est souvent acceptable.

Commencez par linéaire. Si le graphique des résidus montre une courbe claire, essayez une transformation quadratique ou logarithmique. Passer directement à un polynôme de haut degré surajuste et généralise mal aux nouvelles données.

Mathématiquement, vous en avez besoin de 2 ; de manière significative, au moins 20. En dessous, une valeur aberrante domine l’ajustement. Pour les résultats publiés, vérifiez les conseils sur la taille de l’échantillon spécifiques à votre domaine.

Non. Les paires (x, y) que vous collez sont ajustées dans votre navigateur et ne quittent jamais la page.

Outils similaires

Outil disponible dans d’autres langues