Polynomial Regression

データに曲線をフィットさせ、トレンドを分析する。

1行に1つのペア (x, y) を入力

多項式回帰とは:線形を超えて

通常の線形回帰(Linear Regression)は、データを直線 $y = ax + b$ で近似しようとしますが、現実のデータはしばしば曲線的なトレンドを示します。多項式回帰(Polynomial Regression)は、$x^2, x^3 \dots$ といった高次の項をモデルに組み込むことで、これらの非線形な関係を捉える手法です。

モデル式

$n$ 次の多項式回帰モデルは以下のように表されます。

$y = \beta_0 + \beta_1 x + \beta_2 x^2 + \dots + \beta_n x^n + \epsilon$

係数 $\beta$ は通常、誤差の二乗和を最小化する「最小二乗法」によって推定されます。数学的には、これは多変量線形回帰の特殊なケース(特徴量として $x$ のべき乗を使用する)として扱えます。

過学習(Overfitting)の罠

次数を上げれば上げるほど、モデルは学習データに対してより密接にフィットし、決定係数 $R^2$ は1に近づきます。しかし、これは必ずしも良いことではありません。次数が高すぎると、モデルはデータの背後にある本質的なパターンではなく、ノイズまで学習してしまい、未知のデータに対する予測精度が極端に低下する「過学習」を引き起こします。

適切な次数の選択

一般的に、物理法則などで高次式であることが分かっている場合を除き、2次(放物線)や3次程度で十分な場合が多いです。次数を増やすことによる精度の向上と、モデルの複雑さのバランスを見極めることが重要です。