回帰分析とは?単回帰の式・最小二乗法・決定係数R²をわかりやすく図解で解説

統計学入門

 「1日4時間勉強したら、テストで何点くらい取れるだろう?」——第12章では、勉強時間とテストの点数に強い相関(r = 0.90)があることを確認しました。次のステップは、この関係を使って「勉強時間から点数を予測する」ことです。

 回帰分析とは、データに最もよく当てはまる直線(回帰直線)を引き、一方の値からもう一方の値を予測する統計手法です。この章では、回帰直線の式の意味、直線の求め方(最小二乗法)、予測の精度を表す決定係数 R² まで、前章と同じ身近な例を使ってわかりやすく解説します。


13.1 回帰分析とは:散布図に「予測のための直線」を引く

 散布図の点たちのド真ん中を通るように1本の直線を引けば、その直線を「予測の道具」として使えます。たとえばまだデータのない「勉強時間 3.5 時間」でも、直線上の高さを読めば点数を見積もれます。この直線を回帰直線、回帰直線を求めて予測や解釈に使う分析を回帰分析(Regression Analysis)と呼びます。

図13-1:回帰直線は「予測の道具」。データのない x = 3.5 時間でも、直線から y を見積もれる。

 用語を2つだけ押さえておきましょう。予測に使う側の変数 X(勉強時間)を説明変数、予測される側の変数 Y(点数)を目的変数と呼びます。説明変数が1つの回帰分析を単回帰分析、2つ以上を重回帰分析と言います。この章では基本となる単回帰分析を扱います。

💡 相関分析(第12章)が「関係の強さを測る」ものだったのに対し、回帰分析は「関係をにして予測に使う」ものです。役割の違いを意識すると理解がスムーズです。

13.2 回帰直線の式:Ŷ = a + bX の意味

回帰直線は次の式で表します。

Y^=a+bX\hat{Y}=a+bX

記号名前意味
Ŷ予測値  回帰直線から読み取る Y の予測値。実測値 y と区別するために「^ (ハット)」を付ける
b回帰係数
(傾き)
X が1増えたとき Y が平均的にどれだけ変化するか
a切片X = 0 のときの予測値(直線と縦軸が交わる高さ)

13.3 最小二乗法:「一番よく当てはまる直線」の決め方

 散布図に直線を引く方法は無数にあります。その中から「一番よく当てはまる1本」をどう選ぶのでしょうか?

 鍵になるのが残差(ざんさ)です。残差とは、実測値 y と直線上の予測値 Ŷ のズレ(y − Ŷ)のこと。各点の残差を二乗して合計した「残差の二乗和」が最小になる直線を選ぶ——これが最小二乗法(Least Squares Method)です。

図13-2:最小二乗法。各点と直線のズレ(残差)の二乗和が最小になるように直線を決める。

💡 二乗するのは、プラスのズレとマイナスのズレが打ち消し合わないようにするためです。第4章の分散で偏差を二乗したのと同じ発想です。

最小二乗法から、傾き b と切片 a は次の式で求まることが知られています。

係数計算式意味
傾き bb=i=1n(xix)(yiy)i=1n(xix)2b = \frac{\sum_{i=1}^{n}(x_i-\bar{x})(y_i-\bar{y})}{\sum_{i=1}^{n}(x_i-\bar{x})^2}分子は x と y の共分散(相関係数の分子と同じ)、分母は x の分散
切片 aa=yb×xa=\bar{y}-b\times\bar{x}回帰直線が必ず平均点 (x,y)(\bar{x},\bar{y}) を通ることから決まる

13.4 計算例:勉強時間からテストの点数を予測する

 第12章と同じ5人分のデータ(勉強時間 x = 1〜5 時間、点数 y = 40, 60, 50, 70, 80 点)を使います。第12章の計算表から、i=1n(xix)(yiy)=90\sum_{i=1}^{n}(x_i-\bar{x})(y_i-\bar{y})=90i=1n(xix)2=10\sum_{i=1}^{n}(x_i-\bar{x})^2=10x=3\bar{x}=3y=60\bar{y}=60 でした。

傾き b= 90 / 10 = 9
切片 a= 60 − 9 × 3 = 33
回帰直線Ŷ = 33 + 9X

 この式はこう読めます。「勉強時間が1時間増えるごとに、点数は平均9点上がる」。そして冒頭の問い「4時間勉強したら何点?」の答えは Ŷ = 33 + 9 × 4 = 69点、データのない 3.5 時間なら Ŷ = 33 + 9 × 3.5 = 64.5点と見積もれます。

💡 実務メモ:Excel なら散布図に「近似曲線(線形)」を追加すると回帰直線の式が表示されます。SLOPE 関数・INTERCEPT 関数でも b と a を直接計算できます。

13.5 決定係数 R²:その予測はどのくらい当てになるか

 回帰直線はどんなデータにも引けてしまいます。だからこそ「その直線がどのくらいデータに当てはまっているか」を確認する指標が必要です。それが決定係数 R²で、「Y のばらつきのうち、X で説明できる割合」を 0〜1 で表します。

R2=1(yiY^i)2(yiy)2R^2 = 1 – \frac{\sum(y_i – \hat{Y}_i)^2}{\sum(y_i – \bar{y})^2}

 分子は残差の二乗和(直線で説明できなかった部分)、分母は y の全体のばらつきです。残差が小さいほど分数が0に近づき、R² は1に近づきます。

図13-3:決定係数 R² のイメージ。点が直線に近いほど R² は1に近づき、予測の信頼度が高い。

 先ほどの例で計算してみましょう。回帰直線 Ŷ = 33 + 9X による予測値は 42, 51, 60, 69, 78 点。残差は −2, +9, −10, +1, +2 なので、残差の二乗和は 4 + 81 + 100 + 1 + 4 = 190。y の全体のばらつきは 1000 でしたから、

R2=11901000=0.81R^2 = 1 – \frac{190}{1000} = 0.81

「テストの点数のばらつきの81%は勉強時間で説明できる」という意味になります。

💡 単回帰分析では R² = r²(相関係数の二乗)が成り立ちます。実際、第12章で求めた r = 0.90 の二乗は 0.81 で、上の計算結果と一致します。

R² の値当てはまりの評価
R² = 1.00完全な当てはまり(全点が直線上)
R² ≥ 0.80良い当てはまり
0.50 ≤ R² < 0.80中程度の当てはまり
R² < 0.50当てはまりが弱い

⚠️ この目安も分野によって大きく異なります。人の行動データでは R² = 0.3 でも意味がある一方、精密な実験系では R² = 0.9 以上が求められることもあります。

13.6 回帰分析の2つの注意点

① 外挿は危険:予測が有効なのはデータの範囲内だけ

 回帰式が信頼できるのは、データが存在する範囲(この例では勉強時間 1〜5 時間)の内側だけです。範囲内の予測を内挿、範囲外の予測を外挿と呼びます。式の上では「10時間勉強すれば 33 + 9 × 10 = 123点」となりますが、100点満点のテストでそんな点は取れません。データの範囲外では直線関係が続く保証がないのです。

② 回帰式が引けても因果があるとは限らない

 回帰分析は相関関係を式にしたものにすぎません。第12章で見たとおり、交絡因子による見かけの相関でも回帰直線は引けてしまいます。「X を変えれば Y が変わる」と主張するには、相関以外の根拠(実験やドメイン知識)が必要です。

第13章のまとめ&統計学入門シリーズを終えて

ポイント内容
回帰分析データに直線を当てはめ、X から Y を予測する手法。相関分析が「相関の強さを測る」のに対し、回帰分析は「式にして予測する」
回帰直線Ŷ = a + bX。傾き b は「X が1増えたときの Y の平均変化量」、切片 a は「X = 0 のときの予測値」
最小二乗法残差(実測値と予測値のズレ)の二乗和が最小になる直線を選ぶ方法
決定係数 R²Y のばらつきのうち X で説明できる割合(0〜1)。単回帰では R² = r²
注意点予測はデータの範囲内(内挿)のみ有効。外挿は危険。回帰式が引けても因果の証明にはならない

 これで統計学入門シリーズは完結です。データの種類の整理から始まり、平均・分散などの記述統計、確率と分布、推定・仮説検定、そして相関・回帰まで、統計学の基礎を一通り歩いてきました。

 次は実験計画法に関する記事を上げていきます。


前の章:第12章 相関係数 

コメント

タイトルとURLをコピーしました