医療統計学・医療情報学・遠隔医療

医療統計学・医療情報学・遠隔医療 · 10

相関と単回帰

Association, Correlation and Causation. Simple Linear Regression

応用トピック
画像診断における人工知能

🧠 全体像:相関は「対称」、回帰は「非対称」。相関係数は「xとyがどれくらい一緒に動くか」を1つの数で表すだけで、どちらが原因かを一切言わない。回帰は「yはxで説明される」という向きを人間があらかじめ決めてから当てはめる。だから回帰の出力で最初に見るべきは、傾き(slope)とその単位 ——「xが1単位増えると、yは平均して何単位変わるか」であって、p値でもR²でもない。

2変数の関係にはどんな型があるか

散布図を描いた瞬間に、まず関係の「形」を分類する。

型 内容 例
・線形 xが増えるとyが一定の割合で増える(減る) と
・ 向きは一定だが変化の割合が変わる(指数・対数・べき) と効果(対数的)
非 放物線状・周期的(増えてから減る) 至適域を持つ生理指標(Uカーブ)
関係なし 点がに散らばる —

さらに 関数的関係(xの値がyの値を完全に決める)と 統計的関係(xはyを部分的にしか決めず、残りはによる)を区別する。医学データで扱うのはほぼ常に後者である。

⚠️ 相関係数を計算する前に、必ず散布図を描く。 相関係数は「線形の」強さしか測らないので、きれいなU字型の関係でもr ≈ 0 になる。「相関がない」ことは「関連がない」ことを意味しない。

相関係数

  • Pearson の積率相関係数 r — 線形の関係を前提に、その強さを測る
  • Spearman の順位相関係数 ρ — でありさえすればよい(線形性を仮定しない)。値を順位に置き換えてから Pearson を計算するのと同じ。外れ値に強いが、値そのものの実務的な意味づけは難しい

Pearson の r は、x と y のそれぞれが平均からどれだけずれているかを掛け合わせ、両者のばらつきで正規化したものである。

r=∑i=1n(xi−xˉ)(yi−yˉ)∑i=1n(xi−xˉ)2  ∑i=1n(yi−yˉ)2r = \frac{\sum_{i=1}^{n} (x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum_{i=1}^{n} (x_i - \bar{x})^2 \; \sum_{i=1}^{n} (y_i - \bar{y})^2}}

分母がばらつきの大きさを打ち消すので、r は単位を持たない。分子は x と y のずれが同じ向きなら正、逆向きなら負に効く。

いずれも −1 から +1 の実数をとる。

値 意味
+1 完全な正の(線形/)相関
0 線形()な相関なし
−1 完全な負の相関

0から離れるほど強い。符号は向き、絶対値は強さである。

💡 相関は対称である。 r(x,y)=r(y,x)r(x, y) = r(y, x)。との相関を計算しても、「どちらがどちらに依存するか」は式のどこにも現れない。この対称性こそが、相関から因果を読み取れない構造的な理由である。

r と r² を混同しない

⭐ ここは試験でも実務でも最も間違えやすい。

記号 名前 意味
rr 相関係数 線形関係の強さと向き。割合ではない
r2r^2(R2R^2) yの分散のうち、xとの線形関係で説明される割合

2つは名前が似ているだけで、片方がもう片方の二乗である。

r2=(∑(xi−xˉ)(yi−yˉ)∑(xi−xˉ)2∑(yi−yˉ)2) ⁣2=explained variancetotal variancer^2 = \left( \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum (x_i - \bar{x})^2 \sum (y_i - \bar{y})^2}} \right)^{\!2} = \frac{\text{explained variance}}{\text{total variance}}

⚠️ r = 0.7 は「変動の70%」ではない。 r=0.7⇒r2=0.49r = 0.7 \Rightarrow r^2 = 0.49 なので、説明されるのは分散の 49% である。r は「割合」の尺度ではないので、r = 0.4 が r = 0.2 の「2倍強い」わけでもない(0.42=0.160.4^2 = 0.16 対 0.22=0.040.2^2 = 0.04 で、分散の割合では4倍になる)。

「yの変動の43%が xの変動によるものである」と説明されることがあるが、正確には「yの分散のうち43%が、xとの線形回帰で数値的に説明できる」である。「〜による」は因果の言葉であり、相関係数はそれを支えない。相関は対称なので、同じ43%は逆向き(yでxを説明する)にもそのまま成り立ってしまう——因果の主張なら、この対称性はありえない。

例:Framingham 研究の一期分(n = 3263)でとの相関を取ると r≈0.66r \approx 0.66、r2≈0.43r^2 \approx 0.43。血圧が「一緒に動く」ことは強く示されるが、どちらが先かは何も言っていない。

相関係数の有意性検定

H0: 母集団の相関係数 ρ=0\rho = 0(線形相関なし)、H1: ρ≠0\rho \neq 0。検定統計量は n−2n-2 の t 分布に従う。

t=rn−21−r2t = \frac{r \sqrt{n-2}}{\sqrt{1 - r^2}}

⚠️ 「p < 0.05 なので、標本平均との差は有意である」と書かれることがあるが、相関の検定で比べているのは平均とではなく、標本のrと0である。は「母相関が0」であって、平均に関する主張は一切していない。

n が大きければ、実務的に無意味な相関でも有意になる。 上の式で nn が大きくなると tt は n\sqrt{n} に比例して大きくなるので、n=3263n = 3263 なら r=0.04r = 0.04(分散の0.16%しか説明しない)でも t≈2.3t \approx 2.3、p < 0.05 に達する。だから実習では有意性より先に ∣r∣>0.4\lvert r \rvert > 0.4 なら実務的に意味がある のように relevance の閾値をあらかじめ決めてから検定する。この順序を崩さない1。

相関は因果ではない ——「では何が起きているのか」

「相関≠因果」は標語としては正しいが、それだけでは使えない。xとyに関連が観察されたとき、因果以外にどんな説明がありうるかを数え上げられることが重要である。

flowchart TD
  A["xとyに関連が観察された"] --> B["① x → y(本当の因果)"]
  A --> C["② y → x(逆因果)<br>例: 運動不足が肥満か、肥満で動けないのか"]
  A --> D["③ <span class='jp-term jp-term-diagram' title='confounding'>交絡</span>:第3の因子Zが両方を動かす<br>例: 身長と睡眠障害 ← 性別"]
  A --> E["④ <span class='jp-term jp-term-diagram' title='selection bias'>選択バイアス</span>:観察された集団の作り方が関連を生む<br>例: 入院患者だけを見た(Berkson <span class='jp-term jp-term-diagram' title='bias'>バイアス</span>)"]
  A --> F["⑤ <span class='jp-term jp-term-diagram' title='information bias'>情報バイアス</span>:測定・<span class='jp-term jp-term-diagram' title='retrieval'>想起</span>の誤り"]
  A --> G["⑥ <span class='jp-term jp-term-diagram' title='chance'>偶然</span>:多数の組合せを試せばいくつかは相関する"]

⚠️ 統計だけで因果を証明することはできない。 因果を主張するには、(・時間的前後関係)と領域知識が必要になる。の扱いは と重回帰 で扱う。

Hill の視点(1965)

Hill は関連から因果を論じる際に検討すべき9項目を挙げた2。

項目 内容
強さ 関連が強いほど、だけで説明しきるのは難しくなる
一貫性 別の人・場所・集団でも再現されるか
特異性 その要因がその結果に特に結びつくか
時間性 原因が結果に先行するか
量反応関係 曝露が多いほど結果が増える(減る)か
生物学的 機序が説明できるか
整合性 実地の観察と実験結果が矛盾しないか
実験 介入して結果が変わるか(最も強い)
類推 似た関係が他で確立しているか

⚠️ これを「9項目中◯項目満たせば因果」というチェックリストとして使ってはならない。 Hill 自身が原論文でそう戒めている2。満たすことが必須なのは「時間性」だけであり、「特異性」と「類推」は現代の疫学では特に弱い根拠とされる(1つの原因が1つの結果しか生まないという前提は喫煙のように成り立たない)。後に「可逆性」(原因を除けば結果も消える)を加える立場もある。

単回帰

回帰では、y(従属・・応答)が x(独立・説明・予測因子)に依存するという向きを臨床的な理由から先に決めてから当てはめる。統計は向きを決めてくれない。

Y=β0+β1X+εY = \beta_0 + \beta_1 X + \varepsilon
  • β0\beta_0 … 切片。X = 0 のときの Y の期待値
  • β1\beta_1 … 傾き。Xが1単位増えたときの Y の平均変化量
  • ε\varepsilon … 残差(誤差項)。当てはめた直線と実測点との垂直方向の距離

β0+β1X\beta_0 + \beta_1 X が x で決まる部分、ε\varepsilon がによる部分にあたる。

OLS(最小二乗法)

残差の二乗和が最小になる直線を選ぶ。

(β0^,β1^)=arg⁡min⁡β0,β1∑i=1n(yi−(β0+β1xi))2(\hat{\beta_0}, \hat{\beta_1}) = \arg\min_{\beta_0, \beta_1} \sum_{i=1}^{n} \bigl( y_i - (\beta_0 + \beta_1 x_i) \bigr)^2

💡 なぜ絶対値の和ではなく二乗和か。 ① 二乗和は微分可能で解が閉じた式で一意に求まる(絶対値は折れ点で微分できず、解が一意にならないことがある)、② 誤差がするという仮定のもとでは二乗和の最小化が最尤推定と一致する。代償として、二乗するぶん外れ値の影響が強く出る。

💡 垂直距離を最小化するから、x と y を入れ替えると別の直線になる。 「SYSBP を DIABP で予測する直線」と「DIABP を SYSBP で予測する直線」は一致しない(前者は縦の距離、後者は横の距離を最小化しているため)。相関が対称なのに回帰が非対称なのは、ここに現れる。

適用条件

由来 条件
から分かる 観測が互いに独立、単純
診断プロットから分かる 関係が線形である
同上 各 x において y の分布が正規
同上 各 x において y の分散が等しい(等分散性・homoscedasticity)
同上 影響力の大きい外れ値がない

なお、x は「誤差なく測られた」として扱われる(相関では x も y も確率だが、回帰では x は必ずしもそうでない)。

回帰の出力をどう読むか

💡 出力を読む順序

  1. 傾きのとその単位 — 効果量そのもの。「1単位あたり何単位」
  2. 臨床的relevance — その大きさは意味があるか(事前に決めた閾値と比べる)
  3. 傾きの95%信頼区間 — 効果の不確実性の幅。区間の端(最弱・最強のシナリオ)も臨床的に検討する
  4. p値 — 最後。有意でも臨床的に無意味な傾きはあるし、有意でなくても「傾きが0」の証明にはならない

補助的に見るもの:

  • 切片 — X = 0 が現実にありえない値(身長0 cm、出生体重0 g)なら、切片そのものに意味はない。切片のp値はほとんどの場合どうでもよい
  • R² — 当てはまりの目安。R² が高いことは、モデルが正しいことも因果があることも意味しない(Anscombe の四重奏がその反例)
  • 残差の診断プロット — 条件が満たされているか

具体例

Framingham のデータ(n = 3263)で SYSBP を DIABP で回帰すると

SYSBP^=31.05+1.33×DIABP\widehat{\text{SYSBP}} = 31.05 + 1.33 \times \text{DIABP}

読み方:が 1 mmHg 高いごとに、は平均して 1.33 mmHg 高い。事前に「∣β1∣>0.5\lvert \beta_1 \rvert > 0.5(単位は mmHg/mmHg)なら実務的に意味がある」と決めていたので、1.33 は relevant。R2=0.43R^2 = 0.43。

⚠️ 傾き「1.33」は 単位を伴って初めて意味を持つ。同じデータで血圧を kPa で測れば傾きの数値は変わる。単位を書かない傾きは読めない。

Python で確認する

import statsmodels.formula.api as smf

model = smf.ols("SYSBP ~ DIABP", data=df).fit()
print(model.params)        # 切片と傾きの点推定値
print(model.conf_int())    # それぞれの95%信頼区間
print(model.rsquared)      # R²

相関係数だけなら以下で足りる。

from scipy import stats

r, p = stats.pearsonr(df["DIABP"], df["SYSBP"])   # 線形を仮定
rho, p_rho = stats.spearmanr(df["DIABP"], df["SYSBP"])  # 単調でよい
print(r, r**2, rho)

💡 単回帰では、傾きの検定と相関係数の検定は数学的に等価である(同じ t 値、同じ p 値になる)。「傾き = 0」と「ρ = 0」は同じ主張なので当然だが、解釈は等価ではない——傾きには単位があり、相関係数にはない。

信頼区間と予測区間を混同しない

区間 何を覆うか 幅
回帰直線の 回帰直線そのもの(平均的な y の位置)の不確かさ 狭い
予測区間 将来の個々の観測値が落ちる範囲 広い

⚠️ 個々の患者について「この人の値はこの範囲」と言いたいなら、必要なのは予測区間である。回帰直線の(グラフで直線に沿った細い帯)をそれと取り違えると、不確実性を大幅に過小評価する。予測区間は残差のばらつきを含むぶん必ず広い。

💡 の帯が「傾き0の直線」を含まないことは、傾きが有意であることと対応する。逆に帯の中に水平な直線が引けてしまえば有意ではない。グラフだけで有意性が読める。

外挿してはならない

⚠️ は、データが観測された x の範囲でのみ意味を持つ。 出生体重 2000–4500 g のデータから得た直線に出生体重 500 g を代入して成人体重を予測してはならない。範囲の外で関係が線形である保証はどこにもなく、直線はそれを検証していない。

同様に、線形回帰は LOESS のような平滑化曲線と重なる範囲でのみ信用できるというのが実務的な目安である。LOESS は局所的な重み付き回帰をつなげた非母数的な曲線で、真の形を仮定せずにデータの流れを描く。直線と平滑化曲線が離れていく領域では、線形性の仮定が破れている。

Anscombe の四重奏 —「パラメータだけを見てはいけない」

Anscombe は、標本サイズ・xの平均・yの平均・xのSD・yのSD・r・r²・回帰直線の傾きと切片がすべて一致するのに、散布図がまったく異なる4組のデータを作った3。

組 実際の姿
I ふつうの線形関係
II 明確な曲線(放物線)。線形モデルは不適切
III 完全に直線上に並ぶが、1点だけ大きな外れ値があり傾きを歪める
IV x がほぼ1点に集中し、離れた1点だけが傾きを決めている(高レバレッジ点)

⭐ 要約統計量は同じでも、正しい解析はそれぞれ違う。 だから「まず散布図を描く」が回帰の第一手順になる。

まとめ

  • 相関は対称で単位を持たず、回帰は非対称で傾きに単位がある。だから因果的な問いには回帰の枠組みを使うが、それでも因果は統計から出てこない。
  • r は線形関係の強さ、r² は説明される分散の割合。r = 0.7 は「70%」ではなく「49%」。
  • Pearson の r は線形性を仮定する。・外れ値には Spearman の ρ、そして何より散布図を使う。
  • 関連が観察されたときの代替説明は、逆因果・・・・。Hill の視点は判断の材料であってチェックリストではない。
  • 回帰の出力は 傾きと単位 → 臨床的relevance → → p値 の順に読む。R² と切片は補助。
  • 回帰直線のと予測区間は別物。個人の予測には予測区間。
  • 観測された x の範囲の外へ外挿しない。 Anscombe の四重奏が示すとおり、数値が同じでもデータの姿は同じではない。

出典

  1. 1.The ASA Statement on p-Values: Context, Process, and Purpose(The American Statistical Association / The American Statistician(著者 Ronald L. Wasserstein, Nicole A. Lazar)・2016)p値は仮説が正しい確率でも効果の大きさでもなく、p値だけで科学的結論や政策決定を下してはならないこと閲覧 2026-08-17
  2. 2.The Environment and Disease: Association or Causation?(Proceedings of the Royal Society of Medicine(著者 Austin Bradford Hill)・1965)関連から因果を論じるための9つの視点(強さ・一貫性・特異性・時間性・量反応・生物学的妥当性・整合性・実験・類推)。Hill 自身がこれを合否判定のチェックリストにしてはならないと明言していること閲覧 2026-08-17
  3. 3.Graphs in Statistical Analysis(The American Statistician(著者 Francis J. Anscombe)・1973)平均・SD・相関係数・回帰直線がすべて一致するのに散布図がまったく異なる4組のデータ(Anscombe の四重奏)閲覧 2026-08-17