医療統計学・医療情報学・遠隔医療

医療統計学・医療情報学・遠隔医療 · 16

ベイズ法

Bayesian Methods

前提:病態
確率と分布診断検査の評価疫学指標・ROC曲線・尤度比
応用トピック
情報理論とデータベース

🧠 全体像:ベイズ法は「信じている度合いを、新しい証拠で更新する規則」である。臨床医は毎日これをやっている——で見当をつけ()、検査結果でその見当を修正する(事後確率)。尤度比で覚えた Opost=Opre×LRO_{\text{post}} = O_{\text{pre}} \times LR は、この規則の臨床用の衣装にすぎない。ベイズ法を学ぶとは、新しい計算を覚えることではなく、すでにやっている推論に名前と算術を与えることである。

頻度論の枠組みと、その限界

これまでの仮説検定は、次の一本道を通ってきた。

flowchart TD
  A["現実の問い"] --> B["Yes/No の形に直す"]
  B --> C["H0 を立てる<br>(よく知られた状況を仮定として置く)"]
  C --> D["有意水準 α を決める<br>= H0 にどれだけ固執するか"]
  D --> E["条件付き確率を計算する<br>P(観測以上に極端な結果 | H0)"]
  E --> F["p < α なら H0 を棄却<br>p ≥ α なら H0 を棄却しない"]

この枠組みは強力だが、3つの構造的なをもつ。

内容
仮説に確率を割り当てられない 計算しているのは P(data∣H0)P(\text{data} \mid H_0) であって P(H0∣data)P(H_0 \mid \text{data}) ではない。p値を「H0が正しい確率」と読むのは、この2つを取り違える誤りである1
二値の決定しか返さない 「棄却する/しない」。全面的に受け入れるか全面的に捨てるかで、中間の確からしさを表現できない
事前の知識を使えない 同じデータでも、これまで何が分かっているかでは変わるはずだが、その情報を入れる場所がない

💡 3つ目が臨床では特に痛い。「この所見が出るのは珍しい」という事実だけでは診断はできない——その疾患がそもそもどれくらいありそうかを知らなければ意味がない。0.1%の疾患と20%の疾患では、同じ陽性所見の意味がまったく違う(→ の評価)。

すべての確率は条件付きである

⭐ 統計的な言明はすべて、何らかの条件のもとで述べられている。 正しく書けば P(A∣H0,C)P(A \mid H_0, C) であり、CC は実験条件・測定法・・使った知識の全体である。CC は普通は省略されるが、消えたわけではない。

そして CC には、測定装置の仕様だけでなくその判断をする主体の知識も含まれている。臨床の会話は現にこの形をしている。

  • 「今日はたぶん良い天気になる」
  • 「心配いりません、手術はうまくいったはずです」

これらは頻度としては定義できない確率である。しかし定義できないから非科学的だ、と切り捨てると臨床判断の大半が扱えなくなる。ベイズ主義は、こうした言明を計算の中に取り込む道を用意する。

確率の2つの意味

頻度論的確率 ベイズ的(主観)確率
定義 無限回の反復での相対頻度 P(A)=lim⁡N→∞kA/NP(A) = \lim_{N \to \infty} k_A/N 命題 AA が成り立つという信念の度合い
適用対象 反復可能な事象のみ 反復できない一回限りの命題にも適用できる(「この患者はである」)
仮説の確率 定義できない 定義できる

⚠️ 「主観確率」は「好き勝手に決めてよい確率」ではない。 要求されているのは——同じ状況 CC を知っている人は全員が同じ数値を置けなければならない。同じ検査報告を読み、同じ専門的訓練を受けたなら、可能な診断のそれぞれに同じ確率を置く、という水準である。

💡 これを担保する立てが2つある。

内容
壺モデル どんな確率も「黒球が mm 個、白球が nn 個入った壺から1個引く」という形に翻訳できる。互いの確率を共通の尺度で比較できる
賭けによる標準化 「公正な賭け」の価格は期待に等しい。1:x1:x のを受け入れるなら P=1/(1+x)P = 1/(1+x) を置いたことになる。「重篤な副作用の確率は10万分の1」を賭けの形で言い直せば、人によるずれが検出できる

賭けとして表現された確率はコヒーレント(整合的) でなければならない。互いに排反な事象の確率の和が1を超えるような置き方をすると、その人を相手に必ず勝てる賭けの組み合わせが作れてしまう(ダッチブック論法)。すなわちベイズ的確率は「気分」ではなく、コルモゴロフの公理と同じ規則に従うことを要求される量である。

💡 だから形式上の変化は何もない。頻度論的確率が存在する場合、ベイズ的確率はそれと同じ値を与える。 ベイズ主義は頻度論を否定するのではなく、頻度が定義できない場面にまで確率の適用範囲を広げている。

ベイズの定理

条件付き確率の定義から出発する。

P(A∣H)=P(A∩H)P(H)P(A \mid H) = \frac{P(A \cap H)}{P(H)}

同時確率は2通りに分解できる。

P(A∩H)=P(A∣H) P(H)=P(H∣A) P(A)P(A \cap H) = P(A \mid H)\,P(H) = P(H \mid A)\,P(A)

これを P(H∣A)P(H \mid A) について解けば、条件を「ひっくり返す」ことができる。

  P(H∣A)=P(A∣H) P(H)P(A)  \boxed{\;P(H \mid A) = \frac{P(A \mid H)\,P(H)}{P(A)}\;}

⭐ これがベイズの定理である。左辺は事象 AA を観測したあとでの仮説 HH の確からしさであり、これこそ臨床医が知りたいものである。

記号 名前 臨床での中身
P(H)P(H) ——、病歴、診察所見からの見当
P(A∣H)P(A \mid H) 疾患があるときにその所見が出る確率=感度(陽性の場合)
P(A)P(A) 周辺・エビデンス その所見が出る確率(全体)
P(H∣A)P(H \mid A) =陽性的中値 PPV

⚠️ は確率だが「HH についての確率」ではない。 P(A∣H)P(A \mid H) を HH の関数として見たとき、そのは1にならない。「が高い仮説=ありそうな仮説」ではなく、を掛けて初めて確からしさになる。

分母の P(A)P(A) は「起こりうる全ての道」の和

⚠️ ベイズの定理を使う際の最大の実務的落とし穴がここである。P(A)P(A) を求めるには、AA が起こりうる経路をすべて数え上げなければならない。 仮説が「あり/なし」の2つだけなら簡単で、

P(A)=P(A∣H) P(H)+P(A∣Hˉ) P(Hˉ)P(A) = P(A \mid H)\,P(H) + P(A \mid \bar{H})\,P(\bar{H})

これを代入した形が、実際に使う式である。

P(H∣A)=P(A∣H) P(H)P(A∣H) P(H)+P(A∣Hˉ) P(Hˉ)P(H \mid A) = \frac{P(A \mid H)\,P(H)}{P(A \mid H)\,P(H) + P(A \mid \bar{H})\,P(\bar{H})}

💡 診断の文脈でこの式を読み直すと、そのまま PPV の式になる。HH=疾患あり、AA=検査陽性、P(H)P(H)= ww、P(A∣H)P(A \mid H)=感度、P(A∣Hˉ)P(A \mid \bar{H})=1−1-特異度 とすれば、

PPV=w⋅sensw⋅sens+(1−w)(1−spec)\mathrm{PPV} = \frac{w \cdot \text{sens}}{w \cdot \text{sens} + (1-w)(1-\text{spec})}

⭐ の評価で暗記した PPV の式は、ベイズの定理の特殊な場合にすぎない。

低有病率のスクリーニング——ベイズの正典的な例

感度99%・特異度99%というきわめて優秀な検査を、0.1%の集団でスクリーニングに使う。陽性者が本当に疾患をもつ確率は?

P(D∣+)=0.99×0.0010.99×0.001+0.01×0.999=0.000990.01098=0.090P(D \mid +) = \frac{0.99 \times 0.001}{0.99 \times 0.001 + 0.01 \times 0.999} = \frac{0.00099}{0.01098} = 0.090

⭐ わずか9%。 陽性者の10人に9人は疾患をもたない。

def posterior(prior, se, sp):                   # 陽性のときの事後確率
    return prior*se / (prior*se + (1-prior)*(1-sp))
print(posterior(0.001, 0.99, 0.99))             # 0.0902 → 9.0%

自然頻度に直すと直観で分かる

同じ計算を、10万人の集団で数え上げる形に書き換える。

検査陽性 検査陰性 計
疾患あり 99 1 100
疾患なし 999 98,901 99,900
計 1,098 98,902 100,000

陽性者1,098人のうち疾患があるのは99人。99/1098=9.0%99/1098 = 9.0%。

💡 同じ問題でも、条件付き確率の形で出されるとでも大きく外すが、自然頻度(◯△人)の形で出されると訓練なしに正答率が跳ね上がる2。これは知識ではなく形式の問題である。患者に説明するときも、自分で暗算するときも、まず自然頻度に直すのが最も確実な作法である(→ 治療のリスクを伝える)。

⚠️ この例が示すのは「検査が悪い」ではない。感度99%・特異度99%は現実にはほとんど到達できない水準である。それでもなお、が十分に低ければ陽性の意味は薄い。 悪いのは検査ではなく、をして検査を適用したことである。これがスクリーニングの適応をで絞る理由そのものである。

事前確率が高い場面——診断の例

低の例だけを見ると「検査は無力だ」と思いかねないので、逆の例を置く。

を疑う患者がいて、病歴と診察からのを P(H)=15%P(H) = 15% とする。ここで Helicobacter pylori の 検査を行い、陽性だった。この検査はの患者では92%が陽性になる。

P(H∣+)=0.92×0.150.15×0.92+0.85×0.1072=0.1380.2291=0.602P(H \mid +) = \frac{0.92 \times 0.15}{0.15 \times 0.92 + 0.85 \times 0.1072} = \frac{0.138}{0.2291} = 0.602

⭐ 検査前15%だった見当が、検査後60%まで上がった。同じ検査でもが違えばがまるで違う——これが前節との対比である。

⚠️ ただし分母の 0.10720.1072 の出所には注意が要る。これは 検査の性能(感度95%・特異度91%)と一般集団での H. pylori 感染率2%から求めた「一般集団で検査が陽性になる確率」 P(+)P(+) である。

P(+)=0.02×0.95+0.98×0.09=0.019+0.0882=0.1072P(+) = 0.02 \times 0.95 + 0.98 \times 0.09 = 0.019 + 0.0882 = 0.1072

ベイズの定理が要求しているのは P(+∣Hˉ)P(+ \mid \bar{H}) であって P(+)P(+) ではない、と説明を補っておく必要がある。ここでは「でない患者の H. pylori 感染率は一般集団とほぼ同じ」という近似のもとで P(+)P(+) を代用している。この近似は、と H. pylori 感染が独立であるときにしか正しくないが、実際にはの大半は H. pylori 感染に起因するので、両者は強く関連している。したがってこの計算は P(+∣Hˉ)P(+ \mid \bar{H}) を過大評価し、事後確率を過小評価している可能性が高い。

💡 これは細かい揚げ足取りではなく、ベイズ計算で最も壊れやすいのが分母であるという一般的な教訓である。「疾患でない人たちの中でその所見が出る確率」を、うっかり「一般集団でその所見が出る確率」で置き換えていないか——毎回ここを確認する。

オッズ形——尤度比との接続

ベイズの定理を疾患ありと疾患なしについて2本並べる。

P(D∣+)=P(+∣D) P(D)P(+)P(Dˉ∣+)=P(+∣Dˉ) P(Dˉ)P(+)P(D \mid +) = \frac{P(+ \mid D)\,P(D)}{P(+)} \qquad P(\bar{D} \mid +) = \frac{P(+ \mid \bar{D})\,P(\bar{D})}{P(+)}

辺々で割ると、厄介な分母 P(+)P(+) がきれいに消える。

P(D∣+)P(Dˉ∣+)⏟事後=P(D)P(Dˉ)⏟事前×P(+∣D)P(+∣Dˉ)⏟LR+\underbrace{\frac{P(D \mid +)}{P(\bar{D} \mid +)}}_{\text{事後}} = \underbrace{\frac{P(D)}{P(\bar{D})}}_{\text{事前}} \times \underbrace{\frac{P(+ \mid D)}{P(+ \mid \bar{D})}}_{LR^{+}}

⭐ これが本ノートの中心である。 左から読めば「事後 = 事前 × 尤度比」、前回の言い方では

Opost=Opre×LRO_{\text{post}} = O_{\text{pre}} \times LR

まったく同じ一本の式である3。

ベイズの用語 臨床の用語
P(H)P(H) (・病歴・診察)
尤度比 P(A∣H)P(A∣Hˉ)\dfrac{P(A \mid H)}{P(A \mid \bar{H})} 尤度比 LR+LR^{+} / LR−LR^{-}
事後確率 P(H∣A)P(H \mid A) (=陽性なら PPV)

💡 形を使う実務上の利点は3つある。

  1. 分母 P(A)P(A) を計算しなくてよい。 割り算で消えるので、全経路の数え上げが不要になる
  2. 証拠を掛け算で重ねられる。 Opost=Opre×LR1×LR2×⋯O_{\text{post}} = O_{\text{pre}} \times LR_1 \times LR_2 \times \cdots
  3. 対数を取れば足し算になる。 log⁡Opost=log⁡Opre+∑jlog⁡LRj\log O_{\text{post}} = \log O_{\text{pre}} + \sum_j \log LR_j

3番目が示すのは、ロジスティック回帰の係数が log⁡LR\log LR にほかならないということである。所見ごとの「重み」を足し上げるというの構造は、ベイズ更新の対数版そのものである。

同じ検査、違う集団

感度90%・特異度90%の検査(LR+=9LR^{+} = 9、LR−=0.111LR^{-} = 0.111)を、の違う2つの場面で使う。

事前 ×LR+LR^{+} 事後
3% 0.0309 ×9 0.278 21.8%
20% 0.25 ×9 2.25 69.2%
se, sp, pre = 0.90, 0.90, 0.03
lr = se / (1 - sp)                      # 9.0
odds = pre/(1-pre) * lr                 # 事前オッズ × 尤度比
print(odds / (1 + odds))                # 0.218

⚠️ 検査はを置き換えない。掛け算で修正するだけである。 3%の集団では、LR=9LR = 9 という強力な陽性所見をもってしてもなお78%は疾患をもたない。「検査結果だけを見て判断してはいけない」という臨床の教えは、この掛け算の性質の言い換えである。

仮説が3つ以上ある場合、連続の場合

診断は普通「あり/なし」ではなく、のリストの上での確率分布である。仮説が H1,H2,…,HnH_1, H_2, \ldots, H_n と並んでいるとき、検査結果 XiX_i を見たあとの各仮説の確率は

P(Hk∣Xi)=P(Hk) P(Xi∣Hk)∑jP(Hj) P(Xi∣Hj)P(H_k \mid X_i) = \frac{P(H_k)\,P(X_i \mid H_k)}{\sum_{j} P(H_j)\,P(X_i \mid H_j)}

⭐ 分母は全仮説にわたる和であり、のリストが網羅的でなければこの計算は正しくならない。「考えていなかった疾患」は、確率0が割り当てられたのと同じことになり、どれだけ証拠が積み上がっても浮上してこない。これはベイズ推論の限界であると同時に、鑑別を広く挙げることの数学的な根拠でもある。

仮説が連続量(薬の効果の大きさ、の値)の場合も形は同じで、和が積分に変わる。

f(h∣x)=f(h) P(x∣h)∫f(h′) P(x∣h′) dh′f(h \mid x) = \frac{f(h)\,P(x \mid h)}{\int f(h')\,P(x \mid h')\,dh'}

事前分布が、データを通して事後分布に更新される。

flowchart TD
  A["事前分布 f(h)<br>——今までに分かっていること"] --> C["ベイズの定理"]
  B["<span class='jp-term jp-term-diagram' title='likelihood'>尤度</span> P(x|h)<br>——新しいデータ"] --> C
  C --> D["事後分布 f(h|x)<br>——更新後の信念"]
  D --> E["次のデータが来たら<br>これが新しい事前分布になる"]
  E --> A

⚠️ この計算が成立するには2つの条件が要る。

条件 満たせないと
事前分布が存在すること ベイズ的な定義なら普通は用意できるが、「何も分からない」状態の表し方は一意ではない
が計算・推定でき、可能性の全体を覆っていること 覆えていない仮説には確率が回らない

ベイズと頻度論——どう使い分けるか

⚠️ どちらが「正しい」という問題ではない。答えている問いが違う。

頻度論 ベイズ
答える問い 「H0 が真なら、こんなデータはどれくらい珍しいか」 「このデータを見たあとで、各仮説はどれくらい確からしいか」
確率をもつもの データ(仮説は固定) 仮説(データは観測済みで固定)
事前知識 使わない(デザインには使う) 明示的に事前分布として使う
出力 p値、、棄却/非棄却 事後分布、事後確率、信用区間
強み 事前分布の指定が要らない。長期的な誤り率を制御できる。・審査で共通の土俵になる 個別の判断に直接使える。証拠を逐次的に積み上げられる。中間の確からしさを表せる
弱み 仮説の確率を出せない。二値の決定に押し込める 事前分布の選択がに影響する。恣意性の批判を受ける

💡 実務上の橋渡しになるのがベイズ因子(=尤度比) である4。これは事前分布を必要とせず、データが2つの仮説のどちらをどれだけ支持するかだけを表す。事前と掛ければ事後になるので、「証拠の強さ」と「事前の信念」を分離して議論できる。尤度比が臨床で使いやすいのは、まさにこの分離のおかげである——教科書は LRLR を載せ、読者は自分のを持ち込む。

「p < 0.05 なら H0 が正しい確率は5%未満」は誤りである1。が低い仮説では、p = 0.05 で有意になった所見の多くが偽陽性になりうる。p値の解釈が難しいのは、それがを含んでいないからである——ここでも足りないのは同じピースである。

ベイズ的意思決定

診断が確率分布として得られたら、次はどうするかである。事後確率だけでは決定できない——選択肢ごとの結果の良し悪しが要る。

flowchart TD
  A["事前分布"] --> B["ベイズの定理"]
  C["観測・検査結果"] --> B
  B --> D["事後分布"]
  D --> E["効用関数 G(H)<br>——各結果の望ましさ"]
  E --> F["期待効用が最大の選択肢を選ぶ"]
  F --> G["決定"]

選好が2つの公理——完備性(どの2つも比較できる)と推移性(1≼21 \preccurlyeq 2 かつ 2≼32 \preccurlyeq 3 なら 1≼31 \preccurlyeq 3)——を満たすとき、その選好は効用関数 GG で数値化できる(von Neumann–Morgenstern の期待効用理論)。そして選ぶべきは期待効用を最大にする選択肢である。

d∗=arg⁡max⁡d∑kP(Hk∣data) G(d,Hk)d^{*} = \arg\max_{d} \sum_{k} P(H_k \mid \text{data})\, G(d, H_k)

💡 これが「感度を優先するか特異度を優先するか」の一般形である。 見落としの損失が偽陽性の損失より大きければ、期待効用の最大化は自動的に低いを選ぶ。曲線で「臨床上どちらが重要かを先に決める」と言ったのは、暗黙に効用関数を指定していたということである。

⚠️ 効用の設定は統計の問題ではなく価値判断である。誰の効用か(患者か、医療システムか)で答えが変わる。ここを統計家に丸投げすることはできない(→ 調査法・データ表の作り方・統計家との協働)。

医学への応用

領域 中身
診断支援システム 所見を入力するとの確率分布を返す。内部はベイズ更新
分類・機械学習 ナイーブベイズ分類器はこの定理そのもの。「ナイーブ」とは特徴量の条件付き独立を仮定していることを指し、これは尤度比を掛け合わせるときと同じ仮定・同じ限界である
ベイズ流の 逐次的に事後分布を更新し、にや中止を決める。少数例・で特に有利
人工知能 ニューラルネットワークのな解釈、不確実性の定量化
情報量の定量化 「この検査で何ビット学べたか」は事前分布と事後分布の距離で測れる(→ 情報理論とデータベース)

💡 ベイズ的に検査結果を読む順序

  1. — この患者で、検査の前にどれくらいありそうか。ここを飛ばすと以降がすべて無意味になる
  2. 尤度比 — その結果は疾患ありと疾患なしでどれだけ起こりやすさが違うか
  3. 事後確率 — 掛け算した結果。自然頻度に直して確認する
  4. 決定が変わるか — 事後確率が動いてもが変わらないなら、その検査は行う必要がなかった

まとめ

  • ベイズの定理 P(H∣A)=P(A∣H)P(H)P(A)P(H \mid A) = \dfrac{P(A \mid H)P(H)}{P(A)} は、条件をひっくり返す規則である。P(data∣H)P(\text{data} \mid H) しか出せない頻度論に対し、臨床医が本当に欲しい P(H∣data)P(H \mid \text{data}) を与える
  • =、=感度/(1−特異度)、事後確率=(PPV)。PPV のはベイズの定理の特殊例にすぎない
  • 分母 P(A)P(A) が最も壊れやすい。 必要なのは P(A∣Hˉ)P(A \mid \bar{H}) であって、一般集団の P(A)P(A) ではない
  • 低の正典例:感度99%・特異度99%でも0.1%なら陽性的中値は9%。悪いのは検査ではなく、をした適用である
  • 自然頻度(10万…)に直すと、同じ問題の正答率が劇的に上がる。暗算にも患者説明にも使う
  • 形にすると分母が消え、Opost=Opre×LRO_{\text{post}} = O_{\text{pre}} \times LR になる。これは尤度比の式と文字どおり同一である。対数を取れば足し算になり、それがロジスティック回帰の係数の正体
  • が3つ以上なら分母は全仮説の和。挙げていない疾患は確率0として扱われ、決して浮上しない
  • 頻度論とベイズは答えている問いが違う。頻度論は事前分布を要さず誤り率を制御でき、ベイズは個別判断と逐次更新に強い。ベイズ因子(尤度比)は両者の橋渡しで、証拠の強さと事前の信念を分離できる
  • 事後確率だけでは決まらない。効用を掛けて期待効用を最大化して初めて決定になる。効用の設定は統計ではなく価値判断である

出典

  1. 1.Toward Evidence-Based Medical Statistics. 1: The P Value Fallacy(Annals of Internal Medicine(著者 Steven N. Goodman)・1999)p値が「H0が正しい確率」でも「証拠の強さ」でもないこと、頻度論的な誤り率と個別の実験の証拠が混同されていること閲覧 2026-08-17
  2. 2.How to improve Bayesian reasoning without instruction: Frequency formats(Psychological Review(著者 Gerd Gigerenzer, Ulrich Hoffrage)・1995)同じベイズ問題を確率ではなく自然頻度(◯人中△人)で提示すると、訓練なしで正答率が大きく上がること閲覧 2026-08-17
  3. 3.Diagnostic tests 4: likelihood ratios(BMJ(著者 Jonathan J. Deeks, Douglas G. Altman)・2004)検査後オッズ=検査前オッズ×尤度比という関係が、臨床におけるベイズ更新そのものであること閲覧 2026-08-17
  4. 4.Toward Evidence-Based Medical Statistics. 2: The Bayes Factor(Annals of Internal Medicine(著者 Steven N. Goodman)・1999)ベイズ因子(尤度比)が仮説間の証拠の強さを表し、事前オッズと掛け合わせて事後オッズを与えること。頻度論とベイズの役割分担閲覧 2026-08-17