医療統計学・医療情報学・遠隔医療

医療統計学・医療情報学・遠隔医療 · 06

仮説検定の論理 — H0/H1・過誤・検出力・p値

The Logic of Hypothesis Testing: H0, Errors, Power, and the p-Value

応用トピック
調査法・データ表の作り方・統計家との協働薬物開発の段階(概要)

🧠 全体像:統計的検定は「主張を証明する装置」ではなく、反証の装置である。証明したい仮説(H1)は直接テストできない。そこで「効果がない世界(H0)」を仮に立て、その世界で今回のデータがどれくらい珍しいかを測る。珍しすぎればその世界を捨てる。捨てられなかったからといって、その世界が正しいと示されたわけではない。 ここを取り違えることが、この科目で最大の失点源である。

なぜ「反証」なのか

検証は原理的に不可能である

「すべての白鳥は白い」を検証するには、世界中のすべての白鳥を見なければならない。何羽の白い白鳥を見ても証明は完了しない。しかし黒い白鳥を1羽見つければ、命題は即座に否定される。

「どれだけ実験を重ねても私が正しいことは証明できないが、たった1つの実験で私が誤っていることは証明できる」(Einstein に帰される言い方)

⭐ 科学的な言明とは反証可能な言明である。どんな観測によっても否定されえない主張は、正しいのではなく科学の対象外である。「地球と火星の間に急須が周回している」「私のガレージには火を吐く竜がいる」は、真偽の問題ではなく、そもそも検証も反証もできないので科学的言明ではない。

立証責任は主張する側にある

onus probandi incumbit ei qui dicit, non ei qui negat — 立証責任は肯定する者にあり、否定する者にはない。新しい主張をした者が証拠を出す義務を負い、証拠が不十分なら主張は退けられる。反対者が「効かないこと」を証明する必要はない。

💡 これがそのまま H0 の立て方になる。「新薬に効果がある」と主張したい側が証拠を出すので、出発点(H0)は「効果はない」でなければならない。ホメオパシーや診断の是非を問われたら、H0 は常に「効果はない/診断能はない」である。

数学的論理と統計的論理

数学的論理(間接証明) 統計的論理
前提 H が真なら事象 E は起こりえない H が真なら事象 F は起こりにくい
観測 E が起きた F が起きた
H は確実に偽 H を棄却する(ただし100%確実ではない)

100個の玉が入った箱を例にとる。

仮説 5回引いてすべて赤だったときの、その観測の確率
「全部白」 00 100% 確実に誤り(1回引くだけで足りる)
「白99・赤1」 0.015=10−100.01^5 = 10^{-10} ほぼ確実に誤り
「白50・赤50」 0.55=0.0310.5^5 = 0.031 低いが、ありえなくはない。判断は微妙
「全部赤」 15=11^5 = 1 仮説と完全に整合するが、だから正しいとは言えない

⚠️ 最後の行がすべてを含んでいる。観測が仮説と整合しても仮説は証明されない。 「白99・赤1」の箱でも、たまたま赤を5回引く可能性は消えない。反証は働くが、検証は働かない。

最重要の非対称

P(observation∣hypothesis)  ≠  P(hypothesis∣observation)P(\text{observation} \mid \text{hypothesis}) \;\neq\; P(\text{hypothesis} \mid \text{observation})

検定が計算できるのは左辺だけである。p値は「H0 が正しいという仮定のもとで、このデータ(またはより極端なデータ)が得られる確率」であり、「データを見たあとで H0 が正しい確率」ではない。この2つを取り違えることが、後述するほぼすべての誤解の根源である。右辺を計算するにはベイズの定理とが要る(→ ベイズ的方法)。

検定できる問いと、答えの形

問いの3条件

条件 検定できる 検定できない
の問いであること 「骨髄腫の5年生存率は50%か?」 「骨髄腫の5年生存率はいくらか?」
個々の症例でなく観測の集合を指すこと 「骨髄腫の5年生存率は50%か?」 「この患者は5年生きるか?」
少なくとも1つの一義的な答えを持つこと 「5年生存率は50%か?」 「5年生存率は50%未満か?」(50%未満は無数の値を含み一義的でない)

💡 統計的な問いは母集団に向けられる。標本についての問い(「この100人の平均は?」)は記述統計であって、検定の対象ではない。

H0 と H1 の性質

H0 H1
一義性 一義的。必ず等号(=)を含む 複数のあり方を許す(大きい・小さい・どちらでも)
内容 現在確立した知識、または最も仮定の少ない自明な想定(オッカムの剃刀) 現在の合意に挑戦する新しい主張
例 「Cushing症候群患者のは一般人口の平均と同じ」 「一般人口の平均と異なる」
関係 ふつう H1 = not H0(H0 の否定)

⚠️ H0 は「問いに対する否定的な答え」とは限らない。 H0 を決めるのは「否定形かどうか」ではなく「一義的で、現在の知識を代表しているか」である。

検定の手順 — 骨髄腫の例

現在の骨髄腫の5年生存率は 50%(2008〜2012年の平均)。で有望な新薬候補をヒトで試したい。

段階 内容
1a 臨床の問い この新薬に治療プロトコルを置き換えるべきか
1b 臨床的relevance 効果は臨床的に意味があるか。の変化は十分大きいか
1c 統計家の問い そもそも効果はあるか
2 H0 薬に効果はない。は従来治療と同じ(p=0.5p = 0.5)
3 H1 薬に効果がある。は異なる(p≠0.5p \neq 0.5)
4 検定の設計 骨髄腫患者20人を無作為に選び新薬で治療。5年後の数を数える。このが検定統計量
5 H0 分布の生成 H0 のもとでの数の分布 = 二項分布 Bin(n=20,  p=0.5)\mathrm{Bin}(n = 20,; p = 0.5)。コイン投げと同じ
6a 有意水準 α\alpha α=5%\alpha = 5% と定める(歴史的な慣習であって、5% に特別な意味はない)。信頼水準は 1−α=95%1-\alpha = 95%
6b 臨床的relevance が 20%ポイント以上高いことを臨床的に意味あるとする
7 棄却域の決定 H0 分布のもとで、6〜14人生存の範囲が合計 95% 強を占める。この範囲は H0 に対する証拠として弱すぎる結果の集合
8 実験の実施 2016人が5年後に生存(← これが8番目であることに注意)
9 p値の算出 16/20 と同じかそれ以上に起こりにくい結果すべての確率の合計 = 0.0118
10 判断 臨床的にrelevant(50% → 80%)、統計的に有意(p < 0.05)
11 問いへの回答 「新薬候補で治療した群(n = 20)のは 80% で、従来治療の 50% より有意に高い(p = 1.18%)」

⭐ 実験は8番目の段階である。 α、relevance の閾値、棄却域は、データを見る前に決める。データを見てから α を動かしたり、relevance の閾値を都合よく設定し直すのは、検定の前提そのものを壊す行為である(→ )。

検定統計量と H0 分布

検定統計量は「データを1つの数値に要約したもの」であり、H0 分布の横軸そのものである。骨髄腫の例では数、t検定では t値、χ²検定では χ²値がこれにあたる。

flowchart TD
  A["H0 を立てる<br>(一義的・現在の知識)"] --> B["H0 が正しい世界での<br>検定統計量の分布を作る"]
  B --> C["α を決め、棄却域を定める"]
  C --> D["データを取る"]
  D --> E["検定統計量を計算する"]
  E --> F["H0 分布のうえで<br>それ以上に極端な確率を足す = p値"]
  F --> G{"p < α ?"}
  G -->|"はい"| H["H0 を棄却する<br>(H1 が証明されたのではない)"]
  G -->|"いいえ"| I["H0 を棄却しない<br>⚠️ H0 が証明されたのではない"]

p値とは何か

p値 = H0 が正しいと仮定したときに、実際に観測されたのと同じか、それより H0 から遠い結果が得られる確率。

検定統計量を TT、実際に観測された値を tobst_{\mathrm{obs}} とすれば、両側検定の p値はこう書ける。

p  =  P ⁣(∣T∣≥∣tobs∣  |  H0)p \;=\; P\!\left(\lvert T \rvert \ge \lvert t_{\mathrm{obs}} \rvert \;\middle|\; H_0 \right)

⭐ 条件付き確率の縦棒の右側に H0H_0 があることが、この定義のすべてである。つまり「今回のデータは、効果がない世界でどれくらい珍しいか」を表す1つの数値であり、p値が小さいほど H0 のもとでの説明が苦しくなる。

p値について誤りである言い方

⭐ ここは試験と実務の両方で決定的である。米国統計学会(ASA)は 2016年、この種の誤用の広がりを受けて声明を出している1。同じ年に、p値・・検出力についての典型的な誤解を25項目にわたって整理した解説も出ており、下の表はその中核にあたる2。

よくある言い方 なぜ誤りか 正しくは
「p値は H0 が正しい確率」 P(data∣H0)P(\text{data} \mid H_0) と P(H0∣data)P(H_0 \mid \text{data}) の取り違え p値は H0 を仮定したうえでのデータの確率
「1−p1-p は H1 が正しい確率」 同上。p値は H1 について何も計算していない H1 の確率を出すにはベイズ的枠組みが要る
「p = 0.03 なので、結果がである確率は3%」 「である確率」は事後確率であり、p値ではない H0(すべて)を仮定したうえでこの結果が出る確率が3%
「p > 0.05 なので差がない」 不在の証拠と証拠の不在の混同3 「差があるという十分な証拠が得られなかった」
「p = 0.001 は p = 0.04 より効果が大きい」 p値は効果の大きさではなく、効果量と n の両方に依存する 効果の大きさは効果量とで述べる
「有意だから重要」 統計的有意性と臨床的relevanceは別の概念 n が大きければ無意味な差も有意になる
研究間で p値を比較する 標本サイズが違えば p値は比較できない 効果量とを比較する

💡 なぜ p値だけでは足りないのか。 p値は「効果の大きさ」と「標本サイズ」の2つを1つの数字に押し込んでいる。だから p値だけを見ても、大きな効果を小さな標本で見たのか、無意味な効果を巨大な標本で見たのか区別できない。ASA声明が「科学的や政策判断を p < 0.05 という閾値だけで下してはならない」「効果量と推定の精度を報告せよ」と述べるのはこのためである1。

「p > 0.05 だから差がない」がなぜ危険か

非有意な結果が意味するのは「このデータでは H0 を棄却できるほどの証拠が得られなかった」ことだけである。理由は2つありうる。

  1. 本当に効果がない
  2. 効果はあるが、標本が小さすぎて検出できなかった

この2つを区別するのがの幅である3。

状況 差の 95% CI この結果が許すこと
非有意・狭い CI −0.4 〜 +0.5 min⁻¹ 臨床的に意味のある差は実質的に否定できる(同等性に近い主張が可能)
非有意・広い CI −12 〜 +14 min⁻¹ 何も分からない。大きな有害な差も、大きな有益な差も否定できていない

⚠️ 「有意差なし」を「差がない」と書いた論文・答案は、この区別を放棄している。 非有意な結果を報告するときは、必ずの幅を添えて「何が否定できて、何が否定できていないのか」を述べる。

事後の検出力計算で埋め合わせない。 得られた p値から遡って「この研究の検出力は◯%だった」と計算する観測検出力(observed power)は、p値のな言い換えにすぎず、非有意な結果の解釈に新しい情報を一切加えない4。答えるべきは「どの程度の効果までなら否定できたか」であり、それを示すのはである。

判断の誤り — 第1種・第2種の過誤

検定の判断構造は裁判に似ている。

  • 訴え(H1)が無罪推定(H0)に立ち向かう
  • 無罪を仮定する(効果がないと仮定する)
  • 立証責任は訴える側にある
  • H0 に反する証拠を集める(=標本抽出)
  • H0 のもとでの証拠の確率にもとづき、無罪放免(H0 を棄却しない)か有罪(H0 を棄却)かを決める
H0 を棄却しない H0 を棄却する
H0 が真(真実は永久に不明) 正しい判断 1−α1-\alpha 第1種の過誤 α\alpha
P(reject H0∣H0 true)≤αP(\text{reject } H_0 \mid H_0 \text{ true}) \le \alpha
H0 が偽 第2種の過誤 β\beta
P(not reject H0∣H0 false)≤βP(\text{not reject } H_0 \mid H_0 \text{ false}) \le \beta
正しい判断 1−β1-\beta = 検出力

⚠️ 「無罪」は「無実が証明された」ではなく「有罪を立証できなかった」である。統計でも同じく、H0 を棄却しないことは H0 を採択することではない。 だから答案では「accept H0」ではなく「fail to reject H0(H0 を棄却しない)」と書く。これは言葉遊びではない。H0 の「もっともらしさ」を支えているのは今回のデータではなく、H0 を立てる根拠になった従来の知識だからである。

第1種の過誤(α\alpha)— 自分で決められる

  • α\alpha は自分で設定する。H0 を棄却するのは psample<αp_{\text{sample}} < \alpha のときだけである
  • α\alpha を下げれば第1種の過誤は減り、検定は保守的になる
  • α\alpha は検定の とも呼ばれる
  • ⭐ あらかじめ設定した α\alpha 以外に、誤って H0 を棄却する確率を左右するものはない。 標本サイズも効果量も α\alpha には影響しない

第2種の過誤(β\beta)と検出力

  • β\beta は「真実がどうであるか」に依存するため、ふつう既知ではない
  • そこで「最低限これだけの効果があってほしい」という最小の(=臨床的relevanceの閾値) を設定して見積もる
  • 真の効果が大きいほど H0 分布との重なりが減り、β\beta は小さくなる
  • 標本サイズが大きいほど検定統計量の誤差が小さくなり、β\beta は小さくなる
  • は次で定義される
power  =  1−β  =  P ⁣(reject H0  |  H1 true)\text{power} \;=\; 1-\beta \;=\; P\!\left(\text{reject } H_0 \;\middle|\; H_1 \text{ true}\right)

すなわち実在する効果を検定が見つけ出す確率である。

flowchart TD
  A["検出力 1−β を上げたい"] --> B["効果量が大きい<br>(H0 分布との重なりが減る)"]
  A --> C["標本サイズ n が大きい<br>(分布の幅が狭くなる)"]
  A --> D["測定のばらつき σ が小さい<br>(測定法の改善・均質な対象)"]
  A --> E["対応のある設計にする<br>(<span class='jp-term jp-term-diagram' title='individual variation'>個人差</span>が<span class='jp-term jp-term-diagram' title='cancellation'>相殺</span>される)"]
  A --> F["α を大きくする<br>⚠️ 第1種の過誤と引き換え"]

⚠️ α\alpha と β\beta はである。α\alpha を 0.05 から 0.01 に下げれば偽陽性は減るが、そのぶん実在する効果を見逃しやすくなる。両方を同時に小さくできる唯一の手段が、標本サイズを増やすことである。

検定と信頼区間の関係

⭐ 有意水準 α\alpha の両側検定で H0 を棄却する ⇔ 1−α1-\alpha が H0 の値を含まない。 両者は同じ情報の別表現である。

判断の仕方 やること
p値による判断 psamplep_{\text{sample}} と α\alpha を比べる。p<αp < \alpha なら棄却
による判断 が H0 の値(比率なら、差なら 0)を含むかを見る

💡 それでものほうを主に報告すべきである。p値は二値のしか与えないが、は効果の大きさ・向き・精度を同時に示すからである1。→ 標本抽出と推定

1標本比率の検定 — 実習の例

問い:Framingham 心臓研究第3期(1968年)の糖尿病の割合は、今日の 10.5% と異なるか。

項目 内容
効果量 標本の比率と 10.5% の差
relevance 0.5%ポイントを超える差を臨床的に意味ありとする(すなわち < 10.0% または > 11.0%)
有意水準 α=5%\alpha = 5%(信頼水準 1−α=95%1-\alpha = 95%)
H0 差はない。p=10.5%p = 10.5%(一義的で、現在の知識にもとづく)
H1 差がある。p≠10.5%p \neq 10.5%
標本 Framingham 第3期からの100人の部分集合

結果

出力 値
点推定() 0.09(9%)
効果量 9% − 10.5% = −1.5%ポイント
95% 0.042 〜 0.164
p値 0.745
from scipy import stats
res = stats.binomtest(k=9, n=100, p=0.105, alternative="two-sided")   # 正確二項検定
print(res.pvalue)                      # 0.745 → α=0.05 より大きい
print(res.proportion_ci(0.95))         # 0.042〜0.164 → 基準値 0.105 を含む

判断は2通りの経路で一致する。

  1. p値による判断:p=0.745>α=0.05p = 0.745 > \alpha = 0.05。H0 を棄却しない
  2. による判断:95% CI(0.042〜0.164)が 0.105 を含む。H0 を棄却しない

この例が教えている本当のこと

⭐ ここは臨床的にはrelevant(−1.5%ポイントは閾値 0.5%ポイントを超える)だが、統計的には有意でないという組み合わせである。「relevant だが有意でない」は「有意だが relevant でない」と並ぶ、頻出のパターンである。

そしての幅を見ることが決定的になる。95% CI は 4.2% 〜 16.4% で、幅が 12%ポイントもある。

  • ⚠️ この区間は「が半分以下」も「1.5倍以上」も否定していない
  • したがってこの結果は「Framingham 第3期と今日では変わらない」ことをまったく示していない
  • 言えるのは「n = 100 では何も決まらなかった」ということだけである

💡 幅が広い原因は n=100n = 100 という標本サイズにある。比率の標準誤差は p^(1−p^)/n\sqrt{\hat{p}(1-\hat{p})/n} なので、n を 4倍の 400 にすれば区間の幅はおよそ半分になる。非有意な結果を見たら、まず「検出力が足りなかっただけではないか」を疑う。

💡 検定の出力を読む順序

  1. 効果量 — 差・比の大きさそのもの(ここでは −1.5%ポイント)
  2. 臨床的relevance — その大きさは意味があるか(閾値 0.5%ポイントを超える → relevant)
  3. — 効果の不確かさの幅(4.2〜16.4% → 広すぎて何も決まらない)
  4. p値 — 最後(0.745 → 有意でない)

p値から読み始めると、この例は「差なし」で片づいてしまう。順序を守れば「relevant な差が見えているのに、標本が小さすぎて判定できていない」という、本当のにたどり着く。

p値の落とし穴(総まとめ)

落とし穴 内容 行き先
統計的有意性 ≠ 臨床的relevance n が大きければ無意味な差も有意になる。逆に大きな効果でも n が小さければ有意にならない 効果量と CI を先に見る
多重検定 α=5%\alpha = 5% なら、H0 が真の検定を20回やれば1回はおよそ有意になる。しかも有意でない結果は発表されないため、何回検定したか誰にも分からない
H0 非棄却 ≠ H0 の証明 赤白の玉の例。検証は働かず反証しか働かない の幅を見る
相関 ≠ 因果 2が関連して見えてもとは限らない 相関と回帰、
p値を使うべきか論争 濫用・誤解が多いため科学文献から追放すべきという議論がある。ただし代替指標も同じくらい難しい。難しいのは数学ではなく科学的推論そのものである 統計的議論の組み立て

まとめ

  • 科学的な言明は反証可能でなければならない。検証は原理的に完了しないが、反証は1例で成立する。
  • 立証責任は主張する側にある。したがって H0 は常に「効果がない・現在の知識のとおり」 側に置く。
  • H0 は一義的(= を含む)、H1 は新しい主張。H1 = not H0。
  • p値は P(data∣H0)P(\text{data} \mid H_0) であって P(H0∣data)P(H_0 \mid \text{data}) ではない。 「H0 が正しい確率」でも「結果がである確率」でもない。
  • p > 0.05 は「差がない」ではない。 何が否定できたかを決めるのはの幅であり、幅が広ければその研究は何も決めていない。
  • 統計的有意性と臨床的relevanceは別物。 だから読む順序は 効果量 → relevance → → p値。
  • 第1種の過誤 α\alpha は自分で決める。第2種の過誤 β\beta は真実に依存し、検出力 =1−β= 1-\beta。検出力は効果量・標本サイズ・測定精度・設計で上がる。
  • α\alpha と β\beta のを解消できる唯一の手段は n を増やすこと。
  • 両側検定の棄却 ⇔ 1−α1-\alpha が H0 の値を含まない。 同じ情報だが、のほうが効果の大きさと精度まで示すので情報量が多い。
  • 実験は手順の8番目である。α\alpha・relevance の閾値・棄却域は、データを見る前に決めておく。

出典

  1. 1.The ASA Statement on p-Values: Context, Process, and Purpose(The American Statistician (American Statistical Association)・2016)p値がH0の正しさの確率ではないこと、p値だけで科学的・臨床的結論や政策判断を下してはならないこと、効果量と推定の精度を併せて報告すべきであることを定めた学会公式声明の6原則閲覧 2026-08-17
  2. 2.Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations(European Journal of Epidemiology・2016)「p > 0.05 は差がないことを示す」「1−p は H1 が正しい確率」など、p値・信頼区間・検出力についての25の典型的誤解とその訂正閲覧 2026-08-17
  3. 3.Statistics notes: Absence of evidence is not evidence of absence(BMJ・1995)有意でない結果を「差がない」と読むことの誤り、および信頼区間の幅を見れば「差がないと言えるほど精密だったのか」が判別できること閲覧 2026-08-17
  4. 4.The Abuse of Power: The Pervasive Fallacy of Power Calculations for Data Analysis(The American Statistician・2001)得られたp値から事後的に検出力を計算する「観測検出力」がp値の単調な言い換えにすぎず、非有意な結果の解釈には情報を追加しないこと閲覧 2026-08-17