医療統計学・医療情報学・遠隔医療 · 06
仮説検定の論理 — H0/H1・過誤・検出力・p値
The Logic of Hypothesis Testing: H0, Errors, Power, and the p-Value
🧠 全体像:統計的検定は「主張を証明する装置」ではなく、反証の装置である。証明したい仮説(H1)は直接テストできない。そこで「効果がない世界(H0)」を仮に立て、その世界で今回のデータがどれくらい珍しいかを測る。珍しすぎればその世界を捨てる。捨てられなかったからといって、その世界が正しいと示されたわけではない。 ここを取り違えることが、この科目で最大の失点源である。
なぜ「反証」なのか
検証は原理的に不可能である
「すべての白鳥は白い」を検証するには、世界中のすべての白鳥を見なければならない。何羽の白い白鳥を見ても証明は完了しない。しかし黒い白鳥を1羽見つければ、命題は即座に否定される。
「どれだけ実験を重ねても私が正しいことは証明できないが、たった1つの実験で私が誤っていることは証明できる」(Einstein に帰される言い方)
⭐ 科学的な言明とは反証可能な言明である。どんな観測によっても否定されえない主張は、正しいのではなく科学の対象外である。「地球と火星の間に急須が周回している」「私のガレージには火を吐く竜がいる」は、真偽の問題ではなく、そもそも検証も反証もできないので科学的言明ではない。
立証責任は主張する側にある
onus probandi incumbit ei qui dicit, non ei qui negat — 立証責任は肯定する者にあり、否定する者にはない。新しい主張をした者が証拠を出す義務を負い、証拠が不十分なら主張は退けられる。反対者が「効かないこと」を証明する必要はない。
💡 これがそのまま H0 の立て方になる。「新薬に効果がある」と主張したい側が証拠を出すので、出発点(H0)は「効果はない」でなければならない。ホメオパシーや虹彩 iris 虹彩(iris) iris(虹彩) 診断の是非を問われたら、H0 は常に「効果はない/診断能はない」である。
数学的論理と統計的論理
| 数学的論理(間接証明) | 統計的論理 | |
|---|---|---|
| 前提 | H が真なら事象 E は起こりえない | H が真なら事象 F は起こりにくい |
| 観測 | E が起きた | F が起きた |
| 結論conclusion結論(conclusion)conclusion(結論) | H は確実に偽 | H を棄却する(ただし100%確実ではない) |
100個の玉が入った箱を例にとる。
| 仮説 | 5回引いてすべて赤だったときの、その観測の確率 | 結論conclusion結論(conclusion)conclusion(結論) |
|---|---|---|
| 「全部白」 | 100% 確実に誤り(1回引くだけで足りる) | |
| 「白99・赤1」 | ほぼ確実に誤り | |
| 「白50・赤50」 | 低いが、ありえなくはない。判断は微妙 | |
| 「全部赤」 | 仮説と完全に整合するが、だから正しいとは言えない |
⚠️ 最後の行がすべてを含んでいる。観測が仮説と整合しても仮説は証明されない。 「白99・赤1」の箱でも、たまたま赤を5回引く可能性は消えない。反証は働くが、検証は働かない。
最重要の非対称
検定が計算できるのは左辺だけである。p値は「H0 が正しいという仮定のもとで、このデータ(またはより極端なデータ)が得られる確率」であり、「データを見たあとで H0 が正しい確率」ではない。この2つを取り違えることが、後述するほぼすべての誤解の根源である。右辺を計算するにはベイズの定理と事前確率 pretest probability 事前確率(pretest probability) pretest probability(事前確率) が要る(→ ベイズ的方法)。
検定できる問いと、答えの形
問いの3条件
| 条件 | 検定できる | 検定できない |
|---|---|---|
| 二分yes/no 二分(yes/no)yes/no(二分) の問いであること | 「骨髄腫の5年生存率は50%か?」 | 「骨髄腫の5年生存率はいくらか?」 |
| 個々の症例でなく観測の集合を指すこと | 「骨髄腫の5年生存率は50%か?」 | 「この患者は5年生きるか?」 |
| 少なくとも1つの一義的な答えを持つこと | 「5年生存率は50%か?」 | 「5年生存率は50%未満か?」(50%未満は無数の値を含み一義的でない) |
💡 統計的な問いは母集団に向けられる。標本についての問い(「この100人の平均は?」)は記述統計であって、検定の対象ではない。
H0 と H1 の性質
| 帰無仮説null hypothesis帰無仮説(null hypothesis)null hypothesis(帰無仮説) H0 | 対立仮説alternative hypothesis対立仮説(alternative hypothesis)alternative hypothesis(対立仮説) H1 | |
|---|---|---|
| 一義性 | 一義的。必ず等号(=)を含む | 複数のあり方を許す(大きい・小さい・どちらでも) |
| 内容 | 現在確立した知識、または最も仮定の少ない自明な想定(オッカムの剃刀) | 現在の合意に挑戦する新しい主張 |
| 例 | 「Cushing症候群患者の総コレステロール total cholesterol 総コレステロール(total cholesterol) total cholesterol(総コレステロール) は一般人口の平均と同じ」 | 「一般人口の平均と異なる」 |
| 関係 | ふつう H1 = not H0(H0 の否定) |
⚠️ H0 は「問いに対する否定的な答え」とは限らない。 H0 を決めるのは「否定形かどうか」ではなく「一義的で、現在の知識を代表しているか」である。
検定の手順 — 骨髄腫の例
現在の骨髄腫の5年生存率は 50%(2008〜2012年の平均)。動物実験animal testing 動物実験(animal testing)animal testing(動物実験) で有望な新薬候補をヒトで試したい。
| 段階 | 内容 |
|---|---|
| 1a 臨床の問い | この新薬に治療プロトコルを置き換えるべきか |
| 1b 臨床的relevance | 効果は臨床的に意味があるか。生存率survival 生存率(survival)survival(生存率) の変化は十分大きいか |
| 1c 統計家の問い | そもそも効果はあるか |
| 2 H0 | 薬に効果はない。生存率survival 生存率(survival)survival(生存率) は従来治療と同じ() |
| 3 H1 | 薬に効果がある。生存率survival 生存率(survival)survival(生存率) は異なる() |
| 4 検定の設計 | 骨髄腫患者20人を無作為に選び新薬で治療。5年後の生存者 survivor 生存者(survivor) survivor(生存者) 数を数える。この人数 number of people 人数(number of people) number of people(人数) が検定統計量 |
| 5 H0 分布の生成 | H0 のもとでの生存者 survivor 生存者(survivor) survivor(生存者) 数の分布 = 二項分布 。コイン投げと同じ |
| 6a 有意水準 | と定める(歴史的な慣習であって、5% に特別な意味はない)。信頼水準は |
| 6b 臨床的relevance | 生存率survival 生存率(survival)survival(生存率) が 20%ポイント以上高いことを臨床的に意味あるとする |
| 7 棄却域の決定 | H0 分布のもとで、6〜14人生存の範囲が合計 95% 強を占める。この範囲は H0 に対する証拠として弱すぎる結果の集合 |
| 8 実験の実施 | 20人中 philtrum 人中(philtrum) philtrum(人中) 16人が5年後に生存(← これが8番目であることに注意) |
| 9 p値の算出 | 16/20 と同じかそれ以上に起こりにくい結果すべての確率の合計 = 0.0118 |
| 10 判断 | 臨床的にrelevant(50% → 80%)、統計的に有意(p < 0.05) |
| 11 問いへの回答 | 「新薬候補で治療した群(n = 20)の生存率 survival 生存率(survival) survival(生存率) は 80% で、従来治療の 50% より有意に高い(p = 1.18%)」 |
⭐ 実験は8番目の段階である。 α、relevance の閾値、棄却域は、データを見る前に決める。データを見てから α を動かしたり、relevance の閾値を都合よく設定し直すのは、検定の前提そのものを壊す行為である(→ 多重比較multiple comparisons多重比較(multiple comparisons)multiple comparisons(多重比較))。
検定統計量と H0 分布
検定統計量は「データを1つの数値に要約したもの」であり、H0 分布の横軸そのものである。骨髄腫の例では生存者 survivor 生存者(survivor) survivor(生存者) 数、t検定では t値、χ²検定では χ²値がこれにあたる。
flowchart TD
A["H0 を立てる<br>(一義的・現在の知識)"] --> B["H0 が正しい世界での<br>検定統計量の分布を作る"]
B --> C["α を決め、棄却域を定める"]
C --> D["データを取る"]
D --> E["検定統計量を計算する"]
E --> F["H0 分布のうえで<br>それ以上に極端な確率を足す = p値"]
F --> G{"p < α ?"}
G -->|"はい"| H["H0 を棄却する<br>(H1 が証明されたのではない)"]
G -->|"いいえ"| I["H0 を棄却しない<br>⚠️ H0 が証明されたのではない"]
p値とは何か
p値 = H0 が正しいと仮定したときに、実際に観測されたのと同じか、それより H0 から遠い結果が得られる確率。
検定統計量を 、実際に観測された値を とすれば、両側検定の p値はこう書ける。
⭐ 条件付き確率の縦棒の右側に があることが、この定義のすべてである。つまり「今回のデータは、効果がない世界でどれくらい珍しいか」を表す1つの数値であり、p値が小さいほど H0 のもとでの説明が苦しくなる。
p値について誤りである言い方
⭐ ここは試験と実務の両方で決定的である。米国統計学会(ASA)は 2016年、この種の誤用の広がりを受けて公式 official 公式(official) official(公式) 声明を出している1。同じ年に、p値・信頼区間confidence interval信頼区間(confidence interval)confidence interval(信頼区間)・検出力についての典型的な誤解を25項目にわたって整理した解説も出ており、下の表はその中核にあたる2。
| よくある言い方 | なぜ誤りか | 正しくは |
|---|---|---|
| 「p値は H0 が正しい確率」 | と の取り違え | p値は H0 を仮定したうえでのデータの確率 |
| 「 は H1 が正しい確率」 | 同上。p値は H1 について何も計算していない | H1 の確率を出すにはベイズ的枠組みが要る |
| 「p = 0.03 なので、結果が偶然 chance 偶然(chance) chance(偶然) である確率は3%」 | 「偶然chance 偶然(chance)chance(偶然) である確率」は事後確率であり、p値ではない | H0(すべて偶然 chance偶然(chance) chance(偶然))を仮定したうえでこの結果が出る確率が3% |
| 「p > 0.05 なので差がない」 | 不在の証拠と証拠の不在の混同3 | 「差があるという十分な証拠が得られなかった」 |
| 「p = 0.001 は p = 0.04 より効果が大きい」 | p値は効果の大きさではなく、効果量と n の両方に依存する | 効果の大きさは効果量と信頼区間 confidence interval 信頼区間(confidence interval) confidence interval(信頼区間) で述べる |
| 「有意だから重要」 | 統計的有意性と臨床的relevanceは別の概念 | n が大きければ無意味な差も有意になる |
| 研究間で p値を比較する | 標本サイズが違えば p値は比較できない | 効果量と信頼区間 confidence interval 信頼区間(confidence interval) confidence interval(信頼区間) を比較する |
💡 なぜ p値だけでは足りないのか。 p値は「効果の大きさ」と「標本サイズ」の2つを1つの数字に押し込んでいる。だから p値だけを見ても、大きな効果を小さな標本で見たのか、無意味な効果を巨大な標本で見たのか区別できない。ASA声明が「科学的結論 conclusion 結論(conclusion) conclusion(結論) や政策判断を p < 0.05 という閾値だけで下してはならない」「効果量と推定の精度を報告せよ」と述べるのはこのためである1。
「p > 0.05 だから差がない」がなぜ危険か
非有意な結果が意味するのは「このデータでは H0 を棄却できるほどの証拠が得られなかった」ことだけである。理由は2つありうる。
- 本当に効果がない
- 効果はあるが、標本が小さすぎて検出できなかった
この2つを区別するのが信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) の幅である3。
| 状況 | 差の 95% CI | この結果が許すこと |
|---|---|---|
| 非有意・狭い CI | −0.4 〜 +0.5 min⁻¹ | 臨床的に意味のある差は実質的に否定できる(同等性に近い主張が可能) |
| 非有意・広い CI | −12 〜 +14 min⁻¹ | 何も分からない。大きな有害な差も、大きな有益な差も否定できていない |
⚠️ 「有意差なし」を「差がない」と書いた論文・答案は、この区別を放棄している。 非有意な結果を報告するときは、必ず信頼区間 confidence interval 信頼区間(confidence interval) confidence interval(信頼区間) の幅を添えて「何が否定できて、何が否定できていないのか」を述べる。
事後の検出力計算で埋め合わせない。 得られた p値から遡って「この研究の検出力は◯%だった」と計算する観測検出力(observed power)は、p値の単調 monotone 単調(monotone) monotone(単調) な言い換えにすぎず、非有意な結果の解釈に新しい情報を一切加えない4。答えるべきは「どの程度の効果までなら否定できたか」であり、それを示すのは信頼区間confidence interval信頼区間(confidence interval)confidence interval(信頼区間)である。
判断の誤り — 第1種・第2種の過誤
検定の判断構造は裁判に似ている。
- 訴え(H1)が無罪推定(H0)に立ち向かう
- 無罪を仮定する(効果がないと仮定する)
- 立証責任は訴える側にある
- H0 に反する証拠を集める(=標本抽出)
- H0 のもとでの証拠の確率にもとづき、無罪放免(H0 を棄却しない)か有罪(H0 を棄却)かを決める
| H0 を棄却しない | H0 を棄却する | |
|---|---|---|
| H0 が真(真実は永久に不明) | 正しい判断 | 第1種の過誤 |
| H0 が偽 | 第2種の過誤 |
正しい判断 = 検出力 |
⚠️ 「無罪」は「無実が証明された」ではなく「有罪を立証できなかった」である。統計でも同じく、H0 を棄却しないことは H0 を採択することではない。 だから答案では「accept H0」ではなく「fail to reject H0(H0 を棄却しない)」と書く。これは言葉遊びではない。H0 の「もっともらしさ」を支えているのは今回のデータではなく、H0 を立てる根拠になった従来の知識だからである。
第1種の過誤()— 自分で決められる
- は自分で設定する。H0 を棄却するのは のときだけである
- を下げれば第1種の過誤は減り、検定は保守的になる
- は検定のサイズsizeサイズ(size)size(サイズ) とも呼ばれる
- ⭐ あらかじめ設定した 以外に、誤って H0 を棄却する確率を左右するものはない。 標本サイズも効果量も には影響しない
第2種の過誤()と検出力
- は「真実がどうであるか」に依存するため、ふつう既知ではない
- そこで「最低限これだけの効果があってほしい」という最小の対立仮説 alternative hypothesis 対立仮説(alternative hypothesis) alternative hypothesis(対立仮説) (=臨床的relevanceの閾値) を設定して見積もる
- 真の効果が大きいほど H0 分布との重なりが減り、 は小さくなる
- 標本サイズが大きいほど検定統計量の誤差が小さくなり、 は小さくなる
- 検出力power検出力(power)power(検出力) は次で定義される
すなわち実在する効果を検定が見つけ出す確率である。
flowchart TD
A["検出力 1−β を上げたい"] --> B["効果量が大きい<br>(H0 分布との重なりが減る)"]
A --> C["標本サイズ n が大きい<br>(分布の幅が狭くなる)"]
A --> D["測定のばらつき σ が小さい<br>(測定法の改善・均質な対象)"]
A --> E["対応のある設計にする<br>(<span class='jp-term jp-term-diagram' title='individual variation'>個人差</span>が<span class='jp-term jp-term-diagram' title='cancellation'>相殺</span>される)"]
A --> F["α を大きくする<br>⚠️ 第1種の過誤と引き換え"]
⚠️ と はトレードオフ trade-off トレードオフ(trade-off) trade-off(トレードオフ) である。 を 0.05 から 0.01 に下げれば偽陽性は減るが、そのぶん実在する効果を見逃しやすくなる。両方を同時に小さくできる唯一の手段が、標本サイズを増やすことである。
検定と信頼区間の関係
⭐ 有意水準 の両側検定で H0 を棄却する ⇔ 信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) が H0 の値を含まない。 両者は同じ情報の別表現である。
| 判断の仕方 | やること |
|---|---|
| p値による判断 | と を比べる。 なら棄却 |
| 信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) による判断 | 信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) が H0 の値(比率なら基準値 baseline / reference value基準値(baseline / reference value) baseline / reference value(基準値)、差なら 0)を含むかを見る |
💡 それでも信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) のほうを主に報告すべきである。p値は二値の結論 conclusion 結論(conclusion) conclusion(結論) しか与えないが、信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) は効果の大きさ・向き・精度を同時に示すからである1。→ 標本抽出と推定
1標本比率の検定 — 実習の例
問い:Framingham 心臓研究第3期(1968年)の糖尿病の割合は、今日の有病率 prevalence有病率(prevalence) prevalence(有病率) 10.5% と異なるか。
| 項目 | 内容 |
|---|---|
| 効果量 | 標本の比率と 10.5% の差 |
| relevance | 0.5%ポイントを超える差を臨床的に意味ありとする(すなわち < 10.0% または > 11.0%) |
| 有意水準 | (信頼水準 ) |
| H0 | 差はない。(一義的で、現在の知識にもとづく) |
| H1 | 差がある。 |
| 標本 | Framingham 第3期からの100人の部分集合 |
結果
| 出力 | 値 |
|---|---|
| 点推定(有病率prevalence有病率(prevalence)prevalence(有病率)) | 0.09(9%) |
| 効果量 | 9% − 10.5% = −1.5%ポイント |
| 95% 信頼区間confidence interval信頼区間(confidence interval)confidence interval(信頼区間) | 0.042 〜 0.164 |
| p値 | 0.745 |
from scipy import stats
res = stats.binomtest(k=9, n=100, p=0.105, alternative="two-sided") # 正確二項検定
print(res.pvalue) # 0.745 → α=0.05 より大きい
print(res.proportion_ci(0.95)) # 0.042〜0.164 → 基準値 0.105 を含む
判断は2通りの経路で一致する。
- p値による判断:。H0 を棄却しない
- 信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) による判断:95% CI(0.042〜0.164)が基準値 baseline / reference value基準値(baseline / reference value) baseline / reference value(基準値) 0.105 を含む。H0 を棄却しない
この例が教えている本当のこと
⭐ ここは臨床的にはrelevant(−1.5%ポイントは閾値 0.5%ポイントを超える)だが、統計的には有意でないという組み合わせである。「relevant だが有意でない」は「有意だが relevant でない」と並ぶ、頻出のパターンである。
そして信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) の幅を見ることが決定的になる。95% CI は 4.2% 〜 16.4% で、幅が 12%ポイントもある。
- ⚠️ この区間は「有病率prevalence 有病率(prevalence)prevalence(有病率) が半分以下」も「1.5倍以上」も否定していない
- したがってこの結果は「Framingham 第3期と今日で有病率 prevalence 有病率(prevalence) prevalence(有病率) は変わらない」ことをまったく示していない
- 言えるのは「n = 100 では何も決まらなかった」ということだけである
💡 幅が広い原因は という標本サイズにある。比率の標準誤差は なので、n を 4倍の 400 にすれば区間の幅はおよそ半分になる。非有意な結果を見たら、まず「検出力が足りなかっただけではないか」を疑う。
💡 検定の出力を読む順序
- 効果量 — 差・比の大きさそのもの(ここでは −1.5%ポイント)
- 臨床的relevance — その大きさは意味があるか(閾値 0.5%ポイントを超える → relevant)
- 信頼区間confidence interval信頼区間(confidence interval)confidence interval(信頼区間) — 効果の不確かさの幅(4.2〜16.4% → 広すぎて何も決まらない)
- p値 — 最後(0.745 → 有意でない)
p値から読み始めると、この例は「差なし」で片づいてしまう。順序を守れば「relevant な差が見えているのに、標本が小さすぎて判定できていない」という、本当の結論 conclusion 結論(conclusion) conclusion(結論) にたどり着く。
p値の落とし穴(総まとめ)
| 落とし穴 | 内容 | 行き先 |
|---|---|---|
| 統計的有意性 ≠ 臨床的relevance | n が大きければ無意味な差も有意になる。逆に大きな効果でも n が小さければ有意にならない | 効果量と CI を先に見る |
| 多重検定 | なら、H0 が真の検定を20回やれば1回はおよそ有意になる。しかも有意でない結果は発表されないため、何回検定したか誰にも分からない | 多重比較multiple comparisons多重比較(multiple comparisons)multiple comparisons(多重比較) |
| H0 非棄却 ≠ H0 の証明 | 赤白の玉の例。検証は働かず反証しか働かない | 信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) の幅を見る |
| 相関 ≠ 因果 | 2変数 variables 変数(variables) variables(変数) が関連して見えても因果関係 bidirectional causal relationship 因果関係(bidirectional causal relationship) bidirectional causal relationship(因果関係) とは限らない | 相関と回帰、交絡confounding交絡(confounding)confounding(交絡) |
| p値を使うべきか論争 | 濫用・誤解が多いため科学文献から追放すべきという議論がある。ただし代替指標も同じくらい難しい。難しいのは数学ではなく科学的推論そのものである | 統計的議論の組み立て |
まとめ
- 科学的な言明は反証可能でなければならない。検証は原理的に完了しないが、反証は1例で成立する。
- 立証責任は主張する側にある。したがって H0 は常に「効果がない・現在の知識のとおり」 側に置く。
- H0 は一義的(= を含む)、H1 は新しい主張。H1 = not H0。
- p値は であって ではない。 「H0 が正しい確率」でも「結果が偶然 chance 偶然(chance) chance(偶然) である確率」でもない。
- p > 0.05 は「差がない」ではない。 何が否定できたかを決めるのは信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) の幅であり、幅が広ければその研究は何も決めていない。
- 統計的有意性と臨床的relevanceは別物。 だから読む順序は 効果量 → relevance → 信頼区間confidence interval信頼区間(confidence interval)confidence interval(信頼区間) → p値。
- 第1種の過誤 は自分で決める。第2種の過誤 は真実に依存し、検出力 。検出力は効果量・標本サイズ・測定精度・設計で上がる。
- と のトレードオフ trade-off トレードオフ(trade-off) trade-off(トレードオフ) を解消できる唯一の手段は n を増やすこと。
- 両側検定の棄却 ⇔ 信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) が H0 の値を含まない。 同じ情報だが、信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) のほうが効果の大きさと精度まで示すので情報量が多い。
- 実験は手順の8番目である。・relevance の閾値・棄却域は、データを見る前に決めておく。
出典
- 1.The ASA Statement on p-Values: Context, Process, and Purpose(The American Statistician (American Statistical Association)・2016)p値がH0の正しさの確率ではないこと、p値だけで科学的・臨床的結論や政策判断を下してはならないこと、効果量と推定の精度を併せて報告すべきであることを定めた学会公式声明の6原則閲覧 2026-08-17
- 2.Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations(European Journal of Epidemiology・2016)「p > 0.05 は差がないことを示す」「1−p は H1 が正しい確率」など、p値・信頼区間・検出力についての25の典型的誤解とその訂正閲覧 2026-08-17
- 3.Statistics notes: Absence of evidence is not evidence of absence(BMJ・1995)有意でない結果を「差がない」と読むことの誤り、および信頼区間の幅を見れば「差がないと言えるほど精密だったのか」が判別できること閲覧 2026-08-17
- 4.The Abuse of Power: The Pervasive Fallacy of Power Calculations for Data Analysis(The American Statistician・2001)得られたp値から事後的に検出力を計算する「観測検出力」がp値の単調な言い換えにすぎず、非有意な結果の解釈には情報を追加しないこと閲覧 2026-08-17