医療統計学・医療情報学・遠隔医療 · 05
標本抽出と推定 — 標準誤差・信頼区間・予測区間
Sampling and Estimation: Standard Error, Confidence Intervals, Prediction Intervals
🧠 全体像:母集団は永久に見えない。見えるのは標本だけである。標本から母集団の値を「狙う」のが推定で、狙いは必ず外れる。その外れ方のばらつきが標準誤差(SE)、狙いの幅として示したものが信頼区間 confidence interval信頼区間(confidence interval) confidence interval(信頼区間)、そして次の1人がどこに落ちるかの幅が予測区間。この3つを混ぜないことが、この分野で最初に身につけるべき区別である。
推定とは何か
母集団について知りたい値(確率・期待値・分散)は、母集団全体を測らないかぎり分からない。しかし母集団全体を測ることは、ふつう不可能である。そこで標本を無作為に取り出し、標本から計算した値で母集団の値を推測する。
flowchart TD
A["母集団<br>(真の値 p, μ, σ は永久に不明)"] -->|"<span class='jp-term jp-term-diagram' title='random sampling'>無作為抽出</span><br>RANDOMNESS"| B["標本"]
B -->|"記述統計<br>標本の特徴づけ"| C["推定量<br>p̂, x̄, s"]
C -->|"推測統計<br>UNCERTAINTY"| D["母集団についての<span class='jp-term jp-term-diagram' title='conclusion'>結論</span>"]
D -.->|"必ず誤差を伴う"| A
⚠️ この図の要点は、矢印が2回とも不確実性を持ち込むことである。抽出の段階で偶然 chance 偶然(chance) chance(偶然) が入り、推測の段階で「その偶然 chance 偶然(chance) chance(偶然) がどれくらいだったか」を数学で見積もる。誤差はゼロにできない。できるのは誤差の大きさを定量することだけである。
母集団の値と、標本からの推定量
母集団側の値は理論値であり、標本側の値はそれを狙って撃った「弾着点」である。記号を混同しないこと。
| 概念 | 母集団の値(狙い=目標) | 標本からの推定量(弾着) |
|---|---|---|
| 確率・比率 | (相対頻度) | |
| 期待値・平均 | または | (標本平均) |
| 分散 | または | (不偏分散) |
| 標準偏差standard deviation標準偏差(standard deviation)standard deviation(標準偏差) | または | (標本標準偏差 standard deviation標準偏差(standard deviation) standard deviation(標準偏差)、SD) |
💡 ギリシャ文字は母集団、ラテン文字とハット記号は標本、と覚える。試験の記述で と を取り違えると、H0 の書き方まで崩れる。
点推定と区間推定
| 種類 | 出すもの | 例 |
|---|---|---|
| 点推定point estimation点推定(point estimation)point estimation(点推定) | 1つの数値 | 「Rh陽性の割合は 85% と推定される」 |
| 区間推定interval estimation区間推定(interval estimation)interval estimation(区間推定) | 幅を持った区間 | 「Rh陽性の割合は 83〜87% と推定される」 |
⚠️ 点推定だけを報告するのは、当たった位置だけ言って的の大きさを言わないのと同じである。点推定は必ず区間推定と組で示す。
標準誤差 — 推定量そのもののばらつき
⭐ 核心はこの1文である。推定量それ自体が確率変数 variables 変数(variables) variables(変数) である。 標本を取り直せば x̄ も p̂ も別の値になる。その「取り直したときのばらつき」=推定量の理論的な標準偏差 standard deviation 標準偏差(standard deviation) standard deviation(標準偏差) を標準誤差standard error, SE標準誤差(standard error, SE)standard error, SE(標準誤差) と呼ぶ。
平均の標準誤差
比率の標準誤差
💡 比率の SE は のとき最大になる。そのときの値は である。つまりどんな比率でも SE は を超えないので、必要な標本サイズを見積もるときはこの最悪値を使えば安全側になる。
SD と SE は別物である
これが最も頻繁に取り違えられる。論文の表で「平均 ± 2.4」と書いてあるとき、それが SD なのか SE なのかで意味が正反対になる。
| SD(標準偏差standard deviation標準偏差(standard deviation)standard deviation(標準偏差)) | SE(標準誤差) | |
|---|---|---|
| 何のばらつきか | 個々のデータのばらつき | 推定量(平均など)のばらつき |
| n を増やすと | 変わらない(母集団の性質) | 小さくなる( に反比例) |
| 何に使うか | データの散らばりの記述、予測区間 | 推定の精度、信頼区間confidence interval信頼区間(confidence interval)confidence interval(信頼区間)、検定統計量の分母 |
⚠️ n を大きくしても、データそのものの散らばり(SD)は縮まない。縮むのは平均の推定の精度(SE) だけである。「n を増やしたので個人差 individual variation 個人差(individual variation) individual variation(個人差) が小さくなった」という読み方は誤り。
⭐ SE は 1つの標本から計算できる。標本を何度も取り直す必要はない。実習では「30回サンプリングを繰り返して、得られた30個の平均の標準偏差 standard deviation標準偏差(standard deviation) standard deviation(標準偏差)」を SE と対応づけて見せるが、それは SE の意味を実感するための演出であって、実務では公式 official 公式(official) official(公式) で 1標本から出す。
信頼区間
定義
信頼水準(1−α) は、同じ手順で信頼区間 confidence interval 信頼区間(confidence interval) confidence interval(信頼区間) を計算し続けたとき、その区間が推定対象の真の値を含む割合である。95% 信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) なら、同じ方法で100回計算すればおよそ95回は真の値を含む。
信頼区間の読み方 — 何が誤りか
「真の値が95%の確率でこの区間にある」という言い方は、頻度論の枠組みでは不正確である1。頻度論では真の値は定数であって確率変数 variables 変数(variables) variables(変数) ではない。したがって、目の前の1つの区間について言えるのは「含んでいるか、含んでいないか、どちらかである(どちらかは分からない)」だけである。95% は区間そのものではなく、区間を作る手続きの性質である。
正しい言い方は次のいずれかになる。
- 「同じ方法で計算した信頼区間 confidence interval 信頼区間(confidence interval) confidence interval(信頼区間) は、95%の割合で真の値を含む」
- 「この区間は、95%の信頼度で真の値を含むように作られている」
- 「この区間の外側の値は、このデータとあまり整合しない」
💡 なぜ緩い言い方が生き残るのか。 実用上の結論 conclusion 結論(conclusion) conclusion(結論) ——「区間の外側の値は考えにくい」——はどちらの言い方でもほぼ同じになるからである。加えて、無情報事前分布を置いたベイズ的な信用区間(credible interval)は数値がほぼ一致し、そちらでは「真の値が95%の確率でこの区間にある」が正しい読み方になる。だから実害が出にくく、慣用として残っている。ただし試験と論文の査読では区別される。「手続きの性質である」と書けるようにしておく。
何が信頼区間の幅を決めるか
| 変えるもの | 幅への影響 | 理由 |
|---|---|---|
| n を大きくする | 狭くなる(4倍で幅が半分) | SE が に反比例するため |
| 信頼水準を上げる(95% → 99%) | 広くなる | 外す確率を下げるには幅を広げるしかない |
| データのばらつき()が大きい | 広くなる | SE の分子そのもの |
⚠️ 信頼水準を上げれば「より確実」になるが、情報量は減る。「値は 0 から 100 の間にある(信頼水準 100%)」は絶対に外れないが何も言っていない。確実さと有用さはトレードオフ trade-off トレードオフ(trade-off) trade-off(トレードオフ) である。
比率の信頼区間 — 2つの方法
| 方法 | 中身 | いつ使うか |
|---|---|---|
| 正確二項法(Clopper–Pearson) | 二項分布から直接計算 | 常に使える。標本が小さいとき、 が 0 や 1 に近いときはこれ |
| 正規近似(Wald法) | が大きく が 0.5 に近いときの手計算用 |
⚠️ 正規近似は が 0 または 1 に近いと壊れる。 極端な場合、区間が 0 未満や 1 超という存在しない値まで伸びる。(1件も観測されなかった)のときは幅がゼロになってしまい、まったく役に立たない。標本が小さいときは正確法か Wilson 法を使う。
平均の信頼区間
が未知なので で代用する。このとき標準正規分布 Gaussian/normal distribution 正規分布(Gaussian/normal distribution) Gaussian/normal distribution(正規分布) ではなく t分布を使う(自由度degrees of freedom自由度(degrees of freedom)degrees of freedom(自由度) )。95% 信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) は次のようになる。
💡 なら 、 なら 、 で (≈ 2)に近づく。小標本ほど係数が大きいのは、 による の推定自体が不確かなぶんを幅で埋め合わせているからである。詳しくは t検定 を参照。
import numpy as np
from scipy import stats
x = np.array([174, 161, 139, 168, 143, 149, 208, 169]) # コレステロール mg/dL
se = x.std(ddof=1) / np.sqrt(len(x)) # 平均の標準誤差
print(x.mean(), se)
print(stats.t.interval(0.95, len(x)-1, loc=x.mean(), scale=se)) # 平均の95%信頼区間
from statsmodels.stats.proportion import proportion_confint
proportion_confint(count=294, nobs=3263, method="beta") # 正確法(Clopper–Pearson)
proportion_confint(count=294, nobs=3263, method="wilson") # Wilson法(正規近似より安定)
💡 推定の出力を読む順序
- 点推定 — 効果の大きさそのもの。まずここを見る
- 臨床的な意味 — その大きさは意味があるか(例: 心拍数 2 min⁻¹、HDLHDL(high-density lipoprotein) 5 mg/dL)
- 信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) の幅 — 推定の精度。幅が広い=この研究では何も決まっていない
- 区間が含む値の範囲 — 区間の端(臨床的に無視 neglect 無視(neglect) neglect(無視) できる値と、臨床的に重大な値)の両方が入っていないか
予測区間 — 信頼区間との決定的な違い
⭐ 信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) はパラメータ Parameter パラメータ(Parameter) Parameter(パラメータ) (母集団の平均や比率)についての区間、予測区間は次の1個体の観測値についての区間である。 対象がまったく違う。
違いは根号の中の 1 つの項だけである。並べて見るのがいちばん早い。
💡 予測区間にだけ現れる「」が、個体そのもののばらつきである。信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) には の項しかないので で幅は 0 に潰れるが、予測区間には が残るので幅は (≈ )に留まる。
| 信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) (CI) | 予測区間(PI) | |
|---|---|---|
| 何についての区間か | 母数(、 など)。定数 | 将来の1つの観測値。確率変数 variables変数(variables) variables(変数) |
| 幅 | ≈ | |
| で | 幅が 0 に縮む | 幅は 程度に留まる(縮まない) |
| 臨床での呼び名 | ——(研究の報告) | 基準範囲reference range基準範囲(reference range)reference range(基準範囲)・基準値baseline / reference value基準値(baseline / reference value)baseline / reference value(基準値)・正常範囲 |
として、 を 5 から 1000 まで動かしたときの両者の半幅。
xychart-beta
title "標本サイズを増やすと何が縮み、何が縮まないか"
x-axis "標本サイズ n" [5, 10, 20, 30, 50, 100, 200, 300, 500, 1000]
y-axis "半幅" 0 --> 22
line [21.47, 20.56, 20.08, 19.92, 19.8, 19.7, 19.65, 19.63, 19.62, 19.61]
line [8.77, 6.2, 4.38, 3.58, 2.77, 1.96, 1.39, 1.13, 0.88, 0.62]
上の平らな線が予測区間(21.5 → 19.6 とほとんど動かない)、下の落ちていく線が信頼区間 confidence interval信頼区間(confidence interval) confidence interval(信頼区間)(8.77 → 0.62 と 1/14 になる)。
2本がまったく違う運命をたどるのが要点である。信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) は で 0 に向かうが、予測区間は なので に漸近してそこで止まる。しかも信頼区間 confidence interval 信頼区間(confidence interval) confidence interval(信頼区間) の減り方は 付近から急に鈍る——n を10倍にしても幅は 分の1にしかならないので、精度を上げるための増員は途中から割に合わなくなる。
⚠️ 予測区間は n を増やしても縮まない。 これが両者を分ける最も分かりやすい印である。n を増やせば「母集団の平均が 77.0 か 77.2 か」はいくらでも精密に分かるが、「次に来る患者の心拍数が何になるか」の不確かさは、個人差individual variation 個人差(individual variation)individual variation(個人差) そのものなので消えない。
逆に、信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) を基準範囲 reference range 基準範囲(reference range) reference range(基準範囲) として使ってはならない。 大標本の平均の 95% CI は極端に狭く(例: 77.1〜77.6 min⁻¹)、これを基準範囲 reference range 基準範囲(reference range) reference range(基準範囲) と読むとほとんど全員が「異常」になる。
基準範囲
臨床検査の基準範囲 reference range 基準範囲(reference range) reference range(基準範囲) は、健常者集団の中央 95% 区間、すなわち 2.5 パーセンタイルpercentile パーセンタイル(percentile)percentile(パーセンタイル) から 97.5 パーセンタイルpercentile パーセンタイル(percentile)percentile(パーセンタイル) として定義される2。データが正規分布 Gaussian/normal distribution 正規分布(Gaussian/normal distribution) Gaussian/normal distribution(正規分布) するときこれは にほぼ一致する。
⚠️ は正規分布 Gaussian/normal distribution 正規分布(Gaussian/normal distribution) Gaussian/normal distribution(正規分布) を仮定した近似にすぎない。 検査値Labs 検査値(Labs)Labs(検査値) は右に裾を引く分布(トリグリセリド、CRPCRP(C-reactive protein)、γ-GTなど)が多く、そのとき は負の値になったりする。標本の 2.5%・97.5% 分位点を直接とるノンパラメトリック graded / parametric パラメトリック(graded / parametric) graded / parametric(パラメトリック) な方法が標準であり2、正規性の確認には QQ プロットを使う(→ 確率と分布)。実習で「公式official 公式(official)official(公式) から出した基準範囲 reference range 基準範囲(reference range) reference range(基準範囲) と、標本の分位点が食い違うのはなぜか」と問われるのは、まさにこの点である。
さらに、標本から として作った区間は、 と を推定した分の不確かさを無視 neglect 無視(neglect) neglect(無視) しているため、真の 95% 予測区間よりわずかに狭い。正しくは である。n が大きければ差は無視 neglect 無視(neglect) neglect(無視) できるが、小標本では効いてくる。
import numpy as np
from scipy import stats
x = np.array([174, 161, 139, 168, 143, 149, 208, 169])
s, n = x.std(ddof=1), len(x)
print(stats.t.interval(0.95, n-1, loc=x.mean(), scale=s*np.sqrt(1 + 1/n))) # 予測区間
print(np.percentile(x, [2.5, 97.5])) # 分布を仮定しない基準範囲(大標本向け)
基準範囲から μ と σ を逆算する
検査報告書に基準範囲 reference range 基準範囲(reference range) reference range(基準範囲) が印字されていれば、そこから母集団のパラメータ Parameter パラメータ(Parameter) Parameter(パラメータ) を推定できる。空腹時血糖fasting blood glucose 空腹時血糖(fasting blood glucose)fasting blood glucose(空腹時血糖) の基準範囲 reference range基準範囲(reference range) reference range(基準範囲) 65〜99 mg/dL を例にとる(下限 、上限 )。
💡 これは試験で問われやすい小技だが、正規分布Gaussian/normal distribution 正規分布(Gaussian/normal distribution)Gaussian/normal distribution(正規分布) を前提とした逆算 back-calculate 逆算(back-calculate) back-calculate(逆算) であることを忘れないこと。基準範囲reference range 基準範囲(reference range)reference range(基準範囲) が非対称に印字されている検査(多くの酵素活性)では、この逆算 back-calculate 逆算(back-calculate) back-calculate(逆算) は成立しない。
良い標本とは何か
推定の理屈は標本が母集団を代表していることの上に成り立っている。数学は抽出の失敗を修復しない。
| 問題 | 内容 | 例 |
|---|---|---|
| 選択バイアスselection bias選択バイアス(selection bias)selection bias(選択バイアス) | 抽出の確率が個体によって違う | 大学病院の患者だけで一般人口の有病率 prevalence 有病率(prevalence) prevalence(有病率) を推定する |
| 無回答バイアス biasバイアス(bias) bias(バイアス) | 応じた人と応じなかった人が系統的に違う | アンケートに回答するのは健康意識の高い層 |
| 生存者survivor 生存者(survivor)survivor(生存者) バイアス biasバイアス(bias) bias(バイアス) | 観測時点まで残った個体しか見ていない | 退院できた患者だけで治療成績を評価する |
⚠️ 標本サイズを大きくしてもバイアス bias バイアス(bias) bias(バイアス) は減らない。 n を増やすと SE が縮み信頼区間 confidence interval 信頼区間(confidence interval) confidence interval(信頼区間) は狭くなるが、狙いがそもそもずれていれば、ずれた場所に精密に集まるだけである。大規模genome mutation 大規模(genome mutation)genome mutation(大規模) な偏った標本は、小規模な偏った標本より危険である(狭い区間が確からしく見えるため)。詳しくは 交絡confounding 交絡(confounding)confounding(交絡) とバイアス biasバイアス(bias) bias(バイアス) を参照。
実習で用いる Framingham 心臓研究のデータ3も、マサチューセッツ州 Framingham の住民から出発した集団であり、そのまま世界中の人口の推定値として使えるわけではない。
推定と検定の関係
信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) と仮説検定は、同じ情報を別の形で見せているにすぎない。
⭐ 有意水準 α の両側検定で H0 が棄却される ⇔ 1−α 信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) が H0 の値を含まない。
したがって信頼区間 confidence interval 信頼区間(confidence interval) confidence interval(信頼区間) を1つ示せば、検定の結論 conclusion 結論(conclusion) conclusion(結論) もそこから読める。さらに信頼区間 confidence interval 信頼区間(confidence interval) confidence interval(信頼区間) は効果の大きさとその精度まで示すので、p値より情報量が多い。詳しくは 仮説検定の論理 へ続く。
まとめ
- 推定は母集団の見えない値を標本から狙う行為であり、誤差は消せない。定量できるだけである。
- 標準誤差(SE)は推定量そのもののばらつき。、。1標本から計算できる。
- SD はデータのばらつき、SE は推定の精度。 n を増やすと SE は縮むが SD は縮まない。
- 信頼水準は区間を作る手続きの性質であって、目の前の1区間についての確率ではない。「真の値が95%の確率でこの区間にある」は頻度論的には誤り。
- 信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) は n が4倍で幅が半分、信頼水準を上げると広くなる。確実さと情報量はトレードオフ trade-offトレードオフ(trade-off) trade-off(トレードオフ)。
- 比率の区間は、小標本や極端な比率では正規近似ではなく正確法(Clopper–Pearson)または Wilson 法を使う。
- 信頼区間confidence interval 信頼区間(confidence interval)confidence interval(信頼区間) は母数の区間、予測区間は次の1個体の区間。 違いは根号の中の だけで、 で CI は 0 に縮み、PI は に留まる。
- 臨床検査の基準範囲reference range 基準範囲(reference range)reference range(基準範囲) は予測区間(中央95%区間)であり、 は正規性を仮定した近似。基準範囲reference range 基準範囲(reference range)reference range(基準範囲) の上下限から 、 を逆算 back-calculate 逆算(back-calculate) back-calculate(逆算) できる。
- 標本サイズはバイアス bias バイアス(bias) bias(バイアス) を直さない。 偏った標本を大きくすると、間違った答えが精密になるだけである。
出典
- 1.Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations(European Journal of Epidemiology・2016)「真の値が95%の確率でこの区間にある」という信頼区間の読み方が頻度論的には誤りであること、および信頼区間・p値・検出力に関する25の典型的誤解の整理閲覧 2026-08-17
- 2.Reference intervals: current status, recent developments and future considerations(Biochemia Medica・2016)臨床検査の基準範囲が中央95%区間(2.5〜97.5パーセンタイル)として定義され、非正規分布のときはノンパラメトリックにパーセンタイルを直接推定するのが標準であること閲覧 2026-08-17
- 3.The Framingham Heart Study and the epidemiology of cardiovascular disease: a historical perspective(The Lancet・2014)Framingham心臓研究が1948年に開始された前向きコホート研究であり、実習で用いるデータセットの由来であること閲覧 2026-08-17