医療統計学・医療情報学・遠隔医療

医療統計学・医療情報学・遠隔医療 · 05

標本抽出と推定 — 標準誤差・信頼区間・予測区間

Sampling and Estimation: Standard Error, Confidence Intervals, Prediction Intervals

🧠 全体像:母集団は永久に見えない。見えるのは標本だけである。標本から母集団の値を「狙う」のが推定で、狙いは必ず外れる。その外れ方のばらつきが標準誤差(SE)、狙いの幅として示したものが、そして次の1人がどこに落ちるかの幅が予測区間。この3つを混ぜないことが、この分野で最初に身につけるべき区別である。

推定とは何か

母集団について知りたい値(確率・期待値・分散)は、母集団全体を測らないかぎり分からない。しかし母集団全体を測ることは、ふつう不可能である。そこで標本を無作為に取り出し、標本から計算した値で母集団の値を推測する。

flowchart TD
  A["母集団<br>(真の値 p, μ, σ は永久に不明)"] -->|"<span class='jp-term jp-term-diagram' title='random sampling'>無作為抽出</span><br>RANDOMNESS"| B["標本"]
  B -->|"記述統計<br>標本の特徴づけ"| C["推定量<br>p̂, x̄, s"]
  C -->|"推測統計<br>UNCERTAINTY"| D["母集団についての<span class='jp-term jp-term-diagram' title='conclusion'>結論</span>"]
  D -.->|"必ず誤差を伴う"| A

⚠️ この図の要点は、矢印が2回とも不確実性を持ち込むことである。抽出の段階でが入り、推測の段階で「そのがどれくらいだったか」を数学で見積もる。誤差はゼロにできない。できるのは誤差の大きさを定量することだけである。

母集団の値と、標本からの推定量

母集団側の値は理論値であり、標本側の値はそれを狙って撃った「弾着点」である。記号を混同しないこと。

概念 母集団の値(狙い=目標) 標本からの推定量(弾着)
確率・比率 pp p^\hat{p}(相対頻度)
期待値・平均 E(ξ)E(\xi) または μ\mu xˉ\bar{x}(標本平均)
分散 Var(ξ)\mathrm{Var}(\xi) または σ2\sigma^2 s2s^2(不偏分散)
SD(ξ)SD(\xi) または σ\sigma ss(標本、SD)

💡 ギリシャ文字は母集団、ラテン文字とハット記号は標本、と覚える。試験の記述で μ\mu と xˉ\bar{x} を取り違えると、H0 の書き方まで崩れる。

点推定と区間推定

種類 出すもの 例
1つの数値 「Rh陽性の割合は 85% と推定される」
幅を持った区間 「Rh陽性の割合は 83〜87% と推定される」

⚠️ 点推定だけを報告するのは、当たった位置だけ言って的の大きさを言わないのと同じである。点推定は必ず区間推定と組で示す。

標準誤差 — 推定量そのもののばらつき

⭐ 核心はこの1文である。推定量それ自体が確率である。 標本を取り直せば x̄ も p̂ も別の値になる。その「取り直したときのばらつき」=推定量の理論的なを と呼ぶ。

平均の標準誤差

SExˉ  =  σn  ≈  snSE_{\bar{x}} \;=\; \frac{\sigma}{\sqrt{n}} \;\approx\; \frac{s}{\sqrt{n}}

比率の標準誤差

SEp^  =  p (1−p)n  ≈  p^ (1−p^)nSE_{\hat{p}} \;=\; \sqrt{\frac{p\,(1-p)}{n}} \;\approx\; \sqrt{\frac{\hat{p}\,(1-\hat{p})}{n}}

💡 比率の SE は p=0.5p = 0.5 のとき最大になる。そのときの値は 0.25/n=0.5/n\sqrt{0.25/n} = 0.5/\sqrt{n} である。つまりどんな比率でも SE は 0.5/n0.5/\sqrt{n} を超えないので、必要な標本サイズを見積もるときはこの最悪値を使えば安全側になる。

SD と SE は別物である

これが最も頻繁に取り違えられる。論文の表で「平均 ± 2.4」と書いてあるとき、それが SD なのか SE なのかで意味が正反対になる。

SD() SE(標準誤差)
何のばらつきか 個々のデータのばらつき 推定量(平均など)のばらつき
n を増やすと 変わらない(母集団の性質) 小さくなる(n\sqrt{n} に反比例)
何に使うか データの散らばりの記述、予測区間 推定の精度、、検定統計量の分母

⚠️ n を大きくしても、データそのものの散らばり(SD)は縮まない。縮むのは平均の推定の精度(SE) だけである。「n を増やしたのでが小さくなった」という読み方は誤り。

⭐ SE は 1つの標本から計算できる。標本を何度も取り直す必要はない。実習では「30回サンプリングを繰り返して、得られた30個の平均の」を SE と対応づけて見せるが、それは SE の意味を実感するための演出であって、実務ではで 1標本から出す。

信頼区間

定義

信頼水準(1−α) は、同じ手順でを計算し続けたとき、その区間が推定対象の真の値を含む割合である。95% なら、同じ方法で100回計算すればおよそ95回は真の値を含む。

信頼区間の読み方 — 何が誤りか

「真の値が95%の確率でこの区間にある」という言い方は、頻度論の枠組みでは不正確である1。頻度論では真の値は定数であって確率ではない。したがって、目の前の1つの区間について言えるのは「含んでいるか、含んでいないか、どちらかである(どちらかは分からない)」だけである。95% は区間そのものではなく、区間を作る手続きの性質である。

正しい言い方は次のいずれかになる。

  • 「同じ方法で計算したは、95%の割合で真の値を含む」
  • 「この区間は、95%の信頼度で真の値を含むように作られている」
  • 「この区間の外側の値は、このデータとあまり整合しない」

💡 なぜ緩い言い方が生き残るのか。 実用上の——「区間の外側の値は考えにくい」——はどちらの言い方でもほぼ同じになるからである。加えて、無情報事前分布を置いたベイズ的な信用区間(credible interval)は数値がほぼ一致し、そちらでは「真の値が95%の確率でこの区間にある」が正しい読み方になる。だから実害が出にくく、慣用として残っている。ただし試験と論文の査読では区別される。「手続きの性質である」と書けるようにしておく。

何が信頼区間の幅を決めるか

変えるもの 幅への影響 理由
n を大きくする 狭くなる(4倍で幅が半分) SE が n\sqrt{n} に反比例するため
信頼水準を上げる(95% → 99%) 広くなる 外す確率を下げるには幅を広げるしかない
データのばらつき(σ\sigma)が大きい 広くなる SE の分子そのもの

⚠️ 信頼水準を上げれば「より確実」になるが、情報量は減る。「値は 0 から 100 の間にある(信頼水準 100%)」は絶対に外れないが何も言っていない。確実さと有用さはである。

比率の信頼区間 — 2つの方法

方法 中身 いつ使うか
正確二項法(Clopper–Pearson) 二項分布から直接計算 常に使える。標本が小さいとき、pp が 0 や 1 に近いときはこれ
正規近似(Wald法) p^±2p^(1−p^)/n\hat{p} \pm 2\sqrt{\hat{p}(1-\hat{p})/n} nn が大きく p^\hat{p} が 0.5 に近いときの手計算用

⚠️ 正規近似は p^\hat{p} が 0 または 1 に近いと壊れる。 極端な場合、区間が 0 未満や 1 超という存在しない値まで伸びる。p^=0\hat{p} = 0(1件も観測されなかった)のときは幅がゼロになってしまい、まったく役に立たない。標本が小さいときは正確法か Wilson 法を使う。

平均の信頼区間

σ\sigma が未知なので ss で代用する。このとき標準ではなく t分布を使う( n−1n-1)。95% は次のようになる。

xˉ  ±  t0.975, n−1⋅sn\bar{x} \;\pm\; t_{0.975,\,n-1}\cdot\frac{s}{\sqrt{n}}

💡 n=8n = 8 なら t=2.36t = 2.36、n=32n = 32 なら t=2.04t = 2.04、n→∞n \to \infty で 1.961.96(≈ 2)に近づく。小標本ほど係数が大きいのは、ss による σ\sigma の推定自体が不確かなぶんを幅で埋め合わせているからである。詳しくは t検定 を参照。

import numpy as np
from scipy import stats
x = np.array([174, 161, 139, 168, 143, 149, 208, 169])       # コレステロール mg/dL
se = x.std(ddof=1) / np.sqrt(len(x))                          # 平均の標準誤差
print(x.mean(), se)
print(stats.t.interval(0.95, len(x)-1, loc=x.mean(), scale=se))   # 平均の95%信頼区間
from statsmodels.stats.proportion import proportion_confint
proportion_confint(count=294, nobs=3263, method="beta")     # 正確法(Clopper–Pearson)
proportion_confint(count=294, nobs=3263, method="wilson")   # Wilson法(正規近似より安定)

💡 推定の出力を読む順序

  1. 点推定 — 効果の大きさそのもの。まずここを見る
  2. 臨床的な意味 — その大きさは意味があるか(例: 心拍数 2 min⁻¹、 5 mg/dL)
  3. の幅 — 推定の精度。幅が広い=この研究では何も決まっていない
  4. 区間が含む値の範囲 — 区間の端(臨床的にできる値と、臨床的に重大な値)の両方が入っていないか

予測区間 — 信頼区間との決定的な違い

⭐ は(母集団の平均や比率)についての区間、予測区間は次の1個体の観測値についての区間である。 対象がまったく違う。

違いは根号の中の 1 つの項だけである。並べて見るのがいちばん早い。

xˉ±t0.975, n−1⋅s1n⏟CIvs.xˉ±t0.975, n−1⋅s1+1n⏟PI\underbrace{\bar{x} \pm t_{0.975,\,n-1}\cdot s\sqrt{\tfrac{1}{n}}}_{\text{CI}} \qquad\text{vs.}\qquad \underbrace{\bar{x} \pm t_{0.975,\,n-1}\cdot s\sqrt{1+\tfrac{1}{n}}}_{\text{PI}}

💡 予測区間にだけ現れる「1+1+」が、個体そのもののばらつきである。には 1/n1/n の項しかないので n→∞n \to \infty で幅は 0 に潰れるが、予測区間には 11 が残るので幅は ±t⋅s\pm t\cdot s(≈ ±2σ\pm 2\sigma)に留まる。

(CI) 予測区間(PI)
何についての区間か 母数(μ\mu、pp など)。定数 将来の1つの観測値。確率
幅 xˉ±t⋅s1/n\bar{x} \pm t\cdot s\sqrt{1/n} xˉ±t⋅s1+1/n\bar{x} \pm t\cdot s\sqrt{1+1/n} ≈ μ±2σ\mu \pm 2\sigma
n→∞n \to \infty で 幅が 0 に縮む 幅は 2σ2\sigma 程度に留まる(縮まない)
臨床での呼び名 ——(研究の報告) ・・正常範囲

σ=10\sigma = 10 として、nn を 5 から 1000 まで動かしたときの両者の半幅。

xychart-beta
    title "標本サイズを増やすと何が縮み、何が縮まないか"
    x-axis "標本サイズ n" [5, 10, 20, 30, 50, 100, 200, 300, 500, 1000]
    y-axis "半幅" 0 --> 22
    line [21.47, 20.56, 20.08, 19.92, 19.8, 19.7, 19.65, 19.63, 19.62, 19.61]
    line [8.77, 6.2, 4.38, 3.58, 2.77, 1.96, 1.39, 1.13, 0.88, 0.62]

上の平らな線が予測区間(21.5 → 19.6 とほとんど動かない)、下の落ちていく線が(8.77 → 0.62 と 1/14 になる)。

2本がまったく違う運命をたどるのが要点である。は 1/n1/\sqrt{n} で 0 に向かうが、予測区間は 1+1/n→1\sqrt{1+1/n} \to 1 なので ±1.96σ≈±19.6\pm 1.96\sigma \approx \pm 19.6 に漸近してそこで止まる。しかもの減り方は n=100n = 100 付近から急に鈍る——n を10倍にしても幅は 10≈3.2\sqrt{10} \approx 3.2 分の1にしかならないので、精度を上げるための増員は途中から割に合わなくなる。

⚠️ 予測区間は n を増やしても縮まない。 これが両者を分ける最も分かりやすい印である。n を増やせば「母集団の平均が 77.0 か 77.2 か」はいくらでも精密に分かるが、「次に来る患者の心拍数が何になるか」の不確かさは、そのものなので消えない。

逆に、をとして使ってはならない。 大標本の平均の 95% CI は極端に狭く(例: 77.1〜77.6 min⁻¹)、これをと読むとほとんど全員が「異常」になる。

基準範囲

臨床検査のは、健常者集団の中央 95% 区間、すなわち 2.5 から 97.5 として定義される2。データがするときこれは μ±2σ\mu \pm 2\sigma にほぼ一致する。

⚠️ μ±2σ\mu \pm 2\sigma はを仮定した近似にすぎない。 は右に裾を引く分布(トリグリセリド、、γ-GTなど)が多く、そのとき μ−2σ\mu - 2\sigma は負の値になったりする。標本の 2.5%・97.5% 分位点を直接とるノンな方法が標準であり2、正規性の確認には QQ プロットを使う(→ 確率と分布)。実習で「から出したと、標本の分位点が食い違うのはなぜか」と問われるのは、まさにこの点である。

さらに、標本から xˉ±2s\bar{x} \pm 2s として作った区間は、μ\mu と σ\sigma を推定した分の不確かさをしているため、真の 95% 予測区間よりわずかに狭い。正しくは xˉ±t0.975, n−1⋅s1+1/n\bar{x} \pm t_{0.975,,n-1}\cdot s\sqrt{1+1/n} である。n が大きければ差はできるが、小標本では効いてくる。

import numpy as np
from scipy import stats
x = np.array([174, 161, 139, 168, 143, 149, 208, 169])
s, n = x.std(ddof=1), len(x)
print(stats.t.interval(0.95, n-1, loc=x.mean(), scale=s*np.sqrt(1 + 1/n)))  # 予測区間
print(np.percentile(x, [2.5, 97.5]))    # 分布を仮定しない基準範囲(大標本向け)

基準範囲から μ と σ を逆算する

検査報告書にが印字されていれば、そこから母集団のを推定できる。の 65〜99 mg/dL を例にとる(下限 LLLL、上限 ULUL)。

LL≈μ−2σ=65,UL≈μ+2σ=99LL \approx \mu - 2\sigma = 65 \quad,\quad UL \approx \mu + 2\sigma = 99
μ≈UL+LL2=82,σ≈UL−LL4=8.5\mu \approx \frac{UL + LL}{2} = 82 \quad,\quad \sigma \approx \frac{UL - LL}{4} = 8.5

💡 これは試験で問われやすい小技だが、を前提としたであることを忘れないこと。が非対称に印字されている検査(多くの酵素活性)では、このは成立しない。

良い標本とは何か

推定の理屈は標本が母集団を代表していることの上に成り立っている。数学は抽出の失敗を修復しない。

問題 内容 例
抽出の確率が個体によって違う 大学病院の患者だけで一般人口のを推定する
無回答 応じた人と応じなかった人が系統的に違う アンケートに回答するのは健康意識の高い層
観測時点まで残った個体しか見ていない 退院できた患者だけで治療成績を評価する

⚠️ 標本サイズを大きくしてもは減らない。 n を増やすと SE が縮みは狭くなるが、狙いがそもそもずれていれば、ずれた場所に精密に集まるだけである。な偏った標本は、小規模な偏った標本より危険である(狭い区間が確からしく見えるため)。詳しくは と を参照。

実習で用いる Framingham 心臓研究のデータ3も、マサチューセッツ州 Framingham の住民から出発した集団であり、そのまま世界中の人口の推定値として使えるわけではない。

推定と検定の関係

と仮説検定は、同じ情報を別の形で見せているにすぎない。

⭐ 有意水準 α の両側検定で H0 が棄却される ⇔ 1−α が H0 の値を含まない。

したがってを1つ示せば、検定のもそこから読める。さらには効果の大きさとその精度まで示すので、p値より情報量が多い。詳しくは 仮説検定の論理 へ続く。

まとめ

  • 推定は母集団の見えない値を標本から狙う行為であり、誤差は消せない。定量できるだけである。
  • 標準誤差(SE)は推定量そのもののばらつき。SExˉ=s/nSE_{\bar{x}} = s/\sqrt{n}、SEp^=p^(1−p^)/nSE_{\hat{p}} = \sqrt{\hat{p}(1-\hat{p})/n}。1標本から計算できる。
  • SD はデータのばらつき、SE は推定の精度。 n を増やすと SE は縮むが SD は縮まない。
  • 信頼水準は区間を作る手続きの性質であって、目の前の1区間についての確率ではない。「真の値が95%の確率でこの区間にある」は頻度論的には誤り。
  • は n が4倍で幅が半分、信頼水準を上げると広くなる。確実さと情報量は。
  • 比率の区間は、小標本や極端な比率では正規近似ではなく正確法(Clopper–Pearson)または Wilson 法を使う。
  • は母数の区間、予測区間は次の1個体の区間。 違いは根号の中の 1+1+ だけで、n→∞n \to \infty で CI は 0 に縮み、PI は 2σ2\sigma に留まる。
  • 臨床検査のは予測区間(中央95%区間)であり、μ±2σ\mu \pm 2\sigma は正規性を仮定した近似。の上下限から μ≈(UL+LL)/2\mu \approx (UL+LL)/2、σ≈(UL−LL)/4\sigma \approx (UL-LL)/4 をできる。
  • 標本サイズはを直さない。 偏った標本を大きくすると、間違った答えが精密になるだけである。

出典

  1. 1.Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations(European Journal of Epidemiology・2016)「真の値が95%の確率でこの区間にある」という信頼区間の読み方が頻度論的には誤りであること、および信頼区間・p値・検出力に関する25の典型的誤解の整理閲覧 2026-08-17
  2. 2.Reference intervals: current status, recent developments and future considerations(Biochemia Medica・2016)臨床検査の基準範囲が中央95%区間(2.5〜97.5パーセンタイル)として定義され、非正規分布のときはノンパラメトリックにパーセンタイルを直接推定するのが標準であること閲覧 2026-08-17
  3. 3.The Framingham Heart Study and the epidemiology of cardiovascular disease: a historical perspective(The Lancet・2014)Framingham心臓研究が1948年に開始された前向きコホート研究であり、実習で用いるデータセットの由来であること閲覧 2026-08-17