医療統計学・医療情報学・遠隔医療

医療統計学・医療情報学・遠隔医療 · 02

記述統計 — 代表値と散布度

Descriptive Statistics

🧠 記述統計とは、分布という「たくさんの数字」を数個の数字にする作業である。すれば必ず情報は失われる——だから問いは「どの数字を使うか」ではなく「どの情報なら失ってよいか」になる。中心だけを報告してばらつきを捨てるのは、たいてい失ってはいけないほうを捨てている。

度数分布 — 圧縮の第一段階

データを取り終えた直後にあるのは、値の並びにすぎない。ここから度数を数える。

名称 定義 例(AB0血液型 n=100)
絶対度数 そのカテゴリに属する個体の数 A型 42人
相対度数 絶対度数 ÷ 総数 A型 0.42(42%)
その値以下の度数の合計 順序があるときだけ意味をもつ

⭐ 名義の度数分布は情報を失わない。 「どの患者がどの血液型か」を問わないかぎり、度数表から元のデータ集合をできる。これが記述統計の中で例外的に無損失な操作である。

は以上で初めて定義できる。痛みの強さのような順序なら「その強さ以下の人が何人いるか」に意味があるが、血液型で「A型以下」は無意味である。

代表値(中心傾向)

度数分布はまだ「たくさんの数字」である。比較するには1つの典型値に落とす必要がある。中心傾向を表す指標は位置の指標の一種である。

代表値 定義 図の上での意味 使える尺度
最も度数の高い値 分布のピーク 名義以上(=すべて)
並べ替えて「真ん中」の値。半数が下、半数が上 曲線の下の面積を二等分する点 順序以上
÷ 個数 曲線を紙から切り抜いて釣り合う点=重心 間隔以上

💡 「重心」という比喩は単なる言い換えではない。重心は端の値ほど大きなてこ比で効くので、平均は極端な値1個で動く。中央値は面積の二等分点なので、極端な値がどれだけ遠くへ行っても順位が変わらないかぎり動かない。ここから頑健性の差がそのまま出る。

⚠️ 統計では average と mean は別語である。average は最頻値・中央値・各種の平均(算術・幾何・調和)のどれをも指しうる曖昧語なので、算術平均を指すときは常に mean(平均)と書く。

代表値だけがもつ利点

度数分布と違い、代表値は少数のデータからでも計算できる。10人の血圧から平均は出せるが、意味のあるヒストグラムは描けない。

非対称な分布での位置関係

分布が右に裾を引く(右に歪む)とき、最頻値・中央値・平均はこの順に裾の側へずれる。左に歪めば逆になる。

⚠️ この順序関係はであって定理ではない。離散分布や多峰性の分布では逆転する例が知られている。歪みの向きを判断したいなら、位置関係の推測ではなくヒストグラムか箱ひげ図を見る(→ データの可視化)。

分位数

中央値が「1/2の点」なら、「1/4の点」も考えられる。

名称 記法 意味
下側四分位数(第1四分位数) Q1、0.25-分位数 下から25%の位置。25%が下、75%が上
中央値(第2四分位数) Q2、0.5-分位数 50%–50%
上側四分位数(第3四分位数) Q3、0.75-分位数 下から75%の位置

p-分位数の一般的な定義は次の通り:それより小さいデータの個数が高々 npnp、それより大きいデータの個数が高々 n(1−p)n(1-p) であるような値(0<p<10 < p < 1、nn はデータ数)。ここから中央値は0.5-分位数、Q1は0.25-分位数、Q3は0.75-分位数と読める。はこれを百分率で言い直したものにすぎない(0.25-分位数=25)。

⚠️ 「四分位」という語は区間と区切りの値の両方に使われる。さらに分野によって番号の振り方が逆転する(学術誌のランキングでは最群を Q1 と呼ぶ)。文脈から判断するしかない。

なぜ分位数は「複数ありうる」のか

定義をそのまま適用すると、分位数は1つに定まらないことがある。バスの待ち時間を12日ぶん測って昇順に並べた例で考える。

n = 12、p = 0.5 とすると「6個が以下、6個が以上」であればよい。6番目の値が 7.72、7番目が 9.23 なら、7.72 と 9.23 の間のどの数も定義を満たす。同様に、下側四分位数も 3.44 と 3.64 の間のどれでもよいことになる。

💡 実際のソフトは1つの値を返すが、その計算法は一通りではない(中点を取る、線形補間する、など複数の流儀がある)。n が小さいと、ソフトによって四分位数が違う値になる。 論文で四分位数を報告するときに計算法の差が問題になるほどのnなら、そもそも四分位数で要約すべきではない。

外れ値への感度

同じ例で、最大値 12.98 をもっと極端な値(たとえば 120)に置き換えてみる。

指標 変化
中央値 変わらない(順位が変わらないため)
平均 大きく動く

⭐ 平均は移動に敏感、中央値は鈍感。 これが「どちらを使うか」の実質的な判断基準になる。

数値変数に最頻値は使いにくい

同じ12個の待ち時間データに最頻値はあるか。すべての値が1回ずつしか現れないので、「無い」とも「全部そうだ」とも言えてしまい、どちらも無意味である。連続では、生の値に対する最頻値は定義しても役に立たない。 意味をもたせるには、度数分布(分け)を作れるだけのデータ数が必要で、その場合の最頻値は「最も度数の高い」になる。

散布度(ばらつきの指標)

中心だけでは分布は決まらない。ばらつきの大きさを表す指標を並べる。

指標 定義 単位 性質
R=xmax⁡−xmin⁡R = x_{\max} - x_{\min} 元と同じ 2個の値だけで決まる。n が増えるほど大きくなり続ける
s2s^2(下の式) 元の二乗 数学的に扱いやすい(分散は足し合わせられる)
(SD) s=s2s = \sqrt{s^2} 元と同じ 解釈しやすい。報告に使うのはほぼ常にこちら
(IQR) IQR=Q3−Q1\mathrm{IQR} = Q_3 - Q_1 元と同じ 中央の50%が収まる幅。外れ値の影響を受けない

平均と標本分散・の定義は次の通りである。

xˉ=1n∑i=1nxi,s2=1n−1∑i=1n(xi−xˉ)2,s=s2\bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i, \qquad s^2 = \frac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar{x})^2, \qquad s = \sqrt{s^2}

💡 分散と SD は同じ情報をもつのに、報告には SD、理論には分散を使う。理由は単位である。SD はと同じ単位なので「の SD が18 mmHg」と読めるが、分散は「324 mmHg²」で意味が取れない。一方、独立な量を足すときに加算できるのは分散のほうなので(→ 標本抽出と推定)、式の中では分散が現れる。

⚠️ 分母が nn ではなく n−1n-1 なのは、標本から母分散 σ2\sigma^2 を推定する場面だからである(不偏分散)。偏差は標本平均 xˉ\bar{x} からの距離として測られており、xˉ\bar{x} 自体がそのデータから作られているぶん偏差は小さめに出る。nn で割ると母分散を系統的に過小評価するので、 n−1n-1 で割って補正する。統計ソフトの既定の出力はほぼすべて n−1n-1 のほうなので、手計算と食い違ったらここを疑う。

IQR の一般化

四分位に限る必要はない。0.05-分位数と0.95-分位数を使えば「中央の90%が入る幅」になる。分布の形を仮定せずに「大半のデータが収まる範囲」を示せるのがこの方式の強みで、(→ データの可視化)もこの考え方の応用である。

平均と SD で同じことができるか

できる——ただし分布が既知のときに限る。であれば、xˉ±2s\bar{x} \pm 2s の範囲におよそ95%のデータが入る。

⚠️ 「xˉ±2s\bar{x} \pm 2s に95%が入る」はの性質であって、データ一般の性質ではない1。歪んだ分布に当てはめると簡単に破綻する。たとえば入院日数の平均が6日、SD が8日なら、xˉ−2s=−10\bar{x} - 2s = -10 日になる。負の入院日数は存在しないので、これは「この分布は正規ではない」ことの証拠である。

💡 この計算は分布の歪みを見抜く簡便法として使える。xˉ−2s\bar{x} - 2s が、そのの物理的な下限(多くは0)を割り込むなら、分布は右に歪んでいる1。要約統計量しか載っていない論文でも、この暗算で「平均で要約すべきでないデータを平均で要約している」ことが分かる。

SD と SE は別のものである

最も頻出する誤りがこれである2。

(SD) 標準誤差(SE)
何のばらつきか 個々の観測値が平均のまわりに散らばる幅 標本平均という推定値が、標本を取り直すたびに揺れる幅
何を伝えるか 記述——この集団はどれくらいばらついているか 推測——平均の推定はどれくらい正確か
n を増やすと 変わらない(母集団の性質を推定しているだけ) 小さくなる(SE=s/n\mathrm{SE} = s/\sqrt{n} なので n\sqrt{n} に反比例)
使う場面 標本の記述、 、検定統計量の分母

⚠️ SE のほうが必ず小さいので、ばらつきを小さく見せたいときに SE が使われる。図に「平均 ± エラーバー」とだけ書かれていて、それが SD か SE か 95% CI かが書かれていない図は読めない——3つで幅が数倍違う3。自分で図や表を作るときは必ず明記する。

💡 区別の覚え方:SD は「この集団の患者はどれくらい違うか」、SE は「私の測った平均をどれくらい信じてよいか」。前者は患者について、後者は自分の推定について語っている。SE の詳細は 標本抽出と推定 で扱う。

平均と中央値、どちらを使うか

⚠️ 「平均が最良の代表値である」と説明されることがあるが、正確には「何を知りたいかで最良の代表値は変わる」。平均が優れているのは特定の目的においてだけである。

状況 適した指標 理由
「新入社員の自分はいくら稼げるか」 中央値 経営者の高給が外れ値として平均を吊り上げる。平均給与は「典型的な社員の給与」ではない
「この病院の年間総医療費はいくらか」 平均 平均 × =。中央値からはができない
2つの群を統合した値を求めたい 平均 各群の n と平均が分かればで合成できる。中央値は元データなしには合成できない
分布が歪んでいる/外れ値がある 中央値と IQR 頑健
分布がほぼ対称 平均と SD 情報量が多く、以降の検定と接続する

💡 「なぜ平均が理論の中心に居座るのか」は、距離の最小化として理解すると腑に落ちる。

最小にする量 どの距離か 答えとなる cc
∑i∣xi−c∣\sum_{i} \lvert x_i - c \rvert 絶対距離 中央値
∑i(xi−c)2\sum_{i} (x_i - c)^2 二乗距離 平均

つまり平均と中央値は「別々の代表値」ではなく、同じ問い(中心とは何か)に対して距離の測り方を変えた答えである。二乗距離は微分できて数学的に扱いやすいので、以降の理論(分散、回帰、t検定)はすべて平均の側に建てられている。中央値が理論から外れているのではなく、絶対距離が扱いにくいだけである。

💡 上のバスの例で、絶対偏差の和は 7.72 から 9.23 のどこでも同じ最小値になる。中央値がその区間のどの値でもよいという先ほどの話は、ここから来ている。

報告のしかた

分布 報告する組 書き方の例
ほぼ対称 平均 (SD) 「 132.9 (18.4) mmHg」
歪んでいる 中央値 (IQR、または Q1–Q3) 「入院日数 中央値 4日(IQR 2–9)」
カテゴリカル 度数 (%) 「男性 1,340 (41.1%)」
  • ⚠️ 「平均 ± SD」の ± は避け、括弧を使うことが推奨される3。± は区間を示唆するが、平均 ± SD は区間ではない
  • SD なのか SE なのか、必ず明記する2
  • 有効数字は元データの精度を超えない。3263人の平均心拍数を 77.35778 min⁻¹ と5桁も書く意味はなく、77.4 min⁻¹ で足りる
  • 欠測数(NA の個数)を必ず併記する。n が表ごとに違う理由がそこにある

実際の計算

import pandas as pd

df = pd.read_csv("frmgham2.csv", na_values=["NA"])
print(df["TOTCHOL"].describe())                        # n, 平均, SD, 最小, Q1, 中央値, Q3, 最大
print(df["TOTCHOL"].quantile([0.05, 0.25, 0.5, 0.75, 0.95]))
print(df.groupby("SEX")["TOTCHOL"].agg(["count", "median", "mean", "std"]))

💡 数値要約の出力を読む順序

  1. n と欠測数 — 何人ぶんの話か。欠測が多い列は、この後の解析でが減る
  2. 最小値と最大値 — あり得ない値がないか。ここが統計以前の品質チェックで、以降の数字はすべてこれが通ってからの話になる
  3. 中央値と平均の乖離 — 大きくずれていれば歪んでいる。平均で要約してはいけない合図
  4. 散布度(SD あるいは IQR) — 中心を報告するなら必ず対で読む。中心だけを見て「2群は似ている」と判断しない
  5. 群別の比較 — 群ごとに n・中心・散布度を並べる。この段階ではまだ「差がある」と言ってはならない。差がの範囲かどうかは 仮説検定の論理 の問題である

⚠️ 要約統計量が同じでも分布の形はまったく違いうる。平均と SD が一致する2つのデータ集合が、ヒストグラムでは似ても似つかないことは珍しくない。だから要約の前に必ず図を見る(→ データの可視化)。

まとめ

  • 記述統計は情報を捨てる作業である。何を捨ててよいかは分布の形が決める
  • 名義の度数分布は無損失、代表値へのは有損失
  • 代表値:最頻値=ピーク、中央値=面積の二等分点、平均=重心。使える尺度が違う
  • 平均は極端値に敏感、中央値は鈍感。これが選択の実質的な基準
  • p-分位数は「n·p 個が以下、n·(1−p) 個が以上」。n が小さいと一意に定まらず、ソフトの流儀で値が変わる
  • 散布度:範囲は2点だけで決まる/分散は理論用/SD は報告用/IQR は頑健
  • 標本分散 s2=1n−1∑(xi−xˉ)2s^2 = \frac{1}{n-1}\sum (x_i - \bar{x})^2 は n−1n-1 で割る
  • 「xˉ±2s\bar{x} \pm 2s に95%」はのときだけ。xˉ−2s\bar{x} - 2s が0を割るなら分布は歪んでいる
  • SD ≠ SE。SD は個体のばらつき(n を増やしても変わらない)、SE =s/n= s/\sqrt{n} は推定の精度(n を増やすと縮む)
  • 「平均が常に最良」ではない。が要るなら平均、典型値が要るなら中央値、群を合成するなら平均
  • 平均は二乗距離、中央値は絶対距離を最小にする点——同じ問いへの2つの答え
  • 報告は「対称なら平均 (SD)、歪んでいれば中央値 (IQR)」、SD か SE かを明記する

出典

  1. 1.Statistics Notes: Detecting skewness from summary information(BMJ(著者 J. Martin Bland, Douglas G. Altman)・1996)平均と SD だけからでも分布の歪みは検出でき、歪んだデータに平均±SD を報告すると負の値など不可能な範囲を示唆してしまうこと閲覧 2026-08-17
  2. 2.Standard deviations and standard errors(BMJ(著者 Douglas G. Altman, J. Martin Bland)・2005)SD は個々の観測値のばらつき、SE は推定量(平均など)のばらつきであり、両者は目的が異なるため混用してはならないこと閲覧 2026-08-17
  3. 3.Basic statistical reporting for articles published in Biomedical Journals: The “Statistical Analyses and Methods in the Published Literature” or the SAMPL Guidelines(International Journal of Nursing Studies(著者 Thomas A. Lang, Douglas G. Altman)・2015)記述統計の報告基準——対称な分布には平均と SD、非対称な分布には中央値と四分位範囲を用い、SD と SE を明示的に区別して書くこと閲覧 2026-08-17