医療統計学・医療情報学・遠隔医療

医療統計学・医療情報学・遠隔医療 · 11

統計的議論の組み立てとよくある誤り

Reasoning and Reasoning Fallacies

🧠 全体像:議論は「前提(証拠)→ (判断)」という一本の橋である。壊れ方は3つしかない。① 前提が偽、② 前提とが繋がっていない(=誤謬)、③ 必要な前提が抜けている。統計の講義でこれを扱うのは、EBM が「その時点で得られる証拠に基づく、明確で論理的な意思決定の連鎖」だからであり、p値の計算より前に、この橋が架かっているかどうかを見る力が要る。

医師の判断は何でできているか

EBM(Evidence-Based Medicine)の判断は次の3つを材料にする。

材料 中身
既知の統計的結果 研究から得られた数値・効果量・不確実性
個人的な知識・経験 診療経験、症例の記憶
「常識」 一般的な推論

⚠️ 後ろ2つは強力だが体系的に歪む。経験は自分が見た症例に偏り(・の偏り)、常識は直感的な誤謬を生む。統計的結果はその歪みを外から補正するために置かれている。

演繹と帰納 ——「確実」はどこまでか

型 前提が真ならは 例
演繹的 100%確実 陽性+典型症状 →(法的定義上)COVID感染者である
帰納的 確からしいだけ 陽性+典型症状 →(生物学的に)実際に感染している

⭐ 臨床判断はほぼすべて帰納である。 前提が全部正しくてもが外れうる。だから「が外れた=推論が悪かった」とは限らないし、逆に「が当たった=推論が正しかった」とも限らない。推論の質は、結果ではなく過程で評価する。

flowchart TD
  A["前提(証拠)"] --> B{"前提は真か"}
  B -->|"偽"| C["<span class='jp-term jp-term-diagram' title='conclusion'>結論</span>は支えられない<br>(データの誤り・測定の誤り)"]
  B -->|"真"| D{"前提と<span class='jp-term jp-term-diagram' title='conclusion'>結論</span>は繋がっているか"}
  D -->|"繋がっていない"| E["<span class='jp-term jp-term-diagram' title='fallacy'>誤謬</span><br><span class='jp-term jp-term-diagram' title='conclusion'>結論</span>は真かもしれないが根拠がない"]
  D -->|"繋がっている"| F{"必要な前提が揃っているか"}
  F -->|"欠けている"| G["前提の欠落<br>推論は正しいが<span class='jp-term jp-term-diagram' title='conclusion'>結論</span>は誤る"]
  F -->|"揃っている"| H["妥当な議論<br>(帰納なら確からしいだけ)"]

💡 誤謬があってもが正しいことはある。 誤謬が示すのは「その論拠ではを支えられない」ことであって、「が偽である」ことではない。相手の論証を潰しても、相手の主張を反証したことにはならない。

関連性の誤謬 ——「主張ではないもの」を攻撃する

議論が主張そのものではなく、主張者・感情・別の話題へ向けられる型。

誤謬 形 医学での例
ad hominem(人身攻撃) 主張者を攻撃する 「あのは太っている。だから肥満外来の指導はあてにならない」
── tu quoque(お前だって) 主張者自身が守っていない 「しろと言うが、先生こそ飲んでいる」
── 信用性への攻撃 この人は信用できない、ゆえに主張は偽 —
ad verecundiam(権威への訴え) 偉い人が言った、ゆえに真 「教授がそう言ったのだから正しい」
red herring(燻製ニシン) 話題をずらす —
── ストローマン 相手の主張を歪めて攻撃 「交通量の多い道路で遊ばせるな」→「では一日中部屋に閉じ込めろと?」
── 誤った 選択肢が2つしかないように見せる 「我々の味方でないなら敵だ」
論点相違 前提から出るのは別の 「2型糖尿病が増えている、ゆえにの助成を増やすべきだ」(増えることは助成が有効であることを含意しない)
ad passiones(感情への訴え) — —
── ad misericordiam(憐憫) 気の毒だから正しい 「祖母が病気なので落第させないでください」
── ad baculum(威嚇) 同意しないと不利益が及ぶ —
── ad metum(恐怖) 恐ろしいから真ではない/真である 「バイクは死ぬことがある、ゆえに交通手段として無意味だ」
── ad absurdo(嘲笑) 馬鹿げているから偽 —
ad consequentiam(帰結への訴え) 真だと都合が悪いから偽 「落第したら1年やり直しになります、だから通してください」
ad populum(多数への訴え) 多くが信じるから真 「1位だから最良の製品だ」

⚠️ 権威への訴えは、常に誤謬とは限らない。 「専門領域の権威が示した合意」は帰納的な根拠として正当に働く——が全論文を読み直せない以上、ガイドラインを参照するのは合理的である。誤謬になるのは、① 権威が専門外の事柄について語っている、② 権威が根拠の提示の代わりに使われている(「なぜそうなのか」を問うと答えがない)、③ その分野のの間で見解が割れているのに一人の権威だけを引く、のいずれかのとき。「誰が言ったか」ではなく「何を根拠に言ったか」を追えるかどうかが分かれ目である。

因果に関する誤謬

⭐ 医学で最も実害が大きい類型。

誤謬 ラテン語の意味 例
前後即因果 post hoc ergo propter hoc(この後に、ゆえにこのために) 「ワクチン接種の後に血栓ができた、だからワクチンが原因だ」
相関即因果 cum hoc ergo propter hoc(これと共に、ゆえにこのために) 「パイナップル消費量が多い地域ほどがんが多い、だからパイナップルががんを起こす」
因果の向きの恣意的な決定 — 「健康な人ほどが多い、だからの不在が病気を起こす」(実際は発熱すると宿主を離れる)

⚠️ 時間的前後関係は因果の必要条件であって十分条件ではない。 「後に起きた」は「原因である」を意味しない。同時期に起きた他の出来事(、平均への回帰、季節性、併用治療)がすべて競合する説明として残る。関連の代替説明の数え上げは 相関と単回帰 を参照。

💡 因果の向きが恣意的に決まってしまう問題は、では原理的に解けない(曝露とを同時に測っているので、どちらが先か情報がない)。が推論の限界を決める —— と重回帰 を参照。

一般化と、部分・全体の誤謬

誤謬 形 例
secundum quid(性急な一般化) 少数例から全体を推す 「このハーブ茶が私に効いた、だから皆に効く」/「モーツァルトは35歳、シューベルトは31歳で死んだ、だから偉大な作曲家は若死にする」
合成の誤謬 部分に成り立つから全体に成り立つ 「1人の学生が答えられなかった、だからこの班は誰も答えられない」
分割の誤謬 全体に成り立つから部分に成り立つ 「ハンガリーでは心血管疾患が多い、ペーテルはハンガリー人だから心血管疾患を持っている」

⚠️ 分割の誤謬は「全体で成り立つことを一部にも当てはめる」誤りである(合成の誤謬とは向きが逆)。両者を同じ定義で説明している資料があるので、「部分→全体が合成、全体→部分が分割」と向きで覚える。

💡 性急な一般化を統計的に言い換えると「標本サイズが小さい」「標本が母集団を代表していない」である。 逆に、正しく設計された研究とは「一般化を誤謬にしないための手続き」にほかならない。

無知への訴え —— 統計で最も頻発する型

「まだ偽と証明されていないから真である」。立証責任は主張する側にある(onus probandi)という原則に反する。

  • 「メーカーは効くと言っている(誰も反証していない)。だからこの製品は効く」

⭐ 統計版がこれである。

「検定でを棄却できなかった。ゆえにを棄却した」

⚠️ これは誤りである。 「H0 を棄却できなかった」は「H0 が正しい」でも「H1 が偽」でもない。証拠の不在は、不在の証拠ではない1。p > 0.05 は次のいずれでもありうる。

  • 本当に効果がない
  • 効果はあるが検出力が足りない(n が小さい、ばらつきが大きい)
  • 効果はあるが測定が粗い

判定は p値ではなくで行う。 「有意でない」とした研究の95%信頼区間が −2 mmHg 〜 +18 mmHg なら、臨床的に重要な18 mmHg の効果をまったく否定できていない。逆に区間が −0.4 〜 +0.5 mmHg なら「意味のある効果はなさそうだ」と積極的に言える。同じ「有意でない」でも中身がまったく違う2。

同じ理由で、「p = 0.049 と p = 0.051 は本質的に違う」という読み方も誤りである。 0.05 は取り決めであって自然界の境界ではない。

ばらつきの無視

帰納の前提が真でも、ばらつきを飛ばすとが壊れる。2種類ある。

型 何を飛ばしたか 例
の 集団の平均を個人に当てはめた 「このは平均10 mmHg 下げる。だからサム叔父さんも10 mmHg 下がる」
標本変動の 標本の値を母集団の値として断言した 「治療群と対照群の平均減量差は標本で12 kg だった。だから母集団でも差は12 kg である」

💡 前者への答えが予測区間、後者への答えがである(相関と単回帰)。「平均は個人を予測しない」——これは統計の限界ではなく、統計が正しく述べていることである。

グラフによるばらつきの隠蔽

⚠️ 縦軸を切り詰めた棒グラフは、無意味な差を劇的に見せる。IQ が 99.2 から 100.1 に変わっただけでも、縦軸を 99–101 に切れば「劇的な改善」に見える。同じデータを 0–140 の軸で描けば、3本の棒はほとんど区別できない。

グラフを見たら ① 縦軸が0から始まっているか、② エラーバー(SD か SE か95%CI か)が描かれているか、③ その定義が明記されているか を確認する。エラーバーの定義が書かれていないグラフは読めない。

前提の欠落 —— 推論は正しいのに結論が誤る

推論の過程ではなく、必要な前提が入っていないためにが壊れる型。ここにが入る。

観察 素朴な 欠けていた前提
身長が高いほど睡眠障害が多い 身長が睡眠障害を起こす 男性は身長が高く、かつ睡眠障害が多い(性別が)
親の申告では、幼少期の感染症が多い子はがんが多い 感染症ががんを起こす がんの子の親は過去をよく思い出す()

⭐ 「どんな前提が抜けていれば、この関連は因果でなくても説明できるか」——これがと重回帰の出発点である(と重回帰)。

直感が確率を誤る —— 連言錯誤

リンダは31歳、独身で聡明。哲学を専攻し、社会正義に敏感で、学生時代は反核デモに参加した。次のうちどれがより確からしいか。 (d) リンダは銀行員である / (f) リンダは銀行員でフェミニストである

多くの人が (f) を選ぶが、(f) は (d) の部分集合なので、次の不等式が例外なく成り立つ。

P(bank teller∩feminist)≤P(bank teller)P(\text{bank teller} \cap \text{feminist}) \le P(\text{bank teller})

これがである3。「もっともらしい物語」が確率と取り違えられている。条件を足せば足すほど、話は納得しやすくなる一方で確率は必ず下がる。

⭐ 臨床では、詳細な病歴に符合する珍しい診断ほど「確からしく」感じられるという形で現れる。詳細が増えるほど確率は下がるのに、納得感は上がる。これを打ち消すのが基準率()を先に置く習慣であり、の評価 と ベイズの方法 の主題になる。

統計に固有の誤謬(要約)

⭐ 最も多い誤りは条件付き確率の向きの取り違えである。p値が答えているのは左であって、右ではない。

p=P(data at least as extreme∣H0)    ≠    P(H0∣data)p = P(\text{data at least as extreme} \mid H_0) \;\;\neq\;\; P(H_0 \mid \text{data})

同じ形の誤りが診断でも起こる。「疾患があるとき陽性になる確率(感度)」と「陽性のとき疾患がある確率(PPV)」は別物である(の評価)。

誤り 正確には
「p値は H0 が正しい確率」 H0 が正しいと仮定したとき、観測された以上に極端な結果が得られる確率2
「p > 0.05 だから差はない」 差がないことは示されていない。を見る1
「有意だから重要」 n が大きければ無意味な差でも有意になる。臨床的relevanceは別に評価する
「95%CI に真の値が95%の確率で入る」 同じ手順を繰り返せば、そうして作った区間の95%が真の値を含む。得られた1本の区間についての確率ではない
「相関があるから因果がある」 逆因果・・・が競合する
「多数の比較で1つ有意だった」 20回検定すれば1回は有意になる。補正が要る()
「=」 が稀なときのみ近似。頻度が高いと OR は RR より大きく出る(疫学指標・・尤度比)

議論を組み立てる —— 実習で使う型

⭐ 崩してはならない順序がある。

flowchart TD
  A["① 問いを立てる<br>何を知りたいのか"] --> B["② H0 と H1 を、データを見る前に書く"]
  B --> C["③ 効果量として何を使うかを決める<br>(差・比・傾き・相関係数)"]
  C --> D["④ 臨床的relevanceの閾値を、データを見る前に決める<br>例: 心拍数2 min⁻¹ の差は意味がない"]
  D --> E["⑤ 有意水準αを決める"]
  E --> F["⑥ データを取り、記述統計と図で見る"]
  F --> G["⑦ 効果量を推定する(点推定+<span class='jp-term jp-term-diagram' title='confidence interval'>信頼区間</span>)"]
  G --> H["⑧ 有意性を判定する"]
  H --> I["⑨ 効果量・relevance・不確実性・有意性を統合して解釈する"]

💡 ④ をデータの後に決めると、どんな結果でも「意味がある」と言えてしまう。 事前に閾値を書き留めることが、最も安価で最も効果的な誤謬対策である。

⚠️ 有意性と relevance は独立の2軸である。 4通りすべてが起こる。

臨床的に relevant relevant でない
有意 実行に移す価値がある n が大きいだけ。報告はするが臨床的意味はない
有意でない 検出力不足かもしれない。CI の幅を見る。を出さず追試を求める 「効果は小さそうだ」と言える唯一の枠

まとめ

  • 議論の壊れ方は3つ——前提が偽 / 前提とが繋がっていない(誤謬) / 前提が欠けている。
  • 臨床判断はほぼすべて帰納であり、前提が真でもは確からしいだけ。推論は結果でなく過程で評価する。
  • 関連性の誤謬は「主張そのもの以外」を攻撃する型。権威への訴えだけは、専門領域内で根拠を辿れるなら正当な帰納的支持になりうる。
  • 因果の誤謬(前後即因果・相関即因果・向きの恣意的決定)が医学では最も実害が大きい。時間的前後は必要条件であって十分条件ではない。
  • 「H0 を棄却できなかった」は「H1 が偽」ではない。証拠の不在は不在の証拠ではない——判定はで行う。
  • 平均は個人を予測しない()、標本は母集団ではない(標本変動)。切り詰めた縦軸と定義のないエラーバーを疑う。
  • 詳細でもっともらしい話ほど確からしく感じるが、確率は下がる(連言錯誤)。基準率を先に置く。
  • 効果量 → 臨床的relevance → → p値。この順序を守ること自体が誤謬対策である。

出典

  1. 1.Statistics notes: Absence of evidence is not evidence of absence(BMJ(著者 Douglas G. Altman, J. Martin Bland)・1995)有意差が出なかったことを「差がない」と読み替えるのは誤りであり、信頼区間を見れば臨床的に重要な差がなお含まれうること閲覧 2026-08-17
  2. 2.The ASA Statement on p-Values: Context, Process, and Purpose(The American Statistical Association / The American Statistician(著者 Ronald L. Wasserstein, Nicole A. Lazar)・2016)p値は仮説が正しい確率でも効果の大きさでもなく、p > 0.05 は帰無仮説が正しいことの証拠ではないこと。p値だけで結論や政策決定を下してはならないこと閲覧 2026-08-17
  3. 3.Extensional versus intuitive reasoning: The conjunction fallacy in probability judgment(Psychological Review(著者 Amos Tversky, Daniel Kahneman)・1983)「Linda 問題」——具体的な記述に合致する連言(A かつ B)を、その一方(B)単独より確からしいと判断してしまう連言錯誤閲覧 2026-08-17