画像診断学 · 18
画像診断における人工知能
Artificial intelligence in medical imaging
🧠 全体像:人工知能(AI)は大きな箱で、その中に機械学習、さらにその中に深層deep 深層(deep)deep(深層) 学習が入る入れ子である。機械学習は「人が特徴を決め、機械がその特徴から判断のしかたを学ぶ」、深層deep 深層(deep)deep(深層) 学習は「特徴の取り出し方まで機械が学ぶ」ところが違う。画像診断で主役なのは深層 deep 深層(deep) deep(深層) 学習の一種である畳み込みニューラルネットワーク(CNNCNN, convolutional neural network)で、検出・定量・予後予測prognostic 予後予測(prognostic)prognostic(予後予測) までこなす。一方で、AIは成績が良くても意味を理解しているとは限らない。撮影施設の目印で肺炎を「当てる」ような近道を学び、学習データの偏りをそのまま再現し、画像そのものを偽造 forgery 偽造(forgery) forgery(偽造) する道具 tool 道具(tool) tool(道具) にもなる。したがってAIは読影 image interpretation 読影(image interpretation) image interpretation(読影) 医の補助であり、最終判断と責任は人に残る。2020年頃はまだ導入の初期だったが、2026年までに米国で認められたAI対応医療機器 medical devices 医療機器(medical devices) medical devices(医療機器) は累計1,600件を超え、EUEU(European Union)ではAI法が成立して医療機器 medical devices 医療機器(medical devices) medical devices(医療機器) のAIを「高リスク」として規制 Regulation 規制(Regulation) Regulation(規制) する段階に入った。
1. なぜ画像診断にAIが必要なのか
1.1 背景
| 背景 | 内容 |
|---|---|
| 医療データの急増 | 1検査あたりの画像枚数も検査件数も増え続けている(CTCT(computed tomography)の枚数の変化は画像診断学入門の8節) |
| 市場の大きさ | 医用画像の市場はおよそ300億ドルと見積もられていた(2020年頃の推計) |
| 持続可能性・価値に基づく医療 | 限られた人手と費用で、患者にとって意味のある結果を出すことが求められる |
| 放射線科医の不足 | 放射線科医の数が検査需要の伸びに追いつかない |
| 個別化医療individualized (personalized) medicine個別化医療(individualized (personalized) medicine)individualized (personalized) medicine(個別化医療) | 「画像なくして診断なし」と言われるほど、診断と治療方針 treatment strategy 治療方針(treatment strategy) treatment strategy(治療方針) の決定が画像に頼っている |
1.2 なぜ「今」なのか
AIという考え方は1950年代からある。それが2010年代に急に実用になったのは、2つの条件がそろったからである。
- GPU:もとはゲームの画面を描くための演算装置で、同じ計算を大量に並列でこなすのが得意である。ニューラルネットワークの学習は同じ形の掛け算・足し算の繰り返しなので、GPUGPU(graphics processing unit)で一気に速くなった。
- ビッグデータ:写真を大量に集めてラベルを付けたデータセットが整い、学習の材料が手に入るようになった。世界で1日に生まれるデータ量は約2.5×10¹⁸単位(250京)とよく引用される(一般にはバイトで語られる概算である)。
💡 深層deep 深層(deep)deep(深層) 学習は「データが多いほど賢くなる」方式なので、計算力とデータの両方がそろって初めて本領を発揮する。
2. 人工知能とは何か
2.1 定義の4つの立場
AIの教科書として広く使われる Russell と Norvig の整理では、AIの定義は「考えることを目指すか、行動することを目指すか」と「人間を手本にするか、合理性(正しい答え)を手本にするか」の2軸で4つに分かれる。
| 人間を手本にする | 合理性を手本にする | |
|---|---|---|
| 考える | 人間のように考える:「文字どおりの意味で心を持つ機械、考えるコンピュータを作る新しい試み」(Haugeland 1985)、「意思決定・問題解決problem solving問題解決(problem solving)problem solving(問題解決)・学習など、人間の思考に結び付く活動の自動化」(Bellman 1978) | 合理的に考える:「計算モデルを用いた知的能力の研究」(Charniak と McDermott 1985)、「知覚・推論・行動を可能にする計算の研究」(Winston 1992) |
| 行動する | 人間のように行動する:「人が行えば知能を要する機能を果たす機械を作る技術」(Kurzweil 1990)、「今のところ人間の方が上手な事柄をコンピュータにさせる方法の研究」(Rich と Knight 1991) | 合理的に行動する:「計算知能とは知的なエージェントの設計の研究である」(Poole ら 1998)、「AIは人工物 prosthesis 人工物(prosthesis) prosthesis(人工物) の知的なふるまいに関わる」(Nilsson 1998) |
💡 医療AIで求められるのは、多くの場合「合理的に行動する」AIである。人間の医師 medical doctor 医師(medical doctor) medical doctor(医師) と同じ考え方をする必要はなく、正しい判断を安定して出すことが目標になる。ただし後述のように、正しい答えを「正しくない理由」で出していないかを人が確かめる必要がある。
2.2 AI・機械学習・深層学習の入れ子
| 階層 | 登場した時期 | 定義 |
|---|---|---|
| 人工知能 | 1950年代〜 | 感知し、推論し、行動し、適応できるプログラム |
| 機械学習 | 1980年代〜 | データに触れるほど、時間とともに性能が上がるアルゴリズム |
| 深層deep 深層(deep)deep(深層) 学習 | 2010年代〜 | 多層のニューラルネットワークが膨大なデータから学ぶ機械学習の一分野 |
flowchart TD
A["人工知能(1950年代〜)<br>感知・推論・行動・適応するプログラム"] --> B["その一部:機械学習(1980年代〜)<br>データに触れるほど性能が上がる"]
B --> C["その一部:<span class='jp-term jp-term-diagram' title='deep'>深層</span>学習(2010年代〜)<br>多層ニューラルネットワークが<br>膨大なデータから学ぶ"]
C --> D["画像診断の主役:<br>畳み込みニューラルネットワーク(<span class='jp-term jp-term-diagram' title='convolutional neural network'>CNN</span>)"]
⭐ 「AI=深層 deep 深層(deep) deep(深層) 学習」ではない。深層deep 深層(deep)deep(深層) 学習はAIのごく一部だが、画像診断で目立つ成果のほとんどはこの部分から出ている。
2.3 AIが人間に勝った最初の象徴:1997年
1997年、IBMのチェス専用コンピュータ「ディープ・ブルー」が、当時の世界チャンピオンのガルリ・カスパロフに公式 official 公式(official) official(公式) の対戦で勝った。AIが知的なゲームで人間の頂点に勝った最初の象徴的な出来事である。ただしディープ・ブルーは、人が作った評価の規則と膨大な先読みの計算で勝ったもので、データから自分で学ぶ今の深層 deep 深層(deep) deep(深層) 学習とは仕組みが違う。
2.4 AIはどう働くか:入力→思考→行動
AIの働きは「入力→思考→行動」の3段階で整理できる。それぞれを担う技術と、医療に置き換えたときの対応は次のとおりである。
| 段階 | 担う技術 | 医療での対応 |
|---|---|---|
| 入力 | 自然言語処理、コンピュータビジョン(画像の理解)、知識表現 | 医療データ(画像、カルテの文章、検査値Labs検査値(Labs)Labs(検査値)) |
| 思考 | 機械学習 | 機械学習(データから規則を学ぶ) |
| 行動 | 自動推論、ロボット工学 | 医学的推論(診断、リスク評価、治療方針treatment strategy 治療方針(treatment strategy)treatment strategy(治療方針) の提案) |
flowchart TD
A["入力:医療データ<br>画像・文章・<span class='jp-term jp-term-diagram' title='Labs'>検査値</span>"] --> B["思考:機械学習<br>データから判断のしかたを学ぶ"]
B --> C["行動:医学的推論<br>診断・リスク評価・方針の提案"]
C --> D["最終判断は<span class='jp-term jp-term-diagram' title='medical doctor'>医師</span>が行う"]
3. 機械学習
3.1 定義と流れ
機械学習は、判断のしかたを明示的にプログラムしなくても、大量のデータに触れることで、コンピュータが自動的に課題のこなし方を学び、性能を上げていく能力を与えるAIの一分野である。
古典的な機械学習の流れは次のとおりで、特徴の取り出し(特徴抽出)を人が設計するのが要点である。たとえば「車か車でないか」を判定させるなら、人が「車輪がある」「窓がある」といった手がかりを数値として取り出して与え、機械はその数値から分類のしかたを学ぶ。
flowchart TD
A["入力<br>(例:写真)"] --> B["特徴抽出<br>人が手がかりを設計して数値にする"]
B --> C["分類<br>機械が数値から判断のしかたを学ぶ"]
C --> D["出力<br>「車」か「車でない」か"]
3.2 教師あり学習と教師なし学習
| 教師あり学習 | 教師なし学習 | |
|---|---|---|
| 与えるデータ | 正解のラベルが付いた入力と出力(例:「猫」と書いた猫の写真) | ラベルのない入力だけ(猫と犬の写真を区別せず混ぜたもの) |
| 機械がすること | ラベルとの対応を学び、新しいラベルなしのデータに正しくラベルを付けられるかを試す。うまくいかなければアルゴリズムを改良し続ける | データの中にどんな型があるかを自分で見つける。人は機械が見つけた型を観察して学ぶ |
| 代表的な課題 | 分類(猫か猫でないか、病変ありかなしか)、回帰(連続した値の予測。例:年齢、臓器の体積) | クラスタリング(似たもの同士をまとめる。例:似た群1=猫、似た群2=犬)、異常検知(多数派から外れたものを見つける) |
| 画像診断の例 | 「肺結節pulmonary nodule 肺結節(pulmonary nodule)pulmonary nodule(肺結節) あり/なし」を医師 medical doctor 医師(medical doctor) medical doctor(医師) が付けたラベルで学ぶ | 病変の画像特徴から、臨床的に意味のある亜型を探す |
💡 教師あり学習の成績はラベルの質を超えられない。ラベルを付けた医師 medical doctor 医師(medical doctor) medical doctor(医師) の見落としや施設の癖は、そのままAIに受け継がれる。
3.3 学習データ・検証データ・テストデータ
教師あり学習では、集めたデータを役割の違う3つに分けて使う。
| データ | 役割 | 例えると |
|---|---|---|
| 学習データ | モデルの重み(中身の数値)を調整するのに使う | 教科書と演習問題 |
| 検証データ | 学習中に性能を確かめ、層の数や学習を止める時点などの設定を選ぶのに使う | 模擬試験 |
| テストデータ | 最後に一度だけ使い、未知のデータでの性能を見積もる | 本番の試験 |
- 過学習:学習データに合わせすぎて、学習データの成績は良いのに新しいデータで成績が落ちる状態。演習問題の答えを丸暗記して、少し違う問題が解けない受験生と同じである。学習データでの成績が上がり続けるのに検証データの成績が下がり始めたら、過学習のしるしである。
- ⚠️ 同じ患者の画像が学習データとテストデータの両方に入ると、テストの成績が実際より良く見える。データは患者単位で分ける。
- ⭐ 同じ施設のデータで作ったテストデータは、同じ装置・同じ患者層・同じ撮影の癖を共有している。別の施設のデータで確かめる外部検証をして初めて、ほかの病院でも使えるかが分かる(6.3節の肺炎AIの例)。
- AIの成績は、感度・特異度・ROCROC(receiver operating characteristic)曲線下面積 area under the curve 曲線下面積(area under the curve) area under the curve(曲線下面積) (AUCAUC, area under the curve)など、診断検査diagnostic testing 診断検査(diagnostic testing)diagnostic testing(診断検査) と同じ指標で表す。
3.4 特徴抽出の例:ラジオミクス
ラジオミクスとは、画像の関心領域 region of interest (ROI) 関心領域(region of interest (ROI)) region of interest (ROI)(関心領域) から多数の定量的な特徴量を取り出し、1つの異常を数百のパラメータ Parameter パラメータ(Parameter) Parameter(パラメータ) で表す大きなデータセットを作る手法である。1 人の目では「濃い・薄い」「不均一」としか言えない性状を、濃度の分布、きめ(テクスチャ)、形などの数値に置き換える。
冠動脈CT血管造影coronary CT angiography 冠動脈CT血管造影(coronary CT angiography)coronary CT angiography(冠動脈CT血管造影) での流れは次のとおりである。
flowchart TD
A["①<span class='jp-term jp-term-diagram' title='coronary CT angiography'>冠動脈CT血管造影</span>で<br>血管に沿って伸ばした画像を作り<br>プラークの部分を枠で囲む"] --> B["②プラークを立体的に区切り<br>範囲を色で塗り分ける"]
B --> C["③何千もの特徴量を計算し<br>プラークごとの値を色の濃淡で並べ<br>似た特徴どうしを樹形図でまとめる"]
C --> D["④臨床情報や他の所見との<br>関係を統計的に探す"]
この手法で、冠動脈プラークのナプキンリング徴候(プラークの中心が低吸収で周囲が輪状に高吸収 high attenuation 高吸収(high attenuation) high attenuation(高吸収) に見える、心血管イベントの予後因子)を見分けると、石灰化や狭窄度をそろえた対照のプラークと比べて、従来の定量指標8個はどれも有意差を示さなかったのに対し、ラジオミクスの特徴量4,440個のうち20.6%が有意に異なり、最も良い特徴量でAUCは0.918であった。2
💡 ラジオミクスは「特徴を人が定義して計算し、判断は機械学習に任せる」という古典的な機械学習の型の代表である。深層deep 深層(deep)deep(深層) 学習ではこの特徴の定義そのものを機械が学ぶ(4節)。
3.5 古典的な機械学習の手法
| 手法 | 考え方 | 身近な例え |
|---|---|---|
| k近傍法 | 新しいデータの分類や値を、特徴の空間で近くにいるk個の既知のデータの多数決(または平均)で決める。何個の近傍を見るか(k)を決める必要がある | 「国民皆保険を」のプラカードを掲げる人々に囲まれた、プラカードを持たない人の立場を、周りの人から推測する |
| サポートベクターマシン | 2つの群を分ける境界(超平面)のうち、両側の最も近いデータ点からの距離(余白)が最大になるものを探す。境界は曲がっていてもよい(非線形non-linear非線形(non-linear)non-linear(非線形)) | 2つの軍勢の間に引く戦線(1942年12月のスターリングラード周辺の戦線図に、両軍を分ける直線と、その両側に平行な点線の余白を描いた図) |
- k近傍法の図では、「?」の新しい点のまわりに円を描くと、中に三角2つと四角1つが入る。k=3なら多数決で三角と判定される。kを変えると答えが変わりうるので、kの選び方が成績を左右する。
- サポートベクターマシンの図では、丸の群と四角の群を分ける線として、まっすぐな直線と、四角の群に沿って曲がった曲線の2本が描かれる。まっすぐな線で分けられないときは曲がった境界を使える。
4. 深層学習
4.1 機械学習との違い:特徴抽出の自動化
深層deep 深層(deep)deep(深層) 学習(2012年頃から現在まで)の最大の特徴は、データから直接学ぶことで、課題に使う特徴を専門家 expert 専門家(expert) expert(専門家) が設計する必要がなくなることである。つまり「特徴抽出の作成を自動化する」。画像診断で最もよく使われるのは畳み込みニューラルネットワーク(CNN)である。
| 古典的な機械学習 | 深層deep 深層(deep)deep(深層) 学習 | |
|---|---|---|
| 特徴抽出 | 人が設計する(例:ラジオミクスの特徴量) | ネットワークが自分で学ぶ |
| 分類 | 別のアルゴリズムで行う | 特徴抽出と同じネットワークの中で続けて行う |
| 必要なデータ量 | 比較的少なくてよい | 大量に必要 |
| 中身の分かりやすさ | どの特徴を使ったかが分かる | どこを見て判断したかが分かりにくい(6.5節) |
flowchart TD
A["入力:画像そのもの"] --> B["多層のネットワーク<br>前半が特徴抽出<br>後半が分類<br>(両方をまとめて学習)"]
B --> C["出力:<br>「車」か「車でない」か<br>「病変あり」か「なし」か"]
💡 2012年に、画像認識の国際的な競技会で深層 deep 深層(deep) deep(深層) 学習の CNN が従来法を大差で上回ったことが、今の深層 deep 深層(deep) deep(深層) 学習の流行の出発点になった。
4.2 パーセプトロンからニューラルネットワークへ
ニューラルネットワークの単位(パーセプトロン)は、神経細胞をまねたものである。
| 神経細胞 | 人工の単位 |
|---|---|
| 樹状突起dendrite 樹状突起(dendrite)dendrite(樹状突起) が多数の入力を受ける(興奮性の入力が加わる) | 入力1、入力2、入力3、入力4…を受け取る |
| 細胞体で入力を足し合わせる | 各入力に重みを掛けて合計する(重みが入力の大切さを表す) |
| 閾値を超えると軸索から発火する | 合計を活性化関数に通して出力を決める |
| 軸索の先で次の神経細胞群へつながる | 出力が次の層の多数の単位の入力になる |
これを層状につなぐと(図の例では入力層・隠れ層2層・出力層)、入力層→隠れ層(中間層)→…→出力層のネットワークになる。前の層のすべての単位が次の層のすべての単位につながり、出力層の2つの単位が例えば「あり」と「なし」の答えを出す。
- ネットワークは無数の回帰式 regression equation 回帰式(regression equation) regression equation(回帰式) を互いにつないだものと考えられる。1つひとつの単位は重み付きの足し算(回帰式regression equation回帰式(regression equation)regression equation(回帰式))にすぎないが、何層も重ねて非線形 non-linear 非線形(non-linear) non-linear(非線形) の活性化関数を挟むことで、複雑な非線形 non-linear 非線形(non-linear) non-linear(非線形) の関係を表せる。
- 隠れ層が何層も重なっていることが「深層deep深層(deep)deep(深層)」の意味である。
- 学習とは、出力と正解のずれ(誤差)が小さくなるように、出力側から入力側へ向かって重みを少しずつ直していく作業(誤差逆伝播法)の繰り返しである。
4.3 畳み込みニューラルネットワーク(CNN)の考え方
画像を1画素ずつばらばらに全結合の層へ入れると、隣り合う画素の関係(形)が失われ、重みの数も膨大になる。CNNは、小さな窓(フィルタ)を画像の上で少しずつずらしながら同じ計算を繰り返す畳み込みで、場所によらず同じ形の特徴を拾う。
flowchart TD
A["入力画像<br>(胸部X線・<span class='jp-term jp-term-diagram' title='computed tomography'>CT</span>の断面など)"] --> B["浅い層:畳み込み<br>辺・線・濃淡の変化を拾う"]
B --> C["中間の層:畳み込みと縮小(プーリング)<br>辺の組み合わせから<br>形やきめを拾う"]
C --> D["深い層<br>結節・陰影・臓器の輪郭など<br>意味のあるまとまりを表す"]
D --> E["全結合層<br>特徴をまとめて判断"]
E --> F["出力:分類・病変の位置・<br>領域の区分・数値の予測"]
5. 画像診断での応用例
5.1 1枚の胸部X線から長期の死亡リスクを予測する
米国の大規模 genome mutation 大規模(genome mutation) genome mutation(大規模) 検診試験の胸部X線で CNN(CXR-risk)を作り、入組時の胸部X線1枚だけから長期死亡のリスクを5段階(超低・低・中・高・超高)に分けた研究である。3
| 項目 | 内容 |
|---|---|
| データ | 約5万2千人の検診コホートで開発・検証し、別の喫煙者検診コホート(5,493人)で外部検証 |
| 結果 | リスク区分と死亡率が段階的に対応した。超高リスクvery high risk 超高リスク(very high risk)very high risk(超高リスク) 群の死亡率は53.0%(中央値12.2年の追跡)で、超低リスク群に比べた非調整ハザード比 hazard ratio ハザード比(hazard ratio) hazard ratio(ハザード比) は18.3。外部検証でも超高リスク very high risk 超高リスク(very high risk) very high risk(超高リスク) 群の死亡率33.9%(中央値6.3年)、ハザード比hazard ratio ハザード比(hazard ratio)hazard ratio(ハザード比) 15.2。放射線科医の所見や年齢・性別・糖尿病などの危険因子で調整しても、ハザード比hazard ratio ハザード比(hazard ratio)hazard ratio(ハザード比) は4.8(外部検証7.0)と有意に残った |
| 生存曲線 | 12年余りの追跡で、超低リスク群は9割以上が生存し、超高リスクvery high risk 超高リスク(very high risk)very high risk(超高リスク) 群は5割を下回るまで下がる。5群の曲線は交わらずに順に並ぶ(ログランク検定 P<0.001) |
| 判断の根拠の可視化 | Grad-CAM という方法で、スコアに効いた部分を胸部X線の上に色で重ねて示した。色がつくのは心陰影 cardiac silhouette 心陰影(cardiac silhouette) cardiac silhouette(心陰影) や縦隔、肺野lung field 肺野(lung field)lung field(肺野) の広い範囲などで、1つの病変ではない |
💡 AIは、人の目には細かすぎて見えない情報を拾い、人とは違うやり方でデータを読む。胸部X線に写る「体全体の老け具合」のような情報を、放射線科医の所見や年齢・性別・糖尿病などの危険因子とは別の予後情報として取り出したと考えられる。ただし、なぜ予測できるのかは完全には説明できない(6.5節)。
5.2 急性脳梗塞
急性脳梗塞 cerebral infarction 脳梗塞(cerebral infarction) cerebral infarction(脳梗塞) では、MRIMRI(magnetic resonance imaging)の拡散強調像 diffusion-weighted imaging 拡散強調像(diffusion-weighted imaging) diffusion-weighted imaging(拡散強調像) で片側の大脳半球に点状〜斑状の高信号(急性の虚血)が見える。AIソフトはこれと並べて、同じ側の大脳半球の広い範囲を色分けした定量マップを自動で作る。マップで色がつく範囲は、拡散強調像diffusion-weighted imaging 拡散強調像(diffusion-weighted imaging)diffusion-weighted imaging(拡散強調像) の高信号よりも広い。
💡 すでに傷んだ組織(梗塞の中心)と、血流が落ちているがまだ救える組織(ペナンブラpenumbra (ischemic penumbra)ペナンブラ(penumbra (ischemic penumbra))penumbra (ischemic penumbra)(ペナンブラ))の大きさを自動で計算して示すのが、この種のソフトの役割である。ミスマッチmismatch (base-pair mismatch) ミスマッチ(mismatch (base-pair mismatch))mismatch (base-pair mismatch)(ミスマッチ) の考え方と再灌流療法 reperfusion therapy 再灌流療法(reperfusion therapy) reperfusion therapy(再灌流療法) の適応は救急の神経画像 neuroimaging 神経画像(neuroimaging) neuroimaging(神経画像) 診断で扱う(虚血性脳卒中ischemic stroke虚血性脳卒中(ischemic stroke)ischemic stroke(虚血性脳卒中))。
5.3 COVID-19肺炎
胸部CTの肺野条件 lung window 肺野条件(lung window) lung window(肺野条件) の横断像 axial image 横断像(axial image) axial image(横断像) で、両肺の胸膜側に斑状の淡い陰影(すりガラス影ground-glass opacityすりガラス影(ground-glass opacity)ground-glass opacity(すりガラス影))が見える。AIソフトは病変の部分を自動で色づけし、さらに肺と気管支を立体的に再構成した画像の上に、病変の広がりを色で重ねる。色は両肺の外側(胸膜側)と下の方に多い。こうして肺全体のうち何%が侵されているかを数値で出し、重症度の判定と経過の比較に使う(COVID-19)。
5.4 今どこでAIが使われているか
2020年の時点では、脳梗塞cerebral infarction 脳梗塞(cerebral infarction)cerebral infarction(脳梗塞) やCOVID-19COVID-19(coronavirus disease 2019)肺炎の解析ソフトを大学病院が導入し始めた段階だった。その後、利用は大きく広がった。米国食品医薬品局Food and Drug Administration, FDA 米国食品医薬品局(Food and Drug Administration, FDA)Food and Drug Administration, FDA(米国食品医薬品局) (FDAFDA, Food and Drug Administration)が公開しているAI対応医療機器 medical devices 医療機器(medical devices) medical devices(医療機器) の一覧には、2026年9月時点で1,614件が載り、そのうち約76%(1,230件)が放射線科の領域である。4 画像診断は医療AIの最大の応用分野である。
| 役割 | 例 |
|---|---|
| 検出の補助 | 胸部X線の異常候補を枠で示す(胸部X線写真の読影 image interpretation読影(image interpretation) image interpretation(読影)の4.4節)、マンモグラフィmammography マンモグラフィ(mammography)mammography(マンモグラフィ) の乳癌候補、CTの肺結節 pulmonary nodule肺結節(pulmonary nodule) pulmonary nodule(肺結節) |
| 優先度付け | 頭蓋内出血intracranial hemorrhage (intracranial bleeding) 頭蓋内出血(intracranial hemorrhage (intracranial bleeding))intracranial hemorrhage (intracranial bleeding)(頭蓋内出血) や大血管閉塞が疑われる検査を読影 image interpretation 読影(image interpretation) image interpretation(読影) の列の先頭へ回す |
| 定量・計測measuring計測(measuring)measuring(計測) | 梗塞や肺炎の範囲、心胸郭比cardiothoracic ratio心胸郭比(cardiothoracic ratio)cardiothoracic ratio(心胸郭比)、臓器の体積、区域分け |
| 画像の作成 | 少ない線量や短い撮像時間で撮った画像のノイズを減らして再構成する |
| 予後予測prognostic予後予測(prognostic)prognostic(予後予測) | 5.1節のように、画像から将来のリスクを推定する |
AIに任せられることと任せられないことの一覧は画像診断学入門の8節にある。
6. リスクと危険
6.1 AIが「想像」する:敵対的生成ネットワーク(GAN)
敵対的生成ネットワーク(GANGAN, generative adversarial network)は、偽物を作るネットワーク(生成器)と、本物か偽物かを見破るネットワーク(識別器)を競わせて学習させる仕組みである。生成器は識別器をだませるように、識別器は見破れるように上達するので、最後には本物と見分けにくい画像ができる。2019年12月に公開された StyleGAN2 は、子どもから中高年まで、性別も肌の色も様々な、実在しない人の顔写真を本物と区別できない質で作った。
- 利点:まれな疾患の画像を増やして学習データを補う、低線量low-dose 低線量(low-dose)low-dose(低線量) の画像を高画質 image quality 画質(image quality) image quality(画質) 化するなど。
- ⚠️ 危険:本物らしい偽の画像を作れるということは、医用画像の偽造 forgery 偽造(forgery) forgery(偽造) にも使える(6.6節)。
6.2 AIは偏っているか
AIは学習データに含まれる偏りを、そのまま、あるいは強めて再現する。有名な例として、ぼやけた低解像度 resolution 解像度(resolution) resolution(解像度) の顔写真をAIで高解像度 resolution 解像度(resolution) resolution(解像度) に「復元restoration復元(restoration)restoration(復元)」させると、元は黒人男性の顔だったものが、白人男性の顔として出力された。学習に使った顔写真が白人に偏っていたため、「もっともらしい顔」を白人の顔として描き足したのである。
- 映画やドラマのように、画質image quality 画質(image quality)image quality(画質) の悪い画像に「画像を鮮明にしろ」と命じれば真実が浮かび上がる、というのは誤解である。AIは失われた情報を取り戻すのではなく、学習データをもとにもっともらしいものを描き足している。
- ⚠️ 医療では、特定の人種・性別・年齢層、特定の装置のデータで学習したAIが、別の集団で成績を落とす危険がある。画像を高画質 image quality 画質(image quality) image quality(画質) 化するAIが、ないはずの構造を描き足したり、ある病変を消したりする可能性も考える必要がある。
6.3 成績は理解ではない:近道学習
肺炎を胸部X線で見つける CNN を3つの病院系のデータで調べた研究では、施設内のテストでは成績が良くても、別の施設では成績が落ちることが多かった。5
- ネットワークがスコアに効いた部分を色で示すと、肺野lung field 肺野(lung field)lung field(肺野) の陰影ではなく、肺の外の画像の隅にある、施設ごとの左右の目印(金属マーカーfiducial marker金属マーカー(fiducial marker)fiducial marker(金属マーカー))の周りに色がついていた。
- 肺炎の有病率 prevalence 有病率(prevalence) prevalence(有病率) は施設によって大きく違い(ある病院で34.2%、別の2施設で1.2%と1.0%)、どの病院で撮ったかを当てるだけで合同データのAUCが0.861に達した。5 ネットワークは撮影した病院系(ある施設の画像の99.95%、別の施設の99.98%を正しく判別)や、同じ病院内の部署を高い精度で見分けていた。
- つまりAIは「肺炎の画像所見」ではなく「肺炎の多い病院の画像」という近道を学んで、見かけの成績を上げていた。
flowchart TD
A["学習データ:肺炎の多い施設と<br>少ない施設の画像が混ざる"] --> B["AIは施設の目印・<span class='jp-term jp-term-diagram' title='image quality'>画質</span>の癖から<br>撮影施設を見分けられる"]
B --> C["「この施設の画像なら肺炎が多い」<br>という近道を学ぶ"]
C --> D["施設内のテストでは<br>成績が良く見える"]
D --> E["別の施設では近道が通用せず<br>成績が落ちる"]
E --> F["対策:外部検証・<br>判断根拠の可視化・<br>導入後の性能監視"]
⭐ 「性能 ≠ 理解」。AUCが高いことは、AIが医学的に正しい理由で判断していることを保証しない。
6.4 過学習と汎化の失敗
3.3節の過学習、6.3節の近道学習は、どちらも「学習したデータの外で成績が落ちる」問題(汎化の失敗)である。導入後も、装置の更新、撮影条件の変更、患者層の変化でデータの性質がずれ、成績が静かに落ちていくことがある。そのため、導入前の外部検証に加え、導入後も自施設で成績を監視し続ける必要がある。
6.5 説明可能性
深層deep 深層(deep)deep(深層) 学習は、何百万もの重みの組み合わせで答えを出すため、なぜその答えになったのかを人が理解しにくい(ブラックボックス問題)。
- Grad-CAM などの可視化は、画像のどこが答えに効いたかを色で示し、6.3節のような近道を見つける手がかりになる。
- ⚠️ ただし色の地図は「どこを見たか」を示すだけで、「なぜそう判断したか」までは説明しない。地図がもっともらしく見えても、判断が正しいとは限らない。
6.6 医用画像の改ざん:「見ることは信じることか?」
深層deep 深層(deep)deep(深層) 学習は画像の偽造 forgery 偽造(forgery) forgery(偽造) にも使える。CT-GAN と名付けられた手法では、病院のネットワークに入り込んだ攻撃者が、CTの立体データに肺癌を書き加えたり、実在する肺癌を消したりできることが示された。6
flowchart TD
A["①<span class='jp-term jp-term-diagram' title='Digital Imaging and Communications in Medicine'>DICOM</span>ファイルを読み込む"] --> B["②標的の位置を決めて小さな立方体を切り出す<br>加えるなら:結節の位置か任意の位置<br>消すなら:最大の結節"]
B --> C["③前処理:縮尺をそろえ<br>濃度を平坦化・正規化し<br>中心を覆い隠す"]
C --> D["④<span class='jp-term jp-term-diagram' title='generative adversarial network'>GAN</span>が覆った中心を描く<br>加える用の<span class='jp-term jp-term-diagram' title='generative adversarial network'>GAN</span>:腫瘍を描く<br>消す用の<span class='jp-term jp-term-diagram' title='generative adversarial network'>GAN</span>:正常な肺を描く"]
D --> E["⑤後処理:正規化と平坦化を元に戻し<br>元の縮尺に戻す"]
E --> F["⑥元の画像と重み付きで混ぜ<br>雑音を加えて継ぎ目を隠す"]
F --> G["⑦元の位置に貼り戻す<br>(病変が複数なら②〜⑦を繰り返す)"]
G --> H["⑧<span class='jp-term jp-term-diagram' title='Digital Imaging and Communications in Medicine'>DICOM</span>として書き戻す"]
- 改ざんした画像では、もとは細い血管の影しかなかった場所に、丸い結節がなじんだ形で写る。
- 専門の放射線科医3人も、深層deep 深層(deep)deep(深層) 学習の検出AIも、この改ざんに強くだまされた。6
- 起こりうる被害:不要な治療や見逃しによる健康被害、死亡、精神的な被害、偽の診断による生活の変化(職業・保険・政治Politics 政治(Politics)Politics(政治) 活動など)、保険金詐欺などの経済的な影響。
⚠️ 対策は技術(画像データの暗号化・電子署名、院内ネットワークの防御)と運用(予想外の所見と臨床像が合わないときに疑う)の両面から考える。
6.7 責任とデータ保護
| 論点 | 現在の考え方 |
|---|---|
| 責任 | 欧米の放射線関連7団体の共同声明は、当面、AIの最終的な責任はそれを設計し運用する人にあるとし、AIは透明性と信頼性 reliability 信頼性(reliability) reliability(信頼性) を最大にするよう設計すべきだとしている。7 診療では、AIの出力を採用した判断の責任は読影 image interpretation 読影(image interpretation) image interpretation(読影) 医と主治医が負う |
| 人による監督 | EUのAI法では、高リスクのAIは使用中に人が効果的に監督できるように設計しなければならない。8 |
| 自動化バイアス biasバイアス(bias) bias(バイアス) | AIの答えを疑わずに受け入れてしまう人間側の偏り。AIが見逃した病変を人も見逃しやすくなる |
| データ保護 | 健康データはEU一般データ保護規則で「特別な種類の個人データ」とされ、医療目的medical purpose 医療目的(medical purpose)medical purpose(医療目的) などで守秘義務 confidentiality 守秘義務(confidentiality) confidentiality(守秘義務) の下にある場合を除いて処理が原則禁止されている。9 学習用に画像を集めるときは匿名化・仮名kana (syllabary) 仮名(kana (syllabary))kana (syllabary)(仮名) 化と、目的に合った法的根拠が要る(守秘義務confidentiality 守秘義務(confidentiality)confidentiality(守秘義務) の全体像は患者の守秘義務 confidentiality守秘義務(confidentiality) confidentiality(守秘義務)) |
| 公正 | 学習データの偏りで特定の集団に不利な結果が出ないかを確かめる(6.2節) |
6.8 リスクと対策のまとめ
| リスク | 何が起こるか | 主な対策 |
|---|---|---|
| 偏り | 学習データに少ない集団で成績が落ちる | 多様なデータで学習し、集団ごとに成績を確かめる |
| 近道学習・過学習 | 施設内だけ成績が良い | 外部検証、患者単位のデータ分割、導入後の監視 |
| 説明できない | 誤りの理由が分からない | 判断根拠の可視化、人による確認 |
| 偽造forgery偽造(forgery)forgery(偽造)・改ざん | 偽の病変が作られる、本物が消される | 暗号化・電子署名、ネットワークの防御 |
| 責任の所在 | 誤診misdiagnosis 誤診(misdiagnosis)misdiagnosis(誤診) の責任があいまいになる | 人が最終判断を行い、AIは補助と位置づける |
| プライバシー | 学習データからの個人情報の漏洩 | 匿名化、法令に沿ったデータ管理 |
7. 規制の現在(2020年時点との違い)
2020年の時点では、医療AIを横断的に扱う法律はまだなかった。現在の主な枠組みは次のとおりである。
| 地域 | 現在の状況 |
|---|---|
| EU | AI法(規則(EU)2024/1689)が2024年7月の官報で公布された。医療機器規則Medical Device Regulation, MDR 医療機器規則(Medical Device Regulation, MDR)Medical Device Regulation, MDR(医療機器規則) の対象で第三者の適合性評価が必要な医療機器 medical devices 医療機器(medical devices) medical devices(医療機器) (またはその安全部品)となるAIは高リスクAIに分類される。8 当初、附属書I(医療機器medical devices 医療機器(medical devices)medical devices(医療機器) を含む)の高リスクAIの義務は2027年8月2日、用途で高リスクとされる附属書IIIのAI(採用・教育など)の義務は2026年8月2日から適用される予定だった。2026年7月24日に官報で公布された改正規則(デジタル・オムニバス)で、附属書Iの区分は2028年8月2日、附属書IIIの区分は2027年12月2日に延期された。医療機器規則Medical Device Regulation, MDR 医療機器規則(Medical Device Regulation, MDR)Medical Device Regulation, MDR(医療機器規則) は引き続き附属書Iに含まれる。10 |
| 米国 | FDAが医療機器 medical devices 医療機器(medical devices) medical devices(医療機器) として審査し、認めたAI対応医療機器 medical devices 医療機器(medical devices) medical devices(医療機器) を一覧で公開している。一覧は網羅的ではないが、放射線科が約4分の3を占める。大規模genome mutation 大規模(genome mutation)genome mutation(大規模) 言語モデルなどの基盤モデルを組み込んだ機器を識別する方法も検討されている。4 |
⚠️ 規制Regulation 規制(Regulation)Regulation(規制) と承認の状況は年単位で変わる。数字と期日は上の時点のもので、使うときは最新の一次資料で確かめる。
8. 画像診断の未来
8.1 指数関数的な進歩
1,000ドルで買える計算機が1秒間にこなせる計算の回数は、20世紀を通じて指数関数的 exponentially 指数関数的(exponentially) exponentially(指数関数的) に増えてきた。対数目盛の予測図では、この曲線が21世紀のうちに、昆虫の脳→マウスの脳→1人の人間の脳→全人類の脳に相当する計算量を順に越えていく(将来の部分は予測の模式図である)。
放射線医学の進歩を時間に対して描くと、長いあいだほぼ平らに見えた線が、現在の地点で急に立ち上がり upstroke 立ち上がり(upstroke) upstroke(立ち上がり) 始め、この先はほぼ垂直に伸びていく、という見通しが示されていた。指数関数的exponentially 指数関数的(exponentially)exponentially(指数関数的) な変化は、その渦中にいる人には緩やかに見えるが、ある時点から急に目に見えて速くなる。
8.2 これからの放射線科医
2020年の時点で描かれていた見通しは次のとおりである。
- AIの助けで、放射線科医の仕事はより効率的になる。
- 放射線科医は撮影の前後に相談役を務め、患者により近いところで働き、個別化医療individualized (personalized) medicine 個別化医療(individualized (personalized) medicine)individualized (personalized) medicine(個別化医療) を向上させる。
- 「未来の放射線科医は、機械があるにもかかわらずではなく、機械のおかげで、今の放射線科医よりはるかに優れた存在になる」。
💡 2026年の時点でも、AIは放射線科医を置き換えるのではなく、検出・優先度付け・計測measuring 計測(measuring)measuring(計測) を補う道具 tool 道具(tool) tool(道具) として広がっている(5.4節)。AIの答えの妥当性 validity 妥当性(validity) validity(妥当性) を画像と臨床から判断できる力は、むしろ重要になった。
9. Exam Imagesで確かめる
- EI-13-01 COVID-19肺炎:72歳の急な発熱・呼吸困難。非造影unenhanced imaging 非造影(unenhanced imaging)unenhanced imaging(非造影) 胸部CTの横断像 axial image 横断像(axial image) axial image(横断像) で、全肺葉 lobe 肺葉(lobe) lobe(肺葉) の胸膜側にすりガラス影 ground-glass opacity すりガラス影(ground-glass opacity) ground-glass opacity(すりガラス影) (黄色の線で囲んだ範囲)とコンソリデーション consolidation コンソリデーション(consolidation) consolidation(コンソリデーション) が広がり、診断は「肺実質の80%超に及ぶCOVID-19肺炎」とされる。このように病変の広がりを肺実質の割合で表すのが、5.3節の定量ソフトが自動で出す値である。
10. まとめ
- AI ⊃ 機械学習 ⊃ 深層deep 深層(deep)deep(深層) 学習。機械学習は人が特徴を設計し、深層deep 深層(deep)deep(深層) 学習は特徴抽出まで自動化する。画像では CNN が主役である。
- 教師あり学習(分類・回帰)はラベル付きデータ、教師なし学習(クラスタリング・異常検知)はラベルなしデータから学ぶ。データは学習・検証・テストに患者単位で分け、外部検証で汎化を確かめる。
- 古典的手法:k近傍法(近くのk個の多数決)、サポートベクターマシン(余白を最大にする境界)。ラジオミクスは人が定義した多数の特徴量で病変を数値化する。
- 応用:胸部X線1枚からの長期死亡リスク予測 prediction for further pregnanciesリスク予測(prediction for further pregnancies) prediction for further pregnancies(リスク予測)、急性脳梗塞 cerebral infarction 脳梗塞(cerebral infarction) cerebral infarction(脳梗塞) のマップ作成、COVID-19肺炎の範囲の定量、検出・優先度付け・計測measuring計測(measuring)measuring(計測)・再構成。米国で認められたAI対応医療機器 medical devices 医療機器(medical devices) medical devices(医療機器) の約4分の3が放射線科の領域である。
- リスク:学習データの偏り、近道学習(性能 ≠ 理解)、過学習、説明の難しさ、GANによる画像の偽造 forgery偽造(forgery) forgery(偽造)・改ざん、責任とデータ保護。
- AIは補助であり、最終判断と責任は人にある。EUのAI法では医療機器 medical devices 医療機器(medical devices) medical devices(医療機器) のAIは高リスクに分類され、その義務は2026年の改正で延期され、2028年8月2日から適用される。
出典
- 1.Cardiac Computed Tomography Radiomics: A Comprehensive Review on Radiomic Techniques(Journal of Thoracic Imaging・2018)抄録(PMID 28346329)で確認した。ラジオミクスを、関心領域から多数の定量的特徴量を取り出し、1つの異常を数百のパラメータで表す大きなデータセットを作る過程と定義し、データマイニングで臨床情報との関連を探って予測モデルを作ること。閲覧 2026-09-26
- 2.Radiomic Features Are Superior to Conventional Quantitative Computed Tomographic Metrics to Identify Coronary Plaques With Napkin-Ring Sign(Circulation. Cardiovascular Imaging・2017)抄録(PMID 29233836)で確認した。冠動脈CT血管造影でナプキンリング徴候のあるプラーク30個と、石灰化・狭窄度などを揃えた対照30個を手作業で区分し、従来の定量指標8個とラジオミクス特徴量4,440個を比べたこと。多くのラジオミクス特徴量が両者で異なり、最も高いAUCは0.918であったこと。閲覧 2026-09-26
- 3.Deep Learning to Assess Long-term Mortality From Chest Radiographs(JAMA Network Open・2019)抄録(PMID 31322692)で確認した。PLCO試験の胸部X線で畳み込みニューラルネットワーク(CXR-risk)を開発(41,856人)・検証(10,464人)し、NLST(5,493人)で外部検証したこと。入組時の1枚の胸部X線から5段階(超低〜超高)のリスクに分けると死亡率に段階的な関連があり、超高リスク群の死亡率はPLCOで53.0%(中央値12.2年の追跡)、NLSTで33.9%(中央値6.3年)、超低リスク群に対する非調整ハザード比はそれぞれ18.3と15.2であったこと。閲覧 2026-09-26
- 4.Artificial Intelligence-Enabled Medical Devices(U.S. Food and Drug Administration・2026)2026年9月4日更新のページに掲載された一覧表を行ごとに数えた。販売が認められたAI対応医療機器は1,614件(最新の最終決定日は2026年6月29日、最古は1995年)、主担当の審査部門が放射線科のものが1,230件(約76%)で最多、次いで循環器154件、神経73件。一覧は網羅的ではなく、承認文書の要約にAI関連の語があるものを主に拾っていること、大規模言語モデルなどの基盤モデルを組み込んだ機器を識別する方法を検討するとしていること。閲覧 2026-09-26
- 5.Variable generalization performance of a deep learning model to detect pneumonia in chest radiographs: A cross-sectional study(PLOS Medicine・2018)抄録(PMID 30399157)で確認した。3病院系の胸部X線158,323枚で肺炎検出の畳み込みニューラルネットワークを評価し、施設内の検証より外部施設での性能が劣る組み合わせが5つ中3つあったこと。肺炎の有病率がMount Sinaiで34.2%、NIHとIndianaで1.2%と1.0%と大きく違い、病院系で並べ替えるだけで合同データのAUCが0.861になったこと、ネットワークが病院系や院内の部署を高い精度で見分け、それが予測を交絡し得ること。閲覧 2026-09-26
- 6.CT-GAN: Malicious Tampering of 3D Medical Imagery using Deep Learning(28th USENIX Security Symposium・2019)arXivの抄録で確認した。3次元の条件付き敵対的生成ネットワークで、CTの立体データに肺癌を加えたり消したりする改ざんを自動化し、ミリ秒単位で実行できること、専門の放射線科医3人と深層学習の検出AIがともに改ざんに強くだまされたこと、実際の病院ネットワークでCT画像を傍受・改変できることを侵入試験で示したこと。閲覧 2026-09-26
- 7.Ethics of Artificial Intelligence in Radiology: Summary of the Joint European and North American Multisociety Statement(Radiology・2019)抄録(PMID 31573399)で確認した。ACR・ESR・RSNAなど7団体の共同声明で、AIは効率と正確さを高め得る一方で落とし穴と偏りを持ち、広く使うと影響の大きい系統的な誤りの危険が増えること、透明性と信頼性を最大にするよう設計すべきこと、当面AIの最終的な責任は設計者と運用者である人にあること。閲覧 2026-09-26
- 8.Regulation (EU) 2024/1689 of the European Parliament and of the Council of 13 June 2024 laying down harmonised rules on artificial intelligence (Artificial Intelligence Act)(Official Journal of the European Union・2024)官報(L series 2024/1689、2024年7月12日)の本文で確認した。第6条1項で、附属書Iの整合法令の対象製品そのもの、またはその安全部品であって第三者の適合性評価を要するAIシステムを高リスクとすること、附属書I Section Aに医療機器規則(EU)2017/745と体外診断用医療機器規則(EU)2017/746が含まれること、第14条で高リスクAIシステムは使用中に人が効果的に監督できるよう設計しなければならないこと。当初の第113条では、規則全体(附属書IIIの高リスクAIを含む)の適用開始が2026年8月2日、第6条1項とその義務の適用開始が2027年8月2日であったこと。閲覧 2026-09-26
- 9.Regulation (EU) 2016/679 (GDPR), Article 9 — Processing of special categories of personal data(European Union(EU一般データ保護規則)・2016)健康に関するデータが「特別な種類の個人データ」として原則的に処理を禁じられ、医療診断・保健医療の提供などの目的で、職業上の守秘義務を伴う条件下でのみ例外的に処理が認められること閲覧 2026-09-26
- 10.Regulation (EU) 2026/1744 of the European Parliament and of the Council of 8 July 2026 amending Regulations (EU) 2024/1689, (EU) 2018/1139 and (EU) 2023/1230 as regards the simplification of the implementation of harmonised rules on artificial intelligence (Digital Omnibus on AI)(Official Journal of the European Union・2026)官報(L series 2026/1744、2026年7月24日公布、公布の3日後に発効)の本文で確認した。AI法第113条を改め、第3章第1〜3節の適用開始を、附属書III(第6条2項)の高リスクAIは2027年12月2日、附属書I(第6条1項、医療機器を含む)の高リスクAIは2028年8月2日としたこと。附属書I Section Aからは第1項(機械指令)だけが削除され、医療機器規則は残ること(改正第40項・第41項、第4条)。閲覧 2026-09-26