AIは医師を置き換えるのか——性能・信頼・エビデンスの3層で見る現在地

「AIは医師を置き換えるのか」。この問いは、ここ数年で何度も投げかけられてきました。 講演でも記事でも、答えはたいてい二択で示されます。「置き換わる」か「置き換わらない」か。そして多くの場合、根拠は印象で語られます。AIが医師国家試験で高得点を取った、という話が出てくる。逆に、医療は人間の仕事だから代替できない、という話も出てくる。 筆者はどちらの答えも、問いの立て方が雑だと感じています。 この記事では、印象ではなく数字でこの問いに向き合います。使うのは2026年に出た3本の論文です。それぞれが違う層の限界を測っています。 層 問い 用いる論文 エビデンスの層 そもそも、どれだけ検証されているのか Nature Medicine 2026(システマティックレビュー) 性能の層 実際、どこまで当たるのか Radiology 2026(マンモグラフィAI) 信頼の層 患者は、AIの判定を受け入れるのか npj Digital Medicine 2026(ランダム化実験) 先に結論を書きます。「置き換えられるか」は、まだ問える段階にありません。 問うべきなのは「医師のどの業務を、どの程度安全に支援できるのか」のほうです。 第1層:エビデンス——4,609件の研究のうち、前向きRCTは19件 2026年3月、Nature Medicineに大規模なシステマティックレビューが載りました。臨床医学における大規模言語モデル(LLM)の研究を、網羅的に集めて質を評価したものです。 対象期間は2022年1月1日から2025年9月6日。PubMed 5,633件、Embase 8,666件、Scopus 9,315件を検索し、重複を除いた12,894件をスクリーニングして、4,609件の臨床LLM研究を抽出しています。 4,609件を約3年8か月で割ると、1日あたり3.2本。ChatGPTの公開以降、この分野の論文が爆発的に増えたことが数字で示されています。 問題は、その中身です。 項目 件数 抽出された臨床LLM研究 4,609件 うち実患者データを使ったもの 1,048件 うち前向きランダム化比較試験 19件 シミュレーション課題 1,857件 試験形式の課題 1,704件 4,609件のうち、実際の患者データを使ったものは1,048件。そのうち前向きランダム化比較試験は、わずか19件です。 残りの大半は、仮想症例に答えさせたもの(1,857件)か、医師国家試験のような問題を解かせたもの(1,704件)でした。さらに、サンプルサイズが30未満の研究が、全体の少なくとも25%を占めています。 新しい薬が世に出るまでに、どれだけの前向き試験が必要かを考えれば、19件という数字の意味は分かりやすいと思います。論文の数は多い。しかし、診療を変える根拠となる水準の研究は、まだほとんどありません。 人間と直接比べた1,046件——勝ったのは33.0% このレビューがもうひとつ示しているのが、人間との直接比較の結果です。 比較が可能だった1,046件(全体の22.7%)のうち、 LLMが人間を上回った:33.0% 人間がLLMを上回った:64.5% つまり、3回に1回しか勝っていません。 さらに重要なのは、どんな相手と、どんな課題で比べたかによって結果が変わるという点です。著者らは、比較相手が指導医(attending physicians)の場合はLLMが上回る頻度が下がり、研修医(residents)が相手の場合は約30%多く上回る傾向がある、と報告しています。課題についても、試験形式や知識の検索といった人工的な課題ではLLMが比較的強く、実際の患者データを使った現実に近い課題では優位性が下がります。 「AIが医師国家試験で高得点を取った」という話は事実です。しかしそれは、LLMがいちばん得意な土俵での成績でした。1,046件の集計は、その土俵から離れるほど成績が落ちることを示しています。 なお、このレビュー自体にも限界があります。自動解析はタイトルと抄録に対して行われており、本文まで読み込んでいません。著者ら自身が、臨床的に重要な機微を取りこぼす可能性を認めています。AIを使ってAIの研究を評価した論文である以上、この自己言及的な限界は押さえておくべきだと思います。 第2層:性能——10年前から「予感」できる。ただしAUCは0.63-0.67 次は画像です。乳がん検診のマンモグラフィAIについて、2026年6月のRadiologyに興味深い論文が出ました。 スウェーデン4地域の検診データベースを使った後ろ向き研究です。2008年1月から2019年4月までのデータで、31,394人・88,963件の検査を解析しています。うち12,072人(38.5%)が乳がんと診断されました。検診時の年齢中央値は57.6歳でした。 この研究の面白いところは、リスク予測専用のAIではなく、「いまの画像にがんらしさがあるか」を見る通常の市販AI-CAD 3製品を使い、同じ人の過去の検診画像を時間軸でさかのぼって追った点です。 結果はこうです。特異度を90%に設定したとき、AIが拾い得たがんの割合。 診断の何年前か AI-1 AI-2 AI-3 10年前 12.7% 13.8% 17.0% 6年前 19.0% 19.6% 19.7% 4年前 24.2% 23.3% 25.2% 診断の10年前の時点で、すでに1割強のがんでAIスコアが上がっていた。 3製品とも同じ傾向でしたから、特定の製品に固有の現象ではありません。 ...

September 17, 2026 · 2 min

生成AIリテラシーの本質——『使いこなす能力』より大切なこと

「生成AIを使いこなせる医師が生き残る」 こういう言葉を、最近よく目にします。確かにAIは便利で、文書作成・情報収集・要約といった作業を大幅に効率化してくれます。 しかし「使いこなす能力」だけに注目すると、見落とすことがあります。 生成AIリテラシーの本質は、AIを最後まで『ツール』として扱い続ける能力にある——そう考えるようになりました。 AIは「構造」の存在 生成AIは、アルゴリズム・統計・最適化の集合体です。 大量のデータからパターンを学び、確率的に「もっともらしい出力」を生成する——それが生成AIの正体です。苦しみも喜びも持たず、責任も負わず、患者の人生に関わることもありません。 これを「構造」と呼ぶことにします。 一方で、医師は患者と向き合う「実存」です。診断が間違えば患者さんに不利益が生じ、その責任を引き受けるのは医師です。患者の苦しみを前にして動揺し、家族の悲嘆に心を痛める——この「実存としての医師」の部分は、AIには代替できません。 陥りやすい罠——AIへの「実存の仮託」 生成AIを使っていると、あることが起きやすくなります。 「このAIが言うなら正しいだろう」という感覚です。 高精度の出力が続くと、AIの回答を批判的に検討せずに受け入れるようになります。「AIが判断してくれた」「AIが推奨した」という意識が生まれると、AIはもはやツールではなく「責任を持つ存在」に変わっています。 しかしAIは責任を取れません。誤った情報を自信満々に出力する(ハルシネーション)こともあります。最終的な判断と責任は、常に人間の側にあります。 EBMとの類比 「構造を使いつつ、責任は人間が引き受ける」という構図は、医療においてすでになじみのあるものです。 EBM(根拠に基づく医療) がそれです。 ガイドラインやランダム化比較試験のエビデンスは、「構造」として医師の判断を支えます。しかし目の前の患者さんへの適用は、ガイドラインが自動的に決めてくれるわけではない。患者の価値観・合併症・生活背景を総合して、最終的な判断をするのは医師です。 生成AIとの関係も、本質的には同じです。 AIをエビデンスと同じように扱う——参考にするが、鵜呑みにしない。批判的に検討して、責任は引き受ける。これがAI時代のEBMとも言えます。 実際に使って気づいたこと 筆者自身、文書作成・情報整理・アイデア出しにAIを日常的に使っています。 使い続けて気づくのは、AIが「もっともらしい誤り」を生成することがあるという点です。一見正確に見えるが事実と違う、あるいは最新の医学情報が反映されていない——こうした出力は、専門知識がなければ見抜けません。 逆に言えば、専門知識があるからこそAIを安全に使えるのです。 「AIが何でも答えてくれるなら、専門性は不要では?」という発想は、ここで逆転します。AIの出力を批判的に評価できるのは、その分野の専門家だけです。 AIリテラシーの3層構造 「AIを使いこなす」を細かく分解すると、3つの層があると思っています。 層 内容 操作層 プロンプトを書く・ツールを選ぶ・出力を整理する 批判層 出力の正誤を判断する・ハルシネーションに気づく 判断層 AIの提案を踏まえて、最終的に人間が決断する 多くの「AI活用術」は操作層の話です。しかし医療において重要なのは、批判層と判断層です。この2つは、専門知識と臨床経験がなければ機能しません。 まとめ 生成AIは「構造」——責任を持たない。責任を引き受けるのは医師 AIへの「実存の仮託」が最大の危険。「AIが言ったから正しい」は成り立たない EBMと同じ構図:参考にするが鵜呑みにしない、批判的に検討して責任は人間が持つ AIリテラシーの本質は「使いこなす能力」ではなく、AIを最後まで『ツール』として扱い続ける能力 専門知識はAI時代に不要にならない。AIの出力を正しく評価するために必要になる 「AIに仕事を任せる」と「AIに仕事を奪われる」は、紙一重かもしれません。その境界線は、判断と責任を手放すかどうかにあります。 関連記事 AIに代替されない緩和ケア医——「例外の連続」という仕事の本質 参考 本記事は、医師向け媒体における生成AIリテラシーに関する議論をもとに、筆者の実用経験を加えてまとめたものです。 筆者:田舎の県庁所在地に住む医師。外科学会専門医・乳癌学会認定医。現在は乳がんの検診・診断と緩和ケアを専門に担当。医師になって20年。

June 8, 2026 · 1 min

医師がまず試すべき医療AI——OpenEvidenceの強みと限界

「生成AIは便利そうだけど、医療では誤情報が怖い」——そう思っている医師は多いと思います。 私自身、ClaudeやChatGPT等の汎用AIで医療情報を調べた際、根拠がはっきりしない提案をされて困った経験があります。臨床判断に使うには信頼性が不安でした。 しかし、医療用に設計された専門AIなら話は別です。今回は日経メディカル連載「医師のための"安全に攻める"生成AI実践ノウハウ」(岡本賢先生、2026年5月12日)を参考に、OpenEvidenceという臨床AIツールを紹介します。 参考記事:岡本賢「“生成AIアレルギー"の医師こそ、触れるべきツールはこれ!」日経メディカル 2026年5月 https://medical.nikkeibp.co.jp/leaf/mem/pub/series/okamoto/202605/593110.html(※会員限定) 1. OpenEvidenceとは 項目 内容 正式名 OpenEvidence 公式サイト https://www.openevidence.com/ 創業 2023年、米国(Mayo Clinicスタートアップ支援プログラム発) 提携 NEJM(New England Journal of Medicine)・JAMAの公式AIパートナー 利用料 医師は完全無料(医師認証必須) 対応言語 日本語対応 利用実績 米国医師の約40%が日常使用、全米1万以上の医療施設で導入 → 単なる便利ツールではなく、米国臨床現場のスタンダードになりつつあるサービスです。 2. 「生成AIあるある」を回避する4つの仕組み 汎用AIで起きがちな「存在しない論文を提示」「根拠が薄い断定」を、OpenEvidenceは設計レベルで回避しています。 ① 学習データは査読済み医学論文のみ 一般ウェブサイトの情報を学習させていない → 怪しい健康情報・自由診療系のブログ等が混入しない ② 領域ごとに専門化された複数モデルで構成 単一の巨大LLMにすべてを任せない 領域横断の知識混入を防ぎ、専門領域特化の回答を導く ③ 根拠が薄い問いには答えない設計 「現時点では確定的な推奨を行うための十分なエビデンスはありません」 「報告された研究は限定的で、明確な結論には至っていません」 → 汎用AIによくあるユーザー迎合的な不正確な回答を避ける ④ すべての回答に元論文へのリンク ワンクリックで原文を検証可能 医師として一次資料に直接当たれる 3. 性能データ——汎用AIとの比較 同社(OpenEvidence社)が公表しているデータでは: 米国医師国家試験(USMLE)で初の90%超を達成、その後100%にも到達 ChatGPTと比べて誤答が77%少ない GPT-4と比べても誤答が24%少ない つまり、医療特化型のOpenEvidenceは、汎用AIに対して明確な性能優位を示しています(※すべて同社発表の数値、第三者検証は限定的)。 4. 「成書」から「一次資料リアルタイム」への転換 著者(岡本先生)の指摘で印象的だった一節: 成書もガイドラインも、突き詰めれば論文の束を誰かが編み直したもの。 OpenEvidenceはそうした資料の一次情報に医師を直接つなぐ。 これは医学情報の構造的変化を示しています。 従来 OpenEvidence時代 成書・ガイドライン(二次資料)を待つ 一次論文にリアルタイムアクセス 「ハリソン内科学」「UpToDate」を引く AIに問い、引用元を確かめる 二次資料完成まで時間差 公開された論文を即座に統合 → 「ハリソン内科学」「UpToDate」と並ぶ位置、あるいは一歩先に位置する臨床資料という評価。 ...

May 19, 2026 · 1 min

生成AIに聞いてみた

今後下にあるような内容を参考にしながら自分の考えをアウトプットしていこうと思いました。 私からAIへの質問: 2年ぶりにnoteに投稿しようと思います。今までは日記のようなものしか書いていませんでした。今後有料記事を書いたりしようと思っています。そこで自己紹介をしたり、今後書こうと思っている内容を列記しようと思います。構成について提案してください。 AIの回答: 2年ぶりのnote投稿、そして有料記事への挑戦、素晴らしいですね!構成案を提案します。 構成案1:ストーリー仕立てで共感を呼ぶ 導入: 読者に語りかけるような挨拶。2年間の休止理由を簡潔に説明。 自己紹介: 過去の活動を振り返りつつ、「なぜ今、有料記事を書くのか」を語る。 今後のコンテンツ紹介: テーマと各記事の概要、ターゲット読者を明確にする。 結び: 読者への期待感を高めるメッセージ。 構成案2:実績と専門性をアピールする 導入: 専門分野や実績を簡潔にアピール。 自己紹介: 現在の仕事を専門分野との関連性を含めて紹介。 今後のコンテンツ紹介: 専門知識に基づく有料記事のテーマを列記。 結び: 「読者の成長をサポートしたい」という貢献意欲を示す。 構成案3:読者への問いかけで興味を引く 導入: 読者の悩みや課題を具体的に提示。「私も以前は同じことで悩んでいた」と共感を呼ぶ。 自己紹介: 悩みをどう解決してきたか、自身の経験を語る。 今後のコンテンツ紹介: 悩み解決に役立つテーマを列記。 結び: 「一緒に克服しましょう」と読者に寄り添うメッセージ。 共通して意識したいポイント: 読者目線を常に意識する 抽象的な表現を避け、具体的に書く 有料記事を読むメリットを明確にする 公開後はSNSで積極的に告知する

August 31, 2025 · 1 min