症状の経過や心配を、
診察で整理する。
伝えたいことが多いほど、症状の経過と患者の心配を一度に捉えにくい。
AMIE / GOOGLE × BIDMC • 模擬評価から実患者研究へ
医師の常時監督下で実施。記録・要約を事前確認した44件中33件で、診察準備に役立った。
Googleと米BIDMCのAMIEは、模擬患者との対話評価から、実際の患者の診察前問診を調べる段階へ進みました。AIとの面談を100人が完了し、98人がその後の診察も受けました。
監督も含めて医師の負担が減るかは未検証。成人の緊急ではない新しい症状を対象に、1つの医療機関で行った研究です。通常手順との比較はなく、治療成績の改善や監督のないAI診療の安全性も分かっていません。一次資料・研究条件 ↓
外来の患者と医師、医療プロダクト担当者へ。研究用システムの解説であり、個別の医療助言ではありません。
ONE-PAGE BRIEF
これは、記録や要約を診察前に読んだ医師の回答に限る結果です。AIとの会話は別の医師が常時監督しており、その作業まで含めて医師の負担が減るかは未検証です。
出典:Google 10/8、BIDMC 10/9、Google Research、論文 Table A.9。図は通常手順との比較結果ではありません。
診察では、医師が症状の始まった時期、変化、患者の心配などを確認します。AMIEの研究では、AIが診察前に患者へ質問し、その会話記録と要約を担当医に提供しました。
伝えたいことが多いほど、症状の経過と患者の心配を一度に捉えにくい。
診察前の要約に、経過・懸念・未確認事項を置く。診察では患者の話を聞き、補い直す。
課題と使い方を示す編集部の概念整理です。時間削減や通常手順への優越を示す比較結果ではありません。
PATIENT / 外来を予約した成人
CLINICIAN / 外来の担当医
検証したい効果:担当医が患者の状況を把握しやすくなり、診察で追加確認すべき点を見つけられるかを確かめます。要約があるだけで、聞き取りや診察の時間が減ると示されたわけではありません。
研究の目的と患者・医師の体験:Google Research「Trust and experience」。役割別の測定指標は編集部提案。
米BIDMCの単一外来で、新しい非緊急の症状を訴える成人が参加。安全なWebリンクで文字チャットを行い、監督医が画面共有付きビデオ通話でリアルタイムに確認しました。
医師の全回答60件のうち、事前に記録/要約を確認した回答。残る16件は事前確認できませんでした。
98人全体の閲覧率ではありません。未確認の原因をこの数値だけで決めつけず、届け方・タイミングも検証します。
AIは患者との文字のやり取りから症状や経過を聞き取り、会話記録と要約を作成します。研究では可能性のある診断も患者と共有されましたが、担当医の診察が続きます。
自他への危険、強い心理的苦痛、臨床的な危害の可能性、本人の中止希望など、事前基準に沿って止められる設計でした。
出典:Google Research「Testing AMIE」「Safety」、BIDMC発表。
編集部が提案する形式。実際のAMIE画面・出力ではありません。
研究は2025年4〜11月に実施。通常手順との比較は行わず、実際の外来で会話を実施できるか、安全面で中止が必要か、患者・医師がどう評価するかを調べました。数値は、どの集団を分母にしたかと一緒に読む必要があります。
研究の位置づけ:Google Research「Testing AMIE」「Limitations」、BIDMC発表。
100人のうち98人が、その後の担当医の診察も完了。
AI面談の完了者数と、診察まで完了した人数を区別。
事前に記録/要約を確認した回答例。75%はこの44件が分母。
人数:Google Research「Participation」。回答内訳:論文 §4.5.1・Table A.9。実施時期・75%:BIDMC発表。
BIDMCは、98件の完了例で安全上の中止がなく、一方で監督医が事実に基づかない生成内容(幻覚)1件を見つけ、5例で臨床的な補足説明を行ったと報告。これらは別の評価項目です。医師の監督を外した運用の安全性や、見逃しがないことを保証しません。
出典:BIDMC「Safety-stop intervention」周辺。幻覚・補足説明は10月発表の記述に基づき、3月版論文の数値と混ぜていません。
8週後の記録レビューで定めた最終診断が、AIの候補に含まれた割合。候補を7つまで広げた場合と、第一候補だけでは異なります。
棒の長さは0〜100%に比例。一般的な「診断精度90%」への置き換えはできません。
出典:Google Research「Clinical reasoning」。診断を治療成績の改善と同一視しないことも重要です。
通常の問診との因果的な比較はできません。独立診断、時間短縮、治療成績の改善を実証した研究ではありません。
専任の医師が会話をライブで監督しました。その負担を除いて、省人化やコスト削減を見積もることはできません。
AMIEは患者の電子診療録にアクセスせず、身体診察もできません。管理計画の実用性・費用対効果では、担当医の評価が上回りました。
機密性やAIの信頼性への懸念が残りました。診断候補の提示で患者が不安になった可能性を、担当医が「やや有害」とした例も1件ありました。
出典:Google Research「Clinical reasoning」「Limitations」、BIDMC発表。
監督されていること自体の影響も残る。論文は、観察されることで患者の行動が変わる可能性(ホーソン効果)を限界に挙げています。実際にどれだけ変わったかを測定した結果ではなく、監督のない場面へ一般化する際の注意点です。
出典:3月版論文 §6.2・§6.4。
未検証 日本語での実運用、国内での提供状況や規制上の位置づけ、施設間での再現性、監督を含む総費用。本研究を、そのまま日本で使えるサービスや承認済み医療機器の紹介としては扱いません。
患者は安全策と、担当医への情報共有の透明性を重視していました。論文では、共感など一部の項目を患者が医師評価者より低く採点しています。評価者の採点だけで患者の体験を代用しないことも大切です。患者に説明するなら、次の3点を具体化します。
背景:3月版論文 §6.3、BIDMC発表。ここでの比較対象は患者と医師評価者です。この説明を加えれば信頼が高まる、という因果関係は実証されていません。
BEFORE / 事前
目的、共有先、保存期間、権限、利用撤回時の対応を決める。
DURING / 会話中
緊急性・心理的負担・誤情報・中止希望を人につなげる。
AFTER / 引き継ぎ
未読・誤要約・情報欠落を残し、修正と判断を追跡する。
編集部提案 上記3段階は検討項目の整理であり、研究で有効性が実証された標準プロトコルではありません。
医療サービスの開発担当者は、AIの回答の良さに加え、医師が要約を確認・訂正する負担も測る必要があります。合成症例や利用条件を確認したデータで、現行の情報整理とAIの記録・要約+医師の確認を比較します。実患者を対象にした試験は、臨床・安全・法務等の審査と責任体制を先に整えます。
1件あたりの医療者総作業時間[人・分]
職種・工程別の作業時間を記録し、同じ条件の通常手順と比較します。同時に2人が10分作業した場合は20人・分。経過した10分と混同しません。上記の数字は単位の説明例で、研究の測定結果ではありません。
| 評価すること | 数え方・見方 | 見送り/再設計の条件 |
|---|---|---|
| 重要情報の欠落 | 必須項目の欠落数/対象項目数。原文にあるのに落ちた情報を分離。 | 臨床的に重要な情報が欠け、医師が気づけない。 |
| 訂正と確認の負担 | 誤記、根拠のない推測、修正箇所、再問診を記録。 | 事実と推測を区別できず、照合経路がない。 |
| 総時間と総費用 | 医療者の監督+事前確認・訂正+診察・記録を人・分で集計。患者の所要時間は別集計。 | 監督負担を含めると、合意した改善条件を満たさない。 |
| 担当医の事前確認 | 事前に読めた数/対象件数。未読・遅延の理由も残す。 | 診察前に届かない、読めない、担当者が不明。 |
| 安全・離脱 | 要介入・中止・技術失敗・離脱を別々の分母で記録。 | 緊急時や心理的負担に対して、人へつなぐ経路が働かない。 |
コピーは端末内の操作だけで、情報を外部へ送信しません。患者の実データは、この依頼文に記入しないでください。
今回分かったのは、医師の監督下でAI問診を行え、記録・要約を事前に読んだ44件中33件で準備に役立つと評価されたことです。次は通常手順と比較し、要約の質を保ちながら、監督を含む作業時間や患者の負担を減らせるかを調べる必要があります。
2026年10月10日確認。研究はGoogleとBIDMCの共同研究で、BIDMCはAlphabetによる資金提供を明示しています。病院発表も共同研究者による説明であり、独立した外部追試ではありません。
読み方の注意:本稿は公開された研究資料の解説です。AIの独立診療、診断・治療の代替、日本での利用可能性・承認状況を確認したものではありません。医療サービス開発担当者向けの評価案は編集部提案です。