このコンテンツを表示するには、JoVEへの購読が必要です。 または、無料トライアルをお申し込みください。

レビュー記事

腫瘍学教育におけるバーチャルリアリティと生成AIの現状:臨床推論評価ツールのスコーピングレビュー

167 閲覧数

DOI:

10.3791/70722

2026年5月15日

この記事について

サマリー

このスコーピングレビューでは、VRとGenAIが腫瘍学トレーニングにおける臨床的推論を評価する新たな方法を提供していることが示されています。しかし、両者とも、現時点での証拠が予備的であるため、教育用に広く利用される前により堅牢な検証と倫理的枠組みが必要です。

要約

腫瘍学は、臨床推論が基本的な能力であり、複雑な臨床情報を高リスクな環境で統合する必要がある環境です。筆記試験、客観的構造化臨床試験(OSCE)、職場ベースの評価などの従来の評価手段は貴重な知識を提供しますが、臨床推論の動的かつ反復的な質を反映するには効果的ではありません。これらの制約を克服する新たな機会は、特にバーチャルリアリティ(VR)や生成人工知能(GenAI)などの新興デジタル技術によってもたらされています。VRは、没入型で、観察可能な臨床行動に基づいて手続き的・状況的要因の評価を可能にするシミュレーションベースの環境を促進します。GenAIはより対話ベースの相互作用を提供し、認知的および分析的プロセス、特に主要な認知プロセスの評価を可能にします。文献によれば、これらの技術は相補的な利点があるものの、概念的には断片的であることが示されています。VRは主に行動パフォーマンスを記録しますが、生成AIは認知プロセスを重視しており、両者はあまり統合されていません。さらに、現在のエビデンス基盤は方法論的異質性、予備研究への依存、特に信頼性や実世界への影響に関する妥当性の欠如に特徴づけられています。その他考慮すべき要素としては、認知負荷の影響、ユーザーの変動性、そしてアルゴリズムの偏りや透明性などの倫理的問題があります。実施の実現可能性は、インフラや制度の準備状況などの組織的要因によっても影響されます。一般的に、VRと生成AIは有望でありながら、腫瘍学における臨床的推論の評価方法も発展させています。将来的には、この分野の進化には一貫した評価フレームワーク、厳密な検証、明確な倫理構造が必要となるでしょう。

概要

臨床的推論、すなわち診断と管理の基盤となる認知的およびメタ認知的プロセスは、安全かつ効果的な腫瘍学実践の基盤を構成します。これは腫瘍学の文脈で非常に複雑なプロセスであり、臨床医は不確実性に直面しながら確率的な意思決定を進め、急速に変化する治療法のエビデンスを統合し、腫瘍委員会での学際的な議論に参加しなければなりません。さらに、腫瘍医は生物医学的思考と患者中心の考え方のバランスを見つけなければならず、患者に予後が悪いことを伝え、倫理的問題に対処し、病気の変化する経路に合わせた治療計画の調整を行わなければなりません。これらの多層的な要求により、臨床推論の発展と評価は腫瘍学教育において特に重要となります。従来、臨床的推論は筆記試験、客観的構造化臨床試験(OSCE)、およびミニ臨床評価演習(Mini-CEX)などの職場ベースの評価を用いて評価されてきました。これらの方法は学習者の能力に関する背景情報を提供するものの、重大な欠点もあります。筆記試験は動的なプロセスよりも静的知識の適用に傾いています。OSCEは資源を多く消費し、生態学的に無効である可能性があります。また、職場ベースのテストは通常、エピソード的で主観的であり、文脈によるバイアスが起こりやすいです。これらすべての制約が重なり、臨床推論の反復的で文脈依存的かつ縦断的な性格を研究することを難しくしており、特に腫瘍学5のようにリスクが高く認知的負荷の高い専門分野ではそうです。これらの制限は総合的に、特に腫瘍学6のような高リスクで認知的に要求の高い専門分野で、臨床推論の反復的で文脈依存的かつ縦断的な性質を捉える能力を妨げています。

近年のデジタル技術の新たな発展は、これらの課題を克服する良い機会を提供しています。そのうち2つはバーチャルリアリティ(VR)と生成人工知能(GenAI)で、これらは強力な医療教育ツールとなっています。VRは、没入型で高度に空間的かつ文脈的なシミュレーションベースの環境を提供し、複雑な臨床シナリオを再現します。腫瘍学教育において、これらのシミュレーションは腫瘍学的緊急事態、化学療法中の合併症、繊細な患者との相互作用などのシナリオをシミュレートし、安全かつ制御された環境で体験的に意思決定を練習できるようにします7,8,9。重要なのは、VRシステムは行動シーケンス、タイミング、意思決定経路などの詳細な行動データを捉え、臨床推論の手続き的および状況的側面の評価を可能にすることです。

同時に、GenAI、特に大規模言語モデル(LLM)は、推論の認知アーキテクチャを評価する新たな機会を開いています。生成AIシステムは、自然言語を通じて学習者と対話し、仮説の生成、鑑別診断の形成、管理の正当化を問いかける適応的かつ対話ベースの環境に参加させる能力を持っています。これらのシステムは、自然言語処理の技術に基づいて学習者の回答を検証し、これまで客観的に測定が困難だった推論過程を個別化かつ拡張可能な評価で提供します。10,11,12。

さらに、既存の文献は方法論の面で断片的かつ異質です。既存の多くの証拠は、実際の評価よりも主に訓練を目的としたパイロット研究、技術報告書、または応用に基づいています。したがって、VRや生成AIの評価能力に関する多くの議論は、厳密な実証的検証ではなく、技術的機能性に基づいています。妥当性の報告は様々で、内容の妥当性が主に報告され、内部構造、信頼性、または既に確立された評価指標との相関関係への言及は最小限にとどまっています。

これらの制約は、ユーザビリティ、認知負荷、倫理的問題といった新たな課題によってさらに悪化しています。例えば、生成AIシステムはスケーラブルなインタラクティブなソリューションを提供します。しかし、情報冗長性、システムの応答の変動性、ユーザーの慣れ深さの問題は学習者の相互作用やパフォーマンスに影響を与えることがあります。同様に、評価シナリオにおける透明性、公平性、説明責任の欠如は、AI駆動のスコアリングのブラックボックス性の問題と見なすことができます。導入面では、VRシステムは大規模なインフラ投資を必要としますが、GenAIの導入は制度の準備状況、ガバナンス、教育目標との整合性に基づいています。これらの要因は、これらの技術を腫瘍学教育にどのように取り入れられるかを評価する上で、より概念的かつ組織的な枠組みの重要性を強調しています。

これに関連して、本レビューでは、腫瘍教育におけるVRおよび生成AIに関する最新文献を詳細に物語的に統合し、特に臨床推論評価への応用に注目します。特に、(1) これらのツールの技術的設計と実装の文脈を説明すること;(2) 報告された妥当性と教育成果のエビデンスをレビューすること;(3)認知的、倫理的、組織的な懸念などの主要な課題や、今後の研究・実践の方向性を概説すること。主要な学術データベースを体系的に検索し、関連する文献を探しましたが、論文のレビューが慣例として行われているため、本論文は手続き的報告ではなく解釈と総合に焦点を当てています。

図1 は、臨床行動のVRベースの評価とGenAIベースの臨床認知評価を組み合わせた統合モデルです。この二重アプローチは、臨床推論の行動的側面と分析的側面の両方を捉え、包括的な評価とフィードバックを実現します。

figure-introduction-1
図1:VRと生成AIを用いた臨床推論評価の統合モデル。 この図は、行動ベースの臨床推論(例:ワークフロー、手順、チームワーク)を評価するためのバーチャルリアリティ(VR)と、認知的および対話的推論(例:診断、正当化、反省)を評価するための生成AI(GenAI)を統合した統合モデルを示しています。 この図の拡大版はこちらをクリックしてご覧ください。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

レビューと展望

技術のタイプ論と実装
腫瘍教育における臨床推論評価のデジタル技術分野の現状は、2つのデジタル技術パラダイムによって特徴づけられています。現在のアプローチはVRおよび生成AIベースのシステムに依存しています。両方法は複雑な臨床能力の評価向上を目指していますが、技術的基盤、相互作用、評価論理の面で大きな違いがあります(13,14)。これらのシステムは、外来相談、腫瘍緊急の入院管理、またはヘッドマウントディスプレイやインタラクティブインターフェースを用いた多職種的な意思決定の場など、現実的な腫瘍学の環境に学習者を置きます。6.

VRシステムの利点は、組み込み分析を使って詳細な行動データを記録できることです。これらのデータは一連の行動、意思決定スケジュール、ナビゲーション、臨床ガイドラインの遵守で構成されています。これらの指標により、教育者はデータの取得、診断行動の優先順位付け、管理経路の実施など、臨床推論の手続き的要素を評価することができます。しかし、VRベースの評価ツールの導入には、重大なインフラ的・物流的課題が伴います。ハードウェアの取得、ソフトウェア開発、保守に伴う高い初期コストは、特に資源制約のある環境ではアクセス性を制限する可能性があります16。さらに、専用の物理的スペース、技術サポート、教員研修の必要性が大規模な展開をさらに複雑にしています。これらの制約により、VRアプリケーションは専門的なシミュレーションセンターに限定され、その拡張性や腫瘍学カリキュラムへの広範な統合が制限されています。

逆に、生成AIベースのツールは自然言語の相互作用を通じて実行され、新たな評価手法を提供します。大規模言語モデルアーキテクチャに基づいて開発され、臨床的推論メカニズムを模倣した対話型のテキストまたは音声による対話に参加させます。学習者は鑑別診断、管理判断の根拠、変化する臨床状況に答えることが奨励され、システムは形成的フィードバックと評価を提供します。

生成AIシステムの主な利点は、臨床推論の認知的側面や分析的側面を評価できることです。これらのツールは、言語の出力を見て学習者の推論の構造、一貫性、深さを評価し、正確さを超えて思考過程に関する質的情報を得ることができます。さらに、生成AIソリューションはスケーラビリティとアクセスのしやすさという大きな利点を持っています。また、VRシステムのようにウェブベースのインターフェースでのみ実装できるのに対し、リモートや非同期学習の文脈でも実装可能です5。

利点がある一方で、GenAIベースの評価ツールには大きな欠点もあります。自然言語処理への依存は、スコアリングの信頼性、解釈可能性、透明性に関する問題をもたらします。多くのシステムはブラックボックスであり、採点決定の論理が教育者や学習者に常に利用可能とは限りません文献で明らかな主なテーマは、両技術パラダイム間の生態学的妥当性とスケーラビリティの本質的なトレードオフです。VRシステムはリアルな臨床環境を再現し、身体化された意思決定を捉える能力は優れていますが、リソースを消費するためスケーラビリティに制限があります。一方、GenAIシステムは認知プロセスをスケーラブルかつ対話に基づく方法で評価するために利用できます。

重要なのは、VRとGenAIの両利点を統合またはハイブリッドプラットフォームに合わせた既存の文献が著しく不足していることです。この種の統合は、臨床的意思決定の性質が相互に関連しているため、手続き的パフォーマンスと認知的推論の同時期の測定を促進する可能性があります。実装の観点から見ると、技術能力だけが技術の採用を決定する要因ではありません。組織的および環境的要因も影響します。技術・組織・環境(TOE)モデルのようなモデルは、これらのダイナミクスを説明する上で良い視点です。

一般的に、VRと生成AIツールのタイプ論は、断続的でありながら急速に進化する分野を明らかにしています。両技術とも臨床推論の特定の側面を測定する独自の利点がありますが、現存する分離により完全に評価する機会は提供されていません。概念的統合、技術革新、文脈に応じた実施戦略を通じてこのギャップを埋めることが、より包括的かつ効果的な評価モデルへの道を歩むために必要となるでしょう。

臨床推論構造と反復的評価
臨床的推論は、診断的および治療的意思決定を支える認知的、メタ認知的、行動的プロセスを含む多面的な概念です。腫瘍学では、不確実性、動的証拠、学際的な調整の必要性がこれらのプロセスをさらに複雑にしています。文献では、臨床推論を情報収集、仮説の生成、診断の精緻化、意思決定プロセス、そして内省的評価を含む連続体として概念化する傾向が強まっています(20,21)。

VRベースのシステムは、臨床推論の観察可能かつ行動指向の側面の評価とほぼ整合しています。学習者を模擬臨床環境に配置することで、知識の習得、診断プロセスへの集中、一連の手術の実施方法を検証できます。この研究は、臨床的意思決定がシミュレーション環境における相互作用のパターンに基づく、推論を行動に移すことに焦点を当てています22

一方、GenAIベースのシステムは、臨床的推論の根底にある内部認知プロセスを誘導し分析するプロセスに重点を置きます。自然言語の交流は、学習者が異なる診断を表現し、臨床的管理の選択を正当化し、臨床的不確実性について熟考することを促します。このようなシステムは、通常、自然言語処理手法を用いて専門家の判断の近似を得て、意味の一貫性、論理構造、学習者の回答の深さを測定することで推論を決定します。

これらは補完的な強みである一方で、文献全体で最も重要とされている弱点は、認知領域と行動領域間の評価の対立的な断片化です。臨床推論の実際の実践は本質的に反復的であり、思考と行動の間に絶え間ないフィードバックがあります。これは効果的な臨床意思決定プロセス、特に腫瘍学において重要な周期的プロセスであり、患者の治療に対する状態や反応が時間とともに変化していきます11

この動的なインタラクションは、現在のVRや生成AIツールには反映されていないことが多いです。VRシステムは一般的に観察可能な行動から推論を導き出しますが、必ずしも基礎となる精神過程には到達しません。一方、GenAIシステムは臨床行動の文脈外で明確な推論を分析します。したがって、両戦略とも臨床的能力の偏ったイメージを示し、推論活動全体の範囲を十分に評価することはできません。もう一つの大きな弱点は、自動化分析を主要な評価ツールとして使用することにあります。VRではログファイルの分析を用いてユーザーの行動を把握しますが、これらの測定だけでは臨床的選択の理由を理解するには不十分かもしれません。同様に、言語のアルゴリズム解釈は生成AIシステムの評価によく使われ、臨床的直観、不確実性処理、文脈特有の推論などの言語のニュアンスを無視することがあります。

さらに、文献は技術の成果を既知の臨床推論モデルにマッピングする標準化された方法が存在しないことを指摘しています。VRを手続き的推論に、GenAIを認知推論に暗に結びつける研究もありますが、これらのツールを検証済みの理論的構造の文脈に置く研究は多くありません。この格差は、他の研究結果との比較や技術強化評価の一貫した構造形成を制限しています。

この分野の今後の研究の焦点は、認知的および行動的評価のモダリティの統合にあるべきです。複合ハイブリッドシステム 没入型シミュレーションとリアルタイムのAI媒介対話を統合したハイブリッドシステムは、臨床推論の反復的特性をよりよく受け入れることができます。これらにより、仮想環境における学習者の行動がAIエージェントの疑問の反応を引き出し、学習者が何をし、なぜそれをするのかを同時に評価することが可能になります(25,26)。

全体として、VRや生成AI技術は臨床推論の特定の側面に有用な洞察を提供しますが、現時点ではその応用は断片的です。この断片化に対応し、腫瘍教育における包括的で意味のある評価戦略を開発するためには、概念の統合、方法論的厳密さ、技術革新が必要となります。 表1は 、臨床的推論を評価する際のバーチャルリアリティ(VR)と生成AI(GenAI)の主な違いを強調し、それぞれの焦点、相互作用、強み、限界、データ出力を比較しています。さらに、 図2 は反復的な臨床推論サイクルを示しており、VRがデータ収集、行動、反省を支援し、生成AIが仮説生成、洗練、診断説明を支援することを示しています。これらが一体となって、情報に基づいた意思決定と体験学習の連続的なループを可能にします。

寸法バーチャルリアリティ(VR)生成AI(GenAI)
評価の焦点手続き的/行動的認知的/分析的
インタラクションモード没入型シミュレーション対話型
強度高い生態学的妥当性高いスケーラビリティ
制限リソース集約的限られた透明性
データ型行動ログ自然言語の応答

表1:臨床推論評価におけるVRと生成AIの比較。 臨床推論評価におけるバーチャルリアリティ(VR)と生成AI(GenAI)の比較:評価の焦点、相互作用モード、強み、限界、データタイプなどの主要次元。

figure-protocol-1
図2:反復的臨床推論サイクル:VRと生成AIの貢献。 反復的臨床推論サイクルは、VRがシミュレーションベースのタスク(情報収集や意思決定)における行動やパフォーマンスを捉える一方で、生成AIは仮説生成、鑑別診断、説明、洗練を支援し、継続的な反省と経験からの学習を可能にします。 この図の拡大版はこちらをクリックしてご覧ください。

妥当性エビデンスと測定の限界
強力な妥当性の証拠を開発することは、特に腫瘍学教育のような重要な分野では、あらゆる評価ツールを導入する上で不可欠です。現代の妥当性理論の概念化では、妥当性は内容、反応過程、内部構造、他の変数との関係、評価の結果など複数の証拠源によって支えられる単一の構成要素とみなされています。

ほとんどの研究は内容の妥当性に焦点を当てており、これは臨床状況の専門家によるレビュー、課題設計、またはスコアリング基準を通じて示されます。これらの方法は評価資料が腫瘍学の実践に関連し一貫していることを保証しますが、臨床的推論の根底にある構造を測定するツールの能力についてはあまり情報を提供しません。ほとんどの場合、内容の検証は効果の十分な証拠と見なされますが、より厳密な心理測定の実践では29が欠けています。

回答プロセスの妥当性、すなわち学習者が評価活動をどのように認識し、関わるかに関する証拠の報告は一貫性が低いです。他の研究では、ユーザビリティテストや学習者のフィードバック、あるいは「思考」プロトコルを用いて、参加者が望ましい形でVR環境や生成AIシステムに関わっていることを示唆しています。さらに、これらの相互作用が、特にシミュレーションやAI媒介のシナリオにおいて、どの程度真の臨床的推論を正確に捉えられるかはまだ明確ではありません。

VRと生成AIの両方のモダリティにおける最も重要な制約の一つは、内部構造の証拠が不足していることです。内部整合性、評価者間合意、テストと再テストの安定性などの信頼性指標はほとんど報告されません。これは特に自動スコアリングに基づくツールにとって厄介です。生成AIシステムはさらに、自然言語処理によって駆動されるスコアリングアルゴリズムの点で変動し、プロンプト設計、モデルパラメータ、文脈解釈によって結果が異なることがある。

同様に、他の変数との関係に関する証拠も限られています。多くの研究では、OSCEs、筆記試験、職場評価など既存の評価技術とVRや生成AIプラットフォームのパフォーマンスを関連付けようとしていません。このような比較がなければ、これらの技術が現在の臨床能力の枠組みに整合した構成要素を測定しているかどうかを知るのは困難になります。このような収束的妥当性と判別的妥当性の欠如は、評価結果の解釈と信憑性を制限します。

しかし、文献における最大のギャップは、その移行妥当性の欠如です。VRシミュレーションやGenAIベースのテストでの実践が、実際の腫瘍学の臨床的推論能力の向上と相関しているという考えを裏付けるデータはほとんどありません。医療研修の究極の目的は患者ケアの向上であるため、この制限は正式な評価プログラムにおけるこうしたツールの導入における最大の障害の一つです。縦断的またはアウトカム研究がない場合、これらの技術の教育効果は、実装される模擬または実験状況に限定されます。

これらの心理測定的な欠点に加え、自動化分析の利用増加による他の課題も存在します。VRも生成AIもユーザーの行動や言語のアルゴリズム解釈に大きく依存しており、透明性や解釈可能性に疑問を投げかけています。GenAIベースの評価における大規模言語モデルのブラックボックス的な性質は、スコアの生成方法や偏りのないスコアを保証する方法の理解を複雑にしています。このような説明のつかない状況は、特に緊張感のある環境で教師と生徒の間の信頼を壊す可能性があります。

もう一つの重要な問題は、AIベースの評価におけるバイアスです。言語モデル作成に用いられるトレーニングデータは、臨床知識、コミュニケーションパターン、文化的慣習の違いを捉え、学習者グループ間のスコアリングに体系的な差をもたらす可能性があります。このような偏見が対処されなければ、医療教育における公平性と公平性の側面に深刻な影響を及ぼす可能性があります。

さらに、妥当性のもう一つの重要な側面である評価の影響は、既存の文献ではほとんど議論されていません。VRや生成AIツールの使用が学習者の行動、教育経路、臨床環境での意思決定に与える影響を検証した研究は非常に少ないです。下流の影響に関する研究が不足しているため、これらの技術の肯定的および潜在的な意図しない影響についての知識が制限されています36

結論として、VRや生成AI技術は臨床推論を評価する新しい手法を提供する有望ですが、既存のエビデンス基盤は高リスクな状況でそれらを実装するには不十分です。あらゆる分野で妥当性を高めることで、次のステップはこれらのツールを実験的な使用から腫瘍教育評価の効果的な要素へと変革することを保証します。 表2は 、内容、内部構造、他の変数との関係、結果の4つの領域におけるVRおよび生成AIの妥当性エビデンスを要約しつつ、専門家主導の設計、信頼性検定の限界、比較研究の乏しさ、長期的なアウトカムデータの欠如などの主要な制約を強調しています。

妥当ドメインVRエビデンス生成AIの証拠主な制限
内容ストロング中程度主に専門家主導
内部構造限定限定信頼性試験の欠如
他の変数との関係スパーススパース比較研究は少ない
結果ミニマルミニマル長期的な結果なし

表2: 技術ごとの妥当性エビデンス。 この表は、臨床推論評価におけるVRおよび生成AIの内容、内部構造、他の変数との関係、および結果領域における妥当性エビデンスを示しています

教育成果と解釈上の注意
腫瘍学教育におけるバーチャルリアリティ(VR)や生成人工知能(GenAI)の採用増加は、教育全体として良好な成果を示す文献で評価されています。それらは学習者の関与度の向上、動機付けの向上、学習環境の現実感の認識、そして即時かつ個別化されたフィードバックを受け取る能力です。37,38,39。これらの発見は、これらの技術が教育体験の充実と臨床推論スキルの発展を支援する可能性を示唆しています。

報告された結果のかなりの割合は、学習者満足度、認識された自信、主観的学習評価など自己申告です。これらの指標はユーザー体験に関する洞察に満ちた情報を提供しますが、必ずしも具体的な臨床的推論や臨床パフォーマンスの向上と関連しているわけではありません。客観的な報告の場合、彼らは技術プラットフォーム自体のパフォーマンス結果に焦点を当てる傾向があります。これらの結果はツールが成功裏に関与したことを示唆するものの、そのような相互作用が臨床推論における能力全般にさらに応用できるかどうかを決定できるものではありません。制御された環境やシミュレーション環境で得られる成果は、実際の認知的または行動的成長とは対照的にシステムへの慣れと関連している場合があります53。もう一つの制約は、既存の研究の方法論的特徴に関連しています。文献の多くは、サンプル数が限られ、介入期間も短い小規模・単一機関の研究で構成されています。これらの制限は統計的検密力を低下させ、結果の幅広い教育環境への一般化を制限します。

移転可能性の問題はがん教育において特に重要な課題です。腫瘍学的臨床的推論は、一定の時間枠と臨床文脈の中で行われる複雑かつ長期的な意思決定プロセスです。それにもかかわらず、VRやGenAI介入で訓練されたスキルが即時の学習文脈を過ぎても残るのか、実際の臨床実践に影響を与えるのかについては文献が不足しています。さらに、文献はトレーニング結果と評価結果を混同する傾向があります。ほとんどのVRや生成AIアプリケーションは、学習ファシリテーションを教育ツールとして利用することを主な目的としていますが、その成功は時に評価の妥当性の証と見なされることもあります。正確に解釈するためには、形成的学習の利点と総括的評価の有用性を区別することが重要です。

また、教育成果の解釈を複雑にする認知的な理由もあります。先進技術はさまざまな認知負荷をもたらし、学習者のパフォーマンスに影響を与える可能性があります。例えば、没入型VRシステムはナビゲーションやインターフェースとのインタラクション、感覚処理に関して余計な認知負荷を負うことがあります。適切な設計とユーザーへの慣れがあれば、これらの要因は学習を促進するか妨げるかのいずれかです。ユーザー体験やこれまでの技術経験も重要な要素です。コンピュータインターフェースやAI駆動システムにより慣れた学生は、必ずしも臨床的な推論力が高いからではなく、システムとのより便利な相互作用により成績が良い43があります。

予期せぬ結果の可能性も考慮すべき要素です。例えば、AI生成のフィードバックに過度に依存しすぎると、論理的思考や批判的分析の可能性が低下します。同様に、よく表現されたVRの状況は、行動の選択肢を減らし、意図せずに意思決定を制限してしまうことがあります。現在の文献ではこれらの効果が十分に調査されていませんが、教育デザインに重要な示唆を持っています。

これらの制約は存在しますが、学習者の関与や体験学習に関して記録されたポジティブな傾向は無視できません。安全な実践環境、リアルタイムのフィードバック、そして複雑な状況に何度も触れられることがVRや生成AI技術の魅力です。これらの特徴は、体験学習や意図的実践など、能動的学習と継続的な強化を重視する現在の教育理論に関連しています。

全体として、VRや生成AI技術は腫瘍教育を変革する大きな可能性を示していますが、現時点では方法論や解釈の面で証拠が限られています。したがって、研究結果の過度な一般化を防ぎ、教育の効果に関する主張に強い実証的証拠があることを確保するためには、批判的かつ慎重な態度が必要です。

認知的、倫理的、組織的考慮事項
認知面では、これらの技術の開発とその応用が、学習者の情報の認識や臨床的推論の実践に大きな影響を与える可能性があります。認知負荷理論は、内在的、外在的、関連的3種類の認知負荷を通じてこれらの効果を理解する実践的な枠組みを提供します。VR環境は没入感があり魅力的ですが、ナビゲーションや感覚刺激、インターフェースの複雑さなど、ユーザーに大きな余計な認知的負担をかけることがあります。適切に計画されなければ、これらの要因は認知資源を本質的な推論プロセス以外の領域に移し、学習や評価のパフォーマンスを無効化する可能性があります。

同様に、生成AIシステムは情報提示や相互作用のダイナミクスに関して新たな認知的課題を提示します。例えば、AIシステムによって過剰または冗長なフィードバックが発生すると情報過多になり、学習の成功を妨げることがあります。一方で、適切に設計された適応的フィードバックは、スキーマ形成や内省的思考を通じて関連する認知負荷を増強することができます。したがって、ガイダンスと認知的自律性のバランスが重要であり、AI生成応答に過度に依存しすぎると、独立した問題解決や批判的思考の機会が減少する可能性があります。
これらの技術に対する認知的関与は、ユーザーの親しみやデジタルリテラシーによっても媒介されます。

倫理は教育評価におけるVRや生成AIの導入においても重要な側面です。最も顕著な問題の一つが、AIベースのシステムにおけるアルゴリズムバイアスの概念です。大規模言語モデルのような機械学習モデルは、既存の社会的、文化的、または職業的な規範に偏っている可能性のある大量のデータ上で訓練されます。その結果、評価結果は特定の学習者グループに対する望ましくない差別につながる可能性があり、公平性と公平性が問い35に問われることになります。その他の倫理的な問題としては、透明性と説明可能性があります。ほとんどの生成AIシステムはブラックボックスであり、意思決定プロセスの明確な説明はありません。この評価の解釈可能性は、特に最終的な成果物が深刻な学術的影響を持つ場合、学習者と教育者の間に信頼の欠如を引き起こす可能性があります。34

教育データや場合によっては臨床データが機密であるため、データのセキュリティとプライバシーも重要な要素です。VRは詳細な行動データの記録に使えますが、生成AIプラットフォームは大量のテキストデータを扱うことができます。倫理基準と機関への信頼を維持するためには、データ保護規則が遵守され、利用者の情報が保護されることが重要です。

個人レベルの課題に加え、組織全体の課題もこれらの技術の成功に決定的な役割を果たします。腫瘍学教育におけるVRおよびGenAIの導入は、機関の目的、資源へのアクセス、支援的なガバナンスフレームワークと整合しなければなりません。技術・組織・環境(TOE)モデルは、これらの要因を検証し、技術準備度、組織能力、外部環境の影響の相互作用に焦点を当てるための貴重なツールです。

組織の準備状況には、教員の能力、研修、新技術の受け入れが含まれます。採用に抵抗する可能性は、信頼性への不安、作業過多、あるいは単にAI駆動システムへの不慣れさに関連しています。これらの制約は、集中した教員育成プログラムや、評価49における技術の利用に関する明確なルールを設けることで克服できます。

この分野への新しいアプローチは、啓蒙された自律性(エンライトンド・オートノミネーション)に焦点を当てており、AIシステムは人間の判断を補うために作られるものであり、代替するものではありません。この方法は、自動化分析と人間の管理の調和のとれた組み合わせを提案しており、技術が説明責任やプロフェッショナリズムを妨げることなく意思決定を改善することを提案しています。臨床的推論評価の文脈では、AI生成の洞察と専門家による評価を組み合わせることで、より包括的で信頼できる評価プロセスを実現する場合があります。

全体として、VRとGenAIの腫瘍教育への導入は単なる技術革新以上のものを含みます。また、複雑な認知的、倫理的、組織的側面も探求しています。これらの考慮事項は、教育的価値とリスクの低減という点で技術が最大化される上で極めて重要です。ユーザー中心の設計、倫理的懸念、機関の準備度を考慮した学際的戦略は、臨床推論評価における技術の責任ある利用の発展に不可欠です。 図3 技術・組織・環境(TOE)フレームワーク:VRと生成世代AIを腫瘍学教育に統合するための主要な実装要因を特定する。成功する導入には、システム能力、組織支援、外部環境条件の整合性が必要です。

figure-protocol-2
図3:腫瘍学教育におけるVRおよび生成AIの実装のための技術・組織・環境(TOE)フレームワーク。 技術・組織・環境(TOE)フレームワークは、腫瘍学教育におけるVRとGenAIの統合に適用され、システムの能力、リーダーシップ、カリキュラム、さらに規制、資金、文化的考慮事項の重要な要素を強調しています。この図の拡大版はこちらをクリックしてご覧ください。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結論

腫瘍学における臨床的推論は、長らく複雑で動的、かつ高リスクかつ文脈特有の課題であり、腫瘍学的意思決定において長年にわたり複雑でダイナミックな側面です。本レビューでは、従来の評価手法の限界に対する革新的な解決策として、バーチャルリアリティ(VR)と生成人工知能(GenAI)の新機能について論じています。総合的に見ると、これらの技術は重複しない利点を提供するものの、概念の断片化、方法論的制約の克服、部分的な検証はまだ達成されていないことが示唆されています。

VRベースのシステムは、臨床推論の手続き的および状況的要素を観察・測定できる高精度で没入型の環境を提供します。VRは、模擬臨床過程中の詳細な行動情報を記録・分析することで生態学的妥当性を向上させ、学習者が複雑な状況でどのように行動するかについて重要な洞察を提供します。逆に、GenAIベースのシステムは、適応的対話を通じて認知的側面と分析的側面の両方の評価を可能にします。

これらの進歩はありましたが、本レビューの...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

謝辞

資金:浙江省教育局一般研究プロジェクト(自然科学部門)助成金(助成金番号Y202558353)。

資金:高等教育研究プロジェクト 特別プロジェクト:教育と教育応用をエンパワーメントする人工知能(KT2025426)

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

参考文献

  1. Shimizu, H., Nakayama, K. I. Artificial intelligence in oncology. Cancer Sci. 111 (5), 1452-1460 (2020).
  2. Ginsburg, K. B., Curtis, G. L., Timar, R. E., George, A. K., Cher, M. L. Delayed radical prostatectomy is not associated with adverse oncologic outcomes: implications for men experiencing surgical delay due to the COVID-19 pandemic. J Urol. 204 (4), 720-725 (2020).
  3. Egbuna, I., Olatokun, T., Ozo-Ogueji, P., Ekechi, C., Akinbo, O., et al. Revolutionizing cancer surgery: Harnessing artificial intelligence and augmented reality for next-generation precision oncology. Int J Life Sci Res Arch. 9 (1), 147-176 (2025).
  4. Sminia, P., et al. Clinical radiobiology for radiation oncology. Radiobiology textbook. , (2023).
  5. Wood, E. A., Ange, B. L., Miller, D. D. Are we ready to integrate artificial intelligence literacy into medical school curriculum? Students and faculty survey. J Med Educ Curric Dev. 8, 23821205211024078 (2021).
  6. Kok, D. L., Dushyanthen, S., Peters, G., Sapkaroski, D., Barrett, M., et al. Virtual reality and augmented reality in radiation oncology education: A review and expert commentary. Tech Innov Patient Support Radiat Oncol. 24, 25-31 (2022).
  7. Rahimi, F., Sadeghi-Niaraki, A., Choi, S. M. Generative AI meets virtual reality: A comprehensive survey on applications, challenges, and future directions. IEEE Access. 13, 1-20 (2025).
  8. von Ende, E., Ryan, S., Crain, M. A., Makary, M. S. Artificial intelligence, augmented reality, and virtual reality advances and applications in interventional radiology. Diagnostics (Basel). 13 (5), 892 (2023).
  9. Esmail, S., Concannon, B. Immersive virtual reality and AI (generative pretrained transformer) to enhance student preparedness for objective structured clinical examinations: Mixed methods study. JMIR Serious Games. 13, e69428 (2025).
  10. Gilson, A., Safranek, C. W., Huang, T., Socrates, V., Chi, L., et al. How does ChatGPT perform on the United States Medical Licensing Examination (USMLE)? The implications of large language models for medical education and knowledge assessment. JMIR Med Educ. 9 (1), e45312 (2023).
  11. Kung, T. H., Cheatham, M., Medenilla, A., Sillos, C., De Leon, L., et al. Performance of ChatGPT on USMLE: Potential for AI-assisted medical education using large language models. PLoS Digit Health. 2 (2), e0000198 (2023).
  12. Xu, L., Sanders, L., Li, K., Chow, J. C. Chatbot for health care and oncology applications using artificial intelligence and machine learning: Systematic review. JMIR Cancer. 7 (4), e27850 (2021).
  13. Pottle, J. Virtual reality and the transformation of medical education. Future Healthc J. 6 (3), 181-185 (2019).
  14. Farina, E., Nabhen, J. J., Dacoregio, M. I., Batalini, F., Moraes, F. Y. An overview of artificial intelligence in oncology. Future Sci OA. 8 (4), FSO787 (2022).
  15. Hamilton, A. Artificial intelligence and healthcare simulation: The shifting landscape of medical education. Cureus. 16 (5), e00000 (2024).
  16. Siddiqui, F. M., Jabeen, S., Alwazzan, A., Vacca, S., Dalal, L., et al. Integration of augmented reality, virtual reality, and extended reality in healthcare and medical education: A systematic review. J Med Educ Curric Dev. 12, 23821205251342315 (2025).
  17. Wang, S., Zhang, H. Industrial information integration through autonomous AI agents: Paradoxical effects on transparency, dehumanization, and responsible operations. J Ind Inf Integr. 51, 101089 (2026).
  18. Tortora, A., Amaro, I., Della Greca, A., Barra, P. Exploring the role of generative artificial intelligence in virtual reality: Opportunities and future perspectives. , 125-142 (2025).
  19. Wang, S., Zhang, H. Generative AI in international hotel marketing: Impacts on employee creativity and performance. Int J Contemp Hosp Manag. 37 (8), 2601-2626 (2025).
  20. Christensen, N., Jones, M. A., Rivett, D. A., Jones, M. A., Rivett, D. A. Strategies to facilitate clinical reasoning development. Clinical reasoning in musculoskeletal practice. , 562-582 (2019).
  21. Cook, D. A., Sherbino, J., Durning, S. J. Management reasoning: Beyond the diagnosis. JAMA. 319 (22), 2267-2268 (2018).
  22. Croskerry, P. A universal model of diagnostic reasoning. Acad Med. 84 (8), 1022-1028 (2009).
  23. Norman, G. Research in clinical reasoning: Past history and current trends. Med Educ. 39 (4), 418-427 (2005).
  24. Topol, E. J. High-performance medicine: The convergence of human and artificial intelligence. Nat Med. 25 (1), 44-56 (2019).
  25. Durning, S. J., Artino, A. R., Pangaro, L. N., van der Vleuten, C., Schuwirth, L. Redefining context in the clinical encounter: Implications for research and training in medical education. Acad Med. 85 (5), 894-901 (2010).
  26. Bickmore, T. W., Giorgino, T. Health dialog systems for patients and consumers. J Biomed Inform. 39 (5), 556-571 (2006).
  27. Messick, S. Validity. educational measurement. , 13-103 (1989).
  28. Cook, D. A., Beckman, T. J. Current concepts in validity and reliability for psychometric instruments: Theory and application. Am J Med. 119 (2), 166.e7-166.e16 (2006).
  29. Downing, S. M. Validity: On meaningful interpretation of assessment data. Med Educ. 37 (9), 830-837 (2003).
  30. Artino, A. R., La Rochelle, J. S., Dezee, K. J., Gehlbach, H. Developing questionnaires for educational research: AMEE Guide No. 87. Med Teach. 36 (6), 463-474 (2014).
  31. Gwet, K. L. . Handbook of inter-rater reliability. , (2021).
  32. Norcini, J., Anderson, M. B., Bollela, V., Burch, V., Costa, M. J., et al. Criteria for good assessment: Consensus statement and recommendations from the Ottawa 2010 Conference. Med Teach. 33 (3), 206-214 (2011).
  33. Cook, D. A., Hatala, R., Brydges, R., Zendejas, B., Szostek, J. H., et al. Technology-enhanced simulation for health professions education: A systematic review and meta-analysis. JAMA. 306 (9), 978-988 (2011).
  34. Topol, E. J. . Deep medicine: How artificial intelligence can make healthcare human again. , (2019).
  35. Obermeyer, Z., Powers, B., Vogeli, C., Mullainathan, S. Dissecting racial bias in an algorithm used to manage the health of populations. Science. 366 (6464), 447-453 (2019).
  36. van der Vleuten, C. P. M., Schuwirth, L. W. T. Assessing professional competence: From methods to programmes. Med Educ. 39 (3), 309-317 (2005).
  37. Radianti, J., Majchrzak, T. A., Fromm, J., Wohlgenannt, I. A systematic review of immersive virtual reality applications for higher education: Design elements, lessons learned, and research agenda. Comput Educ. 147, 103778 (2020).
  38. Makransky, G., Petersen, G. B. Immersive virtual reality and learning: A meta-analysis. Educ Psychol Rev. 31 (4), 915-943 (2019).
  39. Luckin, R., Holmes, W., Griffiths, M., Forcier, L. B. . Intelligence unleashed: An argument for AI in education. , (2016).
  40. Sitzmann, T., Ely, K., Brown, K. G., Bauer, K. N. Self-assessment of knowledge: A cognitive learning or affective measure?. Acad Manag Learn Educ. 9 (2), 169-191 (2010).
  41. Reeves, S., Fletcher, S., Barr, H., Birch, I., Boet, S., et al. A BEME systematic review of the effects of interprofessional education. Med Teach. 38 (7), 656-668 (2016).
  42. Issenberg, S. B., McGaghie, W. C., Petrusa, E. R., Lee Gordon, D., Scalese, R. J. Features and uses of high-fidelity medical simulations that lead to effective learning: A meta-analysis. Med Teach. 27 (1), 10-28 (2005).
  43. Sweller, J. Cognitive load theory. Psychol Learn Motiv. 55, 37-76 (2011).
  44. Liaw, S. S., Huang, H. M. Perceived satisfaction, perceived usefulness and interactive learning environments as predictors to self-regulation in e-learning environments. Comput Educ. 60 (1), 14-24 (2013).
  45. Carr, S. AI gone wild: Implications of artificial intelligence for education. Educ Technol. 60 (2), 3-10 (2020).
  46. Wang, S., Sun, Z. Roles of artificial intelligence experience, information redundancy, and familiarity in shaping active learning. Educ Inf Technol. 30 (2), 2525-2546 (2025).
  47. European Parliament and Council. General Data Protection Regulation (GDPR). Off J Eur Union. L119, 1-88 (2016).
  48. Tornatzky, L. G., Fleischer, M. . The processes of technological innovation. , (1990).
  49. Rogers, E. M. . Diffusion of innovations. , (2003).
  50. Floridi, L., Cowls, J. A unified framework of five principles for AI in society. Harv Data Sci Rev. 1 (1), 1-15 (2019).

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

タグ

AI