このコンテンツを表示するには、JoVEへの購読が必要です。 または、無料トライアルをお申し込みください。

研究記事

三叉神経痛に対する大規模言語モデルによる患者教育の可読性と質:横断的研究

70 回視聴

⸱

DOI:

10.3791/70833

⸱

2026年8月21日

この記事について

サマリー

本稿では、三叉神経痛に関する大規模言語モデル生成の患者向け情報を体系的に評価し、読みやすさ、教育的適切性、および質を検証するためのプロトコルを提示します。これにより、モデルのベンチマークを行い、患者向けコミュニケーションの指針を提供することを目的とします。

要約

大規模言語モデル(LLM)は患者への健康教育にますます利用されていますが、三叉神経痛(TN)に関するLLM生成情報の読みやすさと教育的質については十分に評価されていません。この横断的ベンチマーク研究では、公開されている5つのLLM(Doubao、DeepSeek、Wenxin Yiyan、Tongyi Qianwen、GPT-5)によって生成されたTN教育コンテンツを比較しました。疾患の基礎知識、病因・リスク因子、診断、治療、および予防・リハビリテーションを網羅する、頻繁に寄せられるTNに関する20の質問を、標準化されたプロンプトを用いて各モデルに提示しました。読みやすさは7つの確立された指標を用いて評価し、教育的な適切さはPatient Education Materials Assessment Tool for Understandability and Actionability(PEMAT)を用いて、そして総合的な情報の質はGlobal Quality Score(GQS)を用いて評価しました。2名の臨床専門家がすべての回答を独立して評価し、意見が不一致の場合はシニア判定者が解決しました。統計解析により、モデル間の性能、テーマ別の相違、および評価指標間の相関を比較しました。読みやすさ、PEMAT、およびGQSスコアにおいて、モデル間で有意な差が認められました。GPT-5は言語的に最も複雑な回答を生成しましたが、教育的な適切さと情報の質において最高評価を獲得しました。対照的に、Wenxin Yiyanは最も読みやすい文章を生成しましたが、PEMATおよびGQSのスコアは概して低い結果となりました。コンテンツのカテゴリーが読みやすさに影響を与え、予防・リハビリテーションおよび病因・リスク因子のトピックは読みやすさが低かった一方、PEMATとGQSはテーマ間で比較的一貫していました。読みやすさの指標は強い内部一貫性を示し、PEMATおよびGQSとは弱から中程度の正の相関を示しましたが、PEMATとGQSの間には中程度の正の相関が認められました。これらの結果は、モデルの選択が専門家による評価での教育的な適切さと総合的な情報の質に影響を与える一方で、トピックの複雑さが主に読みやすさに影響することを示唆しています。患者の理解度、満足度、信頼度、健康アウトカム、事実の正確性、および臨床的安全性が評価されていないため、これらの結果は臨床的な準備が整っている証拠ではなく、専門家による評価に基づいたベンチマーク分析として解釈されるべきです。

概要

三叉神経痛(TN)は、一般に電撃様または刺痛と表現される、片側性で短時間かつ極めて激しい顔面痛が反復して起こることを特徴とする神経障害性疼痛症候群である。国際頭痛分類第3版(ICHD-3)によれば、痛みは通常、三叉神経の1つまたは複数の分枝の分布領域に局在し、しばしば耐え難い強度に達し、軽い接触、洗顔、歯磨き、会話、咀嚼などの無害な刺激によって誘発される。発作は突然に始まり急激に消失し、持続時間は数分の1秒から数分に及ぶ1,2。TNは通常、生命を脅かすものではないが、激しく予測不可能な痛みにより、食事、会話、睡眠、感情調節などの不可欠な日常生活が著しく妨げられ、結果として相当な心理社会的負担と生活の質の低下を招く。系統的レビューによるエビデンスは、TN患者が一般住民と比較して、うつ病、不安、および睡眠障害のリスクが著しく高いことを示している3,4。大規模なコホート研究では、TN患者の約35–55%に臨床的に意味のある不安またはうつの症状が見られ、痛みの破局的思考が非常に多く認められることから、慢性的な激痛、不眠、および感情障害の間に双方向的な相互作用があることが示唆されている5,6。疫学的推定では、一般住民におけるTNの有病率は約0.03%から0.3%の範囲であり、女性および高齢者で発生率が高く、地理的領域、民族グループ、および年齢層によって顕著な差異がある7,8。中国やインドのような人口密集国では、急速な人口高齢化に伴いTN罹患者数を持続的に増加しており、それによって医療システムへの負担が増大している。このため、疾患の評価および管理において、より効果的で拡張性があり、データに基づいたアプローチが必要であることが強調されている8,9。

三叉神経痛(TN)は、古典的、二次的、および特発性の亜型に分類でき、これらのカテゴリー間で病因メカニズムと治療戦略に実質的な違いがあることを示すエビデンスが増えています1,10。現在の研究では、三叉神経根進入帯における神経血管競合に関連した構造的変化、末梢神経の過興奮、および中枢性疼痛調節の変調が、共同して本疾患の病態形成に寄与していることが示唆されています11,12。臨床ガイドラインでは、第一選択治療としてカルバマゼピンおよびオキシカルバゼピンが推奨されており、薬物療法が無効な場合や忍容性が低い場合には、外科的またはインターベンショナルなアプローチが検討されます10。これらの治療の進歩にもかかわらず、TNは再発と寛解を繰り返す経過を特徴とし、長期的な疼痛の再発が一般的であるため、永続的な寛解の達成は困難です13。したがって、再発リスク、治療反応、および合併症をモニタリングするためには、長期的なフォローアップと構造化された慢性疾患管理が不可欠です。縦断的コホート研究によれば、標準化された管理戦略(薬物治療、適応がある場合の外科的介入、および包括的なフォローアップを含む)の下で、保存的治療を受けた患者の約半数が、不可避な病勢進行を伴わずに2年以内に全疼痛負荷の50%以上の軽減を達成できることが示されています14。これらの知見は、長期的な疾患管理における継続的な患者の関与と効果的な健康教育の重要性を強調しています。疾患の病因、病態生理、および治療選択肢についてより深く理解している患者は、治療計画に積極的に参加し、遵守する可能性が高く、結果としてアウトカムが改善することがエビデンスにより示唆されています15。しかし、従来の健康教育アプローチは、到達範囲と拡張性の面で制限されることが多いのが現状です。インターネット、特にオンラインのQ&Aプラットフォームやソーシャルメディアの普及に伴い、患者が医療情報を得るためにデジタルソースに依存する傾向が強まっています16,17。それにもかかわらず、個々のヘルスリテラシーや、十分な情報に基づいた意思決定のために基本的な健康情報にアクセスし、処理し、理解する能力には大きなばらつきがあり、これが効果的な患者教育の大きな障壁となっています18。さらに、不正確または誤解を招く内容を含むオンライン上の健康情報の質の不均一さは、患者の医学的決定や心理的ウェルビーイングに悪影響を及ぼす可能性があります19。

人工知能(AI)技術、特に近年の大規模言語モデル(LLM)の急速な発展は、医学コミュニケーションおよび健康教育に新たな機会をもたらしています20。大規模なテキストコーパスで学習したこれらのモデルは、自然言語による対話を通じて、構造化され論理的に一貫した回答を生成することが可能です21。ChatGPTなどの代表的な国際的システムは、医学的な質疑応答、患者へのコンサルテーション、および医学教育において有望な可能性を示しています22,23。中国においても機能的に同様のLLMがいくつか登場しており、ユーザーの普及範囲と活用シーンは拡大し続けています24。こうした進展がある一方で、医学の普及におけるLLMの活用には、学習データの信頼性、更新頻度、生成された回答の科学的正確性、および臨床的検証の不足など、依然として大きな課題が存在します25。加えて、言語スタイル、読みやすさ、論理構造、および引用の正確性におけるモデル間の差異が、健康関連情報に対する患者の理解度や信頼感に直接的な影響を与える可能性があります26。現在まで、三叉神経痛(TN)に関連する健康教育におけるLLMの性能に関する体系的な評価は限定的です。

したがって本研究では、三叉神経痛(TN)に関する患者教育上の質問への回答における、広く利用されている4つの中国製LLM(Doubao、DeepSeek、Wenxin Yiyan、Tongyi Qianwen)および代表的な国際的LLM(ChatGPT)の性能を系統的に評価し、比較することを目的としました。横断的研究デザインを用いて、臨床ガイドラインと患者の一般的な懸念事項に基づいたTN質問セットを構築し、公開されている5つのLLM(Doubao、DeepSeek、Wenxin Yiyan、Tongyi Qianwen、およびGPT-5)によって生成された回答を評価しました。可読性は複数の指標を用いて評価し、理解しやすさと実行可能性は患者教育用資料評価ツール(PEMAT)を用いて評価しました。全体の情報の質はグローバルクオリティスコア(GQS)を用いて評価しました。さらに、異なる健康教育トピックがこれらの評価指標にどのように影響するか、およびそれらの相互関係を分析し、臨床的な健康コミュニケーションにおけるLLMの選択と最適化のための根拠に基づいた指針を提供することを目指しました。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

本研究ではAIによって生成されたテキストのみを分析しており、ヒト参加者、動物、生物学的試料、診療録、個人特定可能な情報、または臨床ケアへの介入は含まれていません。したがって、倫理審査および正式なインフォームドコンセントは適用されませんでした。

研究デザイン

この横断的研究では、TNに関するよくある質問に対する5つのLLMによって生成された回答の読みやすさ、質、および教育的適切性を評価した。

一般的によく寄せられるTN関連の質問の特定

2025年11月25日、疼痛医学において広範な経験を持つ2名の臨床専門家が、国際頭痛分類第3版(ICHD-3)、欧州神経学会ガイドライン、および米国神経学会/欧州神経学会連合ガイドラインを含む、三叉神経痛(TN)の現在の臨床ガイドラインを独立して検討した1,10,11。合意形成のための議論を経て、彼らは臨床現場で一般的に遭遇するTN関連の質問20項目のリストを作成した。質問数は、事前定義された5つのテーマ領域をバランスよくカバーするため、各領域につき4つの質問を選出することで、事前に決定した。これは、モデルが生成する回答の総数を、専門家による手動の評価および検証が可能な範囲に収めるためである。再現性を高めるため、選定プロセスは事前定義された領域ベースのフレームワークに従った。まず専門家が各領域内で候補となる質問を特定し、臨床的関連性、患者視点の表現、および冗長性の回避について独立して検討した後、各領域の最終的な4つの質問について合意に達した。最終的な質問リストはTable 1およびSupplementary File 1に提示している。事前定義された5つのテーマ領域は、疾患の基礎知識、病因およびリスク要因、診断、治療、および予防とリハビリテーションとした。質問セットは患者の検索ログ、オンライン検索クエリ、または正式な患者インタビューから導出されたものではないため、選択バイアスの可能性があることを研究の限界として認めている。

AIモデルとデータ収集手順

2025年11月25日、確定した20問のTN関連の質問セットを、公開されている5つの大規模言語モデル(LLM)プラットフォームであるDoubao、DeepSeek、文心一言(Wenxin Yiyan)、通義千問(Tongyi Qianwen)、およびGPT-5/ChatGPTに送信した。すべてのモデルは標準的な公開ウェブベースのチャットインターフェースを通じてアクセスし、アプリケーションプログラミングインターフェース(API)によるアクセスは使用しなかった。各プラットフォームにおいて、データ収集日に利用可能であったデフォルトの公開モデルを、生成パラメータを変更せずに使用した。公開ウェブインターフェースでは、バックエンドのモデルスナップショット識別子、隠れたシステムプロンプト、temperature、top-p、最大出力トークン数、またはその他の生成パラメータが表示されなかったため、これらの項目は「公開ウェブインターフェースに表示なし」として記録した。

すべてのモデルにおいて、プロンプトおよび回答の言語は英語としました。各標準化プロンプトは、モデル固有の追加指示を含まず、英語の質問文のみで構成されました。各質問は、以前の会話履歴、アップロード済みファイル、プラグイン、カスタム指示、または追記プロンプトのない、新しく独立したチャットセッションで個別に送信されました。標準化プロンプトの完全なリストおよび対応するモデルの生出力は、Supplementary File 1に提示しています。モデルのメタデータおよびデータ収集設定は、Supplementary Table 1にまとめています。

可読性評価

LLMによって生成された回答の可読性は、オンライン可読性評価プラットフォーム(http://readabilityformulas.com/)で利用可能な複数の確立された可読性公式を用いて評価されました。可読性評価において普遍的に認められたゴールドスタンダードが存在しないことを踏まえ、また先行研究と整合させるため、広く用いられている一連の可読性指標を採用しました23,27。単一の公式への依存を減らすため、文長、単語長、音節負荷、文字ベースの複雑さ、読みやすさ、および推定学年レベルを含む、可読性の相補的な側面を捉える7つの指標を選択しました。具体的には、Coleman-Liau指数(CL)、Linsear Write公式(LW)、Automated Readability Index(ARI)、Simple Measure of Gobbledygook(SMOG)、Gunning Fog指数(GFOG)、Flesch Reading Easeスコア(FRES)、およびFlesch-Kincaid Grade Level(FKGL)を算出しました。これらの指標は読解困難度や学年レベルを推定し、テキストの可読性を定量的に測定するものです(表2)。

教育的適合性と情報品質の評価

教育的適切性は、理解しやすさと実行可能性の2つのドメインからなるPatient Education Materials Assessment Tool (PEMAT)を用いて評価した28。このツールは24項目で構成されており、そのうち16項目で理解しやすさを、8項目で実行可能性を評価する。各項目は二値でスコア化し(0 = 基準を満たさない、1 = 基準を満たす)、合計スコアは0から24の範囲となり、スコアが高いほど患者教育への適切性が高いことを示す。全体的な情報の質は、医療情報の質を評価するために広く用いられている5段階のリッカート尺度であるGlobal Quality Score (GQS)を用いて評価した27(表3)。

2025年11月25日、三叉神経痛(TN)の管理において3年以上の経験を持つ2名の臨床専門家が、2つの評価指標を用いてすべてのAI生成回答を評価した。スコアリングに先立ち、すべてのAI生成回答にはコード化された回答識別子が付与されて匿名化され、PEMATおよびGQSの評価においてレビュー者はLLMプラットフォームを盲検化された。意見の不一致については、第3のシニアエキスパートが判定を行い、最終スコアを決定した。評価者間信頼性はCohenのカッパ係数を用いて評価され、その値は >0.75は極めて高い一致度、0.40~0.75は許容可能な一致度を示し、 <0.40であり、一致度は低いことを示していた。PEMATとGQSの両方におけるコーエンのカッパ値は0.75を超え、評価者間信頼性が極めて高いことが示された。

統計解析

すべての統計解析はRソフトウェア(バージョン4.4.3)を用いて実施した。データの正規性は、シャピロ・ウィルク検定およびQ-Qプロットを用いて評価した。正規分布に従う変数は、平均値として要約した。 ± 標準偏差で示し、一元配置分散分析(ANOVA)を用いて比較した。必要に応じて、その後Tukeyのポストホックテストを行った。非正規分布の変数は中央値および四分位範囲で要約し、Kruskal-Wallis検定を用いて比較した後、ペア比較のためにBonferroni補正を用いたDunnのポストホックテストを行った。可読性指標、PEMATスコア、およびGQS値の間の相関はSpearmanの順位相関係数を用いて評価し、多重検定に対してBenjamini-Hochberg補正を適用した。両側調整済み P 値 < p < 0.05 を統計的に有意と見なした。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

本研究では、大規模言語モデル(LLM)および異なるカテゴリーの健康教育コンテンツが、生成されたテキストの読解可能性と質に及ぼす影響を系統的に評価しました。まず、5つのLLM(Doubao、DeepSeek、文心一言、通義千問、GPT-5)について、患者教育への適合性、全体的な情報の質、およびPEMATスコア、GQS、確立された読解可能性指標(ARI、FRES、GFOG、FKGL、CL、SMOG、LW)を含む複数の読解可能性指標を用いて性能を比較しました。次に、健康教育コンテンツの5つのテーマ領域(疾患の基礎知識、病因およびリスク要因、診断、治療、予防およびリハビリテーション)にわたり、同様のアウトカム指標を検証しました。これら2つの分析的視点を統合することで、モデルの種類とコンテンツカテゴリーがテキストの質と読解可能性にどのように共同的に影響するかをさらに探索し、LLMによって生成された患者教育資料における系統的なパターンを明らかにしました。

異なる大規模言語モデル間における可読性分析

5つの...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

この横断的ベンチマーク研究では、公開されている5つの大規模言語モデル(LLM)によって生成された三叉神経痛(TN)の患者教育資料について、読みやすさ、教育的適切性、および全体的な情報の質を系統的に比較しました。その結果、4つの主要な知見が得られました。第一に、読みやすさはモデル間で大幅に異なり、GPT-5が言語的に最も複雑な回答を生成し、文心一言(Wenxin Yiyan)が最も読みやすいコンテンツを生成しました。第二に、読みやすさと専門家が評価した情報の質は異なる評価次元であり、GPT-5は読みやすさでは劣っていたものの、PEMATおよびGQSスコアで最高値を記録しました。第三に、コンテンツのテーマが読みやすさに影響を及ぼしており、予防、リハビリテーション、および病因とリスク因子のトピックは一般的に高い読解レベルを必要としましたが、PEMATおよびGQSはコンテンツカテゴリー間で比較的安定していました。最後に、読みやすさの指標は強い内部一貫性を示し、相関分析により、言語的複雑さとPEMATおよびGQSの両方との間に弱から中程度の正の相関があること、またPEMATとGQSの間に中程度の正の相関があることが明らかになりました。総じて、これ...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

著者らは、競合する利益がないことを宣言します。

謝辞

本研究は、公的、商業的、または非営利セクターのいかなる資金提供機関からも、特定の助成金を受けていません。三叉神経痛の質問セットについてフィードバックを提供し、評価フレームワークの洗練を支援してくださった臨床に携わる同僚の方々に感謝いたします。また、原稿の作成および改訂をサポートしてくださったすべての寄稿者に感謝いたします。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
DeepSeek チャットプラットフォームDeepSeekhttps://chat.deepseek.com/回答を生成するために使用される、一般にアクセス可能な大規模言語モデルインターフェース
Doubao チャットプラットフォームDoubaohttps://www.doubao.com/chat/回答を生成するために使用される、一般にアクセス可能な大規模言語モデルインターフェース
GPT 5 OpenAIhttps://chat.openai.com/回答を生成するために使用される、一般にアクセス可能な大規模言語モデルインターフェース
R ソフトウェア、バージョン 4.4.3R Foundation for Statistical Computing該当なし統計解析および可視化
Readability Formulas オンライン読みやすさ計算機Readability Formulas該当なし読みやすさ指標を算出するために使用されるオンラインツール
Tongyi Qianwen チャットプラットフォームTongyi Qianwenhttps://www.tongyi.com/回答を生成するために使用される、一般にアクセス可能な大規模言語モデルインターフェース
Wenxin Yiyan チャットプラットフォームWenxin Yiyanhttps://yiyan.baidu.com/回答を生成するために使用される、一般にアクセス可能な大規模言語モデルインターフェース

参考文献

  1. Headache Classification Committee of the International Headache Society (IHS). The International Classification of Headache Disorders, 3rd edition. Cephalalgia. 2018;38(1):1-211.
  2. Ashina S, et al. Trigeminal neuralgia. Nat Rev Dis Primers. 2024;10(1):39.
  3. Donertas-Ayaz B, Caudle RM. Locus coeruleus-noradrenergic modulation of trigeminal pain: Implications for trigeminal neuralgia and psychiatric comorbidities. Neurobiol Pain. 2023;13:100124.
  4. Martinelli R, et al. Psychological assessment in patients affected by trigeminal neuralgia: A systematic review. Neurosurg Rev. 2025;48(1):414.
  5. Melek LN, et al. Comparison of the neuropathic pain symptoms and psychosocial impacts of trigeminal neuralgia and painful posttraumatic trigeminal neuropathy. J Oral Facial Pain Headache. 2019;33(1):77-88.
  6. Zakrzewska JM, et al. Evaluating the impact of trigeminal neuralgia. Pain. 2017;158(6):1166-1174.
  7. Gambeta E, Chichorro JG, Zamponi GW. Trigeminal neuralgia: An overview from pathophysiology to pharmacological treatments. Mol Pain. 2020;16:1744806920901890.
  8. De Toledo IP, et al. Prevalence of trigeminal neuralgia: A systematic review. J Am Dent Assoc. 2016;147(7):570-576.e2.
  9. Svedung Wettervik T, et al. Incidence of trigeminal neuralgia: A population-based study in central Sweden. Eur J Pain. 2023;27(5):580-587.
  10. Bendtsen L, et al. European Academy of Neurology guideline on trigeminal neuralgia. Eur J Neurol. 2019;26(6):831-849.
  11. Cruccu G, et al. Trigeminal neuralgia: New classification and diagnostic grading for practice and research. Neurology. 2016;87(2):220-228.
  12. Araya EI, et al. Trigeminal neuralgia: Basic and clinical aspects. Curr Neuropharmacol. 2020;18(2):109-119.
  13. Chong MS, Bahra A, Zakrzewska JM. Guidelines for the management of trigeminal neuralgia. Cleve Clin J Med. 2023;90(6):355-362.
  14. Heinskou TB, et al. Favourable prognosis of trigeminal neuralgia when enrolled in a multidisciplinary management program: A two-year prospective real-life study. J Headache Pain. 2019;20(1):23.
  15. Liu S, et al. Comparative evaluation of ChatGPT and Gemini in brain-computer interface patient education: A multidimensional analysis of reliability, accuracy, comprehensibility, and readability. Int J Med Inform. 2026;206:106164.
  16. Forgie EME, et al. Social media and the transformation of the physician-patient relationship: Viewpoint. J Med Internet Res. 2021;23(12):e25230.
  17. Gantenbein L, Navarini AA, Maul LV, Brandt O, Mueller SM. Internet and social media use in dermatology patients: Search behavior and impact on the patient-physician relationship. Dermatol Ther. 2020;33(6):e14098.
  18. Youssef Y, et al. Social media and internet use among orthopedic patients in Germany: A multicenter survey. Front Digit Health. 2025;7:1486296.
  19. De Martino I, et al. Social media for patients: Benefits and drawbacks. Curr Rev Musculoskelet Med. 2017;10(1):141-145.
  20. Johnson KB, et al. Precision medicine, AI, and the future of personalized health care. Clin Transl Sci. 2021;14(1):86-93.
  21. Hirani R, et al. Artificial intelligence and healthcare: A journey through history, present innovations, and future possibilities. Life (Basel). 2024;14(5):557.
  22. Karatas G, Kirik F, Karatas ME, Cakir A, Ozdemir H. Comparative performance of ChatGPT o3-mini-high and DeepSeek-R1 in ophthalmology: An evaluation of diagnostic reasoning and case-based problem solving. J Fr Ophtalmol. 2025;49(1):104712.
  23. Hanci V, et al. Assessment of readability, reliability, and quality of ChatGPT, Bard, Gemini, Copilot, and Perplexity responses on palliative care. Medicine (Baltimore). 2024;103(33):e39305.
  24. Liu C, et al. Potential to perpetuate social biases in health care by Chinese large language models: A model evaluation study. Int J Equity Health. 2025;24(1):206.
  25. Haupt CE, Marks M. AI-generated medical advice—GPT and beyond. JAMA. 2023;329(16):1349-1350.
  26. Aydin S, Karabacak M, Vlachos V, Margetis K. Large language models in patient education: A scoping review of applications in medicine. Front Med (Lausanne). 2024;11:1477898.
  27. Kara M, et al. Evaluating the readability, quality, and reliability of responses generated by ChatGPT, Gemini, and Perplexity on the most commonly asked questions about ankylosing spondylitis. PLoS One. 2025;20(6):e0326351.
  28. Perez Rivera LR, et al. Evaluating the quality and reliability of large language models for plastic surgery patient education: A comparative analysis of ChatGPT and OpenEvidence. Aesthet Surg J. 2025. doi:10.1093/asj/sjaf249.
  29. Wilhelm TI, Roos J, Kaczmarczyk R. Large language models for therapy recommendations across three clinical specialties: Comparative study. J Med Internet Res. 2023;25:e49324.
  30. Will J, et al. Enhancing the readability of online patient education materials using large language models: Cross-sectional study. J Med Internet Res. 2025;27:e69955.
  31. Tukur Jido J, Al-Wizni A, Aung SL. Readability of AI-generated patient information leaflets on Alzheimer's disease, vascular dementia, and delirium. Cureus. 2025;17(6):e85463.
  32. Luo Z, Lin C, Kim TH, Shin YS, Ahn ST. Quality and readability analysis of artificial intelligence-generated medical information related to prostate cancer: A cross-sectional study of ChatGPT and DeepSeek. World J Mens Health. 2025. doi:10.5534/wjmh.250144.
  33. Joseph P, Silva NA, Nanda A, Gupta G. Evaluating the readability of online patient education materials for trigeminal neuralgia. World Neurosurg. 2020;144:e934-e938.
  34. Dong C, et al. Comparative evaluation of large language models in delivering guideline-compliant recommendations for topical NSAID use in musculoskeletal pain: A multidimensional analysis. Clin Rheumatol. 2025;44(11):4703-4710.
  35. Ozduran E, Buyukcoban S. Evaluating the readability, quality, and reliability of online patient education materials on post-COVID pain. PeerJ. 2022;10:e13686.
  36. Wang LW, Miller MJ, Schmitt MR, Wen FK. Assessing readability formula differences with written health information materials: Application, results, and recommendations. Res Social Adm Pharm. 2013;9(5):503-516.
  37. Singh SP, et al. Comprehension profile of patient education materials in endocrine care. Kans J Med. 2022;15(2):247-252.
  38. Marder RS, et al. ChatGPT-3.5 and ChatGPT-4.0 do not reliably create readable patient education materials for common orthopaedic upper- and lower-extremity conditions. Arthrosc Sports Med Rehabil. 2025;7(1):101027.
  39. Nasra M, et al. Can artificial intelligence improve patient educational material readability? A systematic review and narrative synthesis. Intern Med J. 2025;55(1):20-34.
  40. Bhatt C, et al. Evaluating readability, understandability, and actionability of online printable patient education materials for cholesterol management: A systematic review. J Am Heart Assoc. 2024;13(8):e030140.
  41. Avra TD, Le M, Hernandez S, Thure K, Ulloa JG. Readability assessment of online peripheral artery disease education materials. J Vasc Surg. 2022;76(6):1728-1732.
  42. Rooney MK, et al. Readability of patient education materials from high-impact medical journals: A 20-year analysis. J Patient Exp. 2021;8:2374373521998847.
  43. Ahmadzadeh K, et al. Patient education information material assessment criteria: A scoping review. Health Info Libr J. 2023;40(1):3-28.
  44. Duan L, Yao Z, Li X, Wu Y, Sheng D. Comparing large language models and human doctors in symptom-driven online medical consultations: A case study on trigeminal neuralgia. Digit Health. 2025;11:20552076251388140.
  45. Werner C, Harden J, Lawton J. Pathways to a diagnosis of trigeminal neuralgia: A qualitative study of patients' experiences. BMC Prim Care. 2025;26(1):65.

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

タグ

大規模言語モデル読みやすさの評価教育的質PEMAT評価グローバル品質スコア健康情報の質モデルベンチマーク患者の理解度