本文介绍了一种系统评估大型语言模型生成的三叉神经痛患者信息在可读性、教育适用性和质量方面的方案,旨在为模型性能提供基准,并指导面向患者的沟通。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本文介绍了一种系统评估大型语言模型生成的三叉神经痛患者信息在可读性、教育适用性和质量方面的方案,旨在为模型性能提供基准,并指导面向患者的沟通。
大型语言模型(LLMs)在患者健康教育中的应用日益广泛,但针对三叉神经痛(TN)的LLM生成内容的可读性与教育质量尚未得到充分评估。本项横断面基准研究比较了五个公开可用的LLM(Doubao、DeepSeek、Wenxin Yiyan、Tongyi Qianwen和GPT-5)生成的TN教育内容。研究采用标准化提示词,向每个模型提出20个关于TN的常见问题,涵盖疾病基础知识、病因/危险因素、诊断、治疗以及预防/康复等方面。通过七个公认的可读性指数评估内容的可读性,使用患者教育材料评估工具(PEMAT)评估教育适宜性(包括可理解性与可操作性),并采用全球质量评分(GQS)评估整体信息质量。两名临床专家独立评估所有回答,分歧由资深仲裁者裁决。统计分析用于比较各模型的表现、主题差异以及各项评价指标之间的相关性。在可读性、PEMAT评分和GQS评分方面,各模型之间存在显著差异。GPT-5生成的回答语言复杂度最高,但在教育适宜性和信息质量方面得分最高。相比之下,Wenxin Yiyan生成的内容最易读,但在PEMAT和GQS上的得分普遍较低。内容类别影响可读性,其中预防/康复及病因/危险因素类主题更难阅读,而PEMAT和GQS在不同主题间的得分相对稳定。可读性指数之间表现出高度的内部一致性,并与PEMAT和GQS呈弱至中等程度的正相关,而PEMAT与GQS之间呈中等程度正相关。研究结果表明,模型选择会影响专家评定的教育适宜性和整体信息质量,而主题复杂性主要影响可读性。由于本研究未评估患者的理解程度、满意度、信任度、健康结局、事实准确性及临床安全性,因此这些结果应视为专家评定的基准分析,而非临床应用准备就绪的证据。
三叉神经痛(TN)是一种神经病理性疼痛综合征,其特征是反复发作的单侧、短暂且极为剧烈的面部疼痛,通常被描述为电击样或刺痛样。根据《国际头痛障碍分类》第三版(ICHD-3),疼痛通常局限于三叉神经的一个或多个分支分布区域,疼痛强度常难以忍受,并可由无害性刺激诱发,例如轻触、洗脸、刷牙、说话或咀嚼。发作具有突然起始和 abrupt 中止的特点,持续时间从数秒的几分之一到数分钟不等1,2。尽管三叉神经痛通常不危及生命,但其剧烈且不可预测的疼痛会严重干扰进食、言语、睡眠和情绪调节等基本日常活动,导致显著的心理社会负担并降低生活质量。系统综述的证据表明,与一般人群相比,三叉神经痛患者罹患抑郁症、焦虑症和睡眠障碍的风险显著升高3,4。在大规模队列研究中,约35–55%的三叉神经痛患者表现出具有临床意义的焦虑或抑郁症状,且疼痛灾难化现象高度普遍,提示慢性重度疼痛、失眠与情感障碍之间存在双向交互作用5,6。流行病学估计显示,三叉神经痛在一般人群中的患病率约为0.03%至0.3%,女性和老年人群中发病率较高,且在不同地理区域、种族群体和年龄层之间存在显著差异7,8。在人口众多的国家(如中国和印度),随着人口迅速老龄化,受三叉神经痛影响的个体数量持续增加,给医疗系统带来日益加重的负担,凸显了对更有效、可扩展且基于数据的疾病评估与管理方法的迫切需求8,9。
TN 可分为经典型、继发型和特发型亚型,越来越多的证据表明,这些类型在病因机制和治疗策略上存在显著差异1,10。目前的研究表明,三叉神经根入脑区的神经血管压迫相关结构改变、外周神经的过度兴奋以及中枢疼痛调节功能的异常共同参与了该疾病的发病机制11,12。临床指南推荐卡马西平和奥卡西平作为一线治疗药物,当药物治疗无效或耐受性差时,则考虑采用手术或介入治疗10。尽管治疗手段不断进步,TN 仍表现为反复发作与缓解的病程,长期疼痛复发较为常见,实现永久缓解十分困难13。因此,长期随访和规范化的慢性病管理对于监测复发风险、治疗反应及并发症至关重要。纵向队列研究显示,在采用标准化管理策略(包括药物治疗、必要时的手术干预以及全面的随访)的情况下,约一半接受保守治疗的患者可在两年内实现总体疼痛负担降低 ≥50%,且疾病未必然进展14。这些发现凸显了持续的患者参与和有效的健康教育在长期疾病管理中的重要性。证据表明,对疾病病因、病理生理机制及治疗选择有更好理解的患者,更有可能积极参与并依从治疗方案,从而获得更优的治疗效果15。然而,传统的健康教育方式在覆盖范围和可扩展性方面往往受限。随着互联网的广泛普及,尤其是在线问答平台和社交媒体的兴起,患者越来越多地依赖数字渠道获取医学信息16,17。但个体健康素养的差异,以及获取、处理和理解基本健康信息以支持知情决策的能力参差不齐,构成了有效患者教育的主要障碍18。此外,在线健康信息质量良莠不齐,包括不准确或误导性内容,可能对患者的医疗决策和心理健康产生负面影响19。
人工智能(AI)技术,特别是近年来大语言模型(LLM)的快速发展,为医学科学传播和健康教育带来了新的机遇20。这些模型在大规模文本语料库上进行训练,能够通过自然语言交互生成结构清晰、逻辑连贯的回应21。以ChatGPT为代表的国际代表性系统,在医学问答、患者咨询和医学教育方面已展现出良好的应用潜力22,23。中国也涌现出多个功能类似的LLM,其用户覆盖范围和应用场景持续扩展24。尽管取得了上述进展,LLM在医学科普中的应用仍面临诸多挑战,包括训练数据的可靠性、更新频率、生成内容的科学准确性以及缺乏临床验证25。此外,不同模型在语言风格、可读性、逻辑结构和引文准确性方面的差异,可能直接影响患者对健康相关信息的理解和信任程度26。迄今为止,针对LLM在腱鞘炎相关健康教育中的系统性性能评估仍较为有限。
因此,本研究旨在系统评估并比较四种广泛使用的中文大语言模型(Doubao、DeepSeek、Wenxin Yiyan 和 Tongyi Qianwen)以及一种代表性国际大语言模型(ChatGPT)在回答与三叉神经痛(TN)相关的患者教育问题方面的表现。采用横断面研究设计,我们基于临床指南和患者常见关切构建了一套TN问题集,并对五个公开可用的大语言模型(Doubao、DeepSeek、Wenxin Yiyan、Tongyi Qianwen 和 GPT-5)生成的回答进行评估。使用多种指标评估可读性,并采用患者教育材料评估工具(PEMAT)评估回答的可理解性和可操作性。整体信息质量则通过全球质量评分(GQS)进行评价。此外,我们分析了不同健康教育主题对这些评估指标及其相互关系的影响,旨在为临床健康传播中大语言模型的选择与优化提供循证依据。
访问受限。请登录或开始试用以查看此内容。
本研究仅分析了人工智能生成的文本,未涉及人类受试者、动物、生物样本、医疗记录、可识别的个人信息或对临床护理的干预。因此,无需进行伦理审查和正式的知情同意。
研究设计
这项横断面研究评估了五种大语言模型(LLM)针对三叉神经痛常见问题所生成回答的可读性、质量及教育适用性。
常见三叉神经相关问题的识别
2025年11月25日,两位在疼痛医学领域具有丰富经验的临床专家独立审阅了三叉神经痛(TN)的现有临床指南,包括《国际头痛障碍分类第三版》(ICHD-3)、欧洲神经病学学会指南以及美国神经病学学会/欧洲神经学会联合会指南1,10,11。经过共识讨论后,他们整理出临床实践中常见的20个与三叉神经痛相关的问题。问题数量预先设定,旨在均衡覆盖五个预定义的主题领域,每个领域选取4个问题,同时确保模型生成的回答总数处于专家人工评分与验证可行的范围内。为提高可重复性,问题筛选过程遵循预设的基于领域的框架:专家首先在每个领域内确定候选问题,独立评估其临床相关性、以患者为中心的表述方式以及避免冗余,随后就每个领域最终的4个问题达成共识。最终的问题列表见表1和补充文件1。五个预定义的主题领域分别为疾病基础知识、病因与危险因素、诊断、治疗以及预防与康复。由于该问题集并非来源于患者搜索日志、在线搜索查询或正式的患者访谈,因此研究承认可能存在选择偏倚,此为本研究的一项局限性。
人工智能模型与数据收集流程
2025年11月25日,最终确定的一组包含20个与三叉神经相关的题目被提交至五个公开可访问的大语言模型(LLM)平台:Doubao、DeepSeek、Wenxin Yiyan、Tongyi Qianwen 和 GPT-5/ChatGPT。所有模型均通过其标准的公共网页聊天界面访问,未使用应用程序编程接口(API)访问。对于每个平台,均使用数据收集当日可获得的默认公开模型,且未对任何生成参数进行修改。由于公共网页界面未显示后端模型快照标识符、隐藏系统提示、温度、top-p、最大输出令牌数或其他生成参数,因此这些项目均记录为“在公共网页界面中未显示”。
所有模型的提示和响应语言均为英语。每个标准化提示仅包含逐字的英文问题,不附加任何针对特定模型的指令。每个问题均在新的独立聊天会话中单独提交,无先前对话历史、上传文件、插件、自定义指令或后续提示。标准化提示的完整列表及相应模型原始输出见补充文件1。模型元数据及数据收集设置汇总于补充表1。
可读性评估
使用在线可读性评估平台(http://readabilityformulas.com/)提供的多种成熟可读性公式,对大语言模型生成回答的可读性进行了评估。鉴于目前尚无普遍接受的可读性评估金标准,且与以往研究一致,本研究采用了一套广泛使用的可读性指标23,27。共选取了七个指标,以涵盖可读性的多个互补维度,包括句子长度、单词长度、音节数量、基于字符的复杂度、阅读难易度以及估计的年级水平,从而降低对单一公式的依赖。具体计算的指标包括:科尔曼-利亚乌指数(CL)、林斯尔书写公式(LW)、自动可读性指数(ARI)、SMOG可读性指数(SMOG)、冈宁雾数(GFOG)、弗莱施阅读易读性得分(FRES)以及弗莱施-金凯德年级水平(FKGL)。这些指标可估算文本的阅读难度或对应年级水平,为文本可读性提供定量衡量标准(表2)。
教育适宜性与信息质量的评估
采用患者教育材料评估工具(Patient Education Materials Assessment Tool, PEMAT)评估教育适宜性,该工具包含两个维度:可理解性和可操作性28。该工具共包含24个条目,其中16个用于评估可理解性,8个用于评估可操作性。每个条目采用二分法评分(0 = 未达到标准;1 = 达到标准),总分范围为0至24分,分数越高表示越适合用于患者教育。整体信息质量采用全球质量评分(Global Quality Score, GQS)27进行评估,GQS是一种广泛使用的五点Likert量表,用于评估医学信息的质量(表3)。
2025年11月25日,两名在三叉神经痛管理方面具有超过3年经验的临床专家使用两种评估工具对所有由人工智能生成的回答进行了评估。在评分前,所有由人工智能生成的回答均采用编码化的回答标识符进行匿名化处理,评审人员在进行PEMAT和GQS评估时对所使用的大型语言模型平台保持盲态。分歧由第三位高级专家解决,该专家裁定最终得分。采用Cohen kappa系数评估评分者间信度,kappa值>0.75表示信度极佳,0.40–0.75表示信度可接受,<0.40表示信度较差。PEMAT和GQS两项评估的Cohen kappa值均超过0.75,表明评分者间信度极佳。
统计学分析
所有统计分析均使用 R 软件(版本 4.4.3)进行。数据正态性通过 Shapiro-Wilk 检验和 Q-Q 图进行评估。符合正态分布的变量以均值 ± 标准差表示,并采用单因素方差分析(ANOVA)进行比较,必要时结合 Tukey 事后检验。不符合正态分布的变量以中位数和四分位距表示,并采用 Kruskal-Wallis 检验进行比较,随后使用 Dunn 事后检验,并对两两比较进行 Bonferroni 校正。可读性指数、PEMAT 评分与 GQS 值之间的相关性采用 Spearman 秩相关系数进行评估,并对多重检验应用 Benjamini-Hochberg 校正。双侧调整后 P 值 < 0.05 被认为具有统计学显著性。
访问受限。请登录或开始试用以查看此内容。
本研究系统评估了大语言模型(LLMs)及不同类别的健康教育内容对生成文本可读性和质量的影响。首先,我们比较了五种大语言模型——Doubao、DeepSeek、Wenxin Yiyan、Tongyi Qianwen 和 GPT-5——在患者教育适宜性、整体信息质量以及多项可读性指标方面的表现,这些指标包括 PEMAT 评分、GQS 和既定的可读性指数(ARI、FRES、GFOG、FKGL、CL、SMOG 和 LW)。其次,我们在五个主题领域的健康教育内容中考察了相同的结局指标:疾病基础知识、病因与危险因素、诊断、治疗以及预防与康复。通过整合这两种分析视角,我们进一步探讨了模型类型与内容类别如何共同影响文本质量和可读性,从而识别出大语言模型生成的患者教育材料中的系统性规律。
不同大语言模型的可读性分析
采用七种成熟的可读性指数,系统比较了由五种大语言模型(Doubao、DeepSeek、Wenxin Yiyan、Tongyi Qianwen 和 GPT-5)生成的三叉神经痛相关文本的语言复杂度。总...
访问受限。请登录或开始试用以查看此内容。
这项横断面基准研究系统比较了由五种公开可用的大语言模型(LLMs)生成的三叉神经痛(TN)患者教育材料的可读性、教育适用性及整体信息质量。研究得出四个主要发现。第一,不同模型在可读性方面存在显著差异,其中GPT-5生成的回答语言复杂度最高,而文心一言生成的内容最易读。第二,可读性与专家评定的信息质量是两个不同的评估维度,尽管GPT-5的可读性较低,但其在患者教育材料评估工具(PEMAT)和总体质量评分(GQS)上得分最高。第三,内容主题影响可读性水平,预防、康复以及病因与风险因素类主题通常需要更高的阅读能力,而PEMAT和GQS在不同内容类别间的得分则相对稳定。最后,可读性指标表现出高度的内部一致性,相关性分析显示语言复杂度与PEMAT及GQS之间存在弱至中等程度的正相关关系,同时PEMAT与GQS之间也存在中等程度的正相关。综合来看,这些发现为评估大语言模型生成的三叉神经痛患者教育材料提供了基准,同时强调了在医学内容完整性与语言可及性之间取得平衡的必要性。需要特别指出的是,这些结果代表的是专家评分的基准评估结果,不应被解读为患者理解能力、事实准确性、临床安全性或常规临床应用准备度的证据。
访问受限。请登录或开始试用以查看此内容。
作者声明不存在任何竞争利益。
本研究未从公共、商业或非营利部门的任何资助机构获得特定资助。作者感谢提供三叉神经痛问题集反馈意见并协助完善评估框架的临床同行。我们还感谢所有支持稿件撰写和修订工作的贡献者。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| DeepSeek 聊天平台 | DeepSeek | https://chat.deepseek.com/ | 用于生成回复的公开大型语言模型接口 |
| 豆包聊天平台 | Doubao | https://www.doubao.com/chat/ | 用于生成回复的公开大型语言模型接口 |
| GPT 5 | OpenAI | 不适用 | 用于统计分析与可视化的工具 |
| R 软件,版本 4.4.3 | R 统计计算基金会 | 不适用 | 统计分析与可视化 |
| Readability Formulas 在线可读性计算器 | Readability Formulas | 不适用 | 用于计算可读性指数的在线工具 |
| 通义千问聊天平台 | Tongyi Qianwen | https://www.tongyi.com/ | 用于生成回复的公开大型语言模型接口 |
| 文心一言聊天平台 | Wenxin Yiyan | https://yiyan.baidu.com/ | 用于生成回复的公开大型语言模型接口 |
访问受限。请登录或开始试用以查看此内容。