本方案描述了一种基于指南的检索增强生成聊天机器人的开发与评估方法,该机器人可从基于网络的癌症临床实践指南中检索并总结内容,以生成有参考依据的用户查询回复。
方法文章
本方案描述了一种基于指南的检索增强生成聊天机器人的开发与评估方法,该机器人可从基于网络的癌症临床实践指南中检索并总结内容,以生成有参考依据的用户查询回复。
互联网上医疗信息的广泛可及性改善了患者获取健康相关知识的途径;然而,这也增加了患者接触不准确医疗信息的风险。癌症治疗涉及复杂的信息,使得患者难以识别准确且基于证据的信息来源。大型语言模型虽能实现自然语言交互,但常产生“幻觉”内容,限制了其在医疗信息传递中的应用。检索增强生成(RAG)技术通过将回答建立在外部参考源的基础上,有望降低此类风险。本研究描述了一种基于指南的RAG聊天机器人的开发与评估过程,该系统利用公开可获取的基于网络的癌症临床实践指南。系统从指南的目录页面提取URL,使用基于词频-逆文档频率的形态学分析和余弦相似度对页面文本进行处理,并从高度相关页面构建参考信息。大型语言模型利用这些参考信息生成受限于指南内容的回答。本研究以《肺癌患者及家属指南手册》(JLCS Guidebook for Lung Cancer Patients and Families)作为参考指南。问题集包括指南涵盖范围内的癌症类型和范围外的癌症类型,以评估系统对回答的控制能力。研究成功从目录页面提取了医疗信息,提取的URL中有98%包含可引用的医学内容。对于范围内的问题,聊天机器人通过总结指南内容生成回答,在定义的测试条件下人工审查未发现任何幻觉内容。对于范围外的问题,聊天机器人始终拒绝回答,并提示现有信息不足以提供答案。该指南的网页结构便于在URL层级高效抓取和组织参考内容。本方案为利用基于网络的临床实践指南构建人工智能医疗信息服务系统提供了实用指导。
互联网和社交媒体的广泛使用使患者更容易获取医学信息1,2。癌症治疗相关的信息通常复杂且繁多,患者尤其难以识别准确、相关且基于科学证据的信息来源3。尽管在线资源有助于提升患者对疾病的认知,但其中也包含大量错误的医学信息3,可能对患者在治疗决策方面产生负面影响4。由于与癌症相关的虚假信息可能影响患者的治疗结局5,因此迫切需要人工智能(AI)系统来帮助个体用户搜索、总结和解读医学信息6。
大语言模型(LLMs)使用户能够通过自然语言对话获取信息7;然而,生成错误信息(即“幻觉”)的问题在医学领域仍然是一个严重关切8,9,10,11。错误信息的一个关键来源是用于开发聊天机器人的训练数据的质量和准确性。此外,模型训练的静态特性意味着知识可能随时间推移而过时,从而限制了LLMs提供最新且符合情境的信息的能力12,13。这些局限性凸显了有效知识管理策略的重要性,以确保聊天机器人的回答保持准确、相关且及时更新。特别是在医疗环境中,临床实践指南等基于证据的资源不断更新,推荐意见和护理标准持续演变,因此更需要能够便捷访问并引用当前权威资源的系统。为应对这一挑战,检索增强生成(retrieval-augmented generation, RAG)技术日益受到关注,该技术通过整合来自外部知识源的信息来生成响应10,13,14,15,16,17。
尽管检索增强生成(RAG)在医学聊天机器人中的应用日益广泛,但关于如何将临床实践指南系统性地整合为参考信息来源,目前关注仍有限18。许多临床实践指南在互联网上公开可获取;然而,其现有的网页结构是否可直接作为RAG系统的检索框架,尚不明确18。此外,如何在无需人工构建知识库的前提下建立参考信息的实用方法,尚未得到充分建立。
本研究旨在通过开发和评估一种基于公开可用的网络癌症临床实践指南的指南型RAG聊天机器人,建立医疗领域中参考指南的人工智能系统的设计原则,从而实现对基于指南信息的简便且及时的获取。作为概念验证,我们评估了利用现有公开临床实践指南的网络结构进行指南检索、回答生成和回答限制的技术可行性,旨在提出一种可重复的指南参考RAG系统的开发流程。
本研究不涉及需要防范研究风险的人体受试者,因此根据日本涉及人体受试者的医学研究伦理指南,无需经过机构审查委员会的审查19。本研究的报告遵循个体预后或诊断多变量模型透明报告(Transparent Reporting of a Multivariable Model for Individual Prognosis or Diagnosis, TRIPOD)-LLM指南20。
有关基于指南的 RAG 聊天机器人协议的示意图,请参见图 1。

图1。基于指南的检索增强生成(RAG)聊天机器人协议的工作流程。 基于指南的RAG聊天机器人工作流程的示意图。从基于网络的临床实践指南的目录页面中提取URL,并用于构建参考信息。用户查询被转换为关键词,网页内容通过分词、词频-逆文档频率向量化和余弦相似性分析进行处理,以识别相关的指南页面。选定的参考信息被整合后提供给大型语言模型,使其仅基于引用的指南内容生成响应。右侧面板总结了用于评估提取的URL、参考信息和聊天机器人响应的评价项目。 请点击此处查看此图的放大版本。
1. 基于网络指南的参考信息准备
2. 从用户查询生成关键词
"3. 文本处理与相似性计算
4. 参考信息的构建
5. 基于人工智能的响应生成
6. 参考指南与问题提出
7. 反应评估
通过目录页面检索医学内容的可获取性
网络爬虫架构从指南的目录页面收集了网址。从《肺部指南手册》中,共从目录页面提取出106个网址,其中104个(98%)包含医学信息(补充表1)。基于指南内容页面的聊天机器人回复效果总结于表1中。当问题在指南范围内时,聊天机器人能够针对全部四个临床关键词生成回复。对于“胸腺肿瘤诊断”和“病理诊断”这两个关键词,每个关键词均提取出3个相关网址,且所有提取的网址均被判定为有效(100%)。对于“治疗方法”和“手术治疗”这两个关键词,每个关键词均提取出15个网址,其中14个为有效项目(93%)。
| 查询 | 关键词 | 引用内容项,n | 有效引用项, n (%) |
| 胸腺肿瘤有哪些可用的诊断方法? | 胸腺肿瘤诊断 | 3 | 3 (100) |
| 胸腺肿瘤的病理学诊断方法有哪些? | 胸腺肿瘤病理诊断 | 3 | 3 (100) |
| 胸腺肿瘤有哪些可用的治疗选择? | 胸腺肿瘤治疗方法 | 15 | 14 (93) |
| 胸腺肿瘤的外科治疗选择有哪些? | 胸腺肿瘤外科治疗 | 15 | 14 (93) |
表1:基于肺癌患者及家属JLCS指南的参考信息与聊天机器人回复内容。 用户查询、生成的关键词、通过基于相似性检索识别出的参考内容项目数量,以及包含医学信息的有效参考项目数量的汇总。参考内容项目表示基于每个关键词在URL级别上识别出的相关网页总数。有效参考项目表示在排除重复URL和非医学网页后,包含医学信息的独立网页的数量及其所占百分比。
聊天机器人对范围内的问题的回应
表2展示了聊天机器人对符合所提供指南范围内的问题所生成的回答。当有足够的参考信息时,聊天机器人通过总结指南文本中的相关内容生成回答。生成的回答包含约350个日文字符。在定义的测试条件下,经人工审查未发现任何幻觉内容。对于这些范围内的问题,有多个有效的参考条目支持了回答的生成(表1)。生成的日文文本使用ChatGPT 5.2版本翻译为英文,随后由研究人员对翻译的准确性及与原始日文回答的一致性进行审核。
| 问题 | 回答 | 字数 | ||||
| 胸腺肿瘤有哪些诊断方法? | 胸腺肿瘤的诊断需结合影像学诊断与病理学诊断。影像学诊断通常进行胸部CT和胸部MRI检查。胸腺瘤和胸腺癌均为实性肿瘤,瘤体内不含气体或液体成分;胸腺瘤对周围正常组织的侵犯较轻,而胸腺癌的侵犯更为明显。当影像学检查确定肿瘤未侵犯周围组织且无远处转移灶时,可采取手术切除,并利用手术标本进行病理学诊断。若手术切除困难,则在CT引导下进行穿刺活检,获取部分肿瘤组织以明确诊断。在病理学诊断中,胸腺瘤根据瘤内正常淋巴细胞的比例及肿瘤细胞的形态进行分类,而胸腺癌则依据组织学亚型进行更详细的分类。临床分期(分期)需综合考虑胸腺肿瘤病变的扩散范围,并基于三种分期系统将肿瘤分为I至IV期。 | 366 | ||||
| 胸腺肿瘤的病理学诊断方法有哪些? | 胸腺肿瘤的病理学诊断通过获取部分或全部肿瘤组织进行病理学检查。胸腺瘤根据瘤内所含正常淋巴细胞的比例及肿瘤细胞的形态,分为A型、AB型等亚型。相比之下,胸腺癌是一种具有明显细胞异型性的恶性肿瘤,其中鳞状细胞癌是最常见的组织学亚型。通过病理学诊断可评估肿瘤的生物学特性及进展程度,有助于选择合适的治疗方案并预测预后。此外,胸腺肿瘤的病理学诊断还可确定疾病分期(stage),为治疗规划提供重要信息。临床分期采用三种系统——Masaoka分期、Masaoka–Koga分期以及UICC–TNM分期系统——根据肿瘤扩散和侵犯的程度将肿瘤分为I至IV期。病理学诊断为胸腺肿瘤的合理治疗及预后评估提供了不可或缺的信息。 | 330 | ||||
| 胸腺肿瘤有哪些治疗选择? | 胸腺肿瘤的治疗选择包括手术治疗(手术)、放射治疗和药物治疗(化疗)。手术治疗通常将胸腺连同肿瘤一并完全切除;对于胸腺瘤,若完整切除后可能无需进一步治疗。对于胸腺癌,若肿瘤已侵犯周围组织,术后可加用放射治疗。当手术难以实施,或出现复发或远处转移时,可采用化疗或放化疗,作为药物治疗的一部分。此外,对于晚期或复发性胸腺癌,以化疗为中心进行治疗,必要时可联合手术与放疗进行多模式治疗。进一步地,对于化疗后仍进展或复发的晚期胸腺癌患者,可使用分子靶向药物仑伐替尼(lenvatinib)。应根据患者的病情及临床状况,选择合适的治疗方式组合。 | 342 | ||||
| 胸腺肿瘤的手术治疗选择有哪些? | 当判断胸腺肿瘤可完全切除时,可进行手术治疗。手术通常需将整个胸腺连同肿瘤一并切除。对于胸腺瘤,若肿瘤被完全切除,则通常无需额外治疗。而对于胸腺癌,若存在对周围组织的癌性侵犯,术后可加用辅助性放射治疗。若判断手术难以实施,则先进行化疗或放化疗,待条件允许后再评估是否可行手术。若无法手术,则可持续进行化疗或放化疗。此外,即使可行手术,若无法实现完全切除,术后也可给予放射治疗或放化疗,以处理残留病灶。应根据肿瘤类型及疾病进展程度,合理选择手术治疗方案。 | 342 | ||||
表2:基于指南的检索增强生成(RAG)聊天机器人根据《日本肺癌学会肺癌患者及家属指南》生成的回答。 该基于指南的RAG聊天机器人针对与胸腺肿瘤相关的问题,利用从《日本肺癌学会肺癌患者及家属指南》(https://www.haigan.gr.jp/public/guidebook/2024/)中提取的参考信息生成的代表性回答。本表包含用户提问、聊天机器人生成的回答以及回答长度。字符数统计基于使用ChatGPT 5.2版本翻译为英文前的原始日文回答。
聊天机器人对超出范围问题的回应
针对超出《肺部指南手册》范围的问题,聊天机器人的回答总结见表3。尽管这些问题引用了少量内容条目,但响应生成模型判定可用的参考信息不足以生成基于证据的回答。因此,聊天机器人对超出范围的查询返回了信息不足的回应。“文本中信息不足”和“无参考文献”是系统提示中预设的固定回答。当检索到的参考信息不足以回答问题时,返回前者;当未检索到任何参考信息时,返回后者。
| 查询 | 关键词 | 引用的内容项目数量,n | 聊天机器人回复 |
| 儿童胶质瘤有哪些诊断方法? | 儿童胶质瘤诊断 | 0 | 无参考文献。 |
| 儿童胶质瘤的病理学诊断方法有哪些? | 儿童胶质瘤病理诊断 | 13 | 文本中信息不足。 |
| 儿童胶质瘤有哪些治疗选择? | 儿童胶质瘤治疗方法 | 13 | 文本中信息不足。 |
| 儿童胶质瘤有哪些手术治疗选择? | 儿童胶质瘤手术治疗 | 12 | 文本中信息不足。 |
表3:基于《肺癌患者及家属指南手册》(JLCS)的聊天机器人对超出范围临床问题的回答。 由基于指南的检索增强生成(RAG)聊天机器人针对超出参考指南范围的问题所生成的回答。该表汇总了用户查询内容、生成的关键词、通过基于相似性检索识别出的参考内容条目数量,以及聊天机器人最终生成的回答。参考内容条目指基于每个关键词在URL层级上识别出的相关网页总数。由于检索到的内容不包含与所查询疾病相关的信息,因此未对超出范围的问题计算有效参考条目数。
补充文件 1. 从基于网页的临床实践指南中提取 URL 和文本的 Python 代码。 该代码用于从基于网页的临床实践指南的目录页面中提取 URL 和网页文本内容。所提取的 URL 和文本内容随后被用于基于指南的检索增强生成(RAG)聊天机器人工作流程中的文本处理、相似性分析以及参考信息构建。请点击此处下载该文件。
补充表 1. 从基于网络的指南目录页面提取的 URL 及其医学与非医学信息分类。 从日本肺癌学会(JLCS)《肺癌患者及家属指南手册》目录页面提取的 URL 经人工审阅后,被分类为医学或非医学信息。医学信息定义为可引用的指南内容,包括临床问题(CQs)、背景问题、问题集以及与患者指导相关的补充教育材料。非医学信息包括学会或组织网页、导航页面、超链接以及其他未用作聊天机器人应答生成参考信息的辅助性内容。本表汇总了所有提取的 URL 及其分类结果。*URL 来源于日本肺癌学会《肺癌患者及家属指南手册》目录页面(https://www.haigan.gr.jp/public/guidebook/2024/)。请点击此处下载该文件。
本研究探讨了一种基于指南的检索增强生成(RAG)聊天机器人,该机器人以网络版临床实践指南——《肺癌患者及家属指南手册》(JLCS Guidebook for Lung Cancer Patients and Families)作为参考信息源。该聊天机器人通过利用指南的网页结构,并根据用户查询与网页内容的相似性进行页面检索,从而生成基于指南内容的回答。该方法表明,基于相似性的检索与参考指南生成回答相结合,可支持可靠且高效的医学信息传递。近期研究已强调了基于大语言模型(LLM)的医疗聊天机器人在幻觉现象和回答可靠性方面的潜力与局限性12,13,14。与以往聚焦于通用聊天机器人框架的研究10,12,13不同,本研究方案展示了一种可复现的、基于指南的RAG方法,该方法在URL层级检索患者指南内容,并生成基于可识别参考信息的回答。因此,本研究提供了一种透明的癌症信息传递方案,而非一个完全验证的临床聊天机器人系统。
本系统并未基于全部指南文献对人工智能进行训练,而是针对每个用户查询,仅选择与之最相关的临床问题(CQ)作为参考信息(图1)。通过使用基于编程语言的余弦相似性计算,并结合TF-IDF向量表示法,对问题文本与各临床问题之间的相关性进行定量评估。根据这些相似性得分,临床问题按相关性从高到低排序并依次选取,从而在指南内部系统性地提取适当的信息来源,而无需依赖主观判断(表1)。此外,将检索到的临床问题文本进行拼接后整体输入人工智能模型,有助于在生成回答时保持一致的证据基础,从而提高生成内容的准确性和上下文连贯性。在检索增强生成(RAG)系统中,正确信息的生成在很大程度上依赖于准确且恰当的参考源14。该设计使系统能够弥补单一临床问题可能无法充分覆盖的信息,从而生成更全面且符合临床实际的回答。此外,RAG方法能够灵活检索最新的临床问题内容,非常适用于基于证据的医学应用10,11。尽管此前已有基于指南的RAG方法报道11,18,但本方案的不同之处在于,利用了面向患者的指南中已有的基于临床问题的网页结构作为主要检索框架。该设计提供了一种透明且可重复的工作流程,无需手动构建知识库或对模型进行重新训练即可实现。
重要的是,该聊天机器人将其回答严格限制在所引用指南的范围内。当问题超出指南内容时,系统会明确避免生成回答,从而降低产生无依据回应的风险。使用余弦相似度来控制参考文献的选择,进一步提高了生成回答的安全性和可靠性(表2)。对于超出指南范围的问题,系统也检索了参考页面(表3)。在主题范围内的问题,其余弦相似度值较高(0.20–0.65),而范围外问题的相似度值较低(0.20–0.31;数据未显示);但即使某些指南页面在临床上不具相关性,仍可能被赋予较低的相似度评分。这是因为余弦相似度仅基于查询语句与指南文本之间的关键词匹配进行计算。重要的是,这些低相关性参考并未导致不恰当的回答,因为当缺乏足够参考信息时,聊天机器人会拒绝生成回答。在定义的测试条件下,人工审查未发现任何幻觉现象。余弦相似度0.2的阈值是在初步测试中通过经验确定的,旨在平衡检索的敏感性与特异性。尽管该阈值在当前测试条件下有效,但系统性评估阈值敏感性超出了本方案研究的范围。未来的研究应利用更大规模的基准数据集和定量检索指标,探讨不同阈值设置的影响。观察到的行为表明,基于检索增强生成(RAG)的输出控制可能在医学人工智能应用中具有实用价值。然而,当前评估仅基于有限数量的范围内和范围外问题,主要目的是对所提出的流程进行概念验证性评估。因此,不应将研究结果解读为对临床准确性、安全性或普适性的全面验证。
本研究存在若干技术局限性。我们采用了日语形态分析器以及 GPT-3.5-turbo-16k(用于生成回复的大型语言模型,LLM)。选择该 LLM 是因为其在系统开发时是一个广泛可用且稳定的模型,能够实现所提出工作流程的可重复性。形态分析器与 LLM 各具不同特性,因此模型或库的选择会影响信息提取的准确性以及生成回复的内容22,23。尽管更新的模型(例如 GPT-4 或 GPT-5 级别的 LLM)可能提升性能和外部有效性22,但评估替代模型超出了本研究方案的范围。较新的 LLM 可能具备更优的推理能力、指令遵循能力以及回复质量;然而,本研究的主要目标是评估基于指南的 RAG 框架的可行性,而非比较不同 LLM 的性能。进一步优化这些组件可能实现更高效且准确的回复生成,还需通过不同模型配置进行验证,以评估研究结果的普适性。此外,本研究方案使用日语指南和日语形态分析技术开发而成。尽管基于 TF–IDF 向量化、余弦相似度和 RAG 的检索框架在原则上与语言无关,但在其他语言中的实现仍需依赖特定语言的文本处理工具并进行验证。本研究仅限于单一指南,因此无法直接比较不同指南结构。然而,按临床问题(CQ)层级组织内容有助于系统性提取指南信息,并支持为基于指南的 RAG 聊天机器人构建参考信息。特别是指南的网页结构——每个临床问题均对应唯一 URL——在高效抓取和按 URL 层级组织参考内容方面发挥了重要的实际作用。对于格式不同的指南,例如基于 PDF 的文档或未提供 CQ 级别 URL 的网站,可能需要采用不同的分段与检索策略。因此,当前工作流程在其他指南结构和医学专科中的普适性仍有待验证。未来的研究应评估该方法在多种疾病、不同指南格式及信息来源中的适用性。
本研究的结果为设计参考指南的人工智能系统提供了实用指导,并证明基于指南、引用网络临床指南的RAG聊天机器人在传递癌症相关医学信息方面具有应用潜力。然而,本研究仅为概念验证性评估,旨在展示指南检索、回答生成及回答限制机制的技术可行性,不应被解读为对医学信息系统进行的正式临床验证。本研究未评估临床有效性、安全性及用户使用效果,这些方面仍有待未来研究加以确立。从伦理和用户安全角度而言,将回答限制在指南支持的信息范围内,可能降低出现无依据或虚构回答的风险。但过度拒绝回答也可能降低用户满意度和感知有用性。因此,未来的研究应评估安全性与可用性之间的平衡,同时保持对错误信息的适当防范措施。通过利用网络指南的信息结构,并针对用户问题提供聚焦的回答,该系统可为人工智能在医学信息传递中的未来应用提供一个有用的模型。
作者声明无竞争利益。
作者感谢日本湘南纪念医院乳腺中心的井上健一医学博士、理学博士(Kenichi Inoue, MD, PhD)在基于指南的检索增强生成式聊天机器人开发过程中提供的大量技术支持。作者还感谢日本国立癌症中心癌症控制研究所(日本东京)的山木千佳子博士(Chikako Yamaki, PhD)以及研究团队全体成员就本文所探讨主题提供的宝贵建议。此外,作者感谢 Editage 提供的英文语言编辑服务。本研究得到了日本健康与劳动科学研究基金(R6–Cancer Control–23EA1026)的资助。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Beautiful Soup 4(版本 4.12.3) | Beautiful Soup Project | N/A | 用于 URL 提取和 HTML 解析的 Python 库 |
| ChatGPT 版本 4o | OpenAI | N/A | 用于关键词生成 |
| GPT-3.5-turbo | OpenAI | N/A | 用于响应生成 |
| 肺癌患者及家属 JLCS 指南 | 日本肺癌学会 | N/A | 基于网络的临床实践指南,用作参考信息 |
| MeCab(版本 0.996) | MeCab Project | N/A | 日语形态分析器 |
| OpenAI API | OpenAI | N/A | 用于基于人工智能的响应生成 |
| Python(版本 3.12) | Python 软件基金会 | N/A | 编程环境 |
| Requests(版本 2.32.3) | Requests Project | N/A | 用于网页获取的 Python 库 |
| scikit-learn(版本 1.6.1) | scikit-learn 开发者 | N/A | 用于 TF–IDF 向量化和余弦相似度计算。 |
| urllib.parse | Python 软件基金会 | N/A | 用于 URL 标准化和拼接的 Python 库 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可