方法文章

基于指南的检索增强生成式聊天机器人开发:参考网络癌症临床实践指南

DOI:

10.3791/71099

2026年8月7日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本方案描述了一种基于指南的检索增强生成聊天机器人的开发与评估方法,该机器人可从基于网络的癌症临床实践指南中检索并总结内容,以生成有参考依据的用户查询回复。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

互联网上医疗信息的广泛可及性改善了患者获取健康相关知识的途径;然而,这也增加了患者接触不准确医疗信息的风险。癌症治疗涉及复杂的信息,使得患者难以识别准确且基于证据的信息来源。大型语言模型虽能实现自然语言交互,但常产生“幻觉”内容,限制了其在医疗信息传递中的应用。检索增强生成(RAG)技术通过将回答建立在外部参考源的基础上,有望降低此类风险。本研究描述了一种基于指南的RAG聊天机器人的开发与评估过程,该系统利用公开可获取的基于网络的癌症临床实践指南。系统从指南的目录页面提取URL,使用基于词频-逆文档频率的形态学分析和余弦相似度对页面文本进行处理,并从高度相关页面构建参考信息。大型语言模型利用这些参考信息生成受限于指南内容的回答。本研究以《肺癌患者及家属指南手册》(JLCS Guidebook for Lung Cancer Patients and Families)作为参考指南。问题集包括指南涵盖范围内的癌症类型和范围外的癌症类型,以评估系统对回答的控制能力。研究成功从目录页面提取了医疗信息,提取的URL中有98%包含可引用的医学内容。对于范围内的问题,聊天机器人通过总结指南内容生成回答,在定义的测试条件下人工审查未发现任何幻觉内容。对于范围外的问题,聊天机器人始终拒绝回答,并提示现有信息不足以提供答案。该指南的网页结构便于在URL层级高效抓取和组织参考内容。本方案为利用基于网络的临床实践指南构建人工智能医疗信息服务系统提供了实用指导。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

互联网和社交媒体的广泛使用使患者更容易获取医学信息1,2。癌症治疗相关的信息通常复杂且繁多,患者尤其难以识别准确、相关且基于科学证据的信息来源3。尽管在线资源有助于提升患者对疾病的认知,但其中也包含大量错误的医学信息3,可能对患者在治疗决策方面产生负面影响4。由于与癌症相关的虚假信息可能影响患者的治疗结局5,因此迫切需要人工智能(AI)系统来帮助个体用户搜索、总结和解读医学信息6

大语言模型(LLMs)使用户能够通过自然语言对话获取信息7;然而,生成错误信息(即“幻觉”)的问题在医学领域仍然是一个严重关切8,9,10,11。错误信息的一个关键来源是用于开发聊天机器人的训练数据的质量和准确性。此外,模型训练的静态特性意味着知识可能随时间推移而过时,从而限制了LLMs提供最新且符合情境的信息的能力12,13。这些局限性凸显了有效知识管理策略的重要性,以确保聊天机器人的回答保持准确、相关且及时更新。特别是在医疗环境中,临床实践指南等基于证据的资源不断更新,推荐意见和护理标准持续演变,因此更需要能够便捷访问并引用当前权威资源的系统。为应对这一挑战,检索增强生成(retrieval-augmented generation, RAG)技术日益受到关注,该技术通过整合来自外部知识源的信息来生成响应10,13,14,15,16,17

尽管检索增强生成(RAG)在医学聊天机器人中的应用日益广泛,但关于如何将临床实践指南系统性地整合为参考信息来源,目前关注仍有限18。许多临床实践指南在互联网上公开可获取;然而,其现有的网页结构是否可直接作为RAG系统的检索框架,尚不明确18。此外,如何在无需人工构建知识库的前提下建立参考信息的实用方法,尚未得到充分建立。

本研究旨在通过开发和评估一种基于公开可用的网络癌症临床实践指南的指南型RAG聊天机器人,建立医疗领域中参考指南的人工智能系统的设计原则,从而实现对基于指南信息的简便且及时的获取。作为概念验证,我们评估了利用现有公开临床实践指南的网络结构进行指南检索、回答生成和回答限制的技术可行性,旨在提出一种可重复的指南参考RAG系统的开发流程。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究不涉及需要防范研究风险的人体受试者,因此根据日本涉及人体受试者的医学研究伦理指南,无需经过机构审查委员会的审查19。本研究的报告遵循个体预后或诊断多变量模型透明报告(Transparent Reporting of a Multivariable Model for Individual Prognosis or Diagnosis, TRIPOD)-LLM指南20

有关基于指南的 RAG 聊天机器人协议的示意图,请参见图 1

figure-protocol-1
图1。基于指南的检索增强生成(RAG)聊天机器人协议的工作流程。 基于指南的RAG聊天机器人工作流程的示意图。从基于网络的临床实践指南的目录页面中提取URL,并用于构建参考信息。用户查询被转换为关键词,网页内容通过分词、词频-逆文档频率向量化和余弦相似性分析进行处理,以识别相关的指南页面。选定的参考信息被整合后提供给大型语言模型,使其仅基于引用的指南内容生成响应。右侧面板总结了用于评估提取的URL、参考信息和聊天机器人响应的评价项目。 请点击此处查看此图的放大版本。

1. 基于网络指南的参考信息准备

  1. 使用 Python(版本 3.12)编程语言实现的 BeautifulSoup 4(HTML 解析库)从目标网络版临床实践指南的目录页面中提取所有 URL。
    注意:使用具备以下包的编程语言实现 URL 提取脚本:HTML 解析库(版本 4.12.3)和 requests(网页获取库;版本 2.32.3)。通过 pip 安装这些包。URL 提取的完整源代码见补充文件 1。软件详细信息请参见材料表
  2. 手动审查所有提取出的 URL,以确认其可成功访问且与目标临床实践指南相关。
  3. 将每个 URL 分类为包含医学信息或非医学信息。由一位作者(S.N.)完成 URL 分类。
    注意:医学信息定义为可引用的指南内容,包括临床问题(CQs)、背景问题以及问题集。非医学信息包括链接、学会或组织页面以及其他不适合引用的辅助性内容。
  4. 将已验证的 URL 汇总至 Microsoft Excel 工作簿(.xlsx 格式),每行记录一个 URL。将生成的 URL 列表作为后续文本检索、预处理和相似性分析的输入数据集进行存储。

2. 从用户查询生成关键词

  1. 将自然语言查询输入至 ChatGPT(生成式预训练变换模型,版本 4o;关键词生成模型)。
  2. 提示模型从用户查询中提取两个关键词。
  3. 使用以下用日语编写的提示语进行关键词生成:
    "figure-protocol-2"
    (英文翻译:“从以下文本中提取两个关键词。”)
  4. 将用户的自然语言查询附加到该指令之后,并提交给关键词生成模型以生成关键词。
  5. 不得手动修改任何模型参数。使用关键词生成模型的默认设置执行关键词生成。
  6. 为每条用户查询生成两个关键词。保留生成的两个关键词,不做进一步修改、筛选或人工选择,并将其用于后续的相似性计算。
  7. 将生成的关键词存储在 Microsoft Excel 工作簿(.xlsx 格式)中。对于每条记录,保存原始用户查询及其对应的生成关键词,以用于后续基于相似性的检索。

3. 文本处理与相似性计算

  1. 使用网页检索库和HTML解析库,从每个提取的URL中获取完整文本内容。利用BeautifulSoup的get_text()函数从HTML源码中提取文本内容。
  2. 对提取的网页文本和生成的关键词进行预处理,移除HTML标签和非日文字符。
  3. 使用MeCab(版本0.996;日文形态分析器)及其默认词典进行日文形态分析。仅保留名词,并将其连接成以空格分隔的文本字符串。
  4. 将生成的关键词合并为单个文本字符串,并应用与网页文本相同的预处理和分词流程。
  5. 使用scikit-learn库(版本1.6.1)中的TfidfVectorizer实现,基于默认参数设置,从处理后的网页文本和关键词文本生成词频-逆文档频率(TF-IDF)向量。
    注意:所有TfidfVectorizer参数均保持默认值,未应用任何自定义参数设置。
  6. 使用余弦相似度函数,计算每个网页向量与关键词向量之间的余弦相似度。
  7. 根据余弦相似度得分,按降序对URL进行排序。不应用额外的并列排序规则。
  8. 选择余弦相似度得分≥0.2的页面作为候选参考信息。
    注意:余弦相似度阈值(0.2)在系统开发过程中通过经验确定,旨在优先提高检索的召回率,避免遗漏潜在相关的指南内容。
  9. 保留所有满足相似度阈值的候选页面。

4. 参考信息的构建

  1. 从排序列表的顶部开始,依次提取所选页面的文本内容。
  2. 将提取的文本拼接成一个单一的参考文档。
  3. 在提交给大语言模型(LLM)之前,将参考文本中的换行符和连续的空白字符替换为单个空格。
  4. 在提供给大语言模型(LLM)之前,将拼接后的参考文本截断为前 4,096 个字符。
    注意:截断限制基于字符数而非 token 数。选择 4,096 个字符的限制是基于经验确定的,以确保组合后的提示和参考信息保持在 GPT-3.5-turbo-16k 响应生成模型的输入容量范围内。

5. 基于人工智能的响应生成

  1. 通过应用程序编程接口(API)将构建的参考信息和原始用户查询提供给响应生成模型。
  2. 使用以下提示(完全以日语撰写)指示人工智能,以确保响应仅基于提供的参考信息生成:
    “您是一名提供癌症患者指导的医疗信息助手。请仅根据以下参考信息生成回答,不得使用您自身的通用知识或推理。回答应详尽且易于理解,长度约为500个字符。如果参考信息中没有足够信息回答问题,请回复:‘There is insufficient information in the text’,不得进行推测或使用通用知识。”
  3. 将参考信息和用户查询合并为单条用户消息。输入结构应为:“Reference Information: [参考文本]”,后接“Question: [用户查询]”。
  4. 使用响应生成模型并按以下设置生成响应:temperature = 0.1,最大输出长度 = 1,024 个 tokens,n = 1,stop = None。
  5. 获取人工智能生成的响应以供后续评估。
    注意:将参考信息和用户查询作为单条用户消息提交。将响应生成指令作为系统消息单独提供。

6. 参考指南与问题提出

  1. 选择《肺癌患者及家属JLCS指南手册》(Lung Guidebook)21,该手册可在线免费获取,作为基于指南的RAG聊天机器人系统的参考信息。
  2. 根据癌症类型创建两类评估问题:胸腺肿瘤(在指南范围内)和儿童胶质瘤(超出参考信息范围)。
  3. 针对每种癌症类型,设计四个涵盖诊断与治疗方面的问题:
    “XX肿瘤(例如胸腺肿瘤或儿童胶质瘤)有哪些诊断方法?”
    “XX肿瘤的病理学诊断方法有哪些?”
    “XX肿瘤有哪些治疗选择?”
    “XX肿瘤的外科治疗选项有哪些?”
  4. 将与参考网络指南所涵盖癌症类型相关的问题提交给聊天机器人。例如,使用《肺癌指南手册》作为参考信息时,提交关于胸腺肿瘤诊断的问题。
  5. 将超出参考指南范围的问题提交给聊天机器人,以评估其避免使用外部或无关信息的能力。例如,使用《肺癌指南手册》作为参考信息时,提交关于儿童胶质瘤的问题。
  6. 在独立的聊天会话中对每个问题进行评估。问题之间不得延续对话历史。
  7. 记录人工智能生成的回答,用于后续评估。

7. 反应评估

  1. 对所有生成的回答进行人工审核。
  2. 评估每个回答是否包含幻觉内容。
  3. 评估每个回答是否得到参考指南中所含信息的支持。
    注:幻觉内容定义为包含不存在的事件、名称或术语的回答,此类内容可能造成医疗危害14。所有生成的回答均由一位在大学医院拥有8年工作经验的作者进行准确性及无幻觉审查,其工作包括为癌症患者提供支持及医疗沟通服务。对于回答分类中的任何疑问,均通过与一位在日本国立癌症中心从事癌症信息服务超过20年的医师合著者讨论后予以解决。
  4. 仅当所有临床相关陈述均可直接从检索到的参考指南中得到确认,且无需额外知识或无依据推断时,才认为该回答得到支持。
  5. 使用预定义的结果标签对每个回答进行分类。将仅包含参考指南支持信息的回答分类为“无幻觉”;将包含无依据或捏造信息的回答分类为“存在幻觉”。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

通过目录页面检索医学内容的可获取性

网络爬虫架构从指南的目录页面收集了网址。从《肺部指南手册》中,共从目录页面提取出106个网址,其中104个(98%)包含医学信息(补充表1)。基于指南内容页面的聊天机器人回复效果总结于表1中。当问题在指南范围内时,聊天机器人能够针对全部四个临床关键词生成回复。对于“胸腺肿瘤诊断”和“病理诊断”这两个关键词,每个关键词均提取出3个相关网址,且所有提取的网址均被判定为有效(100%)。对于“治疗方法”和“手术治疗”这两个关键词,每个关键词均提取出15个网址,其中14个为有效项目(93%)。

查询关键词引用内容项,n有效引用项,
n (%)
胸腺肿瘤有哪些可用的诊断方法?胸腺肿瘤诊断33 (100)
胸腺肿瘤的病理学诊断方法有哪些?胸腺肿瘤病理诊断33 (100)
胸腺肿瘤有哪些可用的治疗选择?胸腺肿瘤治疗方法1514 (93)
胸腺肿瘤的外科治疗选择有哪些?胸腺肿瘤外科治疗1514 (93)

表1:基于肺癌患者及家属JLCS指南的参考信息与聊天机器人回复内容。 用户查询、生成的关键词、通过基于相似性检索识别出的参考内容项目数量,以及包含医学信息的有效参考项目数量的汇总。参考内容项目表示基于每个关键词在URL级别上识别出的相关网页总数。有效参考项目表示在排除重复URL和非医学网页后,包含医学信息的独立网页的数量及其所占百分比。

聊天机器人对范围内的问题的回应

表2展示了聊天机器人对符合所提供指南范围内的问题所生成的回答。当有足够的参考信息时,聊天机器人通过总结指南文本中的相关内容生成回答。生成的回答包含约350个日文字符。在定义的测试条件下,经人工审查未发现任何幻觉内容。对于这些范围内的问题,有多个有效的参考条目支持了回答的生成(表1)。生成的日文文本使用ChatGPT 5.2版本翻译为英文,随后由研究人员对翻译的准确性及与原始日文回答的一致性进行审核。

问题回答字数
胸腺肿瘤有哪些诊断方法?胸腺肿瘤的诊断需结合影像学诊断与病理学诊断。影像学诊断通常进行胸部CT和胸部MRI检查。胸腺瘤和胸腺癌均为实性肿瘤,瘤体内不含气体或液体成分;胸腺瘤对周围正常组织的侵犯较轻,而胸腺癌的侵犯更为明显。当影像学检查确定肿瘤未侵犯周围组织且无远处转移灶时,可采取手术切除,并利用手术标本进行病理学诊断。若手术切除困难,则在CT引导下进行穿刺活检,获取部分肿瘤组织以明确诊断。在病理学诊断中,胸腺瘤根据瘤内正常淋巴细胞的比例及肿瘤细胞的形态进行分类,而胸腺癌则依据组织学亚型进行更详细的分类。临床分期(分期)需综合考虑胸腺肿瘤病变的扩散范围,并基于三种分期系统将肿瘤分为I至IV期。366
胸腺肿瘤的病理学诊断方法有哪些?胸腺肿瘤的病理学诊断通过获取部分或全部肿瘤组织进行病理学检查。胸腺瘤根据瘤内所含正常淋巴细胞的比例及肿瘤细胞的形态,分为A型、AB型等亚型。相比之下,胸腺癌是一种具有明显细胞异型性的恶性肿瘤,其中鳞状细胞癌是最常见的组织学亚型。通过病理学诊断可评估肿瘤的生物学特性及进展程度,有助于选择合适的治疗方案并预测预后。此外,胸腺肿瘤的病理学诊断还可确定疾病分期(stage),为治疗规划提供重要信息。临床分期采用三种系统——Masaoka分期、Masaoka–Koga分期以及UICC–TNM分期系统——根据肿瘤扩散和侵犯的程度将肿瘤分为I至IV期。病理学诊断为胸腺肿瘤的合理治疗及预后评估提供了不可或缺的信息。 330
胸腺肿瘤有哪些治疗选择?胸腺肿瘤的治疗选择包括手术治疗(手术)、放射治疗和药物治疗(化疗)。手术治疗通常将胸腺连同肿瘤一并完全切除;对于胸腺瘤,若完整切除后可能无需进一步治疗。对于胸腺癌,若肿瘤已侵犯周围组织,术后可加用放射治疗。当手术难以实施,或出现复发或远处转移时,可采用化疗或放化疗,作为药物治疗的一部分。此外,对于晚期或复发性胸腺癌,以化疗为中心进行治疗,必要时可联合手术与放疗进行多模式治疗。进一步地,对于化疗后仍进展或复发的晚期胸腺癌患者,可使用分子靶向药物仑伐替尼(lenvatinib)。应根据患者的病情及临床状况,选择合适的治疗方式组合。 342
胸腺肿瘤的手术治疗选择有哪些?当判断胸腺肿瘤可完全切除时,可进行手术治疗。手术通常需将整个胸腺连同肿瘤一并切除。对于胸腺瘤,若肿瘤被完全切除,则通常无需额外治疗。而对于胸腺癌,若存在对周围组织的癌性侵犯,术后可加用辅助性放射治疗。若判断手术难以实施,则先进行化疗或放化疗,待条件允许后再评估是否可行手术。若无法手术,则可持续进行化疗或放化疗。此外,即使可行手术,若无法实现完全切除,术后也可给予放射治疗或放化疗,以处理残留病灶。应根据肿瘤类型及疾病进展程度,合理选择手术治疗方案。342

表2:基于指南的检索增强生成(RAG)聊天机器人根据《日本肺癌学会肺癌患者及家属指南》生成的回答。 该基于指南的RAG聊天机器人针对与胸腺肿瘤相关的问题,利用从《日本肺癌学会肺癌患者及家属指南》(https://www.haigan.gr.jp/public/guidebook/2024/)中提取的参考信息生成的代表性回答。本表包含用户提问、聊天机器人生成的回答以及回答长度。字符数统计基于使用ChatGPT 5.2版本翻译为英文前的原始日文回答。

聊天机器人对超出范围问题的回应

针对超出《肺部指南手册》范围的问题,聊天机器人的回答总结见表3。尽管这些问题引用了少量内容条目,但响应生成模型判定可用的参考信息不足以生成基于证据的回答。因此,聊天机器人对超出范围的查询返回了信息不足的回应。“文本中信息不足”和“无参考文献”是系统提示中预设的固定回答。当检索到的参考信息不足以回答问题时,返回前者;当未检索到任何参考信息时,返回后者。

查询关键词引用的内容项目数量,n聊天机器人回复
儿童胶质瘤有哪些诊断方法?儿童胶质瘤诊断0无参考文献。
儿童胶质瘤的病理学诊断方法有哪些?儿童胶质瘤病理诊断13文本中信息不足。
儿童胶质瘤有哪些治疗选择?儿童胶质瘤治疗方法13文本中信息不足。
儿童胶质瘤有哪些手术治疗选择?儿童胶质瘤手术治疗12文本中信息不足。

表3:基于《肺癌患者及家属指南手册》(JLCS)的聊天机器人对超出范围临床问题的回答。 由基于指南的检索增强生成(RAG)聊天机器人针对超出参考指南范围的问题所生成的回答。该表汇总了用户查询内容、生成的关键词、通过基于相似性检索识别出的参考内容条目数量,以及聊天机器人最终生成的回答。参考内容条目指基于每个关键词在URL层级上识别出的相关网页总数。由于检索到的内容不包含与所查询疾病相关的信息,因此未对超出范围的问题计算有效参考条目数。

补充文件 1. 从基于网页的临床实践指南中提取 URL 和文本的 Python 代码。 该代码用于从基于网页的临床实践指南的目录页面中提取 URL 和网页文本内容。所提取的 URL 和文本内容随后被用于基于指南的检索增强生成(RAG)聊天机器人工作流程中的文本处理、相似性分析以及参考信息构建。请点击此处下载该文件。

补充表 1. 从基于网络的指南目录页面提取的 URL 及其医学与非医学信息分类。 从日本肺癌学会(JLCS)《肺癌患者及家属指南手册》目录页面提取的 URL 经人工审阅后,被分类为医学或非医学信息。医学信息定义为可引用的指南内容,包括临床问题(CQs)、背景问题、问题集以及与患者指导相关的补充教育材料。非医学信息包括学会或组织网页、导航页面、超链接以及其他未用作聊天机器人应答生成参考信息的辅助性内容。本表汇总了所有提取的 URL 及其分类结果。*URL 来源于日本肺癌学会《肺癌患者及家属指南手册》目录页面(https://www.haigan.gr.jp/public/guidebook/2024/)。请点击此处下载该文件。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究探讨了一种基于指南的检索增强生成(RAG)聊天机器人,该机器人以网络版临床实践指南——《肺癌患者及家属指南手册》(JLCS Guidebook for Lung Cancer Patients and Families)作为参考信息源。该聊天机器人通过利用指南的网页结构,并根据用户查询与网页内容的相似性进行页面检索,从而生成基于指南内容的回答。该方法表明,基于相似性的检索与参考指南生成回答相结合,可支持可靠且高效的医学信息传递。近期研究已强调了基于大语言模型(LLM)的医疗聊天机器人在幻觉现象和回答可靠性方面的潜力与局限性12,13,14。与以往聚焦于通用聊天机器人框架的研究10,12,13不同,本研究方案展示了一种可复现的、基于指南的RAG方法,该方法在URL层级检索患者指南内容,并生成基于可识别参考信息的回答。因此,本研究提供了一种透明的癌症信息传递方案,而非一个完全验证的临床聊天机器人系统。

本系统并未基于全部指南文献对人工智能进行训练,而是针对每个用户查询,仅选择与之最相关的临床问题(CQ)作为参考信息(图1)。通过使用基于编程语言的余弦相似性计算,并结合TF-IDF向量表示法,对问题文本与各临床问题之间的相关性进行定量评估。根据这些相似性得分,临床问题按相关性从高到低排序并依次选取,从而在指南内部系统性地提取适当的信息来源,而无需依赖主观判断(表1)。此外,将检索到的临床问题文本进行拼接后整体输入人工智能模型,有助于在生成回答时保持一致的证据基础,从而提高生成内容的准确性和上下文连贯性。在检索增强生成(RAG)系统中,正确信息的生成在很大程度上依赖于准确且恰当的参考源14。该设计使系统能够弥补单一临床问题可能无法充分覆盖的信息,从而生成更全面且符合临床实际的回答。此外,RAG方法能够灵活检索最新的临床问题内容,非常适用于基于证据的医学应用10,11。尽管此前已有基于指南的RAG方法报道11,18,但本方案的不同之处在于,利用了面向患者的指南中已有的基于临床问题的网页结构作为主要检索框架。该设计提供了一种透明且可重复的工作流程,无需手动构建知识库或对模型进行重新训练即可实现。

重要的是,该聊天机器人将其回答严格限制在所引用指南的范围内。当问题超出指南内容时,系统会明确避免生成回答,从而降低产生无依据回应的风险。使用余弦相似度来控制参考文献的选择,进一步提高了生成回答的安全性和可靠性(表2)。对于超出指南范围的问题,系统也检索了参考页面(表3)。在主题范围内的问题,其余弦相似度值较高(0.20–0.65),而范围外问题的相似度值较低(0.20–0.31;数据未显示);但即使某些指南页面在临床上不具相关性,仍可能被赋予较低的相似度评分。这是因为余弦相似度仅基于查询语句与指南文本之间的关键词匹配进行计算。重要的是,这些低相关性参考并未导致不恰当的回答,因为当缺乏足够参考信息时,聊天机器人会拒绝生成回答。在定义的测试条件下,人工审查未发现任何幻觉现象。余弦相似度0.2的阈值是在初步测试中通过经验确定的,旨在平衡检索的敏感性与特异性。尽管该阈值在当前测试条件下有效,但系统性评估阈值敏感性超出了本方案研究的范围。未来的研究应利用更大规模的基准数据集和定量检索指标,探讨不同阈值设置的影响。观察到的行为表明,基于检索增强生成(RAG)的输出控制可能在医学人工智能应用中具有实用价值。然而,当前评估仅基于有限数量的范围内和范围外问题,主要目的是对所提出的流程进行概念验证性评估。因此,不应将研究结果解读为对临床准确性、安全性或普适性的全面验证。

本研究存在若干技术局限性。我们采用了日语形态分析器以及 GPT-3.5-turbo-16k(用于生成回复的大型语言模型,LLM)。选择该 LLM 是因为其在系统开发时是一个广泛可用且稳定的模型,能够实现所提出工作流程的可重复性。形态分析器与 LLM 各具不同特性,因此模型或库的选择会影响信息提取的准确性以及生成回复的内容22,23。尽管更新的模型(例如 GPT-4 或 GPT-5 级别的 LLM)可能提升性能和外部有效性22,但评估替代模型超出了本研究方案的范围。较新的 LLM 可能具备更优的推理能力、指令遵循能力以及回复质量;然而,本研究的主要目标是评估基于指南的 RAG 框架的可行性,而非比较不同 LLM 的性能。进一步优化这些组件可能实现更高效且准确的回复生成,还需通过不同模型配置进行验证,以评估研究结果的普适性。此外,本研究方案使用日语指南和日语形态分析技术开发而成。尽管基于 TF–IDF 向量化、余弦相似度和 RAG 的检索框架在原则上与语言无关,但在其他语言中的实现仍需依赖特定语言的文本处理工具并进行验证。本研究仅限于单一指南,因此无法直接比较不同指南结构。然而,按临床问题(CQ)层级组织内容有助于系统性提取指南信息,并支持为基于指南的 RAG 聊天机器人构建参考信息。特别是指南的网页结构——每个临床问题均对应唯一 URL——在高效抓取和按 URL 层级组织参考内容方面发挥了重要的实际作用。对于格式不同的指南,例如基于 PDF 的文档或未提供 CQ 级别 URL 的网站,可能需要采用不同的分段与检索策略。因此,当前工作流程在其他指南结构和医学专科中的普适性仍有待验证。未来的研究应评估该方法在多种疾病、不同指南格式及信息来源中的适用性。

本研究的结果为设计参考指南的人工智能系统提供了实用指导,并证明基于指南、引用网络临床指南的RAG聊天机器人在传递癌症相关医学信息方面具有应用潜力。然而,本研究仅为概念验证性评估,旨在展示指南检索、回答生成及回答限制机制的技术可行性,不应被解读为对医学信息系统进行的正式临床验证。本研究未评估临床有效性、安全性及用户使用效果,这些方面仍有待未来研究加以确立。从伦理和用户安全角度而言,将回答限制在指南支持的信息范围内,可能降低出现无依据或虚构回答的风险。但过度拒绝回答也可能降低用户满意度和感知有用性。因此,未来的研究应评估安全性与可用性之间的平衡,同时保持对错误信息的适当防范措施。通过利用网络指南的信息结构,并针对用户问题提供聚焦的回答,该系统可为人工智能在医学信息传递中的未来应用提供一个有用的模型。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明无竞争利益。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者感谢日本湘南纪念医院乳腺中心的井上健一医学博士、理学博士(Kenichi Inoue, MD, PhD)在基于指南的检索增强生成式聊天机器人开发过程中提供的大量技术支持。作者还感谢日本国立癌症中心癌症控制研究所(日本东京)的山木千佳子博士(Chikako Yamaki, PhD)以及研究团队全体成员就本文所探讨主题提供的宝贵建议。此外,作者感谢 Editage 提供的英文语言编辑服务。本研究得到了日本健康与劳动科学研究基金(R6–Cancer Control–23EA1026)的资助。

材料

本文使用的材料清单
姓名公司目录编号评论
Beautiful Soup 4(版本 4.12.3)Beautiful Soup ProjectN/A用于 URL 提取和 HTML 解析的 Python 库
ChatGPT 版本 4oOpenAIN/A用于关键词生成
GPT-3.5-turboOpenAIN/A用于响应生成
肺癌患者及家属 JLCS 指南日本肺癌学会N/A基于网络的临床实践指南,用作参考信息
MeCab(版本 0.996)MeCab ProjectN/A日语形态分析器
OpenAI APIOpenAIN/A用于基于人工智能的响应生成
Python(版本 3.12)Python 软件基金会N/A编程环境
Requests(版本 2.32.3)Requests ProjectN/A用于网页获取的 Python 库
scikit-learn(版本 1.6.1)scikit-learn 开发者N/A用于 TF–IDF 向量化和余弦相似度计算。
urllib.parsePython 软件基金会N/A用于 URL 标准化和拼接的 Python 库

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Helft PR, Hlubocky F, Daugherty CK. American oncologists' views of internet use by cancer patients: a mail survey of American Society of Clinical Oncology members. J Clin Oncol. 2003;21(5):942-947.
  2. Chen X, Siu LL. Impact of the media and the internet on oncology: survey of cancer patients and oncologists in Canada. J Clin Oncol. 2001;19(23):4291-4297.
  3. Goto Y, et al. Differences in the quality of information on the internet about lung cancer between the United States and Japan. J Thorac Oncol. 2009;4(7):829-833.
  4. Ogasawara R, et al. Reliability of cancer treatment information on the internet: observational study. JMIR Cancer. 2018;4(2):e10031.
  5. Johnson SB, Park HS, Gross CP, Yu JB. Complementary medicine, refusal of conventional cancer therapy, and survival among patients with curable cancers. JAMA Oncol. 2018;4(10):1375-1381.
  6. Rajpurkar P, Chen E, Banerjee O, Topol EJ. AI in health and medicine. Nat Med. 2022;28(1):31-38.
  7. The Lancet Digital Health. ChatGPT: friend or foe? Lancet Digit Health. 2023;5(3):e102.
  8. Huang L, et al. A survey on hallucination in large language models: principles, taxonomy, challenges, and open questions. arXiv. 2023;2311.05232.
  9. Ji Z, et al. Survey of hallucination in natural language generation. ACM Comput Surv. 2023;55(12):248.
  10. Yang R, et al. Retrieval-augmented generation for generative artificial intelligence in health care. npj Health Syst. 2025;2(2).
  11. Zakka C, et al. Almanac—retrieval-augmented language models for clinical medicine. NEJM AI. 2024;1(2):AIoa2300068.
  12. Chow JCL, Li K. Developing effective frameworks for large language model-based medical chatbots: insights from radiotherapy education with ChatGPT. JMIR Cancer. 2025;11:e66633.
  13. Chow JCL, Li K. Large language models in medical chatbots: opportunities, challenges, and the need to address AI risks. Information. 2025;16(7):549.
  14. Nishisako S, Higashi T, Wakao F. Reducing hallucinations and trade-offs in responses in generative AI chatbots for cancer information: development and evaluation study. JMIR Cancer. 2025;11:e70176.
  15. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  16. Gao Y, et al. Retrieval-augmented generation for large language models: a survey. arXiv. 2023;2312.10997.
  17. Jeong M, Sohn J, Sung M, Kang JJB. Improving medical reasoning through retrieval and self-reflection with retrieval-augmented large language models. Bioinformatics. 2024;40:i119-i129.
  18. Lewis M, et al. Grounding large language models in clinical evidence: a retrieval-augmented generation system for querying UK NICE clinical guidelines. arXiv. 2025;2510.02967.
  19. Ministry of Education, Culture, Sports, Science and Technology; Ministry of Health, Labour and Welfare; Ministry of Economy, Trade and Industry. Ethical guidelines for medical and biological research involving human subjects [Article in Japanese]. Ministry of Health, Labour and Welfare.
  20. Gallifant J, et al. The TRIPOD-LLM reporting guideline for studies using large language models. Nat Med. 2025;31:60-69.
  21. The Japanese Lung Cancer Society. JLCS Guidebook for Lung Cancer Patients and Families. Available at: https://www.haigan.gr.jp/public/guidebook/2024/. Accessed January 21, 2026.
  22. Liu M, et al. Evaluating the effectiveness of advanced large language models in medical knowledge: a comparative study using Japanese national medical examination. Int J Med Inform. 2025;193:105673.
  23. Kudo T, Yamamoto K, Matsumoto Y. Applying conditional random fields to Japanese morphological analysis. In: Proceedings of the 2004 Conference on Empirical Methods in Natural Language Processing. 2004:230-237.

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

234 234 RAG

相关文章