本方案描述了一种基于指南的检索增强生成聊天机器人的开发与评估方法,该机器人可从基于网络的癌症临床实践指南中检索并总结内容,以生成有参考依据的用户查询回复。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本方案描述了一种基于指南的检索增强生成聊天机器人的开发与评估方法,该机器人可从基于网络的癌症临床实践指南中检索并总结内容,以生成有参考依据的用户查询回复。
互联网上医疗信息的广泛可及性改善了患者获取健康相关知识的途径;然而,这也增加了患者接触不准确医疗信息的风险。癌症治疗涉及复杂的信息,使得患者难以识别准确且基于证据的信息来源。大型语言模型虽能实现自然语言交互,但常产生“幻觉”内容,限制了其在医疗信息传递中的应用。检索增强生成(RAG)技术通过将回答建立在外部参考源的基础上,有望降低此类风险。本研究描述了一种基于指南的RAG聊天机器人的开发与评估过程,该系统利用公开可获取的基于网络的癌症临床实践指南。系统从指南的目录页面提取URL,使用基于词频-逆文档频率的形态学分析和余弦相似度对页面文本进行处理,并从高度相关页面构建参考信息。大型语言模型利用这些参考信息生成受限于指南内容的回答。本研究以《肺癌患者及家属指南手册》(JLCS Guidebook for Lung Cancer Patients and Families)作为参考指南。问题集包括指南涵盖范围内的癌症类型和范围外的癌症类型,以评估系统对回答的控制能力。研究成功从目录页面提取了医疗信息,提取的URL中有98%包含可引用的医学内容。对于范围内的问题,聊天机器人通过总结指南内容生成回答,在定义的测试条件下人工审查未发现任何幻觉内容。对于范围外的问题,聊天机器人始终拒绝回答,并提示现有信息不足以提供答案。该指南的网页结构便于在URL层级高效抓取和组织参考内容。本方案为利用基于网络的临床实践指南构建人工智能医疗信息服务系统提供了实用指导。
互联网和社交媒体的广泛使用使患者更容易获取医学信息1,2。癌症治疗相关的信息通常复杂且繁多,患者尤其难以识别准确、相关且基于科学证据的信息来源3。尽管在线资源有助于提升患者对疾病的认知,但其中也包含大量错误的医学信息3,可能对患者在治疗决策方面产生负面影响4。由于与癌症相关的虚假信息可能影响患者的治疗结局5,因此迫切需要人工智能(AI)系统来帮助个体用户搜索、总结和解读医学信息6。
大语言模型(LLMs)使用户能够通过自然语言对话获取信息7;然而,生成错误信息(即“幻觉”)的问题在医学领域仍然是一个严重关切8,9,10,11。错误信息的一个关键来源是用于开发聊天机器人的训练数据的质量和准确性。此外,模型训练的静态特性意味着知识可能随时间推移而过时,从而限制了LLMs提供最新且符合情境的信息的能力12,13。这些局限性凸显了有效知识管理策略的重要性,以确保聊天机器人的回答保持准确、相关且及时更新。特别是在医疗环境中,临床实践指南等基于证据的资源不断更新,推荐意见和护理标准持续演变,因此更需要能够便捷访问并引用当前权威资源的系统。为应对这一挑战,检索增强生成(retrieval-augmented generation, RAG)技术日益受到关注,该技术通过整合来自外部知识源的信息来生成响应10,13,14,15,16,17。
尽管检索增强生成(RAG)在医学聊天机器人中的应用日益广泛,但关于如何将临床实践指南系统性地整合为参考信息来源,目前关注仍有限18。许多临床实践指南在互联网上公开可获取;然而,其现有的网页结构是否可直接作为RAG系统的检索框架,尚不明确18。此外,如何在无需人工构建知识库的前提下建立参考信息的实用方法,尚未得到充分建立。
本研究旨在通过开发和评估一种基于公开可用的网络癌症临床实践指南的指南型RAG聊天机器人,建立医疗领域中参考指南的人工智能系统的设计原则,从而实现对基于指南信息的简便且及时的获取。作为概念验证,我们评估了利用现有公开临床实践指南的网络结构进行指南检索、回答生成和回答限制的技术可行性,旨在提出一种可重复的指南参考RAG系统的开发流程。
访问受限。请登录或开始试用以查看此内容。
本研究不涉及需要防范研究风险的人类受试者,因此根据日本涉及人类受试者的医学研究伦理指南,无需经过机构审查委员会的审查19。本研究的报告遵循个体预后或诊断多变量模型透明报告(Transparent Reporting of a Multivariable Model for Individual Prognosis or Diagnosis, TRIPOD)-LLM指南20。
有关基于指南的 RAG 聊天机器人协议的示意图,请参见图 1。

图1.基于指南的检索增强生成(RAG)聊天机器人协议工作流程。 基于指南的RAG聊天机器人工作流程的示意图。从基于网络的临床实践指南目录页面提取URL,并用于构建参考信息。用户查询被转换为关键词,网页内容通过分词、词频-逆文档频率向量化和余弦相似性分析进行处理,以识别相关的指南页面。选定的参考信息被整合后提供给大语言模型,使其仅基于引用的指南内容生成响应。右侧面板总结了用于评估提取的URL、参考信息和聊天机器人响应的评价项目。 请点击此处查看该图的放大版本。
1. 基于网络指南的参考信息准备
2. 从用户查询生成关键词
"3. 文本处理与相似度计算
4. 参考信息的构建
5. 基于人工智能的响应生成
6. 参考指南与问题提出
7. 反应评估
访问受限。请登录或开始试用以查看此内容。
通过目录页面检索医学内容的可获取性
网络爬虫架构从指南的目录页面收集了网址。从《肺部指南手册》中,共从目录页面提取出106个网址,其中104个(98%)包含医学信息(补充表1)。基于指南内容页面的聊天机器人回复效果总结于表1中。当问题在指南范围内时,聊天机器人能够针对全部四个临床关键词生成回复。对于“胸腺肿瘤诊断”和“病理诊断”这两个关键词,每个关键词均提取出3个相关网址,且所有提取的网址均被判定为有效(100%)。对于“治疗方法”和“手术治疗”这两个关键词,每个关键词均提取出15个网址,其中14个为有效项目(93%)。
| 查询 | 关键词 | ... |
访问受限。请登录或开始试用以查看此内容。
本研究探讨了一种基于指南的检索增强生成(RAG)聊天机器人,该机器人以网络版临床实践指南——《肺癌患者及家属指南手册》(JLCS Guidebook for Lung Cancer Patients and Families)作为参考信息源。该聊天机器人通过利用指南的网页结构,并根据用户查询与网页内容的相似性进行页面检索,从而生成基于指南内容的回答。该方法表明,基于相似性的检索与参考指南生成回答相结合,可支持可靠且高效的医学信息传递。近期研究已强调了基于大语言模型(LLM)的医疗聊天机器人在幻觉现象和回答可靠性方面的潜力与局限性12,13,14。与以往聚焦于通用聊天机器人框架的研究10,12,13不同,本研究方案展示了一种可复现的、基于指南的RAG方法,该方法在URL...
访问受限。请登录或开始试用以查看此内容。
作者声明无竞争利益。
作者感谢日本湘南纪念医院乳腺中心的井上健一医学博士、理学博士(Kenichi Inoue, MD, PhD)在基于指南的检索增强生成式聊天机器人开发过程中提供的大量技术支持。作者还感谢日本国立癌症中心癌症控制研究所(日本东京)的山木千佳子博士(Chikako Yamaki, PhD)以及研究团队全体成员就本文所探讨主题提供的宝贵建议。此外,作者感谢 Editage 提供的英文语言编辑服务。本研究得到了日本健康与劳动科学研究基金(R6–Cancer Control–23EA1026)的资助。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Beautiful Soup 4(版本 4.12.3) | Beautiful Soup Project | N/A | 用于 URL 提取和 HTML 解析的 Python 库 |
| ChatGPT 版本 4o | OpenAI | N/A | 用于关键词生成 |
| GPT-3.5-turbo | OpenAI | N/A | 用于响应生成 |
| 肺癌患者及家属 JLCS 指南 | 日本肺癌学会 | N/A | 基于网络的临床实践指南,用作参考信息 |
| MeCab(版本 0.996) | MeCab Project | N/A | 日语形态分析器 |
| OpenAI API | OpenAI | N/A | 用于基于人工智能的响应生成 |
| Python(版本 3.12) | Python 软件基金会 | N/A | 编程环境 |
| Requests(版本 2.32.3) | Requests Project | N/A | 用于网页获取的 Python 库 |
| scikit-learn(版本 1.6.1) | scikit-learn 开发者 | N/A | 用于 TF–IDF 向量化和余弦相似度计算。 |
| urllib.parse | Python 软件基金会 | N/A | 用于 URL 标准化和拼接的 Python 库 |
访问受限。请登录或开始试用以查看此内容。