이 프로토콜은 웹 기반 암 임상 진료 지침에서 콘텐츠를 검색하고 요약하여 사용자 질문에 대한 참고 기반 응답을 생성하는 가이드라인 기반 검색 증강 생성 챗봇의 개발 및 평가를 설명합니다.
방법 논문
이 프로토콜은 웹 기반 암 임상 진료 지침에서 콘텐츠를 검색하고 요약하여 사용자 질문에 대한 참고 기반 응답을 생성하는 가이드라인 기반 검색 증강 생성 챗봇의 개발 및 평가를 설명합니다.
인터넷을 통한 의료 정보의 광범위한 보급은 환자들의 건강 관련 지식 접근성을 향상시켰으며; 하지만 부정확한 의료 정보에 대한 노출도 증가시켰습니다. 암 치료는 복잡한 정보를 포함하여 환자가 정확하고 근거 기반의 출처를 파악하기 어렵습니다. 대형 언어 모델은 자연어 상호작용을 가능하게 하지만 자주 환각을 발생시켜 의료 정보 전달에서의 적용이 제한적입니다. 검색 증강 생성(RAG)은 외부 참조 소스에 기반을 두고 응답을 완화할 잠재력을 가지고 있습니다. 본 연구는 공개된 웹 기반 암 임상 진료 지침을 사용하는 가이드라인 기반 RAG 챗봇의 개발 및 평가를 설명합니다. 이 시스템은 가이드라인의 목차 페이지에서 URL을 추출하고, 형태학적 분석과 용어 빈도-역 문서 빈도를 기반으로 한 코사인 유사성을 이용해 페이지 텍스트를 처리하며, 매우 관련성 높은 페이지에서 참조 정보를 생성합니다. 대형 언어 모델은 이러한 참조를 사용하여 가이드라인 내용에 제한된 응답을 생성합니다. JLCS 폐암 환자 및 가족 가이드북이 참고 지침으로 사용되었습니다. 질문 세트에는 가이드라인에서 다루는 범위 내 암 유형과 범위 외 암 유형이 모두 포함되어 반응 통제를 평가하였습니다. 의료 정보는 목차에서 성공적으로 추출되었으며, 추출된 URL의 98%가 참고 가능한 의료 내용을 포함하고 있었습니다. 범위 내 질문에 대해서는 챗봇이 가이드라인 내용을 요약하여 응답을 생성했으며, 정의된 테스트 조건 내에서 수동 검토 중 환각은 발견되지 않았습니다. 범위를 벗어난 질문에 대해서는 챗봇이 일관되게 답변을 거부하며 이용 가능한 정보가 불충분하다고 표시했습니다. 가이드라인의 웹 구조는 URL 수준에서 참조 콘텐츠의 효율적인 스크래핑과 조직을 가능하게 했습니다. 이 프로토콜은 웹 기반 임상 진료 지침을 기반으로 의료 정보를 전달하는 인공지능 시스템 구축에 실질적인 지침을 제공합니다.
인터넷과 소셜 미디어의 광범위한 사용으로 환자들이 의료 정보를 더 쉽게 접근할 수 있게 되었습니다 1,2. 암 치료 정보는 종종 복잡하고 방대하기 때문에, 환자들이 정확하고 관련성 있으며 과학적 증거에 기반한 출처를 식별하기 특히 어렵습니다. 온라인 자료는 환자 이해를 돕는 데 도움이 되지만, 상당량의 잘못된의료 정보가 포함되어 있어환자의 치료 결정에 부정적인 영향을 미칠 수 있습니다. 암 관련 허위 정보가 환자 결과에 영향을 미칠 수 있기 때문에,5, 개별 사용자가 의료 정보를 검색, 요약, 해석할 수 있도록 돕는 인공지능(AI) 시스템에 대한 수요가 증가하고 있습니다. 6.
대형 언어 모델(LLM)은 사용자가 자연어 대화를 통해 정보를 접근할 수 있게 합니다7; 그러나 잘못된 정보(즉, 환각)의 생성은 의료 분야에서 여전히 심각한 문제로 남아 있습니다 8,9,10,11. 잘못된 정보의 주요 원인 중 하나는 챗봇 개발에 사용된 훈련 데이터의 품질과 정확성입니다. 또한, 모델 학습의 정적인 특성은 지식이 시간이 지남에 따라 구식이 될 수 있음을 의미하며, LLM이 현재적이고 맥락에 적합한 정보를 제공하는 능력을 제한합니다12,13. 이러한 한계는 챗봇 응답이 정확하고 관련성 있으며 최신 상태를 유지하도록 효과적인 지식 관리 전략의 중요성을 강조합니다. 특히, 임상 진료 지침과 같은 최신 근거 기반 자원에 쉽게 접근하고 참조할 수 있는 시스템은 권고와 치료 기준이 지속적으로 진화하는 의료 환경에서 바람직합니다. 이 문제를 해결하기 위해, 외부 지식원에서 정보를 통합하여 응답을 생성하는 검색 증강 생성(RAG)이 점점 더 주목받고 있습니다10, 13, 14, 15, 16, 17.
RAG가 의료 챗봇에 점점 더 많이 적용되고 있지만, 임상 실무 지침이 체계적으로참고 정보원으로 어떻게 통합되어야 하는지에 대한 관심은 제한적이었습니다. 많은 임상 실무 지침이 웹상에 공개되어 있습니다; 기존 웹 구조가 RAG 시스템18의 검색 프레임워크로 직접 활용될 수 있는지는 불분명합니다. 또한, 수작업으로 지식 기반 개발을 하지 않고 참고 정보를 구축하는 실용적인 방법도 잘 확립되지 않았습니다.
본 연구에서는 공개된 웹 기반 암 임상 진료 지침을 사용하는 지침 기반 RAG 챗봇을 개발 및 평가하여 의료 분야에서 가이드라인 참조 AI 시스템의 설계 원칙을 확립하고자 했으며, 이를 통해 가이드라인 기반 정보에 간단하고 시기적절하게 접근할 수 있게 되었습니다. 개념 증명으로서, 우리는 공개된 임상 실무 지침의 웹 구조를 활용하여 가이드라인 검색, 반응 생성, 반응 제한의 기술적 타당성을 평가하여, 지침 참조 RAG 시스템에 대한 재현 가능한 개발 프로토콜을 제안하는 것을 목표로 했습니다.
이 연구는 연구 위험으로부터 보호가 필요한 인간 대상자가 아닙니다. 따라서 인간 대상 의학 연구에 대해 일본 윤리 지침에 따라 기관 심사 위원회의 심사를 요구하지 않는다19. 이 연구는 개인 예후 또는 진단을 위한 다변수 모델 투명 보고(TRIPOD)-LLM 가이드라인에 따라 보고되었습니다20.
가이드라인 기반 RAG 챗봇 프로토콜의 도식은 그림 1 을 참조하십시오.

그림 1. 가이드라인 기반 검색 증강 생성(RAG) 챗봇 프로토콜의 워크플로우. 가이드라인 기반 RAG 챗봇 워크플로우의 도식적 개요. URL은 웹 기반 임상 실무 지침의 목차 페이지에서 추출하여 참고 정보를 구성하는 데 사용됩니다. 사용자 쿼리는 키워드로 변환되며, 웹페이지 내용은 토큰화, 용어 빈도-역문서 빈도 벡터화, 코사인 유사도 분석을 통해 관련 가이드라인 페이지를 식별합니다. 선택된 참고 정보는 통합되어 대규모 언어 모델에 제공되어 참고된 지침 내용만을 기반으로 응답을 생성합니다. 오른쪽 패널은 추출된 URL, 참고 문헌, 챗봇 응답에 사용된 평가 항목을 요약합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
1. 웹 기반 가이드라인을 기반으로 한 참고 정보 준비
2. 사용자 쿼리를 통한 키워드 생성

3. 텍스트 처리 및 유사도 계산
4. 참고 정보의 구성
5. AI 기반 응답 생성
6. 참고 지침 및 질문 구성
7. 반응 평가
목차 페이지를 통한 의료 콘텐츠 검색 가능
웹 스크래핑 아키텍처는 가이드라인의 목차 페이지에서 URL을 수집했습니다. 폐 가이드북에서 목차 페이지에서 106개의 URL이 추출되었으며, 이 중 104개(98%)는 의료 정보를 포함하고 있습니다(보충표 1). 가이드라인 내용 페이지를 기반으로 한 챗봇 응답의 효과는 표 1에 요약되어 있습니다. 챗봇은 질문이 지침 범위 내에 있을 때 네 가지 임상 키워드 모두에 대해 답변을 생성했습니다. "흉선 종양 진단"과 "병리학적 진단"에 대해서는 각 키워드별로 세 개의 관련 URL을 추출했으며, 추출된 모든 URL이 100% 효과로 간주되었습니다. "치료 방법"과 "외과적 치료"에 대해 각 키워드별로 15개의 URL을 추출했으며, 14개의 유효 문항(93%)을 포함했습니다.
| 쿼리 | 키워드 | 참고 콘텐츠 항목, n | 효과적인 참고문헌, n (%) |
| 흉선 종양에 대한 진단 방법은 무엇인가요? | 흉선 종양 진단 | 3 | 3 (100) |
| 흉선 종양에 대한 병리학적 진단 접근법은 무엇인가요? | 흉선 종양 병리학적 진단 | 3 | 3 (100) |
| 흉선 종양에 대한 치료 옵션은 무엇인가요? | 흉선 종양 치료 방법 | 15 | 14 (93) |
| 흉선 종양에 대한 수술 치료 옵션은 무엇인가요? | 흉선 종양 수술 치료 | 15 | 14 (93) |
표 1: JLCS 폐암 환자 및 가족 가이드북을 기반으로 한 참고 정보 및 챗봇 응답 내용. 사용자 쿼리 요약, 생성된 키워드, 유사성 기반 검색을 통해 확인된 참조 콘텐츠 항목 수, 의료 정보를 포함하는 유효 참조 항목 수. 참조된 콘텐츠 항목은 각 키워드를 기준으로 URL 수준에서 식별된 관련 웹페이지의 총 수를 나타냅니다. 유효 참고 항목은 중복 URL과 비의료 웹페이지를 제외한 고유 의료 정보를 포함하는 웹페이지의 수와 비율을 나타냅니다.
범위 내 질문에 대한 챗봇 응답
표 2는 제공된 지침 범위 내에 해당하는 질문에 대한 챗봇의 응답을 보여줍니다. 충분한 참고 정보가 확보되면, 챗봇은 가이드라인 텍스트의 관련 부분을 요약하여 응답을 생성했습니다. 생성된 응답은 약 350개의 일본어 자자로 구성되었습니다. 정의된 시험 조건 하에서 수동 검토 중 환각은 발견되지 않았습니다. 이러한 범위 내 질문에 대해, 여러 개의 효과적인 참조 문항이 응답 생성을 지원했습니다(표 1). 생성된 일본어 텍스트는 ChatGPT 버전 5.2를 사용해 영어로 번역되었고, 이후 연구자들이 원본 일본어 답변과의 정확성 및 일관성을 검토했습니다.
| 쿼리 | 반응 | 캐릭터 수 | ||||
| 흉선 종양에 대한 진단 방법은 무엇인가요? | 흉선 종양 진단은 영상 진단과 병리학적 진단 모두를 필요로 합니다. 영상 진단을 위해 흉부 CT와 흉부 MRI가 시행됩니다. 흉선종과 흉선암은 종양 내에 공기나 액체가 없는 고형 종양으로, 흉선종에서는 주변 정상 조직으로의 침습이 경미하지만 흉선암에서는 더 심하게 나타납니다. 영상 검사에서 주변 조직에 침범이 없거나 원발 병변에서 먼 곳에 종양이 없다는 것이 확인되면, 종양을 외과적으로 절제하고 수술 표본을 사용하여 병리학적 진단을 수행합니다. 수술 절제가 어려운 경우에는 CT 유도 생검을 시행하고, 종양 조직의 일부를 채취하여 진단을 내립니다. 병리학적 진단에서 흉선종은 종양 내 정상 림프구 비율과 종양 세포의 형태를 기준으로 분류되는 반면, 흉선암은 조직학적 아형에 따라 상세히 분류됩니다. 임상 병기(병기)를 결정할 때는 흉선 종양 병변의 확산 정도를 고려하며, 세 가지 병기 분류 체계를 기반으로 종양을 1기부터 IV기까지 분류합니다. | 366 | ||||
| 흉선 종양에 대한 병리학적 진단 접근법은 무엇인가요? | 흉선 종양의 병리학적 진단에서는 종양 조직의 일부 또는 전체를 채취하여 병리학적 검사를 수행합니다. 흉종은 종양 내에 포함된 정상 림프구의 비율과 종양 세포의 형태에 따라 A형과 AB형(AB)과 같은 하위 유형으로 분류됩니다. 반면, 흉선암은 세포 비형성을 특징으로 하는 악성 종양이며, 편평세포암이 가장 흔한 조직학적 아형입니다. 병리학적 진단을 통해 생물학적 특성과 종양 진행 정도를 평가하여 적절한 치료 전략 선택과 예후 예측에 유용합니다. 또한, 흉선 종양의 병리학적 진단은 질병 병기(병기)를 결정할 수 있어 치료 계획에 중요한 정보를 제공합니다. 임상 병기는 마사오카 분류, 마사오카-코가 분류, UICC-TNM 분류 세 가지 체계로 분류되며, 종양은 종양 전과 침범 정도에 따라 1기부터 4기까지 네 단계로 분류됩니다. 병리학적 진단은 흉선 종양의 적절한 치료와 예후 평가에 필수적인 정보를 제공합니다. | 330 | ||||
| 흉선 종양에 대한 치료 옵션은 무엇인가요? | 흉선 종양의 치료 옵션에는 수술적 치료(수술), 방사선 치료, 약물 치료(화학요법)가 포함됩니다. 수술은 흉선과 종양을 함께 완전히 절제하는 절차로, 흉선종의 경우 추가 치료가 필요하지 않을 수 있습니다. 흉선암에서는 암이 주변 조직으로 전이되었을 때 수술 후 방사선 치료가 추가될 수 있습니다. 화학요법 또는 화학방사선치료는 수술이 어렵거나 재발 또는 멀리 있는 전이가 있을 때 시행되며, 약물 치료의 일부로 사용됩니다. 또한, 진행성 또는 재발성 흉선암의 경우 화학요법을 중심으로 치료가 시행되며, 필요에 따라 수술과 방사선 치료를 결합한 다중 모달 치료도 시행될 수 있습니다. 또한, 화학요법 후 진행성 또는 재발성 흉선암에는 분자 표적 치료제인 렌바티닙이 사용될 수 있습니다. 적절한 치료 방법의 조합은 질병 상태와 환자의 임상 상태에 따라 선택됩니다. | 342 | ||||
| 흉선 종양에 대한 수술 치료 옵션은 무엇인가요? | 흉선 종양의 수술적 치료는 종양이 완전히 절제 가능하다고 판단될 때 시행됩니다. 수술에서는 일반적으로 종양과 함께 흉선 전체를 제거하는 것이 표준 절차입니다. 흉선종의 경우, 종양이 완전히 절제되면 추가 치료가 필요하지 않습니다. 반면, 흉선암의 경우 주변 조직에 암이 침투할 경우 보조 수술 후 방사선 치료를 추가할 수 있습니다. 수술이 어렵다고 판단되면 먼저 화학요법 또는 화학방사선 치료를 시행하고, 가능해지면 수술이 고려됩니다. 수술이 불가능할 경우 화학요법이나 화학방사선 치료를 계속할 수 있습니다. 또한, 수술이 가능하더라도 완전한 절제가 불가능할 경우 수술 후 방사선 치료나 화학방사선 치료를 통해 잔여 종양을 치료할 수 있습니다. 수술 치료는 종양 유형과 질병 진행 정도에 따라 적절히 선택됩니다. | 342 | ||||
표 2: JLCS 폐암 환자 및 가족 가이드북을 기반으로 한 가이드라인 기반 검색-증강 생성(RAG) 챗봇이 생성한 응답. JLCS 폐암 환자 및 가족 가이드북(https://www.haigan.gr.jp/public/guidebook/2024/)에서 추출한 참고 정보를 사용하여 흉선 종양 관련 질문에 대해 가이드라인 기반 RAG 챗봇이 생성한 대표성 응답입니다. 표에는 사용자 쿼리, 챗봇이 생성한 응답, 응답 길이가 포함되어 있습니다. 문자 수는 ChatGPT 버전 5.2를 사용해 영어로 번역하기 전 원본 일본어 응답에서 측정되었습니다.
범위 외 질문에 대한 챗봇 응답
폐 가이드북의 범위를 벗어난 질문에 대한 챗봇의 답변은 표 3에 요약되어 있습니다. 이 질문들에 대해 제한된 수의 내용 항목을 참고했음에도 불구하고, 응답 생성 모델은 이용 가능한 참고 정보가 증거 기반 답변을 생성하기에 충분하지 않다고 판단했습니다. 결과적으로 챗봇은 범위 외 문의에 대한 정보가 부족하다는 답변을 반환했습니다. "텍스트에 정보가 부족하다"와 "참조가 없습니다."라는 문장은 시스템 프롬프트에 미리 정의된 응답이었습니다. 전자는 검색된 참고 정보가 질문에 답하기에 부족할 때 반환되었고, 후자는 참조 정보가 전혀 없을 때 반환되었습니다.
| 쿼리 | 키워드 | 참고 콘텐츠 항목, n | 챗봇 응답 |
| 소아 교모세포종에 대한 진단 방법은 무엇인가요? | 소아 교모세포종 진단 | 0 | 참고 자료는 없습니다. |
| 소아 교모세포종에 대한 병리학적 진단 접근법은 무엇인가요? | 소아 교모세포종 병리학적 진단 | 13 | 본문에는 정보가 부족합니다. |
| 소아 교모세포종에 대한 치료 옵션은 무엇인가요? | 소아 교모종 치료 방법 | 13 | 본문에는 정보가 부족합니다. |
| 소아 교모세포종의 수술 치료 옵션은 무엇인가요? | 소아 교모세포종 수술 치료 | 12 | 본문에는 정보가 부족합니다. |
표 3: JLCS 폐암 환자 및 가족 가이드북을 기반으로 한 임상 질문 수준에서 범위 외 질문에 대한 챗봇 응답. 참고 지침 범위를 벗어난 질문에 대해 가이드라인 기반 검색-증강 생성(RAG) 챗봇이 생성한 응답. 이 표는 사용자 쿼리, 생성된 키워드, 유사성 기반 검색을 통해 확인된 참조 콘텐츠 항목 수, 그리고 그에 따른 챗봇 응답을 요약합니다. 참조된 콘텐츠 항목은 각 키워드를 기준으로 URL 수준에서 식별된 관련 웹페이지의 총 수를 나타냅니다. 검색 내용에 해당 질병과 관련된 정보가 포함되어 있지 않아 범위 외 질문에 대한 효과적인 참고문항은 계산되지 않았습니다.
보충 파일 1. 웹 기반 임상 실무 지침에서 URL 및 텍스트 추출을 위한 파이썬 코드. 웹 기반 임상 실무 지침의 목차에서 URL과 웹페이지 텍스트를 추출하는 데 사용되는 코드입니다. 추출된 URL과 텍스트 내용은 이후 텍스트 처리, 유사성 분석, 참고 정보 생성에 사용되었으며, 가이드라인 기반 검색-증강 생성(RAG) 챗봇 워크플로우에서 사용되었습니다. 이 파일을 다운로드하려면 여기를 클릭해 주세요.
보충 표 1. 웹 기반 가이드라인 목차 페이지에서 추출한 URL 목록과 의료 정보 또는 비의료 정보 분류 정보. JLCS 폐암 환자 및 가족 가이드북의 목차에서 추출한 URL은 수동으로 검토되어 의료 정보 또는 비의료 정보로 분류되었습니다. 의료 정보는 임상 질문(CQ), 배경 질문, 문제 세트, 환자 안내와 관련된 보조 교육 자료를 포함한 참고 가능한 지침 내용으로 정의되었습니다. 비의료 정보에는 사회 또는 조직 웹페이지, 내비게이션 페이지, 하이퍼링크 및 챗봇 응답 생성에 참고 정보가 아닌 기타 부가 콘텐츠가 포함되었습니다. 이 표는 추출된 모든 URL과 그 분류 결과를 요약합니다. *URL은 JLCS 폐암 환자 및 가족 가이드북 목차 페이지(https://www.haigan.gr.jp/public/guidebook/2024/)에서 추출하였습니다. 이 파일을 다운로드하려면 여기를 클릭해 주세요.
본 연구에서는 웹 기반 임상 진료 가이드라인인 JLCS 폐암 환자 및 가족 가이드북을 참고 정보 출처로 사용하는 가이드라인 기반 RAG 챗봇의 유용성을 검토했습니다. 챗봇은 가이드라인의 웹 구조를 활용해 사용자 쿼리와의 유사성을 바탕으로 페이지를 검색하여 지침 내용에 기반한 응답을 생성했습니다. 이 접근법은 유사성 기반 검색과 가이드라인 참조 응답 생성이 신뢰할 수 있고 효율적인 의료 정보 전달을 지원할 수 있음을 입증했습니다. 최근 연구들은 LLM 기반 의료 챗봇의 잠재력과 한계, 특히 환각과 반응 신뢰성 측면에서 부각시켰습니다12, 13, 14. 이전 연구들이 일반 챗봇 프레임워크10, 12, 13에 초점을 맞춘 것과 달리, 본 프로토콜은 URL 수준에서 환자 가이드라인 콘텐츠를 검색하고 식별 가능한 참조 정보를 기반으로 응답을 생성하는 재현 가능한 가이드라인 기반 RAG 접근법을 보여줍니다. 따라서 이 연구는 완전히 검증된 임상 챗봇 시스템이 아니라 암 정보 전달을 위한 투명한 프로토콜을 제공합니다.
전체 가이드라인 코퍼스로 AI를 학습시키는 대신, 시스템은 각 사용자 쿼리와 가장 관련 있는 CQ만 참조 정보로 선택했습니다(그림 1). 문제 텍스트와 각 CQ 간의 관련성은 프로그래밍 언어 기반의 코사인 유사도 계산과 TF–IDF 벡터 표현을 사용하여 정량적으로 평가되었습니다. 이러한 유사도 점수를 바탕으로 CQ는 관련성 순서대로 순위 매겨지고 선택되어, 주관적 판단에 의존하지 않고 가이드라인 내에서 적절한 정보원을 체계적으로 추출할 수 있게 되었습니다(표 1). 더 나아가, 검색된 CQ 텍스트를 연결해 AI에 함께 제시함으로써 응답 생성의 일관된 증거 기반을 유지하여 생성된 응답의 정확성과 맥락적 일관성을 향상시켰습니다. RAG 시스템에서 올바른 정보 생성은 정확하고 적절한 참조 출처에 매우 의존합니다14. 이 설계는 단일 CQ로는 충분히 다룰 수 없는 정보를 보완하여 보다 포괄적이고 임상적으로 타당한 답변을 도출하는 데 기여했습니다. 또한 RAG는 최신 CQ 콘텐츠를 유연하게 검색할 수 있게 하며, 근거 기반 의료 응용에 매우 적합합니다10,11. 지침 기반 RAG 접근법은 이전에11,18에서 설명되었으나, 현재 프로토콜은 환자 지향 가이드라인의 기존 CQ 기반 웹 구조를 주요 검색 프레임워크로 사용한다는 점에서 차이가 있습니다. 이 설계는 수작업 지식 기반 구축이나 모델 재학습 없이도 구현 가능한 투명하고 재현 가능한 워크플로우를 제공합니다.
중요하게도, 챗봇은 답변을 참고된 지침의 범위 내로 제한했다. 질문이 지침 내용 밖에 있을 경우, 시스템은 명시적으로 답변 생성을 자제하여 근거 없는 답변 위험을 줄였습니다. 코사인 유사성을 이용해 참조 선택을 제어함으로써 생성된 응답의 안전성과 신뢰성이 더욱 향상되었습니다(표 2). 가이드라인 범위를 벗어난 질문에 대해서는 참고문헌 페이지도 검색되었습니다(표 3). 코사인 유사도 값은 범위 내 질문에서 0.20–0.65로 더 높았고, 범위 외 질문에서는 0.20–0.31; 데이터 미표기), 임상적으로 관련 없는 내용에도 일부 가이드라인 페이지에는 낮은 유사도 점수가 부여되었습니다. 이는 코사인 유사도가 쿼리와 가이드라인 텍스트 간의 키워드 매칭만을 기준으로 계산되었기 때문입니다. 중요하게도, 이러한 관련 낮은 참고문헌들은 부적절한 응답으로 이어지지 않았는데, 충분한 참고 정보가 없을 때 챗봇이 답변을 생성하지 않았기 때문입니다. 정의된 시험 조건 하에서 수동 검토 중 환각은 발견되지 않았습니다. 예비 검사 중 경험적으로 0.2의 코사인 유사성 임계값을 선택하여 검색 민감도와 특이도를 균형 있게 조정하였습니다. 이 임계값은 현재 시험 조건에서 효과적이었으나, 임계값 민감도에 대한 체계적 평가는 본 프로토콜 연구의 범위를 벗어났습니다. 향후 연구에서는 더 큰 벤치마크 데이터셋과 정량적 검색 지표를 사용하여 대체 임계값 설정의 효과를 조사해야 합니다. 관찰된 행동은 RAG 기반 출력 제어가 의료 AI 응용 분야에서 유용할 수 있음을 시사합니다. 하지만 현재 평가는 범위 내외 질문 수가 제한적이었으며, 주로 제안된 워크플로우의 개념 증명 평가를 목적으로 했습니다. 따라서 이 결과는 임상적 정확성, 안전성 또는 일반화 가능성에 대한 포괄적인 검증으로 해석되어서는 안 됩니다.
이 연구에는 몇 가지 기술적 한계가 있습니다. 일본어 형태 분석기와 GPT-3.5-turbo-16k(반응 생성용 LLM)를 사용했습니다. LLM이 선택된 이유는 시스템 개발 당시 널리 이용 가능하고 안정적인 모델이었으며, 제안된 워크플로우의 재현 가능한 구현을 가능하게 했기 때문입니다. 형태학적 분석기와 LLM은 뚜렷한 특성을 가집니다; 따라서 모델이나 라이브러리의 선택은 정보 추출의 정확성과 생성된 응답의 내용 모두에 영향을 미친다22,23. 새로운 모델(예: GPT-4 또는 GPT-5 클래스 LLM)이 성능과 외부 타당도를 향상시킬 수 있지만, 대체 모델 평가는 본 프로토콜 연구의 범위를 벗어났습니다. 최신 LLM은 추론 능력, 지시 따르기, 응답 품질을 향상시킬 수 있으며; 그러나 본 연구의 주요 목적은 서로 다른 LLM의 성능을 비교하기보다는 가이드라인 기반 RAG 프레임워크의 실현 가능성을 평가하는 것이었습니다. 이러한 구성 요소의 추가 최적화는 보다 효율적이고 정확한 응답 생성을 가능하게 할 수 있으며, 이러한 발견의 일반화 가능성을 평가하기 위해서는 다양한 모델 구성을 이용한 검증이 필요합니다. 또한 본 프로토콜은 일본어 지침과 일본어 형태학적 분석을 바탕으로 개발되었습니다. TF–IDF 벡터화, 코사인 유사성, RAG를 기반으로 한 검색 프레임워크는 원칙적으로 언어 독립적이지만, 다른 언어로 구현하려면 언어별 텍스트 처리 도구와 검증이 필요합니다. 이 연구는 단일 가이드라인에 한정되어 서로 다른 가이드라인 구조의 직접 비교는 허용되지 않았지만, CQ 수준의 조직은 가이드라인 내용의 체계적 추출을 촉진하고 가이드라인 기반 RAG 챗봇의 참고 정보 구축을 지원했습니다. 특히, 각 CQ가 고유한 URL과 연관된 가이드라인의 웹 구조는 URL 수준에서 참조 콘텐츠의 효율적인 스크래핑과 조직을 가능하게 하는 데 중요한 실질적 역할을 했습니다. PDF 기반 문서나 CQ 수준 URL이 없는 웹사이트 등 다양한 형식을 가진 지침은 대체 세분화 및 검색 전략을 요구할 수 있습니다. 따라서 현재 워크플로우가 다른 가이드라인 구조와 의학 전문 분야로 일반화될 수 있는지는 아직 확립되지 않았습니다. 향후 연구에서는 이 접근법이 여러 질병, 가이드라인 형식, 정보원에 적용 가능한지 평가해야 합니다.
본 연구 결과는 가이드라인 참조 AI 시스템 설계에 실질적인 지침을 제공하며, 웹 기반 임상 가이드라인을 참조하는 가이드라인 기반 RAG 챗봇이 암 관련 의료 정보를 전달하는 도구로서 잠재력을 지니고 있음을 보여줍니다. 그러나 본 연구는 가이드라인 검색, 반응 생성, 반응 제한 메커니즘의 기술적 실현 가능성을 입증하기 위한 개념 증명 평가이며, 의료 정보 시스템의 공식적인 임상 검증으로 해석되어서는 안 됩니다. 임상 효과성, 안전성 및 사용자 결과는 평가되지 않았으며 향후 연구를 통해 확립될 예정입니다. 윤리적·사용자 안전 관점에서 보면, 지침에 근거된 정보로 응답을 제한하는 것은 근거 없거나 환각적인 응답의 위험을 줄일 수 있습니다. 하지만 과도한 거부 행동은 사용자 만족도와 유용성 인식을 저하시킬 수도 있습니다. 따라서 향후 연구에서는 안전과 사용성 간의 균형을 평가하면서 허위 정보에 대한 적절한 안전장치를 유지해야 합니다. 웹 기반 가이드라인의 정보 구조를 활용하고 사용자 질문에 집중된 답변을 제공함으로써, 이 시스템은 향후 의료 정보 전달에 AI를 적용할 수 있는 유용한 모델이 될 수 있습니다.
저자들은 상충하는 이해관계가 없다고 선언한다.
저자들은 가이드라인 기반 검색-증강 생성 챗봇 개발에 있어 광범위한 기술 지원을 제공한 이노우에 켄이치 박사(쇼난 메모리얼 병원 유방 센터)에게 감사를 표합니다. 저자들은 또한 이 논문에서 다루는 주제에 대해 귀중한 조언을 제공해 준 야마키 치카코 박사와 일본 국립암센터 암 통제 연구소(도쿄, 일본 ) 연구팀 전원에게 감사를 표합니다. 또한 저자들은 영어 편집에 대해 Editage에 감사를 표합니다. 이 연구는 보건 및 노동과학 연구 보조금(R6–암 통제–23EA1026)의 지원을 받았습니다.
```html
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| Beautiful Soup 4 (버전 4.12.3) | Beautiful Soup 프로젝트 | N/A | URL 추출 및 HTML 파싱에 사용되는 Python 라이브러리 |
| ChatGPT 버전 4o | OpenAI | N/A | 키워드 생성에 사용됨 |
| GPT-3.5-turbo | OpenAI | N/A | 응답 생성에 사용됨 |
| 폐암 환자 및 가족을 위한 JLCS 가이드북 | Japan Lung Cancer Society | N/A | 참조 정보로 사용되는 웹 기반 임상 실무 지침 |
| MeCab (버전 0.996) | MeCab 프로젝트 | N/A | 일본어 형태소 분석기 |
| OpenAI API | OpenAI | N/A | AI 기반 응답 생성에 사용됨 |
| Python (버전 3.12) | Python Software Foundation | N/A | 프로그래밍 환경 |
| Requests (버전 2.32.3) | Requests 프로젝트 | N/A | 웹페이지 검색에 사용되는 Python 라이브러리 |
| scikit-learn (버전 1.6.1) | scikit-learn 개발자들 | N/A | TF–IDF 벡터화 및 코사인 유사도 계산에 사용됨 |
| urllib.parse | Python Software Foundation | N/A | URL 정규화 및 결합에 사용되는 Python 라이브러리 |
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청