Этот протокол описывает разработку и оценку чат-бота поколения с дополненным поиском на основе рекомендаций, который извлекает и суммирует контент из веб-рекомендаций по клинической практике рака для генерации ответов на пользовательские запросы.
Для просмотра этого контента требуется подписка на JoVE. Войдите или начните свой бесплатный пробный период.
Методическая статья
Этот протокол описывает разработку и оценку чат-бота поколения с дополненным поиском на основе рекомендаций, который извлекает и суммирует контент из веб-рекомендаций по клинической практике рака для генерации ответов на пользовательские запросы.
Широкое распространение медицинской информации в Интернете улучшило доступ пациентов к медицинским знаниям; однако это также увеличило риск неточной медицинской информации. Лечение рака включает сложную информацию, что затрудняет пациентам выявление точных и основанных на доказательствах источников. Крупные языковые модели позволяют взаимодействовать с естественным языком, но часто вызывают галлюцинации, ограничивая их применение в передаче медицинской информации. Генерация, дополненная за счёт поиска (RAG), может снизить эти риски, закрепляя реакции на внешних источниках. В данном исследовании описывается разработка и оценка чат-бота RAG на основе рекомендаций, который использует общедоступные веб-рекомендации по клинической практике рака. Система извлекает URL-адреса из страниц оглавления руководства, обрабатывает текст страницы с помощью морфологического анализа и косинусного сходства на основе частоты терминов и обратной частоты документа, а также формирует справочную информацию на основе высокорелевантных страниц. Большая языковая модель использует эти ссылки для генерации ответов, ограниченных содержимым рекомендаций. Руководство JLCS для пациентов и их их семей с раком лёгких использовалось в качестве справочного руководства. Наборы вопросов включали как типы рака, охваченные руководством, так и внесферные типы рака для оценки контроля реакции. Медицинская информация была успешно извлечена из страниц оглавления, при этом 98% извлечённых URL содержали ссылаемый медицинский контент. Для вопросов внутри тематики чат-бот генерировал ответы, суммируя содержание рекомендаций, и при ручном рассмотрении галлюцинаций в условиях определённого теста не было выявлено. На вопросы, выходящие за рамки контекста, чат-бот постоянно отказывался отвечать и указывал, что доступной информации недостаточно. Веб-структура руководства способствовала эффективному сбору и организации референсного контента на уровне URL. Этот протокол предоставляет практические рекомендации по созданию систем искусственного интеллекта, которые предоставляют медицинскую информацию с использованием веб-рекомендаций клинической практики.
Широкое использование интернета и социальных сетей упростило пациентам доступ к медицинской информации 1,2. Информация о лечении рака часто бывает сложной и обширной, что особенно затрудняет пациентам определение точных, релевантных и основанных на научных доказательствахисточников 3. Хотя онлайн-ресурсы могут помочь понять пациента, они также содержат значительное количество неверноймедицинской информации 3, что может негативно повлиять на решения пациентов поуходу 4. Поскольку дезинформация, связанная с раком, может влиять на исходыпациентов 5, растёт потребность в системах искусственного интеллекта (ИИ), которые помогают отдельным пользователям искать, резюмировать и интерпретировать медицинскуюинформацию 6.
Крупные языковые модели (LLM) позволяют пользователям получать доступ к информации через разговор наестественном языке 7; Однако генерация дезинформации (то есть галлюцинаций) остаётся серьёзной проблемой вмедицине 8,9,10,11. Одним из ключевых источников дезинформации является качество и точность обучающих данных, используемых для разработки чат-бота. Кроме того, статический характер обучения моделей приводит к тому, что знания со временем могут устаревать, ограничивая способность LLM предоставлять актуальную и контекстно соответствующую информацию12,13. Эти ограничения подчёркивают важность эффективных стратегий управления знаниями, чтобы ответы чат-ботов оставались точными, актуальными и актуальными. В частности, в медицинских учреждениях, где рекомендации и стандарты ухода постоянно развиваются, являются системы, способные легко получать доступ и ссылаться на актуальные научно обоснованные ресурсы, такие как руководство клинической практики. Для решения этой проблемы всё больше внимания привлекает генерация с дополненным поиском (RAG), которая генерирует ответы путем включения информации из внешних источниковзнаний 10,13,14,15,16,17.
Хотя RAG всё чаще применяется к медицинским чат-ботам, мало внимания уделяется тому, как клинические рекомендации должны систематически внедряться в качестве источников справочнойинформации 18. Многие рекомендации по клинической практике доступны в интернете; однако остаётся неясным, может ли их существующая веб-структура напрямую служить рамкам для поиска системRAG 18. Кроме того, практические методы построения справочной информации без ручной разработки базы знаний не были хорошо развиты.
В этом исследовании мы стремились установить принципы проектирования систем ИИ с ссылкой на рекомендации в медицинской сфере, разработав и оценив чат-бота RAG на основе рекомендаций, который использует общедоступные веб-рекомендации по клинической практике рака, что обеспечивает простой и своевременный доступ к информации, основанной на рекомендациях. В качестве доказательства концепции мы оценили техническую осуществимость извлечения рекомендаций, генерации ответов и ограничения ответа, используя существующую веб-структуру общедоступных клинических рекомендаций с целью предложить воспроизводимый протокол разработки для систем RAG, ссылающихся на рекомендации.
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
В этом исследовании не участвуют люди, которым требуется защита от рисков, связанных с исследованиями. Таким образом, он не требует рассмотрения институциональным экспертным советом согласно японским этическим рекомендациям для медицинских исследований с участием людей19. Данное исследование представлено в соответствии с рекомендациями Transparent Reporting of a Multivariable Model for Individual Prognosis or Diagnosis (TRIPOD)-LLM 20.
См. рисунок 1 для схемного обзора протокола чат-бота RAG на основе руководств.

Рисунок 1. Рабочий процесс протокола чат-бота на основе рекомендаций (RAG). Схематический обзор рабочего процесса чат-бота RAG, основанного на рекомендациях. URL-адреса извлекаются со страницы оглавления веб-руководства клинической практики и используются для создания справочной информации. Пользовательские запросы преобразуются в ключевые слова, а содержимое веб-страницы обрабатывается с помощью токенизации, векторизации частоты терминов и обратной частоты документа и анализа косинусного сходства для выявления релевантных страниц с рекомендациями. Выбранная справочная информация интегрируется и предоставляется в большую языковую модель для генерации ответов исключительно на основе содержимого руководства. Правая панель обобщает элементы оценки, используемые для извлеченных URL, информации о ссылках и ответов чат-ботов. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
1. Подготовка справочной информации на основе веб-рекомендаций
2. Генерация ключевых слов из пользовательских запросов
"3. Обработка текста и расчёт сходства
4. Построение справочной информации
5. Генерация ответов на основе ИИ
6. Руководство по ссылкам и формулировка вопросов
7. Оценка реакции
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
Возможность получения медицинского контента через страницы содержания
Архитектура веб-скрейпинга собирала URL-адреса со страницы оглавления руководства. Из Руководства по лёгким было извлечено 106 URL-адресов со страницы оглавления, из которых 104 (98%) содержали медицинскую информацию (Дополнительная таблица 1). Эффективность ответов чат-ботов, основанных на страницах с содержанием рекомендаций, изложена в Таблице 1
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
В этом исследовании мы рассмотрели полезность чат-бота RAG на основе рекомендаций, который использовал веб-руководство по клинической практике — JLCS Guidebook for Lumng Cancer Patients and Families — в качестве источника справочной информации. Чат-бот генерировал ответы, основанные на содержании руководства, используя веб-структуру руководства и получая страницы на основе их сходства с пользовательскими запросами. Этот подход показал, что извлечение на основе сходства в сочетании с гене...
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
Авторы не заявляют о конкурирующих интересах.
Авторы благодарят Кеничи Иноуэ, доктора медицины, доктора философии (Центр молочной железы Мемориальной больницы Shonan Memorial) за его обширную техническую поддержку в разработке чат-бота поколения с дополненным поиском на основе рекомендаций. Авторы также благодарят Чикако Ямаки, доктора философии, и всех членов исследовательской команды Института контроля рака Национального онкологического центра Японии (Токио, Япония) за ценные советы по теме, рассматриваемой в этой статье. Кроме того, авторы благодарят Editage за редактирование на английском языке. Эта работа была поддержана грантом на исследования в области здравоохранения и труда (R6–Cancer Control–23EA1026).
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
| Имя | Компания | Каталожный номер | Комментарии |
|---|---|---|---|
| Beautiful Soup 4 (версия 4.12.3) | Проект Beautiful Soup | N/A | Библиотека Python, используемая для извлечения URL и разбора HTML |
| ChatGPT версия 4o | OpenAI | N/A | Используется для генерации ключевых слов |
| GPT-3.5-turbo | OpenAI | N/A | Используется для генерации ответов |
| Руководство JLCS для пациентов с раком легкого и их семей | Общество рака легкого Японии | N/A | Веб-ориентированное руководство по клинической практике, используемое в качестве справочной информации |
| MeCab (версия 0.996) | Проект MeCab | N/A | Японский морфологический анализатор |
| API от OpenAI | OpenAI | N/A | Используется для генерации ответов на основе ИИ |
| Python (версия 3.12) | Фонд программного обеспечения Python | N/A | Программная среда |
| Requests (версия 2.32.3) | Проект Requests | N/A | Библиотека Python, используемая для получения веб-страниц |
| scikit-learn (версия 1.6.1) | Разработчики scikit-learn | N/A | Используется для векторизации TF–IDF и вычисления косинусной схожести. |
| urllib.parse | Фонд программного обеспечения Python | N/A | Библиотека Python, используемая для нормализации и объединения URL |
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.