Artykuł metodologiczny

Opracowanie asystenta konwersacyjnego opartego na wytycznych, uzupełniającego informacje z sieci, odnoszącego się do internetowych wytycznych praktyki klinicznej dotyczących raka

DOI:

10.3791/71099

7 sierpnia 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ten protokół opisuje rozwój i ocenę chatbota z generowaniem opartym na odzyskiwaniu, który odzyskuje i podsumowuje treści z internetowych wytycznych praktyki klinicznej dotyczących raka, aby generować odpowiedzi oparte na referencjach na zapytania użytkowników.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Szeroka dostępność informacji medycznych w Internecie poprawiła dostęp pacjentów do wiedzy związanej ze zdrowiem; jednak zwiększyło to także narażenie na niedokładne informacje medyczne. Opieka nad chorymi na raka obejmuje złożone informacje, co utrudnia pacjentom identyfikację dokładnych i opartych na dowodach źródeł. Duże modele językowe umożliwiają interakcję w języku naturalnym, ale często generują halucynacje, co ogranicza ich zastosowanie w dostarczaniu informacji medycznych. Generowanie ulepszone o odwołania (RAG) ma potencjał do zmniejszenia tych ryzyk poprzez oparcie odpowiedzi na zewnętrznych źródłach referencyjnych. Niniejsze badanie opisuje opracowanie i ocenę przewodnika opartego na wytycznych, który korzysta z publicznie dostępnych, internetowych wytycznych praktyki klinicznej dotyczących raka. System wyodrębnia adresy URL ze stron zawierających spis treści wytycznych, przetwarza tekst stron za pomocą analizy morfologicznej i podobieństwa cosinusowego na podstawie częstości występowania terminów–odwrotnej częstości dokumentów, oraz konstruuje informacje referencyjne z wysoce istotnych stron. Duży model językowy wykorzystuje te odniesienia do generowania odpowiedzi ograniczanych do treści wytycznych. Jako wytyczna referencyjna została użyta Książeczka JLCS dla Pacjentów z Rakiem Płuc i Ich Rodzin. Zestawy pytań zawierały zarówno typy raka objęte wytycznymi, jak i typy raka nieobjęte wytycznymi, aby ocenić kontrolę odpowiedzi. Informacje medyczne zostały pomyślnie wyodrębnione ze stron zawierających spis treści, a 98% wyodrębnionych adresów URL zawierało referencyjną treść medyczną. W przypadku pytań objętych wytycznymi, chatbot generował odpowiedzi poprzez podsumowanie treści wytycznych i nie zidentyfikowano żadnych halucynacji podczas manualnej rewizji w zdefiniowanych warunkach testowych. W przypadku pytań nieobjętych wytycznymi, chatbot konsekwentnie odmawiał odpowiedzi i wskazywał, że dostępne informacje były niewystarczające. Struktura internetowa wytycznych ułatwiała efektywne skrobing i organizację treści referencyjnych na poziomie adresów URL. Ten protokół dostarcza praktycznych wskazówek dotyczących budowy systemów sztucznej inteligencji, które dostarczają informacji medycznych przy użyciu internetowych wytycznych praktyki klinicznej.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Szerokie wykorzystanie internetu i mediów społecznościowych ułatwiło pacjentom dostęp do informacji medycznych1,2. Informacje dotyczące opieki nad chorobą nowotworową są często złożone i rozległe, co sprawia, że szczególnie trudno jest pacjentom zidentyfikować źródła, które są dokładne, odpowiednie i oparte na dowodach naukowych3. Podczas gdy zasoby internetowe mogą wspierać zrozumienie przez pacjenta, zawierają również znaczne ilości niepoprawnych informacji medycznych3, co może negatywnie wpływać na decyzje pacjentów dotyczące ich opieki4. Ponieważ dezinformacja dotycząca chorób nowotworowych może wpływać na wyniki pacjentów5, rośnie potrzeba systemów sztucznej inteligencji (AI), które mogą pomóc indywidualnym użytkownikom w wyszukiwaniu, podsumowaniu i interpretacji informacji medycznych6.

Duże modele językowe (LLM) umożliwiają użytkownikom dostęp do informacji poprzez naturalną konwersację językową7; jednakże, generacja dezinformacji (tj. halucynacje) pozostaje poważnym problemem w dziedzinie medycznej8,9,10,11. Jednym z kluczowych źródeł dezinformacji jest jakość i dokładność danych treningowych wykorzystanych do opracowania chatbota. Ponadto, statyczna natura szkolenia modelu oznacza, że wiedza może stać się przestarzała z czasem, ograniczając zdolność LLM do dostarczania aktualnych i odpowiednich kontekstowo informacji12,13. Te ograniczenia podkreślają znaczenie skutecznych strategii zarządzania wiedzą, aby zapewnić, że odpowiedzi chatbota pozostają dokładne, odpowiednie i aktualne. W szczególności, systemy, które mogą szybko uzyskać dostęp i odwołać się do aktualnych opartych na dowodach zasobów, takich jak wytyczne dotyczące praktyki klinicznej, są pożądane w środowiskach medycznych, gdzie zalecenia i standardy opieki nieustannie ewoluują. Aby sprostać temu wyzwaniu, generacja wzbogacona o odzyskiwanie (RAG), która generuje odpowiedzi poprzez uwzględnienie informacji z zewnętrznych źródeł wiedzy, przyciąga coraz większą uwagę10,13,14,15,16,17.

Mimo że RAG jest coraz częściej stosowany w chatbotach medycznych, ograniczona uwaga została poświęcona na to, jak wytyczne dotyczące praktyki klinicznej powinny być systematycznie włączane jako źródła informacji referencyjnych18. Wiele wytycznych dotyczących praktyki klinicznej jest dostępnych publicznie w sieci; jednakże, nadal nie jest jasne, czy ich istniejąca struktura internetowa może bezpośrednio służyć jako struktura odzyskiwania dla systemów RAG18. Ponadto, praktyczne metody konstruowania informacji referencyjnych bez manualnego rozwoju bazy wiedzy nie zostały dobrze ustalone.

W niniejszym badaniu, dążyliśmy do ustanowienia zasad projektowych dla systemów AI odwołujących się do wytycznych w dziedzinie medycznej poprzez opracowanie i ocenę chatbota RAG opartego na wytycznych, który wykorzystuje publicznie dostępne, internetowe wytyczne dotyczące praktyki klinicznej w dziedzinie chorób nowotworowych, umożliwiając w ten sposób prosty i terminowy dostęp do informacji opartych na wytycznych. Jako dowód koncepcji, oceniliśmy techniczną wykonalność pobierania wytycznych, generowania odpowiedzi i ograniczenia odpowiedzi przy użyciu istniejącej struktury internetowej publicznie dostępnych wytycznych dotyczących praktyki klinicznej, z celem zaproponowania powtarzalnego protokołu rozwoju dla systemów RAG odwołujących się do wytycznych.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejsze badanie nie obejmuje osób, które wymagałyby ochrony przed ryzykiem związanym z badaniami. W związku z tym nie wymaga ono oceny przez instytucjonalną komisję bioetyczną zgodnie z japońskimi wytycznymi etycznymi dotyczącymi badań medycznych z udziałem ludzi19. Badanie to zostało opisane zgodnie z wytycznymi Transparent Reporting of a Multivariable Model for Individual Prognosis or Diagnosis (TRIPOD)-LLM20.

Schematyczny przegląd protokołu chatbota RAG opartego na wytycznych przedstawiono na Rysunku 1.

figure-protocol-1
Rysunek 1. Schemat protokołu chatbota opartego na generowaniu rozszerzonym o wyszukiwanie (RAG) w oparciu o wytyczne. Schematyczny przegląd przepływu pracy chatbota RAG opartego na wytycznych. Adresy URL są wyodrębniane ze strony spisu treści internetowych wytycznych praktyki klinicznej i służą do konstruowania informacji referencyjnych. Zapytania użytkowników są przekształcane w słowa kluczowe, a treść stron internetowych jest przetwarzana poprzez tokenizację, wektoryzację TF-IDF (częstość występowania terminu – odwrotna częstotliwość w dokumentach) oraz analizę podobieństwa cosinusowego w celu zidentyfikowania istotnych stron wytycznych. Wybrane informacje referencyjne są integrowane i przekazywane do dużego modelu językowego w celu generowania odpowiedzi opartych wyłącznie na treści przywołanych wytycznych. Prawy panel podsumowuje elementy oceny stosowane dla wyodrębnionych adresów URL, informacji referencyjnych oraz odpowiedzi chatbota. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

1. Przygotowanie informacji referencyjnych na podstawie wytycznych dostępnych w sieci

  1. Wyodrębnij wszystkie adresy URL ze stron spisu treści docelowych internetowych wytycznych praktyki klinicznej, korzystając z biblioteki BeautifulSoup 4 (biblioteka do parsowania HTML) zaimplementowanej w języku programowania Python (wersja 3.12).
    UWAGA: Zaimplementuj skrypt do wyodrębniania adresów URL w języku programowania z wykorzystaniem następujących pakietów: biblioteka do parsowania HTML (wersja 4.12.3) oraz requests (biblioteka do pobierania stron internetowych; wersja 2.32.3). Zainstaluj pakiety za pomocą pip. Pełny kod źródłowy do wyodrębniania adresów URL znajduje się w Pliku uzupełniającym 1. Szczegóły dotyczące oprogramowania podano w Tabeli materiałów.
  2. Ręcznie przejrzyj wszystkie wyodrębnione adresy URL, aby potwierdzić poprawny dostęp oraz ich istotność dla docelowych wytycznych praktyki klinicznej.
  3. Zaklasyfikuj każdy adres URL jako zawierający informacje medyczne lub niemedyczne. Klasyfikacji adresów URL dokonał jeden autor (S.N.).
    UWAGA: Informacje medyczne zdefiniowano jako treść wytycznych podlegającą cytowaniu, w tym pytania kliniczne (CQs), pytania tła oraz zestawy pytań. Informacje niemedyczne obejmowały linki, strony towarzystw lub organizacji oraz inne treści pomocnicze, które nie nadawały się do cytowania.
  4. Zestaw zweryfikowane adresy URL w skoroszycie programu Microsoft Excel (format .xlsx), zapisując jeden adres URL w każdym wierszu. Przechowuj powstałą listę adresów URL jako zbiór danych wejściowych do późniejszego pobierania tekstu, wstępnego przetwarzania i analizy podobieństwa.

2. Generowanie słów kluczowych z zapytań użytkowników

  1. Wprowadź zapytanie w języku naturalnym do ChatGPT (Generative Pre-trained Transformer, wersja 4o; model generowania słów kluczowych).
  2. Poproś model o wyodrębnienie dwóch słów kluczowych odpowiadających zapytaniu użytkownika.
  3. Do generowania słów kluczowych użyj następującego polecenia napisanego w języku japońskim:
    "figure-protocol-2"
    (Tłumaczenie na język angielski: „Extract two keywords from the following text.”)
  4. Do powyższej instrukcji dołącz zapytanie użytkownika w języku naturalnym i prześlij je do modelu generowania słów kluczowych.
  5. Nie modyfikuj ręcznie żadnych parametrów modelu. Generowanie słów kluczowych przeprowadź przy użyciu domyślnych ustawień modelu.
  6. Wygeneruj dwa słowa kluczowe dla każdego zapytania użytkownika. Zachowaj oba słowa kluczowe bez dalszych modyfikacji, filtrowania czy ręcznego wyboru i wykorzystaj je w kolejnych obliczeniach podobieństwa.
  7. Zapisz wygenerowane słowa kluczowe w skoroszycie programu Microsoft Excel (format .xlsx). Dla każdego wpisu zapisz oryginalne zapytanie użytkownika oraz odpowiadające mu wygenerowane słowa kluczowe w celu późniejszego wyszukiwania opartego na podobieństwie.

3. Przetwarzanie tekstu i obliczanie podobieństwa

  1. Pobierz pełną treść tekstową z każdego wyodrębnionego adresu URL, korzystając z biblioteki do pobierania stron internetowych oraz biblioteki do parsowania HTML. Wyodrębnij treść tekstową ze źródła HTML za pomocą funkcji get_text() biblioteki BeautifulSoup.
  2. Przeprowadź wstępne przetwarzanie wyodrębnionego tekstu stron internetowych oraz wygenerowanych słów kluczowych poprzez usunięcie tagów HTML i znaków innych niż japońskie.
  3. Wykonaj analizę morfologiczną języka japońskiego przy użyciu MeCab (wersja 0.996; analizator morfologiczny języka japońskiego) z domyślnym słownikiem. Zachowaj wyłącznie rzeczowniki i połącz je w ciąg tekstowy rozdzielony spacjami.
  4. Połącz wygenerowane słowa kluczowe w jeden ciąg tekstowy i zastosuj te same procedury wstępnego przetwarzania i tokenizacji, które zostały użyte dla tekstu stron internetowych.
  5. Wygeneruj wektory częstości terminu w stosunku do odwrotnej częstości w dokumentach (TF–IDF) z przetworzonego tekstu stron internetowych oraz tekstu słów kluczowych, korzystając z implementacji TfidfVectorizer w bibliotece scikit-learn (wersja 1.6.1) z domyślnymi ustawieniami parametrów.
    UWAGA: Wszystkie parametry TfidfVectorizer pozostały w wartościach domyślnych i nie zastosowano żadnych niestandardowych ustawień.
  6. Oblicz podobieństwo cosinusowe między każdym wektorem strony internetowej a wektorem słów kluczowych, korzystając z funkcji podobieństwa cosinusowego.
  7. Uszereguj adresy URL w kolejności malejącej według wyników podobieństwa cosinusowego. Nie stosuj dodatkowych kryteriów rozstrzygających w przypadku remisów.
  8. Wybierz strony z wynikiem podobieństwa cosinusowego ≥0,2 jako kandydackie informacje referencyjne.
    UWAGA: Próg podobieństwa cosinusowego (0,2) został wybrany empirycznie podczas opracowywania systemu, aby nadać priorytet pełności odzyskiwania danych (recall) i uniknąć wykluczenia potencjalnie istotnych treści wytycznych.
  9. Zachowaj wszystkie strony kandydackie spełniające próg podobieństwa.

4. Konstrukcja informacji referencyjnych

  1. Kolejno wyekstrahuj treść tekstową wybranych stron z górnej części rankingu.
  2. Połącz wyekstrahowane teksty w jeden dokument referencyjny.
  3. Przed przekazaniem do modelu LLM zastąp znaki nowej linii oraz następujące po sobie znaki białych spacji w tekście referencyjnym pojedynczą spacją.
  4. Odetnij połączony tekst referencyjny do pierwszych 4,096 znaków przed udostępnieniem go modelowi LLM.
    UWAGA: Limit ucięcia oparto na liczbie znaków, a nie tokenów. Limit 4,096 znaków wybrano empirycznie, aby zapewnić, że połączony prompt i informacje referencyjne zmieściły się w pojemności wejściowej modelu generowania odpowiedzi GPT-3.5-turbo-16k.

5. Generowanie odpowiedzi oparte na AI

  1. Przekaż przygotowane informacje referencyjne oraz oryginalne zapytanie użytkownika do modelu generującego odpowiedzi za pośrednictwem interfejsu programistycznego aplikacji (API).
  2. Instruuj AI za pomocą poniższego promptu (napisanego w całości w języku japońskim), aby zapewnić generowanie odpowiedzi wyłącznie na podstawie dostarczonych informacji referencyjnych:
    “You are a medical information assistant who provides guidance to cancer patients. Generate responses based solely on the following reference information, and do not use your own general knowledge or reasoning. Responses should be detailed and easy to understand, approximately 500 characters in length. If the reference information does not contain sufficient information to answer the question, respond with: ‘There is insufficient information in the text,’ without using any speculation or general knowledge.”
  3. Przekaż informacje referencyjne i zapytanie użytkownika razem w jednej wiadomości użytkownika. Strukturuj dane wejściowe w następujący sposób: „Reference Information: [tekst referencyjny]”, a następnie „Question: [zapytanie użytkownika]”.
  4. Generuj odpowiedzi za pomocą modelu generującego odpowiedzi z następującymi ustawieniami: temperature = 0.1, maximum output length = 1,024 tokens, n = 1 oraz stop = None.
  5. Pobierz odpowiedź wygenerowaną przez AI do późniejszej oceny.
    UWAGA: Prześlij informacje referencyjne i zapytanie użytkownika jako jedną wiadomość użytkownika. Dostarcz instrukcje generowania odpowiedzi oddzielnie jako wiadomość systemową.

6. Wytyczne referencyjne i formułowanie pytań

  1. Jako informacje referencyjne dla systemu chatbota RAG opartego na wytycznych, wybierz JLCS Guidebook for Lung Cancer Patients and Families (Lung Guidebook)21, który jest dostępny bezpłatnie online.
  2. Utwórz dwie kategorie pytań ewaluacyjnych w zależności od rodzaju nowotworu: guzy grasicy, które mieszczą się w zakresie wytycznych, oraz glejak u dzieci, który wykracza poza zakres informacji referencyjnych.
  3. Sformułuj cztery pytania dotyczące diagnostyki i leczenia dla każdego rodzaju nowotworu:
    „Jakie metody diagnostyczne są dostępne w przypadku guzów XX (np. grasicy lub glejaka u dzieci)?”
    „Jakie podejścia do diagnostyki patomorfologicznej stosuje się w przypadku guzów XX?”
    „Jakie opcje leczenia są dostępne w przypadku guzów XX?”
    „Jakie opcje leczenia chirurgicznego są dostępne w przypadku guzów XX?”
  4. Prześlij do chatbota pytania dotyczące rodzajów nowotworów objętych referencyjnymi wytycznymi internetowymi. Na przykład zadaj pytanie dotyczące diagnostyki guzów grasicy, używając Lung Guidebook jako informacji referencyjnej.
  5. Prześlij do chatbota pytania wykraczające poza zakres referencyjnych wytycznych, aby ocenić jego zdolność do powstrzymania się od korzystania z informacji zewnętrznych lub niezwiązanych z tematem. Na przykład zadaj pytanie dotyczące glejaka u dzieci, używając Lung Guidebook jako informacji referencyjnej.
  6. Oceń każde pytanie w oddzielnej sesji czatu. Nie przenoś historii rozmowy między pytaniami.
  7. Zapisz odpowiedzi wygenerowane przez AI do późniejszej ewaluacji.

7. Ocena odpowiedzi

  1. Przeprowadzić ręczną weryfikację wszystkich wygenerowanych odpowiedzi.
  2. Ocenić, czy każda odpowiedź zawiera halucynacje.
  3. Ocenić, czy każda odpowiedź jest poparta informacjami zawartymi w wytycznych referencyjnych.
    UWAGA: Halucynacje zdefiniowano jako odpowiedzi zawierające nieistniejące zdarzenia, nazwiska lub terminy, które potencjalnie mogłyby spowodować szkody medyczne14. Wszystkie wygenerowane odpowiedzi zostały zweryfikowane pod kątem dokładności i braku halucynacji przez jednego autora z 8-letnim doświadczeniem w szpitalu uniwersyteckim, obejmującym wsparcie pacjentów oraz komunikację medyczną z pacjentami onkologicznymi. Wszelkie wątpliwości dotyczące klasyfikacji odpowiedzi rozstrzygano w drodze dyskusji z lekarzem współautorem z ponad 20-letnim doświadczeniem w usługach informacyjnych dla pacjentów onkologicznych w National Cancer Center Japan.
  4. Odpowiedź uznano za popartą jedynie wtedy, gdy wszystkie klinicznie istotne stwierdzenia mogą zostać bezpośrednio potwierdzone w pobranych wytycznych referencyjnych, bez konieczności posiadania dodatkowej wiedzy lub stosowania niepopartego wnioskowania.
  5. Zaklasyfikować każdą odpowiedź przy użyciu zdefiniowanych etykiet wyników. Odpowiedzi zawierające wyłącznie informacje poparte wytycznymi referencyjnymi zaklasyfikowano jako „brak halucynacji”. Odpowiedzi zawierające niepoparte lub zmyślone informacje zaklasyfikowano jako „obecność halucynacji”.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dostępność treści medycznych za pomocą stron z spisem treści

Architektura web-scraping zbierała adresy URL z strony ze spisem treści wytycznych. Z Książki Płuc wyodrębniono 106 adresów URL ze strony ze spisem treści, z których 104 (98%) zawierały informacje medyczne (Dodatek Tabela 1). Skuteczność odpowiedzi chatbota opartych na stronach treści wytycznych podsumowano w Tabeli 1. Chatbot generował odpowiedzi dla wszystkich czterech słów kluczowych dotyczących klinicznych, gdy pytania mieściły się w zakresie wytycznych. W przypadku „rozpoznania guza tymusowego” i „rozpoznania patologicznego” wyodrębniono po trzy powiązane adresy URL dla każdego słowa kluczowego, a wszystkie wyodrębnione adresy URL uznano za skuteczne (100%). W przypadku „metod leczenia” i „leczenia chirurgicznego” wyodrębniono 15 adresów URL dla każdego słowa kluczowego, przy czym 14 pozycji było skutecznych (93%).

PytanieSłowa kluczowePrzypisane elementy treści, nSkuteczne przypisane elementy,
n (%)
Jakie metody diagnostyczne są dostępne w przypadku guzów tymusowych?Rozpoznanie guza tymusowego33 (100)
Jakie są podejścia diagnostyczne w przypadku guzów tymusowych?Rozpoznanie patologiczne guza tymusowego33 (100)
Jakie opcje leczenia są dostępne w przypadku guzów tymusowych?Metody leczenia guza tymusowego1514 (93)
Jakie są opcje leczenia chirurgicznego guzów tymusowych?Leczenie chirurgiczne guza tymusowego1514 (93)

Tabela 1: Treść informacji referencyjnych i odpowiedzi chatbota na podstawie Książki JLCS dla pacjentów z rakiem płuca i ich rodzin. Podsumowanie pytań użytkowników, wygenerowanych słów kluczowych, liczby przypisanych elementów treści zidentyfikowanych na podstawie odnośności oraz liczby skutecznych przypisanych elementów zawierających informacje medyczne. Przypisane elementy treści reprezentują całkowitą liczbę powiązanych stron internetowych zidentyfikowanych na poziomie URL na podstawie każdego słowa kluczowego. Skuteczne przypisane elementy reprezentują liczbę i procent unikalnych stron zawierających informacje medyczne po wykluczeniu duplikatów adresów URL i stron niemedycznych.

Odpowiedzi chatbota na pytania w zakresie wytycznych

Tabela 2 przedstawia odpowiedzi chatbota na pytania, które mieściły się w zakresie dostarczonych wytycznych. Gdy dostępne informacje referencyjne były wystarczające, chatbot generował odpowiedzi poprzez podsumowanie odpowiednich części tekstu wytycznych. Wygenerowane odpowiedzi składały się z około 350 znaków japońskich. Podczas ręcznej rewizji w zdefiniowanych warunkach testowych nie zidentyfikowano żadnych halucynacji. Dla tych pytań w zakresie wytycznych wiele skutecznych przypisanych elementów wsparło generowane odpowiedzi (Tabela 1). Wygenerowany tekst w języku japońskim został przetłumaczony na język angielski za pomocą wersji 5.2 modelu ChatGPT, a następnie przejrzany przez badaczy pod kątem dokładności i spójności z oryginalnymi odpowiedziami w języku japońskim.

PytanieOdpowiedziLiczba znaków
Jakie metody diagnostyczne są dostępne w przypadku guzów tymusowych?Rozpoznanie guzów tymusowych wymaga zarówno rozpoznania obrazowego, jak i rozpoznania patologicznego. W przypadku rozpoznania obrazowego wykonuje się tomografię komputerową klatki piersiowej i rezonans magnetyczny klatki piersiowej. Guz tymusowy i rak tymusowy to guzy stałe, które nie zawierają składników powietrznych lub płynnych wewnątrz guza, a nawałka w tkanki otaczające jest znana jako lekka w guzie tymusowym i bardziej zauważalna w raku tymusowym. Gdy badania obrazowe stwierdzają, że nie ma nawałki w tkankach otaczających lub nie ma guzów oddalonych od pierwotnej zmiany (przerzuty), guz jest chirurgicznie resekowany, a rozpoznanie patologiczne jest wykonywane za pomocą preparatu chirurgicznego. Gdy resekcja chirurgiczna jest trudna, wykonuje się biopsję pod kontrolą TK, a rozpoznanie jest ustalone przez uzyskanie części tkanki guza. W rozpoznaniu patologicznym guzy tymusowe są klasyfikowane na podstawie proporcji normalnych limfocytów wewnątrz guza i morfologii komórek nowotworowych, podczas gdy rak tymusowy jest klasyfikowany szczegółowo według podtypu histologicznego. W celu ustalenia stadiowania klinicznego (stadium) bierze się pod uwagę stopień rozprzestrzenienia zmian guzów tymusowych, a guzy są klasyfikowane w stadiach od I do IV na podstawie trzech systemów klasyfikacji stadiowania.366
Jakie są podejścia diagnostyczne w przy

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W tej studii zbadaliśmy przydatność chatbota RAG opartego na wytycznych, który korzystał z internetowej wytycznej dotyczącej praktyki klinicznej—Przewodnika JLCS dla Pacjentów z Rakiem Płuca i Ich Rodzin—jako źródła informacji referencyjnych. Chatbot generował odpowiedzi oparte na treści wytycznych poprzez wykorzystanie struktury internetowej wytycznych i pobieranie stron na podstawie ich podobieństwa do pytań użytkowników. Takie podejście wykazało, że pobieranie na podstawie podobieństwa w połączeniu z generowaniu odpowiedzi opartych na wytycznych może wspierać niezawodne i efektywne dostarczanie informacji medycznych. Ostatnie badania podkreśliły zarówno potencjał, jak i ograniczenia chatbotów medycznych opartych na LLM, szczególnie w odniesieniu do halucynacji i niezawodności odpowiedzi12,13,14. W przeciwieństwie do poprzednich badań, które koncentrowały się na ogólnych strukturach chatbotów10,12,13, obecny protokół demonstruje wykonalny i powtarzalny podejście RAG oparte na wytycznych, które pobiera treści pacjent-wytyczne na poziomie URL i generuje odpowiedzi oparte na identyfikowalnych informacjach referencyjnych. Niniejsze badanie zapewnia więc przejrzysty protokół dostarczania informacji o raku, a nie w pełni zweryfikowany system chatbota klinicznego.

Zamiast uczyć sztucznej inteligencji na całym korpusie wytycznych, nasz system wybierał tylko pytania CQ najbardziej istotne dla każdego zapytania użytkownika jako informacje referencyjne (Rysunek 1). Relacja między tekstem pytania a każdym CQ była kwantowana za pomocą obliczeń podobieństwa kątowego opartych na języku programowania z reprezentacjami wektorowymi TF–IDF. Na podstawie tych wyników podobieństwa, CQ były rangowane i wybierane w malejącej kolejności istotności, umożliwiając systematyczne wyciąganie odpowiednich źródeł informacji z wytycznych bez konieczności opierania się na subiektywnym osądzie (Tabela 1). Ponadto, łączenie pobranego tekstu CQ i przedstawianie ich łącznie AI pomogło zachować spójną bazę dowodową dla generowanych odpowiedzi, poprawiając tym samym dokładność i spójność kontekstową wygenerowanych odpowiedzi. W systemach RAG, generacja poprawnych informacji zależy krytycznie od dokładnych i odpowiednich źródeł referencyjnych14. Ta konstrukcja pozwoliła systemowi na rekompensatę informacji, które nie mogły być wystarczająco opisane przez pojedyncze CQ, przyczyniając się do bardziej kompleksowych i klinicznie wiarygodnych odpowiedzi. Dodatkowo, RAG umożliwia elastyczne pobieranie aktualnej treści CQ i jest dobrze przystosowany do zastosowań medycznych opartych na dowodach10,11. Chociaż podejścia RAG oparte na wytycznych zostały wcześniej opisane11,18, obecny protokół różni się użyciem istniejącej struktury webowej opartej na CQ wytycznych pacjent-zorientowanych jako podstawowej ramy pobierania. Ta konstrukcja zapewnia przejrzysty i powtarzalny proces, który może być zaimplementowany bez konieczności manualnej budowy bazy wiedzy lub ponownego trenowania modelu.

Ważne jest, że chatbot ograniczał swoje odpowiedzi do zakresu odniesionych wytycznych. Kiedy pytania wyszły poza treść wytycznych, system wyraźnie powstrzymywał się od generowania odpowiedzi, zmniejszając tym samym ryzyko niepotwierdzonych odpowiedzi. Zastosowanie podobieństwa kątowego do kontroli selekcji referencji zwiększyło dalsze bezpieczeństwo i niezawodność wygenerowanych odpowiedzi (Tabela 2). Strony referencyjne były również pobieranie dla pytań poza zakresem wytycznych (Tabela 3). Wartości podobieństwa kątowego były wyższe dla pytań w zakresie (0,20–0,65) niż dla pytań poza zakresem (0,20–0,31; dane nie pokazane), ale niskie wyniki podobieństwa nadal były przypisywane niektórym stronom wytycznych, nawet gdy treść nie była klinicznie istotna. Stało się tak, ponieważ podobieństwo kątowe było obliczane wyłącznie na podstawie dopasowania słów kluczowych między zapytaniem a tekstem wytycznych. Ważne jest, że te referencje o niskiej istotności nie skutkowały niewłaściwymi odpowiedziami, ponieważ chatbot powstrzymywał się od generowania odpowiedzi, gdy nie było wystarczającej informacji referencyjnej. Podczas manualnej rewizji w zdefiniowanych warunkach testowych nie zidentyfikowano żadnych halucynacji. Próg podobieństwa kątowego wynoszący 0,2 został dobrany empirycznie podczas wstępnych testów, aby zbilansować wrażliwość i specyficzność pobierania. Chociaż ten próg był skuteczny w obecnych warunkach testowych, systematyczna ocena wrażliwości progu wykraczała poza zakres niniejszej studii protokolu. Przyszłe badania powinny zbadać wpływ alternatywnych ustawień progów za pomocą większych zestawów danych bazowych i metryk pobierania ilościowych. Zaobserwowane zachowanie sugeruje, że kontrola wyjścia oparta na RAG może być użyteczna w zastosowaniach sztucznej inteligencji w medycynie. Jednak obecna ocena była oparta na ograniczonym zakresie pytań w zakresie i poza zakresem i miała być przede

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie deklarują żadnych konfliktów interesów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy dziękują Kenichi Inoue, MD, PhD (Shonan Memorial Hospital Breast Center), za jego rozległe wsparcie techniczne w rozwoju chatbotu opartego na wytycznych i wzbogaconej reprezentacji. Autorzy dziękują również Chikako Yamaki, PhD, oraz wszystkim członkom zespołu badawczego w Instytucie Kontroli Raka, Narodowego Centrum Onkologii Japonii (Tokio, Japonia), za cenną poradę na temat zawartego w niniejszej pracy tematu. Dodatkowo autorzy dziękują Editage za edycję językową angielską. Ta praca została wsparta grantem naukowym z zakresu Zdrowia i Pracy (R6–Cancer Control–23EA1026).

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Beautiful Soup 4 (wersja 4.12.3)Beautiful Soup ProjectN/ABiblioteka Pythonu używana do wyciągania URL i parsowania HTML
ChatGPT wersja 4oOpenAIN/AUżywany do generowania słów kluczowych
GPT-3.5-turboOpenAIN/AUżywany do generowania odpowiedzi
JLCS Guidebook for Lung Cancer Patients and FamiliesJapan Lung Cancer SocietyN/AKliniczna wytyczna dostępna w sieci używana jako informacja referencyjna
MeCab (wersja 0.996)MeCab ProjectN/AJapoński morfologiczny analizator
OpenAI APIOpenAIN/AUżywany do generowania odpowiedzi opartych na AI
Python (wersja 3.12)Python Software FoundationN/AŚrodowisko programistyczne
Requests (wersja 2.32.3)Requests ProjectN/ABiblioteka Pythonu używana do pobierania stron internetowych
scikit-learn (wersja 1.6.1)scikit-learn DevelopersN/AUżywany do wektoryzacji TF–IDF i obliczania podobieństwa cosinusowego.
urllib.parsePython Software FoundationN/ABiblioteka Pythonu używana do normalizacji URL i łączenia

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Helft PR, Hlubocky F, Daugherty CK. American oncologists' views of internet use by cancer patients: a mail survey of American Society of Clinical Oncology members. J Clin Oncol. 2003;21(5):942-947.
  2. Chen X, Siu LL. Impact of the media and the internet on oncology: survey of cancer patients and oncologists in Canada. J Clin Oncol. 2001;19(23):4291-4297.
  3. Goto Y, et al. Differences in the quality of information on the internet about lung cancer between the United States and Japan. J Thorac Oncol. 2009;4(7):829-833.
  4. Ogasawara R, et al. Reliability of cancer treatment information on the internet: observational study. JMIR Cancer. 2018;4(2):e10031.
  5. Johnson SB, Park HS, Gross CP, Yu JB. Complementary medicine, refusal of conventional cancer therapy, and survival among patients with curable cancers. JAMA Oncol. 2018;4(10):1375-1381.
  6. Rajpurkar P, Chen E, Banerjee O, Topol EJ. AI in health and medicine. Nat Med. 2022;28(1):31-38.
  7. The Lancet Digital Health. ChatGPT: friend or foe? Lancet Digit Health. 2023;5(3):e102.
  8. Huang L, et al. A survey on hallucination in large language models: principles, taxonomy, challenges, and open questions. arXiv. 2023;2311.05232.
  9. Ji Z, et al. Survey of hallucination in natural language generation. ACM Comput Surv. 2023;55(12):248.
  10. Yang R, et al. Retrieval-augmented generation for generative artificial intelligence in health care. npj Health Syst. 2025;2(2).
  11. Zakka C, et al. Almanac—retrieval-augmented language models for clinical medicine. NEJM AI. 2024;1(2):AIoa2300068.
  12. Chow JCL, Li K. Developing effective frameworks for large language model-based medical chatbots: insights from radiotherapy education with ChatGPT. JMIR Cancer. 2025;11:e66633.
  13. Chow JCL, Li K. Large language models in medical chatbots: opportunities, challenges, and the need to address AI risks. Information. 2025;16(7):549.
  14. Nishisako S, Higashi T, Wakao F. Reducing hallucinations and trade-offs in responses in generative AI chatbots for cancer information: development and evaluation study. JMIR Cancer. 2025;11:e70176.
  15. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  16. Gao Y, et al. Retrieval-augmented generation for large language models: a survey. arXiv. 2023;2312.10997.
  17. Jeong M, Sohn J, Sung M, Kang JJB. Improving medical reasoning through retrieval and self-reflection with retrieval-augmented large language models. Bioinformatics. 2024;40:i119-i129.
  18. Lewis M, et al. Grounding large language models in clinical evidence: a retrieval-augmented generation system for querying UK NICE clinical guidelines. arXiv. 2025;2510.02967.
  19. Ministry of Education, Culture, Sports, Science and Technology; Ministry of Health, Labour and Welfare; Ministry of Economy, Trade and Industry. Ethical guidelines for medical and biological research involving human subjects [Article in Japanese]. Ministry of Health, Labour and Welfare.
  20. Gallifant J, et al. The TRIPOD-LLM reporting guideline for studies using large language models. Nat Med. 2025;31:60-69.
  21. The Japanese Lung Cancer Society. JLCS Guidebook for Lung Cancer Patients and Families. Available at: https://www.haigan.gr.jp/public/guidebook/2024/. Accessed January 21, 2026.
  22. Liu M, et al. Evaluating the effectiveness of advanced large language models in medical knowledge: a comparative study using Japanese national medical examination. Int J Med Inform. 2025;193:105673.
  23. Kudo T, Yamamoto K, Matsumoto Y. Applying conditional random fields to Japanese morphological analysis. In: Proceedings of the 2004 Conference on Empirical Methods in Natural Language Processing. 2004:230-237.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

MedycynaNumer 234Numer 234Warto pustaNumerDu e modele j zykoweGenerowanie wspomagane wyszukiwaniem RAGDostarczanie informacji medycznychBezpieczna sztuczna inteligencja w medycynieWyszukiwanie informacji

Powiązane artykuły