Methodenartikel

Entwicklung eines richtlinienbasierten Retrieval-Augmented Generation Chatbots, der webbasierte klinische Praxisrichtlinien für Krebs referenziert

DOI:

10.3791/71099

7. August 2026

In diesem Artikel

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dieses Protokoll beschreibt die Entwicklung und Bewertung eines richtlinienbasierten, abruf-augmentierten Generierungs-Chatbots, der Inhalte aus webbasierten klinischen Praxisrichtlinien für Krebs abruft und zusammenfasst, um referenzbasierte Antworten auf Nutzerfragen zu generieren.

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die weitverbreitete Verfügbarkeit medizinischer Informationen im Internet hat den Zugang zu gesundheitsbezogenem Wissen für Patienten verbessert; Allerdings hat sie auch die Exposition gegenüber ungenauen medizinischen Informationen erhöht. Die Krebsversorgung beinhaltet komplexe Informationen, was es Patienten erschwert, genaue und evidenzbasierte Quellen zu identifizieren. Große Sprachmodelle ermöglichen die natürliche Sprachinteraktion, erzeugen jedoch häufig Halluzinationen, was ihre Anwendung in der medizinischen Informationsvermittlung einschränkt. Retrieval-augmentierte Erzeugung (RAG) hat das Potenzial, diese Risiken zu mindern, indem sie Antworten in externen Referenzquellen verankert. Diese Studie beschreibt die Entwicklung und Bewertung eines richtlinienbasierten RAG-Chatbots, der öffentlich zugängliche, webbasierte klinische Praxisrichtlinien für Krebs verwendet. Das System extrahiert URLs aus den Inhaltsverzeichnis-Seiten einer Richtlinie, verarbeitet Seitentexte mittels morphologischer Analyse und Kosinusähnlichkeit basierend auf Begriffshäufigkeit und inverser Dokumentfrequenz und konstruiert Referenzinformationen aus hochrelevanten Seiten. Ein großes Sprachmodell verwendet diese Referenzen, um Antworten zu generieren, die auf Leitlinieninhalte beschränkt sind. Der JLCS-Leitfaden für Lungenkrebspatienten und -familien wurde als Referenzrichtlinie verwendet. Die Fragegruppen umfassten sowohl Krebsarten im Rahmen der Leitlinie als auch Krebstypen außerhalb des Scope zur Bewertung der Antwortkontrolle. Medizinische Informationen wurden erfolgreich aus den Inhaltsverzeichnissen extrahiert, wobei 98 % der extrahierten URLs referenzfähige medizinische Inhalte enthielten. Bei Fragen im Rahmen des Umfangs generierte der Chatbot Antworten durch Zusammenfassung der Leitlinieninhalte, und während der manuellen Überprüfung unter den definierten Testbedingungen wurden keine Halluzinationen festgestellt. Bei Fragen außerhalb des Themenbereichs lehnte der Chatbot konsequent eine Antwort ab und gab an, dass die verfügbaren Informationen unzureichend seien. Die Webstruktur der Richtlinie erleichterte ein effizientes Scraping und die Organisation von Referenzinhalten auf URL-Ebene. Dieses Protokoll bietet praktische Anleitungen für den Aufbau künstlicher Intelligenzsysteme, die medizinische Informationen mithilfe webbasierter klinischer Praxisrichtlinien liefern.

Einleitung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die weitverbreitete Nutzung des Internets und der sozialen Medien hat es Patienten erleichtert, medizinische Informationenzuzugreifen 1,2. Informationen zur Krebsversorgung sind oft komplex und umfangreich, was es Patienten besonders schwer macht, Quellen zu identifizieren, die genau, relevant und auf wissenschaftlichen Evidenzen basieren3. Obwohl Online-Ressourcen das Verständnis der Patienten fördern können, enthalten sie auch erhebliche Mengen falscher medizinischer Informationen3, die die Entscheidungen der Patienten bezüglich ihrer Versorgung negativ beeinflussen können4. Da krebsbezogene Fehlinformationen die Patientenergebnissebeeinflussen können 5, besteht ein wachsender Bedarf an künstlichen Intelligenzsystemen (KI), die einzelnen Nutzern helfen können, medizinische Informationen zu suchen, zusammenzufassen und zu interpretieren6.

Große Sprachmodelle (LLMs) ermöglichen es Nutzern, Informationen über natürliche Sprachkonversationzuzugreifen 7; Die Entstehung von Fehlinformationen (d. h. Halluzinationen) bleibt jedoch im medizinischen Bereich ein ernstes Problem 8,9,10,11. Eine wichtige Quelle für Fehlinformationen ist die Qualität und Genauigkeit der Trainingsdaten, die zur Entwicklung des Chatbots verwendet werden. Außerdem führt die statische Natur des Modelltrainings dazu, dass Wissen im Laufe der Zeit veraltet werden kann, was die Fähigkeit von LLMs einschränkt, aktuelle und kontextuell angemessene Informationen bereitzustellen12,13. Diese Einschränkungen unterstreichen die Bedeutung effektiver Wissensmanagement-Strategien, um sicherzustellen, dass die Antworten von Chatbots genau, relevant und aktuell bleiben. Insbesondere Systeme sind in medizinischen Einrichtungen, in denen sich Empfehlungen und Versorgungsstandards kontinuierlich weiterentwickeln, wünschenswert, die sich leicht auf aktuelle evidenzbasierte Ressourcen wie klinische Richtlinien beziehen können. Um diese Herausforderung zu bewältigen, hat die Retrieval-Augmented Generation (RAG), die Antworten erzeugt, indem sie Informationen aus externen Wissensquellen einbezieht, zunehmend Aufmerksamkeit erhalten: 10,13,14,15,16,17.

Obwohl RAG zunehmend auf medizinische Chatbots angewendet wird, wurde nur begrenzte Aufmerksamkeit darauf gelegt, wie klinische Praxisrichtlinien systematisch als Referenzinformationsquellen integriert werden sollten18. Viele klinische Praxisrichtlinien sind öffentlich im Internet verfügbar; es bleibt jedoch unklar, ob ihre bestehende Webstruktur direkt als Abrufrahmen für RAG-Systeme18 dienen kann. Darüber hinaus sind praktische Methoden zur Erstellung von Referenzinformationen ohne manuelle Wissensentwicklung noch nicht gut etabliert.

In dieser Studie wollten wir Designprinzipien für leitlinienbezogene KI-Systeme im medizinischen Bereich etablieren, indem wir einen leitlinienbasierten RAG-Chatbot entwickelt und evaluieren, der öffentlich verfügbare, webbasierte klinische Praxisrichtlinien für Krebs nutzt und so einen einfachen und zeitnahen Zugang zu leitlinienbasierten Informationen ermöglicht. Als Proof of Concept haben wir die technische Machbarkeit von Leitlinienabruf, Antwortgenerierung und Antwortbeschränkung unter Verwendung der bestehenden Webstruktur öffentlich zugänglicher klinischer Praxisrichtlinien bewertet, mit dem Ziel, ein reproduzierbares Entwicklungsprotokoll für leitlinienbezogene RAG-Systeme vorzuschlagen.

Protokoll

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diese Studie bezieht sich nicht auf menschliche Probanden ein, die Schutz vor Risiken benötigen, die mit der Forschung verbunden sind. Daher ist eine Überprüfung durch ein institutionelles Überprüfungsgremium gemäß den japanischen Ethikrichtlinien für medizinische Forschung mit menschlichen Probanden19 erforderlich. Diese Studie wird gemäß den Richtlinien20 der Transparent Reporting of a Multivariable Model for Individual Prognosis or Diagnosis (TRIPOD)-LLM berichtet.

Siehe Abbildung 1 für einen schematischen Überblick über das richtlinienbasierte RAG-Chatbot-Protokoll.

figure-protocol-1
Abbildung 1. Workflow des richtlinienbasierten Retrieval-Augmented Generation (RAG) Chatbot-Protokolls. Schematische Übersicht des richtlinienbasierten RAG-Chatbot-Workflows. URLs werden aus der Inhaltsverzeichnis-Seite einer webbasierten klinischen Praxisrichtlinie extrahiert und zur Erstellung von Referenzinformationen verwendet. Nutzeranfragen werden in Schlüsselwörter umgewandelt, und Webseiteninhalte werden durch Tokenisierung, Termfrequenz–inverse Dokumentfrequenzvektorisierung und Kosinusähnlichkeitsanalyse verarbeitet, um relevante Leitlinienseiten zu identifizieren. Ausgewählte Referenzinformationen werden integriert und in ein großes Sprachmodell bereitgestellt, um Antworten ausschließlich basierend auf dem referenzierten Leitlinieninhalt zu generieren. Das rechte Panel fasst die Bewertungselemente zusammen, die für extrahierte URLs, Referenzinformationen und Chatbot-Antworten verwendet wurden. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

1. Erstellung von Referenzinformationen aus webbasierten Richtlinien

  1. Extrahieren Sie alle URLs aus den Inhaltsverzeichnis-Seiten der webbasierten klinischen Leitlinien für die Ziel-Web-Praxis mit BeautifulSoup 4 (HTML-Parsing-Bibliothek), implementiert in der Programmiersprache Python (Version 3.12).
    HINWEIS: Implementierung des URL-Extraktionsskripts mit der Programmiersprache mit folgenden Paketen: HTML-Parsing-Bibliothek (Version 4.12.3) und Anfragen (Webseiten-Abrufbibliothek; Version 2.32.3). Installiere Pakete mit Pip. Der vollständige Quellcode für die URL-Extraktion ist in Supplementary File 1 bereitgestellt. Siehe die Materialtabelle für Details zur Software.
  2. Überprüfen Sie alle extrahierten URLs manuell, um den erfolgreichen Zugriff und die Relevanz der Ziel-Leitlinie für klinische Praxis zu bestätigen.
  3. Klassifizieren Sie jede URL so, dass sie medizinische oder nichtmedizinische Informationen enthält. Führen Sie die URL-Klassifizierung nach einem Autor durch (S.N.). durch.
    HINWEIS: Medizinische Informationen wurden als referenzfähige Leitlinieninhalte definiert, einschließlich klinischer Fragen (CQs), Hintergrundfragen und Fragestellen. Nichtmedizinische Informationen umfassten Links, Gesellschafts- oder Organisationsseiten sowie andere Zusatzinhalte, die nicht als Nachschlagewerk geeignet waren.
  4. Kompiliere die validierten URLs in ein Microsoft Excel-Arbeitsbuch (.xlsx Format), wobei pro Zeile eine URL aufgezeichnet wird. Speichere die resultierende URL-Liste als Eingabedatensatz für nachfolgende Textabrufe, Vorverarbeitung und Ähnlichkeitsanalysen.

2. Schlüsselwortgenerierung aus Nutzeranfragen

  1. Geben Sie die natürliche Sprachanfrage in ChatGPT ein (Generative Pre-trained Transformer, Version 4o; Schlüsselwort-Generierungsmodell).
  2. Fordert das Modell auf, zwei Schlüsselwörter zu extrahieren, die der Benutzeranfrage entsprechen.
  3. Verwenden Sie den folgenden Prompt, auf Japanisch geschrieben, für die Schlüsselwortgenerierung:
    "figure-protocol-2"
    (Englische Übersetzung: "Zwei Schlüsselwörter aus dem folgenden Text extrahieren.")
  4. Fügen Sie die natürliche Sprachanfrage des Nutzers dieser Anweisung an und senden Sie sie an das Keyword-Generierungsmodell zur Keyword-Generierung ein.
  5. Ändern Sie keine Modellparameter manuell. Führen Sie Keyword-Generierung mit den Standardeinstellungen des Keyword-Generierungsmodells durch.
  6. Generiere zwei Schlüsselwörter für jede Benutzeranfrage. Beibehalten Sie beide Schlüsselwörter ohne weitere Änderungen, Filterung oder manuelle Auswahl und verwenden Sie sie für spätere Ähnlichkeitsberechnungen.
  7. Speichere die generierten Schlüsselwörter in einem Microsoft Excel-Arbeitsbuch (.xlsx Format). Speichern Sie für jeden Datensatz die ursprüngliche Benutzeranfrage und die entsprechenden generierten Schlüsselwörter für eine spätere Ähnlichkeitsbasierte Abfrage.

3. Textverarbeitung und Ähnlichkeitsberechnung

  1. Rufen Sie den Volltextinhalt von jeder extrahierten URL mit der Webseitenabrufbibliothek und der HTML-Parsing-Bibliothek ab. Extrahiere Textinhalte aus der HTML-Quelle mit der Funktion BeautifulSoup get_text().
  2. Verarbeiten Sie den extrahierten Webseitentext und generierte Schlüsselwörter vor, indem Sie HTML-Tags und nicht-japanische Zeichen entfernen.
  3. Führen Sie eine japanische morphologische Analyse mit MeCab durch (Version 0.996; Japanischer morphologischer Analysator) mit dem Standardwörterbuch. Behalten Sie nur Substantive und fügen Sie sie zu einer raumbegrenzten Textfolge zusammen.
  4. Kombinieren Sie die generierten Schlüsselwörter zu einer einzigen Textfolge und wenden Sie die gleichen Vorverarbeitungs- und Tokenisierungsverfahren an, die auch für Webseitentexte verwendet werden.
  5. Erzeugen Sie Termfrequenz–inverse Dokumentfrequenz (TF–IDF)-Vektoren aus dem verarbeiteten Webseitentext und Schlüsselworttext mithilfe der TfidfVectorizer-Implementierung in der scikit-learn-Bibliothek (Version 1.6.1) mit Standardparametereinstellungen.
    HINWEIS: Alle TfidfVectorizer-Parameter wurden auf ihren Standardwerten belassen, und es wurden keine benutzerdefinierten Parametereinstellungen angewendet.
  6. Berechnen Sie die Kosinusähnlichkeit zwischen jedem Webseitenvektor und dem Schlüsselwortvektor mit der Kosinusähnlichkeitsfunktion.
  7. URLs in absteigender Reihenfolge nach Kosinus-Ähnlichkeitswerten zu rangieren. Wenden Sie keine zusätzlichen Entscheidungskriterien an.
  8. Wählen Sie Seiten mit einem Kosinus-Ähnlichkeitswert von ≥0,2 als Kandidatenreferenz aus.
    HINWEIS: Die Kosinusähnlichkeitsschwelle (0,2) wurde empirisch während der Systementwicklung gewählt, um Rückruf zu priorisieren und potenziell relevante Leitlinieninhalte nicht auszuschließen.
  9. Behalten Sie alle Kandidatenseiten, die die Ähnlichkeitsgrenze erfüllen.

4. Konstruktion von Referenzinformationen

  1. Extrahieren Sie nacheinander den Textinhalt der ausgewählten Seiten von oben in der Rangliste.
  2. Fügen Sie die extrahierten Texte zu einem einzigen Referenzdokument zusammen.
  3. Vor der Einreichung in das LLM ersetzen Sie Zeilenumbruch und aufeinanderfolgende Leerzeichen im Referenztext durch ein einzelnes Leerzeichen.
  4. Der zusammengekettete Referenztext wird auf die ersten 4.096 Zeichen abgekürzt, bevor er dem LLM bereitgestellt wird.
    HINWEIS: Das Abschneidungslimit basierte auf Zeichen und nicht auf Token. Eine Begrenzung von 4.096 Zeichen wurde empirisch gewählt, um sicherzustellen, dass die kombinierten Prompt- und Referenzinformationen innerhalb der Eingabekapazität des GPT-3.5-turbo-16k-Antwortgenerierungsmodells blieben.

5. KI-basierte Antwortgenerierung

  1. Stellen Sie die konstruierten Referenzinformationen und die ursprüngliche Benutzeranfrage über die Application Programming Interface (API) für das Response-Generierungsmodell bereit.
  2. Weisen Sie die KI anhand folgender Eingabeaufforderung (vollständig auf Japanisch verfasst), um sicherzustellen, dass die Antworten ausschließlich auf Basis der bereitgestellten Referenzinformationen generiert werden:
    "Du bist ein medizinischer Informationsassistent, der Krebspatienten Orientierung gibt. Erstellen Sie Antworten ausschließlich auf Grundlage der folgenden Referenzinformationen und verwenden Sie nicht Ihr eigenes Allgemeinwissen oder Ihre Begründung. Die Antworten sollten detailliert und leicht verständlich sein, etwa 500 Zeichen lang. Wenn die Referenzinformationen nicht genügend Informationen enthalten, um die Frage zu beantworten, antworten Sie mit: 'Es gibt nicht genügend Informationen im Text', ohne Spekulation oder Allgemeinwissen zu verwenden."
  3. Stellen Sie die Referenzinformationen und die Benutzeranfrage zusammen in einer einzigen Benutzernachricht bereit. Strukturiere die Eingabe als: "Referenzinformation: [Referenztext]" gefolgt von "Frage: [Benutzeranfrage]".
  4. Antworten werden mit dem Antwortgenerierungsmodell mit folgenden Einstellungen generiert: Temperatur = 0,1, maximale Ausgabelänge = 1.024 Token, n = 1 und Stopp = Nichts.
  5. Holen Sie sich die KI-generierte Antwort zur späteren Bewertung.
    HINWEIS: Reichen Sie die Referenzinformationen und die Benutzeranfrage als einzelne Benutzernachricht ein. Stellen Sie die Antwortgenerierungsbefehle separat als Systemnachricht bereit.

6. Referenzrichtlinie und Frageformulierung

  1. Wählen Sie das JLCS-Handbuch für Lungenkrebspatienten und -familien (Lung Guidebook)21, das online frei verfügbar ist, als Referenzinformation für das richtlinienbasierte RAG-Chatbot-System.
  2. Erstellen Sie zwei Kategorien von Bewertungsfragen basierend auf dem Krebstyp: thymische Tumore, die im Rahmen der Richtlinie fallen, und pädiatrisches Gliom, das außerhalb des Geltungsbereichs der referenzierten Informationen liegt.
  3. Formulieren Sie vier Fragen zu Diagnose und Behandlung für jede Krebsart:
    "Welche diagnostischen Methoden stehen für XX (z. B. thymische oder pädiatrische Gliom-) Tumore zur Verfügung?"
    "Was sind die pathologischen diagnostischen Ansätze für XX-Tumore?"
    "Welche Behandlungsmöglichkeiten gibt es für XX-Tumore?"
    "Welche chirurgischen Behandlungsmöglichkeiten gibt es bei XX-Tumoren?"
  4. Stellen Sie Fragen zu Krebsarten, die durch die referenzierte Webrichtlinie abgedeckt sind, an den Chatbot. Reichen Sie zum Beispiel eine Frage zur Thymustumordiagnose ein und verwenden Sie das Lungenhandbuch als Referenzinformation.
  5. Stellen Sie Fragen außerhalb des Referenzrichtliniens an den Chatbot, um seine Fähigkeit zu bewerten, externe oder nicht zusammenhängende Informationen zu verwenden. Reichen Sie zum Beispiel eine Frage zum pädiatrischen Gliom ein, während Sie das Lungenhandbuch als Referenz verwenden.
  6. Bewerten Sie jede Frage in einer unabhängigen Chatsitzung. Überzeugen Sie die Gesprächshistorie nicht zwischen den Fragen.
  7. Zeichnen Sie die KI-generierten Antworten für eine spätere Bewertung auf.

7. Bewertung der Antwort

  1. Führen Sie eine manuelle Überprüfung aller generierten Antworten durch.
  2. Bewerten Sie, ob jede Reaktion Halluzinationen enthält.
  3. Bewerten Sie, ob jede Antwort durch Informationen in der Referenzrichtlinie unterstützt wird.
    HINWEIS: Halluzinationen wurden definiert als Reaktionen, die nicht existierende Ereignisse, Namen oder Begriffe enthalten, die potenziell medizinischen Schaden verursachen könnten14. Alle generierten Antworten wurden von einem Autor mit 8 Jahren Erfahrung in einem Universitätskrankenhaus, einschließlich Patientenbetreuung und medizinischer Kommunikation für Krebspatienten, auf Genauigkeit und das Fehlen von Halluzinationen überprüft. Etwaige Unsicherheiten bezüglich der Antwortklassifikation wurden durch Gespräche mit einem Mitautor eines Arztes mit mehr als 20 Jahren Erfahrung in den Krebsinformationsdiensten am National Cancer Center Japan gelöst.
  4. Betrachten Sie eine Antwort nur als gestützt, wenn alle klinisch relevanten Aussagen direkt aus der abgerufenen Referenzrichtlinie bestätigt werden können, ohne zusätzliches Wissen oder nicht belegten Schlussfolgerungen zu erfordern.
  5. Klassifizieren Sie jede Antwort mit vordefinierten Ergebnislabels. Klassifizieren Sie Antworten, die nur Informationen enthalten, die durch die Referenzrichtlinie unterstützt werden, als "Halluzination fehlt". Klassifizieren Sie Antworten, die nicht belegte oder gefälschte Informationen enthalten, als "Halluzination vorhanden".

Ergebnisse

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Abrufbarkeit medizinischer Inhalte über Inhaltsverzeichnis-Seiten

Die Web-Scraping-Architektur sammelte URLs von der Inhaltsverzeichnis-Seite der Richtlinie. Aus dem Lungenhandbuch wurden 106 URLs aus der Inhaltsverzeichnisseite extrahiert, von denen 104 (98 %) medizinische Informationen enthielten (Ergänzende Tabelle 1). Die Wirksamkeit der Chatbot-Antworten basierend auf den Inhaltsseiten der Leitlinien wird in Tabelle 1 zusammengefasst. Der Chatbot erzeugte Antworten für alle vier klinischen Schlüsselwörter, wenn die Fragen innerhalb der Richtlinie lagen. Für die "thymische Tumordiagnose" und "pathologische Diagnose" wurden für jedes Schlüsselwort drei verwandte URLs extrahiert, und alle extrahierten URLs galten als wirksam (100 %). Für "Behandlungsmethoden" und "chirurgische Behandlung" wurden für jedes Schlüsselwort 15 URLs extrahiert, mit 14 wirksamen Elementen (93 %).

AbfrageSchlüsselwörterReferenzierte Inhaltselemente, nEffektive Referenzartikel,
n (%)
Welche diagnostischen Methoden stehen für thymische Tumore zur Verfügung?Thymische Tumordiagnose33 (100)
Welche pathologischen diagnostischen Ansätze gibt es für thymische Tumore?Thymische Tumorpathologie-Diagnose33 (100)
Welche Behandlungsmöglichkeiten stehen thymischen Tumoren zur Verfügung?Behandlungsmethoden für thymische Tumoren1514 (93)
Welche chirurgischen Behandlungsmöglichkeiten gibt es für thymische Tumoren?Thymische Tumorchirurgie1514 (93)

Tabelle 1: Inhalt der Referenzinformationen und Chatbot-Antworten basierend auf dem JLCS-Leitfaden für Lungenkrebspatienten und -familien. Zusammenfassung der Nutzeranfragen, generierter Schlüsselwörter, Anzahl der durch Ähnlichkeitsabruf identifizierten referenzierten Inhaltselemente und Anzahl der effektiven Referenzelemente mit medizinischen Informationen. Referenzierte Inhaltselemente stellen die Gesamtzahl der zugehörigen Webseiten dar, die auf URL-Ebene anhand jedes Schlüsselworts identifiziert wurden. Effektive Referenzelemente stellen die Anzahl und den Prozentsatz eindeutiger Webseiten dar, die medizinische Informationen enthalten, nachdem doppelte URLs und nichtmedizinische Webseiten ausgeschlossen wurden.

Chatbot-Antworten auf In-Scope-Fragen

Tabelle 2 zeigt die Antworten des Chatbots auf Fragen, die im Rahmen der bereitgestellten Richtlinie lagen. Wenn genügend Referenzinformationen verfügbar waren, generierte der Chatbot Antworten, indem er relevante Teile des Leitlinientextes zusammenfasste. Die generierten Antworten bestanden aus etwa 350 japanischen Zeichen. Während der manuellen Überprüfung unter den definierten Testbedingungen wurden keine Halluzinationen festgestellt. Für diese Aufgabenbereichsfragen unterstützten mehrere effektive referenzierte Aufgaben die Antwortgenerierung (Tabelle 1). Der erzeugte japanische Text wurde mit ChatGPT Version 5.2 ins Englische übersetzt und anschließend von den Ermittlern auf Genauigkeit und Konsistenz mit den ursprünglichen japanischen Antworten überprüft.

AbfrageAntwortenAnzahl der Charaktere
Welche diagnostischen Methoden stehen für thymische Tumore zur Verfügung?Die Diagnose von thymischen Tumoren erfordert sowohl bildgebende als auch pathologische Diagnostik. Zur bildgebenden Diagnose werden ein CT vom Brustkorb und ein Thorax-MRT durchgeführt. Thymom und thymisches Karzinom sind solide Tumore, die keine Luft- oder Flüssigkeitskomponenten im Tumor enthalten, und die Invasion in das umliegende normale Gewebe ist bei Thymom mild und bei thymischem Karzinom ausgeprägter. Wenn bildgebende Untersuchungen feststellen, dass keine Invasion in das umliegende Gewebe stattfindet oder keine Tumore weit entfernt von der primären Läsion (Metastasen) vorliegen, wird der Tumor operativ entfernt und eine pathologische Diagnose anhand der chirurgischen Probe durchgeführt. Wenn die chirurgische Resektion schwierig ist, wird eine CT-geführte Biopsie durchgeführt und eine Diagnose durch Entnahme eines Teils des Tumorgewebes gestellt. In der pathologischen Diagnostik werden Thymome nach dem Anteil normaler Lymphozyten im Tumor und der Morphologie der Tumorzellen klassifiziert, während thymische Karzinome detailliert nach histologischem Subtyp klassifiziert werden. Für die Bestimmung des klinischen Stadiums (Stadium) wird das Ausmaß der Ausbreitung der thymischen Tumorläsionen berücksichtigt, und die Tumore werden basierend auf drei Stufenklassifikationssystemen in Stadien I bis IV eingeteilt.366
Welche pathologischen diagnostischen Ansätze gibt es für thymische Tumore?Bei der pathologischen Diagnose von thymischen Tumoren erfolgt die pathologische Untersuchung, indem ein Teil oder das gesamte Tumorgewebe entnommen wird. Thymome werden in Subtypen wie Typ A und Typ AB eingeteilt, basierend auf dem Anteil normaler Lymphozyten im Tumor und der Morphologie der Tumorzellen. Im Gegensatz dazu ist das thymische Karzinom ein bösartiger Tumor, der durch zelluläre Atypien gekennzeichnet ist, und das Plattenepithelkarzinom ist der häufigste histologische Subtyp. Durch pathologische Diagnostik werden die biologischen Merkmale und das Ausmaß des Tumorfortschritts bewertet, was für die Auswahl geeigneter Behandlungsstrategien und die Vorhersage der Prognose nützlich ist. Darüber hinaus ermöglicht die pathologische Diagnose von thymischen Tumoren die Bestimmung des Krankheitsstadiums (Stadium) und liefert wichtige Informationen für die Behandlungsplanung. Das klinische Stufenverfahren wird nach drei Systemen klassifiziert – der Masaoka-Klassifikation, der Masaoka–Koga-Klassifikation und der UICC–TNM-Klassifikation – und Tumore werden in vier Stadien von Stadium I bis Stadium IV je nach Ausbreitung und Invasion des Tumors kategorisiert. Die pathologische Diagnose liefert unverzichtbare Informationen für die angemessene Behandlung und prognostische Bewertung thymischer Tumore.330
Welche Behandlungsmöglichkeiten stehen thymischen Tumoren zur Verfügung?Die Behandlungsmöglichkeiten für thymische Tumore umfassen chirurgische Behandlung (Chirurgie), Strahlentherapie und medikamentöse Therapie (Chemotherapie). Die Operation erfolgt als Eingriff, bei dem der Thymus zusammen mit dem Tumor vollständig entfernt wird, und bei Thymom ist möglicherweise keine weitere Behandlung erforderlich. Beim thymischen Karzinom kann eine postoperative Strahlentherapie hinzugefügt werden, wenn sich der Krebs auf das umliegende Gewebe ausgebreitet hat. Chemotherapie oder Chemoradiotherapie wird in Fällen durchgeführt, in denen die Operation schwierig ist oder bei Rückfällen oder entfernten Metastasen vorliegt, und diese werden als Teil der medikamentösen Behandlung eingesetzt. Zusätzlich wird bei fortgeschrittenem oder rezidivierendem thymischem Karzinom eine auf Chemotherapie ausgerichtete Behandlung durchgeführt, und bei Bedarf kann auch multimodale Therapie durchgeführt werden, die Chirurgie und Strahlentherapie kombiniert. Außerdem kann bei fortgeschrittenem oder wiederkehrendem thymischem Karzinom nach Chemotherapie Lenvatinib, ein molekularzielorientiertes therapeutisches Wirkstoff, eingesetzt werden. Die geeignete Kombination der Behandlungsmodalitäten wird entsprechend dem Krankheitszustand und dem klinischen Zustand des Patienten ausgewählt.342
Welche chirurgischen Behandlungsmöglichkeiten gibt es für thymische Tumoren?Die chirurgische Behandlung von thymischen Tumoren wird durchgeführt, wenn der Tumor als vollständig resektabel eingestuft wird. Bei der Operation ist es in der Regel gängige Praxis, die gesamte Thymus zusammen mit dem Tumor zu entfernen. Bei Thymom ist bei vollständiger Entfernung des Tumors keine zusätzliche Behandlung erforderlich. Im Gegensatz dazu kann bei thymischem Karzinom, wenn Krebs in umliegendes Gewebe vorliegt, eine adjuvante postoperative Strahlentherapie hinzugefügt werden. Wenn eine Operation als schwierig eingestuft wird, wird zunächst eine Chemotherapie oder Chemoradiotherapie durchgeführt, und anschließend wird eine Operation in Betracht gezogen, sofern dies machbar ist. Wenn keine Operation durchgeführt werden kann, kann die Chemotherapie oder Chemoradiotherapie fortgesetzt werden. Darüber hinaus kann selbst bei möglicher Operation eine postoperative Strahlentherapie oder Chemoradiotherapie zur Behandlung des Resttumors verabreicht werden, falls eine vollständige Resektion nicht möglich ist. Die chirurgische Behandlung wird entsprechend dem Tumortyp und dem Ausmaß des Krankheitsverlaufs ausgewählt.342

Tabelle 2: Antworten, die vom Guideline-Based Retrieval-Augmented Generation (RAG)-Chatbot basierend auf dem JLCS-Leitfaden für Lungenkrebspatienten und -familien generiert wurden. Repräsentative Antworten, die vom richtlinienbasierten RAG-Chatbot für Fragen zu thymischen Tumoren generiert werden, basierend auf Referenzinformationen aus dem JLCS Guidebook for Lung Cancer Patients and Families (https://www.haigan.gr.jp/public/guidebook/2024/). Die Tabelle enthält die Nutzeranfrage, die vom Chatbot generierte Antwort und die Antwortlänge. Die Zeichenanzahl wurde in den ursprünglichen japanischsprachigen Antworten gemessen, bevor sie mit ChatGPT Version 5.2 ins Englische übersetzt wurden.

Chatbot-Antworten auf außerhalb des Zuständigkeitsbereichs liegenden Fragen

Die Antworten des Chatbots auf Fragen, die außerhalb des Geltungshandbuchs lagen, sind in Tabelle 3 zusammengefasst. Obwohl für diese Fragen nur eine begrenzte Anzahl von Inhaltselementen referenziert wurde, stellte das Antwortgenerierungsmodell fest, dass die verfügbaren Referenzinformationen unzureichend waren, um eine evidenzbasierte Antwort zu erzeugen. Folglich gab der Chatbot Antworten zurück, die auf unzureichende Informationen für außerhalb des Bereichs liegende Anfragen hinwiesen. Die Anweisungen "Es gibt nicht genügend Informationen im Text" und "Es gibt keine Referenzen." waren vordefinierte Antworten, die im Systemprompt angegeben wurden. Erstere wurde zurückgegeben, wenn die abgerufenen Referenzinformationen nicht ausreichten, um die Frage zu beantworten, während letztere zurückgegeben wurde, wenn keine Referenzinformationen abgerufen wurden.

AbfrageSchlüsselwörterReferenzierte Inhaltselemente, nChatbot-Antwort
Welche diagnostischen Methoden stehen für das pädiatrische Gliom zur Verfügung?Diagnose eines pädiatrischen Glioms0Es gibt keine Referenzen.
Welche pathologischen diagnostischen Ansätze gibt es für das pädiatrische Gliom?Pathologische Diagnose des pädiatrischen Glioms13Der Text enthält nicht genügend Informationen.
Welche Behandlungsmöglichkeiten stehen für das pädiatrische Gliom zur Verfügung?Behandlungsmethoden für pädiatrische Gliom13Der Text enthält nicht genügend Informationen.
Welche chirurgischen Behandlungsmöglichkeiten gibt es für das pädiatrische Gliom?Pädiatrische Gliomchirurgie12Der Text enthält nicht genügend Informationen.

Tabelle 3: Chatbot-Antworten auf außerhalb des Themenbereichs liegende Fragen auf klinischer Frageebene, basierend auf dem JLCS-Leitfaden für Lungenkrebspatienten und -familien. Antworten, die vom richtlinienbasierten Retrieval-Augmented Generation (RAG)-Chatbot für Fragen außerhalb des Referenzrahmens generiert werden. Die Tabelle fasst Nutzeranfragen, generierte Schlüsselwörter, die Anzahl der durch ähnlichkeitsbasierten Abruf identifizierten referenzierten Inhaltselemente und die daraus resultierenden Chatbot-Antworten zusammen. Referenzierte Inhaltselemente stellen die Gesamtzahl der zugehörigen Webseiten dar, die auf URL-Ebene anhand jedes Schlüsselworts identifiziert wurden. Effektive Referenzaufgaben wurden für außerhalb des Zuständigkeitsbereichs liegenden Fragen nicht berechnet, da der abgerufene Inhalt keine für die beanspruchte Krankheit relevanten Informationen enthielt.

Ergänzende Akte 1. Python-Code für URL- und Textextraktion aus webbasierten klinischen Praxisrichtlinien. Der Code, der verwendet wird, um URLs und Webseitentexte aus den Inhaltsverzeichnissen webbasierter klinischer Praxisrichtlinien zu extrahieren. Die extrahierten URLs und Textinhalte wurden für die anschließende Textverarbeitung, Ähnlichkeitsanalyse und Referenzinformationskonstruktion im Guideline-Based Retrieval-Augmented Generation (RAG)-Chatbot-Workflow verwendet. Bitte klicken Sie hier, um diese Datei herunterzuladen.

Ergänzende Tabelle 1. Liste der URLs, die aus der webbasierten Inhaltsverzeichnis-Seite der Richtlinie extrahiert wurden, und deren Klassifizierung als medizinische oder nicht-medizinische Informationen. URLs , die aus der Inhaltsverzeichnis-Seite des JLCS-Leitfades für Lungenkrebspatienten und -familien extrahiert wurden, wurden manuell überprüft und als medizinische oder nicht-medizinische Informationen klassifiziert. Medizinische Informationen wurden als referenzierbare Leitlinieninhalte definiert, einschließlich klinischer Fragen (CQs), Hintergrundfragen, Fragestellungen und ergänzenden Bildungsmaterialien, die für die Patientenberatung relevant sind. Nicht-medizinische Informationen umfassten Gesellschafts- oder Organisationswebseiten, Navigationsseiten, Hyperlinks und andere ergänzende Inhalte, die nicht als Referenz für die Generierung von Antworten durch Chatbots verwendet wurden. Die Tabelle fasst alle extrahierten URLs und deren Klassifikationsergebnisse zusammen. *URLs wurden aus der Inhaltsverzeichnisseite des JLCS Guidebook for Lung Cancer Patients and Families extrahiert (https://www.haigan.gr.jp/public/guidebook/2024/). Bitte klicken Sie hier, um diese Datei herunterzuladen.

Diskussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

In dieser Studie untersuchten wir den Nutzen eines richtlinienbasierten RAG-Chatbots, der eine webbasierte klinische Praxisrichtlinie – den JLCS Guidebook for Lung Cancer Patients and Families – als Referenzinformationsquelle verwendete. Der Chatbot generierte Antworten, die auf den Inhalten der Leitlinie basierten, indem er die Webstruktur der Richtlinie ausnutzte und Seiten basierend auf deren Ähnlichkeit mit Nutzeranfragen abrufte. Dieser Ansatz zeigte, dass ähnlichkeitsbasierte Abrufe in Kombination mit richtlinienreferenzierter Antwortgenerierung eine zuverlässige und effiziente medizinische Informationsbereitstellung unterstützen können. Jüngste Studien haben sowohl das Potenzial als auch die Schwächen von LLM-basierten medizinischen Chatbots hervorgehoben, insbesondere hinsichtlich Halluzinationen und Reaktionszuverlässigkeit 12,13,14. Im Gegensatz zu früheren Studien, die sich auf allgemeine Chatbot-Frameworks 10,12,13 konzentrierten, zeigt das vorliegende Protokoll einen reproduzierbaren richtlinienbasierten RAG-Ansatz, der Patientenleitlinieninhalte auf URL-Ebene abruft und Antworten generiert, die auf identifizierbaren Referenzinformationen basieren. Diese Studie bietet daher ein transparentes Protokoll für die Bereitstellung von Krebsinformationen statt eines vollständig validierten klinischen Chatbot-Systems.

Anstatt die KI auf dem gesamten Leitlinienkorpus zu trainieren, wählte unser System nur die für jede Nutzeranfrage am relevantesten CQs als Referenzinformation aus (Abbildung 1). Die Relevanz zwischen dem Fragetext und jedem CQ wurde quantitativ mittels der auf Programmiersprache basierenden Kosinusähnlichkeitsberechnungen mit TF–IDF-Vektorrepräsentationen bewertet. Basierend auf diesen Ähnlichkeitswerten wurden CQs in absteigender Reihenfolge ihrer Relevanz bewertet und ausgewählt, was eine systematische Extraktion geeigneter Informationsquellen aus der Richtlinie ermöglichte, ohne sich auf subjektive Einschätzung zu verlassen (Tabelle 1). Darüber hinaus half das Anfügen der abgerufenen CQ-Texte und deren kollektive Präsentation der KI, eine konsistente Beweisgrundlage für die Antwortgenerierung zu bewahren und so die Genauigkeit und kontextuelle Kohärenz der generierten Antworten zu verbessern. In RAG-Systemen hängt die Erzeugung korrekter Informationen maßgeblich von genauen und geeigneten Referenzquellenab 14. Dieses Design ermöglichte es dem System, Informationen auszugleichen, die durch einen einzelnen CQ nicht ausreichend abgedeckt werden konnten, was zu umfassenderen und klinisch plausibleren Antworten beitrug. Darüber hinaus ermöglicht RAG einen flexiblen Abruf aktueller CQ-Inhalte und eignet sich gut für evidenzbasierte medizinische Anwendungen10,11. Obwohl richtlinienbasierte RAG-Ansätze bereits11,18 beschrieben wurden, unterscheidet sich das vorliegende Protokoll dadurch, dass es die bestehende CQ-basierte Webstruktur einer patientenorientierten Richtlinie als primären Rückrufrahmen verwendet. Dieses Design bietet einen transparenten und reproduzierbaren Workflow, der ohne manuelle Wissensbasis-Erstellung oder Modell-Neuschulung implementiert werden kann.

Wichtig ist, dass der Chatbot seine Antworten auf den Anwendungsbereich der referenzierten Richtlinie beschränkte. Wenn Fragen außerhalb des Leitlinieninhalts fielen, verzichtete das System ausdrücklich darauf, Antworten zu generieren, wodurch das Risiko nicht unterstützter Antworten verringert wurde. Die Verwendung von Kosinusähnlichkeit zur Auswahl der Kontrollreferenzen erhöhte die Sicherheit und Zuverlässigkeit der erzeugten Antworten weiter (Tabelle 2). Auch Referenzseiten wurden für Fragen außerhalb des Geltungsbereichs der Richtlinie abgerufen (Tabelle 3). Die Kosinus-Ähnlichkeitswerte waren für In-Scope-Fragen (0,20–0,65) höher als für Out-of-Scope-Fragen (0,20–0,31; Daten nicht gezeigt), aber niedrige Ähnlichkeitswerte wurden einigen Leitlinienseiten auch dann niedrige Ähnlichkeitswerte zugewiesen, selbst wenn der Inhalt nicht klinisch relevant war. Dies geschah, weil die Kosinusähnlichkeit ausschließlich auf der Grundlage der Schlüsselwortübereinstimmung zwischen der Anfrage und dem Leitlinientext berechnet wurde. Wichtig ist, dass diese niedrig relevanten Referenzen nicht zu unangemessenen Antworten führten, da der Chatbot darauf verzichtete, Antworten zu generieren, wenn nicht genügend Referenzinformationen verfügbar waren. Während der manuellen Überprüfung unter den definierten Testbedingungen wurden keine Halluzinationen festgestellt. Der Kosinus-Ähnlichkeitsschwellenwert von 0,2 wurde empirisch während der Voruntersuchung gewählt, um die Rückgewinnungssensitivität und Spezifität auszubalancieren. Obwohl dieser Schwellenwert unter den aktuellen Testbedingungen wirksam war, lag die systematische Bewertung der Schwellenwertempfindlichkeit außerhalb des Anwendungsbereichs dieser Protokollstudie. Zukünftige Studien sollten die Auswirkungen alternativer Schwellenwerte mit größeren Benchmark-Datensätzen und quantitativen Abrufkennzahlen untersuchen. Das beobachtete Verhalten deutet darauf hin, dass eine RAG-basierte Ausgangssteuerung in medizinischen KI-Anwendungen nützlich sein könnte. Die aktuelle Bewertung basierte jedoch auf einer begrenzten Anzahl von In- und Out-of-Scope-Fragen und war in erster Linie als Proof-of-Concept-Bewertung des vorgeschlagenen Arbeitsablaufs gedacht. Daher sollten die Ergebnisse nicht als umfassende Validierung der klinischen Genauigkeit, Sicherheit oder Generalisierbarkeit interpretiert werden.

Diese Studie hat mehrere technische Einschränkungen. Wir verwendeten den japanischen morphologischen Analysator und GPT-3.5-turbo-16k (LLM für die Antwortgenerierung). Das LLM wurde ausgewählt, weil es zur Zeit der Systementwicklung ein weit verbreitetes und stabiles Modell war und eine reproduzierbare Implementierung des vorgeschlagenen Arbeitsablaufs ermöglichte. Morphologische Analysatoren und LLMs haben unterschiedliche Merkmale; Daher beeinflusst die Wahl von Modellen oder Bibliotheken sowohl die Genauigkeit der Informationsextraktion als auch den Inhalt der generierten Antworten22,23. Obwohl neuere Modelle (z. B. GPT-4- oder GPT-5-Klassen LLMs) die Leistung undexterne Validität verbessern können, lag die Bewertung alternativer Modelle außerhalb des Rahmens der vorliegenden Protokollstudie. Neuere LLMs können verbesserte Denkfähigkeit, Instruktionsbefolgung und Antwortqualität bieten; das Hauptziel dieser Studie war jedoch, die Machbarkeit eines richtlinienbasierten RAG-Rahmens zu bewerten, anstatt die Leistung verschiedener LLMs zu vergleichen. Eine weitere Optimierung dieser Komponenten kann eine effizientere und genauere Antwortgenerierung ermöglichen, und eine Validierung mit verschiedenen Modellkonfigurationen ist notwendig, um die Generalisierbarkeit dieser Ergebnisse zu bewerten. Darüber hinaus wurde das vorliegende Protokoll unter Verwendung einer japanischsprachigen Richtlinie und einer japanischen morphologischen Analyse entwickelt. Obwohl das auf TF–IDF-Vektorisierung, Kosinusähnlichkeit und RAG basierende Abrufrahmen prinzipiell sprachunabhängig ist, würde die Implementierung in anderen Sprachen sprachspezifische Textverarbeitungswerkzeuge und Validierung erfordern. Obwohl diese Studie auf eine einzige Richtlinie beschränkt war und daher keinen direkten Vergleich verschiedener Leitlinienstrukturen erlaubt, erleichterte die CQ-Organisation systematische Extraktion der Leitlinieninhalte und unterstützte die Erstellung von Referenzinformationen für den richtlinienbasierten RAG-Chatbot. Insbesondere spielte die Webstruktur der Richtlinie – bei der jeder CQ mit einer einzigartigen URL verknüpft ist – eine wichtige praktische Rolle bei der Ermöglichung eines effizienten Scrapings und der Organisation von Referenzinhalten auf URL-Ebene. Richtlinien mit verschiedenen Formaten, einschließlich PDF-basierter Dokumente oder Websites ohne CQ-URLs, erfordern möglicherweise alternative Segmentierungs- und Abrufstrategien. Daher bleibt die Verallgemeinerbarkeit des aktuellen Arbeitsablaufs auf andere Leitlinienstrukturen und medizinische Fachrichtungen noch zu klären. Zukünftige Arbeiten sollten die Anwendbarkeit dieses Ansatzes auf mehrere Krankheiten, Leitlinienformate und Informationsquellen prüfen.

Die Ergebnisse dieser Studie bieten praktische Leitlinien zur Entwicklung von KI-Systemen zur Orientierungsreferenz und zeigen, dass ein richtlinienbasierter RAG-Chatbot, der webbasierte klinische Leitlinien referenziert, Potenzial als Werkzeug zur Vermittlung krebsbezogener medizinischer Informationen hat. Diese Studie stellt jedoch eine Proof-of-Concept-Bewertung dar, die darauf abzielt, die technische Machbarkeit von Leitlinienabruf, Reaktionsgenerierung und Reaktionseinschränkungsmechanismen aufzuzeigen und sollte nicht als formale klinische Validierung eines medizinischen Informationssystems interpretiert werden. Klinische Wirksamkeit, Sicherheit und Nutzerergebnisse wurden nicht bewertet und müssen in zukünftigen Studien noch geklärt werden. Aus ethischer und nutzersicherer Sicht kann die Beschränkung von Antworten auf von Leitlinien unterstützte Informationen das Risiko von nicht belegten oder halluzinierten Reaktionen verringern. Allerdings kann übermäßiges Ablehnungsverhalten auch die Nutzerzufriedenheit und die wahrgenommene Nützlichkeit verringern. Zukünftige Arbeiten sollten daher das Gleichgewicht zwischen Sicherheit und Benutzerfreundlichkeit bewerten und dabei angemessene Schutzmaßnahmen gegen Fehlinformationen aufrechterhalten. Durch die Nutzung der Informationsstruktur webbasierter Richtlinien und gezielte Antworten auf Nutzerfragen kann dieses System als nützliches Modell für zukünftige Anwendungen von KI in der medizinischen Informationsvermittlung dienen.

Offenlegungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren erklären keine konkurrierenden Interessen.

Danksagungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren danken Kenichi Inoue, MD, PhD (Shonan Memorial Hospital Breast Center), für seine umfangreiche technische Unterstützung bei der Entwicklung des richtlinienbasierten Retrieval-Augmented Generation-Chatbots. Die Autoren danken außerdem Chikako Yamaki, PhD, und allen Mitgliedern des Forschungsteams am Institute for Cancer Control des National Cancer Center Japan (Tokio, Japan) für ihre wertvollen Ratschläge zu dem in diesem Artikel behandelten Thema. Außerdem danken die Autoren Editage für die englischsprachige Redaktion. Diese Arbeit wurde durch ein Forschungsstipendium für Gesundheits- und Arbeitswissenschaften (R6–Cancer Control–23EA1026) unterstützt.

Materialien

```html

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
Beautiful Soup 4 (Version 4.12.3)Beautiful Soup-ProjektN/APython-Bibliothek zur URL-Extraktion und HTML-Analyse
ChatGPT Version 4oOpenAIN/AZur Generierung von Schlüsselwörtern verwendet
GPT-3.5-turboOpenAIN/AZur Generierung von Antworten verwendet
JLCS-Leitfaden für Lungenkrebspatienten und FamilienJapan Lung Cancer SocietyN/AWebbasierte klinische Praxisrichtlinie, die als Referenzinformation verwendet wird
MeCab (Version 0.996)MeCab-ProjektN/AJapanischer morphologischer Analysator
OpenAI APIOpenAIN/AZur Generierung von KI-basierten Antworten verwendet
Python (Version 3.12)Python Software FoundationN/AProgrammierumgebung
Requests (Version 2.32.3)Requests-ProjektN/APython-Bibliothek zur Webseitenabfrage
scikit-learn (Version 1.6.1)scikit-learn-EntwicklerN/AZur TF–IDF-Vektorisierung und Berechnung der Kosinus-Ähnlichkeit verwendet.
urllib.parsePython Software FoundationN/APython-Bibliothek zur URL-Normalisierung und -Verbindung
```

Referenzen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Helft PR, Hlubocky F, Daugherty CK. American oncologists' views of internet use by cancer patients: a mail survey of American Society of Clinical Oncology members. J Clin Oncol. 2003;21(5):942-947.
  2. Chen X, Siu LL. Impact of the media and the internet on oncology: survey of cancer patients and oncologists in Canada. J Clin Oncol. 2001;19(23):4291-4297.
  3. Goto Y, et al. Differences in the quality of information on the internet about lung cancer between the United States and Japan. J Thorac Oncol. 2009;4(7):829-833.
  4. Ogasawara R, et al. Reliability of cancer treatment information on the internet: observational study. JMIR Cancer. 2018;4(2):e10031.
  5. Johnson SB, Park HS, Gross CP, Yu JB. Complementary medicine, refusal of conventional cancer therapy, and survival among patients with curable cancers. JAMA Oncol. 2018;4(10):1375-1381.
  6. Rajpurkar P, Chen E, Banerjee O, Topol EJ. AI in health and medicine. Nat Med. 2022;28(1):31-38.
  7. The Lancet Digital Health. ChatGPT: friend or foe? Lancet Digit Health. 2023;5(3):e102.
  8. Huang L, et al. A survey on hallucination in large language models: principles, taxonomy, challenges, and open questions. arXiv. 2023;2311.05232.
  9. Ji Z, et al. Survey of hallucination in natural language generation. ACM Comput Surv. 2023;55(12):248.
  10. Yang R, et al. Retrieval-augmented generation for generative artificial intelligence in health care. npj Health Syst. 2025;2(2).
  11. Zakka C, et al. Almanac—retrieval-augmented language models for clinical medicine. NEJM AI. 2024;1(2):AIoa2300068.
  12. Chow JCL, Li K. Developing effective frameworks for large language model-based medical chatbots: insights from radiotherapy education with ChatGPT. JMIR Cancer. 2025;11:e66633.
  13. Chow JCL, Li K. Large language models in medical chatbots: opportunities, challenges, and the need to address AI risks. Information. 2025;16(7):549.
  14. Nishisako S, Higashi T, Wakao F. Reducing hallucinations and trade-offs in responses in generative AI chatbots for cancer information: development and evaluation study. JMIR Cancer. 2025;11:e70176.
  15. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  16. Gao Y, et al. Retrieval-augmented generation for large language models: a survey. arXiv. 2023;2312.10997.
  17. Jeong M, Sohn J, Sung M, Kang JJB. Improving medical reasoning through retrieval and self-reflection with retrieval-augmented large language models. Bioinformatics. 2024;40:i119-i129.
  18. Lewis M, et al. Grounding large language models in clinical evidence: a retrieval-augmented generation system for querying UK NICE clinical guidelines. arXiv. 2025;2510.02967.
  19. Ministry of Education, Culture, Sports, Science and Technology; Ministry of Health, Labour and Welfare; Ministry of Economy, Trade and Industry. Ethical guidelines for medical and biological research involving human subjects [Article in Japanese]. Ministry of Health, Labour and Welfare.
  20. Gallifant J, et al. The TRIPOD-LLM reporting guideline for studies using large language models. Nat Med. 2025;31:60-69.
  21. The Japanese Lung Cancer Society. JLCS Guidebook for Lung Cancer Patients and Families. Available at: https://www.haigan.gr.jp/public/guidebook/2024/. Accessed January 21, 2026.
  22. Liu M, et al. Evaluating the effectiveness of advanced large language models in medical knowledge: a comparative study using Japanese national medical examination. Int J Med Inform. 2025;193:105673.
  23. Kudo T, Yamamoto K, Matsumoto Y. Applying conditional random fields to Japanese morphological analysis. In: Proceedings of the 2004 Conference on Empirical Methods in Natural Language Processing. 2004:230-237.

Nachdrucke und Genehmigungen

Genehmigung beantragen, um den Text oder die Abbildungen dieses JoVE-Artikels zu verwenden

Genehmigung beantragen

Schlagwörter

MedizinAusgabe 234Ausgabe 234Leerer WertAusgabeGro e SprachmodelleRetrieval Augmented Generation RAGBereitstellung medizinischer InformationenSichere medizinische KIInformationsabruf

Verwandte Artikel