$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Klinische Fallberichte (CCRs) sind ein grundlegendes Mittel des Teilens, Beobachtungen und Erkenntnisse in der Medizin. Diese dienen als grundlegenden Mechanismus der Kommunikation und Ausbildung für Ärzte und Medizinstudenten. In der Vergangenheit haben CCRs auch Konten von neu auftretenden Krankheiten, ihre Behandlung und ihre genetische Hintergründe1,2,3,4zur Verfügung gestellt. Beispielsweise berichtet die erste Behandlung der menschlichen Tollwut durch Louis Pasteur im Jahre 18855,6 und die erste Anwendung von Penicillin bei Patienten7 waren beide durch CCRs. Mehr als 1,87 Millionen CCRs wurden ab April 2018, mit mehr als 500.000 innerhalb der letzten Dekade veröffentlicht; Zeitschriften sind, neue Gelegenheiten für diese Berichte8fort. Obwohl einzigartig in Form und Inhalt, CCRs enthalten, die weitgehend unstrukturierten Textdaten enthalten ein umfangreiches Vokabular und betreffen zusammenhängende Phänomene, ihre Verwendung als strukturierte Ressource zu beschränken. Erheblicher Aufwand ist erforderlich, um detaillierte Metadaten extrahieren (z.B. "Daten über Daten", oder in diesem Fall, Beschreibungen der Dokumentinhalte) von CCRs und als ein auffindbares, zugänglich, interoperable und wiederverwendbar (FAIR)9 -Daten zu etablieren Ressource.
Hier beschreiben wir einen Prozeß für das Extrahieren von Text und numerische Werte, die Beschreibung der spezifischen biomedizinische Konzepte im veröffentlichten CCRs zu standardisieren. Diese Methode beinhaltet eine Metadatenvorlage, Anmerkung zu führen; siehe Abbildung 1 für einen Überblick über diesen Prozess. Anwendung des Verfahrens Anmerkung zu einer großen Sammlung von Berichten (z. B. mehrere tausend eines bestimmten Typs von Krankheit Präsentation) erlaubt Montage einer überschaubar und strukturierte Gruppe von kommentierten klinischen Texte, maschinenlesbar zu erreichen Dokumentation und biomedizinische Phänomene in jeder klinischen Präsentation eingebettet. Obwohl wie HL7 Datenformate (z.B.., Version 3 von der Messaging-Standard10 oder schnell Healthcare Interoperabilität Ressourcen [FHIR]11), LOINC12und 10 Revision der internationalen statistischen Klassifikation der Krankheiten und verwandter Gesundheitsprobleme (ICD-10)13 bieten Standards für die Beschreibung und den Austausch von klinischen Beobachtungen, sie erfassen nicht den Text, um diese Daten, noch sollen sie. Die Ergebnisse unserer Methodik werden am besten zur Struktur auf CCRs durchzusetzen und die anschließende Analyse, Normalisierung durch kontrollierte Vokabulare und Kodierungen erleichtern (zB., ICD-10), bzw. Umstellung auf die oben aufgeführten klinischen Daten-Formate .
CCRs Bergbau ist ein aktives Gebiet der Arbeit innerhalb der biomedizinischen und klinischen Informatik. Obwohl frühere Vorschläge zur Standardisierung der Struktur der Berichte Fall (zB., mit HL7 v2. 514 oder standardisiert Phänotyp Terminologie15) sind lobenswert, es ist wahrscheinlich, dass CCRs weiterhin eine Vielzahl von verschiedenen Folgen Natürlich-sprachlichen Formen und Dokumentlayouts, wie sie für einen Großteil des vergangenen Jahrhunderts haben. Unter idealen Bedingungen folgen Autoren der neuen Fallberichte Pflege Leitlinien16 um sicherzustellen, dass sie umfassend sind. Ansätze zur medizinischen Konzepte empfindlich auf natürlicher Sprache und ihre Beziehung können daher am effektivsten in der Arbeit mit neuen und archivierte Berichte sein. Ressourcen wie Handwerk17 und diejenigen von Informatik für die Integration von Biologie und Krankenbett (i2b2)18 Kuration Verarbeitung natürlicher Sprache (NLP) Ansätze unterstützen noch nicht speziell Schwerpunkt CCRs oder klinischen Erzählungen. In ähnlicher Weise medizinische NLP-Tools wie cTAKES19 und Klemme20 wurden entwickelt, aber im allgemeinen identifiziert bestimmte Wörter oder Sätze (d.h., Entities) innerhalb von Dokumenten, anstatt die allgemeinen Konzepte, die häufig in CCRs beschrieben.
Wir haben eine standardisierte Metadatenvorlage CCRs üblicherweise enthaltenen Funktionen entwickelt. Diese Vorlage definiert Funktionen, um die Struktur auf CCRs verhängen — ein wesentlicher Vorläufer für detaillierte Vergleiche von Dokumentinhalt-noch sorgt für ausreichend Flexibilität, semantischen Kontext zu behalten. Obwohl wir diese Vorlage für manuelle Beschriftung und rechnerisch unterstützt Textmining geeignet zugeordnete Format entwickelt haben, haben wir dafür gesorgt, dass es für manuelle Kommentatoren besonders einfach zu bedienen ist. Unser Ansatz unterscheidet sich deutlich von komplizierter (und daher weniger für ungeübte sofort verständlich Forscher) Frameworks wie z. B. FHIR21. Das folgende Protokoll beschreibt die Dokumentfunktionen entspricht jede Vorlage Datentyp mit einem einzigen Satz von Werten, die in einem einzigen CCR entspricht zu isolieren.
Die Datentypen in der Vorlage sind die beschreibenden CCRs und patientenorientierte medizinische Unterlagen im Allgemeinen. Anmerkung dieser Funktionen fördert Auffindbarkeit, Zugänglichkeit, Interoperabilität und Wiederverwendbarkeit von CCR Text, in erster Linie durch die Struktur zu geben. Die Datentypen sind in vier allgemeine Kategorien: Dokument und Annotation Identifikation, Fallbericht Identifikation (d. h. auf Dokumentebene Eigenschaften), medizinische Inhalte Konzepte (Eigenschaften in erster Linie Konzept-Ebene) und Bestätigungen (d.h. Funktionen, die den Nachweis der Finanzierung). In diesem Prozess Annotation enthält jedes Dokument im Volltext ein CCR, Verzicht auf jegliches Dokument Inhalt Material unabhängig von der Fall (z. B. experimentelle Protokolle). CCRs sind in der Regel weniger als 1000 Worte; ein einziger Korpus sollte im Idealfall von der gleichen bibliographischen Datenbank indiziert werden und werden in der gleichen Schriftsprache.
Das Produkt des Ansatzes, die hier beschrieben wird, angewandt auf einem CCR-Korpus ist ein strukturierter Satz von kommentierte klinische Text. Während dieser Methodik vollständig manuell ausgeführt werden kann und wurde entwickelt, um durch Fachexperten ohne Informatik Erfahrung durchgeführt werden, es ergänzt die Verarbeitung natürlicher Sprache-Ansätze, die oben genannten und liefert Daten für computergestützte Analyse. Solche Analysen können für Publikum von Wissenschaftlern über die von Interesse sein, die häufig CCRs, einschließlich lesen:
- die betroffenen mit Krankheit Präsentationen, ihre wichtigsten Symptomatik, übliche diagnostische Ansätze und Behandlungen
- diejenigen, die die Ergebnisse klinischer Studien mit innerhalb der klinischen Literatur beschriebenen Ereignisse vergleichen wollen, bietet möglicherweise zusätzliche Beobachtungen und größere statistische Aussagekraft.
- Bioinformatik, biomedizinische Informatik und Computer-Science-Forscher, die strukturierte medizinische Sprache Datensätze oder allgemeine Verständnis von medizinischen Erzählungen benötigen
- Regierung Politik Forscher mit Schwerpunkt auf wie klinische Studien können am besten widerspiegeln wie Diagnose und Behandlung als es in Wirklichkeit auftritt
Durchsetzung der Struktur auf CCRs unterstützen zahlreiche spätere Bemühungen medizinischen Sprache und biomedizinische Phänomene besser zu verstehen.