Artykuł metodologiczny

Podejście do ekstrakcji metadanych w opisach przypadków klinicznych w celu umożliwienia zaawansowanego zrozumienia pojęć biomedycznych

DOI:

10.3791/58392

20 września 2018

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Prezentujemy protokół i związany z nim szablon metadanych do ekstrakcji tekstu opisującego koncepcje biomedyczne w raportach przypadków klinicznych. Ustrukturyzowane wartości tekstowe utworzone za pomocą tego protokołu mogą wspierać głęboką analizę tysięcy narracji klinicznych.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Kliniczne opisy przypadków (CCR) są cennym sposobem dzielenia się obserwacjami i spostrzeżeniami w medycynie. Forma tych dokumentów jest zróżnicowana, a ich treść zawiera opisy licznych, nowatorskich prezentacji chorób i metod leczenia. Jak dotąd, dane tekstowe w CCR są w dużej mierze nieustrukturyzowane, co wymaga znacznego wysiłku ludzkiego i obliczeniowego, aby dane te były przydatne do dogłębnej analizy. W niniejszym protokole opisujemy metody identyfikacji metadanych odpowiadających konkretnym pojęciom biomedycznym często obserwowanym w CCR. Udostępniamy szablon metadanych jako przewodnik do adnotacji dokumentów, uznając, że narzucanie struktury CCR może być realizowane poprzez połączenie wysiłku ręcznego i zautomatyzowanego. Przedstawione tutaj podejście jest odpowiednie do organizowania tekstów związanych z koncepcjami z dużego korpusu literatury (np. tysięcy CCR), ale może być łatwo zaadaptowane w celu ułatwienia bardziej ukierunkowanych zadań lub małych zestawów raportów. Uzyskane w ten sposób ustrukturyzowane dane tekstowe zawierają wystarczający kontekst semantyczny, aby wspierać różne późniejsze przepływy pracy związane z analizą tekstu: metaanalizy w celu określenia, w jaki sposób zmaksymalizować szczegółowość CCR, badania epidemiologiczne chorób rzadkich oraz rozwój modeli języka medycznego mogą być łatwiejsze do zrealizowania i zarządzania dzięki wykorzystaniu ustrukturyzowanych danych tekstowych.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Kliniczne opisy przypadków (CCR) są podstawowym sposobem dzielenia się obserwacjami i spostrzeżeniami w medycynie. Służą one jako podstawowy mechanizm komunikacji i edukacji dla klinicystów i studentów medycyny. Historycznie rzecz biorąc, CCR dostarczały również opisy pojawiających się chorób, ich leczenia i tła genetycznego1,2,3,4. Na przykład, pierwsze leczenie ludzkiej wścieklizny przez Louisa Pasteura w 1885 roku5,6 oraz pierwsze zastosowanie penicyliny u pacjentów7 zostały zgłoszone za pośrednictwem CCR. Do kwietnia 2018 r. opublikowano ponad 1,87 mln CCR, z czego ponad pół miliona w ciągu ostatniej dekady; Czasopisma nadal udostępniają nowe miejsca dla tych raportów8. Chociaż CCR są unikalne pod względem formy i treści, zawierają dane tekstowe, które są w dużej mierze nieustrukturyzowane, zawierają obszerne słownictwo i dotyczą powiązanych ze sobą zjawisk, co ogranicza ich wykorzystanie jako ustrukturyzowanego zasobu. Konieczne jest znaczne wysiłki, aby wyodrębnić szczegółowe metadane (tj. "dane o danych" lub w tym przypadku opisy zawartości dokumentów) z CCR i ustanowić je jako możliwy do znalezienia, dostępny, interoperacyjny i wielokrotnego użytku (FAIR)9 zasób danych.

Tutaj opisujemy proces wyodrębniania tekstu i wartości liczbowych w celu standaryzacji opisu konkretnych koncepcji biomedycznych w opublikowanych CCR. Ta metodologia zawiera szablon metadanych do kierowania adnotacjami; zobacz Rysunek 1, aby zapoznać się z tym procesem. Zastosowanie procesu adnotacji do dużego zbioru raportów (np. kilku tysięcy o określonym typie prezentacji choroby) pozwala na złożenie łatwego w zarządzaniu i ustrukturyzowanego zestawu tekstów klinicznych z adnotacjami, uzyskując czytelną maszynowo dokumentację i zjawiska biomedyczne osadzone w każdym obrazie klinicznym. Chociaż formaty danych, takie jak te dostarczane przez HL7 (np. wersja 3 standardu przesyłania wiadomości10 lub Fast Healthcare Interoperability Resources [FHIR]11), LOINC12 i wersja 10 Międzynarodowej Statystycznej Klasyfikacji Chorób i Powiązanych Problemów Zdrowotnych (ICD-10)13 zapewniają standardy opisu i wymiany obserwacji klinicznych, nie przechwytują tekstu otaczającego te dane, ani nie są do tego przeznaczone. Wyniki naszej metodologii najlepiej wykorzystać do narzucenia struktury na CCR i ułatwienia późniejszej analizy, normalizacji za pomocą kontrolowanego słownictwa i systemów kodowania (np. ICD-10) i/lub konwersji do formatów danych klinicznych wymienionych powyżej.

Górnictwo CCR to aktywny obszar pracy w informatyce biomedycznej i klinicznej. Chociaż poprzednie propozycje standaryzacji struktury opisów przypadków (np. przy użyciu HL7 v2.514 lub ustandaryzowanej terminologii fenotypowej15) są godne pochwały, jest prawdopodobne, że CCR będą nadal podążać za różnymi formami języka naturalnego i układami dokumentów, tak jak to miało miejsce przez większą część ubiegłego stulecia. W idealnych warunkach autorzy nowych opisów przypadków postępują zgodnie z wytycznymi CARE16, aby upewnić się, że są one kompleksowe. Podejścia wrażliwe zarówno na język naturalny, jak i jego związek z pojęciami medycznymi mogą być zatem najbardziej efektywne w pracy z nowymi i archiwalnymi raportami. Zasoby takie jak CRAFT17 oraz te opracowane przez Informatics for Integrating Biology and the Bedside (i2b2)18 wspierają podejścia do przetwarzania języka naturalnego (NLP), ale nie koncentrują się konkretnie na CCR lub narracjach klinicznych. Podobnie, medyczne narzędzia NLP, takie jak cTAKES19 i CLAMP20, zostały opracowane, ale generalnie identyfikują konkretne słowa lub frazy (tj. jednostki) w dokumentach, a nie ogólne pojęcia powszechnie opisywane w CCR.

Zaprojektowaliśmy ustandaryzowany szablon metadanych dla funkcji często zawartych w CCR. Ten szablon definiuje funkcje narzucające strukturę na CCR — niezbędny prekursor do dogłębnych porównań zawartości dokumentów — a jednocześnie zapewnia wystarczającą elastyczność, aby zachować kontekst semantyczny. Chociaż zaprojektowaliśmy format powiązany z tym szablonem tak, aby był odpowiedni zarówno do ręcznego dodawania adnotacji, jak i do wyszukiwania tekstu wspomaganego komputerowo, upewniliśmy się, że jest on szczególnie łatwy w użyciu dla ręcznych adnotatorów. Nasze podejście zauważalnie różni się od bardziej skomplikowanych (a zatem mniej zrozumiałych dla nieprzeszkolonych badaczy) frameworków, takich jak FHIR21. Poniższy protokół opisuje sposób izolowania cech dokumentu odpowiadających poszczególnym typom danych szablonu, przy czym pojedynczy zestaw wartości odpowiada tym w pojedynczym CCR.

Typy danych w szablonie są najbardziej opisowe dla CCR i ogólnie dokumentów medycznych skoncentrowanych na pacjencie. Adnotacje do tych funkcji zwiększają wyszukiwalność, dostępność, interoperacyjność i możliwość ponownego wykorzystania tekstu CCR, przede wszystkim poprzez nadanie mu struktury. Typy danych dzielą się na cztery ogólne kategorie: identyfikacja dokumentów i adnotacji, identyfikacja opisu przypadku (tj. właściwości na poziomie dokumentu), koncepcje treści medycznych (głównie właściwości na poziomie koncepcji) oraz podziękowania (tj. cechy potwierdzające finansowanie). W tym procesie adnotacji każdy dokument zawiera pełny tekst CCR, pomijając wszelkie treści dokumentu niezależne od sprawy (np. protokoły eksperymentalne). CCR mają zazwyczaj mniej niż 1,000 słów każdy; Najlepiej byłoby, gdyby pojedynczy korpus był indeksowany przez tę samą bibliograficzną bazę danych i był napisany w tym samym języku pisanym.

Produkt opisanego tutaj podejścia, zastosowany do korpusu CCR, jest ustrukturyzowanym zestawem adnotowanego tekstu klinicznego. Chociaż metodologia ta może być wykonywana w pełni ręcznie i została zaprojektowana do wykonywania przez ekspertów dziedzinowych bez doświadczenia w dziedzinie informatyki, uzupełnia ona określone powyżej podejścia do przetwarzania języka naturalnego i dostarcza danych odpowiednich do analizy obliczeniowej. Takie analizy mogą być interesujące dla odbiorców badaczy nie tylko tych, którzy często czytają CCR, w tym:

  • osoby zajmujące się prezentacją choroby, jej kluczowymi objawami, typowymi metodami diagnostycznymi i leczeniem
  • tych, którzy chcą porównać wyniki badań klinicznych ze zdarzeniami opisanymi w literaturze klinicznej, potencjalnie dostarczając dodatkowych obserwacji i większej mocy statystycznej.
  • badacze zajmujący się bioinformatyką, informatyką biomedyczną i informatyką, którzy wymagają ustrukturyzowanych zestawów danych języka medycznego lub wysokiego poziomu zrozumienia narracji medycznych
  • Naukowcy zajmujący się polityką rządową koncentrują się na tym, w jaki sposób badania kliniczne mogą najlepiej odzwierciedlać to, jak diagnoza i leczenie zachodzą w rzeczywistości

Egzekwowanie struktury na CCR może wesprzeć wiele późniejszych wysiłków na rzecz lepszego zrozumienia zarówno języka medycznego, jak i zjawisk biomedycznych.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Identyfikacja dokumentu i adnotacji

Uwaga: Wartości w tej kategorii wspierają proces adnotacji.

  1. Korzystając z szablonu adnotacji, podaj identyfikator specyficzny dla tego zestawu metadanych, np. Case123. Format identyfikatora powinien być spójny w całym projekcie (np. od Case001 do Case500).
  2. Określ datę, w której dokument został przeczytany i opatrzony adnotacjami. Użyj formatu przypominającego "10 stycznia 2018 r.", aby zapewnić spójność i czytelność.

2. Identyfikacja opisu przypadku

Uwaga: Wartości w tej kategorii dostarczają funkcji na poziomie dokumentu i przyczyniają się do jego odnalezienia.

  1. Format każdego pola powinien być spójny we wszystkich adnotacjach, np. poszczególne wartości powinny być oddzielone średnikami bez następujących po nich spacji we wszystkich wpisach. Używaj formatów identycznych z tymi, które są używane w oryginalnym dokumencie lub w bibliograficznej bazie danych, takiej jak MEDLINE.
  2. Podaj tytuł dokumentu.
  3. Podaj imiona i nazwiska wszystkich autorów dokumentu w podanej kolejności. Znormalizuj format wszystkich imion, tak aby wszystkie imiona miały postać jednego nazwiska, po którym następuje dowolna liczba inicjałów, np. Jane B. Park staje się Park JB. Nie dołączaj tytułów. Oddziel wielu autorów średnikiem bez dodatkowych znaków interpunkcyjnych, tak aby John A. Smith, Jane B. Park przyjmowali formę Smith JA; Park JB.
  4. Należy podać rok publikacji dokumentu.
  5. Podaj pełny tytuł czasopisma, w którym dokument został opublikowany. Lista kontrolowanych nazw czasopism jest dostępna w katalogu NLM (https://www.ncbi.nlm.nih.gov/nlmcatalog).
  6. Należy podać adres instytucji macierzystej autorów dokumentu, zgodnie z informacją zawartą w dokumencie. Może to obejmować działy, lokalizacje geograficzne i dane adresowe pocztowe.
    1. Jeśli podano wiele lokalizacji (np. jeśli afiliacje różnią się między autorami), podaj tylko szczegóły dotyczące autora korespondencyjnego. Jeśli nie można zidentyfikować autora korespondencyjnego, należy użyć autora pierwszego autora lub nie określać instytucji. Jeśli autor korespondencyjny ma wiele afiliacji, określ je i oddziel średnikiem.
  7. Podaj odpowiedniego autora dokumentu, określonego w nagłówku dokumentu, przy użyciu tego samego formatu, który jest używany w typie danych Autorzy.
  8. Podaj identyfikator dokumentu (np. PMID).
  9. Podaj cyfrowy identyfikator obiektu, o ile jest to możliwe i dostępny, rozpoznawalny jako adres URL dokumentu (za pośrednictwem https://www.doi.org/), a nie stronę PubMed Central.
  10. Podaj stabilny adres URL pełnego tekstu dokumentu, jeśli jest dostępny. Aby zmaksymalizować dostępność, może to odnosić się do wersji PubMed Central.
  11. Podaj język dokumentu. W przypadku dokumentów dostępnych w wielu językach podaj oba te elementy, oddzielając je średnikami.

3. Treści medyczne

Uwaga: Wartości w tej kategorii identyfikują cechy na poziomie dokumentu, koncepcji i tekstu. Służą one do zwiększenia dostępności, interoperacyjności i możliwości ponownego użycia dokumentu. Te funkcje umożliwiają obserwowanie podobieństw koncepcyjnych i semantycznych między treścią dokumentów, ze szczególnym uwzględnieniem tematów i wydarzeń biomedycznych. Większość kategorii w tej sekcji może zawierać wiele stwierdzeń tekstowych, a każda z nich powinna być oddzielona średnikiem.

  1. Uwzględnij szczegóły kontekstowe w każdym polu (np. "matka miała raka piersi w wieku 50 lat"), zamiast podawać tylko terminy z kontrolowanego słownictwa (np. nie tylko "rak piersi"). Nie podawaj obszernych szczegółów poza każdą obserwacją.
  2. Pomiń często powtarzające się słowa i wyrażenia (np. zaimki, słowo "pacjent" i wyrażenia "skarży się" lub "przedstawiono mu"). Chociaż subiektywność wielu adnotatorów jest prawdopodobna, może zostać zmniejszona przez posiadanie wielu adnotatorów dla każdego dokumentu i przez automatyczną normalizację po zebraniu danych. Podejścia do przetwarzania końcowego obliczeń będą się różnić w zależności od potrzeb kolejnej analizy i nie są tutaj szczegółowo omawiane.
  3. Podaj następujące informacje w szablonie adnotacji.
    1. Podaj konkretne terminy określone w dokumencie, zwykle w jego nagłówku, jako terminy kluczowe. Oddziel średnikiem, ponieważ terminy mogą zawierać inne znaki interpunkcyjne.
    2. Podaj wartości demograficzne, w szczególności wszelkie stwierdzenia tekstowe opisujące pochodzenie pacjenta, w tym płeć i/lub płeć, wiek, pochodzenie etniczne lub narodowość.
    3. Należy podać lokalizacje geograficzne wymienione w narracji klinicznej, inne niż adresy konkretnych instytucji. Nie powinno to obejmować lokalizacji/części anatomicznych, ale może obejmować dowolne miejsce geograficzne, w którym pacjent mieszka lub podróżuje.
    4. Podaj wartości stylu życia, w tym wszelkie stwierdzenia tekstowe opisujące częste czynności lub zachowania pacjentów związane z ich ogólnym stanem zdrowia. W praktyce często wiąże się to z nawykami związanymi z paleniem tytoniu lub spożywaniem alkoholu, ale może również obejmować ekspozycję na słońce, dietę lub częstotliwość określonych rodzajów aktywności fizycznej.
    5. Podaj wartości historii medycznej odnoszące się do historii rodziny. Dołącz wszelkie stwierdzenia tekstowe opisujące obserwacje kliniczne i zdarzenia doświadczane przez rodzeństwo, rodziców i innych członków rodziny. Obejmuje to uwarunkowania genetyczne i negatywne obserwacje (tj. wywiad rodzinny był ujemny dla choroby).
    6. Podaj wartości odnoszące się do historii społecznej, w tym wszelkie stwierdzenia tekstowe opisujące pochodzenie pacjenta, które nie zostały uwzględnione w Demografii lub Stylu życia. Treści tych kategorii mogą się pokrywać. Oświadczenia mogą obejmować historię zawodową i nawyki społeczne.
    7. Podaj wartości odnoszące się do historii medycznej i chirurgicznej pacjenta. Dołącz wszelkie stwierdzenia tekstowe opisujące wszelkie obserwacje medyczne, zabiegi lub inne zdarzenia, które miały miejsce przed rozpoczęciem prezentacji klinicznej. Obejmuje to historię położniczą i okresy dobrego stanu zdrowia, jeśli zaznaczono.
    8. Określ co najmniej jedną z następujących 16 kategorii systemu chorobowego. Należy pamiętać, że te wartości są jakościowe, a nie dowolnego. Kategorie nie są wyczerpujące, ale powinny wskazywać większość układów, na które mają wpływ zdarzenia opisane w obrazie klinicznym i zdiagnozowanej chorobie.
      1. Postępuj zgodnie z określonym zestawem kategorii, opartym na kategoriach używanych w systemie kodów Międzynarodowej Statystycznej Klasyfikacji Chorób i Powiązanych Problemów Zdrowotnych, wersja 10 (ICD-10). W tabeli 1 znajduje się wykaz kategorii układów chorobowych wraz z odpowiadającymi im zakresami kodów ICD-10.
    9. Podaj szczegółowe informacje na temat wszystkich oznak i objawów. Dołącz wszelkie stwierdzenia tekstowe opisujące wszelkie obserwacje medyczne dotyczące oznak lub objawów, począwszy od początkowej prezentacji, w tym ich początek, czas trwania, nasilenie i ustąpienie, jeśli zostały dostarczone. Nie uwzględniaj objawów opisanych w wyniku. Wartości te mogą pokrywać się z innymi typami, jeśli objawy utrzymują się od historii do początkowej prezentacji.
    10. Podaj szczegółowe informacje na temat wszelkich chorób współistniejących. Należy uwzględnić wszelkie terminy lub wyrażenia opisujące różne choroby obecne w momencie początkowego obrazu klinicznego. Prawdopodobnie wartości te pokrywają się z tymi w historii klinicznej, chociaż choroby współistniejące nie powinny obejmować terminów identycznych z tymi w diagnozie.
    11. Podaj szczegółowe informacje na temat wszystkich technik i procedur diagnostycznych. Należy podać nazwy procedur medycznych wykonywanych w celach diagnostycznych, w tym badań, testów i obrazowania, a także warunki, w jakich te testy zostały wykonane, oraz odpowiednie lokalizacje anatomiczne (np. "USG żył kończyn górnych"). Wyklucz wyniki testu.
    12. Podaj szczegóły diagnozy. Dołącz wszelkie stwierdzenia tekstowe opisujące diagnozy choroby, nawet jeśli ostateczna diagnoza jest niejednoznaczna.
    13. Podaj wszystkie wartości laboratoryjne i wyniki testów. Uwzględnij nazwy testów diagnostycznych, ich wartości i warunki, w jakich zostały wykonane. Będzie się to wiązało z pokrywaniem się terminów używanych w typie danych Techniki i procedury diagnostyczne. Dopuszczalne są zarówno wartości liczbowe, jak i jakościowe (np. pełna morfologia krwi mieściła się w granicach normy). Jeśli nazwy badań diagnostycznych nie są podane, należy użyć terminów opisujących wyniki (np. leukopenia), chociaż powinny one również znaleźć się w Przedmiotowych i Podmiotowych.
    14. Podaj szczegółowe informacje na temat patologii. Dołącz wszelkie stwierdzenia tekstowe opisujące wyniki badań patologicznych i histologicznych, w tym patologii ogólnej, immunologii i badań mikroskopowych. Terminy mogą pokrywać się z terminami stosowanymi w technikach i procedurach diagnostycznych (krok 3.11), np. z procedurami wykonywanymi w celu uzyskania próbek, takich jak biopsja.
    15. Zapewnij wszystkie terapie farmakologiczne. Uwzględnij wszelkie stwierdzenia tekstowe opisujące terapie lekowe stosowane w trakcie leczenia, w tym ogólne terminy, takie jak antybiotyki lub konkretne nazwy leków. Dołącz również opisy, kiedy i w jaki sposób terapie lekowe zostały przerwane.
    16. Zapewnij wszystkie procedury interwencyjne. Zawierać wszelkie oświadczenia tekstowe opisujące procedury terapeutyczne stosowane w trakcie leczenia, w tym procedury inwazyjne, implantację wyrobów medycznych oraz procedury wykonywane w celu ułatwienia innych terapii. W razie potrzeby dołącz również opisy, kiedy i w jaki sposób trwające procedury terapeutyczne zostały przerwane.
    17. Przedstaw wynik pacjenta. Należy dołączyć wszelkie oświadczenia tekstowe opisujące stan zdrowia pacjenta na koniec prezentacji klinicznej opisanej w raporcie, w tym wszelkie badania kontrolne.
    18. Podaj liczbę wszystkich obrazów diagnostycznych, rysunków, filmów/animacji i tabel. Uwzględnij wszystkie liczby nośników wizualnych uwzględnionych w raporcie, w następującym formacie: liczba obrazów; Liczba figur; Liczba filmów lub animacji; Liczba tabel.
      1. Rozróżnij obrazy i rysunki w ten sposób: obrazy obejmują wszelkie produkty diagnostyki klinicznej, w tym fotografie, mikrofotografie, obrazy rytmu elektrokardiogramu i inne produkty obrazowania diagnostycznego, podczas gdy rysunki to wszystkie inne obrazy, w tym zazwyczaj wykresy danych i ilustracje.
    19. Przedstaw dowody powiązań z innymi CCR. Pole to może zawierać identyfikatory (np. identyfikatory PMID) innych raportów w zbiorze danych, na które powołuje się ten raport lub do którego się odwołuje.
    20. Przedstaw dowody na powiązania z badaniami klinicznymi. W polu tym mogą znajdować się identyfikatory badań klinicznych, w których powoływano się na ten CCR. Identyfikuj badania na podstawie ich identyfikatorów ClinicalTrials.gov, poprzedzonych NCT lub innego stabilnego identyfikatora.
    21. Dołącz linki do bazy danych odpowiadające temu dokumentowi, w tym identyfikatory, najlepiej jako nazwy baz danych i stabilne adresy URL.

4. Podziękowania

Uwagi: Wartości w tej kategorii identyfikują cechy na poziomie dokumentu, ale mają mało spójną strukturę w publikacjach. Zawierają one szczegółowe informacje na temat organizacji udzielających wsparcia dla CCR i związanych z tym prac. Ta kategoria zawiera również pole dla całkowitej liczby odniesień cytowanych w artykule: ma to na celu zapewnienie przybliżonej metryki stopnia, w jakim dokument ma koncepcyjne powiązania z innymi dokumentami biomedycznymi dowolnego typu. Spośród czterech typów danych w tej sekcji podaj następujące elementy.

  1. Należy określić wszystkie źródła finansowania wspierające prace i odpowiadające im PI, a także odpowiednie numery nagród. Pierwsza wartość, Źródło finansowania, powinna zawierać nazwy wszystkich organizacji udzielających wsparcia finansowego na prace.
    1. Oddzielne organizacje ze średnikami i spacjami, np. National Institutes of Health/National Cancer Institute; DOE; Fundacja Smith-Park.
    2. Dla następującej wartości (Numer nagrody) należy podać wszelkie numery nagród lub konkretne oznaczenia podane wraz z laureatami nagród, w stosownych przypadkach, jako inicjały laureatów w nawiasach, np. R01HL123123 (do JP), NS12312 (do JP, JS), stypendium naukowe (do JS). Autorzy mogą wyraźnie stwierdzić, że nie są dostępne żadne odpowiednie informacje (np. "nie otrzymano żadnego finansowania"); w takich przypadkach należy użyć tekstu dostarczonego przez autorów jako wartości Źródła finansowania. W przeciwnym razie wartość powinna być NA.
  2. Określ ujawnienia/konflikty interesów określone przez autorów, np. JP jest konsultantem DrugCo. Autorzy mogą wyraźnie stwierdzić, że nie są dostępne żadne odpowiednie informacje (np. "nie deklaruje się konfliktu interesów"); w takich przypadkach należy użyć tekstu dostarczonego przez autorów jako wartości Ujawnienia/Konflikt interesów. W przeciwnym razie, jak powyżej, wartość powinna wynosić NA.
  3. Należy podać liczbową liczbę wszystkich odniesień cytowanych w dokumencie, nie wliczając w to odniesień zawartych w materiałach dodatkowych. W tym polu nie należy umieszczać tekstu referencyjnego.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Przykład procesu adnotacji jest pokazany w Rysunek 2. Ten case22 opisuje prezentację infekcji patogenem bakteryjnym Burkholderia thailandensis. Dla porównania, odpowiednia część niniejszego CCR jest dostępna w formacie zwykłego tekstu w pliku uzupełniającym 1; Niektóre wyniki badań są również przedstawione w niniejszym raporcie i zostały uwzględnione dla porównania. W praktyce konwersja raportów dostarczonych w formacie HTML lub PDF na zwykły tekst może poprawić wydajność i łatwość ekstrakcji metadanych.

Przykłady dwóch zestawów uzupełnionych adnotacji metadanych CCR znajdują się w Tabeli 2. Pierwszy z tych przykładów to dane próbne w celu zilustrowania idealnego formatu każdej wartości, podczas gdy drugi przykład zawiera wartości wyodrębnione z opublikowanego CCR dotyczącego rzadkiego schorzenia, acrodermatitis enteropathica23.

figure-results-1
Rysunek 1. Przepływ pracy dla adnotacji w raporcie przypadku. Opisany tutaj protokół zapewnia metodę identyfikacji cech tekstowych często występujących w opisach przypadków klinicznych. Proces ten wymaga skompletowania korpusu dokumentów. Produkt procesu adnotacji, po zagregowaniu w pojedynczy plik, pozwala na identyfikację cech tekstowych związanych z pojęciami medycznymi i ich opisów w opisach przypadków. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-2
Rysunek 2. Identyfikacja tekstu specyficznego dla danego pojęcia w opisie przypadku klinicznego. Począwszy od tekstu opisu przypadku, ręczny adnotator może przechodzić przez dokument, identyfikując segmenty tekstu odpowiadające każdemu składnikowi szablonu metadanych. Cechy identyfikacyjne są podświetlone na niebiesko. Tekst odpowiadający pojęciom medycznym jest zaznaczony na czerwono i oznaczony ich rodzajem; cały podświetlony tekst w trzeciej kolumnie odnosi się do typu Patologia. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

powiedział:
kategoriaopisRozdział ICD-10Zakres kodów ICD-10
rakKażdy rodzaj raka lub nowotworu złośliwego.IiZobacz materiał C00-D49
nerwowyKażda choroba mózgu, kręgosłupa lub nerwów.ViG00-G99
Układu krążeniaKażda choroba serca lub układu naczyniowego. Nie obejmuje chorób hematologicznych.IxI00-I99
mięśniowo-szkieletowe i reumatyczneKażda choroba mięśni, układu kostnego, stawów i tkanek łącznych.XiiiZobacz materiał M00-M99
trawiennyKażda choroba przewodu pokarmowego i narządów trawiennych, w tym wątroby i trzustki.XiZobacz materiał K00-K95
położnicze i ginekologiczneKażda choroba związana z ciążą, porodem, żeńskim układem rozrodczym lub piersiami.Xiv; XVO00-O9A; N60-N98
ZakaźnyKażda choroba wywoływana przez zakaźne mikroorganizmy.jaA00-B99
OddechowyKażda choroba płuc i dróg oddechowych.ZJ00-J99
HematologiaKażda choroba krwi, szpiku kostnego, węzłów chłonnych lub śledziony.IiiD50-D89
nerki i urologiczneKażda choroba nerek lub pęcherza moczowego, w tym moczowodów, a także męskich narządów rozrodczych, w tym prostaty.XivN00-N53; Zobacz materiał N99
EndokrynologiczneKażda choroba gruczołów dokrewnych, a także zaburzenia metaboliczne.IvE00-E89
jamy ustnej i szczękowo-twarzowejKażdy stan obejmujący usta, szczęki, głowę, twarz lub szyję.Xi; XiiiK00-K14; Zobacz materiał M26-M27
okoKażdy stan dotyczący oczu, w tym ślepota.ViiH00-H59
otorhinolaryngologiczneWszelkie schorzenia ucha, nosa i/lub gardła.ViiiH60-H95; Zobacz materiał J30-J39
skóraKażda choroba skóry.XiiL00-L99
rzadkiSpecjalna kategoria zarezerwowana dla doniesień o chorobach rzadkich, zdefiniowanych jako te, które dotykają mniej niż 200 000 osób w Stanach Zjednoczonych (patrz https://rarediseases.info.nih.gov/diseases)nienie

Tabela 1. Kategorie chorób do adnotacji w dokumencie. Wymienione tutaj kategorie są kategoriami, które mają być używane dla typu danych System chorób w szablonie metadanych dokumentu. Ponieważ każdy objaw choroby może obejmować wiele układów narządowych lub etiologii, pojedynczy opis przypadku klinicznego może odpowiadać wielu kategoriom. Kategorie te są w dużej mierze zgodne z tymi, które są używane do różnicowania sekcji Międzynarodowej Statystycznej Klasyfikacji Chorób i Powiązanych Problemów Zdrowotnych, systemu kodów rewizji 10 (ICD-10): dostępne są odpowiednie rozdziały ICD-10 i zakresy kodów. Niektóre kategorie, takie jak choroba jamy ustnej i szczękowo-twarzowej, odpowiadają wielu sekcjom systemu ICD-10.

powiedział: zwłok
Typ danychPrzykład #1Przykład #2 (Cameron i McClain 1986)
Identyfikacja dokumentu i adnotacji
Identyfikator wewnętrznyCCR005CCR2000
Data adnotacji2 marca 20181 marca 2018
Identyfikacja raportu przypadku
tytułPrzypadek zapalenia wsierdzia.Histopatologia oka acrodermatitis enteropathica.
AutorówDotacja AB; Chang CDCamerona J.D.; McClain CJ
rok2017Rok 1986
dziennikŚwiatowy Dziennik Medyczny i Opisy PrzypadkówBrytyjski Dziennik Okulistyczny
instytucjaWydział Medycyny, Oddział Kardiologii, Pierwszy Szpital Ogólny, Boston, Massachusetts, USAWydział Okulistyki, University of Minnesota Medical School, Minneapolis, Minnesota 55455
Autor korespondencyjnyDotacja ABCameron JD
Identyfikator PMID255555553756122
Doi10.1011/wjmcr.2017.11.001nie
łączehttps://www.ncbi.nlm.nih.gov/pmc/articles/PMC9555555/https://www.ncbi.nlm.nih.gov/pmc/articles/PMC1040795/
JęzykAngielskiAngielski
Treści medyczne
Słowa kluczowebruceloza; zapalenie wsierdzia; zastawka mitralnanie
demografia37-letni mężczyznaDziecko płci męskiej
Lokalizacje geograficzneFloryda; Rio de Janeiro, Brazylianie
Styl życiapalacz; okazjonalnie pije alkoholnie
Historia rodzinnatrzecie z pięciorga dzieci spokrewnionych rodziców; młodszy brat cierpi na przewlekłą egzemęnie
Historia społecznabudowlaniecnie
Historia medyczna/chirurgicznaHistoria zmęczenia8 funtów 9 uncji (3884 g) produkt nieskomplikowanej, donoszonej ciąży; w dobrym zdrowiu do 1 miesiąca życia, kiedy pojawiła się pęcherzowa wysypka skórna na policzkach; wysypka rozprzestrzeniła się na skórę wokół oczu, nosa i ust; zmiany skórne odnotowano również na brzuchu i kończynach; biegunka i brak rozwoju; biopsja skóry w tym czasie wykazała parakeratozę typową dla acrodermatitis enteropathica; leczony przez następne sześć lat przerywane kuracje antybiotykami o szerokim spektrum działania, mlekiem matki i diodochiną; częściowo udzielono odpowiedzi; rozwinęło się łysienie całkowite, okresowe zapalenie skóry i okresowa biegunka z nieoptymalnym przyrostem masy ciała; Spastyczność przypisywana zajęciu ośrodkowego układu nerwowego przez AE rozwijała się w wieku 8 miesięcy; kilka epizodów zatrzymania krążenia i oddychania po 11 miesiącach; brak koordynacji strun głosowych; Tracheostomii; W wieku 18 miesięcy u dziecka rozwinął się oczopląs poszukiwawczy związany obustronnym zanikiem nerwu wzrokowego i niewielkim osłabieniem naczyń siatkówki oraz oznaki opóźnienia psychomotorycznego; obustronne zapalenie rogówki i spojówki; Wysypka; Druga biopsja skóry wykonana w wieku 3 lat ponownie wykazała parakeratozę typową dla AE; ciężka wysypka skórna i biegunka; zaobserwowano obustronne duże zmętnienia przedniej części rogówki, które całkowicie ustąpiły do czasu ponownego zbadania w wieku pięciu lat; częste infekcje, w tym zapalenie ucha środkowego, infekcje dróg moczowych i infekcje skóry
System choróbsercowo-naczyniowy; zakaźnytrawienny; skóra; oko; rzadko
Oznaki i objawykołatanie serca i duszność w poprzednim tygodniu; objawiające się letargiem, bólem głowy i dreszczamiciężkie zapalenie powiek i spojówek i obustronne unaczynienie przedniej części rogówki; ciężka wysypka skórna i biegunka; posocznica bakteryjna Gram-ujemna; zmiany skórne typowe dla acrodermatitis enteropathica, brak tkanki grasicy, wyraźne zwyrodnienie nerwów wzrokowych, skrzyżowania i dróg wzrokowych oraz rozległe zwyrodnienie móżdżku
Choroby współistniejącenadciśnienie tętnicze; hiperlipidemianie
Techniki i procedury diagnostyczneBadanie fizykalne, elektrokardiografia, posiewy krwibadanie okulistyczne; sekcja
DiagnozaZapalenie wsierdzia Brucellaakrodermitis enteropathica (akrodermitis enteropatia)
Wartości laboratoryjnewzrost białka C-reaktywnego (9 mg/dl); fosfatazy alkalicznej (250 U/L)nie
PatologiaBrucella melitensis wyhodowano z próbek krwiPrawe i lewe oko miały podobny wygląd; grubość nabłonka rogówki zmniejszyła się do jednej do trzech warstw komórek spłaszczonych płaskonabłonkowych na całej powierzchni rogówki; cała polaryzacja nabłonka została utracona. Błonę Bowmana można było zidentyfikować tylko na obrzeżach prawej rogówki. W lewej rogówce nie można było zidentyfikować błony Bowmana. W lewej rogówce nie stwierdzono ani zwyrodnieniowej, ani zapalnej łuski oba oko; rozległy zanik mięśni okrężnych i skośnych ciała rzęskowego; pewna tylna migracja nabłonka torebki soczewki i wczesne zmiany zwyrodnieniowe kory mózgowej; rozległe zwyrodnienie nabłonka barwnikowego siatkówki w całym tylnym biegunie; Siatkówka była przyczepiona i wykazywała łagodne zmiany autolityczne w całym tekście; Pewne zachowanie zewnętrznych segmentów pręcików i stożków w biegunie tylnym, jednak struktury te zostały całkowicie utracone przed równikiem; rozległy ubytek komórek zwojowych i warstw włókien nerwowych w obu oczach; prawie całkowity zanik dysku i przyległego nerwu wzrokowego
Terapia farmakologicznagentamycyna 240 mg/dożylnie/dobęnie
Terapia indywidualnawymiana protezy zastawkinie
Ocena wyników pacjentaRekonwalescencja przebiegła bez powikłań; wypisany do domuzmarł w 1971 r. (w wieku 7 lat)
Obrazowanie diagnostyczne/nagrywanie na taśmie wideocyfra arabska; 1; 0; 1Rozdział 7; 0; 0; 0
Związek z innymi opisami przypadków555555523430849
Związek z próbą klinicznąNCT05555123nie
Powiązanie z bazą danychInformacje zdrowotne MedlinePlus: https://medlineplus.gov/ency/article/000597.htmHighWire - PDF: http://bjo.bmj.com/cgi/pmidlookup?view=long&pmid=3756122; Europa PubMed Central: http://europepmc.org/abstract/MED/3756122; Sojusz genetyczny: http://www.diseaseinfosearch.org/result/143
Podziękowania
Źródło finansowaniaNarodowe Instytuty Zdrowia/Narodowy Instytut Serca, Płuc i KrwiKlub Lions w Minnesocie; Badania zapobiegające ślepocie; Administracja Weteranów; Biuro ds. Programowania Nadużywania Alkoholu i Innych Narkotyków Stanu Minnesota
Numer nagrodyR01HL123123 (do AG)nie
Ujawnianie informacji/konflikt interesówDr Grant jest płatnym rzecznikiem prasowym DrugCo.nie
Odwołania427 Rozdział 27

Tabela 2. Ustandaryzowany szablon metadanych dla opisów przypadków klinicznych z przykładowymi adnotacjami. Przedstawiono tutaj zestaw cech wspólnych dla opisów przypadków klinicznych i ułatwiających ich adnotacje na poziomie koncepcji. Ten szablon jest podzielony na trzy podstawowe sekcje: Identyfikacja, Treści medyczne i Podziękowania, oznaczające cel i dodatkową wartość zapewnianą przez każdy typ funkcji opisu przypadku. Ta tabela zawiera dwa zestawy przykładowych adnotacji, jeden przedstawiający fabularyzowany opis przypadku, a drugi zestaw pochodzący z raportu na temat stanu acrodermatitis enteropathica23.

Plik uzupełniający 1. Tekst opisu przypadku klinicznego (Chang i wsp. 2017). Kliknij tutaj, aby pobrać ten plik.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wdrożenie ustandaryzowanego szablonu metadanych dla CCR może sprawić, że ich treści będą bardziej FAIR, poszerzą grono odbiorców i rozszerzą ich aplikacje. Zgodnie z tradycyjnym zastosowaniem CCR jako narzędzi edukacyjnych w komunikacji medycznej, stażyści opieki zdrowotnej (np . studenci medycyny, stażyści i stypendyści) oraz badacze biomedyczni mogą uznać, że streszczona treść opisu przypadku umożliwia szybsze zrozumienie. Największą zaletą standaryzacji metadanych za pomocą CCR jest jednak to, że indeksowanie tych danych przekształca odizolowane obserwacje w możliwe do zinterpretowania wzorce. Przedstawiony tutaj protokół może służyć jako pierwszy krok w procesie pracy z CCR, niezależnie od tego, czy ten przepływ pracy obejmuje analizę epidemiologiczną, nadzór nad lekiem lub leczeniem po wprowadzeniu do obrotu, czy też szersze badania patogenezy lub skuteczności terapeutycznej. Ustrukturyzowane cechy zidentyfikowane w ramach CCR mogą stanowić użyteczne źródło informacji dla badaczy zajmujących się prezentacją chorób i ich leczeniem, szczególnie w przypadku rzadkich schorzeń. Badacze kliniczni mogą znaleźć dane na temat wcześniejszych schematów leczenia, aby przeanalizować zarejestrowane objawy lub skutki uboczne oraz stopień poprawy w ramach poprzednich standardów opieki. Dane te mogą również stanowić podstawę do szerszych analiz nowych metod leczenia w oparciu o skuteczność, brak działań niepożądanych lub toksyczność, a także różnice w celowaniu leków pod względem płci, grupy wiekowej lub tła genetycznego.

Korzyści zapewniane przez ustrukturyzowane metadane mają podobne zastosowanie do obliczeniowych przepływów pracy zaprojektowanych do analizowania lub modelowania języka medycznego. Ustrukturyzowane funkcje CCR mogą również dostarczyć dowodów na obszary, w których autorzy raportów mogą łatwiej dostarczać treści czytelne dla maszyn (a w niektórych przypadkach czytelne dla człowieka). Różnice między CCR mogą wynikać z braku wyraźnie przedstawionych obserwacji: np. dokładny wiek pacjenta może nie być określony. Podobnie klinicyści mogą nie wspominać o testach, jeśli diagnostyka lub jej wyniki zostały uznane za trywialne. Dostarczając przykładów luk niezbędnych do dogłębnej analizy, egzekwowanie struktury w zakresie CCR uwypukla potencjalne ulepszenia. W szerszej perspektywie większa dostępność ustrukturyzowanych danych tekstowych z dokumentów medycznych wspiera wysiłki w zakresie przetwarzania języka naturalnego (NLP) w celu uczenia się na podstawie dużych zbiorów danych w opiece zdrowotnej24,25.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają nic do ujawnienia.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ta praca była częściowo wspierana przez National Heart, Lung, and Blood Institute: R35 HL135772 (do P. Pinga); Narodowy Instytut Ogólnych Nauk Medycznych: U54 GM114833 (do P. Pinga, K. Watsona i W. Wanga); Narodowy Instytut Obrazowania Biomedycznego i Bioinżynierii: T32 EB016640 (do A. Bui); upominek od Fundacji Hoag i dr S. Setty; oraz fundacja T.C. Laubischa na UCLA (do P. Pinga).

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Korpus opisów przypadków klinicznychnie dotyczyPełneteksty opisów przypadków można uzyskać za pośrednictwem PubMed (np. za pomocą hasła "Opisy przypadków"[Filtr]), innych baz cytowań, takich jak Europe PMC (https://europepmc.org/) lub bezpośrednio u wydawców.

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ban, T. A. The role of serendipity in drug discovery. Dialogues in Clinical Neuroscience. 8 (3), 335-344 (2006).
  2. Cabán-Martinez, A. J., García-Beltrán, W. F. Advancing medicine one research note at a time: the educational value in clinical case reports. BMC Research Notes. 5 (1), 293(2012).
  3. Vandenbroucke, J. P. In Defense of Case Reports and Case Series. Annals of Internal Medicine. 134 (4), 330(2001).
  4. Bayoumi, A. M. The storied case report. Canadian Medical Association Journal. 171 (6), 569-570 (2004).
  5. Pasteur, L. Méthode pour prévenir la rage après morsure. Comptes rendus de l'Académie des Sciences. 101, 765-774 (1885).
  6. Pearce, J. Louis Pasteur and Rabies: a brief note. Journal of Neurology, Neurosurgery & Psychiatry. 73 (1), 82-82 (2002).
  7. Keefer, C. S., Blake, F. G., Marshall, E. K. J., Lockwood, J. S., Wood, W. B. J. PENICILLIN IN THE TREATMENT OF INFECTIONS. Journal of the American Medical Association. 122 (18), 1217(1943).
  8. Akers, K. G. New journals for publishing medical case reports. Journal of the Medical Library Association JMLA. 104 (2), 146-149 (2016).
  9. Wilkinson, M. D., et al. The FAIR Guiding Principles for scientific data management and stewardship. Scientific Data. 3, 160018(2016).
  10. Beeler, G. W. HL7 Version 3-An object-oriented methodology for collaborative standards development. International Journal of Medical Informatics. 48 (1-3), 151-161 (1998).
  11. HL7 FHIR Release 3 (STU; v3.0.1-11917). , Available from: http://hl7.org/implement/standards/fhir/ (2018).
  12. McDonald, C. J. LOINC, a Universal Standard for Identifying Laboratory Observations: A 5-Year Update. Clinical Chemistry. 49 (4), 624-633 (2003).
  13. CDC/National Center for Health Statistics ICD-10-CM Official Guidelines for Coding and Reporting. , Available from: https://www.cdc.gov/nchs/data/icd/10cmguidelines_fy2018_final.pdf (2017).
  14. Rajeev, D., et al. Development of an electronic public health case report using HL7 v2.5 to meet public health needs. Journal of the American Medical Informatics Association. 17 (1), 34-41 (2010).
  15. Biesecker, L. Mapping phenotypes to language: a proposal to organize and standardize the clinical descriptions of malformations. Clinical Genetics. 68 (4), 320-326 (2005).
  16. Riley, D. S., et al. CARE guidelines for case reports: explanation and elaboration document. Journal of Clinical Epidemiology. 89, 218-235 (2017).
  17. Cohen, K. B., et al. Coreference annotation and resolution in the Colorado Richly Annotated Full Text (CRAFT) corpus of biomedical journal articles. BMC Bioinformatics. 18 (1), 372(2017).
  18. Sun, W., Rumshisky, A., Uzuner, O. Evaluating temporal relations in clinical text: 2012 i2b2 Challenge. Journal of the American Medical Informatics Association. 20 (5), 806-813 (2013).
  19. Savova, G. K., et al. Mayo clinical Text Analysis and Knowledge Extraction System (cTAKES): architecture, component evaluation and applications. Journal of the American Medical Informatics Association. 17 (5), 507-513 (2010).
  20. Soysal, E., et al. CLAMP - a toolkit for efficiently building customized clinical natural language processing pipelines. Journal of the American Medical Informatics Association. 25 (3), 331-336 (2018).
  21. Bender, D., Sartipi, K. HL7 FHIR: An Agile and RESTful approach to healthcare information exchange. Proceedings of the 26th IEEE International Symposium on Computer-Based Medical Systems. , 326-331 (2013).
  22. Chang, K., et al. Human Infection with Burkholderia thailandensis, China, 2013. Emerging Infectious Diseases. 23 (8), 1416-1418 (2013).
  23. Cameron, J. D., McClain, C. J. Ocular histopathology of acrodermatitis enteropathica. British Journal of Ophthalmology. 70 (9), 662-667 (1986).
  24. Maddox, T. M., Matheny, M. A. Natural Language Processing and the Promise of Big Data. Circulation: Cardiovascular Quality and Outcomes. 8 (5), 463-465 (2015).
  25. Kreimeyer, K., et al. Natural language processing systems for capturing and standardizing unstructured clinical information: A systematic review. Journal of Biomedical Informatics. 73, 14-29 (2017).

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Analiza tekstusystemy chor btechniki diagnostycznewyniki pacjent wdane ustrukturyzowanerozpoznawanie jednostek nazwanychdane FAIR

Powiązane artykuły