Badanie to przeprowadzono zgodnie ze standardami etycznymi instytucji i zyskało aprobatę Komitetu Etycznego Szpitala Generalnego Dowództwa Teatru Wschodniego (Numer zgody DZQH-KYLLFS-25-38). Pisemną, świadomą zgodę na udział w badaniu uzyskały wszystkie osoby uczestniczące przed ich przyjęciem. Wszystkie dane pacjentów zostały sanonimizowano i zdekompletowano w celu zapewnienia ochrony prywatności. Narzędzia badawcze zastosowane w tym protokołach są wymienione w Tabeli materiałów.
1. Budowa grafu wiedzy
Graf wiedzy został zbudowany przy użyciu wieloźródłowej strategii integracji danych. Zbieranie danych i ich adnotowanie przeprowadzali przeszkoleni pracownicy z formalnym wykształceniem w zakresie tradycyjnej medycyny chińskiej (TCM) i akupunktury. Źródła danych obejmowały klasyczne teksty dotyczące akupunktury, literaturę w języku chińskim z CNKI, literaturę w języku angielskim z Web of Science Core Collection, dane kliniczne z centrów reprodukcyjnych w szpitalach wyższej klasy oraz sstandardyzowane bazy wiedzy (Szczegółowa lista klasycznych tekstów jest dostępna w Pliku uzupełniającym 1). Źródła te zostały wybrane w celu zapewnienia zarówno historycznej głębi, jak i współczesnej istotności klinicznej. Łącznie włączono 400 przypadków klinicznych, aby wspierać identyfikację wzorców diagnostycznych i terapeutycznych. Ogólny przepływ pracy przy budowie grafu wiedzy jest przedstawiony na Rysunku 1.

Rysunek 1: Przepływ pracy przy budowie grafu wiedzy. Przegląd procesu zbierania, wyodrębniania i integracji danych stosowanych do budowy grafu wiedzy. Proszę kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.
Kryteria dotyczące włączenia wymagały, aby wszystkie dane były bezpośrednio związane z diagnozą i leczeniem za pomocą akupunktury, z pełnymi i jasno ustrukturyzowanymi treściami nadającymi się do ekstrakcji encji i relacji. Wymagano, aby klasyczne teksty były krytycznie zestawione i wolne od oczywistych błędów, podczas gdy współczesna literatura była ograniczona do publikacji recenzowanych przez rówieśników lub dokumentów wydanych przez autorytatywne instytucje. Wymagano, aby dane kliniczne były zdekompletowane i zatwierdzone etycznie. Kryteria wykluczenia obejmowały duplikaty zapisów, niekompletne fragmenty tekstu, treści niezwiązane z diagnozą i leczeniem za pomocą akupunktury oraz niepotwierdzone lub błędne stwierdzenia.
Zaimplementowano hybrydową metodę ekstrakcji wiedzy, łącząc adnotację ręczną i automatyczną ekstrakcję. Około 30% danych, w tym klasyczne teksty i treści semantycznie skomplikowane, zostało ręcznie adnotowanych przez ekspertów dziedzinowych za pomocą zstandardyzowanej platformy adnotacji. Pozostałe 70% danych zostało przetworzonych za pomocą dużych modeli językowych (LLMs) w celu automatycznej ekstrakcji, w tym rozpoznawania encji, ekstrakcji relacji oraz normalizacji terminologii. Wszystkie automatycznie wygenerowane wyniki zostały przejrzane i skorygowanie przez ekspertów, aby zapewnić dokładność i spójność.
Automatyczna ekstrakcja została przeprowadzona za pomocą zstrukturyzowanych szablonów pytań zaprojektowanych w celu wyznaczenia zachowania LLM (Przykłady szablonów są przedstawione w Pliku uzupełniającym 2). Szablony te definiowały rolę modelu jako eksperta od ekstrakcji wiedzy specyficznej dla danej dziedziny i zawierały przykłady few-shot learning w formacie JSON triplet, aby poprawić wydajność ekstrakcji. Przetworzone abstrakty literatury były przesyłane przez interfejsy programowania aplikacji (API), a strategie przetwarzania równoległego zostały zaimplementowane, aby poprawić efektywność obliczeniową. Wyniki ekstrakcji były analizowane i walidowane za pomocą narzędzi do walidacji JSON, aby zapewnić integralność strukturalną. Walidowane triplety wiedzy były serializowane do niezależnych plików JSON, nazwane zgodnie ze źródłowymi dokumentami, aby zachować śledzenie.
Sfinalizowany graf wiedzy został przechowany w bazie danych grafowej i zaimplementowany za pomocą ramek opartych na Pythonie. Wizualizacja została przeprowadzona za pomocą wbudowane narzędzi bazy danych grafowej, aby wspierać inspekcję i walidację.
Encje w grafie wiedzy zostały sklasyfikowane w siedmiu typach: choroby, objawy, wzory zespołów, punkty akupunktury, merydiany, metody leczenia oraz substancje efektorowe i mechanizmy biologiczne. Relacje między encjami zostały zbudowane, aby odzwierciedlać kliniczna logikę diagnostyczną i terapeutyczną, wspierającą rozumowanie wieloskoczne i wnioskowanie strukturalne. Ontologia i struktura relacji są przedstawione na Rysunku 2. Szczegółowy schemat grafu wiedzy i przykłady ograniczeń relacji są dostępne