Artykuł metodologiczny

Weryfikowane u źródła wydobywanie i wizualizacja rzeczywistych zapisów przypadków klinicznych z zakresu tradycyjnej medycyny chińskiej z wykorzystaniem formuły Hegan Jianpi

2 wyświetleń

⸱

DOI:

10.3791/73716

⸱

29 września 2026

* These authors contributed equally

W tym artykule

Podsumowanie

Niniejszy protokół integruje deidentyfikację, normalizację terminologii, weryfikację źródeł oraz powtarzalną wizualizację w celu generowania audytowalnych, zagregowanych wyników z rzeczywistych rekordów ambulatoryjnych tradycyjnej medycyny chińskiej.

Streszczenie

Rzeczywiste zapisy z wizyt ambulatoryjnych w ramach tradycyjnej medycyny chińskiej (TCM) zawierają podłużne informacje o diagnozach, elementach zespołów objawów, opisach symptomów oraz zindywidualizowanych receptach, jednak ich półstrukturalny format utrudnia powtarzalną analizę. Niniejszy artykuł przedstawia poddany audytowi protokół konwersji zanonimizowanych zapisów przypadków w śledzone tabele zbiorcze i wizualizacje gotowe do publikacji. Przepływ pracy definiuje kryteria kwalifikacji i jednostki analizy, zachowuje mapowania między oryginalną a znormalizowaną terminologią, weryfikuje wszystkie zgłoszone liczniki i mianowniki oraz regeneruje rysunki z wersjonowanych tabel źródłowych. Zastosowany do zapisów z okresu od stycznia 2015 do czerwca 2024 roku protokół zidentyfikował 555 kwalifikujących się wizyt z przepisanymi lekami u 396 pacjentów. Końcowy zbiór danych zawierał 324 znormalizowane etykiety ziół oraz 9 339 wystąpień zastosowania ziół. Przepływ pracy wygenerował równoległe spektra chorób w medycynie zachodniej i TCM, jawne spektrum elementów zespołów objawów i macierz współwystępowania, profile częstotliwości ziół i materia medica, spektrum symptomów wywiedzionych z wywiadu obejmujące 37 terminów, 15 skierowanych reguł asocjacyjnych, hierarchiczne grupowanie oraz mapy ciepła zastosowania ziół zestratyfikowane według diagnozy. Przynajmniej jedno z wcześniej określonych słów kluczowych z wywiadu wykryto w 474 wizytach (85,41%). W przypadku, gdy pozwalają na to zasady instytucjonalne, opcja sztucznej inteligencji (AI) pod nadzorem człowieka może pomóc w weryfikacji terminologii, przeglądzie spójności między plikami oraz dopasowaniu podpisów do rysunków. Każde użycie AI musi zostać udokumentowane w oddzielnym raporcie z audytu i nie może zastępować przeglądu danych źródłowych. Dzięki zintegrowaniu zarządzania, normalizacji, obliczeń, interpretacji klinicznej i wyjścia wizualnego w jeden powtarzalny przepływ pracy, metoda ta przekształca rozproszoną dokumentację kliniczną w podlegający przeglądowi zasób badawczy. Protokół może zostać dostosowany do innych zbiorów danych z praktyk eksperckich, wieloośrodkowych projektów terminologicznych oraz prospektywnych platform danych klinicznych.

Wprowadzenie

Rzeczywiste rekordy z wizyt w ambulatoryjnych placówkach tradycyjnej medycyny chińskiej (TCM) przechowują podłużne rozumowanie kliniczne poprzez narracyjne opisy objawów, równoległe systemy diagnostyczne, opisy syndromów oraz zindywidualizowane recepty. Wczesne prace nad odkrywaniem wiedzy uznały zapisy przypadków za złożone dane doświadczalne, wymagające dedykowanych metod informatycznych przed możliwością wiarygodnego zbadania występujących w nich wzorców1. Następne badania wykazały, że synonimiczne wyrażenia opisujące objawy, precyzyjne encje oraz lokalnie dokumentowane terminy diagnostyczne muszą zostać znormalizowane bez usuwania oryginalnego sformułowania2,3,4,5,6. Dane z elektronicznej dokumentacji medycznej (EHR) mogą również wspierać obliczeniowe badania nad recepturami oraz wykorzystanie wielokrotnych narzędzi analitycznych, o ile kontekst kliniczny i pochodzenie danych pozostają widoczne7,8. W związku z tym niezbędne są autorytatywne referencje materia medica w celu standaryzacji nazw ziół, form przetwórstwa, właściwości, smaków oraz przypisań do południków9,10. Na poziomie raportowania wytyczne RECORD i STROBE wymagają przejrzystych opisów źródeł danych, reguł kwalifikowalności, zmiennych i decyzji analitycznych, podczas gdy zasady FAIR kładą nacisk na możliwe do prześledzenia i ponownego wykorzystania obiekty badawcze11,12,13. Rozważania te są szczególnie istotne, gdy rekordy zawierają powtarzające się wizyty, brakujące pola, nakładającą się terminologię oraz teksty wolne. Ocena przydatności do użytku musi odnosić się do kompletności, zgodności, prawdopodobieństwa i spójności źródeł14,15. Deidentyfikacja tekstów wolnych wymaga również wyraźnych procedur i weryfikacji ludzkiej, ponieważ metody zautomatyzowane mogą zachować użyteczną treść kliniczną, pozostawiając jednocześnie rezydualne ryzyko naruszenia prywatności16,17,18.

Po ustaleniu zasad zarządzania i terminologii, profilowanie częstotliwości, wydobywanie reguł asocjacyjnych oraz klasteryzacja hierarchiczna mogą dostarczyć uzupełniających perspektyw na strukturę recept19,20,21. Metody analizy sieci i mapowania nauki dodatkowo demonstrują, w jaki sposób skoordynowane reprezentacje wizualne mogą ujawnić zależności, których pojedyncza lista rankingowa nie jest w stanie uchwycić22,23,24,25. Niedawne badania nad reumatoidalnym zapaleniem stawów z depresją, inhibitorami kinaz Janus w wrzodziejącym zapaleniu jelita grubego oraz reumatoidalnym zapaleniem stawów z fibromialgią ilustrują wartość kryteriów wyszukiwania z blokadą wersji, sieci współwystępowania, klasteryzacji, interpretacji czasowej oraz wyraźnego określenia ograniczeń analitycznych26,27,28. Niniejsze badanie adaptuje te uniwersalne zasady projektowania do analizy rekordów klinicznych, a nie do bibliometrii literatury. W rekordach źródłowych Hegan Jianpi Formula odnosi się do formuły opartej na doświadczeniu, związanej z praktyką profesora Nai-li Yao29,30. Powiązane publikacje opisują jego szersze kliniczne podejście do harmonizacji wątroby i śledziony oraz śledziony i żołądka29,30. W niniejszym artykule metodologicznym nazwa formuły identyfikuje jedynie kontekst rekordu źródłowego i nie ustanawia stałego składu, dawki, wskazania terapeutycznego ani twierdzenia co do skuteczności. Przepływ obliczeniowy wykorzystuje reguły deterministyczne i ogólne metody statystyczne. Powtarzalna praktyka obliczeniowa wymaga dodatkowo zachowania danych wejściowych, dokumentacji parametrów, zaprogramowanych transformacji oraz weryfikowalnych wyników31,32. Opcja sztucznej inteligencji (AI) pod nadzorem człowieka może pomagać w weryfikacji terminologii, przeglądach spójności między plikami oraz wizualnej kontroli jakości, pod warunkiem udokumentowania jej zastosowania. Ekspertyza kliniczna, zabezpieczenia prywatności i odpowiedzialne podejmowanie decyzji przez człowieka muszą pozostać nadrzędne (Supplementary Table 1)33,34. Ogólnym celem tej metody jest przekształcenie zanonimizowanych rekordów przypadków TCM w audytowany łańcuch wyników uwarstwionych według chorób, syndromów, objawów, zastosowania ziół, asocjacji, klasteryzacji i diagnoz. Przykład praktyczny wykorzystuje 555 kwalifikujących się wizyt z receptami od 396 pacjentów, aby zademonstrować, w jaki sposób zarządzanie, normalizacja, obliczenia, interpretacja kliniczna i publikacja wizualna mogą zostać zintegrowane bez ujawniania rekordów na poziomie pacjenta, dokładnych szczegółów formulacji, proporcji dawek lub instrukcji przepisywania.

Protokół

Ta retrospektywna analiza zanonimizowanych rekordów klinicznych została przeanalizowana i zatwierdzona przez Komisję Etyki Medycznej Szpitala Guang'anmen Chińskiej Akademii Nauk Medycznych (numer zatwierdzenia 2026-108-KY; 13 lipca 2026 r.). Wymóg uzyskania świadomej zgody został zniesiony przez Komisję.

1. Ustanowienie zasad etyki, ładu organizacyjnego i bezpieczeństwa danych

  1. Wyznacz opiekuna danych, analityka danych źródłowych, recenzenta terminologii klinicznej, recenzenta ilościowego oraz badacza upoważnionego do zatwierdzenia udostępnienia danych zagregowanych. Odnotuj każdą z tych ról w dzienniku projektu.
  2. Przygotuj plan zarządzania danymi, określając dozwolony system źródłowy, okres badania, pola, lokalizację przechowywania, uprawnienia do dostępu, procedurę kopii zapasowych, okres retencji oraz ograniczenia dotyczące kluczy powiązań.
  3. Eksportuj wyłącznie minimalny zestaw zmiennych wymaganych do uprzednio określonej analizy. Uwzględnij lokalny identyfikator pacjenta, datę wizyty, wiek lub datę urodzenia (jeśli jest to dozwolone), płeć, diagnozę zachodnią, nazwę choroby według TCM, zanonimizowany tekst historii choroby, opis języka, opis tętna, opis zespołu oraz pola dotyczące ziół w recepturze.
  4. Usuń imiona, nazwiska, numery identyfikacyjne, numery telefonów, dokładne adresy, identyfikatory ubezpieczeniowe, dane kontaktowe oraz inne bezpośrednie identyfikatory w kontrolowanym środowisku instytucjonalnym. Zastąp każdy numer dokumentacji medycznej identyfikatorem pacjenta specyficznym dla projektu.
  5. Przeskanuj pola tekstowe pod kątem pozostałych identyfikatorów i zamaskuj każdy wykryty element. Przechowuj każdy klucz powiązań oddzielnie od analitycznego zbioru danych i wyklucz go z folderów roboczych, współpracy oraz przesyłania danych.
  6. Zachowaj pierwotny zanonimizowany eksport jako migawkę źródłową w trybie tylko do odczytu. Zapisz nazwę pliku, datę utworzenia, liczbę wierszy, liczbę kolumn, rozmiar pliku oraz sumę kontrolną w manifeście źródłowym.
  7. Utwórz oddzielne katalogi dla plików źródłowych, plików roboczych, słowników, tabel zagregowanych, rycin, skryptów oraz zapisów audytu.
  8. Ogranicz udostępniane lub współdzielone materiały do tabel zagregowanych, zatwierdzonych zanonimizowanych słowników, skryptów i rycin do publikacji. Nie przesyłaj rekordów możliwych do identyfikacji lub potencjalnie możliwych do ponownej identyfikacji do publicznych systemów generatywnej AI, niezatwierdzonych usług chmurowych ani publicznych repozytoriów.
    UWAGA: Jeśli polityka instytucjonalna zezwala na pomoc AI pod nadzorem człowieka, dostarczaj wyłącznie zanonimizowane fragmenty tekstu lub tabele zagregowane. Odnotuj cel, zweryfikowany wynik, zaakceptowaną poprawkę, recenzenta oraz datę w dzienniku audytu.

2. Określenie reguły identyfikacji rekordów i jednostek analizy

  1. Zdefiniuj instytucję, warunki opieki ambulatoryjnej, odpowiedzialny zespół kliniczny, system elektronicznej dokumentacji medycznej oraz okres źródłowy przed rozpoczęciem przesiewu. W analizowanym przykładzie należy użyć zapisów z okresu od stycznia 2015 do czerwca 2024 roku.
  2. Przechowuj regułę identyfikacji kohorty w ograniczonym, kontrolowanym pod względem wersji pliku przed analizą wyników. Zapisz zaakceptowane warianty terminologiczne oraz wszystkie warunki włączenia i wykluczenia, nie ujawniając w manuskrypcie poufnych szczegółów formułowania tych reguł.
  3. Zastosuj zablokowaną wersję reguły identyfikacji zapisów na poziomie wizyty z przepisanym lekiem po normalizacji nazw ziół. Sfinalizuj pliki źródłowe, słowniki, regułę kohorty i parametry analizy jako jeden zestaw wydawniczy.
  4. Utwórz nową wersję i zregeneruj wszystkie zależne wyniki za każdym razem, gdy zmieni się komponent zablokowany wersyjnie. Nie modyfikuj reguły identyfikacji kohorty po przeanalizowaniu rozkładu chorób, częstotliwości występowania ziół, reguł asocjacji lub klastrów.
  5. Uwzględnij wizytę ambulatoryjną, jeśli mieści się ona w zablokowanym wersyjnie okresie badania, jest przypisana do poprawnego identyfikatora pacjenta w projekcie, zawiera interpretowalny zapis recepty i spełnia ograniczoną regułę identyfikacji zapisów.
  6. Wyklucz dokładne duplikaty eksportów, zapisy spoza okresu badania, zapisy bez interpretowalnej recepty oraz wiersze, które nie spełniają zablokowanej wersyjnie reguły identyfikacji. Przypisz jeden główny powód wykluczenia do każdego wykluczonego wiersza.
  7. Odróżnij powtórzone eksporty od rzeczywistych wizyt kontrolnych. Usuń wyłącznie dokładne duplikaty systemowe lub eksportowe i zachowaj rzeczywiste wizyty powtórne.
  8. Przypisz stabilne identyfikatory pacjentów i wizyt z przepisanym lekiem. Utwórz manifest kohorty zawierający wersję źródłową, wersję reguły, status przesiewu, powód włączenia lub wykluczenia, identyfikator pacjenta, identyfikator wizyty oraz status recenzenta.
  9. Używaj jednego zapisu na unikalnego pacjenta w celu przygotowania stałych podsumowań demograficznych, w tym wieku i płci. Przyjmij wizytę z przepisanym lekiem jako jednostkę analizy dla analiz chorób, zespołów, słów kluczowych z wywiadu, języka, tętna, ziół, reguł asocjacji oraz klastrowania.
  10. Oddziel kwalifikowalność do kohorty od dostępności zmiennych. Zachowaj wizytę, która w innym przypadku byłaby kwalifikowalna, nawet jeśli brakuje pola specyficznego dla danej zmiennej, i raportuj mianownik ocenialny dla każdej analizy.
  11. Zablokuj manifest kohorty przed przeprowadzeniem analizy opisowej. Zapisz liczbę kwalifikowalnych wizyt z przepisanym lekiem oraz liczbę unikalnych pacjentów i zregeneruj wszystkie zależne wyniki w przypadku zmiany decyzji o kwalifikowalności.

3. Normalizacja terminologii i zachowanie ścieżki audytu

  1. Utworzyć oddzielne słowniki z kontrolą wersji dla ziół, diagnoz zachodnich, nazw chorób w TCM, elementów zespołów, słów kluczowych wywiadu, terminów dotyczących języka, terminów dotyczących tętna oraz atrybutów materia medica.
  2. W każdym słowniku zawrzeć oryginalny termin, termin znormalizowany, kategorię terminu, pole źródłowe, regułę, źródło referencyjne, wersję słownika, recenzenta, datę recenzji oraz uwagi. Zachować każdy oryginalny termin po normalizacji.
  3. Normalizować nazwy chińskich materiałów leczniczych (CMM) przy użyciu autorytatywnych referencji nomenklaturowych9,10. Poprawić warianty typograficzne i skróty systemowe, zachowując jednocześnie klinicznie istotne formy przetworzenia.
  4. Zachować kwalifikatory przetworzenia, w tym: smażone (stir-fried), przetwarzane octem (vinegar-processed), smażone w miodzie (honey-fried), przetwarzane imbirem (ginger-processed), przetwarzane winem (wine-processed), zwęglone (charred) oraz surowe (raw), jako oddzielne etykiety.
  5. Utrzymywać oddzielnie zioła odmienne ortograficznie lub klinicznie. Nie łączyć Bai Shao z Bai Zhu ani nie wnioskować o rodzaju zioła z dwuznacznego skrótu bez weryfikacji źródła.
  6. Zachować oryginalną dawkę i jednostkę w oddzielnych polach, jeśli są dostępne. Usuwać tekst dawki wyłącznie podczas konstruowania zmiennych obecności ziół na poziomie wizyty.
  7. Nie interpretować częstotliwości występowania jako dawki skumulowanej lub intensywności leczenia.
  8. Normalizować nazwy chorób zachodnich i TCM niezależnie. Zachować system diagnostyczny oraz status diagnozy głównej; nie tłumaczyć etykiety choroby TCM na diagnozę zachodnią, chyba że obie zostały wyraźnie odnotowane.
  9. Przy pierwszym użyciu zdefiniować transliterowaną etykietę choroby TCM, jeśli jest to konieczne dla orientacji czytelnika. Zachować oryginalną etykietę źródłową.
  10. Rozdzielić wielowartościowy, jawny tekst zespołu za pomocą ograniczników zablokowanych wersyjnie i zmapować wyrażenia źródłowe na znormalizowane elementy zespołu. Usuwać powtórzenia każdego znormalizowanego elementu w obrębie jednej wizyty.
  11. Utrzymywać jawny tekst zespołu oddzielnie od kolumn wskaźników dziedziczonych lub pochodnych z punktacji.
  12. Zachować oryginalne pola języka, tętna, ustrukturyzowanych objawów oraz zanonimizowanego wywiadu jako oddzielne produkty danych. Nie traktować dopasowania słowa kluczowego z wywiadu jako równoważnego do ustrukturyzowanego objawu wprowadzonego przez klinicystę.
  13. Zlecić jednemu recenzentowi zaproponowanie każdego dwuznacznego lub wielo-do-jednego mapowania, a następnie przekazać je drugiemu recenzentowi klinicznemu do weryfikacji. Wykluczyć niepewne mapowania z publikowanych analiz do czasu ich rozstrzygnięcia w przeglądzie źródłowym.
  14. Sprawdzić pod kątem pustych znormalizowanych etykiet, mapowań jeden-do-wielu, mapowań wiele-do-jednego, duplikatów wpisów w słowniku, terminów nieprzejrzanych oraz przypadkowej utraty etykiet przetwarzania. Zablokować wersje słowników przed generowaniem tabel zagregowanych.

4. Weryfikacja pól źródłowych i blokada wyników raportowalnych

  1. Utwórz rejestr dowodów z jednym wierszem dla każdego twierdzenia w manuskrypcie, tabeli oraz panelu rysunku. Zapisz jednostkę analizy, pole źródłowe, wersję źródła, wersję słownika, wersję skryptu, licznik, mianownik, plik wyjściowy, recenzenta oraz zatwierdzone sformułowanie.
  2. Przelicz liczbę kwalifikujących się wizyt i unikalnych pacjentów, podsumowania demograficzne, liczbę przypadków chorób, liczbę jawnych zespołów objawów, liczbę słów kluczowych w historii, częstość występowania połączonych ziół oraz sumaryczne zużycie ziół bezpośrednio z plików zablokowanych wersyjnie.
  3. Porównaj każdą przeliczoną wartość z odpowiadającą jej wartością w manuskrypcie, arkuszu kalkulacyjnym lub na rysunku. Popraw manuskrypt i wygeneruj ponownie zależne wyniki za każdym razem, gdy zostanie potwierdzona rozbieżność.
  4. Rozwiąż każdą rozbieżność na poziomie pola źródłowego. Zapisz przyczynę, korektę, recenzenta i datę w rejestrze dowodów przed opublikowaniem dotkniętego tego problemu wyniku.
  5. Zweryfikuj, czy każda tabela zagregowana zawiera znormalizowaną etykietę, licznik, mianownik, definicję procentową, jednostkę analizy oraz identyfikator źródła wymagane do odtworzenia odpowiadającego stwierdzenia.
  6. Zweryfikuj mianownik użyty dla każdego procentu. Użyj unikalnych pacjentów dla stałych cech demograficznych oraz wizyt recepturowych dla dynamicznych zmiennych klinicznych i recepturowych.
  7. Porównaj etykiety rysunków, wartości, kolejność i definicje paneli z odpowiadającymi im zablokowanymi wersyjnie tabelami zagregowanymi. Regeneruj każdy rysunek po korekcie tabeli zamiast ręcznie edytować naniesione wartości.
  8. Poproś recenzenta klinicznego o weryfikację mapowań terminologicznych. Poproś recenzenta ilościowego o weryfikację liczności, wskaźników, metryk reguł i mianowników map ciepła.
  9. Zablokuj rejestr dowodów, tabele zagregowane i źródła rysunków pod jednym identyfikatorem wersji przed złożeniem manuskryptu.

5. Generowanie widm opisowych i wyników współwystępowania

  1. Wygeneruj podsumowania wieku i płci na poziomie pacjenta, przyjmując jeden wiersz dla każdego unikalnego pacjenta. Zachowaj i wyraźnie zaraportuj kategorie nieznane.
  2. Wygeneruj osobno widma chorób według medycyny zachodniej i TCM na poziomie wizyty z przepisywaniem leków. Zachowaj oryginalny system diagnostyczny i oblicz wiodące znormalizowane etykiety, stosując wspólny mianownik wizyt.
  3. Wygeneruj widmo syndromów-elementów z jawnego pola znormalizowanego tekstu syndromu. Rozdziel terminy za pomocą zablokowanych wersji ograniczników, usuń duplikaty każdego terminu w obrębie wizyty i oblicz częstotliwości na poziomie wizyt.
  4. Zbuduj macierz współwystępowania syndromów z tych samych zbiorów tokenów w obrębie wizyty. Zakoduj rozmiar węzła za pomocą częstotliwości wizyt, a szerokość krawędzi lub intensywność mapy ciepła za pomocą liczby współwystąpień parzystych.
  5. Wstępnie określ dokładny słownik słów kluczowych historii choroby w przypadku, gdy informacje o objawach mają głównie charakter opisowy. Przeskanuj wyłącznie zanonimizowane pole historii i policz każde pojęcie nie więcej niż raz w obrębie wizyty.
  6. Oblicz proporcję kwalifikujących się wizyt zawierających co najmniej jedno słowo kluczowe z historii i uszereguj wszystkie liczby słów kluczowych. Eksportuj pełną tabelę oraz wykreślony podzbiór.
  7. Wygeneruj częstotliwości połączonych ziół z znormalizowanych danych dotyczących recept. Policz każdą znormalizowaną etykietę zioła nie więcej niż raz na wizytę i zachowaj klinicznie istotne formy przetworzenia jako osobne etykiety.
  8. Wygeneruj profile Czterech Energii (Four-Qi), pięciu smaków i tropizmu południkowego na podstawie zablokowanego wersji słownika materia medica. Traktuj Cztery Energie jako kategorię jednowartościową dla każdego wystąpienia zioła z kodem właściwości.
  9. Traktuj pięć smaków i tropizm południkowy jako atrybuty wieloetykietowe. Określ mianownik zakodowany właściwością i zachowaj oddzielną jednostkę analizy.
  10. Wyeksportuj jedną tabelę zbiorczą czytelną dla maszyn dla każdej domeny opisowej przed wygenerowaniem końcowych wykresów.

6. Przeprowadzenie analiz reguł asocjacyjnych oraz klastrowania hierarchicznego

  1. Stwórz binarną macierz wizyt-recept-zioła z zablokowanej wersji znormalizowanej tabeli recept. Przypisz jeden wiersz do każdej kwalifikującej się wizyty i jedną kolumnę do każdej znormalizowanej etykiety zioła.
  2. Oblicz wsparcie (support), ufność (confidence) oraz lift dla skierowanych reguł asocjacyjnych pojedynczych ziół19. Zachowaj kierunek każdej reguły, ponieważ ufność zależy od poprzednika.
  3. Zastosuj zdefiniowane wcześniej progi: wsparcie ≥ 0.30, ufność ≥ 0.70 i lift > 1.0. Eksportuj każdą zatrzymaną regułę wraz z liczbą współwystępowania oraz wszystkimi trzema metrykami.
  4. Przedstaw kompletny zestaw zatrzymanych reguł w formie skierowanej dwudzielnej sieci reguł oraz uporządkowanego profilu siły reguł. Zakoduj szerokość krawędzi sieci za pomocą wsparcia, a kolor krawędzi za pomocą liftu.
  5. Zakoduj rozmiar punktu za pomocą wsparcia i opisz ufność w uporządkowanym profilu.
  6. Zweryfikuj, czy oba sposoby prezentacji reguł zawierają ten sam zestaw zatrzymanych reguł i zachowują kierunek reguły. Przed publikacją wyjaśnij każdą niezgodność w odniesieniu do wyeksportowanej tabeli reguł.
  7. Wybierz 20 zmiennych obecności ziół o najwyższej częstotliwości do klasteryzacji hierarchicznej. Oblicz parami odległości Jaccarda i zastosuj metodę średniego wiązania (average linkage).
  8. Oznacz dendrogram znormalizowanymi nazwami ziół. Interpretuj bliskość gałęzi wyłącznie jako podobieństwo w wzorcach występowania na poziomie wizyty.
  9. Przed generowaniem rycin wyeksportuj specyfikację macierzy binarnej, tabelę reguł, listę krawędzi sieci, kolejność danych wejściowych do klasteryzacji, macierz odległości oraz macierz wiązań.
  10. Poproś recenzenta ilościowego o ręczne odtworzenie jednej metryki reguły. Porównaj każdą krawędź sieci z tabelą reguł.
  11. Uruchom ponownie cały proces generowania reguł i klasteryzacji za każdym razem, gdy zmieni się kohorta, słownik terminologii lub macierz obecności ziół.
  12. W przypadku przykładu praktycznego przeprowadź deterministyczną analizę wrażliwości „jedna wizyta na pacjenta”, zachowując najwcześniejszy rekord zgodnie z kolejnością źródłową dla każdego pacjenta. Porównaj wynikowe 12 reguł z 15 regułami z analizy na poziomie wizyt.
  13. Zgłoś zmianę jako opisowy wynik odporności (robustness), a nie jako walidację na poziomie pacjenta. Skorzystaj z deterministycznego przeliczenia dostarczonego w Supplementary File 1.

7. Generowanie wzorców stratyfikowanych według diagnozy i ram interpretacji klinicznej

  1. Wybierz klinicznie istotne główne warstwy zachodniich diagnoz przed analizą rozkładu ziół specyficznych dla danej diagnozy.
  2. Zlicz każdą znormalizowaną etykietę zioła nie więcej niż raz na wizytę w obrębie każdej warstwy diagnozy. Oblicz rozpowszechnienie jako liczbę wizyt zawierających daną etykietę podzieloną przez całkowitą liczbę kwalifikujących się wizyt w tej warstwie.
  3. Użyj tego samego zestawu wyświetlanych ziół oraz stałej skali kolorystycznej 0%–100% dla wszystkich warstw diagnoz. Wyświetl wartości komórek, aby zachować dokładną interpretację.
  4. Przedstaw licznik i mianownik dla każdej wyświetlanej komórki w niezależnej tabeli zagregowanej.
  5. Stwórz oddzielny panel interpretacji klinicznej po ukończeniu opisowej mapy ciepła. Zachowaj wyraźny wizualny podział między obliczonymi wynikami a interpretacją ekspercką.
  6. Wypełnij warstwę wskazówek wyłącznie terminami, które można prześledzić w zablokowanej wersyjnie tabeli słów kluczowych historii lub w jawnych znormalizowanych opisach zespołów objawów.
  7. Poproś dwóch recenzentów klinicznych o uzgodnienie zwięzłych interpretacji kontekstowych dla wybranych wskazówek. Odnotuj recenzentów oraz ostateczne sformułowania w rejestrze dowodów.
  8. Powiąż każdą interpretację kontekstową z zastosowaniem badawczym, takim jak wybór zmiennych, walidacja prospektywna lub generowanie hipotez.
  9. W warstwie interpretacyjnej zastosuj przerywane łączniki niedyrekcjonalne. Pomiń treści dotyczące dawkowania, składu stałego oraz zaleceń terapeutycznych.
  10. Przejrzyj wspólnie mapę ciepła i panel interpretacyjny. Upewnij się, że obliczone rozpowszechnienie, kontekst ekspercki i przyszłe zastosowania badawcze pozostają wyraźnie odseparowane.

8. Przygotowanie i weryfikacja pakietu reprodukowalności

  1. Wyeksportuj manifest źródłowy, manifest kohorty, wersje słownika, rejestr dowodów, skrypty analizy, tabele zbiorcze, źródła ryciny oraz końcowe ryciny do osobnych katalogów.
  2. Nazwij każdy plik, używając stałego numeru ryciny lub tabeli oraz daty wersji. Zachowaj jedną aktualną wersję autorytatywną, a zastąpione wyniki zarchiwizuj osobno.
  3. Wygeneruj każdą rycinę jako jeden wielopanelowy plik obrazu. Wyeksportuj plik PDF w wysokiej rozdzielczości oraz plik PNG o rozdzielczości 300 dpi do wglądu.
  4. Umieść legendy ryciny w manuskrypcie i pozostaw je poza plikami obrazów. Opisz każdy panel, jednostkę analizy, mianownik oraz kodowanie wizualne.
  5. Przygotuj jeden niezależny plik XLSX dla każdej tabeli.
  6. Poproś niezależnego recenzenta o porównanie liczb w manuskrypcie z tabelami zbiorczymi oraz procentów z ich licznikami i mianownikami.
  7. Porównaj krawędzie reguł z tabelą reguł, a komórki mapy ciepła z macierzą źródłową.
  8. Uruchom automatyczne kontrole spójności nazw plików, wymaganych sekcji, wymiarów ryciny, liczby tabel, liczby referencji, pozostałości szablonu oraz zakazanych sformułowań.
  9. Poproś kliniczny zespół autorski o zweryfikowanie terminologii, interpretacji, granic własności intelektualnej, danych autorów, kolejności finansowania, sformułowań dotyczących etyki oraz końcowego zestawu rycin.
  10. Usuń z pakietu zgłoszeniowego pliki na poziomie pacjenta, klucze powiązań, nieograniczony wolny tekst, korespondencję wewnętrzną oraz tymczasowe artefakty z recenzji.
  11. Zablokuj wydany pakiet i zapisz jego wersję, datę, sumę kontrolną, wersję manuskryptu oraz status zatwierdzenia przez autorów. Utwórz nową wersję i dziennik zmian dla każdej kolejnej korekty.

Wyniki

Pomyślne zastosowanie protokołu pozwoliło na stworzenie możliwego do prześledzenia łańcucha łączącego zanonimizowany obraz źródłowy, manifest kohorty, słowniki terminologiczne, tabele zagregowane, skrypty oraz końcowe wykresy. Zablokowana wersja procedury przesiewowej zidentyfikowała 555 kwalifikujących się wizyt związanych z wypisaniem recept u 396 unikalnych pacjentów. Rycina 1 podsumowuje trzy skoordynowane etapy metody: nadzór, normalizację terminologiczną oraz analizę z przeglądem klinicznym. Odpowiednia dokumentacja przejrzystości i audytu, w tym granica danych zagregowanych dla przeglądu wspomaganego przez AI, została przedstawiona w Tabeli uzupełniającej 1.

Końcowa kohorta obejmowała 555 kwalifikujących się wizyt związanych z receptami, pochodzących od 396 unikalnych pacjentów (Rysunek 2 i Tabela 1). Rzeczywiste wizyty powtórne zachowano dla dynamicznych zmiennych klinicznych i recepturowych, natomiast wiek i płeć podsumowano po deduplikacji na poziomie pacjenta. Wiek pacjentów wahał się od 13 do 94 lat, przy średniej 47,11 lat i odchyleniu standardowym 14,88 lat. Kohorta obejmowała 228 pacjentek (57,58%), 167 pacjentów (42,17%) oraz 1 pacjenta o nieznanej płci (0,25%). Takie rozdzielenie jednostek analizy pozwoliło na zachowanie przebiegu wizyt podłużnych bez zawyżania mianownika demograficznego.

Spektra chorób w medycynie zachodniej i TCM podsumowano na Rysunku 3. Diagnozy zachodnie koncentrowały się na schorzeniach układu pokarmowego, dróg żółciowych i wątroby oraz trzustki. Grupowanie hierarchiczne przypisało 271 wizyt do schorzeń układu pokarmowego, 222 do schorzeń dróg żółciowych i wątroby lub trzustki oraz 62 do innych układów (Rysunek 3A). Dominującymi pojedynczymi diagnozami były przewlekłe zapalenie żołądka w 133 wizytach (23,96%), stłuszczenie wątroby w 77 wizytach (13,87%) oraz marskość wątroby w 46 wizytach (8,29%), a następnie przewlekłe zanikowe zapalenie żołądka, ból brzucha, przewlekłe zapalenie wątroby typu B, dyspepsja, refluksowe zapalenie przełyku, przewlekłe powierzchowne zapalenie żołądka oraz przewlekłe zapalenie trzustki (Rysunek 3C i Tabela 2).

Odpowiadające im spektrum nazw jednostek chorobowych w TCM zorganizowało te same wizyty zgodnie z równoległym systemem diagnostycznym. Nazwy chorób śledziony, żołądka lub jelit stanowiły 280 wizyt, chorób wątroby i pęcherzyka żółciowego 223, zaburzeń qi, krwi i płynów 26, zaburzeń ducha, klatki piersiowej i głowy 12, zaburzeń kanałów lub kończyn 5, zaburzeń ginekologicznych 4, a pozostałe kategorie 5 wizyt (Rycina 3B). Wei pi, zachowana etykieta choroby w TCM oznaczająca pełność lub dyskomfort w nadbrzuszu, została odnotowana w 163 wizytach (29,37%). Ji disease (etykieta TCM typu akumulacji), Gan zhuo (dosłownie: utrwalenie wątroby; zachowana klasyczna etykieta choroby w TCM), Bi disease (choroba zatorowa) oraz Xiao ke (pragnienie marniejące) zostały zachowane jako źródłowe etykiety TCM i nie zostały przekształcone w nowoczesne diagnozy biomedyczne. Gan pi, etykieta choroby w TCM stosowana we współczesnym chińskim konsensusie dotyczącym stłuszczenia wątroby, została odnotowana w 77 wizytach (13,87%)35. Źródłowe pola zachodnie i TCM pozostały niezależne i nie były stosowane zamiennie (Rycina 3D oraz Tabela 3). Xie xie (stolce luźne lub wodniste) oraz Fu xie (biegunka) były oddzielnymi oryginalnymi etykietami chorób w TCM, odnotowanymi odpowiednio 6 i 2 razy, i żadna z nich nie została utożsamiona z nowoczesną diagnozą biomedyczną. Przedstawienie obu spektrów obok siebie pozwoliło zachować logikę każdego z systemów diagnostycznych, wykazując jednocześnie kliniczny zakres zapisów źródłowych.

Jawne znormalizowane pole tekstu zespołu objawów zawierało 555 kwalifikujących się wierszy z wizyt. Po usunięciu duplikatów w obrębie wizyt, dominującymi elementami były: śledziona w 362 wizytach (65,23%), wątroba w 304 (54,77%), niedobór qi w 295 (53,15%), żołądek w 171 (30,81%), wilgoć w 151 (27,21%) oraz stagnacja qi w 109 (19,64%; Rysunek 4A i Tabela 4). Pozostałą część przedstawionego spektrum stanowiły: gorąco, retencja wody, krew, zastój krwi, kanały, nerki, serce oraz niedobór yin. Procenty nie były wzajemnie wykluczające się, ponieważ podczas jednej wizyty mogło wystąpić wiele elementów zespołu objawów.

Sieć oraz macierz liczbową wygenerowano z tych samych zestawów tokenów na poziomie wizyty (Rysunek 4B,C). Częste współwystępowanie koncentrowało się wokół śledziony, wątroby i niedoboru qi, z dodatkowymi powiązaniami z żołądkiem, wilgocią, stagnacją qi, gorącem i retencją wody. Zastosowanie jednej macierzy z zablokowaną wersją dla wykresu częstotliwości, sieci i mapy ciepła zapewniło, że wszystkie trzy panele reprezentowały te same dowody podstawowe na różnych poziomach szczegółowości. Przeprowadzony audyt odzyskanych danych wykazał 0 dokładnych dopasowań tekstu zespołu objawów/wskaźnika wśród 555 wierszy oraz średnią podobieństwo Jaccarda tekstu-wskaźnika na poziomie 0,1806. W związku z tym kolumny wskaźników zostały wyłączone z merytorycznego raportowania. Zachowane materiały nie zawierały rekonstruowalnych wektorów rozkładu sprzed oczyszczania; w konsekwencji nie oszacowano stabilności rozkładu pomiędzy wersjami. Analiza wrażliwości dla jednej wizyty na pacjenta odnosiła się natomiast do wpływu powtarzających się wizyt. Wyniki audytu źródeł i jakości danych podsumowano w Tabeli uzupełniającej 2.

Po normalizacji terminologii i zachowaniu klinicznie istotnych form przetwarzania, 555 wizyt obejmowało 324 odrębne zunifikowane etykiety ziół oraz 9339 przypadków stosowania ziół. Bai Shao odnotowano w 531 wizytach (95,68%), następnie Fu Ling w 520 (93,69%), Dang Gui w 510 (91,89%), Chi Shao w 467 (84,14%) oraz prażony Bai Zhu w 361 (65,05%). Rysunek 5A i Tabela 5). Krzywa rangi i częstotliwości 36 głównych etykiet wykazała stromy segment o wysokiej częstotliwości, po którym następował stopniowo rozszerzający się ogon (Rysunek 5B), co stanowiło zwarte przedstawienie komponentów wspólnego tła i indywidualnych zaleceń. Mapowania źródeł na formy znormalizowane, kwalifikatory przetwarzania, standardowe nazwy CMM, gatunki źródłowe oraz granice dowodowe leżące u podstaw nomenklatury ziół zostały udokumentowane w Tabela uzupełniająca 3.

Pomocniczy słownik materia medica zawierał 9 115 wystąpień zastosowań ziół z kodowaniem właściwości. Dominującymi kategoriami Czterech Energii (Four-Qi) były: ciepła (2 588, 28,39%), lekko zimna (2 339, 25,66%), neutralna (2 330, 25,56%) oraz zimna (1 221, 13,40%; Rysunek 5C). Po normalizacji terminologii smaku źródeł związków, głównymi kategoriami pięciu smaków były: gorzki (4 488, 49,24%), słodki (4 377, 48,02%) oraz ostry (2 893, 31,74%) (Rysunek 5D). W kodowaniu tropizmu południkowego dominowały: śledziona (5 541, 60,79%), wątroba (4 801, 52,67%), płuca (3 358, 36,84%), żołądek (2 988, 32,78%) oraz serce (2 702, 29,64%; Rysunek 5E). Rysunek 5F przedstawia odrębne jednostki analizy na poziomie wizyty oraz jednostki z kodowaniem właściwości wraz z powiązaniami ich powtarzalności. Wspólnie panele te demonstrują, w jaki sposób częstotliwość przepisywania oraz zstandaryzowane deskryptory materia medica mogą zostać podsumowane bez utraty terminologii specyficznej dla procesu przetwarzania.

Wstępnie określony słownik historii zawierał 37 dokładnych pojęć dotyczących objawów. Przynajmniej jedno pojęcie wykryto w 474 z 555 kwalifikujących się wizyt (85,41%). Dominującymi terminami były: suchość w gardle w 178 wizytach (32,07%), zmęczenie w 151 (27,21%), problemy ze snem w 139 (25,05%), wzdęcia brzucha w 115 (20,72%), refluks żołądkowo-przełykowy w 100 (18,02%), gorzki smak w 99 (17,84%), zgaga w 90 (16,22%), czkawka w 87 (15,68%), odbijanie w 87 (15,68%) oraz luźne stolce w 77 (13,87%; Rysunek 6A,B oraz Tabela 6).

Pełna krzywa rangi i częstotliwości przedstawiała cały rozkład 37 terminów, natomiast linia skumulowana podsumowywała koncentrację wszystkich wykrytych słów kluczowych w poszczególnych rangach (Ryc. 6C). Ryc. 6D przedstawia powtarzalną sekwencję użytą do wygenerowania spektrum: zablokowanie słownika, skanowanie zanonimizowanego tekstu historii, usuwanie powtarzających się pojęć w obrębie każdej wizyty oraz eksport zagregowanych liczb i wskaźników.

W procesie wydobywania reguł asocjacyjnych wykorzystano zablokowaną wersyjnie macierz obecności ziół w wizytach z przepisaniem leków, składającą się z 555 wierszy. Piętnaście skierowanych reguł dla pojedynczych ziół spełniło kryteria: wsparcie (support) ≥ 0,30, ufność (confidence) ≥ 0,70 oraz lift > 1,0 (Rysunek 7A,B oraz Tabela 7). Zachowane wartości wsparcia mieściły się w zakresie od 0,3009 do 0,7892, wartości ufności od 0,7302 do 0,9748, a wartości lift od 1,0010 do 1,1226.

Najczęściej współwystępującą skierowaną parą była Chi Shao > Fu Ling, na podstawie 438 wizyt, przy wsparciu (support) 0,7892, ufności (confidence) 0,9379 i lift 1,0010. Reguła odwrotna miała takie samo wsparcie i ufność na poziomie 0,8423, co pokazuje, dlaczego należy zachować kierunek reguły. Analiza wrażliwości progów pozwoliła zachować odpowiednio 18, 11, 21, 14, 7 i 4 reguły przy wsparciu ≥ 0,25 lub ≥ 0,35, ufności ≥ 0,65 lub ≥ 0,75 lub lift > 1,02 lub > 1,05. W analizie uwzględniającej jedną wizytę na pacjenta ta sama para wystąpiła w 316 wizytach, przy wsparciu 0,7980, ufności 0,9489 i lift 0,9994; w związku z tym nie została ona zachowana przy kryterium lift > 1,0. Wyniki perturbacji progów i wrażliwości na powtórne wizyty znajdują się w Tabeli uzupełniającej 4, a deterministyczne przeliczenia w Pliku uzupełniającym 1. W związku z tym wysokiego wsparcia na poziomie wizyt nie należy interpretować jako walidacji na poziomie pacjenta.

Najwyższe wartości liftu zaobserwowano dla Gan Cao > stir-fried Bai Zhu (1,1226) oraz Gan Cao > Chi Shao (1,1200). Rysunek 7A integruje wszystkie 15 zachowanych reguł w skierowanej sieci dwudzielnej, gdzie szerokość krawędzi koduje wsparcie (support), a kolor krawędzi koduje lift. Rysunek 7B szereguje te same reguły według liftu, skaluje każdy punkt zgodnie ze wsparciem oraz nanosi adnotacje dotyczące ufności (confidence). Tym samym oba panele odróżniają topologię sieci od ilościowej siły reguł, zamiast powielać tę samą reprezentację wizualną.

Grupowanie hierarchiczne 20 najczęściej występujących zmiennych dotyczących ziół zostało wykonane z wykorzystaniem odległości Jaccarada i metody wiązania średniego (Rycina 7C). Dendrogram zapewnia globalną reprezentację podobieństwa wzorców obecności na poziomie wizyt, co uzupełnia lokalne informacje kierunkowe dostarczone przez reguły asocjacyjne. Razem panele te demonstrują, w jaki sposób komplementarne ujęcia analityczne mogą zostać dopasowane do jednej, zablokowanej wersji macierzy binarnej.

Obliczono rozpowszechnienie w podziale na diagnozę dla stłuszczenia wątroby (77 wizyt), marskości wątroby (46 wizyt) oraz przewlekłego zapalenia żołądka (133 wizyty; Rycina 8A i Tabela 8). Bai Shao, Fu Ling oraz Dang Gui wykazały wysokie rozpowszechnienie we wszystkich trzech warstwach. W wizytach dotyczących marskości wątroby odnotowano znaczną obecność Dan Shen (95,65%), E Zhu przetwarzanego octem (86,96%), Bie Jia przetwarzanego octem (84,78%) oraz Sheng Huang Qi (60,87%). Wizyty związane ze stłuszczeniem wątroby wykazały wyższe rozpowszechnienie Yin Chen (41,56%) i Ze Xie (31,17%) niż w pozostałych warstwach, natomiast w wizytach dotyczących przewlekłego zapalenia żołądka często pojawiały się Huang Lian (44,36%), Mu Xiang (34,59%) i Chai Hu (36,09%). Mapa ciepła dostarcza zatem zwięzłego porównania opisowego zagregowanych wzorców przepisywania leków w głównych kontekstach klinicznych.

Rysunek 8B oddziela obliczenia od interpretacji. Zweryfikowane wskazówki historyczne są powiązane z zwięzłymi kontekstami eksperckimi, a następnie z zastosowaniami badawczymi, obejmującymi kontekstualizację elementów zespołu, porównywanie wzorców stratyfikowanych według diagnozy, wybór zmiennych do prospektywnej walidacji oraz generowanie pytań uzupełniających. Ten ostatni panel pokazuje, w jaki sposób wiedza kliniczna może wzbogacić wyniki analityczne, pozostając jednocześnie wyraźnie oddzieloną od obliczonej częstości występowania.

Rysunek 8C podsumowuje powtarzalność i granicę wydzielenia, odróżniając komponenty zweryfikowane u źródła lub przeanalizowane ponownie od elementów wymagających ostrożności lub dalszego potwierdzenia. Ta końcowa warstwa audytu zapobiega prezentowaniu nierozwiązanych lub niemożliwych do odtworzenia produktów analitycznych jako zwalidowanych wyników.

figure-results-1
Rysunek 1: Przepływ pracy w procesie wydobywania danych z rekordów przypadków poddanych audytowi źródłowemu. Zarządzanie, normalizacja terminologii, analiza zagregowana, przegląd kliniczny oraz pakietowanie wydania zostały przedstawione jako następujące po sobie etapy przepływu pracy. Niebieskie, zielone i pomarańczowe pasy odróżniają domeny przepływu pracy, a przerywane linie pionowe wskazują bramki audytowe. Strzałki wskazują sekwencję przepływu pracy i nie implikują przyczynowości biologicznej. Reguła wydania określa, że udostępniane są wyłącznie wyniki zagregowane, identyfikatory pacjentów są wykluczone, a każda raportowana wartość pozostaje możliwa do prześledzenia do tabeli źródłowej z zablokowaną wersją. Słupki błędów nie mają zastosowania. Kliknij tutaj, aby zobaczyć powiększoną wersję tego rysunku.

figure-results-2
Rysunek 2: Profil zbioru danych i dane demograficzne pacjentów. Pola podsumowania zawierają informacje o 555 wizytach związanych z wypisaniem recept, 396 unikalnych pacjentach, zakresie wieku pacjentów od 13 do 94 lat ze średnim wiekiem 47,11 ± 14,88 lat oraz 324 złączonych etykietach ziół reprezentujących 9 339 przypadków stosowania ziół. (A) Rozkład płci wśród 396 unikalnych pacjentów, obejmujący kategorie: kobieta, mężczyzna i nieznana. (B) Rozkład wieku pacjentów według płci wśród tych samych 396 pacjentów. Pola podsumowania wykorzystują wyświetlane mianowniki na poziomie wizyt lub pacjentów, w zależności od kontekstu. Kolory rozróżniają kategorie płci oraz elementy podsumowania i nie mają znaczenia wnioskującego. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

figure-results-3
Rycina 3: Spektra chorób odzyskane z wizyt recepturowych. (A) Hierarchiczne grupy chorób zachodnich i (B) hierarchiczne grupy chorób TCM wywodzące się z 555 kwalifikujących się wizyt recepturowych. (C) Główne znormalizowane diagnozy zachodnie i (D) główne znormalizowane nazwy chorób TCM z tego samego mianownika na poziomie wizyt. Segmenty pierścieni i słupki reprezentują liczbę wizyt; kolory rozróżniają systemy diagnostyczne lub kategorie i nie reprezentują efektów leczenia. Zachowane etykiety źródłowe TCM zdefiniowano w Tabeli 3: Wei pi (pełność lub dyskomfort w nadbrzuszu), Ji disease (etykieta źródłowa TCM typu akumulacyjnego), Gan pi (etykieta choroby TCM stosowana w zaburzeniach stłuszczenia wątroby), Gan zhuo (dosłownie: utrwalenie wątroby; zachowana klasyczna etykieta choroby TCM), Bi disease (choroba z przeszkody/zatorowa), Xiao ke (wycieńczające pragnienie), Xie xie (luźne lub wodniste stolce) oraz Fu xie (biegunka). Te objaśnienia nie zamieniają etykiet źródłowych w nowoczesne diagnozy biomedyczne. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

figure-results-4
Rysunek 4: Jawne widmo tekstu zespołu oraz struktura współwystępowania. (A) Częstości na poziomie wizyt dla 14 znormalizowanych elementów zespołu po usunięciu duplikatów w obrębie wizyty, przyjmując 555 kwalifikujących się wizyt z przepisanymi lekami jako mianownik. (B) Sieć współwystępowania 12 najczęstszych elementów zespołu; rozmiar węzła reprezentuje częstotliwość wizyt, a szerokość i przezroczystość krawędzi reprezentują liczbę parzystych współwystąpień. (C) Odpowiadająca im symetryczna macierz liczby współwystąpień; komórki na przekątnej reprezentują częstotliwość wizyt indywidualnych, a komórki poza przekątną reprezentują liczbę parzystych współwystąpień. Pasek audytu wykazuje 0 dokładnych dopasowań tekstu zespołu/wskaźnika w 500 wierszach oraz średnią podobieństwo Jaccarda między tekstem a wskaźnikiem na poziomie 0,1806; w związku z tym kolumny wskaźników dziedzicznych zostały wykluczone z merytorycznego raportowania. W macierzy „Qi def.” oznacza niedobór qi, „Qi stag.” oznacza stagnację qi, a „Water ret.” oznacza retencję wody. Paleta kolorów ma charakter opisowy. Nie zastosowano słupków błędów. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

figure-results-5
Rysunek 5: Często występujące zioła oraz znormalizowane profile atrybutów materia medica. (A) Dwadzieścia najczęstszych znormalizowanych etykiet ziół spośród 555 kwalifikujących się wizyt związanych z przepisywaniem leków. (B) Profil częstotliwości rangowej 36 wiodących znormalizowanych etykiet ziół. (C) Rozkład Four-Qi oparty na 9 115 przypadkach użycia ziół z zakodowanymi właściwościami; Four-Qi jest wartością pojedynczą dla każdego zakodowanego przypadku. (D) Rozkład Five-flavor i (E) rozkład tropizmu południkowego (meridian-tropism) oparte na tym samym mianowniku zakodowanych właściwości; oba są atrybutami wieloetykietowymi, zatem liczby w kategoriach nie są wzajemnie wykluczające się. (F) Jednostki analizy na poziomie wizyty oraz jednostki z zakodowanymi właściwościami wraz z łącznikiem ich odtwarzalności. Długości słupków reprezentują liczebność, a kolory rozróżniają panele. Słupki błędów nie mają zastosowania. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

figure-results-6
Rysunek 6: Spektrum słów kluczowych dotyczących objawów pochodzących z wywiadu oraz powtarzalny schemat agregacji. (A) Odsetek 555 kwalifikujących się wizyt recepturowych zawierających co najmniej jedno określone słowo kluczowe z wywiadu; 474 wizyty (85,41%) zawierały co najmniej jedno słowo kluczowe. (B) Piętnaście najczęstszych dokładnych pojęć objawów pochodzących z wywiadu. (C) Pełny rozkład częstotliwości rankingowej dla 37 terminów oraz skumulowany udział wykrytych słów kluczowych. (D) Zablokowany wersyjnie schemat postępowania od określonego słownika do wyników zagregowanych. Każde pojęcie było liczone nie więcej niż raz w ramach jednej wizyty, podczas gdy w tej samej wizycie mogło wystąpić wiele pojęć. Pomarańczowe słupki reprezentują liczbę słów kluczowych, a kolory schematu rozróżniają etapy przetwarzania. Słupki błędu nie mają zastosowania. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

figure-results-7
Rysunek 7: Skierowane reguły asocjacyjne ziół i klasteryzacja hierarchiczna. (A) Skierowana sieć dwudzielna wszystkich 15 reguł asocjacyjnych dla pojedynczych ziół spełniających zastalone progi: support ≥ 0.30, confidence ≥ 0.70 i lift > 1.0. Szerokość krawędzi reprezentuje support, a kolor krawędzi reprezentuje lift. (B) Profil siły reguł dla tych samych 15 reguł uszeregowanych według wartości lift; rozmiar punktu reprezentuje support, a sąsiednie etykiety podają confidence (conf.). (C) Klasteryzacja hierarchiczna z metodą średniego wiązania dla 20 zmiennych obecności ziół o najwyższej częstotliwości z wykorzystaniem odległości Jaccarda. Wszystkie panele wykorzystują wizyty po receptę jako jednostkę analizy i opisują wzorce współwystępowania zapisów, a nie skuteczność, synergię lub zalecaną kombinację stałą. Słupki błędów nie mają zastosowania. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

figure-results-8
Rycina 8: Zagregowane wzorce stosowania ziół z rozwarstwieniem według diagnozy, mapa wzorców klinicznych oraz granica publikacji. (A) Mapa ciepła z rozwarstwieniem według diagnozy, przedstawiająca rozpowszechnienie 16 znormalizowanych etykiet ziół na poziomie wizyt w przypadku stłuszczenia wątroby (n = 77), marskości wątroby (n = 46) oraz przewlekłego zapalenia żołądka (n = 133). Każda komórka reprezentuje procent kwalifikujących się wizyt w ramach odpowiadającej warstwy diagnozy zachodniej, przy użyciu stałej skali kolorów 0%–100%. (B) Wyprowadzona z zapisów mapa wzorców klinicznych łącząca zweryfikowane wskazówki z zapisów z znormalizowanymi grupami tekstowymi i zaobserwowanymi zagregowanymi etykietami ziół. Przerywane, niedyrekcyjne połączenia odróżniają tę opisową warstwę interpretacyjną od obliczonego rozpowszechnienia; panel ten nie stanowi rekomendacji terapeutycznej. (C) Powtarzalność i granica publikacji odróżniająca komponenty zweryfikowane w źródłach lub poddane reanalizie od elementów wymagających ostrożności lub potwierdzenia. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

MetrykaWartośćJednostka/mianownikStatus
Wizyty recepturowe555555 wizyt z receptązweryfikowano na podstawie odzyskanego pliku XLSX
Unikalni pacjenci396396 unikalnych pacjentówzweryfikowano na podstawie odzyskanego pliku XLSX
Zakres wieku na poziomie pacjenta13-94latazweryfikowano
Średnia wieku na poziomie pacjenta +/- SD47.11 +/- 14.88latazweryfikowano
Średnia wieku +/- SD na poziomie wizyty48.22 +/- 15.82latazweryfikowano
Płeć na poziomie pacjentaKobiety: 228; mężczyźni: 167; nieznana płeć: 1396 pacjentówzweryfikowano
Płeć na poziomie wizytyKobiety: 327; mężczyźni: 227; nieznana płeć: 1555 odwiedzinzweryfikowano
Złączone zioła324wyróżniające się scalone nazwyzweryfikowano
Połączone przypadki stosowania ziół9339555 wizyt związanych z wypisywaniem receptzweryfikowano

Tabela 1: Profil zbioru danych. Demograficzne charakterystyki na poziomie pacjenta oraz zmienne na poziomie wizyty po receptę przedstawiono z zastosowaniem odpowiednich mianowników. Podano również znormalizowane sumy ziół.

Nazwa chorobyLiczbaProcent wizyt
Przewlekłe zapalenie żołądka13324
Stłuszczenie wątroby7713.9
Marskość wątróby468.3
Przewlekłe zapalne zapalenie zanikowe żołądka224
Ból brzucha224
Przewlekłe zapalenie wątroby typu B203.6
Dyspepsja193.4
Refluksowe zapalenie przełyku81.4
Przewlekłe powierzchowne zapalenie żołądka71.3
Przewlekłe zapalenie trzustki61.1
Wrzodziejące zapalenie jelita grubego61.1
Polip pęcherzyka żółciowego61.1
Zespół pocholecystektomiczny61.1
Dysfunkcja jelit61.1
Kamienie żółciowe61.1
Przewlekłe zapalenie wątroby50.9
Zmęczenie50.9
Dysfunkcja przewodu pokarmowego (niepewna oryginalna etykieta)50.9
Przewlekłe zapalenie żołądka (niepewny opis pierwotny)50.9
Autoimmunologiczna marskość wątroby40.7

Tabela 2: Główne znormalizowane diagnozy zachodnie. Liczby i procenty głównych znormalizowanych diagnoz zachodnich odnotowane podczas 555 kwalifikujących się wizyt związanych z receptami. Procenty obliczono, przyjmując liczbę kwalifikujących się wizyt związanych z receptami jako mianownik.

Nazwa jednostki chorobowej według TCMLiczbaProcent wizyt
Wei pi (pełność lub dyskomfort w nadbrzuszu)16329.4
Ji disease (etykieta TCM dla jednostek typu kumulacyjnego)8615.5
Gan pi (etykieta TCM stosowana w zaburzeniach stłuszczenia wątroby)7713.9
Ból żołądka6111
Ból w podżebrzu325.8
Ból brzucha315.6
Gan zhuo (dosłownie: utrwalenie wątroby; zachowana klasyczna etykieta chorobowa TCM)285
Wycieńczenie z niedoboru173.1
Refluks treści kwaśnej91.6
Xie xie (stolce luźne lub wodniste)61.1
Bezsenność40.7
Czerwonka40.7
Ból głowy40.7
Bi disease (zespół zablokowania/utrudnienia)40.7
Zaburzenia miesiączkowania30.5
Uciski w klatce piersiowej30.5
Zaburzenia pocenia30.5
Zaparcia30.5
Fu xie (biegunka)20.4
Xiao ke (pragnienie wyniszczające)20.4

Tabela 3: Główne znormalizowane nazwy chorób w TCM. Liczba i odsetki głównych znormalizowanych nazw chorób w TCM odnotowane w 555 kwalifikujących się wizytach związanych z receptami. Odsetki obliczono, przyjmując liczbę kwalifikujących się wizyt związanych z receptami jako mianownik. Zachowane etykiety źródłowe i glosy wyjaśniające nie implikują równoważności z nowoczesnymi diagnozami biomedycznymi.

RangaElement zespołuWizyty recepturoweKwalifikujące się wizytyProcent odwiedzin
1śledziona36255565.23%
2wątroba30455554.77%
3niedobór qi29555553.15%
4żołądek17155530.81%
5wilgoć15155527.21%
6staza energii qi10955519.64%
7ciepło9755517.48%
8zatrzymywanie wody9455516.94%
9Krew8755515.68%
10staza krwi5855510.45%
11kanały5755510.27%
12nerka435557.75%
13serce375556.67%
14niedobór yin345556.13%

Tabela 4: Główne znormalizowane elementy zespołów objawów. Elementy zespołów objawów zostały wyekstrahowane z jawnego znormalizowanego tekstu opisującego zespoły i usunięto duplikaty w ramach każdej wizyty związanej z receptą. Liczby oparto na mianowniku wynoszącym 555 kwalifikujących się wizyt związanych z receptą; wartości procentowe nie są wzajemnie wykluczające się, ponieważ podczas jednej wizyty mogą wystąpić wiele elementów zespołu objawów.

Zintegrowana etykieta ziółLiczbaProcent wizyt
Bai Shao53195.7
Fu Ling52093.7
Dang Gui51091.9
Chi Shao46784.1
Smażony Bai Zhu36165
E Zhu przetwarzane octem30755.3
Tai Zi Shen28451.2
Dan Shen28250.8
Gan Cao27850.1
Huang Lian19935.9
Sheng Huang Qi17631.7
Mu Xiang17631.7
Chai Hu14425.9
Ji Nei Jin przetwarzane octem14225.6
Mu Dan Pi13724.7
Sheng Di Huang13123.6
Gan Cao smażone w miodzie12923.2
Fa Ban Xia11921.4
Chuan Xiong11320.4
Hou Po przetworzone imbirem10619.1
Yin Chen10418.7
Sheng Bai Zhu9717.5
Dou Kou9617.3
Sheng Long Gu9216.6
Zhe Bei Mu9016.2
Huang Qin8815.9
Dang Shen8515.3
Bie Jia przetwarzane octem8315
Gui Zhi8315
Sheng Mu Li8114.6
Jiao Zhi Zi7413.3
He Huan Hua6912.4
Huang Jing przetworzone winem6611.9
Chen Pi6411.5
Ze Xie6311.4
Jin Qian Cao6111

Tabela 5: Główne znormalizowane etykiety ziół według częstotliwości występowania w wizytach recepturowych. Każda znormalizowana etykieta zioła została policzona maksymalnie raz na jedną wizytę recepturową. Liczby i wartości procentowe obliczono przyjmując za mianownik 555 kwalifikujących się wizyt recepturowych; klinicznie istotne formy przetworzenia zachowano jako oddzielne etykiety.

RangaSłowo kluczowe pochodne z historiiWizyty recepturoweKwalifikujące się wizytyProcent odwiedzin
1Suchość w gardle17855532.07%
2Zmęczenie15155527.21%
3Zaburzenia snu13955525.05%
4Wzdęcie brzucha11555520.72%
5Refluks kwasowy10055518.02%
6Gorzki smak9955517.84%
7Zgaga9055516.22%
8Czkawka8755515.68%
9Bekanie8755515.68%
10Luźny stolec7755513.87%
11Biegunka7755513.87%
12Wzdęcie nadbrzusza7655513.69%
13Ból brzucha7355513.15%
14Łatwe wybudzanie5955510.63%
15Zawroty głowy545559.73%
16Wymioty525559.37%
17Nudności525559.37%
18Tępy ból515559.19%
19Ból rozsadzający505559.01%
20Brak apetyku445557.93%
21Ból brzucha435557.75%
22Ucisk w klatce piersiowej275554.86%
23Drażliwość265554.68%
24Ból głowy235554.14%
25Borborygmus235554.14%
26Dyskomfort w nadbrzuszu215553.78%
27Kołatania serca195553.42%
28Żółty mocz185553.24%
29Uczucie ciała obcego155552.70%
30Ból kłujący145552.52%
31Zaparcia135552.34%
32Senność125552.16%
33Uczucie ciała obcego w gardle95551.62%
34Nadmierna potliwość85551.44%
35Ból w nadbrzuszu / Ból w podżebrzu55550.90%
36Tenesmus55550.90%
37Suche stolce35550.54%

Tabela 6: Główne słowa kluczowe objawów wywiedzionych z historii choroby. Dokładne pojęcia dotyczące objawów wykryte w zanonimizowanych tekstach historii choroby. Każde pojęcie było liczone nie więcej niż raz w ramach jednej wizyty związanej z receptą, podczas gdy w ramach tej samej wizyty mogło wystąpić wiele pojęć. Liczby i procenty obliczono przyjmując 555 kwalifikujących się wizyt związanych z receptą jako mianownik.

PoprzednikNastępnikWspółwystępujące wizytyWsparcieUfnośćLift
Chi ShaoFu Ling4380.78920.93791.0010
Fu LingChi Shao4380.78920.84231.0010
Smażony Bai ZhuFu Ling3500.63060.96951.0348
Smażony Bai ZhuBai Shao3480.62700.96401.0076
Smażony Bai ZhuChi Shao3200.57660.88641.0535
Tai Zi ShenFu Ling2730.49190.96131.0260
Tai Zi ShenBai Shao2720.49010.95771.0010
Gan CaoBai Shao2710.48830.97481.0189
Gan CaoChi Shao2620.47210.94241.1200
Tai Zi ShenChi Shao2420.43600.85211.0127
Gan CaoSmażony Bai Zhu2030.36580.73021.1226
Huang LianFu Ling1870.33690.93971.0029
Huang LianChi Shao1800.32430.90451.0750
Sheng Huang QiDang Gui1680.30270.95451.0388
Mu XiangFu Ling1670.30090.94891.0127

Tabela 7: Skierowane reguły asocjacji ziół spełniające określone progi. Reguły zostały wygenerowane z 555 binarnych wierszy recepta-wizyta przy zastosowaniu parametrów: wsparcie ≥ 0,30, ufność ≥ 0,70 oraz lift > 1,0. W obliczeniach wsparcia mianownikiem jest 555 wizyt z wypisaniem recepty, a kierunek reguły został zachowany, ponieważ ufność ma charakter kierunkowy.

Nazwa ziołaStłuszczenie wątroby (n)Stłuszczenie wątroby (N)Stłuszczenie wątroby (%)Marskość wątroby (n)Marskość wątroby (N)Marskość wątroby (%)Przewlekłe zapalenie żołądka (n)Przewlekłe zapalenie żołądka (N)Przewlekłe zapalenie żołądka (%)
Bai Shao717792.21%444695.65%13013397.74%
Dang Gui727793.51%424691.30%11913389.47%
Dan Shen457758.44%444695.65%4313332.33%
Fu Ling707790.91%434693.48%12613394.74%
E Zhu przetwarzane octem577774.03%404686.96%6113345.86%
Bie Jia przetwarzane octem6777.79%394684.78%41333.01%
Smażony Bai Zhu577774.03%334671.74%7613357.14%
Chi Shao697789.61%324669.57%12113390.98%
Huang Lian237729.87%74615.22%5913344.36%
Mu Xiang207725.97%134628.26%4613334.59%
Yin Chen327741.56%134628.26%101337.52%
Sheng Huang Qi237729.87%284660.87%2113315.79%
Gan Cao457758.44%184639.13%7713357.89%
Chai Hu127715.58%3466.52%4813336.09%
Huang Qin167720.78%4468.70%2513318.80%
Ze Xie247731.17%94619.57%71335.26%

Tabela 8: Prewalencja stosowania ziół w podziale według diagnozy. Liczniki, mianowniki oraz prewalencja na poziomie wizyty dla 16 znormalizowanych etykiet ziół w przypadku stłuszczenia wątroby (n = 77), marskości wątroby (n = 46) oraz przewlekłego zapalenia żołądka (n = 133). Każda etykieta zioła została policzona nie więcej niż raz na kwalifikującą się wizytę związaną z przepisaniem leków.

Tabela uzupełniająca 1: Rejestr przejrzystości i audytu wspomaganego przez AI. Dokumentacja rozróżniająca rejestr analizy pierwotnej od przeglądu spójności na etapie rewizji przeprowadzonego 21 sierpnia 2026 r. Tabela zawiera informacje o narzędziu/modelu/wersji, zakresie danych wejściowych, celu, zidentyfikowanym niezgodności kardynalności Four-Qi, korekcie ludzkiej, ograniczeniach użytkowania, informacjach o recenzencie, rozstrzygnięciu oraz szablonie promptu. Do systemu AI nie przekazywano surowych danych na poziomie pacjenta. Kliknij tutaj, aby pobrać ten plik.

Tabela uzupełniająca 2: Wyniki jakości danych z audytu źródeł. Przedstawiono kompletność odzyskanych pól, ustalenia z audytu, działania analityczne oraz stany wydania dla klinicznych pól źródłowych i starszych struktur analitycznych. Tabela dokumentuje wykluczenie niezgodnych starszych wskaźników zespołów objawów, korektę wcześniejszych sum ziół, brak możliwych do odtworzenia wektorów rozkładu sprzed czyszczenia dla szacowania stabilności między wersjami oraz ilości, których nie udało się odtworzyć. Kliknij tutaj, aby pobrać ten plik.

Tabela uzupełniająca 3: Mapowanie nomenklatury ziół. Kontrolowane etykiety wyświetlania ziół są powiązane z kwalifikatorami przetwarzania, standardowymi nazwami chińskich materiałów leczniczych (CMM), terminologią źródłową, źródłami botanicznymi, zoologicznymi lub mineralnymi, wersjami referencyjnymi, lokalizatorami dowodów oraz granicami dowodów. Etykiety specyficzne dla przetwarzania zostaną zachowane tam, gdzie mają one znaczenie kliniczne. Kliknij tutaj, aby pobrać ten plik.

Tabela uzupełniająca 4: Analizy wrażliwości progu i powtórnych wizyt. Przedstawiono perturbacje progów reguł asocjacyjnych, porównania zestawów reguł dla jednej wizyty na pacjenta, wskaźniki wrażliwości Chi Shao > Fu Ling oraz porównanie odległości danych wejściowych do klastrowania dla 190 par. Kliknij tutaj, aby pobrać ten plik.

Plik uzupełniający 1: Skrypt deterministycznego progu i czułości powtórnych wizyt. Skrypt deterministyczny wykorzystany do odtworzenia zagregowanych wskaźników progu oraz czułości powtórnych wizyt z zestawu danych źródłowych zablokowanego do konkretnej wersji. Plik nie zawiera danych na poziomie pacjentów. Prosimy kliknąć tutaj, aby pobrać ten plik.

Dyskusja

Głównym wkładem niniejszego protokołu jest stworzenie kompletnej i weryfikowalnej ścieżki prowadzącej od zanonimizowanych rekordów przypadków TCM do zbiorczych danych badawczych. Najbardziej krytycznymi krokami są: ustalenie reguły identyfikacji kohorty przed analizą wyników, rozróżnienie unikalnych pacjentów od wizyt związanych z wypisaniem recept, zachowanie każdego mapowania terminu oryginalnego na znormalizowany oraz weryfikacja każdego licznika i mianownika przed wizualizacją. Kontrole te zmieniają oczyszczanie danych z niewidocznej czynności wstępnej w udokumentowany element metodyki. Dostosowują one również przepływ pracy do standardów RECORD, STROBE, FAIR oraz uznanych ram jakości danych EHR11,12,13,14,15. Wynik uznaje się za gotowy do publikacji dopiero wtedy, gdy jego pole źródłowe, jednostka analizy, wersja słownika, reguła obliczeń, mianownik, tabela, figura oraz decyzja recenzenta mogą zostać odtworzone w rejestrze dowodów.

Metoda ta jest innowacyjna, ponieważ ład korporacyjny, inżynieria terminologiczna, obliczenia, wizualizacja oraz przegląd kliniczny są zintegrowane, a nie traktowane jako oddzielne zadania. Pojedyncza, jawna macierz syndromów generuje spektrum częstotliwości, sieć współwystępowania oraz mapę ciepła. Pojedyncza macierz wizyt z receptami według ziół wspiera zestawienia częstotliwości, skierowane reguły asocjacyjne oraz grupowanie hierarchiczne19,20,21. Pojedyncza tabela stratyfikowana według diagnozy umożliwia wyznaczenie zarówno dokładnych wartości procentowych, jak i końcowej mapy ciepła. Przepływ analityczny wykorzystuje skryptowe, reprodukowalne narzędzia open-source36,37,38,39,40, co pozwala na propagację korekty w słowniku wejściowym lub decyzji dotyczącej kohorty na wszystkie zależne wyniki. Wcześniejsze prace nad magazynami danych klinicznych wykazują również znaczenie przetwarzania wstępnego powiązanego ze źródłem oraz ponownego wykorzystania ustrukturyzowanych danych41,42. Taka architektura ogranicza ręczną transkrypcję, utrzymuje spójność między kodowaniem graficznym a tabelami źródłowymi oraz ułatwia audyt, nauczanie i przekazywanie metodologii innym zespołom badawczym.

Trzy ostatnie badania oparte na analizie baz danych dostarczają przydatnych zasad projektowania, choć ich jednostką analizy jest publikacja, a nie wizyta kliniczna. Badanie dotyczące reumatoidalnego zapalenia stawów i depresji łączy predefined search strategy z analizami krajów, instytucji, autorów, czasopism, słów kluczowych oraz ram czasowych26. Badanie nad wrzodziejącym zapaleniem jelita grubego i inhibitorami kinazy Janus wykorzystuje skoordynowaną analizę współpracy, współcytowań, klasteryzacji oraz analizy burst, aby odróżnić trwałe tematy od wyłaniających się frontów badawczych27. Badanie nad reumatoidalnym zapaleniem stawów i fibromialgią rozszerza mapowanie bibliometryczne o bioinformatykę, zachowując jednocześnie rozróżnienie między dwiema warstwami dowodów28. Niniejszy protokół stosuje tę samą zasadę skoordynowanych, ale niewymiennych widoków analitycznych. Przeniesienie metody do ginekologii, pulmonologii, reumatologii lub innej specjalizacji wymaga rekonstrukcji pól specyficznych dla danej dziedziny, słowników terminologicznych, reguł włączenia i wykluczenia, wyników oraz procedur przeglądu klinicznego przed ponownym wykorzystaniem zestawu reguł. Spektra chorób, sieci zespołów, słowa kluczowe objawów, reguły asocjacyjne, klasteryzacja i wzorce stratyfikowane według diagnozy wynikają ze źródeł o zablokowanej wersji, jednak każdy z tych elementów odpowiada na odrębne pytanie i zachowuje własny mianownik oraz granicę interpretacyjną.

Sztuczna inteligencja nadzorowana przez człowieka może zapewnić dodatkową warstwę kontroli jakości, jeśli ograniczy się do zatwierdzonych, zanonimizowanych fragmentów lub materiałów zagregowanych. W ramach tego procesu AI może porównywać terminologię w różnych plikach, sygnalizować niespójności między podpisami a tabelami, identyfikować etykiety wykraczające poza granice rycin, weryfikować, czy każdy wyświetlony węzeł sieci posiada prawidłową krawędź, oraz sugerować jaśniejsze sformułowania. AI nie określa kwalifikowalności kohorty, nie tworzy mapowań terminologicznych, nie wyciąga wniosków co do efektów leczenia ani nie zastępuje przeglądu danych źródłowych. Taki podział odpowiedzialności jest zgodny z szerszym ujęciem, według którego medyczna AI powinna wspomagać osąd człowieka, a nie zacierać odpowiedzialność33. Odzwierciedla to również nacisk standardu DECIDE-AI na przejrzyste czynniki ludzkie, obsługę błędów i rozliczalną ewaluację34. W związku z tym, w przypadku korzystania z pomocy AI, w dzienniku audytu powinny zostać zachowane informacje o celu każdego promptu, zweryfikowanym wyniku, zaakceptowanej poprawce, recenzencie oraz dacie.

Rozwiązywanie problemów jest szczególnie istotne, gdy wynik wydaje się klinicznie prawdopodobny, ale nie przechodzi procesu uzgadniania z danymi źródłowymi. W takich przypadkach interpretacja wyników końcowych powinna zostać wstrzymana do czasu ustalenia, czy rozbieżność wynika z określenia kwalifikowalności, deduplikacji, mapowania terminologii, wyboru pól, doboru mianownika czy montażu rysunków. Po wprowadzeniu korekty wszystkie zależne wyniki powinny zostać wygenerowane ponownie. Przedstawiony przykład opiera się na retrospektywnym zbiorze danych z jednego ośrodka, obejmującym pacjentów ambulatoryjnych ocenianych przez ekspertów, w którym powtarzające się wizyty nie są od siebie niezależne. Analiza wrażliwości dla jednej wizyty na pacjenta zredukowała liczbę zachowanych reguł z 15 do 12, zachowując jednocześnie obecność wszystkich 20 głównych ziół. Wśród wszystkich 190 nieuporządkowanych par spośród tych 20 wspólnych zmiennych korelacja Pearsona wyniosła 0,9944, współczynnik korelacji Spearmana rho wyniósł 0,9836, średnia bezwzględna zmiana odległości Jaccarda wyniosła 0,0146, a zmiana maksymalna 0,0528 (Tabela uzupełniająca 4). W związku z tym wysokiego poziomu wsparcia na poziomie wizyty nie należy interpretować jako walidacji na poziomie pacjenta. Spektrum historia-słowo kluczowe odzwierciedla dosłowną dokumentację, a nie zwalidowaną skalę objawów. Podsumowania materia medica są ważone według liczby wystąpień, a nie według dawki. Reguły asocjacyjne opisują współwystępowanie zapisów, a nie przyczynowość. Mapy ciepła w rozstrzębieniu według diagnoz mają charakter opisowy i nie określają skuteczności porównawczej, specyficzności choroby ani konieczności leczenia.

Protokół ten można zastosować w badaniach nad dziedziczeniem specjalistycznego doświadczenia klinicznego, w opisach kohort pacjentów w poradniach specjalistycznych, w wieloośrodkowej harmonizacji terminologii, w przeglądzie jakości dokumentacji, w wyborze zmiennych do rejestrów prospektywnych oraz w przygotowywaniu zagregowanych zbiorów danych do współpracy z zachowaniem prywatności. Przyszłe prace mogą obejmować prospektywne, ustrukturyzowane gromadzenie objawów, modele zgrupowane według pacjentów, jawne zmienne dawkowania, zdefiniowane a priori hipotezy porównawcze, walidację zewnętrzną, wersjonowane usługi terminologiczne, obliczenia chroniące prywatność oraz interaktywne rejestry dowodów. Przetwarzanie języka naturalnego i przeglądy wspomagane przez AI mogą dodatkowo ograniczyć powtarzalną kuratela danych, pod warunkiem zastosowania zasad zablokowanych wersyjnie oraz weryfikacji przez człowieka. Szerzej rzecz ujmując, protokół ten umożliwia przekształcenie rozproszonego doświadczenia klinicznego w przejrzysty obiekt badawczy, który może być analizowany, reprodukowany, kwestionowany i rozszerzany. Metoda ta nie przekształca częstotliwości w skuteczność; zamiast tego przekształca niedokumentowane decyzje analityczne w widoczne dowody, stanowiąc podstawę dla bardziej rygorystycznych pytań klinicznych i trwalszych badań nad TCM w warunkach rzeczywistych.

Oświadczenia

Autorzy oświadczają, że nie mają żadnych konfliktów interesów.

Podziękowania

OpenAI Codex (gpt-5.6-luna i gpt-5.6-sol) był wykorzystywany wyłącznie podczas redakcji manuskryptu do sprawdzania spójności między plikami na poziomie zbiorczym oraz w celu uzyskania sugestii dotyczących sformułowań. Do systemu AI nie przekazywano żadnych rekordów na poziomie pacjenta. Wszystkie wyniki uzyskane przy wsparciu AI zostały niezależnie zweryfikowane z materiałami źródłowymi przez Tian Xia w dniu 21 sierpnia 2026 r. Autorzy sprawdzili i zatwierdzili ostateczną treść i ponoszą pełną odpowiedzialność za manuskrypt. Projekt ten był wspierany przez Narodowy Kluczowy Program Badań i Rozwoju Chin, Kluczowy Projekt Specjalny w zakresie Modernizacji Tradycyjnej Medycyny Chińskiej (nr 2025YFC3512800); Narodowy Główny Projekt Naukowo-Technologiczny Chin (projekt nr 2026ZD0554100; podprojekt nr 2026ZD0554101); Projekt Doskonalenia Zdolności do Badań Klinicznych i Translacji Osiągnięć w Centralnych Szpitalach Tradycyjnej Medycyny Chińskiej Wysokiego Szczebla, Projekt Specjalny w zakresie Przekazywania Doświadczeń Akademickich Renomowanych Starszych Ekspertów Tradycyjnej Medycyny Chińskiej (nr HLCMHPP2023016) oraz Fundację Nauk Przyrodniczych Autonomicznego Regionu Sinciang (nr 2025D01C213).

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Arkusze kalkulacyjne do zbiorczej reanalizyLokalne pliki wygenerowane przez autoraNie dotyczyStosowane do obliczania sum zbiorczych, tworzenia tabel i generowania rycin.
Eksport zanonimizowanej dokumentacji medycznej pacjentów ambulatoryjnychInstytucjonalny system elektronicznej dokumentacji medycznejNie dotyczyStosować wyłącznie w kontrolowanym środowisku instytucjonalnym; dokumentacja na poziomie pacjenta nie stanowi materiałów do przedłożenia.
lxmlprojekt lxml6.1.1Wersja oprogramowania użyta do serializacji z zachowaniem przestrzeni nazw podczas regeneracji na etapie rewizji; nie jest to historyczna wersja z etapu analizy pierwotnej.
MatplotlibProjekt Matplotlib (matplotlib.org)3.11.1Wersja zaobserwowana w środowisku regeneracji na etapie rewizji oraz w metadanych SVG Rysunku 3; nie jest to historyczna wersja analizy pierwotnej.
NetworkXProjekt NetworkXPakiet PyPI: networkxZarejestrowano identyfikator pakietu; w środowisku dziedziczonym nie zweryfikowano dokładnej wersji etapu rewizji.
NumPyProjekt NumPy2.3.5Wersja oprogramowania użyta do regeneracji zaktualizowanych wyników zagregowanych; nie jest to historyczna wersja z pierwotnej analizy.
openpyxlprojekt openpyxl3.1.5Wersja oprogramowania użyta do wygenerowania poprawionych zbiorczych wyników w formacie XLSX; nie jest to historyczna wersja oryginalnej analizy.
pandasprojekt pandas3.0.1Wersja oprogramowania użyta do regeneracji poprawionych wyników zagregowanych; nie jest to historyczna wersja z oryginalnej analizy.
PyMuPDFprojekt PyMuPDF1.28.2Wersja oprogramowania użyta do regeneracji zaktualizowanych wyników w postaci rycin na etapie rewizji; nie jest to historyczna wersja z etapu pierwotnej analizy.
PythonPython Software Foundation3.13.15Wersja oprogramowania użyta do regeneracji zaktualizowanych wyników zagregowanych; nie jest to historyczna wersja z pierwotnej analizy.
SciPyProjekt SciPyPakiet PyPI: scipyZapisano identyfikator pakietu; nie zweryfikowano dokładnej wersji etapu rewizji w środowisku dziedziczonym.

Bibliografia

  1. Wang YH, et al. Study on knowledge discovery in traditional Chinese medical case records [in Chinese]. Zhong Xi Yi Jie He Xue Bao. 2007;5(4):368-372.
  2. Wang Y, et al. Automatic symptom name normalization in clinical records of traditional Chinese medicine. BMC Bioinformatics. 2010;11:40.
  3. Zhou L, et al. Natural language processing algorithms for normalizing expressions of synonymous symptoms in traditional Chinese medicine. Evid Based Complement Alternat Med. 2021;2021:6676607.
  4. Chu X, et al. Quantitative knowledge presentation models of traditional Chinese medicine (TCM): a review. Artif Intell Med. 2020;103:101810.
  5. Zhang T, et al. Constructing fine-grained entity recognition corpora based on clinical records of traditional Chinese medicine. BMC Med Inform Decis Mak. 2020;20:64.
  6. Wang Q, et al. A study of entity-linking methods for normalizing Chinese diagnosis and procedure terms to ICD codes. J Biomed Inform. 2020;105:103418.
  7. Zhang H, et al. Transformer- and generative adversarial network-based inpatient traditional Chinese medicine prescription recommendation: development study. JMIR Med Inform. 2022;10(5):e35239.
  8. Dan W, et al. SinoMedminer: an R package and Shiny application for mining and visualizing traditional Chinese medicine herbal formulas. Chin Med. 2025;20:80.
  9. Chinese Pharmacopoeia Commission. Pharmacopoeia of the People's Republic of China. 2025 ed. China Medical Science and Technology Press; Beijing; 2025.
  10. Editorial Committee of Zhonghua Bencao, State Administration of Traditional Chinese Medicine. Zhonghua Bencao. 10 vols. Shanghai Scientific and Technical Publishers; Shanghai; 1999. ISBN: 7532351068. Available from: National Diet Library record
  11. Benchimol EI, et al. The REporting of studies Conducted using Observational Routinely-collected health Data (RECORD) statement. PLoS Med. 2015;12(10):e1001885.
  12. von Elm E, et al. The Strengthening the Reporting of Observational Studies in Epidemiology (STROBE) statement: guidelines for reporting observational studies. Lancet. 2007;370(9596):1453-1457.
  13. Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Sci Data. 2016;3:160018.
  14. Weiskopf NG, Weng C. Methods and dimensions of electronic health record data quality assessment: enabling reuse for clinical research. J Am Med Inform Assoc. 2013;20(1):144-151.
  15. Kahn MG, et al. A harmonized data quality assessment terminology and framework for the secondary use of electronic health record data. EGEMS (Wash DC). 2016;4(1):18.
  16. Kovačević A, Bašaragin B, Milošević N, Nenadić G. De-identification of clinical free text using natural language processing: a systematic review of current approaches. Artif Intell Med. 2024;151:102845.
  17. Meystre SM, et al. Text de-identification for privacy protection: a study of its impact on clinical text information content. J Biomed Inform. 2014;50:142-150.
  18. Neamatullah I, et al. Automated de-identification of free-text medical records. BMC Med Inform Decis Mak. 2008;8:32.
  19. Agrawal R, Srikant R. Fast algorithms for mining association rules in large databases. Presented at: 20th International Conference on Very Large Data Bases; Santiago, Chile; 1994. p. 487-499.
  20. Hahsler M, Grün B, Hornik K. arules: a computational environment for mining association rules and frequent item sets. J Stat Softw. 2005;14(15):1-25.
  21. Murtagh F, Contreras P. Algorithms for hierarchical clustering: an overview. WIREs Data Min Knowl Discov. 2012;2(1):86-97.
  22. van Eck NJ, Waltman L. Software survey: VOSviewer, a computer program for bibliometric mapping. Scientometrics. 2010;84(2):523-538.
  23. Chen C. CiteSpace II: detecting and visualizing emerging trends and transient patterns in scientific literature. J Am Soc Inf Sci Technol. 2006;57(3):359-377.
  24. Aria M, Cuccurullo C. bibliometrix: an R-tool for comprehensive science mapping analysis. J Informetr. 2017;11(4):959-975.
  25. Donthu N, et al. How to conduct a bibliometric analysis: an overview and guidelines. J Bus Res. 2021;133:285-296.
  26. Zhao Y, Chen GY, Fang M. Research trends of rheumatoid arthritis and depression from 2019 to 2023: a bibliometric analysis. J Multidiscip Healthc. 2024;17:4465-4474.
  27. Wang Y, et al. Research trends and hotspots in JAK inhibitors for ulcerative colitis: a bibliometric analysis from 2015 to 2024. J Multidiscip Healthc. 2025;18:6755-6771.
  28. Chen G, Yan Z, Wang Y, Tao Q. Rheumatoid arthritis and fibromyalgia syndrome: a bibliometric and bioinformatics perspective on comorbidity research. J Multidiscip Healthc. 2025;18:6811-6827.
  29. Wang SL, et al. Yao Naili's experience in applying the harmonizing liver and spleen method. Journal of Traditional Chinese Medicine. 2008;49(7):596-597.
  30. Wang L, et al. Analysis of Professor Naili Yao's experience in treating spleen-stomach diseases [in Chinese]. Lishizhen Med Mater Med Res. 2022;33(6):1436-1438.
  31. Sandve GK, Nekrutenko A, Taylor J, Hovig E. Ten simple rules for reproducible computational research. PLoS Comput Biol. 2013;9(10):e1003285.
  32. Munafò MR, et al. A manifesto for reproducible science. Nat Hum Behav. 2017;1:0021.
  33. Topol EJ. High-performance medicine: the convergence of human and artificial intelligence. Nat Med. 2019;25(1):44-56.
  34. Vasey B, et al. Reporting guideline for the early-stage clinical evaluation of decision support systems driven by artificial intelligence: DECIDE-AI. Nat Med. 2022;28(5):924-933.
  35. Branch of Gastrointestinal Diseases, China Association of Chinese Medicine. Expert consensus on traditional Chinese medicine diagnosis and treatment of Gan pi (2023). Chinese Journal of Integrative Digestive Diseases. 2024;32(9):741-747.
  36. McKinney W. Data structures for statistical computing in Python [conference paper]. Presented at: 9th Python in Science Conference; Austin, TX; 2010. p. 56-61. doi:10.25080/Majora-92bf1922-00a.
  37. Harris CR, et al. Array programming with NumPy. Nature. 2020;585(7825):357-362.
  38. Virtanen P, et al. SciPy 1.0: fundamental algorithms for scientific computing in Python. Nat Methods. 2020;17(3):261-272.
  39. Hunter JD. Matplotlib: a 2D graphics environment. Comput Sci Eng. 2007;9(3):90-95.
  40. Hagberg AA, Schult DA, Swart PJ. Exploring network structure, dynamics, and function using NetworkX. Presented at: 7th Python in Science Conference; Pasadena, CA; 2008. p. 11-15. doi:10.25080/TCWV9851.
  41. Zhou X, et al. Development of traditional Chinese medicine clinical data warehouse for medical knowledge discovery and decision support. Artif Intell Med. 2010;48(2-3):139-152.
  42. Liu B, et al. Data processing and analysis in real-world traditional Chinese medicine clinical data: challenges and approaches. Stat Med. 2012;31(7):653-660.

Przedruki i uprawnienia

Tagi

Kliniczne zapisy przypadkówprotokół z audytem źródełnormalizacja danychspektrum elementów syndromuczęstotliwość występowania ziółprofile materia medicareguły asocjacyjnewizualizacja danych klinicznych