Te reprezentatywne wyniki uzyskano, postępując zgodnie z procedurą opisaną w niniejszym protokole. Analizę asocjacji poprzez eksplorację tekstu przeprowadzono zgodnie z protokołem CaseOLAP LIFT5 przy użyciu parametrów domyślnych, badając osiem szerokich kategorii chorób układu krążenia72 oraz ich powiązania z białkami mitochondrialnymi (GO:05739). Łącznie do maja 2024 roku ustalono, że 635 696 raportów jest istotnych dla tych chorób; spośród nich zidentyfikowano 4 65 wysokowiarygodnych asocjacji białko-choroba, które posłużyły do dalszych analiz. Graf wiedzy biomedycznej skonstruowano w maju 2024 roku9, wykorzystując kod oprogramowania Know2BIO z ustawieniami domyślnymi. Powstały graf wiedzy składa się z 219 450 węzłów i 6 323 257 krawędzi, a także cech dla 189 493 węzłów, obejmujących opisy węzłów, sekwencje białek/genów, strukturę chemiczną itp., w zależności od dostępności. Szacowany czas obliczeniowy dla wszystkich etapów protokołu przedstawiono w Tabeli 1.
System RUGGED został zainicjowany poprzez utworzenie baz danych wektorowych zarówno dla węzłów i cech grafu wiedzy, jak i dla publikacji związanych z CVD. Wszystkie węzły, krawędzie i cechy węzłów grafu wiedzy zostały przetworzone z rozmiarem fragmentu (chunk size) wynoszącym 20 tokenów przy użyciu modelu osadzania BART71 w celu przygotowania do wektorowego wyszukiwania RAG. Podobnie, oryginalne prace badawcze i artykuły przeglądowe zostały przetworzone z rozmiarem fragmentu 50 tokenów i przy użyciu modelu osadzania BART w celu przygotowania do wektorowego wyszukiwania RAG. W celu wyszukiwania literatury publikacje w pełnym tekście przekraczające 50 tokenów zostały hierarchicznie podsumowane na podstawie poszczególnych sekcji publikacji za pomocą modelu osadzania BART. Do pozostałych agentów LLM w systemie wykorzystano model GPT-4o.
Te reprezentatywne wyniki prezentują przykładowy scenariusz zastosowania w celu zbadania potencjalnych terapeutyków lekowych dla kardiomiopatii arytmogennej (ACM) oraz kardiomiopatii rozstrzeniowej (DCM), zidentyfikowanych odpowiednio jako MeSH_Disease: D019571 i MeSH_Disease: D02311. Seria zapytań została przedstawiona na Rysunku 3, przykłady odpowiedzi modelu wskazano na Rysunku 4, a pełne odpowiedzi zamieszczono w Pliku uzupełniającym 1, sekcja A. Kierunek zapytań był dostosowywany do odpowiedzi zweryfikowanych przez badacza, tak aby kolejne zapytania były formułowane na podstawie wyników poprzednich odpowiedzi. Analiza wykazała 11 kandydatów na leki sklasyfikowanych jako beta-blokery i leki przeciwarytmiczne. Nowe możliwości leczenia terapeutycznego oceniono za pomocą modelu predykcji krawędzi opartego na grafowej sieci neuronowej splotowej (GCNN) na podzbiorze pełnego grafu wiedzy, obejmującego węzły w odległości 1-hop od węzłów choroby i leku oraz ich połączenia, a wskaźniki oceny przedstawiono w Tabeli 4. 10 najważniejszych istotnych krawędzi dla każdej predykcji modelu zostało następnie poddanych analizie za pomocą modułu wyjaśnialności grafów, GNNExplainer44, w celu zidentyfikowania odpowiednio najważniejszych węzłów i krawędzi przyczyniających się do każdej predykcji. Całkowity koszt wykorzystania komercyjnego modelu LLM dla wszystkich etapów protokołu RUGGED w tym przypadku użytkowania szacowany jest w momencie pisania na 1,50 $.

Rysunek 1: Schemat działania Retrieval Under Graph-Guided Explainable disease Distinction (RUGGED). RUGGED składa się z czterech głównych komponentów: (1) gromadzenia i przetwarzania danych z etycznie pozyskanych i profesjonalnie zarządzanych zasobów (np. PubMed oraz kuratowanych baz wiedzy biomedycznej), (2) integrowania wyników badań recenzowanych w ujednolicony graf wiedzy, (3) strukturyzowania danych tekstowych i grafowych w usługach bazodanowych, (4) modelowania i przewidywania wyjaśnialnych relacji między jednostkami biomedycznymi wewnątrz grafu wiedzy oraz (5) wydobywania i syntetyzowania wiedzy poprzez przepływ pracy Retrieval Augmented Generation (RAG) (Rysunek 2) w celu walidacji złożonych relacji molekularnych i badania przewidywań dotyczących chorób opartych na AI. Użytkownik może przeprowadzić etap weryfikacji z udziałem człowieka (human-in-the-loop), aby zwiększyć dokładność wyników. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rycina 2: Architektura wyszukiwania i przepływ pracy ograniczania stronniczości. Struktura Retrieval Augmented Generation (RAG) wykorzystuje wiele agentów LLM, z których każdy wykonuje określone zadania w celu wsparcia dostępu do istotnych informacji na podstawie zapytania użytkownika. System ten dostarcza udokumentowane dowody dla Reasoning Agent opartego na GPT, który komunikuje się z użytkownikiem, co ułatwia interakcję użytkownik-agent oraz syntezę wiedzy. (1) Wyszukiwanie tekstów biomedycznych: Oryginalne prace badawcze i artykuły przeglądowe po recenzji są filtrowane pod kątem ich istotności dla zrozumienia powiązań z chorobami. Konstruowana jest baza danych wektorowych dla dowodów tekstowych zweryfikowanych przez autorów i redaktorów, ważonych na podstawie odpowiedniej sekcji publikacji: 70% Streszczenie, 10% Wyniki, 10% Metadane oraz 10% dla wszystkich pozostałych podsekcji. Wyszukiwanie słów kluczowych oraz wyszukiwanie podobieństwa względem osadzenia wektorowego zapytania użytkownika wspólnie identyfikują istotne dokumenty. Podsumowania każdego dokumentu są generowane za pomocą streszczacza opartego na BERT, a GPT-based Text Evaluator Agent doprecyzowuje wyszukiwanie w celu walidacji istotności dokumentu dla zapytania. (2) Wyszukiwanie w grafach wiedzy: Moduł rozpoznawania nazwanych encji oparty na BERT oraz moduł ekstrakcji relacji oparty na GPT łączą zapytanie użytkownika z istotnymi encjami w grafie wiedzy. Wyszukiwanie podobieństwa w bazie danych wektorowych identyfikuje odpowiednie węzły i krawędzie. Dane są pobierane z bazy danych Neo4j za pomocą zapytań Cypher generowanych przez Cypher Query Agent oparty na GPT i doprecyzowanych przez Query Verification Agent. (3) Poszczególne odpowiedzi z potoków wyszukiwania tekstów biomedycznych lub wyszukiwania w grafach wiedzy są przedstawiane Reasoning Agentowi, który syntetyzuje zwięzłą odpowiedź na zapytanie użytkownika przy minimalnej stronniczości. System jest sterowany tak, aby zachować dokładność i bezstronność w prezentowaniu informacji faktycznych. Kliknij tutaj, aby zobaczyć powiększoną wersję tej ryciny.

Rycina 3Studium przypadku dotyczące syntezy wiedzy i eksploracji hipotez poprzez tkaskada zapytań warstwowych. Rysunek ten przedstawia wybrany przypadek użycia, koncentrujący się na ciągu powiązanych pytań i pojęć, które badacz i/lub pracownik służby zdrowia może sformułować w systemie RUGGED. Zapytania użytkownika są przekazywane do systemu w kolejności numerycznej, a strzałki reprezentują wnioskowane rozumowanie logiczne i dziedzinowe pomiędzy poszczególnymi pytaniami. System pobiera informacje z treści ukrytych i odpowiednich (źródło zaznaczone na niebiesko), odpowiadając na zapytanie. Przykłady odpowiedzi systemu przedstawiono w Rysunek 4. Proszę kliknąć tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 4: Przypadek użycia w patologii układu sercowo-naczyniowego: wyjaśnianie patogenezy CVD. Przedstawiono pary zapytań i odpowiedzi między użytkownikiem a systemem RUGGED. Na górnym lewym panelu pytania 1-6 służą do wyszukiwania informacji poprzez ekstrakcję danych z bazy grafu wiedzy w celu sformułowania odpowiedzi opartych na dowodach. Pytanie 7 wykorzystuje wyjaśnialną predykcję linków w grafie do zidentyfikowania najwyżej ocenianych środków terapeutycznych. Zapytanie inicjuje analizę predykcyjną, która jest automatycznie wykonywana i przetwarzana przez system, a kluczowe wnioski zostają zwięźle podsumowane. Pytanie 8 ocenia dowody literaturowe z zdefiniowanego korpusu danych tekstowych, które zostają pobrane jako istotne dowody w celu weryfikacji, walidacji i potwierdzenia przewidzianego wyniku. Odpowiedzi systemu zostały sprawdzone w procesie inspekcji z udziałem człowieka (human-in-the-loop) i zmodyfikowane pod kątem czytelności oraz zwięzłości. Pełna transkrypcja tych wyników znajduje się w Pliku uzupełniającym 1. Kliknij tutaj, aby zobaczyć powiększoną wersję tego rysunku.
| Procedura | Opis | Czas |
| Dostęp do wiedzy biomedycznej | 30% całkowitej objętości |
| Przygotowanie korpusu literatury biomedycznej | Połącz się z PubMed oraz PubMed Central, pobierz i przeanalizuj dane publikacyjne dla zadań w dalszych etapach przetwarzania. | 20% |
| Przygotowanie danych bazy wiedzy | Połącz się z biomedycznymi bazami wiedzy, pobierz i przeanalizuj niezbędne informacje dla zadań w dalszych etapach przetwarzania. | 5% |
| Ekstrakcja informacji | 30% całkowitego |
| Analiza tekstowa metodą CaseOLAP LIFT | Identyfikacja wysokopoziomowych relacji choroba-białko w korpusie tekstów biomedycznych. | 25% |
| Budowa grafu wiedzy | Połącz i zintegruj rozproszone informacje z biomedycznych baz wiedzy w ujednolicony graf wiedzy. | 5% |
| Analiza predykcyjna | 10% całkowitego |
| Trenowanie grafowej sieci neuronowej | Wytrenuj model na danych z biomedycznego grafu wiedzy, aby nauczyć go rozpoznawania ukrytych wzorców w obrębie grafu. | 5% |
| Analiza rankingu istotności | Zastosuj moduł wyjaśnialności, aby wyróżnić najbardziej istotne węzły i krawędzie związane z badaną chorobą. | 2.5% |
| Przewidywanie krawędzi | Wykorzystaj moduł wyjaśnialności, aby zidentyfikować kluczowe węzły i krawędzie przyczyniające się do nowych przewidywanych krawędzi. | 2.5% |
| Generowanie i/lub walidacja hipotez | 30% całkowitego |
| Konfiguracja bazy danych dla generowania rozszerzonego o pobieranie (Retrieval Augmented Generation) | Zainicjuj grafową bazę danych do odpytywania grafu wiedzy oraz wektorową bazę danych do wyszukiwania tekstu. | 25% |
| Eksploracja hipotez | Umożliwienie użytkownikowi interakcji z systemem RUGGED w celu uzyskania dostępu do odpowiednich informacji i ich analizy na potrzeby weryfikacji hipotez. | 5% |
Tabela 1: Przepływ pracy i etapy ograniczające szybkość procesu. Tabela ta przedstawia przybliżone szacunki czasu obliczeniowego wymaganego dla każdego etapu przepływu pracy. Etapy ograniczające szybkość procesu obejmują dostęp, ekstrakcję i indeksowanie wiedzy biomedycznej niezbędnej do generowania wspomaganego wyszukiwaniem (retrieval-augmented generation). Eksploracja hipotez może być powtarzana w sposób ciągły bez konieczności ponownego wykonywania etapów ograniczających szybkość procesu.
| Kategoria choroby | Numery drzewa MeSH | Liczba PMID | Liczba oryginalnych publikacji | Liczba artykułów przeglądowych |
| Kardiomiopatie (CM) | C14.280.238 | 132 531 | 102 337 | 19 942 |
| C14.280.434 |
| Arytmie serca (ARR) | C14.280.067 | 125 286 | 92 374 | 13 854 |
| C23.50.073 |
| Wady wrodzone serca (CHD) | C14.280.40 | 82 06 | 54 023 | 6 379 |
| Choroby zastawek serca (VD) | C14.280.484 | 72 016 | 50 19 | 5 743 |
| niedokrwienie mięśnia sercowego (IHD) | C14.280.647 | 256 986 | 210 042 | 30 23 |
| Choroby układu przewodzącego serca (CCD) | C14.280.123 | 53 050 | 35 39 | 4 363 |
| Przeszkoda odpływu komorowego (VOO) | C14.280.95 | 22 244 | 15 504 | 1 686 |
| Inne choroby serca (OTH) | C14.280.195 C14.280.282 C14.280.383 C14.280.470 C14.280.945 C14.280.459 C14.280.720 | 14 085 | 7 302 | 1 79 |
| Suma | 635 696 | 478 404 | 69 690 |
Tabela 2: Statystyki literatury biomedycznej. W tabeli tej szczegółowo opisano kategorie chorób badanych wraz z odpowiadającymi im numerami drzew MeSH oraz liczbą dokumentów PubMed pobranych do maja 2024 roku, które posłużyły jako korpus do eksploracji tekstu. Podzbiór tych publikacji, składający się z oryginalnych artykułów badawczych i artykułów przeglądowych, został zaindeksowany w bazie danych wektorowych w celu wyszukiwania przez system RUGGED podczas generowania hipotez.
| Kategoria | Liczba węzłów | Liczba krawędzi | Źródło(a) danych |
| Anatomia | 5,049 | 122,533 | Bgee, PubMed, MeSH, Uberon, |
| Proces biologiczny | 27,047 | 108,106 | Ontologia Genów |
| Komponent komórkowy | 4,057 | 52,238 | Ontologia Genów |
| Związek | 27,278 | 3,292,028 | DrugBank, MeSH, CTD, UMLS, KEGG, TTD, SIDER, Inxight Drugs, Hetionet, PathFX, MyChem.info |
| Choroba | 21,938 | 311,773 | PubMed, MeSH, DisGeNET, SIDER, ClinVar, ClinGen, PharmGKB, MyDisease.info, PathFX, UMLS, OMIM, Mondo, DOID, KEGG |
| Klasa leku | 5,721 | 8,283 | ATC |
| Gen | 29,810 | 943,419 | HGNC, GRNdb, KEGG, ClinVar, ClinGen, |
| Funkcja molekularna | 11,151 | 47,086 | SMPDB, DisGENET, PharmGKB, MyGene.info |
| Ścieżka | 52,012 | 234,944 | Ontologia Genów |
| Białko | 20,740 | 1,074,809 | Reactome, KEGG, SMPDB |
| Reakcja | 14,647 | 128,038 | UniProt, Reactome, TTD, SMPDB, STRING, HGNC |
| Suma częściowa | 219,450 | 6,323,257 | Reactome |
| Asocjacje w eksploracji tekstu | 8 | 4,670 | |
| Suma | 219,458 | 6,327,927 | |
Tabela 3: Statystyki grafu wiedzy. Tabela ta szczegółowo przedstawia 11 szerokich kategorii biomedycznych tworzących skonstruowany graf wiedzy Know2BIO, wzbogacony o dodatkowe krawędzie pochodzące z analizy text mining oraz analizy predykcyjnej. Powstały graf wiedzy oraz predykcje są zarządzane przez grafową bazę danych Neo4j w celu pobierania danych przez system RUGGED podczas generowania hipotez.
| Dokładność | Precyzja | Czułość | miara F1 | AUROC | AUPRC |
| Walidacja | 0.7158 | 0.6639 | 0.8743 | 0.7547 | 0.8437 | 0.8637 |
| Test | 0.703 | 0.6367 | 0.9455 | 0.761 | 0.8961 | 0.9094 |
Tabela 4: Ewaluacja modelu wyjaśnialnej sztucznej inteligencji (XAI). W tabeli przedstawiono metryki ewaluacji dla predykcji połączeń w grafie wiedzy z wykorzystaniem dwuwarstwowej grafowej splotowej sieci neuronowej. Metryki oceniano poprzez podział krawędzi grafu na zbiory: treningowy (85%), walidacyjny (5%) i testowy (10%). Accuracy (dokładność) określa proporcję poprawnie sklasyfikowanych predykcji. Precision (precyzja) określa proporcję poprawnych predykcji pozytywnych spośród wszystkich predykcji pozytywnych. Recall (czułość) mierzy proporcję poprawnych predykcji pozytywnych spośród rzeczywistych krawędzi pozytywnych. F1-score jest średnią harmoniczną precyzji i czułości, balansując obie te metryki. AUROC ocenia zdolność modelu do rozróżniania predykcji pozytywnych od negatywnych. AUPRC kwantyfikuje kompromis między precyzją a czułością dla różnych progów odcięcia. W przypadku wszystkich metryk wyższe wartości wskazują na lepszą wydajność modelu.
Plik uzupełniający 1: Plik ten zawiera szczegółową pełną odpowiedź modelu RUGGED oraz porównanie z GPT-4o. Sekcja A prezentuje pełną interakcję człowiek-komputer z RUGGED, rozszerzając podejście oparte na łańcuchu zapytań opisane na Rysunku 3 i dostarczając pełną odpowiedź wykraczającą poza podsumowanie wyróżnione na Rysunku 4. Sekcja B ocenia odpowiedzi GPT-4o bez wyszukiwania w zestawieniu z odpowiedziami RUGGED, analizując takie atrybuty jak precyzja, głębia, ocena pewności, wiarygodność dowodów oraz koszt. Aby pobrać ten plik, kliknij tutaj.