Proponowane prace mają na celu zaprojektowanie i wdrożenie nowatorskiej techniki uczenia się transferowego, która umożliwi lepsze zrozumienie długoterminowych wyników zdrowotnych i wesprze dostosowane do potrzeb spostrzeżenia epidemiologiczne.
Research Article
Proponowane prace mają na celu zaprojektowanie i wdrożenie nowatorskiej techniki uczenia się transferowego, która umożliwi lepsze zrozumienie długoterminowych wyników zdrowotnych i wesprze dostosowane do potrzeb spostrzeżenia epidemiologiczne.
Poostre następstwa SARS-CoV-2 (PASC) stanowią środowisko ekstremalnego ryzyka z poważnymi konsekwencjami, szczególnie dla osób w średnim i starszym wieku oraz osób z przewlekłymi schorzeniami, takimi jak choroby układu krążenia, nowotwory, choroby układu oddechowego i cukrzyca. Zaburzenia fizyczne obejmują silne i uporczywe bóle ciała, zmęczenie i trudności z ruchami ciała. Podobnie zaburzenia nastroju, takie jak depresja, wahania nastroju, poczucie beznadziejności i trudności z koncentracją, są istotnymi predyktorami PASC. Osoby, głównie osoby w średnim i starszym wieku, borykają się z nasilonymi konsekwencjami fizycznymi i psychicznymi, w tym częstymi hospitalizacjami, niestabilnymi medycznie warunkami, a w niektórych przypadkach nieoczekiwanymi zgonami. Terminowa identyfikacja PASC ma zasadnicze znaczenie dla złagodzenia nasilenia powiązanych problemów zdrowotnych. W tym badaniu zalecono model transferu utajonego w celu zintegrowania danych pacjentów z różnych regionów, wydobycia wglądu w dane i dostarczania spersonalizowanych rozwiązań w zakresie opieki zdrowotnej. Badanie to przedstawia potencjał modelu uczenia się z transferem utajonym w celu poprawy uproszczenia danych, uogólnienia, personalizacji, wykrywania wglądu, zmienności, skalowalności i zdolności adaptacyjnych w celu poprawy wyników zdrowia publicznego.
Choroba koronawirusowa z 2019 roku (COVID-19) została po raz pierwszy zidentyfikowana w Wuhan w Chinach. W dniu 31grudnia 2019 r. Chiny zgłosiły do Światowej Organizacji Zdrowia (WHO) informacje o chorobach zapalnych płuc o nieznanej etiologii zaobserwowanych w mieście Wuhan w prowincji Hubeiw Chinach 1. Od 31grudnia 2019 r. do3 stycznia 2020 r. 44 osoby zostały zarażone tym wirusem i miały historię kontaktu z rynkiem hurtowym "Huanan Seafood". Początkowo pacjenci byli obserwowani z gorączką, zmęczeniem i suchym kaszlem. Wybuch tego wirusa miał miejsce 30stycznia 2020 r. i został ogłoszony przez WHO jako stan zagrożenia zdrowia publicznego o zasięgu międzynarodowym1. Do połowy lutego 2020 r. nowy koronawirus dotknął ponad 25 krajów, z 70 635 i 794 przypadkami odpowiednio w Chinach i innych krajach. Oficjalnie ogłoszono tysiąc siedemset siedemdziesiąt dwa zgony (1772) w Chinach i trzy zgony we wszystkich krajach. 31grudnia 2019 r. zgłoszono kilka przypadków zakażenia zapaleniem płuc, a WHO poinformowała, że w Wuhan nie zgłoszono żadnych zgonów. W Tajlandii pierwszy przypadek został ogłoszony w Bangkoku 13stycznia 2020 r. dla 61-letniej Chinki, która8 stycznia 2020 r. wróciła z miasta Wuhan po wizycie w mieście Wuhan. Objawami był ból gardła, kaszel, gorączka, dreszcze i ból głowy. Osoba ta została przetestowana na obecność COVID-19 w ramach nadzoru termicznego w dniu8 stycznia 2020 r. i tego dnia została przyjęta do szpitala przez tajlandzkich funkcjonariuszy. Osoba wyzdrowiała. Struktura sekwencjonowania genetycznego wirusa została podzielona przez rząd chiński i umożliwiła większej liczbie krajów skuteczne badanie i diagnozowanie pacjentów2.
W Stanach Zjednoczonych pierwszy przypadek został zgłoszony w Waszyngtonie 19stycznia 2020 r. u 35-letniego mężczyzny, który 15stycznia 2020 r. wrócił z miasta Wuhan po spotkaniu rodzinnym. Od 15stycznia 2020 r. objawy kaszlu i gorączki zalecono mu poddanie się badaniom lekarskim. Nie miał kontaktu z osobą zakażoną COVID-19, ale podczas wizyty w Wuhan został zarażony COVID-19 z powodu wybuchu epidemii w Chinach. 20stycznia 2020 r. uzyskał pozytywny wynik testu na COVID i został poddany kwarantannie na oddziale izolacyjnym centrum medycznego. Po przyjęciu na izolatkę był normalny z częstością tętna 110/min, ciśnieniem krwi 134/87 mmHg, temperaturą ciała 37,2 °C, częstością oddechów 16 uderzeń na minutę i saturacją 96% tlenem przy prawidłowym osłuchiwaniu płuc. Przeprowadzano regularne monitorowanie COVID i testy dochodzeniowe, a przez dwa dni odnotowano u niego kaszel, nudności i wymioty3. Drugiego dnia przyjęcia skarżył się na dyskomfort w jamie brzusznej, a następnego dnia nie stwierdzono żadnych nieprawidłowości w badaniu rentgenowskim klatki piersiowej. Jednak w piątym dniu na zdjęciu rentgenowskim klatki piersiowej zaobserwowano znaczące dowody zapalenia płuc, a saturacja tlenem spadła do 90%. Zalecono mu poddanie się tlenoterapii, którą uzupełniano w celu poprawy poziomu saturacji. W8 dniu jej stan się poprawił i została wypisana z kliniki. W Indiach pierwszy przypadek został zgłoszony w Kerali 27stycznia 2020 r. dla 20-letniej kobiety, która wróciła z miasta Wuhan z powodu wybuchu epidemii COVID-19 w Chinach. Od 23 stycznia 2020 r. do 26stycznia 2020 r. przechodziła chorobę bezobjawowo, a od 27stycznia 2020 r. była świadkiem bólu gardła i łagodnego kaszlu. Nie miała kontaktu z osobami zakażonymi COVID-19, ale podczas podróży pociągiem z Wuhan do Kunming zauważyła kilka osób z problemami z oddychaniem, przeziębieniami i kaszlem. W związku z tym władze rządowe Kerali poinstruowały ją, aby pozostała w odosobnionym miejscu i odwiedziła placówkę medyczną w przypadku wystąpienia objawów COVID w nadchodzących dniach. Po przyjęciu do szpitala ogólnego była normalna z częstością tętna 82/min, ciśnieniem krwi 130/80 mmHg, temperaturą ciała 98,5 °F i nasyceniem 96% tlenem przy prawidłowym osłuchiwaniu płuc. Regularne monitorowanie COVID i badania dochodzeniowe były przeprowadzane w 3., 7. i 20. dniu od dnia choroby. Wymazy z jamy ustnej i gardła były przeprowadzane pierwszego dnia i co drugi dzień przez 23 dni od dnia choroby, a od 17dnia dały wynik negatywny. Przeszła wszystkie badania i została wypisana ze szpitala 20lutego 2020 r.4.
W Wielkiej Brytanii pierwszy przypadek COVID-19 został zgłoszony 23stycznia 2020 r. przez 50-letnią kobietę, która wróciła z miasta Wuhan po wizycie. Początkowo była bezobjawowa i 26stycznia 2020 r. wystąpiły u niej objawy gorączki, osłabienia, bólu gardła i suchego kaszlu. Po przyjęciu do szpitala ogólnego była normalna z częstością oddechów 18/min, ciśnieniem krwi 120/80 mmHg, temperaturą ciała 37,6 °C i saturacją 97% tlenem. Przeprowadzono regularne monitorowanie COVID i badania dochodzeniowe, a stan pacjenta jest stabilny klinicznie. Wstępne badania wykazały u niej łagodną limfopenię i wzrost białka C-reaktywnego. Po 3dniu przyjęcia do szpitala została oczyszczona ze wszystkich objawów, a badania wymazu z jamy ustnej i gardła wykazały się jako COVID-ujemne od drugiego dnia pobytu w szpitalu. Była izolowana przez 2 tygodnie, a jej testy wymazu z nosa i gardła dały wynik5.
Koronawirusy (CoV) zostały odkryte w latach 60. XX wieku i zostały sklasyfikowane w następujący sposób. Orthornavirae jest nazywany królestwem / królestwem różnych wirusów, które zawierają genomy zbudowane z kwasu rybonukleinowego (RNA) i które translują z polimerazą RNA zależną od RNA (RdRp). RdRp transkrybuje genom wirusowego RNA na informacyjny RNA (mRNA) i replikuje genom. Cechy charakterystyczne wirusów występujących w Orthornavirae obejmują ewolucję, mutacje genetyczne, rekombinację i reasortację6. Genomy zbudowane z RNA są trzech typów, a mianowicie wirusy o dodatniej nici RNA, wirusy o ujemnej nici RNA (wirusy -ssRNA) i dwuniciowe wirusy RNA (wirusy dsRNA). Wirusy RNA o dodatniej nici (+wirusy ssRNA) to zbiór powiązanych wirusów, które mają jednoniciowe RNA o dodatnim sensie. Genom wirusa +ssRNA może być używany jako kurierski RNA (mRNA) i jest bezpośrednio przekształcany w białka związane z wirusem przez rybosomy komórek gospodarza. + Wirusy ssRNA są związane z typami takimi jak Pisuviricota, Kitrinoviricota i Lenarviricota. Wirusy o dodatniej nici RNA zawierają różne patogeny, takie jak wirus C wirusa Hepaci, denga, Ebola, odra, wścieklizna, grypa, zespół ciężkiej ostrej niewydolności oddechowej CoV, bliskowschodni zespół oddechowy koronawirus CoV i zespół ciężkiej ostrej niewydolności oddechowej CoV7. Wirusy o ujemnej nici RNA (wirusy -ssRNA) to zbiór powiązanych wirusów, które mają jednoniciowe RNA o ujemnym sensie. Genom wirusa -ssRNA może być postrzegany jako RNA kurier (mRNA) i wytwarzany przez enzym zwany polimerazą RNA zależną od RNA (RdRp). Wirusy -ssRNA tworzą gromadę Negarnaviricota. Wirusy RNA o ujemnej nici zawierają dwie główne gałęzie gromady, a mianowicie Haploviricotina i Polyploviricotina. Ważnymi wirusami kręgowców-ssRNA są Ebola, Hanta, grypa, gorączka Lassa i wścieklizna. Dwuniciowe wirusy RNA (wirusy dsRNA) to zbiór wirusów polifiletycznych, które mają dwuniciowe genomy RNA. Genom dsRNA transkrybuje +ssRNA przez wirusową polimerazę RNA zależną od RNA (RdRp). Genom wirusa +ssRNA może być używany jako kurierski RNA (mRNA) i jest otwarcie przekształcany w białka związane z wirusem przez rybosomy komórek gospodarza. Natomiast genom wirusa -ssRNA może służyć jako kurierski RNA (mRNA) i być wytwarzany przez enzymatyczną polimerazę RNA zależną od RNA (RdRp). Wirusy dsRNA są związane z typami Duplornaviricota i Pisuviricota. Dwuniciowe wirusy RNA obejmują rotawirusy (które atakują małe dzieci) i wirus choroby niebieskiego języka (który atakuje bydło i owce)8.
Pisuviricota jest określana jako gromada wirusów RNA, która obejmuje wszystkie wirusy + ssRNA i dsRNA. Jego niższa klasyfikacja obejmuje trzy klasy, a mianowicie Duplopiviricetes, Pisoniviricetes i Stelpaviricetes. Pisoniviricetes to klasa wirusów +ssRNA, które infekują i zanieczyszczają eukarionty. Jego niższa klasyfikacja obejmuje trzy podklasy, a mianowicie Nidovirales, Picornavirales i Sobelivirales. Nidovirales to rząd otoczkowego, +ssRNA, który infekuje i zanieczyszcza kręgowce i bezkręgowce9. Zawiera podrząd wirusów, a mianowicie Abnidovirineae, Cornidovirineae, Nanidovirinae, Arnidovirineae, Mesnidovirineae i Tornidovirineae. W ramach Nidovirales wyróżnia się różne rodziny, takie jak Abyssoviridae, Coronaviridae, Nanghoshaviridae, Nanhypoviridae, Arteriviridae, Medioniviridae, Cremegaviridae, Mesoniviridae, Euroniviridae, Gresnaviridae, Roniviridae, Tobaniviridae, Mononiviridae i Olifoviridae8. Coronaviridae to rodzina wirusów otoczkowych +ssRNA, które infekują ssaki, i ptaki. Jego niższa klasyfikacja obejmuje dwie podrodziny, Letovirinae i Orthocoronavirinae. Członkowie Orthocoronavirinae są identyfikowani jako koronawirusy. Koronawirusy to podrodzina Coronaviridae, która jest spokrewniona z wirusami RNA, które powodują infekcje u ssaków i ptaków. U ssaków i ptaków wirusy te powodują łagodne lub ciężkie infekcje wymazów z dróg oddechowych, takie jak infekcje wymazów z górnych dróg oddechowych i infekcje wymazów z dolnych dróg oddechowych10. Wirusy te powodują SARS, MERS i COVID-19 u ludzi i niektórych ssaków, biegunkę u świń i krów, zapalenie wątroby i rdzenia kręgowego. Koronawirusy są otoczone +ssRNA, które należą do Królestwa Orthornavirae, gromady Pisuviricota, klasy Pisoniviricetes, podklasy Nidovirales, rodziny Coronaviridae i podrodziny Orthocoronavirinae. Koronawirusy dzielą się na cztery rodzaje, a mianowicie koronawirusa Alfa, koronawirusa Beta, koronawirusa Gamma i koronawirusa Delta11. Na podstawie tych badań powstają następujące hipotezy.
Mutacja kolca koronawirusa-2 zespołu ciężkiej ostrej niewydolności oddechowej (SARS-CoV-2) jest wyjątkowo glikozylowana. Niezwykle ważne jest zbadanie biologicznych konsekwencji tych mutacji kolców. Więcej niż jedna mutacja może powstać w tej samej pozycji w sekwencji białka kolca. Sekwencje białek kolca dały szansę na oszacowanie szerokiego spektrum mutacji wykrytych na całym świecie i są one przedstawione w Tabeli 1. Rozważane mutacje były konsekwencją przenoszenia wirusa z człowieka na człowieka. Szczepienie wywołało reakcje immunologiczne zdolne do silnej neutralizacji SARS-CoV-212. Chociaż badania naukowe wykazały pojawienie się wariantów SARS-CoV-2 ukrywających mutacje w kolcu, głównym celem pozostała neutralizacja przeciwciał gospodarza. Obserwowano ewoluujące oznaki zmniejszonej neutralizacji niektórych wariantów SARS-CoV-2 po szczepieniu. Producenci szczepionek opracowali różne platformy do potencjalnej aktualizacji struktur szczepionek, a także przeprowadzono badania genetycznych i antygenowych zmian w globalnej populacji wirusa z eksperymentami mającymi na celu wyjaśnienie fenotypowych wpływów mutacji13.
Baza danych wirusów National Center for Biotechnology Information (NCBI) zawiera 10333 ludzkie białka kolców SARS-CoV-2 z Afryki, Azji, Europy, Ameryki Północnej, Ameryki Południowej i Oceanii. Rozprzestrzenianie się kilku mutacji w białkach kolców badanych z różnych lokalizacji geograficznych przedstawiono w powyższej tabeli. Szczegółowe informacje na temat koronawirusa Alfa, Beta, Gamma i Delta wraz z ich rodzajami, cechami i opisami znajdują się w powyższej tabeli. Każdy rodzaj jest opisany przez jego cechy, takie jak podstawowe, warianty, znaczenie, kształt, wymiary, struktura, fuzja błonowa, uwalnianie, zanieczyszczenie i synteza14.
Jak wspomniano w tabeli 1, szczepy wirusa, takie jak HCoV-229E, HCoV-OC43, HCoV-NL63 i HCoV-HKU1, obserwowały łagodne do umiarkowanych objawy choroby, podczas gdy SARS-CoV, MERS-CoV i SARS-CoV-2 obserwowały ciężkie krytyczne objawy choroby u ludzi. Mikroorganizmy wirusowe przechodzą przez organizm i infekują komórkę gospodarza. W zależności od kategorii koronawirusa infekuje komórki w różnych częściach ciała gospodarza. Gdy tylko przyczepi się do silnej i zdrowej komórki, wchodzi do niej15. Po tym, jak wirus zostanie osadzony w komórce gospodarza, zostanie uporządkowany, a jego DNA i RNA wydostaną się na zewnątrz i powędrują w kierunku jądra. Będą się przemieszczać we fragmencie, co będzie skutkowało różnymi reprodukcjami wirusa. Kopie te wyjdą z jądra, aby zostać złożone i otrzymać białko, które chroni ich DNA i RNA. Te nowomodne reprodukcje wirusa opuszczą wcześniej zainfekowane i chore komórki, aby ponownie zanieczyścić inne zdrowe komórki gospodarza i namnażać się. Jeśli układ odpornościowy gospodarza zdoła zwalczyć koronawirusa, dana osoba nie zachoruje; W przeciwnym razie mogą wystąpić niezdrowe powikłania. Jeśli układ odpornościowy nie jest w stanie zapanować nad koronawirusem, dochodzi do patogenezy. W ten sposób wirus dostaje się do organizmu i infekuje różne narządy. W zależności od tego, jak poważne są oznaki lub objawy, dana osoba udaje się na odpoczynek lub szuka pomocy medycznej16. Cykl życiowy i różne szczepy koronawirusa przedstawiono na rysunku 1.
Powyższy rysunek w szczegółowy sposób obrazuje cykl życia i etapy koronawirusa. Istnieje siedem etapów, a mianowicie: (1) przyczepienie i przyjęcie, (2) fuzja i endocytoza, (3) proteoliza, (4) translacja i rozszczepienie, (5) replikacja, (6) egzocytoza i (7) uwolnienie dojrzałego wirusa. W fazie przyczepiania i przyjmowania mikroorganizmy koronawirusowe są przyjmowane do organizmu gospodarza, a celem jest opracowanie strategii rozpoznania i interwencji odpornych na gospodarza. Aby dostać się do komórek gospodarza, wirusy te najpierw przyczepiają się do receptora powierzchniowego komórki w celu związania, a następnie wchodzą do endosomów i ostatecznie rozpoczynają fuzję. Później koronawirus łączy się z osłonkami związanymi z wirusem i lizosomami do komórki gospodarza. Białko kolca przyczepione do powierzchni wirusa zakłóca wnikanie tych wirusów. Endocytoza to proces komórkowy, w którym substancja jest przenoszona do komórki gospodarza17. Materiał, który ma zostać przyjęty, jest otoczony szeregiem osłonek komórkowych, które następnie wystrzeliwują w górę do wnętrza komórki gospodarza, tworząc pęcherzyk obejmujący spożytą substancję. Endocytoza obejmuje pinocytozę i fagocytozę; Pierwszym z nich jest picie komórek, a drugim zjadanie komórek. Proteoliza to wyszczególnienie białek związanych z wirusem na mniejsze polipeptydy/aminokwasy. Ustrukturyzowana konwersja mRNA to proces potranskrypcyjny, który ogranicza komunikację genów i szybko prowadzi do dyfuzji białek. Odgrywa główną rolę w licznych procedurach biologicznych, takich jak wzrost komórek, postęp komórek, plastyczność synaptyczna, retorty stresowe i produktywny rozwój wirusa18. Procedurę translacji wirusa można podzielić na trzy fazy, a mianowicie inicjację, wydłużenie i rozpuszczenie.
Replikacja wirusa to proces generowania wirusów genetycznych poprzez zanieczyszczenie zakażonych komórek gospodarza. Aby doszło do rozmnażania wirusa, wirusy muszą najpierw dostać się do komórki gospodarza. Poprzez wielokrotną replikację ich genomu wirusowego i zamykanie tych kopii, wirusy przeżywają i kontynuują rozprzestrzenianie się, infekując nowe komórki gospodarza19. Egzocytoza to mechanizm, dzięki któremu pęcherzyki zawierające cząsteczki wirusa są wydzielane i uwalniane z zakażonej komórki, umożliwiając nowo powstałym wirusom przedostanie się do organizmu gospodarza i zakażenie dodatkowych zdrowych komórek. Poostre następstwa SARS-CoV-2 (PASC) są rozpoznawane jako zespół, który atakuje przede wszystkim płuca, chociaż może wpływać na wiele narządów, powodując uszkodzenie narządów, a nawet niewydolność narządów20. Takie powikłania mogą prowadzić do śmierci lub długotrwałych problemów zdrowotnych. Na przykład w sercu może wystąpić zwiększone ryzyko niewydolności serca lub innych powikłań; płuca mogą doznać długotrwałych trudności w oddychaniu po zapaleniu płuc; mózg może być dotknięty udarami, drgawkami lub zespołem Guillaina-Barrégo; A nerki mogą doznać uszkodzenia, które może spowodować wstrząs septyczny. Uszkodzenie wątroby może wystąpić z powodu braku równowagi enzymów, podczas gdy rabdomioliza prowadzi do rozpadu tkanki mięśniowej, uwalniając mioglobinę do krwiobiegu, co może stać się śmiertelne, jeśli nerki nie mogą jej szybko przefiltrować. Dodatkowe powikłania obejmują tworzenie się nieprawidłowych skrzepów krwi, które powodują krwawienie wewnętrzne i niewydolność narządów, wtórne infekcje bakteriami, takimi jak paciorkowiec lub gronkowiec, rozsiane wykrzepianie wewnątrznaczyniowe z powodu dysfunkcyjnych reakcji krzepnięcia oraz przewlekłe zmęczenie, któremu często towarzyszy mgła mózgowa, silne zmęczenie, zawroty głowy lub zaburzenia myślenia. W oparciu o te wyzwania zaproponowano następujące hipotezy: H1: Wykorzystanie algorytmu uczenia transferowego może znacznie zwiększyć dokładność przewidywania i możliwość przenoszenia modeli poprzez zastosowanie danych epidemiologicznych do identyfikacji PASC. H1a: Modele uczenia głębokiego, które są dostrajane przy użyciu danych epidemiologicznych, działają lepiej niż inne modele. H1b: Połączenie specyficznych dla regionu determinantów PASC z modelami uczenia transferowego poprawia dokładność i efektywność klasyfikacji i grupowania. H1c: Ta kombinacja może również ujawnić wcześniej nieujawnione lub przeoczone wzorce specyficzne dla regionu. H1d: Uczenie transferowe umożliwia skrócenie czasu szkolenia i szybszą konwergencję w porównaniu z innymi modelami.
Access restricted. Please log in or start a trial to view this content.
Badanie to zostało przeprowadzone zgodnie z wytycznymi etycznymi dotyczącymi badań z udziałem ludzi. Wszystkie dane pacjentów wykorzystane w tym badaniu zostały w pełni zanonimizowane przed uzyskaniem dostępu i analizą. Nie wykorzystano żadnych danych osobowych. Protokół badawczy został zweryfikowany i zatwierdzony przez Instytucjonalną Komisję Rewizyjną (IRB), zgodnie z Deklaracją Helsińską. W stosownych przypadkach uzyskano zezwolenia na dostęp do danych od odpowiednich organów lub repozytoriów danych. Ze względu na to, że badanie to obejmuje wtórną analizę danych pozbawionych elementów pozwalających na identyfikację, IRB uchylił świadomą zgodę. Proponowany model transferu utajonego jest techniką uczenia częściowo nadzorowanego opartą na uczeniu maszynowym, zaprojektowaną w celu znalezienia ukrytych wzorców i przeniesienia ich ze źródłowego zestawu danych do docelowego zestawu danych, zapewniając, że jest wysoce odpowiedni do analizy problemów epidemiologicznych PASC16. Stany pocovidowe często objawiają się różnymi objawami w różnych populacjach, co prowadzi do niespójnych i skąpych danych. Proponowane prace dotyczą problemu rzadkich danych spowodowanych różnorodnymi objawami w różnych regionach poprzez poznanie ulepszonych reprezentacji utajonych w celu reprezentowania ukrytych wzorców zdrowotnych ze zbiorów danych i przedstawienie ich jako pojawiających się zestawów danych. Aby przeprowadzić tę konwersję, te techniki transferu utajonego używają koderów automatycznych lub odmianowych do reprezentowania zarówno danych źródłowych, jak i docelowych we wspólnej przestrzeni utajonej. Ta wspólna przestrzeń chroni uzyskane ukryte wzorce, ponieważ skupiska objawów pocovidowych są dobrze zachowane w różnych regionach21. Prototyp może być dalej rozwijany dzięki ulepszonemu uogólnieniu z adaptacją domeny. Korzystając z tego podejścia, model może pomóc w rozpoznawaniu i przewidywaniu zagrożonych klastrów oraz wspierać nadzór nad zdrowiem publicznym na odległych obszarach. Ta praca usprawnia również uczenie się, zmniejszając zależność od całkowicie oznaczonych danych. Dzięki temu proponowane podejście staje się potężnym narzędziem do analizy luk ze względu na uogólnione podejście do różnych populacji.
1. Źródła i gromadzenie danych
W badaniu wykorzystano publicznie dostępne zestawy danych Kaggle (zestaw danych dotyczących chorób sercowo-naczyniowych, zestaw danych dotyczących przewidywania raka, zestaw danych przewidywania cukrzycy we wczesnym stadium i zestaw danych przewidywania zdrowia psychicznego). W związku z tym zgoda IRB w tym zgłoszeniu nie jest wymagana.
W przypadku zestawów danych zawierających dane obrazowe wstępne przetwarzanie przeprowadzono przy użyciu języka Python z bibliotekami TensorFlow i OpenCV. Etapy wstępnego przetwarzania obejmowały zmianę rozmiaru obrazu (np. 224 × 224 pikseli), konwersję skali szarości lub RGB, normalizację wartości pikseli do zakresu [0, 1] oraz techniki zwiększania danych (obracanie, odwracanie, powiększanie) w celu zwiększenia uogólnienia modelu i zmniejszenia nadmiernego dopasowania. Tablice obrazów zostały następnie przekształcone w tablice NumPy w celu dalszego przetwarzania i wprowadzania modelu.
W przypadku wyboru funkcji zaimplementowano rekurencyjną eliminację cech (RFE) przy użyciu klasy RFE Scikit-learn, zwykle w połączeniu z estymatorem regresji logistycznej lub lasu losowego. Liczba wybranych obiektów różniła się w zależności od zestawu danych, ale powszechną konfiguracją było zredukowanie wymiarowości do 10–15 najbardziej wpływowych funkcji na podstawie punktacji rekurencyjnej. Metoda ta poprawiła dokładność klasyfikacji przy jednoczesnym zmniejszeniu złożoności obliczeniowej i nadmiernego dopasowania modelu.
W badaniu wykorzystano cztery publicznie dostępne zestawy danych z Kaggle. Zestaw danych chorób sercowo-naczyniowych, zestaw danych przewidywania raka piersi, zestaw danych przewidywania cukrzycy we wczesnym stadium oraz zestaw danych przewidywania zdrowia psychicznego. Te zestawy danych zostały pobrane bezpośrednio z Kaggle i składają się z ustrukturyzowanych danych tabelarycznych zawierających atrybuty kliniczne i oparte na ankiecie. Wstępne przetwarzanie danych przeprowadzono przy użyciu języka Python z kluczowymi bibliotekami, takimi jak Pandas do manipulowania danymi, NumPy do operacji numerycznych i Scikit-learn do wstępnego przetwarzania danych, wyboru funkcji i modelowania. Brakujące wartości zostały przypisane przy użyciu strategii średniej lub modalnej, zmienne jakościowe zostały zakodowane za pomocą kodowania One-Hot lub Label Encoding, a funkcje liczbowe zostały przeskalowane przy użyciu StandardScaler lub MinMaxScaler. W przypadku klas niezrównoważonych zastosowano SMOTE (Synthetic Minority Oversampling Technique) z pakietu imblearn. Rekurencyjna eliminacja cech (RFE) została zaimplementowana przy użyciu modułu RFE firmy Scikit-learn z estymatorami, takimi jak regresja logistyczna i las losowy, a liczba funkcji była zwykle redukowana do 10-15 najbardziej wpływowych w oparciu o wskaźniki wydajności modelu, takie jak ROC-AUC i dokładność.
2. Architektura modelu
W ramach tych badań zaproponowano wariant algorytmu sieci neuronowej zwany modelem transferu utajonego do trenowania obrazów wejściowych z bazy danych obrazów COVID-19. Ta praca jest skuteczna w przezwyciężaniu problemu znikającego gradientu podczas budowania głębokiej sieci neuronowej. Chociaż dostępne są różne warianty sieci neuronowych o różnych konfiguracjach warstw, praca ta koncentruje się przede wszystkim na implementacji szczątkowych technik uczenia się podczas procesu trenowania głębokich sieci neuronowych. Proponowany model transferu utajonego wykorzystuje ulepszony algorytm ResNet-50 z konwolucyjną strukturą warstw 7 x 7, wraz ze spłaszczonymi i gęstymi sieciami warstwowymi. Warstwy te są wykorzystywane do transformacji obrazu i wieloklasowej klasyfikacji pacjentów z PASC, pod względem regionu, w celu wyodrębnienia wzorców22. W tej pracy uwzględniono obrazy wejściowe o rozmiarze 256 x 256 x 3, wykorzystujące wydajne hiperparametry, zachowanie uczenia się, procedury optymalizacji i objętości partii. Proponowany model transferu utajonego uwzględnia zestaw danych 12 946 obrazów w celu sklasyfikowania pacjentów z aktywnym ryzykiem rozwoju problemów sercowo-naczyniowych, raka, przewlekłych chorób układu oddechowego, cukrzycy i problemów ze zdrowiem psychicznym. Szczegóły zestawu danych i hiperparametry podano odpowiednio w tabeli 2 i tabeli 3.
Aby zapewnić odtwarzalność, wszystkie etapy implementacji, wstępnego przetwarzania i oceny modelu przeprowadzono w kontrolowanym środowisku przy użyciu języka Python w Jupyter Notebook w systemie z systemem Windows 11, wyposażonym w procesor Intel Core i7 (11. generacji), 16 GB pamięci RAM i procesor graficzny NVIDIA GeForce RTX 3060 (do dowolnego przyspieszonego przetwarzania, chociaż procesor graficzny nie był niezbędny dla tych zestawów danych). Używane biblioteki oprogramowania obejmują Pandas 1.5.3, NumPy 1.24, Scikit-learn 1.3.0, Imbalanced-learn 0.11.0 dla SMOTE, Matplotlib 3.7.1 i Seaborn 0.12.2 dla wizualizacji. Przetwarzanie wstępne obejmowało obsługę brakujących wartości za pomocą imputacji średniej/trybu, kodowanie zmiennych jakościowych przy użyciu kodowania One-Hot lub Label oraz skalowanie funkcji przy użyciu narzędzia StandardScaler. Do opracowania modelu wykorzystano klasyfikatory, takie jak regresja logistyczna, las losowy i maszyny wektorów nośnych, z rekurencyjną eliminacją cech (RFE) w celu redukcji wymiarowości. Modele oceniano za pomocą 5-krotnej walidacji krzyżowej, a wydajność mierzono za pomocą wskaźników, w tym dokładności, precyzji, kompletności i wyniku ROC-AUC, zapewniając spójny i powtarzalny potok.
3. Przetwarzanie wstępne i inżynieria funkcji
Aby uzyskać statystycznie istotne cechy z tych zestawów danych, stosuje się technikę wstępnego przetwarzania o nazwie "Wybór cech przy użyciu rekurencyjnej eliminacji cech (RFE)" oraz potok modelowania o nazwie "Transfer Learning with Multi-Layer Perceptron (MLP)".
4. Szkolenie i walidacja
Do oceny proponowanego podejścia do analizy i przewidywania objawów PASC wykorzystano zorganizowane podejście szkoleniowe i walidacyjne. Na początku zastosowano hierarchiczny podział pociągu i testu, aby uzyskać skumulowany system etykiet klas ze stosunkiem 80:20 danych treningowych i testowych. Następnie zaimplementowano walidację krzyżową k-krotną z k = 5 na danych treningowych w celu oceny niezawodności modelu w różnych podziałach danych. Zastosowano klasyfikator MLP z dwiema ukrytymi warstwami (64 i 32 neurony) i 300 iteracjami. Wdrożono dalsze techniki reprezentacji cech i uczenia się transferowego.
5. Metryki oceny
Dokładność, miara F, średnia G, MAPE, czułość i swoistość zostały obliczone na podstawie danych testowych w celu porównania wydajności proponowanego modelu. Wyniki ilustrują poprawę wskaźników oceny, dokładności, miary F, średniej G, MAPE, czułości i swoistości w danych testowych w celu porównania wydajności proponowanego modelu z innymi najnowocześniejszymi modelami, a mianowicie VGG-16 CNN, VGG-19 CNN, DenseNet-121 CNN, InceptionV3 CNN, ResNet-101 CNN, MobileNetV2 CNN oraz proponowanym modelem transferu utajonego. Powyższy zestaw danych zawiera próbki treningowe, walidacyjne i testowe danych związanych z chorobami sercowo-naczyniowymi, nowotworami, przewlekłymi układami oddechowymi, cukrzycą i chorobami psychicznymi.
Wszystkie eksperymenty zostały przeprowadzone w środowisku Windows 11 przy użyciu Pythona 3.10 na systemie z procesorem Intel Core i7, 16 GB pamięci RAM i procesorem graficznym NVIDIA RTX 3060. Publicznie dostępne zestawy danych Kaggle zostały wstępnie przetworzone przy użyciu narzędzi Pandas, NumPy i Scikit-learn w celu imputacji brakujących wartości, kodowania, skalowania i wyboru funkcji za pomocą rekurencyjnej eliminacji funkcji (RFE). Modele takie jak regresja logistyczna, las losowy i SVM zostały przeszkolone i ocenione przy użyciu 5-krotnej walidacji krzyżowej z metrykami, takimi jak dokładność, precyzja, kompletność i ROC-AUC, aby zapewnić odtwarzalność i spójność działania.
W powyższej tabeli przedstawiono szczegółowe informacje o hiperparametrach oraz technice lub algorytmie, który ich używa. Szybkość uczenia się, technika wczesnego zatrzymywania, wielkość partii, wielkość epoki, wywołania zwrotne, funkcja strat i metryki do pomiaru wydajności są podane dla algorytmu optymalizatora Adama.
Access restricted. Please log in or start a trial to view this content.
Proponowany model jest porównywany z istniejącymi modelami transferu, w tym VGG-16 CNN, VGG-19 CNN, DenseNet-121 CNN, InceptionV3 CNN, ResNet-101 CNN i MobileNetV2 CNN. Szczegóły parametrów i wyniki porównania przedstawiono odpowiednio w tabeli 4, tabeli 5 i na rysunku 2. Wyniki ilustrują poprawę wskaźników oceny przy użyciu proponowanego modelu w porównaniu z innymi modelami, a mianowicie VGG-16 CNN, VGG-19 CNN, DenseNet-121 CNN, InceptionV3 CNN, ResNet-101...
Access restricted. Please log in or start a trial to view this content.
Propozycja koncentruje się na zbudowaniu modelu uczenia się z ukrytym transferem, aby poradzić sobie z wpływem PASC. Struktura ta prowadzi do poważnych problemów ze zdrowiem fizycznym i psychicznym, szczególnie u osób w średnim wieku i starszych oraz osób cierpiących na wcześniejsze choroby przewlekłe, takie jak choroby układu krążenia, nowotwory, choroby układu oddechowego i cukrzyca. Ostatecznym celem jest ujednolicenie różnorodnych danych pacjentów z różnych populacji za pomocą modelu utajonego transferu, aby umożliwi...
Access restricted. Please log in or start a trial to view this content.
Autorzy oświadczają, że nie występują konflikty interesów w związku z publikacją niniejszego artykułu.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| Środowisko chmury obliczeniowej (np. Google Colab / AWS EC2) | Google / Amazonka | N/A | Służy do trenowania modeli uczenia głębokiego z akceleracją procesora GPU |
| Zestaw danych epidemiologicznych (poostre następstwa SARS-CoV-2, specyficzne dla regionu) | Repozytoria danych dotyczących zdrowia publicznego (np. WHO, CDC, ICMR, szpitale regionalne) | N/A | Zestaw danych do eksperymentów z uczeniem transferowym |
| Notes Jupyter | Projekt Jupyter | Oprogramowanie typu open source (oprogramowanie typu open source) | Interaktywne środowisko do kodowania i dokumentacji |
| Keras (Język kers) | Oprogramowanie typu open source (oprogramowanie typu open source) | Zintegrowany z TensorFlow | Interfejs API wysokiego poziomu do tworzenia i trenowania modeli uczenia głębokiego |
| Matplotlib / Urodzony na morzu | Oprogramowanie typu open source (oprogramowanie typu open source) | N/A | Biblioteki wizualizacyjne wykorzystywane do tworzenia wykresów i analizy trendów epidemiologicznych |
| NumPy | Oprogramowanie typu open source (oprogramowanie typu open source) | N/A | Biblioteka obliczeń numerycznych |
| Pandy | Oprogramowanie typu open source (oprogramowanie typu open source) | N/A | Biblioteka manipulacji i analizy danych |
| Wstępnie wytrenowane modele CNN/Transformer (np. EfficientNet, modele oparte na) | Piasta TensorFlow / PrzytulanieTwarz | Specyficzne dla modelu | Służy do uczenia się transferowego i dostrajania na potrzeby prognozowania epidemiologicznego |
| Python (wersja 3.8 lub nowsza) | Fundacja oprogramowania Python | Oprogramowanie typu open source (oprogramowanie typu open source) | Język programowania używany do wstępnego przetwarzania danych, trenowania modelu i oceny |
| Scikit-naucz się | Oprogramowanie typu open source (oprogramowanie typu open source) | N/A | Biblioteka uczenia maszynowego do przetwarzania wstępnego, metryk oceny i modeli bazowych |
| TensorFlow (wersja 2.x) | Wyszukiwarka Google | Oprogramowanie typu open source (oprogramowanie typu open source) | Struktura głębokiego uczenia używana do uczenia transferowego i wdrażania modeli |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission