제안된 작업은 장기적인 건강 결과를 더 잘 이해하고 맞춤형 역학적 통찰력을 지원하기 위해 새로운 전이 학습 기술을 설계하고 구현하는 것을 목표로 합니다.
Research Article
제안된 작업은 장기적인 건강 결과를 더 잘 이해하고 맞춤형 역학적 통찰력을 지원하기 위해 새로운 전이 학습 기술을 설계하고 구현하는 것을 목표로 합니다.
SARS-CoV-2(PASC)의 급성 후유증은 특히 중년 및 노년층과 심혈관 질환, 암, 호흡기 질환 및 당뇨병과 같은 만성 건강 상태를 가진 사람들에게 심각한 결과를 초래하는 극도의 위험 환경을 초래하고 있습니다. 신체 장애에는 심각하고 지속적인 신체 통증, 피로, 신체 움직임의 어려움이 포함됩니다. 마찬가지로, 우울증, 기분 변화, 절망감, 집중력 저하와 같은 기분 장애는 PASC의 중요한 예측 인자입니다. 주로 중년 및 노년층을 중심으로 한 개인은 잦은 입원, 의학적으로 불안정한 상태, 경우에 따라 예상치 못한 사망 등 신체적, 정신적 결과가 증가하고 있습니다. PASC를 적시에 식별하는 것은 관련 건강 문제의 심각성을 완화하는 데 필수적입니다. 이 연구는 다양한 지역의 환자 데이터를 통합하고, 데이터에 대한 통찰력을 추출하고, 개인화된 의료 솔루션을 제공하기 위한 잠재 전송 모델을 권장합니다. 이 연구는 공중 보건 결과를 개선하기 위해 데이터 단순화, 일반화, 개인화, 통찰력 감지, 가변성, 확장성 및 적응성을 개선할 수 있는 잠재 전이 학습 모델의 잠재력을 특징으로 합니다.
2019년 코로나바이러스 질병(COVID-19)은 중국 우한에서 처음 확인되었습니다. 2019년12월 31일, 중국은 세계 보건 기구(WHO)에 중국 후베이성 우한시에서 발견된 원인 불명의 폐 염증 질환에 대해 보고했습니다1. 2019년 12 월 31일부터 2020년 1 월 3일까지 44명이 이 바이러스에 감염되었으며 도매 시장인 "화난 해산물"과 접촉한 이력이 있습니다. 처음에 환자들은 발열, 피로, 마른 기침을 목격했습니다. 이 바이러스의 발생은 2020년 1 월 30일에 발생했으며 WHO에 의해 국제적으로 우려되는 공중보건 비상사태로 발표되었습니다1. 2020년 2월 중순까지 25개국 이상이 신종 코로나바이러스의 영향을 받았으며, 중국과 기타 국가에서 각각 70,635건과 794건이 발생했습니다. 중국에서 1,772명(1772년)이 사망했고 모든 국가에서 3명이 사망했다고 공식적으로 선언되었습니다. 2019년 12 월 31일, 많은 폐렴 감염 사례가 보고되었으며 WHO는 우한에서 보고된 사망자가 없다고 보고했습니다. 태국에서는 2020년 1 월 13일 방콕에서 우한시를 방문한 후 2020년 1 월 8일 우한시에서 돌아온 61세 중국인 여성에 대한 첫 번째 사례가 발표되었습니다. 그녀는 인후통, 기침, 발열, 오한, 두통 등의 증상을 보였습니다. 이 사람은 2020년 1 월 8일 열 감시에서 COVID-19 양성 판정을 받았고 그날 태국 경찰관에 의해 병원에 입원했습니다. 그 사람은 질병에서 회복되었습니다. 바이러스의 유전자 염기서열 분석 구조는 중국 정부가 공유했으며 더 많은 국가가 환자를 효율적으로 검사하고 진단할 수 있도록 했습니다2.
미국에서는 2020년 1월 19일 워싱턴에서 가족 모임을 마치고 2020년 1월 15일 우한시에서 돌아온 35세 남성의 첫 번째 사례가 보고되었습니다. 그는 2020년 1월 15일부터 기침과 발열 증상이 있었고 건강 검진을 받으라는 권고를 받았습니다. 그는 코로나19 감염자와 접촉하지 않았지만 우한을 방문하는 동안 중국에서 발생한 발병으로 인해 코로나19에 감염되었습니다. 그는 2020년 1월 20일 코로나 양성 판정을 받았고 의료 센터의 공중 격리실에 격리되었습니다. 격리병동에 입원한 후 맥박수 110/min, 혈압 134/87mmHg, 체온 37.2°C, 호흡수 16bpm, 정상 폐 청진으로 산소포화도 96%로 정상이었다. 정기적인 COVID 모니터링 및 조사 테스트가 수행되었으며 이틀 동안 기침, 메스꺼움, 구토를 보였습니다3. 입원 둘째 날에는 복부 불편감을 호소했고, 다음날 흉부 방사선 사진에서 이상이 보이지 않았다. 그러나 5일째 되는 날에는 흉부 방사선 사진에서 폐렴의 유의미한 증거가 나타났고 산소 포화도는 90%로 떨어졌습니다. 그는 포화 수준을 개선하기 위해 보충된 산소 요법을 받도록 조언받았습니다. 8일째 되자 상태가 호전되어 퇴원했습니다. 인도에서는 2020년 1월 27일 케랄라에서 중국의 코로나19 발병으로 인해 우한시에서 돌아온 20세 여성의 첫 번째 사례가 보고되었습니다. 그녀는 2020년 1월 23일부터 2020년 1월 26일까지 무증상이었고 2020년 1월 27일부터 인후통과 가벼운 기침을 목격했습니다. 그녀는 코로나19 감염자들과 접촉하지 않았지만 우한에서 쿤밍까지 기차를 타는 동안 호흡기 질환, 감기, 기침을 앓고 있는 여러 사람을 발견했습니다. 따라서 케랄라 정부 당국은 그녀에게 격리된 장소에 머물면서 앞으로 며칠 동안 코로나 증상이 나타나면 의료 시설을 방문하라고 지시했습니다. 종합병원에 입원한 후 맥박수 82/분, 혈압 130/80mmHg, 체온 98.5°F, 정상 폐 청진으로 산소포화도 96%로 정상이었습니다. 질병 발생일로부터 3일, 7일, 20일에 정기적인 COVID 모니터링 및 조사 테스트를 실시했습니다. 구인두 면봉 검사는 질병 발생일로부터 23일 동안 첫날과 격일로 실시했으며 17일째부터 음성 판정을 받았습니다. 그녀는 모든 검사를 통해 무효를 얻었고 2020년 2월 20일에 퇴원했습니다.
영국에서는 2020년 1 월 23일 우한 시에서 방문 후 돌아온 50세 여성에 의해 첫 번째 COVID-19 사례가 보고되었습니다. 처음에 그녀는 무증상이었고 2020년 1 월 26일에 발열, 쇠약, 인후통, 마른 기침 증상이 나타났습니다. 종합병원 입원 후 호흡수 18/분, 혈압 120/80mmHg, 체온 37.6°C, 산소포화도 97%로 정상이었다. 정기적인 코로나 모니터링 및 조사 검사가 수행되었으며 환자의 상태는 임상적으로 안정적입니다. 초기 검사에서 그녀는 경미한 림프구 감소증과 C 반응성 단백질의 증가로 보고되었습니다. 입원 3일 째 만에 모든 증상이 사라졌고, 입원 둘째부터 구인두 면봉 검사에서 코로나 음성으로 나타났다. 그녀는 2주 동안 격리되었고 코와 목 면봉 검사는음성 5였습니다.
코로나바이러스(CoV)는 1960년대에 발견되었으며, 다음과 같이 분류되었습니다. Orthornavirae는 리보핵산(RNA)으로 만들어진 게놈을 포함하고 RNA 의존성 RNA 중합효소(RdRp)로 번역되는 다양한 바이러스의 왕국/영역이라고 합니다. RdRp는 바이러스 RNA 게놈을 메신저 RNA(mRNA)로 전사하고 게놈을 복제합니다. Orthornavirae에 있는 바이러스의 특성에는 진화, 유전적 돌연변이, 재조합 및 재조합이 포함됩니다6. RNA로 구성된 게놈은 양성 가닥 RNA 바이러스, 음극 가닥 RNA 바이러스(-ssRNA 바이러스), 이중 가닥 RNA 바이러스(dsRNA 바이러스)의 세 가지 유형이 있습니다. 양성 가닥 RNA 바이러스(+ssRNA 바이러스)는 양성 감각의 단일 가닥 RNA를 가진 관련 바이러스의 모음입니다. +ssRNA 바이러스의 게놈은 택배 RNA(mRNA)로 사용할 수 있으며 숙주 세포의 리보솜에 의해 바이러스 관련 단백질로 직접 형질전환됩니다. +ssRNA 바이러스는 Pisuviricota, Kitrinoviricota 및 Lenarviricota와 같은 문과 관련이 있습니다. 양성 가닥 RNA 바이러스에는 헤파시바이러스 C, 뎅기열, 에볼라, 홍역, 광견병, 인플루엔자, 중증급성호흡기증후군 CoV, 중동호흡기증후군 코로나바이러스 CoV, 중증급성호흡기증후군 CoV7 등 다양한 병원체가 포함되어 있습니다. 음가닥 RNA 바이러스(-ssRNA 바이러스)는 음의 감각, 단일 가닥 RNA를 갖는 관련 바이러스의 모음입니다. -ssRNA 바이러스의 게놈은 택배 RNA(mRNA)로 볼 수 있으며 RNA 의존성 RNA 중합효소(RdRp)라는 효소에 의해 생성됩니다. -ssRNA 바이러스는 Negarnaviricota 문을 구성합니다. 음수 가닥 RNA 바이러스는 문에서 두 가지 주요 가지, 즉 Haploviricotina 및 Polyploviricotina를 포함합니다. 중요한 척추동물-ssRNA 바이러스는 에볼라, 한타, 인플루엔자, 라사열, 광견병입니다. 이중 가닥 RNA 바이러스(dsRNA 바이러스)는 이중 가닥 RNA 게놈을 가진 다계통 바이러스의 모음입니다. dsRNA의 게놈은 바이러스 RNA 의존성 RNA 중합효소(RdRp)에 의해 +ssRNA를 전사합니다. +ssRNA 바이러스의 게놈은 택배 RNA(mRNA)로 사용될 수 있으며 숙주 세포의 리보솜에 의해 공개적으로 바이러스 관련 단백질로 형질전환됩니다. 반면 -ssRNA 바이러스의 게놈은 택배 RNA(mRNA) 역할을 할 수 있으며 효소 RNA 의존성 RNA 중합효소(RdRp)에 의해 생성될 수 있습니다. dsRNA 바이러스는 Duplornaviricota 및 Pisuviricota 문과 관련이 있습니다. 이중 가닥 RNA 바이러스에는 로타바이러스(어린 아이들에게 영향을 미치는)와 블루텅 바이러스(소와 양에 영향을 미치는)가 포함됩니다8.
피수비리코타는 모든 + ssRNA 바이러스와 dsRNA를 포함하는 RNA 바이러스의 문이라고 합니다. 하위 분류에는 Duplopiviricetes, Pisoniviricetes 및 Stelpaviricetes의 세 가지 클래스가 포함됩니다. Pisoniviricetes는 진핵생물을 감염시키고 오염시키는 +ssRNA 바이러스의 일종입니다. 하위 분류에는 Nidovirales, Picornavirales 및 Sobelivirales의 세 가지 하위 클래스가 포함됩니다. Nidovirales는 척추동물과 무척추동물을 감염시키고 오염시키는 외피 +ssRNA의 순서입니다9. 여기에는 Abnidovirineae, Cornidovirineae, Nanidovirinae, Arnidovirineae, Mesnidovirineae 및 Tornidovirineae와 같은 바이러스의 하위 목이 포함되어 있습니다. Abyssoviridae, Coronaviridae, Nanghoshaviridae, Nanhypoviridae, Arteriviridae, Medioniviridae, Cremegaviridae, Mesoniviridae, Euroniviridae, Gresnaviridae, Roniviridae, Tobaniviridae, Mononiviridae 및 Olifoviridae8과 같은 다양한 과가 Nidovirales에서 인식됩니다. 코로나바이러스과(Coronaviridae)는 포유류, 양서류 및 조류를 감염시키는 외피가 있는 +ssRNA 바이러스 계열입니다. 하위 분류에는 Letovirinae와 Orthocoronavirinae의 두 아과가 포함됩니다. Orthocoronavirinae의 구성원은 코로나바이러스로 식별됩니다. 코로나바이러스는 포유류와 조류에 감염을 일으키는 RNA 바이러스와 관련된 코로나바이러스과의 아과입니다. 포유류와 조류에서 이러한 바이러스는 상기도 면봉 감염 및 하기도 면봉 감염과 같은 경증에서 중증의 호흡기 면봉 감염을 일으킵니다10. 이 바이러스는 인간과 일부 포유류에서 SARS, MERS 및 COVID-19, 돼지와 소의 설사, 간염 및 뇌척수염을 유발합니다. 코로나바이러스는 Orthornavirae 왕국, Pisuviricota 문, Pisoniviricetes 계단, Nidovirales 하위 계열, 코로나바이러스과, 오르토코로나바이러스과 아과에 속하는 외피 +ssRNA입니다. 코로나바이러스는 알파 코로나바이러스, 베타 코로나바이러스, 감마 코로나바이러스, 델타 코로나바이러스11의 4개 속으로 분류됩니다. 이 연구를 바탕으로 다음과 같은 가설이 형성됩니다.
중증급성호흡기증후군 코로나바이러스-2(SARS-CoV-2) 스파이크 돌연변이는 극도로 당화됩니다. 이러한 스파이크 돌연변이의 생물학적 결과를 조사하는 것은 매우 중요합니다. 둘 이상의 돌연변이는 스파이크 단백질 서열의 동일한 위치에서 발생할 수 있습니다. 스파이크 단백질 서열은 전 세계에서 검출된 광범위한 돌연변이를 추정할 수 있는 기회를 제공했으며 표 1에 나와 있습니다. 고려된 돌연변이는 바이러스의 인간 간 전파의 결과였습니다. 백신 접종은 SARS-CoV-2를 강력하게 중화할 수 있는 면역 반응을 촉발했습니다12. 과학적 조사를 통해 스파이크의 돌연변이를 숨기는 SARS-CoV-2 변이의 출현이 발견되었지만 핵심 목표는 숙주 항체의 중화였습니다. 백신 접종 후 일부 SARS-CoV-2 변이의 중화가 감소한다는 징후가 진화하고 있었습니다. 백신 제조업체는 백신 구조의 잠재적 업데이트를 위한 다양한 플랫폼을 공식화했으며, 돌연변이의 표현형 영향을 밝히기 위한 실험을 통해 전 세계 바이러스 집단의 유전적 및 항원 변이에 대한 조사가 수행되었습니다13.
NCBI(National Center for Biotechnology Information) 바이러스 데이터베이스에는 아프리카, 아시아, 유럽, 북미, 남미 및 오세아니아의 10333개의 인간 SARS-CoV-2 스파이크 단백질이 포함되어 있습니다. 서로 다른 지리적 위치에서 조사한 스파이크 단백질의 여러 돌연변이의 전파는 위의 표에 나와 있습니다. 알파, 베타, 감마 및 델타 코로나바이러스에 대한 자세한 내용과 해당 속, 특징 및 설명은 위 표에 나와 있습니다. 각 속은 기본, 변종, 중요성, 모양, 측정, 구조, 막 융합, 방출, 오염 및 합성과 같은 특징으로 설명됩니다14.
표 1에서 언급한 바와 같이, HCoV-229E, HCoV-OC43, HCoV-NL63 및 HCoV-HKU1과 같은 바이러스 변종은 경증에서 중등도의 질병 증상을 관찰한 반면, SARS-CoV, MERS-CoV 및 SARS-CoV-2는 인간에서 심각한 질병의 심각한 증상을 관찰했습니다. 바이러스 미생물은 신체를 통과하여 숙주 세포를 감염시킵니다. 코로나바이러스의 범주에 따라 숙주 신체의 다른 부분에 있는 세포를 감염시킵니다. 강하고 건강한 세포에 부착되자마자 세포 안으로 들어갑니다15. 바이러스가 숙주 세포 내부에 정착한 후 어수선해지고 DNA와 RNA가 방출되어 핵을 향해 이동합니다. 그들은 단편으로 이동하여 바이러스의 다양한 번식을 초래할 것입니다. 이 사본은 핵에서 나와 조립되어 DNA와 RNA를 보호하는 단백질을 받습니다. 바이러스의 이러한 새로운 번식은 이전에 감염되고 병든 세포를 비워 다른 건강한 숙주 세포를 다시 오염시키고 증식할 것입니다. 숙주의 면역 체계가 코로나바이러스와 싸우는 데 성공하면 개인은 아프지 않을 것입니다. 그렇지 않으면 건강에 해로운 합병증이 발생할 수 있습니다. 면역 체계가 코로나바이러스를 제어하지 못하면 발병 기전이 발생합니다. 이를 통해 바이러스는 체내에 들어가 다른 장기를 감염시킵니다. 징후나 증상이 얼마나 심각한지에 따라 개인은 휴식을 취하거나 의료 지원을 받을 것입니다16. 코로나바이러스의 수명주기와 다양한 변종은 그림 1에 나와 있습니다.
위의 그림은 코로나 바이러스의 수명 주기와 단계를 자세히 보여줍니다. (1) 부착 및 입원, (2) 융합 및 엔도사이토시스, (3) 단백질 분해, (4) 번역 및 절단, (5) 복제, (6) 엑소사이토시스, (7) 성숙 바이러스 방출의 7단계가 있습니다. 부착 및 입원 단계에서 코로나바이러스 미생물은 숙주로 유입되며 목표는 숙주 저항성 정찰 및 개입 전략입니다. 숙주 세포에 들어가기 위해 이 바이러스는 먼저 결합을 위해 세포의 표면 수용체에 부착한 다음 엔도좀으로 들어가 궁극적으로 융합을 시작합니다. 나중에 코로나바이러스는 바이러스 관련 및 리소좀 칼집과 융합하여 숙주 세포로 들어갑니다. 바이러스 표면에 고정된 스파이크 단백질은 이러한 바이러스의 진입을 방해합니다. 엔도사이토시스는 물질이 숙주 세포로 운반되는 세포 과정입니다17. 채택할 물질은 다양한 세포집으로 둘러싸여 있으며, 숙주 세포 내부에서 솟아올라 섭취된 물질을 둘러싸는 소포를 생성합니다. 엔도사이토시스는 포이노사이토시스와 식균작용을 포함한다. 전자는 세포를 마시는 것이고 후자는 세포를 먹는 것입니다. 단백질 분해는 바이러스 관련 단백질을 미량 폴리펩타이드/아미노산으로 항목화하는 것입니다. 구조화된 mRNA 전환은 유전자 통신을 억제하고 단백질 풍부함을 즉시 분기시키는 전사 후 과정입니다. 이는 세포 성장, 세포 진행, 시냅스 가소성, 스트레스 레토르트 및 생산적인 바이러스 발달과 같은 풍부한 생물학적 절차에서 주요 부분을 차지합니다18. 바이러스 번역 절차는 선동, 신장 및 용해의 세 단계로 나눌 수 있습니다.
바이러스 복제는 감염된 숙주 세포의 오염을 통해 유전 바이러스를 생성하는 과정입니다. 바이러스 번식이 일어나기 위해서는 바이러스가 먼저 숙주 세포에 들어가야 합니다. 바이러스 게놈을 반복적으로 복제하고 이러한 사본을 캡슐화함으로써 바이러스는 생존하고 새로운 숙주 세포를 감염시켜 계속 확산합니다19. 엑소사이토시스는 바이러스 입자를 함유한 소포가 감염된 세포에서 분비되고 방출되어 새로 형성된 바이러스가 숙주 체에 들어가 추가로 건강한 세포를 감염시킬 수 있도록 하는 메커니즘입니다. SARS-CoV-2(PASC)의 급성 후유증은 주로 폐에 영향을 미치는 증후군으로 인식되지만 여러 장기에 영향을 미쳐 장기 손상 또는 장기 부전을 초래할 수 있습니다20. 이러한 합병증은 사망이나 장기적인 건강 문제로 이어질 수 있습니다. 예를 들어, 심장은 심부전 또는 기타 합병증의 위험이 증가할 수 있습니다. 폐는 폐렴 후 장기적인 호흡 곤란을 지속할 수 있습니다. 뇌는 뇌졸중, 발작 또는 길랭-바레 증후군의 영향을 받을 수 있습니다. 그리고 신장은 패혈성 쇼크를 유발할 수 있는 손상을 입을 수 있습니다. 간 손상은 효소 불균형으로 인해 발생할 수 있으며, 횡문근융해증은 근육 조직의 파괴로 이어져 미오글로빈을 혈류로 방출하여 신장이 미오글로빈을 빠르게 걸러내지 못하면 치명적일 수 있습니다. 추가 합병증으로는 내부 출혈 및 장기 부전을 유발하는 비정상적인 혈전 형성, 패혈성 인혈성 또는 포도상구균과 같은 박테리아에 의한 2차 감염, 기능 장애 응고 반응으로 인한 파종성 혈관내 응고, 종종 브레인 포그, 심한 피로, 현기증 또는 사고 장애를 동반합니다. 이러한 과제를 바탕으로 다음과 같은 가설이 제안됩니다. H1: 전이 학습 알고리즘을 활용하면 역학 데이터를 적용하여 지역별 PASC를 식별함으로써 모델의 예측 정확도와 전이 가능성을 상당히 향상시킬 수 있습니다. H1a: 역학 데이터를 사용하여 미세 조정된 딥러닝 모델은 다른 모델보다 더 나은 성능을 발휘합니다. H1b: 지역별 PASC 결정 요인을 전이 학습 모델과 결합하면 분류 및 클러스터링의 정확성과 효율성이 향상됩니다. H1c: 이 조합은 이전에 공개되지 않았거나 간과된 지역별 패턴을 드러낼 수도 있습니다. H1d: 전이 학습은 다른 모델에 비해 훈련 시간을 줄이고 수렴을 가속화할 수 있습니다.
Access restricted. Please log in or start a trial to view this content.
본 연구는 인간 데이터와 관련된 연구에 대한 윤리적 지침에 따라 수행되었습니다. 이 연구에 사용된 모든 환자 데이터는 액세스 및 분석 전에 완전히 익명으로 처리되었습니다. 개인 식별 정보는 사용되지 않았습니다. 연구 프로토콜은 헬싱키 선언에 따라 IRB(Institutional Review Board)에서 검토 및 승인했습니다. 해당되는 경우 관련 당국 또는 데이터 저장소에서 데이터 액세스 권한을 얻었습니다. 이 연구는 비식별화된 데이터의 2차 분석을 포함하므로 IRB는 정보에 입각한 동의를 포기했습니다. 제안된 잠재 전달 모델은 숨겨진 패턴을 찾아 소스 데이터 세트에서 대상 데이터 세트로 전송하도록 설계된 기계 학습 기반 반지도 학습 기술로, PASC16의 역학 문제 분석에 매우 적합합니다. 코로나 이후 질환은 다양한 인구에 걸쳐 다양한 증상으로 나타나는 경우가 많아 일관되지 않고 희박한 데이터가 발생합니다. 제안된 작업은 데이터 세트에서 숨겨진 건강 패턴을 나타내기 위해 개선된 잠재 표현을 학습하고 이를 새로운 데이터 세트로 표현함으로써 다양한 영역에 걸쳐 다양한 증상으로 인한 희소 데이터 문제를 해결합니다. 이 변환을 수행하기 위해 이러한 잠재 전송 기술은 자동 또는 변이 인코더를 사용하여 공통 잠재 공간에서 소스 데이터와 대상 데이터를 모두 나타냅니다. 그리고 이 공통 공간은 COVID 이후 증상의 클러스터가 다양한 지역에 걸쳐 잘 보존됨에 따라 얻은 숨겨진 패턴을 보호합니다21. 프로토타입은 도메인 적응을 통한 향상된 일반화를 통해 더욱 발전할 수 있습니다. 이 접근 방식을 사용하면 이 모델은 위험에 처한 클러스터를 인식 및 예측하고 외딴 지역의 공중 보건 감시를 지원하는 데 도움이 될 수 있습니다. 이 작업은 또한 완전히 레이블이 지정된 데이터에 대한 의존도를 줄여 학습을 향상시킵니다. 이를 통해 제안된 접근 방식은 다양한 모집단에 대한 일반화된 접근 방식으로 인해 격차를 분석하는 강력한 도구가 됩니다.
1. 데이터 소스 및 수집
이 연구는 공개적으로 사용 가능한 Kaggle 데이터 세트(심혈관 질환 데이터 세트, 암 예측 데이터 세트, 초기 당뇨병 예측 데이터 세트 및 정신 건강 예측 데이터 세트)를 사용했습니다. 따라서 이 제출물에서 IRB 승인이 필요하지 않습니다.
이미지 데이터가 포함된 데이터 세트의 경우 TensorFlow 및 OpenCV 라이브러리와 함께 Python을 사용하여 전처리를 수행했습니다. 전처리 단계에는 이미지 크기 조정(예: 224 × 224픽셀), 그레이스케일 또는 RGB 변환, 픽셀 값을 [0, 1] 범위로 정규화, 모델 일반화를 강화하고 과적합을 줄이기 위한 데이터 증강 기술(회전, 뒤집기, 확대/축소)이 포함되었습니다. 그런 다음 추가 처리 및 모델 입력을 위해 이미지 배열을 NumPy 배열로 변환했습니다.
기능 선택을 위해 재귀 기능 제거(RFE)는 일반적으로 로지스틱 회귀 또는 랜덤 포레스트 추정기와 함께 Scikit-learn의 RFE 클래스를 사용하여 구현되었습니다. 선택한 특징의 수는 데이터 세트마다 다르지만 일반적인 구성은 재귀 점수를 기반으로 가장 영향력 있는 상위 10-15개 기능으로 차원을 줄이는 것이었습니다. 이 방법은 계산 복잡성과 모델 과적합을 줄이면서 분류 정확도를 향상시켰습니다.
이 연구는 Kaggle에서 공개적으로 사용 가능한 4개의 데이터 세트를 활용했습니다. 심혈관 질환 데이터 세트, 유방암 예측 데이터 세트, 초기 당뇨병 예측 데이터 세트 및 정신 건강 예측 데이터 세트. 이러한 데이터 세트는 Kaggle에서 직접 다운로드되었으며 임상 및 설문 조사 기반 속성을 포함하는 구조화된 표 형식으로 구성됩니다. 데이터 전처리는 데이터 조작을 위한 Pandas, 수치 연산을 위한 NumPy, 데이터 전처리, 기능 선택 및 모델링을 위한 Scikit-learn과 같은 주요 라이브러리와 함께 Python을 사용하여 수행되었습니다. 결측값은 평균 또는 모드 전략을 사용하여 귀속되었고, 범주형 변수는 One-Hot 또는 Label Encoding 을 통해 인코딩되었으며, 수치 기능은 StandardScaler 또는 MinMaxScaler를 사용하여 스케일링되었습니다. 불균형한 클래스의 경우 imblearn 패키지의 SMOTE(Synthetic Minority Oversampling Technique)가 적용되었습니다. 재귀적 특징 제거(RFE)는 로지스틱 회귀 및 랜덤 포레스트와 같은 추정기와 함께 Scikit-learn의 RFE 모듈을 사용하여 구현되었으며, 기능 수는 일반적으로 ROC-AUC 및 정확도와 같은 모델 성능 메트릭을 기반으로 가장 영향력 있는 상위 10-15개 기능으로 줄었습니다.
2. 모델 아키텍처
이 연구는 COVID-19 이미지 데이터베이스에서 입력 이미지를 훈련하기 위해 잠재 전송 모델이라는 신경망 알고리즘의 변형을 제안합니다. 이 작업은 심층 신경망을 구축할 때 사라지는 기울기 문제를 극복하는 데 효과적입니다. 다양한 계층 구성으로 다양한 신경망 변형을 사용할 수 있지만 이 작업은 주로 심층 신경망의 훈련 과정에서 잔차 학습 기술을 구현하는 데 중점을 둡니다. 제안된 잠재 전송 모델은 평평하고 조밀한 계층 네트워크와 함께 7 x 7 컨볼루션 계층 프레임워크와 함께 개선된 ResNet-50 알고리즘을 사용합니다. 이러한 레이어는 패턴을 추출하기 위해 PASC 환자의 이미지 변환 및 다중 클래스 분류에 활용됩니다22. 이 작업은 효율적인 하이퍼파라미터, 학습 동작, 최적화 절차 및 배치 볼륨을 활용하여 256 x 256 x 3 크기의 입력 이미지를 고려합니다. 제안된 잠복 전달 모델은 12,946개의 이미지 데이터 세트를 고려하여 심혈관 문제, 암, 만성 호흡기 질환, 당뇨병 및 정신 건강 문제가 발생할 위험이 있는 환자를 분류합니다. 데이터 세트 세부 정보 및 하이퍼파라미터는 각각 표 2 및 표 3에 나와 있습니다.
재현성을 보장하기 위해 모든 모델 구현, 전처리 및 평가 단계는 Intel Core i7(11세대) 프로세서, 16GB RAM 및 NVIDIA GeForce RTX 3060 GPU가 장착된 Windows 11을 실행하는 시스템에서 Jupyter Notebook 내에서 Python을 사용하여 제어된 환경에서 수행되었습니다(GPU는 이러한 데이터 세트에 필수는 아니지만 모든 가속화된 처리를 위해). 사용되는 소프트웨어 라이브러리에는 Pandas 1.5.3, NumPy 1.24, Scikit-learn 1.3.0, SMOTE용 Imbalanced-learn 0.11.0, 시각화용 Matplotlib 3.7.1 및 Seaborn 0.12.2가 포함됩니다. 전처리에는 평균/모드 대치 를 통한 결측값 처리, One-Hot 또는 Label Encoding을 사용한 범주형 변수 인코딩, StandardScaler를 사용한 기능 스케일링이 포함되었습니다. 모델 개발에서는 차원 축소를 위해 RFE(Recursive Feature Elimination)와 함께 Logistic Regression, Random Forest 및 Support Vector Machines와 같은 분류기를 활용했습니다. 모델은 5배 교차 검증을 사용하여 평가되었고 정확도, 정밀도, 재현율 및 ROC-AUC 점수를 포함한 지표를 사용하여 성능을 측정하여 일관되고 재현 가능한 파이프라인을 보장했습니다.
3. 전처리 및 기능 엔지니어링
이러한 데이터 세트에서 통계적으로 유의미한 특징을 검색하기 위해 "재귀적 특징 제거(RFE)를 사용한 특징 선택"이라는 전처리 기술과 "MLP(Multi-Layer Perceptron)를 사용한 전이 학습"이라는 모델링 파이프라인이 사용됩니다.
4. 교육 및 검증
PASC 증상 분석 및 예측을 위해 제안된 접근 방식을 평가하기 위해 조직화된 교육 및 검증 접근 방식이 사용되었습니다. 처음에는 훈련 및 테스트 데이터의 비율이 80:20인 클래스 레이블의 누적 시스템을 얻기 위해 계층적 훈련-테스트 분할을 적용했습니다. k = 5인 k-fold 교차 검증에 이어 훈련 데이터에 대해 구현하여 데이터의 다양한 분할에 걸쳐 모델의 견고성을 평가했습니다. 2개의 숨겨진 계층(64개 및 32개 뉴런)과 300회 반복이 있는 MLP 분류기가 적용되었습니다. 추가 기능 표현 및 전이 학습 기술이 구현되었습니다.
5. 평가 지표
제안된 모델의 성능을 비교하기 위해 테스트 데이터에 대해 정확도, F-측정, G-평균, MAPE, 민감도 및 특이도를 계산했습니다. 결과는 제안된 모델의 성능을 다른 최첨단 모델, 즉 VGG-16 CNN, VGG-19 CNN, DenseNet-121 CNN, InceptionV3 CNN, ResNet-101 CNN, MobileNetV2 CNN 및 제안된 잠재 전송 모델. 위의 데이터 세트에는 심혈관, 암, 만성 호흡기, 당뇨병 및 정신 질환 관련 데이터의 훈련, 검증 및 테스트 샘플이 포함되어 있습니다.
모든 실험은 Intel Core i7 프로세서, 16GB RAM 및 NVIDIA RTX 3060 GPU가 탑재된 시스템에서 Python 3.10을 사용하는 Windows 11 환경에서 수행되었습니다. 공개적으로 사용 가능한 Kaggle 데이터 세트는 RFE(Recursive Feature Elimination) 를 통한 결측값 대치, 인코딩, 스케일링 및 기능 선택을 위해 Pandas, NumPy 및 Scikit-learn을 사용하여 전처리되었습니다. 로지스틱 회귀, 랜덤 포레스트, SVM과 같은 모델은 재현성과 성능 일관성을 보장하기 위해 정확도, 정밀도, 재현율 및 ROC-AUC를 포함한 지표와 함께 5배 교차 검증을 사용하여 훈련 및 평가되었습니다.
위의 표는 하이퍼파라미터의 세부 정보와 하이퍼파라미터를 사용하는 기술 또는 알고리즘을 보여줍니다. Adam 옵티마이저 알고리즘에 대해 학습률, 조기 중지 기술, 배치 크기, 에포크 크기, 콜백, 손실 함수 및 효율성을 측정하는 메트릭이 제공됩니다.
Access restricted. Please log in or start a trial to view this content.
제안된 모델은 VGG-16 CNN, VGG-19 CNN, DenseNet-121 CNN, InceptionV3 CNN, ResNet-101 CNN 및 MobileNetV2 CNN을 포함한 기존 전송 모델과 비교됩니다. 비교의 매개변수 세부 사항 및 결과는 각각 표 4, 표 5 및 그림 2에 나와 있습니다. 결과는 VGG-16 CNN, VGG-19 CNN, DenseNet-121 CNN, InceptionV3 CNN, ResNet-101 CNN 및 MobileNetV2 CNN과 같은 다른 모델에 비해 제안된 모델을 사용하여 평가 지표가 개선되었음을 보여줍니다.
이 연구는 ResNet-50용 TensorFlow 2.13, MLP 분류기 및 RFE용 Scikit-learn 1.3.0, 데이터 처리용 Pandas 1.5.3을 포함한 주요 라이브러리와 함께 Python 3.1...
Access restricted. Please log in or start a trial to view this content.
이 제안은 PASC의 영향을 처리하기 위한 잠재 전이 학습 모델을 구축하는 데 중점을 둡니다. 이러한 구조는 특히 중년층과 심혈관 질환, 암, 호흡기 질환, 당뇨병 등 이전에 만성 질환을 앓고 있는 사람들에게 심각한 신체적, 정신적 건강 문제를 야기합니다. 최종 목표는 잠복 전달 모델의 도움으로 다양한 모집단의 다양한 환자 데이터를 통합하여 PASC의 맞춤형 치료, 조기 발견 및 효율적인 치료를 가능하게 하는 것입니다. 이 기술은 전이 학습을 사용하여 복잡한 임상 데이터 간의 격차를 해소하고, 모집단 간에 지식을 전달하고, 환자 시나리오에 맞게 조정하고, 의학적 통찰력을 확장합니다. 궁극적으로 목표는 최첨단 기계 학습을 사용하여 장기 COVID(만성) 증상의 심각한 영향을 완화하여 진단 정확도를 개선하고 시기적절한 개입을 촉진하며 공중 보건에 기여하는 것입니다23.
제안된 연구...
Access restricted. Please log in or start a trial to view this content.
저자는 이 기사의 출판과 관련하여 이해 상충이 없음을 선언합니다.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| 클라우드 컴퓨팅 환경(예: Google Colab / AWS EC2) | 구글 / 아마존 | 해당 사항 없음 | GPU 가속으로 딥러닝 모델을 훈련하는 데 사용됩니다. |
| 역학 데이터 세트(SARS-CoV-2의 급성 후 후유증, 지역별) | 공중 보건 데이터 저장소(예: WHO, CDC, ICMR, 지역 병원) | 해당 사항 없음 | 전이 학습 실험을 위한 데이터 세트 |
| Jupyter Notebook | 프로젝트 Jupyter | 오픈 소스 | 코딩 및 문서화를 위한 대화형 환경 |
| 케라스 | 오픈 소스 | TensorFlow와 통합 | 딥 러닝 모델 구축 및 학습을 위한 고급 API |
| Matplotlib / 시본 | 오픈 소스 | 해당 사항 없음 | 그래프 및 역학 동향 분석에 사용되는 시각화 라이브러리 |
| 넘파이 | 오픈 소스 | 해당 사항 없음 | 수치 계산 라이브러리 |
| 팬더 | 오픈 소스 | 해당 사항 없음 | 데이터 조작 및 분석 라이브러리 |
| 사전 학습된 CNN/Transformer 모델(예: EfficientNet, BERT 기반 모델) | TensorFlow 허브 / HuggingFace | 모델별 | 역학 예측을 위한 전이 학습 및 미세 조정에 사용 |
| 파이썬(v3.8 이상) | 파이썬 소프트웨어 재단 | 오픈 소스 | 데이터 전처리, 모델 학습 및 평가에 사용되는 프로그래밍 언어 |
| 시킷 학습 | 오픈 소스 | 해당 사항 없음 | 전처리, 평가 메트릭 및 기준 모델을 위한 기계 학습 라이브러리 |
| TensorFlow(v2.x) | 구글 | 오픈 소스 | 전이 학습 및 모델 배포에 사용되는 딥 러닝 프레임워크 |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission