מחקר זה מציע מסגרת מבוססת בינה מלאכותית גנרטיבית המשלבת GANs, VAEs ורשתות קונבולוציה עמוקות מבוססות קשב כדי לזהות COVID-19 מאותות שמע של שיעול, ולשפר עמידות, איזון נתונים והכללה חוצת מערכי נתונים לצורך סקר מדרגלי ולא פולשני.
מאמר מחקר
מחקר זה מציע מסגרת מבוססת בינה מלאכותית גנרטיבית המשלבת GANs, VAEs ורשתות קונבולוציה עמוקות מבוססות קשב כדי לזהות COVID-19 מאותות שמע של שיעול, ולשפר עמידות, איזון נתונים והכללה חוצת מערכי נתונים לצורך סקר מדרגלי ולא פולשני.
ניתוח קול של שיעול מספק מסלול מעשי לפיתוח כלים אוטומטיים לתמיכה בסקר מחלות COVID-19. למרות העניין הגובר, גישות רבות קיימות עדיין רגישות לרעש, חוסר איזון מעמד ושונות במאגרי נתונים, מה שמגביל את השחזור שלהן. עבודה זו מציגה מתודולוגיה מובנית מונעת בינה מלאכותית גנרטיבית לגילוי COVID-19 באמצעות הקלטות קול של שיעול. הניסויים נערכים באמצעות שני מאגרי נתונים נגישים לציבור, COUGHVID ו-Virufy, ששניהם כוללים דגימות שיעול מסומנות. הפרוטוקול המוצע מורכב משלבים עוקבים של עיבוד מוקדם, כולל סגמנטציה של שיעול, דה-נואיזציה ונירמול אותות. מאפיינים אקוסטיים נלכדים לאחר מכן באמצעות מקדמי ספסטרל בתדר מל, תיאורי כרומה ותכונות ניגודיות ספקטרליות. כדי לשפר את למידת הייצוג ולהפחית חוסר איזון בנתונים, נעשה שימוש במסגרת היברידית גנרטיבית המשלבת מקודדי אוטואנקודים וריאציוניים ורשתות יריבים גנרטיביים לסינתזה של דגימות ברמת התכונות. הסיווג מתבצע לאחר מכן באמצעות רשתות עצביות קונבולוציונליות עמוקות ומודלים מבוססי קשב DCNN. הערכת ביצועים מצביעה על כך ששילוב הגדלה גנרטיבית משתפר בעקביות לעומת קווי בסיס לא גנרטיביים, ומגיע לדיוק סיווג שיא של 97.2% ו-AUROC של 0.953 בכל מערכי הנתונים שנבדקו. תוצאות אלו מדגימות את יעילות המודלים הגנרטיביים לשיפור גילוי COVID-19 מבוסס שיעול ומקימות מסלול אנליטי שניתן לשחזר למחקר עתידי בניטור בריאות אקוסטית.
אקוסטיקה נשימתית נחקרת יותר ויותר כמקור מידע לא פולשני להערכת בריאות, במיוחד בהקשר של מחלות זיהומיות וריאות. התקדמות בעיבוד אותות ובינה מלאכותית (AI) אפשרה ניתוח אוטומטי של קולות שיעול ונשימה, ותומכת בשימושם כסמנים ביולוגיים דיגיטליים. מחקרים עדכניים מראים כי קולות נשימתיים שנקלטים באמצעות מיקרופונים המוטמעים בסמארטפונים, מכשירים לבישים או חיישנים קליניים ניתנים לניתוח יעיל באמצעות מודלים של למידה עמוקה לזיהוי זיהום COVID-19. ההתפתחויות הללו מדגישות את הפוטנציאל של סקר מבוסס שמע כהשלמה מהירה, ללא מגע וניתנת להרחבה לפרוצדורות אבחון קונבנציונליות. מחלת הקורונה 2019 (COVID-19), הנגרמת על ידי נגיף SARS-CoV-2, משפיעה בעיקר על מערכת הנשימה וגורמת לשינויים מדידים בדינמיקת זרימת האוויר, תפקוד הריאות והתנהגות דרכי הקול. למרות שבדיקות RT-PCR (תגובת שרשרת שעתוק הפוך-פולימראז) נותרות תקן ייחוס לאבחון, המגבלות הלוגיסטיות וזמן ההשלכה המאוחר מגבילים את התאמתו לסינון רחב היקף או רציף, מה שמניע את חקירת גישות חלופיות המבוססות על ניתוח קול נשימה.
גוף הולך וגדל של ספרות חקרה גילוי COVID-19 מונע בינה מלאכותית באמצעות אותות שיעול, נשימה ודיבור. כפי שמסוכם בטבלה 1, מחקרים קודמים חקרו מערכי נתונים מגוונים, ייצוגים של תכונות אקוסטיות (למשל, MFCC, STFT, תכונות מבוססות ספקטרוגרמה), ופרדיגמות למידה שנעו ממודלים קלאסיים של למידת מכונה ועד לארכיטקטורות קונבולוציוניות עמוקות, חוזרות, מבוססות קשב וטרנספורמרים 8,9,10,11,12,13,14,15 ,16,17,18,19,20,21,22,23,24,25,26,27˒43,44,45. מספר עבודות הראו ביצועי סקר מבטיחים באמצעות אודיו נשימתי שנאסף על ידי המונים וקליניים. לעומת זאת, אחרים הדגישו את החשיבות של למידת העברה, הרחבת נתונים ובינה מלאכותית מוסברת לשיפור החוסן והאמינות. במקום לחזור על דיון מפורט מחקר-מחקר, טבלה 1 מספקת סקירה השוואתית מאוחדת של הגישות המייצגות הללו, ומאפשרת השוואה ישירה של מאגרי נתונים, מתודולוגיות ותוצאות מדווחות.
למרות ההתקדמות הזו, מספר מגבלות מגבילות את החוסן והיישום האמיתי של הגישות הקיימות. מערכי נתוני אודיו נשימתיים נאספים לעיתים קרובות בתנאי הקלטה הטרוגניים, מה שמוביל לשונות משמעותית בין מכשירים, סביבות אקוסטיות ואוכלוסיות הנבדקים 2,3,4. מאגרי נתונים רבים הזמינים לציבור מסתמכים על דיווח עצמי על מצב COVID-19, מה שיוצר אי-ודאות באמינות התווית7. בנוסף, חוסר איזון מעמד בולט וזמינות מוגבלת של מדגמים מאומתים קלינית מגבילים את יכולת ההכללה של מודלים מפלים המאומנים אך ורק על נתונים שנצפו 4,5. כתוצאה מכך, ביצועי מודלים המדווחים תחת הגדרות ניסוי מבוקרים אינם מתורגמים באופן עקבי לפריסה אמינה בתרחישים מגוונים בעולם האמיתי.
יחד, מגבלות אלו מדגישות פער מחקר קריטי: היעדר מסגרת מאוחדת שמטפלת בו זמנית במחסור בנתונים, חוסר איזון מעמדי והכללה איתנה בין מערכי נתונים הטרוגניים. למרות שמודלים גנרטיביים כמו רשתות עוינות גנרטיביות (GANs) ו-VAEs נבדקו כדי ללמוד ייצוגים חבויים ולסנתז אותות ביו-רפואיים ריאליסטיים 6,7, מחקרים קיימים בדרך כלל משתמשים במודלים אלה באופן עצמאי ומעריכים אותם במערך נתונים יחיד. יתרה מזאת, האינטגרציה שלהן עם ארכיטקטורות קונבולוציוניות משופרות קשב והערכה בתנאים חוצי-מערכי נתונים עדיין לא נחקרים מספיק.
כדי להתמודד עם פער זה, המחקר הנוכחי מציע מסגרת גנרטיבית בסיוע בינה מלאכותית לזיהוי COVID-19 מקולות שיעול, המשלבת חילוץ תכונות אקוסטיות עם מודל היברידי GAN–VAE ורשתות עצביות קונבולוציונליות עמוקות מבוססות קשב (DCNNs). הרכיב הגנרטיבי מפחית את חוסר האיזון הקלאסי ואת זמינות המדגם המוגבלת באמצעות למידה מובנית לייצוג סמוי ויצירת נתונים סינתטיים, בעוד שהמודלים המבחינים משפרים את עמידות הסיווג בין מערכי נתונים הטרוגניים. בניגוד לעבודות קודמות שהתבססו בעיקר על אימות בתוך מערך נתונים, המסגרת המוצעת מוערכת באמצעות בדיקות חוצות מערכי נתונים על מערך נתונים עצמאי, מה שמאפשר הערכה קפדנית יותר של ביצועי הכללה. המסגרת מיועדת להיות גישה ממוקדת סינון ולא ככלי אבחון עצמאי, והעיצוב שלה מתחשב במפורש בשונות רישום ואי-ודאות בתווית כדי לתמוך בפריסה אמינה ושחזורית.
בהקשר זה, התרומות החדשניות של המחקר הנוכחי הן בשלושה מחלקים. ראשית, מסגרת גנרטיבית היברידית מאוחדת של GAN–VAE משולבת עם מסווגי DCNN מבוססי קשב, כדי לטפל במשותף באי-איזון מחלקתי, זמינות מוגבלת של נתונים ולמידה חזקה לייצוג תכונות בבדיקות COVID-19 מבוססות שיעול. שנית, הגישה המוצעת מוערכת באופן שיטתי באמצעות אימות חוצה מערכי נתונים, המספקת הערכה ריאלית יותר של הכללת המודל בהשוואה לבדיקות קונבנציונליות בתוך מערך הנתונים. שלישית, המחקר מציג ניתוח מפורט של השפעת ההגברה הגנרטיבית בתנאי רישום הטרוגניים, ובכך ממקם את המסגרת כהוכחת היתכנות לשחזור לסקר COVID-19 מעשי וניתן להרחבה.
| סופר(ים) & שנה | מאגר נתונים | טכניקות / תכונות בשימוש | מודל / מסווג | דיוק / מדדים | מגבלות / הערות |
| עימראן ואחרים, 20208 | מאגר נתונים של שיעול מבוסס קהל (AI4COVID-19) | MFCC, למידת העברה, תכונות מודעות לדומיין | רב-מסווג חסין סיכון (אנסמבל DL + ML) | דיוק: 92.6% | תלוי באיכות השיעול; אימות קליני מוגבל |
| בראון ואח', 20209 | קולות נשימה מבוססי קהל (>7,000 משתמשים) | תכונות אודיו בעבודת יד, הטמעות-VGGish | מודלים של למידת מכונה רדודה | AUC > 80% | רעש תווית בנתוני מיקור המונים |
| לגוארטה ואח', 202010 | מאגר נתונים של MIT Open Voice (5,320 נבדקים) | MFCC, סמנים ביולוגיים אקוסטיים | CNN (ResNet50, למידת העברה) | רגישות: 98.5%, ספציפיות: 94.2% | דורש מאגר נתונים קדם-אימון גדול |
| Quartieri ואח', 202011 | ראיונות דיבור (5 נבדקים, לפני/אחרי הקורונה) | עוצמת נשימה, F0, CPP, פורמנטים | ניתוח גודל אפקט סטטיסטי | להשיג AUC של מעל 80% בכל המשימות | מדגם קטן מאוד |
| חסן ואחרים, 202012 | קולות נשימה | מאפייני דיבור זמני | RNN | שיעול: 97%, נשימה: 98.2%, קול: 88.2% | היעדר סטטיסטיקות מפורטות במאגר נתונים |
| חמפאריה ואח', 201913 | ESC-10, ESC-50 | תכונות מבוססות תמונה ספקטרוגרמית | CNN, TDSN | CNN: 77% (ESC-10), 49% (ESC-50); מספר קצר: 56% (ESC-10) | רק קולות סביבתיים; ביצועים נמוכים יותר על מערכי נתונים מורכבים |
| אייקנת ואח', 201714 | 17,930 קולות ריאה מ-1,630 נבדקים (סטטוסקופ אלקטרוני) | תכונות MFCC, תמונות ספקטרוגרמה | SVM, CNN | CNN/SVM: 86% (בריא לעומת פתולוגי), 76%/75% (ראל–רונקוס–נורמלי), 80%/80% (סוג יחיד), 62%/62% (כל הסוגים) | דורש חומרה מיוחדת; לא ספציפי למחלה |
| פונומרצ'וק ואח', 202215 | קוסווארה, וירופי | MFCC, mel-spectrogram, תכונות גל | CNN, RNN, דגמי אנסמבל | AUC: 0.93 (פנימי), 0.79 (חיצוני) | הכללה בין מערכי נתונים נותרת מאתגרת |
| פנג ואח', 202116 | קוסווארה, וירופי | STFT, MFCC | SVM (RBF), CNN | דיוק 81.25% (AUC של 0.79) | ביצועים התלויים במערך הנתונים |
| איסלאם ואח', 202217 | הקלטות קליניות של שיעול | תכונות ספקטרליות ותדר-זמן | רשתות עצביות עמוקות | דיוק: 89.2% | מאגר נתונים מוגבל |
| מנשורי, 202218 | וירופי | תכונות ניתוח ספקטרלי | מסווגי למידת מכונה קלאסיים | דיוק: 95.86% | מחקר ניסויי בקנה מידה קטן |
| הואנג ואח', 202019 | קולות ריאות מ-10 חולי COVID-19 | ניתוח קול נשימתי בזמן–תדר | ניתוח מומחים קליני | אימות איכותי | מאגר נתונים קטן; מודל ללא ML |
| ו. ד. פוג'ה ואח', 202420 | Coswara, Virufy (מערכי נתונים של קולות שיעול) | STFT, ספקטרוגרם מל, MFCC, אנרגיית RMS, רוחב פס ספקטרלי, מרכז ספקטרלי, גלגול ספקטרלי, ZCR; חילוץ תכונות עמוק מבוסס CNN | CNN חד-ממדי (חולץ תכונות) + יער אקראי | דיוק: 93% | הביצועים תלויים באיכות השיעול; תוכנן לסקר ולא לאבחון קליני; שונות נתונים מבוססי המונים |
| צ'דאגה ואח', 202321 | הקלטות אודיו של שיעול מבוססות קהל | ספקטרוגרמה מל ותכונות אקוסטיות בזמן-תדר | רשת עצבית קונבולוציונית (CNN) | דיוק: 84%, דיוק: 85%, זיכרון: 84%, ציון F1: 84% | הביצועים מוגבלים על ידי חוסר איזון בנתונים, תוויות מדווחות עצמית, רגישות לתנאי הקלטה |
| צ'דאגה ואח', 202322 | קורונה קלה-בינונית וסמנים קליניים של מחלות נשימה אחרות | בחירת סרטים (פירסון, PSO); סמנים מרכזיים: אאוסינופיל, אלבומין, ט. בילירובין, ALP, ALT, AST, HBA1c, TWBC | הרכב מוערם; 1D CNN, LSTM, DNN, שארית MLP | דיוק: 89% | מקרים חמורים לא נכללים; חלופה ל-RT-PCR; יישום בינה מלאכותית מוסברת |
| דר ואח' 202423 | מערך הנתונים של COVID-19 | אופטימיזציה של SJHBO (Jaya+HBO+SO), תכונות ספקטרליות רבות | רשת Deep Q (DQN) | דיוק: 95.11%, רגישות: 95.06%, ספציפיות: 94.69% | מורכבות גבוהה; הכיוון משופר באמצעות אופטימייזר היברידי |
| ג'ינג קוויאן ואח' 202024 | הקלטות דיבור של חולי COVID-19 | סטים אקוסטיים; ניתוח חומרת המחלה, איכות השינה, עייפות, חרדה | מכונות וקטור תמיכה (SVM) | 0.69 (חומרת המחלה) | מוגבל לתכונות קוליות; דיוק בינוני; גודל מערך הנתונים לא צוין; רק ארבעה היבטי בריאות נלקחו בחשבון |
| שארמה, ג', ואחרים 202025 | UrbanSound8K, ESC-10, ESC-50 | ערוצי רב-תכונה: MFCC, GFCC, CQT, Chromagram; הרחבת נתוני ערבוב | CNN עמוק עם קונבולוציות ומודולי קשב ניתנים להפרדה מרחבית | UrbanSound8K: 97.52%, ESC-10: 94.75%, ESC-50: 87.45% | לא נבדק על מאגרי נתונים שאינם בנצ'מרק או בעולם האמיתי; מורכבות חישובית הנובעת מ-CNN עמוק יותר ומודולים של קשב |
| Lella KK, ואחרים 202126 | קולות נשימה; COVID-19, אסתמה, בריא) | הגדלת נתונים; תכונות עמוקות באמצעות מקודד אוטומטי להסרת רעש נתונים (DDAE) במקום MFCC | רשת עצבית קונבולוציונית חד-ממדית (CNN חד-ממדי) | ~90% | פרטים מוגבלים על מערכי נתונים; ~4% שיפור לעומת MFCC; הכללה לא נבדקה. |
| אורלנדיק ואח', 202127 | שיעול (25k+ שיעול) | MFCCs, PSD, ספקטרלים ותכונות זמן | XGBoost | AUC 96.5%, דיוק 95.5% | דיווח עצמי על קורונה; תוויות מומחים על תת-קבוצה |
| ז'אנג ואח', 202343 | דיווחי מקרה שפורסמו של HLH לאחר חיסון COVID-19 (מאגרי ספרות) | סקירה שיטתית; אגרגציה קלינית של מאפיינים קליניים; ניתוח עגינה מולקולרית | לא רלוונטי (סקירה קלינית) | סטטיסטיקה תיאורית; תוצאות קליניות | ניתוח אירועים נדירים; גודל מדגם קטן; הסתמכות על מקרים מדווחים עלולה ליצור הטיית דיווח |
| שו ואח', 202344 | מקרים מדווחים של מחלת VKH הקשורה לחיסונים מתוך ספרות | סקירת מקרה רטרוספקטיבית; ניתוח תכונות קליניות ודימות | לא רלוונטי (מחקר תצפיתי קליני) | תגובת טיפול ותוצאות החלמה קלינית | מספר מוגבל של מקרים; היעדר קבוצת ביקורת; קשר סיבתי אינו ניתן להוכחה חד-משמעית |
| הו ואח', 202545 | נתוני אם-בת ברמת החברה של חברות מכשור רפואי SRDI בסין (מאגר Qixinbao) | ניתוח רשתות חברתיות; מדדי רשת מרחבית; ניתוח גלאי גאוגרפי | לא רלוונטי (ניתוח רשת ומדיניות) | צפיפות רשת, מרכזיות, מדדי דיפוזיה | עיצוב חתך; משקל שווה של חברות; אין מדדי ביצועים ישירים או תוצאות קליניות |
טבלה 1: סיכום מחקרי גילוי מבוססי קול קיימים של COVID-19. סקירה השוואתית של גישות קודמות לסקר שיעול/שמע, כולל מערכי נתונים, שיטות וביצועים מדווחים. אנא לחצו כאן להורדת הטבלה הזו.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
מתודולוגיה מוצעת
מחקר זה מציע מסגרת מבוססת בינה מלאכותית גנרטיבית לזיהוי COVID-19 מאותות שיעול. המסגרת משלבת מודלים גנרטיביים עם מסווגים מבחינים הבחנה, כאשר נתוני ההדרכה וההערכה נשמרים בנפרד מוחלט. איור 1 ממחיש את הארכיטקטורה המפורטת של מסגרת GAN–VAE–ADCNN המוצעת, ומראה את הזרימה מעיבוד מוקדם של אודיו וחילוץ תכונות דרך למידת ייצוג סמוי דרך מקודד עצמי וריאציוני (VAE), יצירת תכונות סינתטיות באמצעות רשת עוינת גנרטיבית (GAN), וסיווג סופי באמצעות רשתות עצביות קונבולוציונליות עמוקות (DCNN) ו-DCNN מבוסס קשב (ADCNN). התרשים מראה כי רכיבים גנרטיביים משמשים רק במהלך ההכשרה, בעוד שהסיווג מתבצע באמצעות מודלים מבחינים (discriminative).

איור 1: סקירה כללית של ארכיטקטורת GAN–VAE–ADCNN. סכמטי של צינור ההיבריד המוצע, שבו תכונות אקוסטיות שמקורן בשיעול מקודדות באמצעות VAE, מוגברות באמצעות יצירת דגימות סינתטיות מבוססות GAN, ומסווגות באמצעות מודלים מבוססי DCNN ו-DCNN מבוססי קשב (ADCNN). אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
ארכיטקטורת מודל ויישום
המודלים הגנרטיביים וההבחנתיים ששימשו במסגרת זו יושמו עם ארכיטקטורות קבועות וניתנות לשחזור. ה-GAN מורכב מגנרטור עם שלוש שכבות מחוברות במלואן (128, 256 ו-512 יחידות) באמצעות הפעלה של ReLU, ומדיסקרימינטור עם שלוש שכבות מחוברות לחלוטין (512, 256 ו-128 יחידות) באמצעות הפעלה של LeakyReLU ואחריה פלט סיגמואיד.
מקודד VAE מורכב משתי שכבות מחוברות במלואן עם 256 ו-128 יחידות, ואחריהן הערכת ממוצע ושונות סמויה עם ממד סמוי של 64. המפענח משקף מבנה זה ומאומן באמצעות שילוב של אובדן שחזור וסטייה של קולבק–לייבלר כדי ללמוד מרחב סמוי מובנה והסתברותי.
מסווג DCNN כולל ארבעה בלוקים קונבולוציונליים עם 3x3 גרעינים ו-32, 64, 128 ו-256 פילטרים, בהתאמה. כל בלוק מלווה בנרמול אצווה, הפעלה של ReLU ו-2x2 מקסימום איגוד. ה-ADCNN מרחיב את ה-DCNN על ידי שילוב מנגנון תשומת לב לפי ערוץ לאחר הבלוק הקונבולוציוני הסופי. כל המודלים אופטימיזציה באמצעות אופטימייזר אדם עם קצב למידה של 0.0001 וגודל אצווה של 32. כפי שמוצג באיור 1, VAE ו-GAN פועלים רק במהלך ההכשרה, בעוד DCNN ו-ADCNN משמשים לסיווג. תהליך ההכשרה וההערכה המלא מסוכם באלגוריתם 1.
אלגוריתם 1: מסגרת זיהוי COVID-19 מבוססת GAN–VAE
קלט: הקלטות אודיו של שיעול מעובדות מראש
פלט: תווית סיווג בינארית (חיובי/שלילי של COVID-19)
הליכי ההכשרה וההערכה התקיימו לפי צינור קבוע וניתן לשחזור. כל הקלטות האודיו של שיעול עברו דגימה מחדש ל-16 קילוהרץ, עברו הפחתת רעש ונורמליזציה של משרעת. ההקלטות חולקו לקטעים באורך קבוע, מהם הופקו MFCC, כרומה ותכונות ספקטרליות. בסך הכול הופקו 40 מקדמי ספסטרל בתדר מל (MFCCs) מכל קטע שמע. בנוסף, חושבו 12 תכונות כרומה. הייצוג המתקבל יוצר וקטור תכונה 52 ממדי עבור כל מקטע שיעול. בוצע חלוקה ברמת הנושא כדי לחלק את הנתונים לקבוצות אימון, אימות ומבחן. ה-VAE אומן ללמוד ייצוגים סמויים הסתברותיים, והוקטורים החבויים שנוצרו שימשו לאימון ה-GAN ליצירת תכונות סינתטיות. מאגר הנתונים של ההדרכה הורחב באמצעות דגימות שנוצרו על ידי GAN–VAE, בעוד שנתונים סינתטיים הוצאו מהאימות והבדיקות. מסווגי DCNN ו-ADCNN הוכשרו על נתוני ההכשרה המורחבים, וההערכה סופית בוצעה על סט הבדיקות המוחזק באמצעות מדדי ביצועים סטנדרטיים.
הגדרת אימונים, חלוקת נתונים ומניעת דליפות
כל הניסויים בוצעו עם תצורת אימון קבועה וניתנת לשחזור. חלוקת הנתונים בוצעה ברמת הנושא לפני סגמנטציה של האודיו כדי למנוע דליפת נתונים. מערך הנתונים חולק לקבוצות אימון, אימות ובדיקות ביחס של 80:10:10, כדי להבטיח שכל הקטעים מאותה הקלטה יוקצו לתת-קבוצה אחת. סט האימון שימש ללמידת מודלים והרחבת נתונים גנרטיביים, סט האימות לכיוון היפרפרמטרים ועצירה מוקדמת, וסט הבדיקה הוחזק להערכת ביצועים סופית. דגימות סינתטיות שנוצרו על ידי מסגרת GAN–VAE שימשו אך ורק במהלך ההכשרה והוחרגו לחלוטין מאימות ובדיקות כדי להבטיח הערכה הוגנת.
המודלים אומנו למקסימום 100 אפוקים, עם עצירה מוקדמת בהתבסס על אובדן אימות וסבלנות של 10 אפוקים. האופטימיזציה בוצעה באמצעות אופטימייזר אדם עם קצב למידה של 0.0001 וגודל אצווה של 32. אובדן אנטרופיה בינארית יושם לסיווג, בעוד ששיקום והפסדים יריבים שימשו לאימון רכיבי VAE ו-GAN, בהתאמה. פרוטוקול ההדרכה וההערכה המאוחד הזה מבטיח שחזוריות, מונע דליפת נתונים ושומר על הפרדה קפדנית בין שלבי ההדרכה וההערכה.
תיאור מאגר הנתונים
שני מערכי נתונים ציבוריים של אודיו לשיעול — COUGHVID ו-Virufy — שימשו לאיזון בין גיוון אקוסטי רחב היקף לבין תוויות קליניות, עם תפקידים מופרדים בבירור בהכשרה והערכה.
COUGHVID הוא אוסף המונים של הקלטות שיעול עם הערות מומחים חלקיות ומטא-דאטה מדווח עצמי. כדי להבטיח את איכות הנתונים, נבחרו 428 הקלטות לאחר יישום קריטריוני בקרת איכות מוגדרים מראש, כולל משך האות המינימלי, יחס אות לרעש מספק, הסרת דגימות פגומות או מעורפלות, ונוכחות אירועי שיעול מזוהים עם מטא-דאטה של תסמינים. לאחר עיבוד מוקדם וסגמנטציה, ההקלטות הללו הניבו 1,719 קטעי שיעול, סטנדרטים לפורמט WAV בקצב דגימה של 16 קילוהרץ. COUGHVID שימש לאימון מודלים גנרטיביים ומסווגי הבחנה.
Virufy מורכב מהקלטות שיעול בפיקוח רופא המסומנות כחיוביות או שליליות RT-PCR ל-COVID-19. כל 16 ההקלטות הזמינות נכללו, מה שהוביל ל-234 קטעי שיעול לאחר סגמנטציה, שגם הם הוסדרו ל-16 קילוהרץ. Virufy שימש אך ורק להערכת מערכי נתונים חיצוניים להערכת ביצועי הכללה ולא שימש לאימון, כיוונון עדין או הרחבה גנרטיבית.
לכן, יש לפרש את המסגרת המוצעת כגישת סקר הוכחת היתכנות המוערכת בתנאים ניסיוניים מבוקרים ולא כמערכת אבחון מאומתת קלינית.
עיבוד נתונים מוקדם וסגמנטציה
כל ההקלטות עברו דגימה מחדש ל-16 קילוהרץ, הוסבו למונו, ועברו הסרת שקט, הפחתת רעש ספקטרלי ונירמול משרעת. סגמנטציה בוצעה לאחר פיצול ברמת הנבדק כדי למנוע דליפת נתונים. כל הקלטה חולקה למקטעים חופפים של 2–4 שניות, וקטעים בעלי אנרגיה נמוכה או שקטה הושלכו.
פרוטוקול אימות חיצוני
אימות חיצוני בוצע באמצעות הערכה בין מערכי נתונים. מודלים שאומנו על COUGHVID הוערכו על Virufy לאימות חיצוני. פרוטוקול זה מעריך הכללה בין מערכי נתונים שנאספו בתנאים שונים ולא באישור קליני פרוספקטיבי. איור 2 מספק סקירה ברמת הפרוטוקול של זרימת עבודה זו, ומדגים שימוש במאגרי נתונים, עיבוד מוקדם, חילוץ תכונות, הדרכת מסווגים ותסריטי הערכה. בעוד שאיור 1 מתמקד בארכיטקטורת המודל הפנימית, איור 2 מדגיש תכנון ניסויים וזרימת נתונים לאורך שלבי ההכשרה והבדיקות.

איור 2: זרימת העבודה של מסגרת סקר שיעול COVID-19 המוצעת. המחשה של צינור העיבוד המלא, כולל עיבוד מוקדם, חילוץ תכונות (MFCC, כרומה, תכונות ספקטרליות), למידה והרחבה של ייצוגים מבוססי GAN–VAE (הכשרה בלבד), וסיווג סופי תחת חלוקה ברמת הנושא והערכת מערכי נתונים חוציים. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
הרכב מערכי נתונים וניתוח התפלגות מחלקות
לאחר עיבוד מוקדם וסגמנטציה, מערכי הנתונים של COUGHVID ו-Virufy הראו הבדלים משמעותיים הן בקנה המידה והן בצפיפות המקטעים. COUGHVID תרם 428 מתוך 444 הקלטות (96.4%) ו-1,719 מתוך 1,953 מקטעי שיעול שהופקו (88.0%), מה שמאשר את תפקידו כמאגר הנתונים הראשי לאימון מודלים והגדלה גנרטיבית (איור 3). לעומת זאת, Virufy תרם רק 16 הקלטות (3.6%) ו-234 מקטעי שיעול (12.0%) והוקצה אך ורק להערכה ח...
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
התוצאות מראות כי המסגרת הגנרטיבית המבוססת על בינה מלאכותית מוצעת יכולה לזהות COVID-19 מאותות שיעול בין מערכי נתונים הטרוגניים. כפי שמוצג בטבלה 4 ובטבלה 6, מודל ההיבריד GAN–VAE השיג את הביצועים הטובים ביותר, עם דיוק של 97.2% ו-AUROC של 0.953, יחד עם דיוק, שחזור, ציון F1 וספציפיות גבוהים, המצביעים על ביצועי סיווג מאוזנים.
הביצועים השתפרו באופן עקבי כאשר מודלים גנרטיביים שולבו עם מסווגים מבחינים. גם GAN–DCNN וגם VAE–ADCNN עקפו את...
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
לא דווח על ניגוד עניינים פוטנציאלי על ידי המחבר/ים.
אנו מביעים את תודתנו הכנה לסגל ולמנטורים המחקריים בבית הספר למדעי המחשב והנדסת מחשב על ההכוונה החשובה, התמיכה המתמשכת והמשוב הבונה במהלך הכנת מאמר זה.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
| שם | חברה | מספר קטלוג | הערות |
|---|---|---|---|
| מערך הנתונים של COUGHVID | É קול פוליטכניק Fé dé ראלה דה לוזאן (EPFL) | הפצה ציבורית (2021) | מאגר נתוני אודיו של שיעול מבוסס קהל עם מטא-דאטה מדווח עצמי והערות חלקיות של רופא; משמש בעיקר לאימון והרחבת נתונים. |
| ערכת כלים של CUDA | NVIDIA | 11.3 | מסגרת האצת GPU משמשת להאצת אימון והסקת מודלים. |
| LibROSA | קוד פתוח | 0.9 | ספריית ניתוח אודיו המשמשת לדגימה מחודשת, סגמנטציה, חילוץ MFCC וחישוב תכונות ספקטרליות. |
| מערכת ההפעלה לינוקס | קנוני | אובונטו 20.04 LTS | מערכת הפעלה המשמשת לכל הניסויים והדרכת מודלים. |
| Matplotlib | קוד פתוח | 3.5 | ספריית ויזואליזציה המשמשת לשרטוט התפלגויות מערכי נתונים ותוצאות הערכה. |
| NumPy | קוד פתוח | 1.21 | ספריית חישוב נומרי המשמשת למניפולציה של מערך ועיבוד אותות. |
| כרטיס מסך NVIDIA | NVIDIA | מחלקת טסלה / RTX | יחידת עיבוד גרפיקה המשמשת לאימון מודלים עמוקים וגנרטיביים. |
| שפת תכנות פייתון | קרן התוכנה של פייתון | 3.8 | סביבת תכנות מרכזית המשמשת לעיבוד נתונים מוקדם, חילוץ תכונות, פיתוח מודלים והערכה. |
| פייטורץ' | מטא (מחקר בינה מלאכותית של פייסבוק) | 1.12 | מסגרת למידה עמוקה המשמשת ליישום מודלים מבוססי קשב של GAN, VAE, DCNN ו-DCNN. |
| Scikit-learn | קוד פתוח | 1 | ספריית למידת מכונה המשמשת לפיצול נתונים, משקל מחלקות וחישוב מדדי ביצועים. |
| SciPy | קוד פתוח | 1.7 | ספריית מחשוב מדעי המשמשת לעיבוד מוקדם של אודיו וטרנספורמציית אותות. |
| מערך הנתונים של Virufy | וירופי | הפצה ציבורית (2021) | רישום שיעול שנאסף קלינית עם RT-PCR– תוויות COVID-19 מאומתות; משמש אך ורק לאימות חיצוני ולהערכה בין מערכי נתונים. |
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה
בקש הרשאה