פרוטוקול AutoML שלב אחר שלב מוצג לסינון מחלת כבד שומני שאינה אלכוהולית באמצעות נתוני NHANES וקוהורט חיצוני. השיטה מאוטומטית עדיפות תכונות ובחירת מודלים (GBM), וכוללת פרשנות מבוססת SHAP ואימות חיצוני לפריסה קלינית ניתנת לשחזור.
מאמר מחקר
* These authors contributed equally
פרוטוקול AutoML שלב אחר שלב מוצג לסינון מחלת כבד שומני שאינה אלכוהולית באמצעות נתוני NHANES וקוהורט חיצוני. השיטה מאוטומטית עדיפות תכונות ובחירת מודלים (GBM), וכוללת פרשנות מבוססת SHAP ואימות חיצוני לפריסה קלינית ניתנת לשחזור.
מחלת כבד שומני לא-אלכוהולית (NAFLD) היא הפרעה נפוצה בכבד הקשורה להשמנת יתר, עמידות לאינסולין ותסמונת מטבולית, שלרוב אינה מאובחנת עד לשלבים מתקדמים. שיטות אבחון מסורתיות, כולל הדמיה וביופסיית כבד, סובלות ממגבלות בגילוי מוקדם. יש צורך בכלי יעיל ולא פולשני לסקר מוקדם של NAFLD. באמצעות טכנולוגיית למידת מכונה אוטומטית (AutoML), פותח מודל אבחוני ל-NAFLD תוך שימוש במאגר נתונים גדול מ-NHANES (n = 2677). בנוסף, שימש קבוצת אימות חיצונית עצמאית (n = 200) להערכת התוקף והביצועים החיצוניים של המודל. לבחירת תכונות קליניות מבטיחות, יושמה שיטת בחירת תכונות דו-שלביות, המשלבת רגרסיית LASSO עם ניתוח חכם מבוסס ChatGPT-4. בהמשך, תהליך AutoML, ששילב מספר אלגוריתמים של למידת מכונה, בוצע לאימון ואימות מודלים. ביצועי המודל הוערכו באמצעות עקומות ROC, ציוני F1 וניתוח הסבר מצטבר SHapley (SHAP). מודל GBM השיג AUC של 0.843 בסט האימון, 0.851 במערך הבדיקות, ו-0.945 במערך האימות החיצוני, מה שהדגים דיוק אבחוני גבוה בין מאגרי נתונים שונים. מנבאים מרכזיים, כולל BMI, טריגליצרידים ו-GGT, זוהו כתורמים משמעותיים לתחזיות המודל. ניתוח SHAP אישר עוד יותר את חשיבות המשתנים הללו בחיזוי NAFLD. מודל האבחון המונע על ידי AutoML ל-NAFLD הראה שיפור משמעותי בביצועי זיהוי מוקדם, והציע חלופה אמינה, לא פולשנית ויעילה לשיטות אבחון קונבנציונליות. שיטה זו טומנת בחובה פוטנציאל רב ליישום קליני רחב יותר ב-NAFLD, תוך הפחתת התלות בידע מומחה תוך שיפור דיוק האבחון.
מחלת כבד שומני לא אלכוהולית (NAFLD) היא אחת ממחלות הכבד הנפוצות ביותר בעולם, ומשפיעה כיום על כ-35% מהאוכלוסייה הבוגרת בעולם, ואינה נובעת מצריכת אלכוהולמופרזת 1. הוא מאופיין בהצטברות שומן ביותר מ-5% מהפטוציטים, מה שעלול להתפתח למצבים חמורים יותר, כולל דלקת, פיברוזיס בכבד, שחמת כבד, ולבסוףאי ספיקת כבד. כיום, השיטות המסורתיות לאבחון NAFLD מסתמכות בעיקר על סמנים ביוכימיים חריגים בכבד ודימות אולטרסאונד. עם זאת, אולטרסאונד מציג רגישות מוגבלת כאשר דרגת הסטיאטוזיס נמוכה מ-20%, מה שפוגע באמינותו בזיהוי חדירת שומן קלה ולעיתים מוביל לאבחון לא מדויק של NAFLD4 בשלב מוקדם. למרות שביופסיית כבד נחשבת לסטנדרט הזהב לאבחון NAFLD, אופייה הפולשני והסיכון לסיבוכים כמו כאב, זיהום ודימום מגבילים את היתכנותה לבדיקות נרחבות5. כתוצאה מכך, יש צורך דחוף בכלי יעיל, לא פולשני, חסכוני ורגיש במיוחד שיקל על סקר ל-NAFLD.
עם ההתפתחות המהירה של טכנולוגיות בינה מלאכותית (AI) ולמידת מכונה (ML), גישות מונחות נתונים מציעות פתרונות חדשים לאבחון מוקדם ולהערכת סיכונים של NAFLD. באמצעות ניתוח נתונים רחבי היקף ומורכבים, טכנולוגיות למידת מכונה יכולות לזהות אוטומטית דפוסים ויחסים פוטנציאליים, והן יושמו רבות באבחון וחיזוימחלות שונות. לדוגמה, אלגוריתמים של ML שימשו לחיזוי הסיכון לשחמת כבד אצל אנשים עם זיהום כרוני בנגיף הפטיטיס B, והשיגו תוצאות מבטיחות7. מחקרים דומים בתחום NAFLD פיתחו בהצלחה מודלים אבחנתיים באמצעות אלגוריתמים מסורתיים של למידת מכונה, כגון מכונות וקטור תמיכה (SVM) ויערות אקראיים (RF), והשיגו רמות דיוק גבוהות והפגינו יישום קליני חזק 8,9,10,11,12,13,14,15,16,17, 18. לדוגמה, חוקרים פיתחו מודל למידת מכונה המשתמש בפרמטרי מעבדה כדי לסנן בצורה יעילה NAFLD באוכלוסייה הכללית באמצעות ניתוח נתוני מעבדה שגרתיים. מודל למידת מכונה המשתמש בפרמטרי מעבדה פותח13 כדי לסנן בצורה יעילה NAFLD באוכלוסייה הכללית באמצעות ניתוח נתוני מעבדה שגרתיים. השכיחות של NAFLD בארה"ב נחזתה על ידי שילוב אלסטוגרפיה חולפת עם שיטות למידת מכונה באמצעות נתוני NHANES 2017–201816. צוות המחקר השתמש באלגוריתמים של למידת מכונה כדי לחקור את הקשר בין אלסטוגרפיה חולפת למשתנים קליניים אחרים, ופיתח מודל חיזוי שהעריך באופן אמין את שכיחות NAFLD באוכלוסיות מגוונות.
עם זאת, שיטות למידת מכונה מסורתיות דורשות בדרך כלל מאמץ ידני משמעותי, במיוחד בהנדסת תכונות, בחירת מודלים וכוונון פרמטרים, שדורשים ידע וניסיון מיוחדים. כדי להתמודד עם מגבלות אלו, פותחה למידת מכונה אוטומטית (AutoML). AutoML מאוטומט את כל צינור בניית המודלים, הכולל עיבוד נתונים מוקדם, בחירת תכונות, בחירת מודלים ואופטימיזציה של היפרפרמטרים, ובכך משפר משמעותית את היעילות והדיוק של תהליכי למידת מכונה19. מודל חיזוי לדימום דליות הוושט פותח ואומת באמצעות פלטפורמת H2O AutoML20. המודל השתמש באלגוריתמים שונים, כולל למידה עמוקה (DL), eXtreme Gradient Boosting (XGBoost), מודלים ליניאריים כלליים (GLM), מכונות הגברת גרדיאנטים (GBM), יערות אקראיים (RF) ואנסמבלים של ערימה, עם אופק חיזוי של 12 חודשים. AutoML שימש לחיזוי הסיכון לגרורות כבד בקרב חולי גידול סטרומלי במערכת העיכול, תוך שימוש בנתונים ממאגר SEER21. פלטפורמות AutoML נוצלו לפיתוח כלי אבחון מהיר וחסכוני לסרטן הערמונית באמצעות נתונים קליניים שגרתיים22. הופעתו של AutoML הציעה פתרונות יעילים יותר לאבחון קליני, והפוטנציאל שלה בסקר NAFLD ראוי לחקירה נוספת. בעוד שהגילוי המוקדם והאבחון המדויק של NAFLD הם קריטיים, האופי הא-סימפטומטי של המחלה מציב אתגרים אבחנתיים משמעותיים. למרות שטכנולוגיית AutoML הראתה פוטנציאל רב באבחון מחלות, יישומה באבחון NAFLD נותר מוגבל, מה שמדגיש את הפוטנציאל המבטיח של תחום מחקר זה.
מחקר זה פיתח מודל אבחון למחלת כבד שומני לא אלכוהולית (NAFLD) באמצעות טכנולוגיית AutoML בשילוב עם אלסטוגרפיה חולפת, תוך שימוש בנתונים ממאגר NHANES בארה"ב (2017–2018). המודל אומת חיצונית באמצעות מאגר נתונים מאנשים במחלקה למחלות זיהומיות, בית החולים הראשון המסונף של אוניברסיטת וונג'ואו לרפואה (2018–2020). המחקר העריך את ביצועי המודל על בסיס נתונים חיצוני והשווה אותו לשיטות מסורתיות, ובכך טיפל בפערים מחקריים קיימים. באמצעות ניתוח מספר סמנים בדם וביוכימיים, נבנו מודלים חיזויים באמצעות אלגוריתמים כמו רגרסיה לוגיסטית ויערות אקראיים. התוצאות הצביעו על ביצועים מעולים של המודל בזיהוי מדויק של אנשים שאינם NAFLD. זה לא רק מציע כלי יעיל ומדויק לסריקת NAFLD מוקדמת, אלא גם מקדם את שילוב AutoML ביישומים רפואיים.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
מטופלים ועיצוב המחקר
מאגר הנתונים הראשון של מחקר זה התקבל ממאגר הסקר הלאומי לבריאות ותזונה (NHANES) לתקופה 2017–2018. מסגרת הזמן הספציפית הזו נבחרה משום שנתוני הסקר כללו מדידות אלסטוגרפיה חולפת של אולטרסאונד כבד באמצעות טכנולוגיית FibroScan® (הבדיקות האלקטרוניות). NHANES עושה שימוש בעיצוב דגימה הסתברותית רב-שלבית ומשמשת כסקר אוכלוסייה ארצי המתבצע כל שנתיים. הוא אוסף באופן שיטתי נתונים בריאותיים מייצגים ברמה הלאומית על אוכלוסיית ארה"ב הלא-מוסדית כדי להעריך את המצב התזונתי והבריאותי של האוכלוסייה האזרחית הכלליתבארצות הברית. ה-NHANES הוא מחקר חתך מייצג ברמה הלאומית, המנוהל על ידי המרכז הלאומי לסטטיסטיקה בריאותית (NCHS). פרוטוקול הסקר קיבל אישור מוועדת סקירת האתיקה המחקרית של NCHS, עם הסכמה מתועדת מדעת שהתקבלה מכל המשתתפים. המחקר נערך בהתאם להצהרות הלסינקי ואיסטנבול, ואושר על ידי ועדת האתיקה של בית החולים הראשון המסונפ של אוניברסיטת וונג'ואו לרפואה (2016–246, 1 בדצמבר 2016), והתקבלה הסכמה מדעת בכתב מכל משתתף.
מערך הנתונים הראשון כלל 5494 אנשים מסקר NHANES 2017–2018 שעברו בדיקת FibroScan (FibroScan). לאחר ההחרגה למטה, נכללו בניתוח בסך הכל 2677 משתתפים, שכללו 718 אנשים עם NAFLD ו-1959 עם לא NAFLD. המשתתפים הללו חולקו באקראי לקבוצת אימון (n = 1785) וקבוצת מבחנים (n = 892). מערך הנתונים השני כלל 582 אנשים מהמחלקה למחלות זיהומיות בבית החולים הראשון המסונף של אוניברסיטת וונג'ואו לרפואה (2018–2020). לאחר יישום אותם קריטריונים להוצאה, נכללו סך הכל 200 אנשים, בהם 159 אנשים עם NAFLD ו-41 אנשים עם לא NAFLD. קבוצה זו שימשה כמערך אימות עצמאי. עיצוב המחקר פותח כדי לבנות ולאמת את המודל באמצעות נתונים רב-מרכזיים, ובכך לשפר את האמינות וההכללה של הממצאים. המאפיינים הקליניים הבסיסיים של קבוצות NAFLD וקבוצות שאינן NAFLD סוכמו באמצעות חבילת טבלה אחת (טבלה 1). בנוסף, תהליך בחירת המטופל וזרימת המחקר הכוללת מוצגים באיור 1.
קריטריונים אבחנתיים וקריטריוני הוצאה ל-NAFLD
אבחון NAFLD התבסס על הקריטריונים הבאים16: גיל 18 ומעלה, השתתפות בסקר אלסטוגרפיה זמנית (FibroScan) עם צריכת אלכוהול מוגבלת ל-≤140 גרם לשבוע לנשים ו-≤ 210 גרם לשבוע לגברים במהלך 12 החודשים הקודמים, ערך פרמטר הפחתה מבוקר (CAP) של ≥ 302 dB/m כפי שנמדד באמצעות מערכת FibroScan 502 V2 Touch (Echosens, פריז, צרפת) עם גלאי בינוני (M) או גדול במיוחד (XL), או אבחנה שאושרה על ידי פתולוגיית ביופסיית כבד במחלקה למחלות זיהומיות בבית החולים הראשון המסונף של אוניברסיטת וונג'ואולרפואה 23.
הקריטריונים להחרגה של NAFLD מפורטים כך:צריכת אלכוהול גבוהה (צריכת אלכוהול יומית ממוצעת > 20 גרם לנשים ו-> 30 גרם לגברים לפי סקר השימוש באלכוהול של NHANES5), נוכחות של הפטיטיס B או C, זיהום HIV, הפטיטיס אוטואימוני, כולנגיטיס מררה ראשוני, מחלת וילסון, שימוש ממושך בתרופות נוגדות דלקת לא-סטרואידיות, חוסמי תעלות סידן, טמוקסיפן, אמיודארון, קורטיקוסטרואידים, איזוניאזיד או מתוטרקסאט, הריון או הנקה, ואבחון של סרטן כבד או כל גידול שפיר או ממאיר אחר.
איסוף נתונים ובחירת משתנים
משתני החיזוי הפוטנציאליים הכלולים במחקר זה מפורטים להלן:
מאפיינים דמוגרפיים (כלומר, גיל ומגדר); מדד מסת גוף (BMI); ערכי CAP של המשתתפים במאגר הנתונים של NHANES; בדיקות ביוכימיה כלליות [למשל, אלבומין (ALB), גלובולין (GLO), חלבון כולל (TP), לקטט דה-הידרוגנאז (LDH), חנקן אוריאה בדם (BUN), חומצת שתן (UA), גמא-גלוטמיל טרנספראז (GGT), טריגליצריד (TG), סרום-גלוקוז (Glu), קריאטינין סרום (SCr), בילירובין כולל (TBIL), נתרן (Na⁺), כלוריד (Cl⁻), אשלגן (K⁺), סידן (Ca), ביקרבונט (HCO₃), כולסטרול כולל (TC), אספרטט אמינוטרנספראז (AST) ואלנין אמינוטרנספראז (ALT)]; פרמטרים המטולוגיים סטנדרטיים [כלומר, ספירות תאי דם אדומים (RBC), ספירות תאי דם לבנים (WBC), ספירות נויטרופילים (NEUT), ספירות אאוזינופילים (EOS), ספירות לימפוציטים (LYM), ספירות מונוציטים (MON), רוחב התפלגות תאי דם אדומים (RDW) וספירת טסיות דם (PLT)]; היסטוריה של יתר לחץ דם וסוכרת (DM). מבין הנבדקים שנכללו במחקר, הקריטריונים האבחנתיים לסוכרת וליתר לחץ דם התקבלו ממחקר קודם של מודל חיזוי מבוסס למידת מכונה שהתמקד ב-NAFLD24.
טיפול בנתונים חסרים ובחירת תכונות
נתוני הקוהורט ששימשו במחקר זה כללו ערכים חסרים. החרגת כל הרשומות הלא שלמות לא רק תקטין את גודל המדגם של הניתוח, אלא גם תפגע באיכות הנתונים ועלולה להטות את תוצאות התחזית. לכן, כל נתונים עם ערכים חסרים העולים על 20% הוצאו. עבור מערכי נתונים עם ערכים חסרים ≤20%, יושמו שיטות אימפוטציה שונות בהתאם לסוג הנתונים: "norm" למשתנים רציפים, "logreg" למשתני סיווג בינאריים, ו-"polyreg" למשתנים מרובי מחלקות. ההטמעות הללו בוצעו באמצעות חבילת "עכברים" ב-R עבור האצאה מרובה25. במחקר זה, כל המשתנים הרציפים חולקו למשתנים בינאריים, כאשר ספי הסיווג האופטימליים נקבעו באמצעות ניתוח עקומות מאפייני הפעלה של מקלט (ROC). באופן ספציפי, נקודת החיתוך המתאימה למדד יודן המקסימלי על עקומת ROC נבחרה כקריטריון סיווג אופטימלי, ובכך אופטימיזציה של ביצועי הסיווג תוך שמירה על איזון מתאים בין רגישות לספציפיות. בהמשך, נעשה שימוש בניתוח הבחנה חלקי של ריבועים קטניים (PLS-DA) כדי לאשכול את הנתונים בצורה יעילה.
לצורך בחירת תכונות נוספות, הפרטים חולקו באקראי למערכות אימון ובדיקות ביחס של 7:3 באמצעות חבילת ה"קארט". ראשית, השתמשו ברגרסיית אופרטור ההתכווצות והבחירה המוחלטת הקטנה ביותר (LASSO) לבחירת תכונות, וזיהתה 14 משתנים מרכזיים לניתוח הבא. לאחר מכן, ChatGPT-4 הוחל כדי להקצות ציון חשיבות לכל משתנה. כדי להעריך באופן שיטתי את חשיבות המאפיין תוך שליטה בהטיה פוטנציאלית ובשונות סטוכסטית, יושם פרוטוקול הערכה סטנדרטי. ההנחיה הספציפית שסופקה למודל הייתה: "בהתבסס על ספרות קלינית מבוססת בנוגע למחלת כבד שומני לא-אלכוהולית (NAFLD), הקצה ציון חשיבות הנע בין 1 (הנמוך ביותר) ל-10 (הגבוה ביותר) לכל אחד מ-14 המשתנים הבאים שזוהו באמצעות רגרסיית LASSO." על ידי הגבלת ההערכה רק למשתנים שנבחרו מראש על ידי רגרסיית LASSO, הסיכון לשילוב תכונות הזייתי או לא רלוונטיות צומצם. כדי למנוע דליפת נתונים פוטנציאלית ושימוש לא מכוון בשכיחות התוצאה, מודל השפה היה עיוור לחלוטין למאגר הנתונים האמפירי. הניקוד היה מוגבל לסינתזה של ידע רפואי קיים לגבי שמות המשתנים. הליך זה משפר שיטות מסורתיות, כגון בחירת יציבות LASSO או גיזום מבוסס SHAP, בכך שהוא מבטיח שתכונות מונחות נתונים בלבד מציגות סבירות פתופיזיולוגית חזקה לפני האינטגרציה הסופית של המודל. בנוסף, כדי לצמצם שונות תגובה יחידה, ההליך הזה חזר על עצמו 10 פעמים באופן עצמאי. הציון הממוצע לכל משתנה חושב בין האיטרציות הללו, מה שמבטיח עדיפות אובייקטיבית. המשתנים דורגו בסדר יורד בהתאם לממוצע הציונים שלהם. לבסוף, הבחירה צומצמה לכלול רק את המשתנים שציון החשיבות הממוצע שלהם עולה על 5, מה שהוביל ל-8 משתנים מרכזיים: SCr, UA, GGT, גלוטוס, יתר לחץ דם, סוכרת, TG ו-BMI.
פיתוח מודלים מבוססי AutoML לחיזוי NAFLD
במחקר זה, שולבה חבילת אלגוריתמים קלאסית ומתקדמת של למידת מכונה באמצעות H2O AutoML לאבחון יעיל של NAFLD. באמצעות ניצול יכולות AutoML של פלטפורמת H2O.ai, בוצעו ניתוחי למידת מכונה למשימות סיווג בינארי. האלגוריתמים בהם השתמשו כללו הגברת גרדיאנט אקסטריימה (XGBoost), מכונת הגברת גרדיאנט (GBM), מודל ליניארי מוכלל (GLM), עצים אקראיים מאוד (XRT), למידה עמוקה (DL) ואנסמבל מוערם. אלגוריתמים אלו הוערכו באופן שיטתי כדי לזהות את המודל האופטימלי לאבחון מחלה. כדי להבטיח שחזור מתודולוגי קפדני, הוגדרו במפורש פרמטרי הביצוע של H2O AutoML. החיפוש האוטומטי הוגבל לזמן ריצה מקסימלי של 11,687 שניות ולמקסימום 302 מודלים, תוך שימוש ב-seed אקראי קבוע של 13. דגלי קדם-עיבוד פנימיים כללו הקצאה אוטומטית של ערכים חסרים שאריתיים באמצעות אלגוריתמים של ממוצע/מצב, וכן קידוד מטרות למשתנים קטגוריים בעלי עוצמה גבוהה. הארכיטקטורה האופטימלית שנבחרה (מסומנת GBM_grid_1_model77) הייתה מכונת הגברת גרדיאנטים עם ההיפרפרמטרים הספציפיים הבאים: סך הכל 28 עצים, עומק עץ מקסימלי של 5, וקצב למידה של 0.1.
כדי לשפר את עמידות המודל ולהפחית סיכוני התאמת יתר, הוטמעה מסגרת AutoML הכוללת פרוטוקולי כוונון ואימות היפרפרמטרים שיטתיים. התהליך החל בחקירה אוטומטית של 200 תצורות מודל שונות באמצעות אופטימיזציה של היפרפרמטרים, תוך שימוש באימות צולב של 5 פעמים, כאשר מערך הנתונים של האימון חולק לחמישה תת-קבוצות סותריות. במהלך האימון האיטרטיבי, כל תצורה השתמשה בארבע תת-קבוצות (80%) לבניית מודלים, תוך שמירה על תת-קבוצה אחת (20%) לאימות, כאשר תפקיד האימות הזה מסתובב ברצף בכל הקפלים. כדי לאזן בין יעילות חישובית לאופטימיזציית ביצועים, יושמה עצירה דינמית מוקדמת בהתבסס על השטח מתחת לעקומת ROC (AUC). מנגנון זה השעה את האימון כאשר שיפורי AUC ירדו מתחת לסף 0.001 לשלושה מחזורים רצופים, והחלו הן על שיפור מודלים בודדים והן על תהליך החיפוש הכולל ב-AutoML. בחירת המודל הסופית נתנה עדיפות לקונפיגורציות שהדגימו ממוצע AUC מקסימלי הן בקבוצות אימון והן במערכות אימות, תוך דרישה במקביל ביצועים עקביים בין קבוצות אלו ושונות מטרית מינימלית בין איטרציות אימות צולבות. גישה משולבת זו הבטיחה דיוק חיזוי מיטבי תוך שמירה על הכללה חזקה באמצעות פרוטוקולי אימות קפדניים ומגבלות אופטימיזציה אוטומטיות.
הערכת ביצועי המודל ופרשנות תוצאות החיזוי
ביצועי המודל ופרשנות תוצאות החיזוי הוערכו באופן מקיף באמצעות עקומות ROC, ציוני F1 וניתוח SHapley Additive Explanation (SHAP). ביצועי המודל ופרשנות תוצאות החיזוי שלו הוערכו באופן מקיף באמצעות עקומות ROC, ציוני F1 וניתוח SHapley Additive Explanation (SHAP). בתחילה, נוצרו תחזיות במאגר הנתונים של הבדיקה באמצעות המודל המאומן, וההסתברויות החזויות למחלקה החיובית (כלומר, מחלקה 1) הופקו (pred_prob). עקומת ה-ROC נבנתה באמצעות חבילת pROC, ו-AUC של המודל, יחד עם רווח האמון של 95%, חושב. הסף האופטימלי על עקומת ROC נקבע באמצעות סטטיסטיקת J של יודן (J = רגישות + ספציפיות − 1) לקביעת תווית סיווג בינארית. בהתבסס על סף זה שנגזר מעקומת ROC, ההסתברויות החזויות הומרו לתוויות חיזוי בינאריות (0 או 1), ולאחר מכן נוצרה מטריצת בלבול. ציון F1 בערכת הבדיקה חושב באמצעות פונקציית מטריצת הבלבול, והופקה ויזואליזציה של מטריצת הבלבול ונשמרה. בנוסף, המודל אומת נוסף על בסיס מאגר נתונים עצמאי לאימות חיצוני הכולל 200 מקרים (מבית החולים הראשון המסונף של אוניברסיטת וונג'ואו לרפואה). ערכי SHAP נותחו באמצעות חבילת "shapviz" כדי להבהיר את השפעת כל משתנה על תוצאות החיזוי של המודל, ובכך לספק תובנות לפרשנות תחזיות הסתברות NAFLD בודדות.
שיטות סטטיסטיות
"ניתוח סטטיסטי ופיתוח תוכנה בוצעו באמצעות גרסה 4.2.3 של R (קרן R למחשוב סטטיסטי, וינה, אוסטריה). משתנים רציפים הוערכו תחילה לנורמליות באמצעות מבחן שפירו-וילק או בדיקה ויזואלית של גרפים Q-Q. הנתונים המפוזרים בדרך כלל הוצגו כסטיית תקן ממוצעת ± (SD), והשוואות בין שתי קבוצות בלתי תלויות בוצעו באמצעות מבחני t של מדגמים בלתי תלויים. להשוואות קבוצתיות מרובות, ANOVA חד-כיווני שימש עם בדיקות HSD של טוקי בפוסט-הוק כאשר הדבר מתאים. נתונים רציפים שאינם מתחלקים נורמלית סוכמו כחציון [טווח בין-רבעוני (IQR), P25–P75], והשוואות קבוצות בוצעו באמצעות מבחן Mann-Whitney U לשתי קבוצות עצמאיות או מבחן Kruskal-Wallis לקבוצות מרובות, ואחריו מבחן הפוסט-הוק של דאן במידת הצורך. משתנים קטגוריים הוצגו כתדירויות ואחוזים (%), והשוואות של יחסים בין קבוצות נותחו באמצעות מבחן כי-ריבוע (מבחן χ2 ) או מבחן פישר המדויק כאשר ספירת התאים הצפויה הייתה נמוכה מ-5. רמת המובהקות נקבעה על α = 0.05 (דו-זנבות), וערך p < 0.05 נחשב למובהק סטטיסטית.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
מאפיינים קליניים של NAFLD
במחקר זה, המאפיינים הקליניים של אנשים עם וללא NAFLD נותחו באופן שיטתי. מגוון שיטות שימשו כדי להמחיש בבירור את התפלגות וההבדלים של תכונות אלו בתוך אוכלוסיית המדגם (טבלה 1). בסך הכל נכללו בניתוח 2,677 אנשים, מתוכם 718 סבלו מ-NAFLD. הניתוח כיסה מגוון מדדים קליניים, כולל BMI, TG, GGT, UA ואחרים (כפי שמוצג באיור 1). על ידי ביצוע PLS-DA על המשתנים הקליניים והמטבוליים, נצפתה הפר...
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
NAFLD הוא הגורם השכיח ביותר למחלות כבד כרוניות בעולם, ושכיחותו עולה בכ-1% בכל שנה26. כ-30% מאוכלוסיית העולם מושפעת, מה שהופך את NAFLD לא רק להפרעה הכרונית המובילה בכבד, אלא גם לסימן הצומח ביותר להשתלת כבד3. למידת מכונה אוטומטית (AutoML) הפכה לכלי חשוב ברפואה, כאשר אחד היעדים המרכזיים שלה הוא לבנות מודלים חיזויים על ידי זיהוי קורלציות בין תכונות קלט. מספר הולך וגדל של מחקרים מדגישים את הפוטנציאל החזק של ML לפיתוח מודלים אבח...
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
המחברים מצהירים שאין ביניהם ניגוד עניינים. במחקר זה, ChatGPT-4 (OpenAI) שימש ככלי אנליטי חכם במהלך שלב בחירת התכונות להערכת הרלוונטיות הקלינית של משתנים שזוהו על ידי רגרסיית LASSO. כל הציונים שנוצרו על ידי בינה מלאכותית נבדקו בקפידה על ידי המחברים ואומתו אמפירית בתהליך AutoML שלאחר מכן. ChatGPT-4 לא שימש לשינוי נתונים גולמיים או לביצוע חישובים מתמטיים. המחברים נושאים באחריות מלאה על שלמות ודיוק התוצאות הסופיות.
עבודה זו נתמכה על ידי קרן הסטארטאפ למחקר מדעי של אוניברסיטת פוג'יאן לרפואה [2021QH1176]; המעבדה המרכזית לאבחון קליני ומחקר תרגומי של מחוז ג'ג'יאנג [2022E10022]; פרויקט תוכנית המדע והטכנולוגיה הרפואית והבריאותית של מחוז ג'ג'יאנג [2024KY1265]; ופרויקט המחקר הבסיסי לרווחת הציבור העירונית של וונג'ואו [Y2023096].
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
| שם | חברה | מספר קטלוג | הערות |
|---|---|---|---|
| Datasets for NAFLD (2017–2018) | מאגר NHANES [https://wwwn.cdc.gov/nchs/nhanes/continuousnhanes/default.aspx?BeginYear=2017] | N/A | כמקבץ האימונים לבניית המודל |
| Datasets for NAFLD (2018–2020) | בית החולים המסונף הראשון של אוניברסיטת וונג'ואו לרפואה (2018–2020), סין. [https://doi.org/10.6084/m9.figshare.32105248.] | N/A | כקבוצת בדיקה לאימות חיצוני של המודל |
| R (גרסה 4.2.3) | R Foundation for Statistical Computing | N/A | בשימוש יחד עם כלים אחרים לביצוע ניתוח נתונים ויצירת מצגות חזותיות וגרפיות. |
| Adobe Illustrator 2025 (גרסה 29.2) | Adobe Systems Incorporated | N/A | לפריסת תמונות ועריכתן |
| ChatGPT-4 | OpenAI Inc. | N/A | להקצאת ציון חשיבות לכל משתנה שנבחר |
| H2O AutoML (3.44.0.3) | H2O.ai | N/A | לשילוב סט מקיף של אלגוריתמים ללמידת מכונה |
בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה
בקש הרשאה