$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
מקור הנתונים והצהרת אתיקה
מחקר רטרואקטיבי זה השתמש בנתונים מ-MIMIC-IV (גרסה 3.1), מאגר מידע אלקטרוני לטיפול קריטי שאינו מזוהה לציבור, המאוחסן ב-PhysioNet. המאגר כולל מידע דמוגרפי, סימני חיים, בדיקות מעבדה, אבחנות, פרוצדורות ותרופות.
הגישה ל-MIMIC-IV דורשת אישור מוסמכת ועמידה בהסכם השימוש בנתונים ובדרישות ההכשרה של PhysioNet. החוקרים השלימו את ההכשרה הנדרשת וקיבלו גישה (מספר תעודה: 68351548). מכיוון שמאגר הנתונים אינו מזוהה, מחקר זה ניתח נתונים אנונימיים ולא כלל מגע ישיר עם מטופלים; לכן, לא נדרשה הסכמה מדעת. תהליך המידול הביצועי המלא שלב אחר שלב מוצג באיור 1.

איור 1. תהליך המידול הכולל לחיזוי סיכון לאוסטאופורוזיס (OP) אצל חולי סוכרת. ייצוג סכמטי של צינור המחקר, כולל זיהוי קוהורטים, חילוץ נתונים, הנדסת תכונות, בנצ'מרקינג מרובי מודלים, בחירת מודלים על בסיס ביצועי אימות, ופרשנות מבוססת SHAP של המודל הסופי. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
מחקר אוכלוסייה וחילוץ נתונים
הנתונים הופקו ממאגר Medical Information Mart for Intensive Care IV (MIMIC-IV) באמצעות כלי ניהול מסדי נתונים. כדי להבטיח שחזוריות, שאילתות SQL מדויקות, כולל שמות טבלאות ולוגיקת סינון המשמשת לשליפת קוהורטים, מסופקות בקובץ המשלים 1. מטופלים בוגרים (≥18) שאובחנו עם סוכרת זוהו באמצעות קודי ICD-9 (249, 250) וקודי ICD-10 (E08–E13). התוצאה העיקרית, OP, הוגדרה באמצעות קודי ICD-9 (733.x) וקודי ICD-10 (M80, M81, M82). בתוך קבוצת הסוכרת הראשונית הזכאית (n = 46,226), זוהו 3,672 אירועים חיוביים (מטופלים עם OP) ו-42,554 אירועים שליליים (מטופלים ללא OP). תרשים זרימה מפורט של בחירת מטופלים ופרישה מוצג באיור 2.

איור 2. תרשים זרימה של בחירת מטופלים ובניית קבוצה. תרשים הזרימה ממחיש את ההסקה ההדרגתית של הקוהורט מתוך מאגר MIMIC-IV (v3.1). מטופלים מבוגרים עם סוכרת זוהו באמצעות קודי ICD, ואחריהם הוצאה ממטופלים בגיל ובגיל סגן; 18 שנים, חסרים נתונים קריטיים gt; 30%, או רשומות לא תקפות. הקבוצה האחרונה חולקה ל-OP (אירועים חיוביים) ולא-OP (אירועים שליליים). אי-איזון מחלקתי טופל באמצעות דגימה תת-אקראית ו-SMOTE שהחלה על נתוני האימון לפני חלוקת מערכי הנתונים בשכבות. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
הנדסת תכונות
כדי להבטיח בנצ'מרקינג הוגן בין אלגוריתמי למידת מכונה ויכולת שחזור מדויקת, הוחל רצף זהה של שלבי קדם-עיבוד: בחירת תכונות, אימפוטציה של ערכים חסרים, קנה מידה מתמשך של תכונות, איזון מחלקות וחלוקת מערכי נתונים. הרשימה המלאה של תכונות הקלט, כולל שמות משתנים, יחידות ומקורות נתונים, מפורטת בטבלה 1.
| מאפיינים | סך הכל (n = 14,688) | סט אימונים (n = 9,546) | קבוצת האימות (n = 2,204) | סט מבחן (n = 2,938) | ערך P |
| מגדר | | | | | 0.345 |
| זכר | 6222 (42.36%) | 4045 (42.37%) | 935 (42.42%) | 1242 (42.27%) | |
| נקבה | 8466 (57.64%) | 5501 (57.63%) | 1269 (57.58%) | 1696 (57.73%) | |
| גיל | 0.28 (−0.40, 0.94) | 0.28 (−0.43, 0.94) | 0.23 (−0.46, 0.89) | 0.28 (−0.39, 0.95) | 0.1655 |
| תאי דם אדומים | −0.14 (−0.79, 0.49) | −0.13 (−0.79, 0.49) | −0.17 (−0.83, 0.48) | −0.14 (−0.76, 0.49) | 0.3641 |
| המטוקריט | −0.14 (−0.81, 0.52) | −0.13 (−0.80, 0.52) | −0.14 (−0.87, 0.51) | −0.16 (−0.81, 0.52) | 0.3709 |
| המוגלובין | −0.12 (−0.79, 0.52) | −0.12 (−0.79, 0.51) | −0.15 (−0.86, 0.53) | −0.13 (−0.78, 0.52) | 0.3616 |
| RDW | −0.16 (−0.59, 0.45) | −0.17 (−0.59, 0.46) | −0.14 (−0.59, 0.45) | −0.17 (−0.60, 0.42) | 0.5803 |
| פוספט | −0.14 (−0.60, 0.38) | −0.15 (−0.61, 0.38) | −0.11 (−0.57, 0.38) | −0.13 (−0.56, 0.34) | 0.415 |
| MCV | 0.05 (−0.50, 0.63) | 0.06 (−0.50, 0.65) | 0.03 (−0.49, 0.65) | 0.02 (−0.50, 0.59) | 0.5408 |
| מגנזיום | −0.10 (−0.52, 0.37) | −0.10 (−0.52, 0.37) | −0.10 (−0.52, 0.37) | −0.09 (−0.50, 0.37) | 0.7797 |
| תאי דם לבנים | −0.16 (−0.47, 0.21) | −0.16 (−0.47, 0.20) | −0.15 (−0.48, 0.25) | −0.16 (−0.46, 0.20) | 0.6856 |
| מעבר אניון | −0.12 (−0.64, 0.45) | −0.13 (−0.64, 0.45) | −0.07 (−0.61, 0.48) | −0.13 (−0.64, 0.45) | 0.1217 |
| קריאטינין | −0.30 (−0.48, 0.01) | −0.30 (−0.48, 0.01) | −0.30 (−0.46, 0.01) | −0.30 (−0.48, −0.00) | 0.3323 |
| MCH | 0.11 (−0.48, 0.62) | 0.12 (−0.48, 0.62) | 0.11 (−0.47, 0.62) | 0.09 (−0.48, 0.61) | 0.5195 |
| ספירת טסיות | −0.09 (−0.61, 0.49) | −0.09 (−0.61, 0.49) | −0.08 (−0.62, 0.47) | −0.10 (−0.62, 0.48) | 0.9709 |
| MCHC | −0.00 (−0.59, 0.59) | −0.00 (−0.60, 0.59) | −0.00 (−0.57, 0.58) | 0.00 (−0.57, 0.60) | 0.9263 |
| כלוריד | 0.05 (−0.54, 0.64) | 0.05 (−0.52, 0.65) | 0.03 (−0.59, 0.62) | 0.07 (−0.52, 0.62) | 0.4675 |
| אשלגן | −0.07 (−0.67, 0.53) | −0.09 (−0.67, 0.53) | −0.07 (−0.67, 0.53) | −0.07 (−0.62, 0.53) | 0.3071 |
| נתרן | 0.05 (−0.56, 0.60) | 0.05 (−0.55, 0.60) | −0.00 (−0.60, 0.60) | 0.07 (−0.57, 0.61) | 0.3492 |
| חנקן אוריאה | −0.28 (−0.60, 0.29) | −0.28 (−0.60, 0.29) | −0.26 (−0.59, 0.31) | −0.28 (−0.59, 0.25) | 0.6826 |
| סך הסידן | 0.02 (−0.61, 0.59) | 0.02 (−0.61, 0.59) | −0.01 (−0.59, 0.56) | 0.01 (−0.61, 0.60) | 0.8203 |
טבלה 1. מאפייני בסיס ותכונות מהונדסות של קבוצת המחקר. משתנים קטגוריים מוצגים כ-n (%). משתנים רציפים מוצגים כחציון (טווח בין-רבעוני) של ערכים סטנדרטיים. ערכי P חושבו כדי להשוות התפלגויות בין מערכות האימון, האימות והבדיקות באמצעות מבחנים סטטיסטיים מתאימים.
משתנים רציפים עם מדידות חוזרות אוגדו באמצעות הממוצע האריתמטי בתוך כל חלון התצפית בטיפול נמרץ כדי לקבל וקטור תכונה יחיד לכל מטופל. משתנים עם שיעור היעדרות העולה על 30% הוצאו. עבור המשתנים המספריים הנותרים, ערכים חסרים הועברו באמצעות אלגוריתם K-Nearest Neighbors (KNN) (n_neighbors = 5, משקלים = 'אחידים'). משתנים קטגוריים הועברו באמצעות הקטגוריה השכיחה ביותר ולאחר מכן הועברו לשינוי באמצעות מיפוי בינארי, כאשר כל קטגוריה שלא נראית קיבלו וקטור של אפסים.
משתנים רציפים תוקנו באמצעות נוסחת קנה המידה של ציון z (). תכונות עם אפס שונות הוסרו במפורש לפני הסקיילינג. כל פרמטרי הקדם-עיבוד (μ ו-σ.) הוערכו אך ורק על סט האימון והוחלו בעקביות על מערכות האימות והבדיקה.
בהינתן חוסר האיזון החמור בין המחלקות (3,672 לעומת 42,554), שימשה אסטרטגיית איזון היברידית אך ורק על נתוני האימון כדי למנוע ניפוח הערכות ביצועים. ראשית, נעשה שימוש בדגימה תת-אקראית כדי להפחית את רוב הקטגוריה השלילית ולהשיג יחס של 1:2 (חיובי-שלילי) (הניב 7,344 דגימות שליליות). לאחר מכן, טכניקת דגימת היתר של מיעוט סינתטי (SMOTE) יושמה על המחלקה החיובית כדי להשיג יחס מאוזן סופי של 1:1 (7,344 לעומת 7,344)8.
לבסוף, הקבוצה חולקה ברמת המטופל לקבוצות הכשרה (65%), אימות (15%) ובדיקות (20%) באמצעות דגימה שכבתית. כדי לשלוט בקפדנות בכל התהליכים האקראיים בכל סוגי ההשערה, האיזון והפיצול, הוטל זרע אקראי גלובלי (random_state = 42).
ארכיטקטורת מודלים
כדי לזהות את המודל החיזוי המתאים ביותר לסיכון OP בחולי סוכרת, נעשה שימוש במסגרת השוואות בקנה מידה רחב להשוואת 70 וריאנטים של אלגוריתם ML תחת פרוטוקול ייצוג והערכה זהה. משפחות המודלים המועמדות כללו מסווגים ליניאריים רגולריזציה, מכונות וקטוריות תמיכה (SVMs), kNN, אנסמבלים של עצים, ארכיטקטורות הגברת גרדיאנט, ופרספטרונים רב-שכבתיים 9,10,11,12,13,14,15,16,17.
במקום שימוש בחיפוש רשת מסורתי, אופטימיזציה של היפרפרמטרים בוצעה על ידי הערכת תצורות מוגדרות מראש וחזקות לאורך 70 וריאנטים אלו של מודלים בחלוקת האימון. הבחירה התבססה אך ורק על מקסום השטח מתחת לעקומת מאפיין הפעולה של המקלט (ROC) (AUC) בקבוצת האישור. המודל הסופי עם הביצועים הטובים ביותר הוגדר עם n_estimators = 200, כאשר פרמטרים אחרים נשארו בהגדרות ברירת המחדל של חבילת התוכנה המופיעה בטבלת החומרים. מדדי הערכה, כולל AUC, דיוק, ציון F1, דיוק וזיכרון, חושבו באמצעות סף הסתברות ברירת מחדל של 0.5.
כדי לתמוך בשקיפות קלינית, SHAP יושם על המודל הנבחר באמצעות שיטת TreeExplainer. בהינתן האופי המבוסס על עץ של המודל הסופי, נעשה שימוש בערכים צפויים תלויי מסלול עץ בדיוק כתצורת הרקע.