תפקוד לקוי של בלוטת התריס (TD) הוא אחת מהמחלות האנדוקריניות הכרוניות הנפוצות ביותר, עם שכיחות משתנה בין אוכלוסיות1. שתי ההפרעות הנפוצות ביותר בבלוטות התריס הן תת-פעילות של בלוטת התריס והיפרתירואידיזם. תת-פעילות של בלוטת תריס היא מצב נפוץ הנובע מייצור לא מספק של הורמוני בלוטת התריס. למרות שבדרך כלל ניתן לניהול באמצעות טיפול, במקרים חמורים זה עלול להיות קטלני אם לא מטופל. התסמינים הנפוצים ביותר של תת-פעילות בלוטת התריס במבוגרים כוללים עייפות, עצירות, עייפות, עלייה במשקל, עור יבש ושינויים בקול. עם זאת, ההופעות הקליניות עשויות להשתנות לפי גיל, מגדר וגורמים נוספים3. מדווח כי המחלה פוגעת ב-5% מהאוכלוסייה הכללית, ועוד 5% נותרו ללא אובחנות, בעוד ש-99% מהחולים סובלים מתת-פעילות ראשונית של בלוטת התריס. הוא נפוץ במדינות המפרץ הערבי, אם כי לעיתים קרובות הוא עדיין לא מאובחן מספיק.4. תת-פעילות מולדת של בלוטת הבר משפיעה על בערך אחד מכל 3,450 תינוקות בערב הסעודית. מחקרים חתך אחרים שהתמקדו אך ורק בנשים דיווחו על שיעורי שכיחות גבוהים יותר שנעו בין 13% ל-35%5. יתרה מזאת, מוכיח שנקבות רגישות יותר מגברים6. תת-פעילות בלוטת התריס, אם לא מטופלת, עלולה להוביל לדיסלפידמיה, פגיעה קוגניטיבית, יתר לחץ דם, עקרות ותפקוד נוירומוסקולרילקוי 7. כתוצאה מכך, מחקר זה שואף להשתמש בשיטות למידת מכונה לאבחון יזום של תת-פעילות בלוטת התריס באמצעות מאגר נתונים מבית החולים המלך פאהד (KFUH) בדמאם, ערב הסעודית.
תת-פעילות בלוטת התריס יכולה להיות קשה לאבחון מכיוון שהתסמינים לעיתים קרובות מתבלבלים עם תסמינים של מחלות אחרות.8. יתרה מזאת, אבחנה מאוחרת של תת-פעילות של בלוטת התריס עלולה להשפיע לרעה על היכולות האינטלקטואליותשל המטופל. בדיקת הורמון מגרה בלוטת התריס (TSH) היא השיטה האבחנתית הנפוצה ביותר לזיהוי תת-פעילות בלוטת התריס9. עם זאת, הגעת גישות, אסטרטגיות וכלים של בינה מלאכותית ולמידת מכונה סייעה לפתור בעיות אבחוניות ותחזיתיות בתחומים רפואיים שונים. למידת מכונה משמשת להערכת חשיבות הגורמים הקליניים ושילוביהם לפרוגנוזה, כגון חיזוי התקדמות המחלה, הפקת ידע רפואי למחקר תוצאות, תכנון ותמיכה טיפולית,וטיפול כללי בחולים. עם כמויות גדולות של נתונים רפואיים זמינים, לרופאים יש כיום משאב יקר ערך לגילוי ידע חדש ופוטנציאלי בעל ערך באמצעות למידת מכונה11,12.
באמצעות מאגר נתונים קליני פשוט ממאגר הנתונים הסעודי, מחקר זה שואף לסייע לעובדי בריאות במדינה לאבחן תת-פעילות בלוטת התריס מוקדם וליישם מערכת חיזוי זו בבתי חולים עם משאבי מחשב וציוד מוגבלים. בנוסף, מחקרים קודמים בתחום זה לא השתמשו במאגר הנתונים הסעודי. זה יוצר הזדמנות לשלב את מערך הנתונים הסעודי לצד מחקרים קודמים. המחקרים השתמשו במאגר נתונים סעודי לחיזוי מחלות כליה, סוכרת, מחלת בלוטת התריס ואלצהיימר, בהתאמה, והשיגו דיוק גבוה 13,14,15. הניסיון הזה מניע יישום שיטות אלו על מחלות נוספות בערב הסעודית. המחקרים הם בין העבודות העדכניות ביותר בלמידת מכונה ובינה מלאכותית בתחום הרפואה 16,17,18,19.
המחקר המוצע דן ביישום טכניקות למידת מכונה על מאגר נתונים קליני פשוט של תת-פעילות בלוטת תריס, כדי לחזות את נוכחות המחלה לפני שהיא הופכת לסימפטומטית במלואה. המטרה היא לפתח מערכת מבוססת למידת מכונה שמספקת התרעות מוקדמות על התרחשות אפשרית של תת-פעילות בלוטת התריס. זה גם יקל על בתי חולים מקומיים עם ציוד מוגבל להשתמש במערכת האבחון הזו. מחקר זה הוא הראשון שבוחן מחלה זו באמצעות מאגר הנתונים הסעודי, תוך התמקדות בשלב טרום-סימפטומטי. מאגר הנתונים מכסה אוכלוסיית מטופלים רחבה של מטופלים בבתי חולים סעודיים מקומיים, עם טווח גילאים רחב, שילוב של מקרים חיוביים ושליליים של יתר פעילות בלוטת התריס.
מחקר זה השתמש בארבעה אלגוריתמים של למידת מכונה: מכונת וקטור תמיכה (SVM), K-neighbours nearest (KNN), הגברת גרדיאנט eXtreme (XGBoost), ומסווג אנסמבל הצבעה רכה המורכב מ-SVM ו-KNN. כל אחד מארבעת האלגוריתמים הוכיח את יכולותיו בתחום הרפואה. אלגוריתם KNN נבחר בשל פשטותו ושל השגת דיוק בדיקות של 77.5% באבחון מונע של סוכרת (DM)20. במקביל, SVM נבחר בשל עמידותו21, והוא שימש לאחרונה לחיזוי סיכון לתמותה בקרב חוליCOVID-19 22. יתרה מזאת, XGBoost נבחר בזכות ביצועיו החזקים23, שהשיג ציון חיזוי מדויק של 94% לתוצאות יתר לחץ דם, ושימש ערימה לשיפור התוצאות מהאלגוריתמים המובילים. בנוסף, נעשה שימוש במסווג קבוצות הצבעה לזיהוי הפרעות בלוטת התריס בדיוק של 100%.
המטרה העיקרית של המחקר הנוכחי היא אבחון מוקדם של תת-פעילות בלוטת התריס באוכלוסייה סעודית באמצעות נתונים קליניים שגרתיים מקוריים ואלגוריתמים מתקדמים של למידת מכונה. ארבע הטכניקות ששימשו במחקר זה יושמו על פלטפורמת Jupyter באמצעות שפת התכנות פייתון, תוך שימוש במאגר הנתונים של תת-פעילות בלוטת התריס. אימות צולב של 10 פעמים עם כוונון היפרמטר שימש לשיפור הביצועים. לאחר מכן יושמה בחירת תכונות סדרתיות עם טכניקת בחירה קדימה, שהביאה לכך שמסווג קבוצת ההצבעה הגיע לדיוק הגבוה ביותר של 94.7%. SVM, KNN ו-XGBoost, בהתאמה, עקבו אחריו. לגבי הקריאה, מסווג קבוצת ההצבעה הרכה השיג את הציון הגבוה ביותר של 95.5%. בסך הכל, המודל האופטימלי לאבחון תת-פעילות מונעת של בלוטת התריס היה מסווג קבוצת ההצבעה הרכה, שהשיג את הציון הגבוה ביותר בכל מדדי הביצועים שנבדקו במחקר זה.
נערכו מספר מחקרים על אבחון הפרעות כלליות של בלוטת התריס ועל יישום טכנולוגיה, במיוחד למידת מכונה, כפתרון בעזרת מחשב. LSTM-CNN, AlexNet, מודלי הלמידה העמוקה המתוקנים של GoogLeNet, IndRNN–CNN ומודלים מותאמים של ResNet הופעלו באמצעות ספקטרוסקופיית רמאן להבחנה בין דגימות סרום מ-32 חולי תת-פעילות בלוטת התריס, 38 חולי יתר פעילות בלוטת התריס ו-29 נבדקים מביקורת. המודל שלהם השיג דיוק של 84%, 91%, 75%, 82% ו-71%, בהתאמה25%.
אלגוריתמים של למידת מכונה כמו SVM, KNN, רגרסיה לוגיסטית ויער אקראי שימשו לחיזוי שכיחות תת-פעילות בלוטת התריס הנגרמת מקרינה בקרב חולי קרצינומה נאזופרינגיאלית26. המודל שלהם השיג ערך AUC של 0.7. יתרה מזאת, המחברים השתמשו באלגוריתמים שונים של למידת מכונה כדי לחזות את מגמת הטיפול במטופלים עם תת-פעילות בלוטת התריס העוברים טיפול ב-LT4. מבין 10 מסווגים, מסווג העץ החיצוני השיג את הדיוק הגבוה ביותר של 84%.
במחקר נוסף, המחברים יצרו ובדקו אסטרטגיית למידת מכונה לזיהוי אנשים עם היפרתירואידיזם ותת-פעילות של בלוטת התריס שיכולים להרוויחמטיפול רפואי מיידי. הם הטמיעו עץ החלטות להגברת גרדיאנט (GBDT), SVM, ANN ואלגוריתמים רגרסיה לוגיסטית. המודלים שלהם השיגו AUROC של 93.8% ו-90.9% עבור יתר פעילות של בלוטת התריס ותת-פעילות של בלוטת התריס, בהתאמה. במחקר נוסף, המחברים השתמשו בלמידת מכונה כדי לאתר הפרעות בבלוטת התריס, הכוללות תת-פעילות של בלוטת התריס והיפרתירואידיזם. המודלים שלהם כללו SVM, ANN, KNN, רגרסיה לוגיסטית ועץ החלטה, עם הדיוק הגבוה ביותר של 96.92% שהושג על ידי רגרסיהלוגיסטית 28. לאחרונה, קבוצת חוקרים יישמה שיטות שונות, כולל SVM, עץ החלטות, Naïve Bayes ו-ensemble, כדי לחזות ולזהות תת-פעילות של בלוטת תריס. עץ ההחלטה השיג את הדיוק הגבוה ביותר, עם 97.6%29. מחקר נוסף השתמש באלגוריתם Naïve Bayes המבוסס על גרעין אבולוציה דיפרנציאלית היברידית כדי להפחית את תכונות מאגר הנתונים של היפרתירואידיזם ותת-פעילות בלוטת התריס מ-21 ל-10. בהמשך הם יישמו את מסווג Naïve Bayes המבוסס על הליבה על תת-התכונות, והשיגו דיוק של 97.97%ב-30. באופן דומה, במחקר נוסף, המחברים השתמשו במספר אלגוריתמים של למידת מכונה כדי לחזות את הסיכון למחלת בלוטת התריס במאגר הנתונים החולה של אוניברסיטת קליפורניה. הניסוי שלהם הראה כי ANN עולה על כל שאר השיטות, והשיג דיוק של 95%31. יתרה מזאת, ג'ה ועמיתיו השתמשו בטכניקות הגדלת תכונות מוצעות המבוססות על רשתות עצביות עמוקות לחיזוי מחלות בלוטת התריס, והשיגו דיוק יוצא דופן של 99.95%32.
לפי ספרות קודמת, נעשה שימוש באנסמבל הצבעה הומוגני עם בחירת תכונות מרובות לזיהוי מחלות בלוטת התריס, תוך שימוש באלגוריתמים הבאים: יער אקראי, הגברת גרדיאנט, עץ החלטות ורגרסיה לוגיסטית, והשגת דיוק של 100%24. יתרה מזאת, המחברים יישמו את מודל מכונת הלמידה הקיצונית על מאגר הנתונים הפתוח של תת-פעילות בלוטת התריס ב-Kaggle, והשיגו דיוק של 92%. מאגר הנתונים כלל 3772 דגימות: 3481 תת-פעילות בלוטת התריס והיתר שלילי33. לאחרונה, במחקר, המחברים השתמשו ב-CART בשקיות כדי לסיווג תת-פעילות בלוטת התריס. המודל שהוצע השיג דיוק מרשים של 99.9%. בנוסף, T4U, TSH ו-TBG זוהו כגורמים המשמעותיים ביותר הקשורים לתת-פעילות של בלוטת התריס34. במחקר נוסף, המחברים הציעו והשוו מודלים שונים של למידת מכונה ולמידה עמוקה, בהם עץ ההחלטה והיער האקראי השיגו דיוק של 99.5% ו-99.3%, בהתאמה. הם השתמשו במאגר נתונים של Weka שכלל 30 מאפיינים ו-3772 מדגמיםו-35.
סקירת הספרות הקצרה הזו מראה שבעוד שרוב השיטות שימשו השיגו תוצאות טובות עד מצוינות, אף אחת מהן לא השתמשה במאגר נתונים קליני פשוט מערב הסעודית. כמו כן צוין כי רוב הפרסומים הנבדקים השתמשו במאגרי נתונים של דימות, מה שהעלה את רמת העבודה הנדרשת לאיסוף נתונים והגביר את הקושי ליישם מודלים מורכבים מאוד שנוצרו על ידי אנשים שאינם טכניים. יתרה מזאת, רוב המחקרים הללו נעשו על הפרעות כלליות בבלוטת התריס, כאשר מעט מאוד פרסומים הדגישו תת-פעילות של בלוטת התריס. מצב זה מספק הזדמנות לחקור מודלים בסיסיים של למידת מכונה על בסיס מאגר נתונים קליני פשוט מתוך מאגר הנתונים הסעודי, כדי לסייע לבתי חולים מקומיים עם ציוד ממוחשב מוגבל לאבחן את המחלה באופן מונע מראש.
ההקדמה הקצרה לאלגוריתמים שנחקרו במחקר הנוכחי ניתנת בקובץ משלים 1. ארבעת האלגוריתמים הם K-Nearest Neighbor (KNN)36,37,38,39,40, מכונת וקטור תמיכה (SVM)41,42,43,44,45, הגברת גרדיאנט קיצוני (XGBoost)46,47,48, ואנסמבל הצבעה 49,50.