מאמר זה מציג פרוטוקול לזיהוי ישויות בשם ביו-רפואי באמצעות BioBERT, למידה מבוססת הנחיות, ומודלים לשוניים גדולים לתרחישים בעלי משאבים דלים.
מאמר מחקר
מאמר זה מציג פרוטוקול לזיהוי ישויות בשם ביו-רפואי באמצעות BioBERT, למידה מבוססת הנחיות, ומודלים לשוניים גדולים לתרחישים בעלי משאבים דלים.
זיהוי ישויות בשם ביו-רפואי (NER) ממלא תפקיד מרכזי בהפקת מידע יקר ערך מטקסטים קליניים וספרות ביו-רפואית. מודלים מסורתיים של למידה עמוקה, כולל BioBERT, ClinicalBERT ו-RoBERTa, הראו שיפורים משמעותיים במשימות NER; עם זאת, הם עדיין מתקשים עם מונחים ביומדיים דלי משאבים, אתגרי התאמת תחום, והכללה של ישויות בלתי נראות. כדי להתמודד עם מגבלות אלו, מחקר זה מציג מסגרת היברידית המשלבת BioBERT, למידה מבוססת השראה ומודלים לשוניים גדולים (LLMs) כדי לשפר את יכולות הלמידה ב-lu-shot ו-zero-shot ב-NER. המודל המוצע מנצל ביעילות ידע הקשרי משנאים מאומנים מראש, ומפחית את התלות במאגרי נתונים מתויגים נרחבים תוך שמירה על דיוק גבוה. לאחר הערכה ניסויית מקיפה על פני מספר מאגרי מדד ביו-רפואיים, הגישה המוצעת מראה ביצועים חזקים בעקביות. במיוחד, הוא משיג דיוק של 89.8%, דיוק של 88.7%, שחזור של 90.5% וציון F1 של 0.895, מה שמעלה על שיטות בסיס ומדגים את יעילותו במשימות כריית טקסט ביו-רפואיות. בהשוואה לשיטות אחרות, הנדסת פרומפט מסייעת למודל להסתגל הרבה יותר טוב לשפה הייחודית של טקסטים ביו-רפואיים. בנוסף, בוסטינג עם מודל שפה גדול (LLM) מעניק שיפור משמעותי לביצועי NER על ידי זיהוי פרטים סמנטיים ודקדוקיים מורכבים. ממצאים אלו מדגימים את היעילות של למידה מועטה ו-zero-shot בכריית טקסטים ביו-רפואיים, וסוללים את הדרך לניתוח נתונים קליניים אוטומטי טוב יותר ולמערכות תמיכה בהחלטות חכמות יותר.
ההתפוצצות של ספרות ביו-רפואית, רשומות בריאות אלקטרוניות (EHRs) ונתוני ניסויים קליניים באמת זקוקה למערכות חכמות וחזקות לזיהוי ישויות ביו-רפואיות (BioNER). BioNER היא משימה מיוחדת בעיבוד שפה טבעית (NLP) שמטרתה לזהות ישויות כגון מחלות, גנים, חלבונים, תרופות וכימיקלים בטקסט ביו-רפואי לא מובנה1. היכולת לזהות את הגורמים האלה בצורה מדויקת היא מאוד חשובה למגוון שימושים אחרים, כמו כריית ידע ביו-רפואי, מציאת תרופות חדשות, תמיכה ברופאים בהחלטות קליניות, או אפילו מיון אוטומטי של ערימות של מאמרי מחקר2.
למרות שהושגו התקדמויות משמעותיות במודלים מבוססי למידה עמוקה — כגון BioBERT, ClinicalBERT ו-BlueBERT — רוב הגישות הקיימות לזיהוי ישויות ביו-רפואיות מפוקחות (BioNER) ממשיכות להסתמך במידה רבה על מערכי נתונים מוערים בקנה מידה גדול. תלות חזקה זו בנתונים מתויגים נרחבים מגבילה את יכולת ההכללה שלהם כאשר הם מיושמים על טקסטים ביו-רפואיים חדשים או שלא נראו קודם3. המודלים הקלאסיים של BioNER צריכים המון נתונים עם הערות רק כדי לכוונן אותם, וזה הופך לכאב ראש אמיתי באזורים שבהם אין מספיק נתונים, כמו מחלות נדירות, פרמקוגנומיקה או מחקר ביו-רפואי שפורסם בשפות אחרותמלבד אנגלית. מעבר לכך, תיוג ידני של כל הטקסט הביו-רפואי הזה הוא איטי, יקר, ובדרך כלל דורש מומחים אמיתיים בתחום5. לכן פיתוח מודלים של BioNER עם יריות מועטות וללא יריות הוא כל כך חשוב: זה יכול להפחית משמעותית את הצורך בנתונים מתויגים תוך הבטחת עבודה טובה של מודלים במגוון רחב של תוכן ביו-רפואי6.
למידה קצרה (FSL) מאפשרת למודלים להשיג ביצועי זיהוי ישויות תחרותיים תוך שימוש רק בחלק קטן מהנתונים המסומנים, בדרך כלל בין 1% ל-10% ממערך הנתונים המלא של ההדרכה, מה שהופך אותה לבעלת ערך מיוחד עבור תחומים ביו-רפואיים דלי משאבים7. Zero-shot Learning (ZSL) הולכת אפילו רחוק יותר, ומאפשרת למודל לזהות ישויות שמעולם לא ראה קודם, רק על ידי שימוש בכוח של מודלים גדולים ומאומנים מראש (LLMs), בליצורך בנתוני אימון נוספים. לאחרונה, התקדמות במודלים גדולים כמו GPT-4, LLaMA ו-Falcon הראתה ביצועים חזקים ב-zero shot במשימות כלליות של NER, אך השימוש בהם בטקסטים ביו-רפואיים אמיתיים נותר ברובו לא מוכר. זה כי השפה בביו-רפואה כל כך מיוחדתומורכבת.
מחקר זה שואף לצמצם את הפער הזה על ידי שילוב כיוונון מדויק של BioBERT, למידה מועטה, הסקת LLM ללא הזדמנות ולמידה מבוססת השראה, הכל במטרה להעלות את הרף ל-BioNER בסביבות ביו-רפואיות דלות משאבים.
כדי לתת מושג למה שכבר קיים: (1) BioBERT היא גרסה של BERT שעברה הכשרה מחדש על תקצירי PubMed ומאמרים בטקסט מלא, ולכן היא מתאימה יותר לתוכן ביו-רפואי10. (2) ClinicalBERT הוא וריאנט BERT המאומן על EHR, ולכן מותאם במיוחד להבנת הערות קליניות ודוחות רופאים11. (3) BlueBERT הוא מודל NLP ביומדיצי נוסף, מאומן על מערכי נתונים של PubMed ו-MIMIC-III, והוא מותאם לזיהוי דברים רפואיים בטקסט12. (4) PubMedBERT הוא מודל טרנספורמר שאומן רק על נתוני PubMed, מה שעוזר לו לזהות באמת את הדפוסים והמונחים הייחודיים שנמצאים בכתיבה ביו-רפואית13.
בעוד שמודלים אלו משיגים ביצועים מתקדמים ביותר במדדי BioNER, התלות שלהם במאגרי נתונים גדולים ומסומנים וכיולון מדויק מפוקח מגבילה את היכולת שלהם להסתגלות לתחומי ביו-רפואה חדשים14. יתרה מזאת, שינויים בתחום בין ספרות ביו-רפואית מדעית (למשל, תקצירי PubMed) לבין הערות קליניות (למשל, מערך נתונים i2b2 2010) פוגעים עוד יותר בביצועי מערכות BioNER מפוקחות15.
המגבלות העיקריות במחקר BioNER הנוכחי כוללות: תלות בנתונים מוערים: מודלים קיימים מבוססי טרנספורמרים דורשים מערכי נתונים מסומנים נרחבים, הנדירות בתחומים ביו-רפואיים מיוחדים16. היעדר הכללה לישויות בלתי נראות: מודלים נוכחיים מתקשים לזהות מונחים ביו-רפואיים נדירים או חדשים שאינם קיימים בנתוני ההכשרה17. חקירה מוגבלת של למידה ב-Few-Shot ו-Zero-Shot: רוב המחקר מתמקד בלמידה מפוקחת מלאה, עם חקירה מינימלית של פרדיגמות דלות נתונים עבור BioNER18. התאמה לא יעילה של מודלים גדולים גדולים: למרות שמודלים כמו GPT-4 ו-LLaMA מראים ביצועים חזקים ב-zero shot ב-NLP כללי, היישום שלהם ל-NER ביו-רפואי עדיין לא נחקר בשל מורכבות טרמינולוגית והיעדר הנחיות ספציפיותלתחום 19.
כדי להתמודד עם פערים אלו, מחקר זה בוחן את שאלות המחקר המרכזיות הבאות: כיצד למידה מועטה יכולה לשפר את ביצועי BioBERT ב-NER ביו-רפואי עם נתונים מתויגים מינימליים? האם הסקת זילום אפס באמצעות LLMs יכולה לזהות במדויק ישויות ביו-רפואיות ללא כיוונון מדויק לתחום? כיצד למידה מבוססת הנחיה יכולה לשפר ביצועים ללא פגיעה במשימות NER ביו-רפואיות? מהי הגישה ההיברידית האופטימלית המשלבת BioBERT ותוויות פסאודו-שנוצרות על ידי LLM לשיפור BioNER בסביבות דלות משאבים? כיצד הכשרה יריבה משפיעה על החוסן של מודלים של BioNER עם יריות מועטות ודגמי BioNER ללא יריות?
מטרת מחקר זה היא לפתח מסגרת חדשנית ואדפטיבית ל-NER ביו-רפואי, המנצלת למידה ב-מעט הזדמנויות ואפס כדי להתמודד עם האתגרים שמציבים המחסור בנתונים מסומנים. מטרת המחקר היא לשפר את יכולות ההכללה של BioBERT ו-LLMs על ידי חקר טכניקות הנדסיות מיידיות, למידה ניגודית והכשרה יריבית.
המחקר בנוי סביב המטרות הבאות: (1) פיתוח צינור למידה קצר ל-NER ביו-רפואי על ידי כיוונון מדויק של BioBERT על נתונים מוגבלים עם הערות. (2) הערכת מודלים גדולים ללא יריות (למשל, GPT-4, LLaMA, Falcon) עבור NER ביו-רפואי באמצעות הנדסת הנחיות ספציפית לתחום. (3) יצירת גישה היברידית המשלבת כיולון BioBERT עם תוויות פסאודו-שנוצרות על ידי LLM לשיפור זיהוי הישויות במאגרי נתונים ביו-רפואיים דלי משאבים. (4) ביצוע ניתוח השוואתי של יריות מעטות לעומת יריות מעטות למידה ללא הזדמנות באמצעות מדדים ביו-רפואיים סטנדרטיים (MedMentions, BC5CDR, i2b2 2010, PharmaCoNER, BioASQ). (5) יישום הכשרה עוינת (FGSM, PGD) לשיפור עמידות המודל מול וריאציות טקסט ביומדיקליות רועשות.
מחקר זה תורם לתחום ה-NLP הביו-רפואי וזיהוי הישויות על ידי הצגת אסטרטגיות BioNER ל-low-shot ו-zero-shot כדי להתמודד עם מחסור בתוויות במאגרי נתונים ביו-רפואיים ומדגים כיצד ניתן לנצל מודלים גדולים גדולים ל-NER ביו-רפואי ללא יריות באמצעות הנדסת פרומפט אופטימלית. הצעת מסגרת היברידית המשלבת כיוונון מדויק של BioBERT והערות סינתטיות שנוצרו על ידי LLM להכללה טובה יותר. הערכת השפעת ההכשרה היריבה על מודלי BioNER לשיפור החוסן מול שינויים בתחום. מספק מדד השוואתי לביצועי BioNER בפרדיגמות מפוקחות, מועטות וללא פגיעות אפס.
סקר ספרות
סיברג'קומאר וואנג20 פיתחו את HealthPrompt, מסגרת למידה ללא זריקה (ZSL) ל-NLP קליני, המתמודדת עם המחסור במאגרי נתונים קליניים עם הערות. במקום לכוונן מודל שפה מאומן מראש (PLM), הם השתמשו בלמידה מבוססת הנחיות, שבה הגדרות המשימות מכוונות באמצעות תבניות מובנות. הערכת שישה PLMs, כולל BioBERT ו-ClinicalBERT, במאגר הנתונים MIMIC-III הראתה כי ClinicalBERT השיג את הדיוק הטוב ביותר (85%) ואת ציון F1 (86%) בסיווג טקסטים קליניים. מחקר זה מראה שלמידה מבוססת פרומפט (ZSL) יכולה לעמוד בקצב של מודלים מפוקחים בעיבוד שפה טבעית קלינית (NLP), מבלי לדרוש נתוני הדרכה.
כמינג לו וצוות21 פיתחו את BIODLM, גישה חדשה לכוונון מודלים לשונית מובחנים (DLMs) לתחום הביו-רפואי באמצעות הכשרה מתמשכת מבוססת השראה. המטרה העיקרית שלהם הייתה לשפר את הביצועים הן במשימות עם יריות מועטות והן במשימות ללא פגיעות בביו-רפואה באמצעות כיוונון חכם של פרומפט ושיטת זיהוי אסימונים מוחלפים (RTD). כדי שזה יעבוד, הם משחקים עם אוצר המילים, מערבבים בכוונה מונחים ספציפיים לתחום העבודה, ומשתמשים ב-PubMedBERT כמחולל במהלך ההכשרה המוקדמת. התוצאות מוצקות: BIODLM למעשה עבר את הכיוונון הרגיל מבוסס CLS, עם דיוק ממוצע מאקרו של 50.2% עם פיקוח מלא ו-43.4% במצב אפס יריות.
זונגהאי יאו ועמיתיו בן22 נקטו בגישה שונה, תוך התמקדות ביצירת פרומפטים שמתחשבים בשונות הקשר. המטרה שלהם הייתה להפחית את ההטיות המוזרות שיכולות להיווצר במהלך בדיקה מבוססת מהירות, ולהפוך את הערכת BioLAMA לשקופה וניתנת לפרשנות יותר. במילים אחרות, הם מנסים לוודא שמודלי השפה האלה נותנים לנו תשובות הגיוניות ולא רק תופסים הנחיות מנוסחות בצורה חכמה.
הם הציגו מדד הערכה מבוסס שינוי דרגה (UCM: הבנה–בלבול–הבנה לא נכונה) במקום דיוק מסורתי של Top-k להערכת PLMs על זיהוי ישויות ביו-רפואיות. ניסויים על 12 PLMs, כולל BioBERT, ClinicalBERT ומודלים מבוססי RoBERTa, הראו שיפור בביצועי BioLAMA עבור יחסי N-M גדולים וישויות ביו-רפואיות נדירות. BioBERT השיג Accuracy@1 של 40.7% ויכולת הבנה של UCM של 32.8%, שעלה על מדדי Top-k המסורתיים.
Yeh ואחרים, 23 , חקרו הנעה להפקת קשרים ביו-רפואיים באמצעות מערך הנתונים ChemProt לשיפור כיונון נתונים מדויק ומדויק של נתונים מלאים. הם עיצבו תבניות מבוססות הנחיה שמשלבות מדדי ניקוד כמו תדירות, ספציפיות ודמיון כדי לייעל בחירת מילים לתווית. באמצעות בסיס BioMed-RoBERTa, השיטה שלהם השיגה ציון F1 של 90.09, כשהיא עולה על SciFive-Large ב-1.14 F1 ועקפה את הכיול הרגיל ב-14.21 F1. דבר זה מאשר שלמידה מבוססת הנחיה משפרת את ביצועי ה-NER הביו-רפואיים עם פחות דוגמאות הדרכה.
סוסנטי והולסמואל 24 חקרו אימות מבוסס NLP של גרפים סיבתיים, והשוו מודלים לשוניים מכוונים לבין מודלים מבוססי השראה. הם אימנו מודלים של BioBERT ו-GPT לסיווג יחס סיבתי מפוקח והעריכו מודלים מבוססי זיכרון אפס ומעט שמות מבוססי הנחיות. תוצאות על מאגרי נתונים ביו-רפואיים ופתוחים חשפו כי מודלים מכוונים במדויק עקפו את ההנחיות של LLM, והשיגו ציוני F1 גבוהים עד 20.5%. המחקר מדגיש את הצורך בהנחיה מתקדמת ובכוונון ספציפי למאגרי נתונים כדי לשפר את דיוק חילוץ הקשר הסיבתי.
צ'ן ואחרים.25 הציעו מסגרת למידת יצירת מופעים מונחית ידע ולמידת השוואה-השראתית עבור BioNER מועט הזדמנויות. הגישה שלהם משתמשת בגרפי ידע בתחום ליצירת ישויות ביו-רפואיות מגוונות ומשתמשת בלמידה הנגדית מבוססת שאלה-שאלה, כדי לשפר את זיהוי הישויות על ידי מדידת מידע הדדי בין זוגות שאלה–תשובה. המודל שלהם הוערך על פי מערכי נתונים של fbenchmark (NCBI, BC5CDR-Disease, BioNLP11EPI, BioNLP13GE), והשיג שיפור של עד 7.1% בציון F1 לעומת מודלים מתקדמים בתרחישי 20 זריקות. הקוד שלהם זמין לציבור בכתובת: https://github.com/cpmss521/KGPC.
צ'ן ואחרים, 26, הציעו גם גישת למידת דחיפה לזיהוי תביעות ביו-רפואיות על ידי הפיכת סיווג טקסט למשימת מידול שפה מוסתר (MLM). באמצעות BERT, RoBERTa ו-T5 עם תבניות קשות ומעורבות, הם שיפרו את דיוק חיזוי הטענות. במאגר הנתונים של BioClaim, מודל T5 שלהם עם תבניות מעורבות השיג שיפור של 5.3% בציון F1 לעומת מודלים קודמים, וטיפל בפער בין קדם-אימון לכיוון מדויק ב-PLMs באמצעות חיזוי טוקנים מוסתרים.
ריאן שיאה יינג קונג טאן ואח' העריכו מודלים גדולים להסקת תגובת מחלות סרטן מדוחות רדיולוגיה באמצעות מודלים של טרנספורמר, Bi-LSTM, CNN ולמידת מכונה קלאסית. השיטה שלהם כללה הרחבת נתונים (החלפות משפט ואובדן עקביות) וכוונון עדין מבוסס הנחיות. שנאי GatorTron השיג את הדיוק הטוב ביותר: 0.8916 בערכת הבדיקה ו-0.8976 לאחר שדרוג. כיוונון מדויק מבוסס הנחיה אפשר ביצועים יעילים עם רק 500 דוחות מסומנים.
הו ואח' העריכו את GPT-3.5 ו-GPT-4 ל-NER קליני, ושיפרו ביצועים באמצעות מסגרת הנחיות בת ארבעה חלקים: הנחיות בסיסיות, הנחיות מבוססות הנחיות, הוראות מבוססות שגיאות ודגימות עם כמה זריקות. במערכי הנתונים של MTSamples ו-VAERS, GPT-3.5 ו-GPT-4 שיפרו את ציוני ה-F1 המרופים שלהם מ-0.634/0.804 ו-0.301/0.593 ל-0.794/0.861 ו-0.676/0.736, בהתאמה. למרות שעדיין מאחור ב-BioClinicalBERT (F1: 0.901 ב-MTSamples, 0.802 ב-VAERS), תוצאות אלו מראות את היעילות הגוברת של LLMs ב-NER קליני עם אסטרטגיות הנעה נכונות.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
1. הליך


2. מבנה סביבתי
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
הערכת מודל זיהוי ישויות בשם ביומדיקלי (NER) בוצעה על בסיס מאגר נתונים ביו-רפואי מגוון שמקורו בתקצירים של PubMed, הערות קליניות וקורפוסי שאלות ביו-רפואיות. בוצע ניתוח ביצועים השוואתי מול מודלים מבוססים, כולל BioBERT, ClinicalBERT, RoBERTa, PhenoBERT29, GPT-3.5 ו-GPT-4. המודל המוצע השיג דיוק כולל עליון של 89.8%, עם דיוק של 88.7%, זיכרון של 90.5%, וציון F1 של 0.895. ביצועים אלו מייצגים עלייה משמעותית לעומת ClinicalBERT (דיוק של 85.0%, 0.86 F1) ו-GPT-4 (דיוק 86.1%, 0....
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
תוצאות סותרות, ממצאים בלתי צפויים והסתירות עם מחקרים אחרים
למרות הביצועים המעולים של המודל המוצע, הופיעו תוצאות סותרות מסוימות בהשוואה למחקרים קיימים. מודלים מבוססי BioBERT הראו באופן מסורתי ביצועים חזקים בזיהוי ישות ביו-רפואית בשם (NER), כפי שדווח בסקרים קודמים ובמחקרים השוואתיים של מערכות NER ביו-רפואיות 4,10. בעוד שארכיטקטורות מבוססות טרנספורמרים משיגות דיוק גבוה במשימות NLP רפואי
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
למחברים אין מה לחשוף.
| שם | חברה | מספר קטלוג | הערות |
|---|---|---|---|
| מודל הליבה | BioBERT-base (v1.1) | פנים חיבוק: מונולוג/ביוברט-v1.1 | |
| מסגרת למידה עמוקה | PyTorch 2.3.1 | https://pytorch.org/ | |
| חומרת GPU | NVIDIA A100 (40GB VRAM) | NVIDIA | |
| מודל שפה גדול (LLM) | GPT-4 | OpenAI API | |
| מערכת הפעלה | חלונות | מיקרוסופט | |
| כיוון יעיל בפרמטרים | LoRA (דרך ספריית PEFT 0.6.2) | https://github.com/huggingface/peft | |
| שפת תכנות | פייתון 3.9.18 | קרן התוכנה של פייתון | |
| LLM קו בסיס לאפס | GPT-3.5-טורבו | OpenAI API |
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה
בקש הרשאה