מאמר מחקר

זיהוי ישות בשם ביו-רפואי עם מעט יריות ואפס יריות: הליך לשיפור BioBERT באמצעות למידה מבוססת השראה ומודלים לשוניים גדולים

DOI:

10.3791/69390

31 במרץ 2026

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מאמר זה מציג פרוטוקול לזיהוי ישויות בשם ביו-רפואי באמצעות BioBERT, למידה מבוססת הנחיות, ומודלים לשוניים גדולים לתרחישים בעלי משאבים דלים.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

זיהוי ישויות בשם ביו-רפואי (NER) ממלא תפקיד מרכזי בהפקת מידע יקר ערך מטקסטים קליניים וספרות ביו-רפואית. מודלים מסורתיים של למידה עמוקה, כולל BioBERT, ClinicalBERT ו-RoBERTa, הראו שיפורים משמעותיים במשימות NER; עם זאת, הם עדיין מתקשים עם מונחים ביומדיים דלי משאבים, אתגרי התאמת תחום, והכללה של ישויות בלתי נראות. כדי להתמודד עם מגבלות אלו, מחקר זה מציג מסגרת היברידית המשלבת BioBERT, למידה מבוססת השראה ומודלים לשוניים גדולים (LLMs) כדי לשפר את יכולות הלמידה ב-lu-shot ו-zero-shot ב-NER. המודל המוצע מנצל ביעילות ידע הקשרי משנאים מאומנים מראש, ומפחית את התלות במאגרי נתונים מתויגים נרחבים תוך שמירה על דיוק גבוה. לאחר הערכה ניסויית מקיפה על פני מספר מאגרי מדד ביו-רפואיים, הגישה המוצעת מראה ביצועים חזקים בעקביות. במיוחד, הוא משיג דיוק של 89.8%, דיוק של 88.7%, שחזור של 90.5% וציון F1 של 0.895, מה שמעלה על שיטות בסיס ומדגים את יעילותו במשימות כריית טקסט ביו-רפואיות. בהשוואה לשיטות אחרות, הנדסת פרומפט מסייעת למודל להסתגל הרבה יותר טוב לשפה הייחודית של טקסטים ביו-רפואיים. בנוסף, בוסטינג עם מודל שפה גדול (LLM) מעניק שיפור משמעותי לביצועי NER על ידי זיהוי פרטים סמנטיים ודקדוקיים מורכבים. ממצאים אלו מדגימים את היעילות של למידה מועטה ו-zero-shot בכריית טקסטים ביו-רפואיים, וסוללים את הדרך לניתוח נתונים קליניים אוטומטי טוב יותר ולמערכות תמיכה בהחלטות חכמות יותר.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ההתפוצצות של ספרות ביו-רפואית, רשומות בריאות אלקטרוניות (EHRs) ונתוני ניסויים קליניים באמת זקוקה למערכות חכמות וחזקות לזיהוי ישויות ביו-רפואיות (BioNER). BioNER היא משימה מיוחדת בעיבוד שפה טבעית (NLP) שמטרתה לזהות ישויות כגון מחלות, גנים, חלבונים, תרופות וכימיקלים בטקסט ביו-רפואי לא מובנה1. היכולת לזהות את הגורמים האלה בצורה מדויקת היא מאוד חשובה למגוון שימושים אחרים, כמו כריית ידע ביו-רפואי, מציאת תרופות חדשות, תמיכה ברופאים בהחלטות קליניות, או אפילו מיון אוטומטי של ערימות של מאמרי מחקר2.

למרות שהושגו התקדמויות משמעותיות במודלים מבוססי למידה עמוקה — כגון BioBERT, ClinicalBERT ו-BlueBERT — רוב הגישות הקיימות לזיהוי ישויות ביו-רפואיות מפוקחות (BioNER) ממשיכות להסתמך במידה רבה על מערכי נתונים מוערים בקנה מידה גדול. תלות חזקה זו בנתונים מתויגים נרחבים מגבילה את יכולת ההכללה שלהם כאשר הם מיושמים על טקסטים ביו-רפואיים חדשים או שלא נראו קודם3. המודלים הקלאסיים של BioNER צריכים המון נתונים עם הערות רק כדי לכוונן אותם, וזה הופך לכאב ראש אמיתי באזורים שבהם אין מספיק נתונים, כמו מחלות נדירות, פרמקוגנומיקה או מחקר ביו-רפואי שפורסם בשפות אחרותמלבד אנגלית. מעבר לכך, תיוג ידני של כל הטקסט הביו-רפואי הזה הוא איטי, יקר, ובדרך כלל דורש מומחים אמיתיים בתחום5. לכן פיתוח מודלים של BioNER עם יריות מועטות וללא יריות הוא כל כך חשוב: זה יכול להפחית משמעותית את הצורך בנתונים מתויגים תוך הבטחת עבודה טובה של מודלים במגוון רחב של תוכן ביו-רפואי6.

למידה קצרה (FSL) מאפשרת למודלים להשיג ביצועי זיהוי ישויות תחרותיים תוך שימוש רק בחלק קטן מהנתונים המסומנים, בדרך כלל בין 1% ל-10% ממערך הנתונים המלא של ההדרכה, מה שהופך אותה לבעלת ערך מיוחד עבור תחומים ביו-רפואיים דלי משאבים7. Zero-shot Learning (ZSL) הולכת אפילו רחוק יותר, ומאפשרת למודל לזהות ישויות שמעולם לא ראה קודם, רק על ידי שימוש בכוח של מודלים גדולים ומאומנים מראש (LLMs), בליצורך בנתוני אימון נוספים. לאחרונה, התקדמות במודלים גדולים כמו GPT-4, LLaMA ו-Falcon הראתה ביצועים חזקים ב-zero shot במשימות כלליות של NER, אך השימוש בהם בטקסטים ביו-רפואיים אמיתיים נותר ברובו לא מוכר. זה כי השפה בביו-רפואה כל כך מיוחדתומורכבת.

מחקר זה שואף לצמצם את הפער הזה על ידי שילוב כיוונון מדויק של BioBERT, למידה מועטה, הסקת LLM ללא הזדמנות ולמידה מבוססת השראה, הכל במטרה להעלות את הרף ל-BioNER בסביבות ביו-רפואיות דלות משאבים.

כדי לתת מושג למה שכבר קיים: (1) BioBERT היא גרסה של BERT שעברה הכשרה מחדש על תקצירי PubMed ומאמרים בטקסט מלא, ולכן היא מתאימה יותר לתוכן ביו-רפואי10. (2) ClinicalBERT הוא וריאנט BERT המאומן על EHR, ולכן מותאם במיוחד להבנת הערות קליניות ודוחות רופאים11. (3) BlueBERT הוא מודל NLP ביומדיצי נוסף, מאומן על מערכי נתונים של PubMed ו-MIMIC-III, והוא מותאם לזיהוי דברים רפואיים בטקסט12. (4) PubMedBERT הוא מודל טרנספורמר שאומן רק על נתוני PubMed, מה שעוזר לו לזהות באמת את הדפוסים והמונחים הייחודיים שנמצאים בכתיבה ביו-רפואית13.

בעוד שמודלים אלו משיגים ביצועים מתקדמים ביותר במדדי BioNER, התלות שלהם במאגרי נתונים גדולים ומסומנים וכיולון מדויק מפוקח מגבילה את היכולת שלהם להסתגלות לתחומי ביו-רפואה חדשים14. יתרה מזאת, שינויים בתחום בין ספרות ביו-רפואית מדעית (למשל, תקצירי PubMed) לבין הערות קליניות (למשל, מערך נתונים i2b2 2010) פוגעים עוד יותר בביצועי מערכות BioNER מפוקחות15.

המגבלות העיקריות במחקר BioNER הנוכחי כוללות: תלות בנתונים מוערים: מודלים קיימים מבוססי טרנספורמרים דורשים מערכי נתונים מסומנים נרחבים, הנדירות בתחומים ביו-רפואיים מיוחדים16. היעדר הכללה לישויות בלתי נראות: מודלים נוכחיים מתקשים לזהות מונחים ביו-רפואיים נדירים או חדשים שאינם קיימים בנתוני ההכשרה17. חקירה מוגבלת של למידה ב-Few-Shot ו-Zero-Shot: רוב המחקר מתמקד בלמידה מפוקחת מלאה, עם חקירה מינימלית של פרדיגמות דלות נתונים עבור BioNER18. התאמה לא יעילה של מודלים גדולים גדולים: למרות שמודלים כמו GPT-4 ו-LLaMA מראים ביצועים חזקים ב-zero shot ב-NLP כללי, היישום שלהם ל-NER ביו-רפואי עדיין לא נחקר בשל מורכבות טרמינולוגית והיעדר הנחיות ספציפיותלתחום 19.

כדי להתמודד עם פערים אלו, מחקר זה בוחן את שאלות המחקר המרכזיות הבאות: כיצד למידה מועטה יכולה לשפר את ביצועי BioBERT ב-NER ביו-רפואי עם נתונים מתויגים מינימליים? האם הסקת זילום אפס באמצעות LLMs יכולה לזהות במדויק ישויות ביו-רפואיות ללא כיוונון מדויק לתחום? כיצד למידה מבוססת הנחיה יכולה לשפר ביצועים ללא פגיעה במשימות NER ביו-רפואיות? מהי הגישה ההיברידית האופטימלית המשלבת BioBERT ותוויות פסאודו-שנוצרות על ידי LLM לשיפור BioNER בסביבות דלות משאבים? כיצד הכשרה יריבה משפיעה על החוסן של מודלים של BioNER עם יריות מועטות ודגמי BioNER ללא יריות?

מטרת מחקר זה היא לפתח מסגרת חדשנית ואדפטיבית ל-NER ביו-רפואי, המנצלת למידה ב-מעט הזדמנויות ואפס כדי להתמודד עם האתגרים שמציבים המחסור בנתונים מסומנים. מטרת המחקר היא לשפר את יכולות ההכללה של BioBERT ו-LLMs על ידי חקר טכניקות הנדסיות מיידיות, למידה ניגודית והכשרה יריבית.

המחקר בנוי סביב המטרות הבאות: (1) פיתוח צינור למידה קצר ל-NER ביו-רפואי על ידי כיוונון מדויק של BioBERT על נתונים מוגבלים עם הערות. (2) הערכת מודלים גדולים ללא יריות (למשל, GPT-4, LLaMA, Falcon) עבור NER ביו-רפואי באמצעות הנדסת הנחיות ספציפית לתחום. (3) יצירת גישה היברידית המשלבת כיולון BioBERT עם תוויות פסאודו-שנוצרות על ידי LLM לשיפור זיהוי הישויות במאגרי נתונים ביו-רפואיים דלי משאבים. (4) ביצוע ניתוח השוואתי של יריות מעטות לעומת יריות מעטות למידה ללא הזדמנות באמצעות מדדים ביו-רפואיים סטנדרטיים (MedMentions, BC5CDR, i2b2 2010, PharmaCoNER, BioASQ). (5) יישום הכשרה עוינת (FGSM, PGD) לשיפור עמידות המודל מול וריאציות טקסט ביומדיקליות רועשות.

מחקר זה תורם לתחום ה-NLP הביו-רפואי וזיהוי הישויות על ידי הצגת אסטרטגיות BioNER ל-low-shot ו-zero-shot כדי להתמודד עם מחסור בתוויות במאגרי נתונים ביו-רפואיים ומדגים כיצד ניתן לנצל מודלים גדולים גדולים ל-NER ביו-רפואי ללא יריות באמצעות הנדסת פרומפט אופטימלית. הצעת מסגרת היברידית המשלבת כיוונון מדויק של BioBERT והערות סינתטיות שנוצרו על ידי LLM להכללה טובה יותר. הערכת השפעת ההכשרה היריבה על מודלי BioNER לשיפור החוסן מול שינויים בתחום. מספק מדד השוואתי לביצועי BioNER בפרדיגמות מפוקחות, מועטות וללא פגיעות אפס.

סקר ספרות
סיברג'קומאר וואנג20 פיתחו את HealthPrompt, מסגרת למידה ללא זריקה (ZSL) ל-NLP קליני, המתמודדת עם המחסור במאגרי נתונים קליניים עם הערות. במקום לכוונן מודל שפה מאומן מראש (PLM), הם השתמשו בלמידה מבוססת הנחיות, שבה הגדרות המשימות מכוונות באמצעות תבניות מובנות. הערכת שישה PLMs, כולל BioBERT ו-ClinicalBERT, במאגר הנתונים MIMIC-III הראתה כי ClinicalBERT השיג את הדיוק הטוב ביותר (85%) ואת ציון F1 (86%) בסיווג טקסטים קליניים. מחקר זה מראה שלמידה מבוססת פרומפט (ZSL) יכולה לעמוד בקצב של מודלים מפוקחים בעיבוד שפה טבעית קלינית (NLP), מבלי לדרוש נתוני הדרכה.

כמינג לו וצוות21 פיתחו את BIODLM, גישה חדשה לכוונון מודלים לשונית מובחנים (DLMs) לתחום הביו-רפואי באמצעות הכשרה מתמשכת מבוססת השראה. המטרה העיקרית שלהם הייתה לשפר את הביצועים הן במשימות עם יריות מועטות והן במשימות ללא פגיעות בביו-רפואה באמצעות כיוונון חכם של פרומפט ושיטת זיהוי אסימונים מוחלפים (RTD). כדי שזה יעבוד, הם משחקים עם אוצר המילים, מערבבים בכוונה מונחים ספציפיים לתחום העבודה, ומשתמשים ב-PubMedBERT כמחולל במהלך ההכשרה המוקדמת. התוצאות מוצקות: BIODLM למעשה עבר את הכיוונון הרגיל מבוסס CLS, עם דיוק ממוצע מאקרו של 50.2% עם פיקוח מלא ו-43.4% במצב אפס יריות.

זונגהאי יאו ועמיתיו בן22 נקטו בגישה שונה, תוך התמקדות ביצירת פרומפטים שמתחשבים בשונות הקשר. המטרה שלהם הייתה להפחית את ההטיות המוזרות שיכולות להיווצר במהלך בדיקה מבוססת מהירות, ולהפוך את הערכת BioLAMA לשקופה וניתנת לפרשנות יותר. במילים אחרות, הם מנסים לוודא שמודלי השפה האלה נותנים לנו תשובות הגיוניות ולא רק תופסים הנחיות מנוסחות בצורה חכמה.

הם הציגו מדד הערכה מבוסס שינוי דרגה (UCM: הבנה–בלבול–הבנה לא נכונה) במקום דיוק מסורתי של Top-k להערכת PLMs על זיהוי ישויות ביו-רפואיות. ניסויים על 12 PLMs, כולל BioBERT, ClinicalBERT ומודלים מבוססי RoBERTa, הראו שיפור בביצועי BioLAMA עבור יחסי N-M גדולים וישויות ביו-רפואיות נדירות. BioBERT השיג Accuracy@1 של 40.7% ויכולת הבנה של UCM של 32.8%, שעלה על מדדי Top-k המסורתיים.

Yeh ואחרים, 23 , חקרו הנעה להפקת קשרים ביו-רפואיים באמצעות מערך הנתונים ChemProt לשיפור כיונון נתונים מדויק ומדויק של נתונים מלאים. הם עיצבו תבניות מבוססות הנחיה שמשלבות מדדי ניקוד כמו תדירות, ספציפיות ודמיון כדי לייעל בחירת מילים לתווית. באמצעות בסיס BioMed-RoBERTa, השיטה שלהם השיגה ציון F1 של 90.09, כשהיא עולה על SciFive-Large ב-1.14 F1 ועקפה את הכיול הרגיל ב-14.21 F1. דבר זה מאשר שלמידה מבוססת הנחיה משפרת את ביצועי ה-NER הביו-רפואיים עם פחות דוגמאות הדרכה.

סוסנטי והולסמואל 24 חקרו אימות מבוסס NLP של גרפים סיבתיים, והשוו מודלים לשוניים מכוונים לבין מודלים מבוססי השראה. הם אימנו מודלים של BioBERT ו-GPT לסיווג יחס סיבתי מפוקח והעריכו מודלים מבוססי זיכרון אפס ומעט שמות מבוססי הנחיות. תוצאות על מאגרי נתונים ביו-רפואיים ופתוחים חשפו כי מודלים מכוונים במדויק עקפו את ההנחיות של LLM, והשיגו ציוני F1 גבוהים עד 20.5%. המחקר מדגיש את הצורך בהנחיה מתקדמת ובכוונון ספציפי למאגרי נתונים כדי לשפר את דיוק חילוץ הקשר הסיבתי.

צ'ן ואחרים.25 הציעו מסגרת למידת יצירת מופעים מונחית ידע ולמידת השוואה-השראתית עבור BioNER מועט הזדמנויות. הגישה שלהם משתמשת בגרפי ידע בתחום ליצירת ישויות ביו-רפואיות מגוונות ומשתמשת בלמידה הנגדית מבוססת שאלה-שאלה, כדי לשפר את זיהוי הישויות על ידי מדידת מידע הדדי בין זוגות שאלה–תשובה. המודל שלהם הוערך על פי מערכי נתונים של fbenchmark (NCBI, BC5CDR-Disease, BioNLP11EPI, BioNLP13GE), והשיג שיפור של עד 7.1% בציון F1 לעומת מודלים מתקדמים בתרחישי 20 זריקות. הקוד שלהם זמין לציבור בכתובת: https://github.com/cpmss521/KGPC.

צ'ן ואחרים, 26, הציעו גם גישת למידת דחיפה לזיהוי תביעות ביו-רפואיות על ידי הפיכת סיווג טקסט למשימת מידול שפה מוסתר (MLM). באמצעות BERT, RoBERTa ו-T5 עם תבניות קשות ומעורבות, הם שיפרו את דיוק חיזוי הטענות. במאגר הנתונים של BioClaim, מודל T5 שלהם עם תבניות מעורבות השיג שיפור של 5.3% בציון F1 לעומת מודלים קודמים, וטיפל בפער בין קדם-אימון לכיוון מדויק ב-PLMs באמצעות חיזוי טוקנים מוסתרים.

ריאן שיאה יינג קונג טאן ואח' העריכו מודלים גדולים להסקת תגובת מחלות סרטן מדוחות רדיולוגיה באמצעות מודלים של טרנספורמר, Bi-LSTM, CNN ולמידת מכונה קלאסית. השיטה שלהם כללה הרחבת נתונים (החלפות משפט ואובדן עקביות) וכוונון עדין מבוסס הנחיות. שנאי GatorTron השיג את הדיוק הטוב ביותר: 0.8916 בערכת הבדיקה ו-0.8976 לאחר שדרוג. כיוונון מדויק מבוסס הנחיה אפשר ביצועים יעילים עם רק 500 דוחות מסומנים.

הו ואח' העריכו את GPT-3.5 ו-GPT-4 ל-NER קליני, ושיפרו ביצועים באמצעות מסגרת הנחיות בת ארבעה חלקים: הנחיות בסיסיות, הנחיות מבוססות הנחיות, הוראות מבוססות שגיאות ודגימות עם כמה זריקות. במערכי הנתונים של MTSamples ו-VAERS, GPT-3.5 ו-GPT-4 שיפרו את ציוני ה-F1 המרופים שלהם מ-0.634/0.804 ו-0.301/0.593 ל-0.794/0.861 ו-0.676/0.736, בהתאמה. למרות שעדיין מאחור ב-BioClinicalBERT (F1: 0.901 ב-MTSamples, 0.802 ב-VAERS), תוצאות אלו מראות את היעילות הגוברת של LLMs ב-NER קליני עם אסטרטגיות הנעה נכונות.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. הליך

  1. עיבוד נתונים מראש וכוונון עדין של מודלים
    הנתונים עובדו מראש מ-PubMed, BioASQ, MedQA ו-MMLU באמצעות נרמול טקסט, טוקניזציה (WordPiece/BPE), הסרת מילות עצור והערות IOB. ביצעו כיוונון עדין ספציפי לתחום של BioBERT באמצעות מודל שפה במסכה (MLM) וראש סיווג טוקנים. בהשוואה לשיטות מבוססות מתאם כמו LoRA.
  2. יישום למידה מבוססת הנחיות: למידה מעט-ירייה ואפס-זריקה
    ללמידה ללא יריות: השתמשו במודלים גדולים גדולים (GPT-4, GPT-3.5, T5) עם הנחיות שפה טבעית (למשל, "חילוץ ישויות ביו-רפואיות מהטקסט הבא: [הזנת משפט]. הישויות שיש לזהות הן מחלות, תרופות, גנים וכימיקלים. רשום כל ישות ואת סוגה.") וכיוונון הוראות. השתמשתי ב-5–20 דוגמאות מסומנות לכל סוג ישות עם אימון ניצול דפוסים (PET) וכוונון קידומות.
  3. שילוב מודלים גדולים גדולים והקמת מסגרת היברידית
    בוצעו מיזוג הקשרי (Contextual Embeddings) וחיזוי NER רב-שלבי (זיהוי BioBERT + שיפור GPT-4). מסגרת זו השתמשה בגישת כיוונון עדין דו-שלבי, סדרתית (לא מקצה לקצה) לניהול מורכבות חישובית. ראשית, BioBERT עברה התאמה מדויקת לנתוני הזמנים המעטים הזמינים. שנית, מודל BioBERT הקפוא הזה שולב עם רכיב ה-LLM דרך שכבת ההיתוך, שאומנה על אותם נתונים. לכן, הוא שולב באמצעות אסטרטגיית כיוונון עדין דו-שלבית:
    שלב 1 – כיוונון BioBERT מפוקח עבור NER.
    שלב 2 – התאמה מבוססת הנחיה באמצעות פלטי GPT-4.
    figure-protocol-1
    כאשר α הוא מקדם נלמד, ו-Wp היא מטריצת ההקרנה.
    הצבעה קבוצתית משוקללת (WBioBERT=0.45, WGPT4=0.35, WClinicalBERT=0.20) יושמה על תחזיות המיזוג.
    המשקלים לכל מודל (W_BioBERT=0.45, W_Hybrid=0.35, W_ClinicalBERT=0.20) אופטימליים על מערך אימות שהוחזק באמצעות חיפוש רשת כדי למקסם את ציון המיקרו-F1. שיטת המשקל הזו משקפת את התרומה היחסית של כל מודל: BioBERT המכוון מספק את האות החזק ביותר הספציפי לתחום, המודל ההיברידי מוסיף הכללה, ו-ClinicalBERT מציע הקשר קליני משלים.
  4. יישום קישור לשיפור ואונטולוגיה
    GPT-4 שימש לשיפור מונחה אונטולוגיה, וקיבל תיקונים כאשר הדמיון בקוסינוס להטמעות-אונטולוגיה היה ≥-0.8 (רק תיקונים עם > 0.8 כבר מוזכרים). הישויות קושרו למסדי נתונים UMLS, MeSH ו-HPO לצורך פתרון מילים נרדפות.
  5. פריסת המערכת עם הסקה אופטימלית
    סף הביטחון האדפטיבי יושם לכל מחלקת ישות: TCC + βσC (β=0.5).
    מרכיב מרכזי בצינור ההסקה הוא סף הביטחון האדפטיבי, שמאזן דינמית בין דיוק לשלירה בין סוגי ישויות. במקום להשתמש בסף סטטי, המנגנון האדפטיבי חישב סף TC ספציפי למחלקה בהתבסס על התפלגות האמון האמפירית של התחזיות:
    figure-protocol-2
    כאשרμ C ו-σC מייצגים את הממוצע והסטיית תקן של ציוני הביטחון עבור כיתת ישות C, ו-β הוא גורם סקיילינג ניתן לכוונון (מוגדר אמפירית ל-0.5). סוגי ישויות ביו-רפואיות נדירות (למשל, מחלות נדירות) נוטים להציג שונות גבוהה בציוני הביטחון. הסף האדפטיבי הבטיח שהם נשמרים כאשר σC גדול, ובכך מנע סינון יתר של ישויות נדירות. לעומת זאת, עבור ישויות תכופות, הסף מתוח כדי להפחית חיוביים שגויים.
    המערכת הופעלה באמצעות ממשק מבוסס Flask עם עיבוד רב-GPU (PyTorch DDP) וכימות של 8 ביטים להסקה בזמן אמת.

2. מבנה סביבתי

  1. מאגרי נתונים
    המסגרת נבדקה על מערכי הנתונים הביו-רפואיים הסטנדרטיים של NER כדי לבצע השוואה הוגנת. מערכי הנתונים הבאים שימשו, כאשר החלוקות הרשמיות שלהם נשמרו.
    BC5CDR: לזיהוי ישויות כימיות ומחלות.
    מחלת NCBI: מתמקדת באזכורים למחלות.
    i2b2 2010: להכרה במושגים קליניים ברשומות בריאות אלקטרוניות (EHRs).
  2. הערכה
    כדי להבטיח עמידות סטטיסטית, ביצענו 5 ריצות עצמאיות לכל ניסוי של כמה יריות (K=5,10,15) עם זרעים אקראיים שונים לדגימת נתונים ואתחול משקל. הדיוק, הדיוק, הזיכרון והציון בפורמולה 1 דווחו במהלך הריצות הללו. תוצאות של אפס יריות, שהיו דטרמיניסטיות, דווחו מריצה אחת.
    כדי להעריך את ההיתכנות של פריסת מערכות NER ביו-רפואיות המוצעת בסביבות ביו-רפואיות בזמן אמת, נערך ניתוח יעילות חישובית מפורטת ופרופיל משאבים. הפרופילינג בוצע על כרטיס מסך NVIDIA A100 (40GB VRAM) עם CUDA 12.1 ו-PyTorch 2.3.1, תוך שימוש בהסקת דיוק מעורב (FP16) לאיזון מהירות ויעילות זיכרון.
  3. מודלים בסיסיים
    BioBERT (מכוון לעומק): דגם הבסיס BioBERT-v1.110עבר כוונון מדויק באופן מפוקח לחלוטין על כל נתוני האימון של כל מדד.
    ClinicalBERT & RoBERTa-base: מותאם לקווי בסיס ספציפיים לתחום וכללי.
    GPT-3.5 & GPT-4 (Zero-Shot): נבדק כפי שתואר בשלב 3.3, ללא כוונון מדויק למשימה.
    HealthPrompt20: מודל NER קליני מתקדם ומבוסס פרושטים עם אפס ירי כיום.
    למטרת שחזוריות מלאה, ספריות התוכנה המרכזיות, נקודות ביקורת המודלים ופרטי החומרה ששימשו במחקר זה מפורטים בטבלת החומרים. זה כולל גרסאות מסוימות של רכיבים מרכזיים, כגון וריאנט מודל BioBERT, LLM, מסגרת למידה עמוקה וסביבה חישובית.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

הערכת מודל זיהוי ישויות בשם ביומדיקלי (NER) בוצעה על בסיס מאגר נתונים ביו-רפואי מגוון שמקורו בתקצירים של PubMed, הערות קליניות וקורפוסי שאלות ביו-רפואיות. בוצע ניתוח ביצועים השוואתי מול מודלים מבוססים, כולל BioBERT, ClinicalBERT, RoBERTa, PhenoBERT29, GPT-3.5 ו-GPT-4. המודל המוצע השיג דיוק כולל עליון של 89.8%, עם דיוק של 88.7%, זיכרון של 90.5%, וציון F1 של 0.895. ביצועים אלו מייצגים עלייה משמעותית לעומת ClinicalBERT (דיוק של 85.0%, 0.86 F1) ו-GPT-4 (דיוק 86.1%, 0....

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

תוצאות סותרות, ממצאים בלתי צפויים והסתירות עם מחקרים אחרים
למרות הביצועים המעולים של המודל המוצע, הופיעו תוצאות סותרות מסוימות בהשוואה למחקרים קיימים. מודלים מבוססי BioBERT הראו באופן מסורתי ביצועים חזקים בזיהוי ישות ביו-רפואית בשם (NER), כפי שדווח בסקרים קודמים ובמחקרים השוואתיים של מערכות NER ביו-רפואיות 4,10. בעוד שארכיטקטורות מבוססות טרנספורמרים משיגות דיוק גבוה במשימות NLP רפואי

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

למחברים אין מה לחשוף.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
מודל הליבהBioBERT-base (v1.1)פנים חיבוק:  מונולוג/ביוברט-v1.1
מסגרת למידה עמוקהPyTorch 2.3.1https://pytorch.org/
חומרת GPUNVIDIA A100 (40GB VRAM)NVIDIA
מודל שפה גדול (LLM)GPT-4OpenAI API
מערכת הפעלהחלונותמיקרוסופט
כיוון יעיל בפרמטריםLoRA (דרך ספריית PEFT 0.6.2)https://github.com/huggingface/peft
שפת תכנותפייתון 3.9.18קרן התוכנה של פייתון
LLM קו בסיס לאפסGPT-3.5-טורבוOpenAI API

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Chen, P., Wang, J., Luo, L., Lin, H., Yang, Z. Learning to explain is a good biomedical few-shot learner. Bioinformatics. 40 (10), 589(2024).
  2. Moscato, V., Postiglione, M., Sperlí, G. Few-shot named entity recognition: definition, taxonomy and research directions. ACM Trans Intell Syst Technol. 14 (5), 1-46 (2023).
  3. Nerella, S., et al. Transformers in healthcare: A survey. arXiv. , (2023).
  4. Song, B., Li, F., Liu, Y., Zeng, X. Deep learning methods for biomedical named entity recognition: A survey and qualitative comparison. Briefings Bioinform. 22 (6), bbab282(2021).
  5. Badawi, M., Abushanab, M., Bhat, S., Maier, A. Review of zero-shot and few-shot AI algorithms in the medical domain. arXiv. , (2024).
  6. Jin, M., Sang-Min, C., Gun-Woo, K. Comcare: A collaborative ensemble framework for context-aware medical named entity recognition and relation extraction. Electronics Basel. 14 (2), 328(2025).
  7. Ge, Y., Guo, Y., Das, S., Al-Garadi, M. A., Sarker, A. Few-shot learning for medical text: a review of advances, trends, and opportunities. J Biomed Inform. 144, 104458(2023).
  8. Picco, G., et al. Description boosting for zero-shot entity and relation classification. arXiv. , (2024).
  9. Khan, W., et al. A comprehensive survey of foundation models in medicine. IEEE Rev Biomed Eng. 18, 1-25 (2025).
  10. Ngo, Q. H., Kechadi, T., Le-Khac, N. A. Domain specific entity recognition with semantic-based deep learning approach. IEEE Access. 9, 152892-152902 (2021).
  11. Li, M., Zhang, R. How far is language model from 100% few-shot named entity recognition in medical domain. arXiv. , (2023).
  12. Nerella, S., et al. Transformers and large language models in healthcare: A review. Artif Intell Med. 148, 102900(2024).
  13. Rodríguez, H. Natural language technologies in the biomedical domain. Governing Asia. 93, 1-15 (2022).
  14. Mobasher, G. Welt: Weighted loss trainer for biomedical joint entity and relation extraction. [PhD thesis]. , https://www.mathinf.uni-heidelberg.de/en/thesis-defenses/welt-weighted-loss-trainer-for-biomedical-joint-entity-and-relation-extraction-2025-01-23 (2025).
  15. Giorgi, J. A study on the application of natural language processing methods to scientific text. [PhD thesis]. , University of Toronto. Canada. https://utoronto.scholaris.ca/items/0b02984d-5b6f-4287-9461-5afde0ec6c4e (2024).
  16. Amin, S. Learning entity and relation representation for low-resource medical language processing. [PhD thesis]. , https://publikationen.sulb.uni-saarland.de/bitstream/20.500.11880/38051/1/PhD_final_Amin.pdf (2024).
  17. Almudaifer, A. I. Entity information extraction and normalization from scientific and clinical texts. [PhD thesis]. , https://digitalcommons.library.uab.edu/etd-collection/3906/ (2024).
  18. One-shot biomedical named entity recognition via knowledge-inspired large language model. Bian, J., Zheng, J., Zhang, Y., Zhou, H., Zhu, S. Proc ACM Int Conf Bioinform Comput Biol Health Inform, , 1-10 (2024).
  19. Alotaibi, A., Nadeem, F., Hamdy, M. Weakly supervised deep learning for Arabic tweet sentiment analysis on education reforms: leveraging pre-trained models and LLMs with Snorkel. IEEE Access. 13, 1-15 (2025).
  20. Sivarajkumar, S., Wang, Y. HealthPrompt: A zero-shot learning paradigm for clinical natural language processing. AMIA Annu Symp Proc. , 972-981 (2023).
  21. Prompt discriminative language models for domain adaptation. Lu, K., et al. Proc Clin Nat Lang Process Workshop, , 247-258 (2023).
  22. Yao, Z., Cao, Y., Yang, Z., Yu, H. Context variance evaluation of pretrained language models for prompt-based biomedical knowledge probing. AMIA Jt Summits Transl Sci Proc. 2023, 592-601 (2023).
  23. Yeh, H. S., Lavergne, T., Zweigenbaum, P. Decorate the examples: a simple method of prompt design for biomedical relation extraction. arXiv. , (2022).
  24. Susanti, Y., Holsmoelle, N. Prompt-based vs fine-tuned LLMs toward causal graph verification. arXiv. , (2024).
  25. Chen, P., Wang, J., Lin, H., Zhao, D., Yang, Z. Few-shot biomedical named entity recognition via knowledge-guided instance generation and prompt contrastive learning. Bioinformatics. 39 (8), 496-504 (2023).
  26. Improving biomedical claim detection using prompt learning approaches. Chen, T., Stefanidis, A., Jiang, Z., Su, J. IEEE Int Conf Pattern Recognit Mach Learn, , 369-376 (2023).
  27. Tan, R. S. Y. C., et al. Inferring cancer disease response from radiology reports using large language models with data augmentation and prompting. J Am Med Inform Assoc. 30 (10), 1657-1664 (2023).
  28. Hu, Y., et al. Improving large language models for clinical named entity recognition via prompt engineering. J Am Med Inform Assoc. 31 (9), 1812-1820 (2024).
  29. Yang, J., et al. Enhancing phenotype recognition in clinical notes using large language models: PhenoBCBERT and PhenoGPT. Patterns NY. 5 (1), 100891(2024).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

Few Shot LearningZero Shot LearningBiomedical NERDomain AdaptationPrompt Engineering

מאמרים קשורים