מאמר מחקר

פלטפורמת רשת עם יכולת פעולה הדדית המבוססת על מודלי שפה גדולים לניתוח נתונים רפואיים: פרוטוקול לתמיכה בקבלת החלטות קליניות

49 צפיות

DOI:

10.3791/72085

25 באוגוסט 2026

במאמר זה

סיכום

פרוטוקול זה מתאר את היישום של פלטפורמת אינטרנט עם יכולת פעולה הדדית המשלבת נתונים קליניים מבוססי FHIR עם יצירה מועשרת באחזור (Retrieval-Augmented Generation) ומודלי שפה גדולים מרובי-סוכנים לתמיכה בהחלטות קליניות. זרימת העבודה מאפשרת פריסה ניתנת לשחזור, אינטגרציה סטנדרטית של נתונים והערכה של ניתוח נתונים רפואיים בסיוע בינה מלאכותית (AI).

תקציר

קבלת החלטות קליניות נבלמת לעיתים קרובות על ידי רשומות בריאות אלקטרוניות מקוטעות ויכולת קישוריות (interoperability) מוגבלת בין מערכות מידע בריאותיות הטרוגניות. מאמר זה מציג פרוטוקול שלב-אחרי-שלב להטמעת פלטפורמת רשת בעלת יכולת קישוריות המשלבת נתונים קליניים באמצעות תקן Fast Healthcare Interoperability Resources (FHIR), לצד Retrieval-Augmented Generation (RAG), מודלי שפה גדולים (LLMs), ומסגרת הסקה קלינית רב-סוכנית (multi-agent) לתמיכה בניתוח נתונים רפואיים ותמיכה בקבלת החלטות קליניות. הפרוטוקול מתאר את זרימת העבודה המלאה, כולל הגדרת סביבת מחשוב, עיבוד מקדים של מערכי נתונים קליניים, אינטגרציית נתונים מבוססת FHIR, בניית בסיס נתונים וקטורי, הגדרת שליפה (retrieval), הנדסת פרומפטים, תזמור רב-סוכני והערכת המערכת. תוצאות מייצגות מדגימות את יכולתה של הפלטפורמה להפיק תגובות רלוונטיות קלינית ועקביות מבחינת ההקשר, תוך שיפור הקישוריות הסמנטית בין מקורות נתונים הטרוגניים. ביצועי המערכת הוערכו באמצעות מדדים כמותיים וסמנטיים משלימים, כולל BLEU, ROUGE, BERTScore ודמיון קוסינוס (cosine similarity). הערכה איכותית בוצעה באמצעות מערכי נתונים רפואיים של benchmark הזמינים לציבור ואנונימיים לחלוטין, כדי להעריך את השחזוריות של זרימת העבודה המתודולוגית המוצעת. הארכיטקטורה המוצעת משלבת קישוריות בריאותית סטנדרטית עם מודלי שפה משופרי-שליפה כדי לשפר הסקה הקשרית, להפחית הזיות (hallucinations) ולתמוך בתהליכי עבודה קליניים שחזירים הנעזרים ב-AI. פרוטוקול זה מספק מסגרת ניתנת להרחבה ושחזור עבור חוקרים ומפתחים השואפים להטמיע מערכות בריאות חכמות, מודעות לפרטיות ובעלות יכולת קישוריות לתמיכה בקבלת החלטות קליניות, ניתוח נתונים רפואיים ומחקר תרגומי עתידי.

מבוא

מידע בריאותי נוצר באופן שגרתי בבתי חולים, מרכזים לאבחון, מעבדות ומרפאות חוץ, ולעיתים קרובות הוא נשאר מפוזר בין מערכות מידע הטרוגניות. פרגמנטציה זו מגבילה את יכולת ההחלפה (interoperability) ומגבילה את הגישה המהירה לרשומות מטופלים מקיפות, דבר היוצר אתגרים מתמשכים בטיפול קליני, באינטגרציית נתונים ובניהול שירותי הבריאות1,2,3,4.

ההשלכות של פרגמנטציה זו הופכות לבולטות במיוחד בזרימות עבודה קליניות התלויות בגישה מהירה למידע על המטופל. כאשר אנשי מקצוע בתחום הבריאות אינם יכולים לשלוף רשומות רפואיות מלאות ואינטגרטיביות, ההערכה הקלינית הופכת לקשה יותר, מה שמעלה את הסיכון לקבלת החלטות חלקית ומפחית את יעילות מתן הטיפול, במיוחד במצבי חירום5,6.

התפתחויות אחרונות בבינה מלאכותית (AI), ובמיוחד במודלי שפה גדולים (LLMs), הרחיבו את מגוון הגישות החישוביות הזמינות ליישומים בתחום הבריאות. מודלים אלו נבחנו במשימות כגון סיוע באבחון, טריאז' קליני ותמיכה בקבלת החלטות. לדוגמה, Jahan et al.5 העריכו את השימוש ב-LLMs במשימות ביו-רפואיות, בעוד ש-Taylor et al.7 חקרו מודלים שעברו כוונון עדין (fine-tuned) לסריקת בריאות נפשית דיגיטלית, ודיווחו על תוצאות מעודדות במסגרות קליניות ייעודיות.

היישום של מודלי שפה גדולים (LLMs) התרחב גם לתחומים קליניים ייעודיים יותר. Song et al. 49 בחנו את השימוש בהם לאבחון פנוקוניוזיס (pneumoconiosis), בעוד ש-Chien et al.8 יישמו מודלים אלו כדי לנתח דפוסי עומס עבודה בקרב מטפלים לא פורמליים. ברפואת עיניים, Xue et al.9 הציעו מערכת למתן תשובות לצורך אבחון גלאוקומה, בעוד ש-Tan et al.3  ו-Wu et al.10 דיווחו על שימוש ב-LLMs במערכות אבחון היברידיות ובייעוץ של רפואה סינית מסורתית.

השימוש במודלי שפה גדולים (LLMs) אינו מוגבל ליישומים קליניים ישירים. Zhang et al.11 חקרו את יישומם לזיהוי רגשות בתרחישים של בריאות הנפש, בעוד ש-Sarzaeim et al.12 בחנו מערכות שיטור חכמות שעשויות לתרום גם לניתוחים הקשורים לבריאות הציבור. מחקרים אלה ממחישים את הישימות הרחבה של גישות מבוססות LLM בתחומים שונים הקשורים לשירותי בריאות.

אף על פי ש-LLMs הרחיבו את האפשרויות ליישומים בתחום הבריאות, שילובם בסביבות קליניות נותר קשור לאתגרים טכניים, ארגוניים ורגולטוריים משמעותיים. פריסה מעשית דורשת תשתית מחשוב מתאימה, ממשל נתונים אפקטיבי ועמידה במסגרות רגולטוריות כגון תקנת הגנת הנתונים הכללית (GDPR) וחוק הגנת הנתונים הכללי של ברזיל (LGPD). מסגרות אלו קובעות דרישות לעיבוד מאובטח ואתי של מידע בריאותי רגיש, תוך התייחסות לסוגיות הקשורות לפרטיות, אמינות והטיה אלגוריתמית במערכות בריאות מסייעות בבינה מלאכותית13,14.

יכולת פעולה הדדית בין מקורות נתונים הטרוגניים של שירותי בריאות, כולל רשומות בריאות אלקטרוניות (EHRs), מערכות דימות רפואיות ומכשירי האינטרנט של הדברים (IoT), ממשיכה להוות אתגר טכני מרכזי בפריסת פתרונות בריאות מבוססי בינה מלאכותית (AI). בהקשר זה, מסגרות עבודה סטנדרטיות ליכולת פעולה הדדית כגון HL7 FHIR מספקות מנגנון מובנה להחלפת מידע קליני בין מערכות שונות תוך שמירה על עקביות סמנטית ותמיכה באינטגרציה ניתנת להרחבה.

עבודה זו מציגה פלטפורמת רשת בעלת יכולת פעולה הדדית המשלבת מודלי שפה גדולים (Large Language Models) עם תקני קישוריות של מערכות בריאות כדי לתמוך בניתוח נתונים רפואיים בסביבות קליניות הטרוגניות. הארכיטקטורה המוצעת משלבת אינטגרציית נתונים מבוססת HL7 FHIR עם יצירה מוגברתת-אחזור (Retrieval-Augmented Generation - RAG) ומסגרת עיבוד רב-סוכנית כדי לספק ניתוח מונחה בינה מלאכותית המודע להקשר, תוך שמירה על הלימה עם דרישות הגנת הנתונים הרלוונטיות, כולל החוק הברזילאי להגנה על נתונים כלליים (LGPD).

פרוטוקול זה מתאר ארכיטקטורה בעלת יכולת פעולה הדדית (interoperable) לשילוב נתונים קליניים הטרוגניים תוך שימוש בתקני קישוריות מקובלים בתחום הבריאות. כמו כן, הוא מפרט את היישום של צינור עיבוד רב-סוכנים (multi-agent processing pipeline) המבוסס על מודלי שפה גדולים וקטנים (LLMs ו-SLMs), יחד עם מסגרת הערכה המשלבת מדדים כמותיים וניתוחים איכותיים להערכת התנהגות הפלטפורמה המוצעת.

פרוטוקול

מחקר זה לא כלל גיוס של משתפים אנושיים, גישה לרשומות רפואיות מזוהות של מטופלים, או ניסויים הכוללים בעלי חיים. הפרוטוקול פותח והוערך באופן בלעדי באמצעות מאגרי נתונים זמינים לציבור ואנונימיים לחלוטין לצורך תיקוף מתודולוגי. לא בוצעו גישה או עיבוד של מידע בריאותי אישי. לפיכך, לא נדרש אישור מוועדה לביקורת מוסדית (IRB) או מוועדת אתיקה במחקר. הפרוטוקול פותח בהתאם לעקרונות הגנת הנתונים הרלוונטיים, כולל חוק הגנת הנתונים הכללי של ברזיל (LGPD), כדי לתמוך ביישומים עתידיים הכוללים נתונים קליניים.

בחירה ועיבוד מקדים של מערכי נתונים

הפרוטוקול המוצע הוערך באמצעות מאגרי נתונים קליניים זמינים לציבור ואנונימיים לחלוטין, הכוללים רשומות בריאות אלקטרוניות (EHRs) מובנות, נתוני מענה על שאלות קליניות ומאגרי נתונים של דימות רפואי לצורך תיקוף מתודולוגי. לפני השילוב בפלטפורמה, עברו מאגרי הנתונים הליכי עיבוד מקדמי סטנדרטיים, כולל נרמול נתונים, הסרת רשומות לא עקביות או חסרות, מיפוי למשאבי HL7 FHIR, ניקוי טקסט, פילוח למקטעי אחזור (retrieval chunks) ויצירת וקטורים (embedding) לצורך אינדוקס וקטורי. שלבי עיבוד מקדמי אלו הבטיחו עקביות סמנטית בין מקורות נתונים הטרוגניים, קידמו את יכולת השילוב (interoperability) ואפשרו את השחזור של זרימת העבודה המוצעת, תוך שמירה על עמידה בעקרונות הגנת הפרטיות החלים על הנתונים.

מסדי הנתונים הופקו ממאגרי ביצועים (benchmark) הזמינים לציבור ונהוגים במחקרים בתחומי בינה מלאכותית ובריאות דיגיטלית. הם נבחרו כדי לייצג מידע קליני הטרוגני, הכולל רשומות רפואיות אלקטרוניות (EHRs) מובנות, תיאורים קליניים בלתי מובנים, משימות של מענה על שאלות קליניות ומטא-נתונים של דימות רפואי. במקום להעריך קוהורט קליני ספציפי, הפרוטוקול מתמקד בהדגמת זרימת עבודה ליישום הניתנת לשחזור וניתנת להתאמה למסדי נתונים שונים בתחום הבריאות. הגיוון של מסדי נתונים אלו מאפשר תיקוף של צינור השוריינות (interoperability pipeline), מחולל מוגבר באחזור (RAG), ומסגרת הסקה מרובת סוכנים על פני מודליות שונות של נתונים קליניים.

הגדרת סביבת הניסוי

הסביבה הניסויית הוקמה כדי להעריך את הפלטפורמה בעלת יכולת ההסבה (interoperable platform) תחת תנאים מבוקרים וניתנים לשחזור. הארכיטקטורה מורכבת ממודולי קליטת נתונים, שכבות קישוריות, מודלי שפה גדולים (LLMs) ומרכיבי הערכה, המאורגנים בתוך צינור עיבוד יחיד לניתוח נתונים רפואיים. איור 1 ממחיש את זרימת העבודה המלאה, מקליטת הנתונים הקליניים ועד להפקת הפלטים האבחנתיים.

תרשים עיבוד נתוני EHR; סינון הערות קליניות; הסקת מחלה באמצעות LLM; תהליך אבחון.
איור 1זרימת עבודה כוללת של המערכת, הממחישה את צינור העיבוד מנתונים קליניים גולמיים ועד לפלט של מצב המחלה. התהליך מתחיל בקליטה של רשומות בריאות אלקטרוניות (EHR), ולאחריה סינון נתונים ועיבוד מקדים להוצאת מידע הרגיש למחלה. שלב תכנון פרומפט מובנה משלב ידע של מומחים, הגדרות מחלה והיפר-פרמטרים, המאפשרים אינטראקציה יעילה עם מודל שפה גדול (LLM). ה-LLM מבצע הסקת מסקנות טקסטואלית כדי להפיק תגובות מודעות להקשר, אשר מוערכות לאחר מכן באמצעות כללים קליניים כדי לקבוע את סטטוס המחלה הסופי. זרימת העבודה מדגישה את השילוב של עיבוד מקדים של נתונים, פרומפטינג מונחה-ידע והסקה מבוססת בינה מלאכותית לתמיכה בקבלת החלטות קליניות. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

ארכיטקטורת קישוריות (interoperability) במערכות בריאות

תשתית ה-backend מאמצת ארכיטקטורה מודולרית המבוססת על RESTful APIs כדי לתמוך בתקשורת בין רכיבי הפלטפורמה (איור 2). ארכיטקטורה זו תואמת מידע קליני הטרוגני, כולל רשומות בריאות אלקטרוניות (EHRs) מובנות, הערות רופא ומטא-נתונים המופקים ממערכות דימות רפואיות. מכיוון שנתונים אלו מקורם במקורות ובפורמטים מרובים, הפיעילות ההדדית (interoperability) הושגה באמצעות מודלים סטנדרטיים של נתונים, ובמיוחד את מסגרת Fast Healthcare Interoperability Resources (FHIR)15,16,17..אימוץ FHIR תומך בחילוף מידע מובנה תוך שמירה על סקילביליות וגמישות בסביבות בריאות מבוזרות. מנגנוני תקשורת מבוססי HL7 שולבו גם הם כדי להקל על האינטגרציה עם מערכות קליניות ישנות, שעדיין נמצאות בשימוש נרחב במוסדות בריאות16,17.

דיאגרמה של Flask API המציגה בקשות POST/GET, שאילתות MySQL ואינטגרציה של מאגר הווקטורים FAISS.
איור 2ארכיטקטורת המערכת של הפלטפורמה הבין-תפעולית המוצעתממשק האינטרנט מתקשר עם צד השרת (backend) באמצעות Flask API באמצעות בקשות HTTP POST/GET. ה-API מנהל את הניתוב, עיבוד השאילתות והאינטראקציה עם מקורות נתונים מובנים ובלתי מובנים כאחד. מסד נתונים מסוג MySQL מאחסן נתונים קליניים מובנים, בעוד שמאגר וקטורים המבוס על FAISS תומך בחיפוש דמיון לצורך פעולות שליפה. צינור העיבוד (pipeline) המבוסס על LLaMA מעבד קלטים טקסטואליים ומייצר תגובות באמצעות ייצוגים וקטוריים, מה שמאפשר יצירה מוגברת בשליפה (RAG). הארכיטקטורה מדגישה את השילוב של שירותי רשת, ניהול מסדי נתונים, שליפה וקטורית והסקה של מודל שפה גדול במערכת מאוחדת. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של דמות זו.

הגדרת זרימת עבודה רב-סוכנית

ארכיטקטורת הרב-סוכנים מאורגנת לסוכנים פונקציונליים מומחים האחראים על שלבים שונים של זרימת העבודה. סוכן עיבוד מקדמי מבצע נורמליזציה של נתונים ומיפוי FHIR, ולאחריו סוכן שליפה האחראי על חיפוש סמנטי בתוך בסיס הנתונים הווקטורי. סוכן הסקה משלב את ההקשר שנשלף עם ה-LLM כדי להפיק תגובות, בעוד שסוכן אימות בודק את עקביות הפלט ואת העיצוב לפני החזרת התגובה הסופית. תיאום הסוכנים פועל לפי אסטרטגיית ניהול רצפית שבה הפלט של כל סוכן משמש כקלט לשלב הבא, מה שמבטיח מימוש מודולרי וניתן לשחזור.

אינטגרציה של נתונים קליניים

שכבת אינטגרציית הנתונים מרכזת מידע ממספר מקורות קליניים ומכינה אותו לעיבוד המשכי. עיבוד מקדים כולל נורמליזציה של נתונים, טוקניזציה (tokenization) והתאמת ישויות כדי לשפר את העקביות הסמנטית בין מערכי נתונים הטרוגניים. מכיוון שמידע קליני משתנה במבנהו ובאיכותו, פעולות אלו מסייעות להפחית רעשים ולהקל על האינטראקציה עם מודלים של בינה מלאכותית (AI). כמו כן, הוחלו אסטרטגיות מיפוי מובנות כדי להאחיד פורמטים שונים של נתונים ולשמור על תאימות עם צינור העיבוד, כפי שמוצג ב-איור 315,16,17.

תרשים תהליך קבלת החלטות במערכת הבריאות; שלבים: מורכבות השאלה, גיוס, ניתוח, סינתזה.
איור 3דוגמה מפורטת לתהליך הסקה קלינית מרובה-סוכניםהאיור ממחיש כיצד שאילתה קלינית מנותחת דרך מספר שלבים, הכוללים הערכת מורכבות, גיוס מומחים, דיון שיתופי וקבלת החלטה סופית. תהליך זה מדגים את יכולתו של המערכת להתאים באופן דינמי אסטרטגיות הסקה על בסיס מורכבות השאילתה, ובכך לשפר הן את היעילות והן את הדיוק האבחנתי בתרחישים של תמיכה בהחלטות קליניות. אנא לחצו כאן כדי להציג גרסה גדולה יותר של דמות זו.

הגדרת תוכנית העבודה (pipeline) של יצירה מוגברת באחזור (Retrieval-Augmented Generation)

יצירה מוגברתת שולף (Retrieval-Augmented Generation - RAG) משולבת כדי לספק ניתוח מודע להקשר על ידי שילוב של אחזור מידע עם היכולות הגנרטיביות של מודלי שפה גדולים. שאילתות משתמש מומרות לייצוגים וקטוריים באמצעות מודלי שיכון (embedding models) ומושוות למסד הנתונים הוקטורי באמצעות חיפוש דמיון סמנטי כדי לאחזר את קטעי ההקשר הרלוונטיים ביותר. המסמכים שנשלפו משולבים לאחר מכן עם השאילתה המקורית לפני ביצוע ההסקה על ידי ה-LLM. אסטרטגיה זו מסייעת לספק מידע הקשרי במהלך יצירת התגובה וקושרה לשיפור בעקביות עובדתית ולהפחתת הזיות (hallucinations) ביישומים עתירי ידע, כולל שירותי בריאות18,19. איור 1 ו-איור 3 ממחישים את זרימת העבודה הכוללת של השליפה ואת תהליך ההסקה התואם.

עבור כל בקשה של משתמש, הפרומפט הסופי נבנה באופן דינמי על ידי שילוב השאילתה המקורית עם הקטעים ההקשריים הרלוונטיים ביותר שנשלפו ממאגר הנתונים הווקטורי. המידע שנשלף משולב כראיה הקשרית לפני שלב ההסקה, מה שמאפשר למודל השפה להפיק תגובות המבוסות על ידע רפואי שנשלף, תוך שמירה על עקביות סמנטית וצמצום של תוצרי השלמה שאינם נתמכים בנתונים.

הנדסת פרומפטים והסקה רב-סוכנית

הפרוטוקול משלב אסטרטגיות של הנחיה מובנית (structured prompting) כדי לשפר את הפרשנות ההקשרית במהלך יצירת התגובה. טכניקות הנחיה אלו, יחד עם מנגנוני הסקה מתקדמים, מסייעות בהכוונת תהליך החשיבה בתרחישים קליניים מורכבים ועקביות עם התפתחויות אחרונות שדווחו בספרות20.

הארכיטקטורה כוללת מסגרת רב-סוכנים המורכבת ממודולים ייעודיים המבצעים פונקציות נפרדות בתוך צינור העיבוד, כולל אימות נתונים, סינון הקשר, תמיכה בחשיבה קלינית ואימות פלט. הארגון המודולרי מאפשר ביצוע משימות באופן סדרתי או במקביל, ובכך מספק גמישות לדרישות עיבוד שונות (איור 4). חלוקת פעילויות אלו בין מספר סוכנים מפחיתה את ההסתמכות על מודל שפה יחיד ותומכת בזרימת עיבוד חסונה יותר. אסטרטגיה ארכיטקטונית זו עולה בקנה אחד עם התפתחויות אחרונות בתחומי הבינה המלאכותית המבוזרת ועיצוב מערכות אינטליגנטיות21,2.

תרשים זרימה של תהליך שאילתה; זרימת קבלת החלטות עבור בעיות רפואיות פשוטות לעומת מורכבות; ניתוח צוות.
איור 4מסגרת קבלת החלטות רב-סוכנית לחשיבה קליניתהתהליך מתחיל בשאילתת משתמש, הנבדקת על ידי בודק-סוכן האחראי להערכת מורכבות השאילתה. במקרים מורכבים, המערכת מגייסת באופן דינמי צוות רב-תחומי (MDT) של סוכנים מומחים, המקיימים סבבי דיון איטרטיביים כדי לנתח את הבעיה ולסנתז ידע לפני קבלת החלטה סופית. במקרים פשוטים יותר, השאילתה מטופלת על ידי סוכן קלינאי רפואה ראשונית (PCC), מה שמאפשר יצירה מהירה יותר של תגובה. ארכיטקטורה אדפטיבית זו מאזנת בין יעילות לעומק אנליטי, ובכך משפרת את איכות ההחלטות ואת יכולת ההתרחבות של המערכת ביישומי בריאות. אנא לחץ כאן כדי להציג גרסה גדולה יותר של דמות זו.

הערכת ביצועים

ביצועי המערכת הוערכו באמצעות מדדים משלימים הלוכדים הן את האיכות הלשונית והן את העקביות הסמנטית של הפלטים הנוצרים. מדד ה-BLEU יושם למדידת דמיון תחבירי בהתבס על חפיפת n-grams23, בעוד שמד ROUGE העריך את הrecall ואת כיסוי התוכן, במיוחד במשימות סיכום והפקת מידע24. דמיון סמנטי הוערך באמצעות BERTScore, המשתמש בטמיעות (embeddings) קשריות הגזורות ממודלים מבוססי transformer כדי להשוות בין טקסטים נוצרים לטקסטים של ייחוס25. ניתוחים נוספים כללו perplexity ודמיון קוסינוס (cosine similarity) לבחינת ביטחון המודל והקוהרנטיות הסמנטית, בהתאמה26,27.

מדדי ההערכה שנבחרו מספקים נקודות מבט משלימות על ביצועי המערכת על ידי שילוב של ניתוחים לקסיקליים וסמנטיים. שילוב זה רלוונטי במיוחד ביישומים בתחום הבריאות, שבהם פרשנות הקשרית חשובה לא פחות מדמיון לקסיקלי. הפלטפורמה הוערכה בסביבה חישובית מבוקרת התומכת הן בפריסה מבוססת ענן והן בפריסה מקומית. הרצה מקומית של LLMs נכללה כאפשרות כדי לתמוך בדרישות פרטיות נתונים ולהפחית את ההסתמכות על שירותים חיצוניים בעת עיבוד מידע קליני רגיש. אסטרטגיית פריסה זו תואמת למסגרות הגנה על נתונים וניתנת להתאמה לסביבות תפעוליות שונות4.

תוצאות

ביצועי המערכת הוערכו באמצעות מדדים כמותיים משלימים יחד עם ניתוח איכותי, כדי לבחון הן את הדיוק הלשוני והן את העקביות הסמנטית של הפלטים הנוצרים. אסטרטגיית הערכה זו משלבת מדדים לקסיקליים וסמנטיים כדי לספק אפיון רחב יותר של התנהגות המודל במשימות של יצירת שפה הקשורה לשירותי בריאות.

טבלה 1 מציגה את התוצאות הכמותיות שהתקבלו באמצעות BLEU, ROUGE ו-BERTScore. מדדים אלו נבחרו מכיוון שהם מעריכים היבטים משלימים של טקסט שנוצר, כולל דמיון לקסיקלי, כיסוי מידע והלימה סמנטית, והם נמצאים בשימוש נרחב במחקר של עיבוד שפה טבעית.

שופטהנחיה (Prompt)PearsonRMSEMAEשיעור פגיעה (Hit Rate)
Mixtralקצרה0.0981.791.3466/28
zero-shot0.1741.6181.29315/28
few-shot0.4751.6731.3679/28
LLaMA 3קצרה0.4851.6171.31411/28
zero-shot0.4791.6141.31410/28
few-shot0.4251.6521.3913/28
LLaMA 3.1קצרה0.3491.6211.31806/28
zero-shot0.681.6141.30712/28
few-shot0.4081.2430.8861/28

טבלה 1: מדדי הערכה כמותיים של המערכת המוצעת.

השימוש במד BLEU נועד לכמת את הדמיון התחבירי בהתבסס על חפיפת n-grams בין הפלטים הנוצרים לבין טקסטי הייחוס23. מדד זה, שפותח במקור עבור תרגום מכונה, יושם גם על מגוון רחב של משימות יצירת טקסט כיוון שהוא לוכד התאמה מבנית בין טקסטים. בהערכה הנוכחית, ציוני ה-BLEU מעידים כי התגובות הנוצרות שומרות על מאפיינים תחביריים העקביים עם פלטי הייחוס.

נעשה שימוש ב-ROUGE כדי להעריך דמיון מכוון-recall (הזכרת מידע), תוך דגש על כיסוי של מידע רלוונטי בטקסטים שהופקו24. ביישומים של שירותי בריאות, מדד זה שימושי במיוחד מכיוון ששימור מידע רלוונטי מבחינה קלינית הוא לרוב חשוב יותר משחזור של ניסוח זהה. כפי שדווח ב-טבלה 2, ציוני ה-ROUGE מעידים כי התגובות שהופקו שומרות על תוכן קליני רלוונטי לאורך המקרים שנבחנו.

שופטהנחיהICC1ICC2ICC3ICC1kICC2kICC3K
Mixtralקצר0.1360.1640.1820.320.370.4
אפס-דוגמה (Zero-shot)0.280.3530.5070.5390.6210.755
למידה מדוגמאות בודדות0.2240.3230.5220.4630.5880.766
LLaMA3קצר0.2340.3310.5320.4790.5970.773
אפס-דגימה0.2440.340.5510.4920.6070.786
למידה מדוגמאות בודדות0.2180.3210.5310.4560.5870.772
LLaMA3.1קצר0.5210.5250.5370.7660.7680.777
אפס-דגימות0.2460.3430.560.4950.6110.792
למידה מדוגמאות בודדות0.5990.5970.5890.8170.8160.811

טבלה 2: מדדי הסכמה בין בוחנים (ICC).

מדד BERTScore נכלל כדי להעריך דמיון סמנטי באמצעות שיבוצים הקשריים (contextual embeddings) המופקים ממודלים מבוססי transformer25. בניגוד ל-BLEU ו-ROUGE, מדד זה משווה טקסטים על פי משמעות הקשרית ולא על פי חפיפה לקסית, מה שהופך אותו למתאים להערכת יצירת שפה קלינית. ערכי ה-BERTScore שהתקבלו במחקר זה מעידים על דרגה גבוהה של התאמה סמנטית בין התגובות שנוצרו לבין טקסטים הייחוס התואמים.

ניתוחים נוספים כללו פרפלקסיות (perplexity) ודמיון קוסינוס כדי להשלים את מדדי ההערכה העיקריים. הפרפלקסיה חושבה כדי להעריך את יכולת הניבוי של הפלטים שנוצרו, כאשר ערכים נמוכים יותר מעידים על אי-ודאות נמוכה יותר במהלך יצירת הטקסט26. דמיון קוסינוס שימש לכימות ההתאמה בין וקטורי שיכון (embedding vectors) שהופקו מהטקסטים שנוצרו ומהטקסטים המייחסיים, ובכך סיפק מדד נוסף לקוהרנטיות סמנטית27.

בסך הכל, מדדי ההערכה מספקים מידע משלים על המאפיינים התחביריים, הסמנטיים וההקשריים של התגובות שנוצרו. איור 5 מסכם את התפלגות תוצאות ההערכה על פני המדדים שנבחנו, ומספק מבט כללי על ביצועי המערכת בתנאים שנבדקו.

תוצאות ההערכה עקביות עם ההתנהגות הצפויה של יצירה מוגברתת-שליפה (Retrieval-Augmented Generation - RAG) ביישומים הדורשים גישה למקורות ידע חיצוניים. על ידי שילוב מסמכים נשאלים בתהליך יצירת התגובה, הארכיטקטורה מספקת מידע הקשרי נוסף התומך בתגובות רלוונטיות קלינית בתרחישים עתירי ידע18,19. אסטרטגיות הנחיה (prompting) מובנות שולבו כמנגנונים משלימים להכוונת תהליך ההסקה והפרשנות ההקשרית, בהתאם לגישות שדווחו במחקרים אחרונים20.

ניתוח איכותני השלים את ההערכה הכמותית על ידי בחינת יכולת הפירוש והרלוונטיות הקלינית של הפלטים שהופקו. דוגמאות מייצגות של תגובות המערכת מוצגות ב-איור 3 עבור סוגים שונים של שאילתות קליניות. דוגמאות אלו מדגימות כיצד הפלטפורמה מייצרת תגובות קוהרנטיות מבחינה הקשרית על פני התרחישים שנבחנו, כולל מקרים הכוללים מידע קליני מורכב יותר.

ארכיטקטורת הרב-סוכנים מחלקת את משימות העיבוד בין מודולים ייעודיים האחראים על פונקציות משלימות בתוך זרימת העבודה. ארגון זה מפחית את ההסתמכות על מודל שפה יחיד ומאפשר שלבים מרובים של עיבוד מידע ואימות פלטים, בדומה לגישות רב-סוכנים שדווחו לאחרונה בספרות21,2. איור 5 מסכם את התפלגות תוצאות ההערכה שהתקבלו עם אסטרטגיות ההנחיה ומודלי השפה השונים שנבחנו במחקר זה.

תרשימי כינור המשווים תמריצים מוטיבציוניים, שיטות: Pearson, MAI, M/F CE; ניתוח חינוכי.
איור 5התפלגות הביצועים של המערכת המוצעת על פני אסטרטגיות הנחיה (prompting) ומודלי שפה שונים. (א–ותרשימי כינור (violin plots) ממחישים את הווריאציות באיכות התגובות עבור גישות של הנחיה (prompting) קצרה, zero-shot ו-few-shot, תוך שימוש במודלים של LLaMA3, LLaMA3.1 ו-Mixtral. התוצאות מדגישות את ההשפעה של עיצוב ההנחיה על עקביות הפלט ועל הביצועים, ומראות כי אסטרטגיות הנחיה מובנות נוטות להפיק תגובות יציבות ומדויקות יותר במשימות קליניות. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

תוצאות ההערכה עקביות עם מחקרים אחרונים הממליצים על שילוב של מדדים לקסיקליים וסמנטיים להערכת הביצועים של מודלי שפה גדולים4,12. בפרט, מדדים מבוססי השחלה (embedding) הפכו לחשובים יותר ויותר ללכידת דמיות הקשרית ביצירת שפה הקשורה לבריאות, שבה הפרשנות הסמנטית חורגת מהתאמה לקסיקלית28,29.

באופן כללי, ההערכה מצביעה על כך שהפלטפורמה המוצעת משלבת סטנדרטים של קישוריות (interoperability), יצירה מוגברתת באמצעות אחזור (RAG) ועיבוד רב-סוכנים בתוך מסגרת מאוחדת לניתוח נתוני בריאות. התוצאות הכמותיות והאיכותניות המוצגות במחקר זה תומכות בהיתכנות של זרימת העבודה המוצעת תחת התנאים הניסיוניים שנבחנו, ומהוות בסיס לתיקוף עתידי בסביבות קליניות ממספר מקומות בעולם האמיתי.

זמינות נתונים

מערכי הנתונים ששימשו במחקר זה זמינים לציבור. מערך הנתונים של צילומי רנטגן של בית החזה ה obtained מתוך אוסף צילומי הרנטגן של בית החזה של אוניברסיטת אינדיאנה (Open-i, הספרייה הלאומית לרפואה של ארה"ב), כולל הקבצים indiana_reports.csv ו-indiana_projections.csv, הזמינים בכתובת https://openi.nlm.nih.gov/. מערך נתוני הבנצ'מרק MedQA זמין לציבור דרך המאגר הרשמי שלו. לא נעשה במחקר זה שימוש בנתונים קליניים קנייניים או כאלה המאפשרים זיהוי מטופלים. כל הליכי עיבוד המקדמיים מתוארים בסעיף הפרוטוקול על מנת לתמוך ביכולת השחזור.

דיון

ההערכה המוצגת במחקר זה מייצגת תיקוף מתודולוגי שבוצע באמצעות מאגרי נתונים של שירותי בריאות המהווים מדדי ייחוס (benchmarks) זמינים לציבור ואנונימיים לחלוטין. לא בוצע תיקוף קליני פרוספקטיבי הכולל אנשי מקצוע בתחום הבריאות או גיוס מטופלים, שכן מטרתו של מחקר זה היא להדגים פרוטוקול יישום הניתן לשחזור ולא את היעילות הקלינית.

ממצאי מחקר זה מצביעים על כך ששילוב של תקני קישוריות (interoperability) במערכות בריאות עם מודלי שפה גדולים מספק מסגרת מעשית לשילוב מידע קליני הטרוגני. הארכיטקטורה המוצעת מאגדת מנגנוני חליפין של נתונים מובנים, כולל FHIR ו-HL7, עם עיבוד שפה מבוסס בינה מלאכותית בתוך זרימת עבודה מאוחדת העולה בקנה אחד עם הפיתוחים הנוכחיים במערכות בריאות דיגיטליות15,16,17.

היבט חשוב של זרימת העבודה המוצעת הוא שילוב של יצירה מוגברתת-שליפה (Retrieval-Augmented Generation - RAG) בתוך ארכיטקטורה רב-סוכנית. בתצורה זו, מסמכים שנשלפו מספקים מידע קשרי (contextual) נוסף במהלך יצירת התגובה, ובכך תומכים במשימות קליניות עתירות ידע. עיצוב ארכיטקטוני זה עולה בקנה אחד עם מחקרים אחרונים המתארים מנגנוני שליפה כאסטרטגיה לשיפור הביסוס ההקשרי ואמינות התגובות ביישומים של מודלי שפה גדולים18,19.

אסטרטגיות של הנחיה מובנית (Structured prompting) שולבו בזרימת העבודה המוצעת כדי לתמוך בפרשנות הקשרית במהלך יצירת התגובה. מחקרים קודמים דיווחו כי הנדסת פרומפטים וטכניקות של הסקה מובנית יכולות לשפר את הביצועים של מודלי שפה גדולים במשימות קבלת החלטות מורכבות20. הגישה שאומצה בפרוטוקול זה עולה בקנה אחד עם התפתחויות אלו ומספקת מסגרת מובנית לעיבוד שפה קלינית.

מנקודת מבט של הערכה, השימוש במדדים משלימים אפשר לבחון ממדים שונים של ביצועי המערכת. בעוד ש-BLEU ו-ROUGE מספקים מידע על דמיון תחבירי וכיסוי תוכן23,24, מדדים מבוססי שיכון (embedding) כגון BERTScore לוכדים קשרים סמנטיים שעשויים שלא לבוא לידי ביטוי באמצעות חפיפה לקסיקלית בלבד25. אסטרטגיית הערכה רב-ממדית זו עולה בקנה אחד עם מחקרי ביצועים (benchmarking) מהעת האחרונה, הממליצים לשלב מדדים לקסיקליים וסמנטיים בעת הערכת מודלי שפה גדולים ביישומי בריאות4,12.

מסלול העבודה המוצע מספק מסגרת מתודולוגית הניתנת לשחזור ליישום מערכות תמיכה בקבלת החלטות קליניות מבוססות AI בעלות יכולת פעולה הדדית. במקום לבצע השוואות ביצועים (benchmarking) בין ארכיטקטורות שונות של בינה מלאכותית, מחקר זה מתמקד בתיעוד של מסלול היישום המלא, ארכיטקטורת המערכת, מנגנוני הפעולה ההדדית ומתודולוגיית ההערכה, וזאת כדי להקל על השחזור ועל אימוץ המערכת בעתיד. ניתוחים השוואתיים הכוללים LLMs קונבנציונליים, תצורות ללא RAG, מודלים שעברו כיוונון עדין (fine-tuned) או גישות מסורתיות של למידת מכונה הם מעבר להיקף של תרומה מתודולוגית זו, ומהווים כיוון חשוב למחקר עתידי.

תרגום עתידי של המסגרת המוצעת לסביבות קליניות בעולם האמיתי יחייב תיקוף נוסף עם אנשי מקצוע בתחום הבריאות, כמו גם עמידה בדרישות רגולטוריות ואתיות רלוונטיות. בהתאם לשימוש המיועד, מערכות אלו עשויות להיות כפופות לתקנות של תוכנה כמכשיר רפואי (SaMD) ועליהן לעמוד בדרישות שנקבעו על ידי רשויות רגולטוריות, כולל מינהל המזון והתרופות של ארה"ב (FDA) והתקנה האירופית למכשור רפואי (MDR). בנוסף, ממשל נתונים חסון, אבטחת סייבר, שקיפות ונהלי בטיחות קלינית יהיו חיוניים לתמיכה בפריסה בטוחה ואחראית במסגרות בריאות.

הניתוח האיכותני השלים את ההערכה הכמותית על ידי הדגמת מאפייני התשובות שהופקו בתרחישים קליניים מייצגים. הדוגמאות המוצגות מצביעות על כך שהפלטפורמה הייתה מסוגלת להפיק תשובות קוהרנטיות מבחינה הקשרית תחת התנאים שנבחנו, ובכך סיפקה תובנה נוספת לגבי יכולת הפרשנות של התשובות מעבר למדדים הכמותיים. תצפיות דומות דווחו במחקרים שיישמו מודלי שפה גדולים ביישומים קליניים, כולל סיוע באבחון ואינטראקציה עם מטופלים28,29,30,31.

הארכיטקטורה המוצעת מחלקת את משימות העיבוד בין מודולים ייעודיים האחראים על פונקציות משלימות, הכוללות אימות נתונים, סינון הקשרי, תמיכה בחשיבה קלינית ואימות פלט. ארגון מודולרי זה מפחית את ההסתמכות על מודל שפה בודד ומאפשר שלבים עוקבים של עיבוד מידע בתוך זרימת העבודה. אסטרטגיות ארכיטקטוניות דומות תוארו במחקרים אחרונים על מערכות בינה מלאכותית מבוזרות ומסגרות רב-סוכניות שתוכננו עבור סביבות קבלת החלטות מורכבות21,22.

מספר שיקולי יישום עשויים להקל על השחזור והפריסה של הפרוטוקול המוצע. מיפוי עקבי של מידע קליני לתקן HL7 FHIR מסייע בשימור קישוריות סמנטית לאורך צינור עיבוד הנתונים. באופן דומה, עיבוד מקדים של מסמכים, אסטרטגיות חלוקה למקטעים (chunking), יצירת וקטורי שיכון (embedding) ואינדוקס וקטורי משפיעים על התנהגות תזרים העבודה של יצירה מוגברתת-שליפה (Retrieval-Augmented Generation) ויש להגדירם ולתקפם בהתאם למאפייני יישום היעד. ניתן גם לשכלל באופן איטרטיבי את הנדסת הפרומפטים (Prompt engineering) ואת התזמור של רב-סוכנים (multi-agent orchestration) באמצעות ידע ספציפי לתחום ומשוב ממומחים, כדי לשפר את הביסוס ההקשרי במהלך יצירת התגובה. פרקטיקות יישום אלו עולות בקנה אחד עם התפתחויות אחרונות בתחומי הבינה המלאכותית המהימנה ומודלי שפה משופרי-שליפה18,19,20.

יש להכיר בכמה מגבלות של מחקר זה. למרות שההערכה שילבה מדדים כמותיים ואיכותיים משלימים, מדדים אלו עשויים שלא לשקף באופן מלא את כל היבטי החשיבה הקלינית. תצפית זו עולה בקנה אחד עם מחקרים קודמים הממליצים על מסגרות הערכה ספציפיות לתחום עבור יישומים בתחום הבריאות12. בנוסף, הפלטפורמה הוערכה תחת תנאים מבוקרים תוך שימוש במאגרי נתונים של מדדי ייחוס (benchmark) אנונימיים וזמינים לציבור, אשר עשויים שלא לייצג באופן מלא את השונות והמורכבות של סביבות קליניות בעולם האמיתי.

הפלטפורמה המוצעת פותחה בהתאם לתקני קישוריות (interoperability) מקובלים בתחום הבריאות. אימוץ תקני HL7 ו-FHIR תומך בחילופי נתונים מובנים בין מערכות מידע בריאותיות הטרוגניות, ובכך מספק מסגרת סטנדרטית לשילוב מידע קליני ממקורות מרובים. גישה ארכיטקטונית זו עולה בקנה אחד עם מאמצים עכשוויים לפיתוח מערכות AI בעלות קישוריות עבור סביבות בריאות מבוזרות15,16,17.

היישום המוצלח של זרימת העבודה המוצעת תלוי במספר שלבים מתודולוגיים קריטיים. ראשית, יש למפות נתונים קליניים באופן עקבי למשאבי HL7 FHIR סטנדרטיים כדי לשמר קישוריות סמנטית בין מערכות בריאות הטרוגניות15,17. שנית, יש להגדיר בקפידה את עיבוד המבוא של המסמכים, כולל נורמליזציה, אסטרטגיית חלוקה למקטעים (chunking) ויצירת וקטורי שיכון (embedding), שכן שלבים אלו משפיעים ישירות על איכות השליפה בתוך צינור ה-Retrieval-Augmented Generation (RAG)19,32,33. שלישית, יש לבנות מחדש את מסד הנתונים הווקטורי בכל פעם שבסיס הידע מתעדכן, כדי לשמור על עקביות בין המסמכים המאנדקסים לבין תוצאות השליפה. לבסוף, יש לתקף באופן איטרטיבי את הנדסת הפרומפטים ואת התיאום בין הסוכנים (multi-agent orchestration) באמצעות תרחישים קליניים מייצגים, במטרה לשפר את הדיוק ההקשרי, לצמצם הזיות (hallucinations) ולהגביר את השחזוריות של זרימות עבודה לתמיכה בהחלטות קליניות מבוססות בינה מלאכותית4,3,20,31.

מנקודת מבט של פתרון בעיות, אתגרי יישום נפוצים כוללים מיפוי חסר של משאבי FHIR, ירידה בביצועי השליפה הקשורה לאינדוקס מסמכים או להגדרות של מסד נתונים וקטורי, ותגובות המושפעות ממידע הקשרי לא מספיק או מהנדסת פרומפטים שאינה אופטימלית. ניתן לטפל בבעיות אלו באמצעות תיקוף של משאבי קישוריות (interoperability), אופטימיזציה של פרמטרי השליפה, עדכון תקופתי או בנייה מחדש של מסד הנתונים הווקטורי לאחר ביצוע שינויים בבסיס הידע, והערכה רציפה באמצעות מדדים לקסיקליים וסמנטיים משלימים. פרקטיקות אלו תומכות בהתנהגות עקבית של המערכת ומסייעות בפריסה ובתחזוקה של תהליכי עבודה לתמיכה בהחלטות קליניות בעזרת בינה מלאכותית4,12,25,23..

מנקודת מבט מעשית, פריסת מודלי שפה גדולים בסביבות בריאות דורשת התחשבות במשאבים חישוביים ובדרישות תשתית. למרות שהארכיטקטורה המוצעת תומכת הן בהרצה מבוססת ענן והן בהרצה מקומית, ייתכן שיהיה צורך באסטרטגיות אופטימיזציה נוספות בהתאם להיקף הפריסה ולמשאבים החישובים הזמינים, במיוחד בסביבות עם משאבים מוגבלים4.

מחקרים עתידיים עשויים להרחיב את זרימת העבודה המוצעת על ידי הערכת הפלטפורמה באמצעות מאגרי נתונים קליניים מהעולם האמיתי ותהליכי עבודה שגרתיים במערכות בריאות. חקירות נוספות עשויות לבחון אסטרטגיות של כוונון עדין (fine-tuning) ספציפיות לתחום ושילוב של שיטות בינה מלאכותית ניתנת להסבר (explainable AI) כדי לשפר את יכולת הפרשנות של המודל ולתמוך בשקיפות במהלך תמיכה בהחלטות קליניות. כיוונים אלו עשויים לתרום להערכה רחבה יותר של הפלטפורמה בסביבות בריאות מעשיות.

באופן כללי, עבודה זו מציגה מסגרת ניתנת לשחזור לשילוב תקני קישוריות (interoperability) של שירותי בריאות, יצירה מוגברת באחזור (Retrieval-Augmented Generation - RAG), וארכיטקטורות של מודלי שפה רב-סוכנים במסגרת תהליך עבודה מאוחד לעיבוד נתונים קליניים. הפרוטוקול המוצע מספק גישה מובנית להטמעה והערכה של מערכות לניתוח נתונים רפואיים בסיוע בינה מלאכותית, ועשוי לשמש כנקודת ייחוס לפיתוחים עתידיים בתחום תמיכת החלטות קלינית בעלת קישוריות.

גילויים

המחברים מצהירים כי אין ניגודי אינטרסים פיננסיים או מערכות יחסים אישיות שעלולים היו להשפיע על העבודה המדווחת במאמר זה. כלי בינה מלאכותית (AI) גנרטיבית שימשו אך ורק כדי לסייע בעריכה לשונית, תיקון דקדוקי ושיפור קריאות המאמר. כל התוכן המדעי, עיצוב המחקר, המתודולוגיה, ניתוח הנתונים, פרשנות התוצאות וההחלטות העריכתיות פותחו, אומתו ואושרו על ידי המחברים, הנושאים באחריות מלאה לתוכן מאמר זה.

תודות

המחברים מבקשים להודות למעבדת המערכות המשובצות והמבוזרות (LESC), באוניברסיטה הפדרלית של סארה (UFC), על אספקת סביבת המחקר והדיונים הטכניים שתמכו בפיתוח עבודה זו. המחברים מודים גם למפתחים ולמתחזקים של התוכנות בקוד פתוח, תקני קישוריות ומסדי הנתונים הזמינים לציבור ששימשו לאורך מחקר זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
FAISSMeta Platforms Inc.גרסה 1.8.0בסיס נתונים וקטורי המשמש לחיפוש דמיון בצינור העיבוד של יצירה מועשרת באחזור (RAG).
תקן FHIRHL7 Internationalגרסה 4 (R4)תקן קישוריות למערכות בריאות שאומץ להחלפת נתונים קליניים מובנים.
בקבוק מעבדהפרויקטי משטחיםגרסה 3.0.3מסגרת פיתוח אינטרנט (web framework) של Python המשמשת להטמעת ה-API של ה-backend מסוג RESTful.
תקן HL7HL7 Internationalגרסה 2.xפרוטוקול העברת הודעות מיושן המשמש לצורך קישוריות (interoperability) עם מערכות מידע בית-חולים.
ממשק תכנות יישומים (API) מסוג HTTP RESTיישום מותאם אישיתלא רלוונטישכבת תקשורת RESTful בין צד לקוח (frontend), צד שרת (backend), בסיס נתונים ושירותי בינה מלאכותית (AI).
LangChainLangChain Inc.גרסה 0.3.xמסגרת המשמשת לשילוב של מודלי שפה גדולים (LLMs), הנדסת פרומפטים ותהליכי עבודה של יצירה מוגברתת-שליפה (Retrieval-Augmented Generation).
LangGraphLangChain Inc.גרסה 0.2.xמסגרת העבודה ששימשה לתיאום זרימת העבודה של הסקה קלינית רב-סוכנית.
LLaMA 3.1 8B InstructMeta Platforms Inc.גרסה 3.1מודל שפה גדול (Large Language Model) המשמש להסקה קלינית וליצירת שפה טבעית.
MySQL Community ServerOracle Corporationגרסה 8.0מסד נתונים רלציוני המשמש לאחסון נתונים קליניים מובנים.
OllamaOllama Inc.גרסה 0.9.xמנוע הסקה מקומי המשמש להרצת מודלי שפה גדולים תוך שמירה על פרטיות המטופל.
PythonPython Software Foundationגרסה 3.11שפת התכנות ששימשה למימוש הפלטפורמה המלאה.
PyTorchLinux Foundationגרסה 2.4מסגרת למידה עמוקה המשמשת להסקה של מודלי שפה גדולים.
תהליך יצירה מוגברת באחזור (RAG)יישום מותאם אישיתלא רלוונטימסגרת בינה מלאכותית המשלבת אחזור סמנטי עם הסקה של מודל שפה גדול (LLM) לצורך יצירת תגובות מודעות-הקשר.
Sentence TransformersHugging Face Inc.all-MiniLM-L6-v2מודל שיכון (Embedding model) המשמש ליצירת ייצוגי וקטורים צפופים עבור אחזור סמנטי של מסמכים.
Ubuntu LinuxCanonical Ltd.גרסה 24.04 LTSמערכת ההפעלה ששימשה לפיתוח ולהערכה ניסיונית.
Visual Studio CodeMicrosoft Corporationגרסה 1.100סביבת פיתוח משולבת המשמשת למימוש תוכנה ולניקוי שגיאות (debugging).

מקורות

  1. Chukwu E, Garg L. A systematic review of blockchain in healthcare: frameworks, prototypes, and implementations. IEEE Access. 2020;8:21196-21214. doi:10.1109/ACCESS.2020.2969881.
  2. Al-Nbhany WANA, Zahary AT, Al-Shargabi AA. Blockchain-IoT healthcare applications and trends: a review. IEEE Access. 2024;12:4178-4212. doi:10.1109/ACCESS.2023.3349187.
  3. Tan Y, et al. MedChatZH: a Chinese medical large language model. Comput Biol Med. 2024;172:108290.
  4. OLLAMA TEAM. Ollama: Run Large Language Models locally. Version 0.x. San Francisco: Ollama, 2024.
  5. Jahan I, Laskar MTR, Peng C, Huang JX. A comprehensive evaluation of large language models on benchmark biomedical text processing tasks. Comput Biol Med. 2024;171:108189. doi:10.1016/j.compbiomed.2024.108189.
  6. Liu X, Zhou Y, Wang Z, et al. Disease topic modeling of users' inquiry texts: a text mining-based PQDR-LDA model for analyzing the online medical records. IEEE Trans Eng Manag. 2023.
  7. Taylor N, Kormilitzin A, Lorge I, Nevado-Holgado A, Cipriani A, Joyce DW. Model development for bespoke large language models for digital triage assistance in mental health care. Artif Intell Med. 2024;157:102988.
  8. Song M, et al. PneumoLLM: a large language vision model for pneumonia diagnosis. Med Image Anal. 2024;97:103248.
  9. Chien SC, Yen CM, Chang YH, Chen YE, Liu CC, Hsiao YP, et al. Using large language model (LLM) to identify high-burden informal caregivers in long-term care. Comput Methods Programs Biomed. 2024;255:108329. doi:10.1016/j.cmpb.2024.108329.
  10. Xue X, Zhang D, Sun C, et al. Xiaoqing: a Q&A model for glaucoma based on LLMs. Comput Biol Med. 2024;174:108399.
  11. Wu D, Nie L, Mumtaz RA, Agarwal K. A LLM-based hybrid-transformer diagnosis system in healthcare. IEEE J Biomed Health Inform. 2024.
  12. Zhang Y, et al. LLM-enhanced multi-teacher knowledge distillation for modality-incomplete emotion recognition in daily healthcare. IEEE J Biomed Health Inform. 2024.
  13. Sarzaeim P, Mahmoud QH, Azim A. A framework for LLM-assisted smart policing system. IEEE Access. 2024;12:74915-74929. doi:10.1109/ACCESS.2024.3404862.
  14. Leme RS, Blank M. Lei Geral de Proteção de Dados e segurança da informação na área da saúde. Cad Ibero-Am Direito Sanit. 2020;9(3):210-224. doi:10.17566/ciads.v9i3.690.
  15. Zaganelli MV, Binda Filho DL. O sigilo médico e os dados sensíveis na telemedicina à luz da Lei Geral de Proteção de Dados. RECIIS. 2023;17(3):729-740. doi:10.29397/reciis.v17i3.3689.
  16. Tabari P, Costagliola G, De Rosa M, Boeker M. State-of-the-art Fast Healthcare Interoperability Resources (FHIR)-based data model and structure implementations: systematic scoping review. JMIR Med Inform. 2024.
  17. Martinez T, et al. HL7 systems and interoperability ecosystems in modern healthcare. IEEE Rev Biomed Eng. 2024.
  18. Chen L, et al. HL7 integration and semantic interoperability in distributed healthcare networks. IEEE J Biomed Health Inform. 2024.
  19. Liu W, Li W, Huang W, Gao Y. Security framework for medical data sharing. Telemed E-Health. 2024.
  20. Basile LJ, Carbonara N, Panniello U, Pellegrino R. How can technological resources improve the quality of healthcare service? IEEE Trans Eng Manag. 2024;71:5771-5781. doi:10.1109/TEM.2022.3192405.
  21. Singh A, et al. Prompt engineering in large language models: a survey using SWOT analysis [preprint]. arXiv. 2024
  22. Chen L, Chen Y, Liang W, Li X, Li KC, Wang J, Xiong N. MASS: a multiattribute sketch secure data sharing scheme for IoT wearable medical devices based on blockchain. IEEE Internet Things J. 2025;12(2):1990-2001. doi:10.1109/JIOT.2024.3468733.
  23. Autoridade Nacional de Proteção de Dados (BR). Diretrizes para agentes de tratamento de pequeno porte. Brasília (DF): ANPD; 2021.
  24. Patel R, Kim H. Interoperability in EHR. IEEE Transactions on Biomedical Engineering, v. 70, n. 8, p. 2341-2354, ago. 2023. DOI: 10.1109/TBME.2023.3241567.
  25. Zhang T, Kishore V, Wu F, Weinberger KQ, Artzi Y. BERTScore: evaluating text generation with BERT. In: International Conference on Learning Representations (ICLR); 2020.
  26. Chen X, Lu X, Li Q, Li D, Zhu F. Integration of LLM and Human-AI Coordination for Power Dispatching With Connected Electric Vehicles Under SAGVNs. IEEE Trans Veh Technol. 2025;74(2):1992-2002. doi:10.1109/TVT.2024.3434969
  27. Zhou S, Chen C, Gu HH. Testing and evaluating SNOMED CT web browsers' textual search feature. In: Proceedings of the IEEE International Conference on Bioinformatics and Biomedicine (BIBM); 2019.
  28. McPeak G, Sautmann A, George O, Hallal A, Simal EA, Schwartz AL, Abaluck J, Ravi N, Pless R. An LLM's medical testing recommendations in a Nigerian clinic: potential and limits of prompt engineering for clinical decision support. In: Proceedings of the 2024 IEEE 12th International Conference on Healthcare Informatics (ICHI); 2024.
  29. LLAMA TEAM, AI @ META. The Llama 3 Herd of Models. arXiv preprint arXiv:2407.21783, 2024. Disponível em: https://arxiv.org/abs/2407.21783.
  30. Conselho Nacional de Saúde (BR). Resolução nº 466, de 12 de dezembro de 2012. Aprova as diretrizes e normas regulamentadoras de pesquisas envolvendo seres humanos. Brasília (DF): Ministério da Saúde; 2012.
  31. Singhal K, Azizi S, Tu T, et al. Large language models encode clinical knowledge. Nature. 2023;620:172-180. doi:10.1038/s41586-023-06291-2.
  32. Sahoo P, et al. A systematic survey of prompt engineering in large language models [preprint]. arXiv. 2024. Available from: https://arxiv.org/abs/2402.07927
  33. Yan Y, Hou Y, Xiao Y, Zhang R, Wang Q. KNOWNET: guided health information seeking from LLMs via knowledge graph integration. IEEE Trans Vis Comput Graph. 2024.

הדפסות חוזרות והרשאות

תגיות

אינטגרציית FHIRיצירה מוגברתת-שליפה (RAG)הסקה רב-סוכנותיתמסד נתונים וקטוריקישוריות סמנטיתהנדסת פרומפטים