מחקר זה נערך בהתאם לסטנדרטים אתיים מוסדיים ואושר על ידי ועדת האתיקה של בית החולים הכללי של פיקוד התיאטרון המזרחי (אישור מס' DZQH-KYLLFS-25-38). הסכמה מדעת בכתב התקבלה מכל המשתתפים לפני הכללה. כל נתוני המטופלים עברו אנונימיות והסרת זיהויים כדי להבטיח הגנה על פרטיות. כלי המחקר לפרוטוקול זה הופיעו בטבלת החומרים.
1. בניית גרף ידע
גרף הידע נבנה באמצעות אסטרטגיית אינטגרציה של נתונים מרובי מקורות. איסוף הנתונים וההערות בוצעו על ידי אנשי צוות מיומנים עם השכלה פורמלית ברפואה סינית מסורתית (TCM) ובדיקור סיני. מקורות הנתונים כללו טקסטים לדיקור סיני קלאסי, ספרות בשפה הסינית מ-CNKI, ספרות באנגלית מאוסף הליבה של Web of Science, נתונים קליניים ממרכזי רבייה בבתי חולים שלישוניים, ובסיסי ידע סטנדרטיים (הרשימה המפורטת של הטקסטים הקלאסיים זמינה בקובץ המשלים 1). מקורות אלו נבחרו כדי להבטיח עומק היסטורי ורלוונטיות קלינית עכשווית. בסך הכל נכללו 400 מקרים קליניים לתמיכה בזיהוי דפוסים אבחנתיים וטיפוליים. תהליך העבודה הכולל של בניית גרף הידע מוצג באיור 1.

איור 1: תהליך בניית גרף ידע. סקירה כללית של תהליך איסוף, חילוץ ואינטגרציה של נתונים המשמש לבניית גרף הידע. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
קריטריוני ההכללה דרשו שכל הנתונים יהיו קשורים ישירות לאבחון וטיפול בדיקור סיני, עם תוכן מלא ומובנה בבירור המתאים להוצאת ישויות וקשרים. טקסטים קלאסיים נדרשו להיות מאוגדים באופן ביקורתי וללא טעויות ברורות, בעוד שהספרות המודרנית הוגבלה לפרסומים שעברו ביקורת עמיתים או מסמכים שפורסמו על ידי מוסדות סמכותיים. הנתונים הקליניים נדרשו להיות מזוהים ללא זיהוי ואישור אתי. קריטריוני ההחרגה כללו רשומות כפולות, קטעי טקסט לא שלמים, תוכן שאינו קשור לאבחון וטיפול בדיקור סיני, והצהרות לא נתמכות או שגויות.
יושמה גישה היברידית לחילוץ ידע, המשלבת הערות ידניות וחילוץ אוטומטי. כ-30% מהנתונים, כולל טקסטים קלאסיים ותוכן סמנטי מורכב, סומנו ידנית על ידי מומחי תחום באמצעות פלטפורמת הערות סטנדרטית. 70% הנותרים מהנתונים עובדו באמצעות מודלים לשוניים גדולים (LLMs) לחילוץ אוטומטי, כולל זיהוי ישויות, חילוץ קשרים ונירמול מונחים. כל התוצאות שנוצרו אוטומטית נבדקו ותוקנו על ידי מומחים כדי להבטיח דיוק ועקביות.
חילוץ אוטומטי בוצע באמצעות תבניות הנחיות מובנות שנועדו להנחות את התנהגות LLM (דוגמאות לתבניות מוצגות בקובץ המשלים 2). תבניות אלו הגדירו את תפקיד המודל כמומחה להפקת ידע ייעודי לתחום ושילבו דוגמאות למידה מעטות בפורמט JSON triplet לשיפור ביצועי החילוץ. תקצירי ספרות מעובדים מראש הוגשו דרך ממשקי תכנות יישומים (APIs), ואסטרטגיות עיבוד מקביל יושמו לשיפור היעילות החישובית. פלטי החילוץ נותחו ואומתו באמצעות כלי אימות JSON כדי להבטיח שלמות מבנית. שלישיות ידע מאומתות הועברו לסריאליזציה לקבצי JSON עצמאיים, שנקראו לפי מסמכי המקור שלהם כדי לשמור על מעקב.
גרף הידע הסופי נשמר במסד נתונים של גרפים ויושם באמצעות מסגרות עבודה מבוססות פייתון. ההמחשה בוצעה באמצעות כלי מסד נתונים גרפיים מובנים לתמיכה בבדיקה ואימות.
הישויות בגרף הידע סווגו לשבעה סוגים: מחלות, תסמינים, דפוסי תסמונות, נקודות דיקור, מרידיאנים, שיטות טיפול, וחומרים אפקטורים ומנגנונים ביולוגיים. הקשרים בין ישויות נבנו כך שישקפו לוגיקה אבחנתית וטיפולית קלינית, ותומכים בהיגיון רב-קפיצות ובהסקה מובנית. האונטולוגיה ומבנה היחסים מוצגים באיור 2. סכמת גרף הידע המפורטת ודוגמאות למגבלות יחסים מוצגות בקובץ המשלים 3 ובקובץ המשלים 4.

איור 2: אונטולוגיה של גרף ידע ומודל היחסים. ייצוג סכמטי של סוגי ישויות ויחסים בתוך גרף הידע. הישויות המרכזיות כוללות מחלה, סימפטום, תסמונת, נקודת דיקור ושיטת טיפול, והן ממחישות קשרים אבחנתיים וטיפוליים.
אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
2. פיתוח מערכות יישומים
מערכת היישום פותחה בהתבסס על גרף ידע שנבנה כדי לאפשר תמיכה בהחלטות קליניות. המערכת מעבדת נתוני קלט משתמש ומבצעת ניתוח מובנה באמצעות עיבוד שפה טבעית והסקת גרף ידע.
הבנת שפה טבעית יושמה באמצעות מודל BiLSTM-CRF לזיהוי ישויות עם שם וקישור ישויות; ארכיטקטורת המודל מוצגת באיור 3. ארכיטקטורת המודל כללה שכבת הטמעה המאומנת על קורפוסים ספציפיים לתחום, שכבת זיכרון דו-כיוונית ארוכה לטווח קצר ללכידת מידע הקשרי, ושכבת שדה אקראי מותנית להבטחת תיוג רצף אופטימלי. המודל אומן על נתונים קליניים וספרותיים עם הערות ידניות, כאשר ההערות בוצעו באופן עצמאי על ידי מומחי תחום. ההסכמה בין המפרשים הוערכה באמצעות מקדם הקאפה של כהן, עם סף של ≥0.85. ההסתירות נפתרו באמצעות הסכמה של מומחים.

איור 3: ארכיטקטורת מודל BiLSTM-CRF. דיאגרמה סכמטית של מודל BiLSTM-CRF המשמשת לזיהוי ישויות עם שם, כולל הטמעה, BiLSTM ושכבות CRF.
אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
במהלך ההסקה, המודל חילץ ישויות מובנות, כולל תסמינים, מחלות ודפוסי תסמונות, מנתוני קלט קליניים. ישויות אלו מופו לצמתים סטנדרטיים בגרף הידע באמצעות נרמול מונחים, התאמת וקטורים מבוססת דמיון קוסינוס, והבהרה הקשרית.
שליפת ידע בוצעה באמצעות אסטרטגיה דו-מצב-מצבית ששילבה גישות מבוססות מילות מפתח וסמנטיות. שליפת מילות מפתח השתמשה באינדקסינג טקסט מלא להתאמה מדויקת של ישויות מובנות, בעוד ששליפה סמנטית השתמשה בייצוגים וקטוריים לזיהוי ידע לא מובנה רלוונטי. התוצאות שנשלפו אוחדו, הוסרו ועובדו לעיבוד במורד הזרם. יושמה אסטרטגיית דירוג רב-ממדית כדי לתעדף תוצאות בהתבסס על התאמה מדויקת, דמיון סמנטי ורלוונטיות למילים המפתח, כאשר המשקל מותאם להקשרים גינקולוגיים והקשרים הקשורים ל-DOR.
המערכת יצרה תוצרים אבחנתיים וטיפוליים באמצעות טכניקות יצירת שפה טבעית, והמרת ידע מובנה לתגובות ניתנות לפרשנות קלינית.
3. יישום קליני והערכה
המערכת שפותחה יושמה בסביבה קלינית להערכת ביצועיה המעשיים. משתתפי המחקר היו מטופלים שאובחנו עם ירידה במאגר שחלות בבית חולים שלישוני בנאנג'ינג שהסכימו לקבל טיפול בדיקור.
המשתתפים היו זכאים אם היו בגילאי 20 עד 40 ועמדו בקריטריונים אבחנתיים לירידה במאגר השחלות בהתאם לקריטריוני ה-POSEIDON מ-2016 והקונצנזוס של המומחים הסיני לשנת 2020. המדדים האבחנתיים כללו ירידה ברמות ההורמונים האנטי-מולריאני וספירת הזקיקים האנטרליים < 5. מטופלים הוצאו מהשירות אם היו להם מצבים המשפיעים על פוריות, מחלות נלוות חמורות, או שקיבלו טיפול דיקור לפוריות בשלושת החודשים הקודמים. תרשים הזרימה של הכללת והדרת מטופלים מוצג באיור 4.

איור 4: תרשים זרימה של הכללת והדרה של מטופלים. תרשים זרימה שמראה את בחירת המטופלים. בסך הכל 127 מטופלים עמדו בקריטריוני הכללה, ו-90 מטופלים נכללו לאחר יישום קריטריוני ההדרה והתחשבות בנתונים לא שלמים. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
נתוני המטופלים, כולל מידע דמוגרפי וקליני, נאספו ותועדו בפורמט מובנה. המשתתפים מילאו שאלונים סטנדרטיים לאיסוף תסמינים ומידע קליני (השאלון המפורט מסופק בקובץ המשלים 5). המערכת יצרה תוצרים אבחנתיים ומרשמים לדיקור סיני בהתבסס על נתוני הקלט.
ביצועי המערכת הוערכו באמצעות דיוק אבחוני והתאמת טיפול. דיוק האבחון הוערך על ידי השוואת תוצאות הבדלה של תסמונת שנוצרה על ידי מערכת לאלו שסופקו על ידי שלושה רופאים בכירים גינקולוגיים TCM ששימשו כסטנדרט ייחוס. שיעור ההסכמה האבחנתית חושב כאחוז המקרים העקביים בין כל המקרים.
התאמת הטיפול הוערכה על ידי פאנל של שלושה דיקוריסטים בכירים עם לפחות חמש שנות ניסיון קליני ותפקידים מקצועיים בכירים. מומחים העריכו באופן עצמאי מרשמים שנוצרו על ידי מערכת באמצעות סולם ליקרט של 5 נקודות. ההסכמה בין המעריכים הוערכה באמצעות מקדם ההתאמה של קנדל (W).