מאמר שיטה

כרייה וויזואליזציה מבוססות ביקורת מקור של רשומות מקרי עולם-ממשי ברפואה סינית מסורתית תוך שימוש בנוסחת Hegan Jianpi

15 צפיות

⸱

DOI:

10.3791/73716

⸱

29 בספטמבר 2026

* These authors contributed equally

במאמר זה

סיכום

פרוטוקול זה משלב הסרת זיהוי, נורמליזציה של טרמינולוגיה, אימות מקורות וויזואליזציה הניתנת לשחזור, כדי להפיק פלטים מצברים הניתנים לביקורת מתוך רשומות רפואיות של מרפאות חוץ לרפואה סינית מסורתית בעולם האמיתי.

תקציר

רשומות מרפאת חוץ של רפואה סינית מסורתית (TCM) מהעולם האמיתי מכילות מידע אlongitudinal על אבחנות, מרכיבי תסמונית, תיאורי תסמינים ומרשמים אינדיבידואליים, אך הפורמט החצי-מובנה שלהן מקשה על ביצוע ניתוח הניתן לשחזור. מאמר זה מציג פרוטוקול מבוקר-מקור להמרת רשומות מקרה אנונימיות לטבלאות סיכום עקביות ולהצגה חזותית מוכנה לפרסום. זרימת העבודה מגדירה קריטריונים לסמיכות ויחידות ניתוח, שומרת על מיפויים בין הטרמינולוגיה המקורית למנורמלת, מאמתת את כל המונים והמכנים המדווחים, ומייצרת מחדש איורים מטבלאות מקור בגרסאות שונות. ביישום הפרוטוקול על רשומות מינואר 2015 ועד יוני 2024, זוהו 555 ביקורי מרשם זכאים מ-396 חולים. מערך הנתונים הסופי הכיל 324 תוויות צמחים מנורמלות ו-9,339 מופעים של שימוש בצמחים. זרימת העבודה הניבה ספקטרומי מחלות מקבילים של רפואה מערבית ו-TCM, ספקטרום מפורש של מרכיבי תסמונית ומטריצת התרחשות משותפת, פרופילי שכיחות צמחים ו-materia medica, ספקטרום תסמינים המופק מהיסטוריה הכולל 37 מונחים, 15 כללי התאמה מכוונים, צבירה היררכית ומפות חום של שימוש בצמחים המחולקות לפי אבחנה. לפחות מילת מפתח אחת שהוגדרה מראש בהיסטוריה זוהתה ב-474 ביקורים (85.41%). כאשר מדיניות המוסד מאפשרת זאת, ניתן להיעזר באפשרות של בינה מלאכותית (AI) תחת פיקוח אנושי לצורך בדיקות טרמינולוגיות, סקירת עקביות בין קבצים והתאמת כיתובים לאיורים. כל שימוש ב-AI חייב להיות מתועד ברשומת ביקורת נפרדת ואינו יכול להחליף את סקירת נתוני המקור. על ידי שילוב של ממשל, נורמליזציה, חישוב, פרשנות קלינית ופלט חזותי לתוך זרימת עבודה אחת הניתנת לשחזור, השיטה הופכת תיעוד קליני מפוזר למשאב מחקרי הניתן לבדיקה. ניתן להתאים את הפרוטוקול למאגרי נתונים אחרים של פרקטיקה מומחית, לפרויקטים של טרמינולוגיה רב-מרכזית ולפלטפורמות של נתונים קליניים פרוספקטיביים.

מבוא

רשומות של מרפאות חוץ לרפואה סינית מסורתית (TCM) מהעולם האמיתי משמרות הסקה קלינית לאורך זמן באמצעות תיאורי תסמינים נרטיביים, מערכות אבחנה מקבילות, תיאורי תסמונות ומרשמים מותאמים אישית. עבודות מוקדמות של גילוי ידע זיהו רשומות של מקרים כנתונים חווייתיים מורכבים הדורשים שיטות אינפורמטיקה ייעודיות לפני שניתן יהיה לחקור את הדפוסים שבהם באופן מהימן1. מחקרים מאוחרים יותר הראו כי ביטויים נרדפים של תסמינים, ישויות בעלות רזולוציה גבוהה ומונחי אבחנה מתועדים באופן מקומי חייבים לעבור נורמליזציה מבלי למחוק את הניסוח המקורי2,3,4,5,6. נתונים מתוך רשומות בריאות אלקטרוניות (EHR) יכולים לתמוך גם במחקר חישובי של מרשמים ובשימוש בכלי ניתוח ניתנים לשימוש חוזר, כאשר ההקשר הקליני ושושלת הנתונים נותרים גלויים7,8. לכן, נדרשים מקורות סמכותיים של materia-medica כדי להגדיר סטנדרט לשמות של צמחים, צורות עיבוד, תכונות, טעמים והקצאות למרידיאנים9,10. ברמת הדיווח, הצהרות RECORD ו-STROBE קוראות לתיאורים שקופים של מקורות נתונים, כללי זכאות, משתנים והחלטות אנליטיות, בעוד שעקרונות FAIR מדגישים אובייקטי מחקר ניתנים למעקב ולשימוש חוזר11,12,13. שיקולים אלו חשובים במיוחד כאשר הרשומות כוללות ביקורים חוזרים, שדות חסרים, טרמינולוגיה חופפת וטקסט חופשי. הערכת כשירות לשימוש חייבת להתייחס לשלמות, תאימות, סבירות והסכמה בין מקורות14,15. הסרת זיהוי מטקסט חופשי דורשת גם נהלים מפורשים ובדיקה אנושית, מכיוון ששיטות אוטומטיות עשויות לשמר תוכן קליני מועיל בעודן מותירות סיכוני פרטיות ששריים16,17,18.

לאחר קביעת השלטון והטרמינולוגיה, ניתוח פרופילי תדירות, כריית חוקי אסוציאציה (association-rule mining) וצבירה היררכית יכולים לספק נקודות מבט משלימות על מבנה המרשמים19,20,21. שיטות מיפוי מדע ורשתות מדגימות עוד כיצד ייצוגים חזותיים מתואמים יכולים לחשוף קשרים שרשימה מדורגת אחת אינה יכולה ללכוד22,23,24,25. מחקרים אחרונים על דלקת מפרקים שיגית עם דיכאון, מעכבי Janus kinase בקוליטיס כיבית, ודלקת מפרקים שיגית עם פיברומיאלגיה ממחישים את הערך של קריטריוני אחזור עם גרסה נעולה, רשתות תסמיכים משותפים (co-occurrence networks), צבירה, פרשנות זמנית והצהרות מפורשות על מגבלות אנליטיות26,27,28. המחקר הנוכחי מעמיד עקרונות עיצוב ניתנים להעברה אלו ליישום בכריית רשומות קליניות במקום בביבליומטריה של ספרות. ברשומות המקור, Hegan Jianpi Formula מתייחס לנוסחה מבוססת ניסיון הקשורה לפרקטיקה של פרופסור Nai-li Yao29,30. פרסומים קשורים מתארים את גישתו הקלינית הרחבה יותר להרמוניזציה של הכבד והטחול ולטחול והקיבה29,30. במאמר שיטה זה, שם הנוסחה מזהה את ההקשר של רשומת המקור בלבד ואינו קובע הרכב קבוע, מינון, אינדיקציה לטיפול או טענה ליעילות. זרימת העבודה החישובית משתמשת בכללים דטרמיניסטיים ובשיטות סטטיסטיות למטרות כלליות. פרקטיקה חישובית ניתנת לשחזור דורשת בנוסף שימור של קלטי נתונים, תיעוד של פרמטרים, טרנספורמציות מבוססות סקריפט ותוצרים ניתנים לבדיקה31,32. אפשרות לבינה מלאכותית (AI) תחת פיקוח אנושי יכולה לסייע בבדיקות טרמינולוגיות, סקירות עקביות בין קבצים ובקרת איכות חזותית כאשר השימוש בה מתועד. מומחיות קלינית, הגנות פרטיות וקבלת החלטות אנושית אחראית חייבות להישאר בעדיפות ראשונה (Supplementary Table 1)33,34. המטרה הכוללת של שיטה זו היא להמיר רשומות מקרי TCM שזהותן נמחקה לשרשרת של תוצרים מבוקרים של מקור, המיוספים לפי מחלה, תסמונת, סימפטום, שימוש בצמחים, אסוציאציה, צבירה ואבחנה. הדוגמה המעשית משתמשת ב-555 ביקורי מרשם זכאים מ-396 מטופלים כדי להדגים כיצד ניתן לשלב שלטון, נורמליזציה, חישוב, פרשנות קלינית ושחרור חזותי מבלי לחשוף רשומות ברמת המטופל, פרטי הרכב מדויקים, יחסי מינונים או הוראות מרשם.

פרוטוקול

ניתוח רטרוספקטיבי זה של רשומות קליניות שזוהו מתוכן הפרטים נסקר ואושר על ידי ועדת האתיקה הרפואית של בית החולים Guang'anmen, האקדמיה הסינית למדעי הרפואה הסינית (מספר אישור 2026-108-KY; 13 ביולי 2026). הדרישה להסכמה מדעת בוטלה על ידי הוועדה.

1. קביעת אתיקה, ממשל ואבטחת נתונים

  1. מנו אמנה של נשטרן נתונים, אנליסט נתוני מקור, בודק טרמינולוגיה קלינית, בודק כמותי וחוקר המוסמך לאשר שחרור נתונים מצברים. רשמו כל תפקיד ביומן הפרויקט.
  2. הכינו תוכנית ניהול נתונים המגדירה את מערכת המקור המותרת, תקופת המחקר, השדות, מיקום האחסון, הרשאות גישה, נהלי גיבוי, תקופת שמירה והגבלות על מפתחות קישור.
  3. ייצאו רק את המשתנים המינימליים הדרושים לאנליזה שהוגדרה מראש. כללו מזהה מטופל מקומי, תאריך ביקור, גיל או תאריך לידה כאשר הדבר מותר, מין, אבחנה מערבית, שם המחלה ב-TCM, טקסט היסטוריה אנונימי, טקסט לשון, טקסט דופק, טקסט תסמונית ושדות צמחי מרשם.
  4. הסירו שמות, מספרי זיהוי לאומיים, מספרי טלפון, כתובות מפורטות, מזהי ביטוח, פרטי קשר ומזהים ישירים אחרים בתוך הסביבה המוסדית המבוקרת. החליפו כל מספר רשומה רפואית במזהה מטופל ייחודי לפרויקט.
  5. סרקו שדות טקסט חופשי לאיתור מזהים שנותרו והסתירו כל פריט שזוהה. אחסנו כל מפתח קישור בנפרד מסט הנתונים האנליטי והשמיטו אותו מתיקיות עבודה, שיתוף והגשה.
  6. שמרו את הייצוא האנונימי הראשוני כצילום מצב (snapshot) של המקור לקריאה בלבד. רשמו את שם הקובץ, תאריך היצירה, מספר השורות, מספר העמודות, גודל הקובץ וערך ה-checksum במניפסט מקור.
  7. צרו ספריות נפרדות לקובצי מקור, קובצי עבודה, מילונים, טבלאות מצברים, איורים, סקריפטים ורישומי ביקורת.
  8. הגבילו חומרים המשוחררים או משותפים לטבלאות מצברים, מילונים אנונימיים מאושרים, סקריפטים ואיורי פרסום. אין להעלות רשומות מזוהות או רשומות שניתן לזהותן מחדש למערכות Generative-AI ציבוריות, שירותי ענן לא מאושרים או מאגרים ציבוריים.
    הערה: כאשר מדיניות המוסד מאפשרת סיוע של AI תחת פיקוח אנושי, ספקו רק קטעי טקסט אנונימיים או טבלאות מצברים. רשמו את המטרה, הפלט שנבדק, התיקון שהתקבל, הבודק והתאריך ביומן הביקורת.

2. הגדרת כלל זיהוי הרשומות ויחידות הניתוח

  1. הגדירו את המוסד, את מסגרת הטיפול במטופלים אמבולטוריים, את הצוות הקליני האחראי, את מערכת הרישום הרפואי האלקטרוני ואת תקופת המקור לפני הסינון. עבור הדוגמה המעשית, השתמשו ברשומות מתאריך ינואר 2015 ועד יוני 2024.
  2. אחסנו את כלל זיהוי הקוהורטה בקובץ מוגבל עם בקרת גרסאות לפני בחינת התוצאות האנליטיות. תיעדו וריאנטים מקובלים של טרמינולוגיה ואת כל תנאי ההכללה וההחרגה מבלי לחשוף פרטי ניסוח חסויים בכתב היד.
  3. השלימו את כלל זיהוי הרשומות בעל הגרסה הנעולה ברמת ביקור המרשם לאחר נורמליזציה של שמות הצמחים. גבשו את קובצי המקור, המילונים, כלל הקוהורטה ופרמטרי האנליזה כסט שחרור יחיד.
  4. צרו גרסה חדשה והפיקו מחדש את כל התוצריים התלויים בכל פעם שרכיב בעל גרסה נעולה משתנה. אל תשנו את כלל זיהוי הקוהורטה לאחר בחינת התפלגויות מחלות, שכיחות צמחים, כללי התאמה או אשכולות.
  5. הכלילו ביקור אמבולטורי כאשר הוא חל בתוך תקופת המחקר בעלת הגרסה הנעולה, ממופה למזהה חולה תקף של הפרויקט, מכיל רשומת מרשם הניתנת לפירוש, ועומד בכלל זיהוי הרשומות המוגבל.
  6. החריגו ייצואים כפולים מדויקים, רשומות מחוץ לתקופת המחקר, רשומות ללא מרשם הניתן לפירוש, ושורות שאינן עומדות בכלל הזיהוי בעל הגרסה הנעולה. הקצו סיבת החרגה ראשית אחת לכל שורה שהוחרגה.
  7. הבדילו בין ייצואים חוזרים לבין ביקורי מעקב אמיתיים. הסירו רק כפילויות מדויקות של המערכת או הייצוא ושמרו ביקורים חוזרים אמיתיים.
  8. הקצו מזהים יציבים לחולים ולביקורי מרשמים. צרו מניפסט קוהורטה המכיל את גרסת המקור, גרסת הכלל, סטטוס סינון, סיבת הכללה או החרגה, מזהה חולה, מזהה ביקור וסטטוס סוקר.
  9. השתמשו ברשומה אחת לכל חולה ייחודי עבור סיכומי דמוגרפיה קבועים, כולל גיל ומגדר. השתמשו בביקור המרשם כיחידת האנליזה עבור אנליזות של מחלות, תסמונים, מילות מפתח מההיסטוריה, לשון, דופק, צמחים, כללי התאמה ואשכולות.
  10. הפרידו בין זכאות לקוהורטה לבין זמינות משתנים. שמרו ביקור שזכאי אחרת כאשר שדה ספציפי למשתנה חסר, ודווחו על המכנה הניתן להערכה עבור כל אנליזה.
  11. הקפיאו את מניפסט הקוהורטה לפני האנליזה התיאורית. תיעדו את מספר ביקורי המרשם הזכאים ואת מספר החולים הייחודיים, והפיקו מחדש את כל התוצרים התלויים אם החלטת זכאות משתנה.

3. נרמול הטרמינולוגיה ושמירה על נתיב הביקורת

  1. צרו מילונים נפרדים עם בקרת גרסאות עבור צמחים, אבחנות מערביות, שמות מחלות לפי TCM, רכיבי תסמונת, מילות מפתח של היסטוריה רפואית, מונחי לשון, מונחי דופק ומאפייני חומרי רפואה (materia-medica).
  2. כלולו בכל מילון את המונח המקורי, המונח הנורמל, קטגוריית המונח, שדה המקור, הכלל, מקור הייחוס, גרסת המילון, הבודק, תאריך הבדיקה והערות. שמרו על כל מונח מקורי לאחר הנורמליזציה.
  3. בצעו נורמליזציה לשמות של חומרים רפואיים סיניים (CMM) באמצעות מקורות נומנקלטורה מוסמכים9,10. תקנו וריאנטים טיפוגרפיים וקיצורי מערכת תוך שימור צורות עיבוד בעלות משמעות קלינית.
  4. שמרו על סייגי עיבוד כתוויות נפרדות, כולל טיגון, עיבוד בחומץ, טיגון בדבש, עיבוד בג'ינג'ר, עיבוד ביין, השרפה ומצב גולמי.
  5. הפרידו בין צמחים השונים מבחינה אורתוגרפית או קלינית. אל תמזגו את Bai Shao עם Bai Zhu ואל תסיקו זהות של צמח מקיצור מעומעם ללא בדיקת המקור.
  6. שמרו את המינון והיחידה המקוריים בשדות נפרדים כאשר הם זמינים. הסירו את טקסט המינון רק בעת בניית משתני נוכחות-צמחים ברמת הביקור.
  7. אל תפרשו את תדירות ההופעה כמינון מצטבר או כעוצמת טיפול.
  8. בצעו נורמליזציה לשמות מחלות מערביים ומחלות TCM באופן עצמאי. שמרו על מערכת האבחנה ועל סטטוס האבחנה הראשית, ואל תתרגמו תווית מחלה של TCM לאבחנה מערבית אלא אם שתיהן תועדו במפורש.
  9. הגדירו תווית מחלה של TCM בתעתיק בשימוש ראשון כאשר הדבר נחוץ להכוונת הקורא. שמרו על תווית המקור המקורית.
  10. פצלו טקסט תסמונתי מפורש בעל ערכים מרובים באמצעות מפרידים בעלי גרסה נעולה, ומפו את ביטויי המקור לרכיבי תסמונת מנורמלים. הסירו כפילויות של כל רכיב מנורמל בתוך ביקור בודד.
  11. הפרידו בין טקסט תסמונתי מפורש לבין עמודות אינדיקטורים שהורשתו או נגזרו מציונים.
  12. שמרו על השדות המקוריים של לשון, דופק, סימפטום מובנה והיסטוריה ללא זיהוי כתוצרי נתונים נפרדים. אל תתייחסו להתאמה של מילת מפתח בהיסטוריה כשוות ערך לסימפטום מובנה שהוזן על ידי קלינאי.
  13. בקשו מבודק אחד להציע כל מיפוי מעומעם או מיפוי של רבים-לאחד, ובקשו מבודק קליני שני לאשר אותו. הגבירו מיפויים לא ודאיים מהניתוחים שפורסמו עד שביקורת המקור תפתור אותם.
  14. בדקו אם קיימות תוויות נורמליות ריקות, מיפויים של אחד-לרבים, מיפויים של רבים-לאחד, כפילויות ברשומות המילון, מונחים שלא נבדקו ואובדן מקרי של תוויות עיבוד. הקפיאו את גרסאות המילון לפני יצירת טבלאות סיכום.

4. אימות שדות המקור ונעילת פלטים לדיווח

  1. צרו פנקס ראיות (evidence ledger) עם שורה אחת עבור כל טענה בכתב היד, טבלה ופאנל של איור. רשמו את יחידת הניתוח, שדה המקור, גרסת המקור, גרסת המילון, גרסת הסקריפט, המונה, המכנה, קובץ הפלט, הבודק והניסוח המאושר.
  2. חשבו מחדש את ספירות הביקורים הזכאים והחולים הייחודיים, סיכומי דמוגרפיה, ספירות מחלות, ספירות תסמונים מפורשות, ספירות מילות-מפתח מההיסטוריה, שכיחויות של צמחי מרפא ממוזגים וסך כל השימוש בצמחי מרפא ישירות מהקבצים הנעולים בגרסה מסוימת.
  3. השוו כל ערך שחושב מחדש לערך המתאים בכתב היד, בגיליון האלקטרוני או באיור. תקנו את כתב היד והפיקו מחדש פלטים תלויים בכל פעם שאי-התאמה מאוששת.
  4. פתרו כל אי-התאמה ברמת שדה המקור. רשמו את הסיבה, התיקון, הבודק והתאריך בפנקס הראיות לפני שחרור התוצאה המושפעת.
  5. וודאו שכל טבלת סיכום מכילה את התווית הנורמלית, המונה, המכנה, הגדרת האחוז, יחידת הניתוח ומזהה המקור הדרושים לשחזור ההצהרה המתאימה.
  6. וודאו את המכנה ששימש לכל אחוז. השתמשו בחולים ייחודיים עבור מאפיינים דמוגרפיים קבועים ובביקורי מרשם עבור משתנים קליניים ומשתני מרשם דינמיים.
  7. השוו תוויות איורים, ערכים, סדר והגדרות פאנלים עם טבלאות הסיכום הנעולות בגרסתן. הפיקו מחדש כל איור לאחר תיקון טבלה במקום לערוך ידנית ערכים ששורטטו.
  8. בקשו מבודק קליני לאשר את מיפויי המינוחים. בקשו מבודק כמותי לאשר ספירות, שיעורים, מדדי כללים ומכנים של מפות חום (heatmap).
  9. נעלו את פנקס הראיות, טבלאות הסיכום ומקורות האיורים תחת מזהה גרסה אחד לפני הרכבת כתב היד.

5. יצירת ספקטרומים תיאוריים ופלטיים של התרחשות משותפת

  1. צור סיכומי גיל ומגדר ברמת המטופל משורה אחת עבור כל מטופל ייחודי. שמור על קטגוריות לא ידועות ודווח עליהן במפורש.
  2. צור ספקטרומים של מחלות לפי הרפואה המערבית ורפואת TCM בנפרד, ברמת הביקור-מרשם. שמור על מערכת האבחנה המקורית וחשב תוויות נורמליזציה דומיננטיות באמצעות מכנה משותף של ביקורים.
  3. צור את ספקטרום אלמנט-התסמונת משדה טקסט-התסמונת הנורמליזציה המפורש. פצל מונחים באמצעות מפרידים בעלי גרסה נעולה, הסר כפילויות של כל מונח בתוך ביקור אחד, וחשב תדירויות ברמת הביקור.
  4. בנה את מטריצת השכיחות המשותפת של התסמונות מאותן קבוצות טוקנים בתוך הביקור. קידד את גודל הצומת לפי תדירות הביקורים ואת רוחב הקשת או עוצמת מפת החום לפי מספר השכיחויות הזוגיות.
  5. הגדר מראש מילון מילות-מפתח מדויק להיסטוריה רפואית כאשר המידע על התסמינים הוא בעיקרו נרטיבי. סרוק רק את שדה ההיסטוריה שעבר דה-אידנטיפיקציה וספור כל מושג לכל היותר פעם אחת בתוך ביקור.
  6. חשב את הפרופורציה של ביקורים זכאים המכילים לפחות מילת מפתח אחת מההיסטוריה ודרג את כל ספירות מילות המפתח. ייצא את הטבלה המלאה ואת תת-הקבוצה המוצגת בגרף.
  7. צור תדירויות של צמחים ממוזגים מנתוני מרשמים נורמליזציה. ספור כל תווית צמח נורמליזציה לכל היותר פעם אחת לביקור, ושמור על צורות עיבוד בעלות משמעות קלינית כתוויות נפרדות.
  8. צור פרופילים של Four-Qi, חמישה טעמים ונטייה למרידיאנים מתוך מילון ה-materia-medica בעל הגרסה הנעולה. התייחס ל-Four-Qi כקטגוריה בעלת ערך יחיד עבור כל מופע של צמח המקודד למאפיין.
  9. התייחס לחמישה טעמים ולנטייה למרידיאנים כתכונות רב-תוויות. ציין את המכנה המקודד למאפיין ושמור על יחידת הניתוח הנפרדת.
  10. ייצא טבלת סיכום אחת קריאה-מכונה עבור כל תחום תיאורי לפני יצירת האיורים הסופיים.

6. ביצוע ניתוחי כללי התאמה (association-rule) וההקבצה היררכית (hierarchical-clustering)

  1. בנה מטריצה בינארית של ביקור-מרשם לפי צמח רפואי מתוך טבלת המרשמים הנורמליים בעלת הגרסה הנעולה. השתמש בשורה אחת לכל ביקור זכאי ובעמודה אחת לכל תווית צמח נורמלית.
  2. חשב תמיכה (support), ביטחון (confidence) ו-lift עבור כללי אסוציאציה מכוונים של צמח בודד19. שמור על כיוון כל כלל מכיוון שהביטחון תלוי באנטסדנט (antecedent).
  3. החל את הספים שהוגדרו מראש: תמיכה ≥ 0.30, ביטחון ≥ 0.70, ו-lift > 1.0. ייצא כל כלל שנשמר יחד עם ספירת ההתרחשות המשותפת ושלושת המדדים.
  4. שרטט את מערך הכללים השמור המלא כרשת כללים דו-צדית מכוונת וכפרופיל סדר עוצמת הכללים. קודד את רוחב קשת הרשת לפי התמיכה ואת צבע הקשת לפי ה-lift.
  5. קודד את גודל הנקודה לפי התמיכה וציין את הביטחון בפרופיל המסודר.
  6. וודא ששני תצוגות הכללים מכילים את אותו מערך כללים שמור ושומרים על כיוון הכלל. התאם כל אי-התאמה אל מול טבלת הכללים המיוצאת לפני הפרסום.
  7. בחר את 20 משתני נוכחות הצמחים בעלי התדירות הגבוהה ביותר לצורך מקבץ היררכי (hierarchical clustering). חשב מרחקי Jaccard בזוגות והחל קישור ממוצע (average linkage).
  8. סמן את הדנדרוגרמה בשמות הצמחים הנורמליים. פרש קרבה בין ענפים אך ורק כדמיון בדפוסי התרחשות ברמת הביקור.
  9. ייצא את הגדרת המטריצה הבינארית, טבלת הכללים, רשימת קשתות הרשת, סדר הקלט של המקבץ, מטריצת המרחקים ומטריצת הקישור לפני יצירת האיורים.
  10. בקש מבקר כמותי לשחזר מדד כלל אחד באופן ידני. השווה כל קשת ברשת אל מול טבלת הכללים.
  11. הפעל מחדש את כל תהליך העבודה של הכללים והמקבץ בכל פעם שהקוהורט, מילון המונחים או מטריצת נוכחות הצמחים משתנים.
  12. עבור הדוגמה המעשית, בצע ניתוח רגישות דטרמיניסטי של ביקור אחד למטופל על ידי שמירת הרשומה המוקדמת ביותר לפי סדר המקור עבור כל מטופל. השווה את 12 הכללים שהתקבלו ל-15 הכללים מניתוח רמת הביקור.
  13. דווח על השינוי כתוצאת חוסן תיאורית ולא כתיקוף ברמת המטופל. השתמש בחישוב מחדש הדטרמיניסטי המסופק ב-Supplementary File 1.

7. יצירת תבניות מופרדות לפי אבחנה ומסגרת הפרשנות הקלינית

  1. בחרו שכבות של אבחנות מערביות עיקריות הרלוונטיות מבחינה קלינית לפני בדיקת התפלגויות צמחים ספציפיות לאבחנה.
  2. ספרו כל תווית צמח מנורמלת לכל היותר פעם אחת לביקור בתוך כל שכבת אבחנה. חשבו את השכיחות כמספר הביקורים המכילים את התווית חלקי מספר הביקורים הזכאים הכולל באותה שכבה.
  3. השתמשו באותה קבוצת צמחים מוצגת ובסקאלת צבעים קבועה של 0%–100% לכל שכבות האבחנה. הציגו את ערכי התאים כדי לשמר פרשנות מדויקת.
  4. דווחו על המונה והמכנה עבור כל תא מוצג בטבלת סיכום נפרדת.
  5. בנו פאנל פרשנות קלינית נפרד לאחר השלמת מפת החום התיאורית. שמרו על הפרדה ויזואלית בין התוצאות המחושבות לבין פרשנות המומחים.
  6. אכלסו את שכבת הרמזים (cue layer) אך ורק במונחים שניתן להוכיחם בטבלת מילות-המפתח ההיסטורית הנעולה לגרסה או בטקסט תסמוני מנורמל מפורש.
  7. בקשו משני בודקים קליניים להסכים על פרשנויות הקשריות תמציתיות עבור הרמזים שנבחרו. רשמו את שמות הבודקים ואת הניסוח הסופי בפנקס הראיות.
  8. קשרו כל פרשנות הקשרית לשימוש מחקרי, כגון בחירת משתנים, תיקוף פרוספקטיבי או יצירת היפותזה.
  9. השתמשו במחברים מקווקוים ולא כיווניים עבור שכבת הפרשנות. השמיטו תוכן הנוגע למינון, הרכב קבוע והמלצות טיפוליות.
  10. סקרו את מפת החום ואת פאנל הפרשנות יחד. ודאו שהשכיחות המחושבת, ההקשר של המומחים והשימוש המחקרי העתידי נותרים מופרדים בבירור.

8. הרכבה ואימות של חבילת השחזור

  1. ייצאו את מניפסט המקור, מניפסט הקוהורט, גרסאות המילון, ספר הראיות, סקריפטים של ניתוח, טבלאות סיכום, מקורות האיורים והאיורים הסופיים לספריות נפרדות.
  2. תנו לכל קובץ שם המבוסס על מספר איור או טבלה יציב ותאריך גרסה. שמרו גרסה עדכנית אחת מוסמכת ואתחוו פלטים שהוחלפו בנפרד.
  3. צרו כל איור כקובץ תמונה אחד מרוב-לוחות. ייצאו קובץ PDF ברזולוציה גבוהה וקובץ PNG ב-300 dpi לצורך סקירה.
  4. מקמו את מקראי האיורים בכתב היד ושמרו אותם מחוץ לקובצי התמונה. תארו כל לוח, יחידת ניתוח, מכנה וקידוד חזותי.
  5. הכינו קובץ XLSX עצמאי אחד עבור כל טבלה.
  6. בקשו מסוקר עצמאי להשוות את המספרים בכתב היד עם טבלאות הסיכום, ואת האחוזים עם המונים והמכנים שלהם.
  7. השוו את גבולות הכללים עם טבלת הכללים ואת תאי מפת החום עם מטריצת המקור.
  8. הריצו בדיקות אוטומטיות לעקביות שמות קבצים, סעיפים נדרשים, מימדי איורים, מספר טבלאות, מספר הפניות, שאריות תבנית וניסוחים אסורים.
  9. בקשו מצוות הכותבים הקליני לסקור את המינוח, הפרשנות, גבולות הקניין הרוחני, פרטי המחברים, סדר המימון, ניסוח האתיקה ואת מערכת האיורים הסופית.
  10. הסירו מהחבילה להגשה קבצים ברמת המטופל, מפתחות קישור, טקסט חופשי לא מוגבל, התכתבויות פנימיות ועזרי סקירה זמניים.
  11. הקפיאו את החבילה ששוחררה ורשמו את גרסתה, תאריך, checksum, גרסת כתב היד וסטטוס אישור המחברים. צרו גרסה חדשה ויומן שינויים עבור כל תיקון עוקב.

תוצאות

יישום מוצלח של הפרוטוקול יצר שרשרת עקבת המקשרת בין צילום המקור המנוטרל מפרטים מזהים (de-identified source snapshot), מניפסט הקוהורט, מילוני הטרמינולוגיה, טבלאות סיכום, סקריפטים והאיורים הסופיים. הליך הסינון בעל הגרסה הנעולה זיהה 555 ביקורי מרשם רלוונטיים מ-396 מטופלים ייחודיים. איור 1 מסכם את שלושת השלבים המתואמים של השיטה: ממשל (governance), נרמול טרמינולוגיה, וניתוח הכולל ביקורת קלינית. תיעוד השקיפות והביקורת התואם, כולל גבולות הסיכום בלבד (aggregate-only boundary) עבור ביקורת בסיוע AI, מופיע ב-טבלה משלימה 1.

הקוהורט הסופי כלל 555 ביקורי מרשמים זכאים שנתרמו על ידי 396 מטופלים ייחודיים (איור 2 ו- טבלה 1). ביקורים חוזרים אמיתיים נשמרו עבור משתנים קליניים ומשתני מרשמים דינמיים, בעוד שגיל ומגדר סוכמו לאחר הסרת כפילויות ברמת המטופל. גיל המטופלים נע בין 13 ל-94 שנים, עם ממוצע של 47.11 שנים וסטיית תקן של 14.88 שנים. הקוהורט כלל 228 מטופלות (57.58%), 167 מטופלים (42.17%) ומטופל אחד שמגדרו לא ידוע (0.25%). הפרדה זו של יחידות הניתוח שימרה מפגשים אורך (longitudinal) מבלי לנפח את המכנה הדמוגרפי.

ספקטרום המחלות על פי הרפואה המערבית והרפואה הסינית המסורתית (TCM) מסוכם ב-איור 3. האבחנות המערביות התרכזו בהפרעות במערכת העיכול, בדרכי הכבד והמרה ובבלב. קיבוץ היררכי שייך 271 ביקורים להפרעות במערכת העיכול, 222 להפרעות בכבד, בדרכי המרה או בבלב, ו-62 למערכות אחרות (איור 3A). האבחנות האישיות השכיחות ביותר היו גסטריטיס כרונית ב-133 ביקורים (23.96%), כבד שומני ב-77 ביקורים (13.87%), ושחמת הכבד ב-46 ביקורים (8.29%), ואחריהן גסטריטיס אטרופית כרונית, כאבי בטן, הפטיטיס B כרוני, דיספפסיה, אזופגיטיס רפלקסיבי, גסטריטיס שטחית כרונית ופנקריטיטיס כרונית (איור 3C ו-טבלה 2).

ספקטרום שמות המחלות המתאימים ברפואה הסינית המסורתית (TCM) ארגן את אותם ביקורים בהתאם למערכת אבחון מקבילה. שמות מחלות של הטחול-קיבה או המעיים הפרישו 280 ביקורים, שמות מחלות של הכבד-כיס המרה 223, הפרעות של צ'י-דם-נוזלים 26, הפרעות של הנפש-חזה-ראש 12, הפרעות של ערוצים או גפיים 5, הפרעות גינקולוגיות 4, וקטגוריות אחרות 5 ביקורים (איור 3B). Wei pi, תווית מחלה שמורה של TCM למילאות או אי-נוחות באפגסטריום, תועדה ב-163 ביקורים (29.37%). Ji disease (תווית TCM מקורית מסוג הצטברות), Gan zhuo (מילולית, קיבעון הכבד; תווית מחלה קלאסית שמורה של TCM), Bi disease (מחלת חסימה), ו-Xiao ke (צמא-בזבז) נשמרו כתוויות TCM מקוריות ולא הומרו לאבחנות ביו-רפואיות מודרניות. Gan pi, תווית מחלה של TCM המשמשת בקונצנזוס הסיני העכשווי להפרעות של כבד שומני, תועדה ב-77 ביקורים (13.87%)35. שדות המקור המערביים ואלו של ה-TCM נשארים עצמאיים ולא הוחלפו זה בזה (איור 3D ו-טבלה 3). Xie xie (צואה רפה או מימית) ו-Fu xie (שלשול) היו תוויות מחלה מקוריות נפרדות של TCM, שתועדו 6 ו-2 פעמים, בהתאמה, ואף אחת מהן לא הושוותה לאבחנה ביו-רפואית מודרנית. הצגת שני הספקטrums זה לצד זה שימרה את הלוגיקה של כל מערכת אבחון תוך הדגמת הרוחב הקליני של רשומות המקור.

שדה טקסט התסמונת הנורמליסטי המפורש הכיל 555 שורות ביקורים זכאיות. לאחר הסרת כפילויות בתוך כל ביקור, האלמנטים השכיחים ביותר היו טחול ב-362 ביקורים (65.23%), כבד ב-304 (54.77%), חסר ב-qi ב-295 (53.15%), קיבה ב-171 (30.81%), לחות ב-151 (27.21%), וסטגנציה של qi ב-109 (19.64%; איור 4A ו-טבלה 4). חום, אגירת נוזלים, דם, סטגנציה של דם, תעלות, כליה, לב וחסר ב-yin הרכיבו את שאר הספקטרום המוצג. האחוזים אינם בלעדיים כיוון שאלמנטים של תסמונות מרובות יכלו להופיע במהלך ביקור בודד.

הרשת ומטריצת הספירה הופקו מאותה קבוצת אסימונים (tokens) ברמת הביקור (איור 4B,C). תיעוד משותף שכיח התרכז בטחול, כבד וחסר צ'י (qi deficiency), עם קשרים נוספים לקיבה, לחות (dampness), סטגנציה של צ'י (qi stagnation), חום ואגירת נוזלים. שימוש במטריצה אחת עם גרסה נעולה עבור תרשים השכיחות, הרשת ומפת החום הבטיח שכל שלושת הפנלים ייצגו את אותן ראיות בסיסיות ברמות פירוט שונות. הביקורת השחזורית זיהתה 0 התאמות מדויקות בין טקסט התסמונת למדד מבין 555 שורות, ודמיון ג'קארד (Jaccard similarity) ממוצע בין הטקסט למדד של 0.1806. לפיכך, עמודי המדדים הושמטו מהדיווח המהותי. החומרים שנשמרו לא הכילו וקטורי התפלגות הניתנים לשחזור לפני ניקוי הנתונים; כתוצאה מכך, יציבות התפלגותית בין גרסאות לא נאמדה. ניתוח רגישות של ביקור אחד לכל מטופל טיפל במקום בכך באפקט של ביקורים חוזרים. תוצאות ביקורת המקור ואיכות הנתונים מסוכמות ב-טבלה משלימה 2.

לאחר נורמליזציה של המינוח ושימור צורות עיבוד בעלות משמעות קלינית, 555 הביקורים הכילו 324 תוויות צמחים ממוזגות נפרדות ו-9,339 מופעי שימוש בצמחים. Bai Shao תועד ב-531 ביקורים (95.68%), ואחריו Fu Ling ב-520 (93.69%), Dang Gui ב-510 (91.89%), Chi Shao ב-467 (84.14%), ו-Bai Zhu מטוגן ב-361 (65.05%; איור 5A ו-טבלה 5). עקומת הדירוג-שכיחות של 36 התוויות המובילות הראתה מקטע תלול בעל שכיחות גבוהה, ולאחריו זנב רחב יותר באופן הדרגתי (איור 5B), מה שסיפק ייצוג תמציתי של מרכיבי הרקע המשותף והמרשמים האינדיבידואליים. המיפויים מהמקור לנורמליזציה, הסיוגים של תהליכי העיבוד, שמות CMM סטנדרטיים, מיני המקור וגבולות הראיות העומדים בבסיס השם המדעי של הצמחים מתועדים ב-טבלת השלמה 3.

מילון החומריות הרפואית (materia-medica) העזר הכיל 9,115 מופעים של שימוש בצמחים שקודדו לפי תכונות. קטגוריות "ארבעת האנרגיות" (Four-Qi) השכיחות ביותר היו חם (2,588, 28.39%), קר קלות (2,339, 25.66%), ניטרלי (2,330, 25.56%) וקר (1,221, 13.40%; איור 5C). לאחר נורמליזציה של טרמינולוגיית הטעמים של מקור התרכובות, קטגוריות "חמשת הטעמים" השכיחות ביותר היו מר (4,488, 49.24%), מתוק (4,377, 48.02%) וחריף (2,893, 31.74%) (איור 5D). קידוד הנטייה למרידיאנים (Meridian-tropism) נשלט על ידי הטחול (5,541, 60.79%), הכבד (4,801, 52.67%), הריאה (3,358, 36.84%), הקיבה (2,988, 32.78%) והלב (2,702, 29.64%; איור 5E). איור 5F מתעד את יחידות הניתוח הנפרדות ברמת הביקור ובקידוד התכונות ואת הקשר השמיח ביניהן. יחד, לוחות אלו מדגימים כיצד ניתן לסכם את שכיחות המרשמים ותיאורי החומריות הרפואית הסטנדרטיים מבלי להשמיט טרמינולוגיה ספציפית לתהליך העיבוד.

מילון ההיסטוריה שהוגדר מראש הכיל 37 מושגי תסמינים מדויקים. לפחות מושג אחד זוהה ב-474 מתוך 555 ביקורים מתאימים (85.41%). המונחים השכיחים ביותר היו גרון יבש ב-178 ביקורים (32.07%), עייפות ב-151 (27.21%), שינה לקויה ב-139 (25.05%), נפיחות בבטן ב-115 (20.72%), רפלקס חומצי ב-100 (18.02%), טעם מר ב-99 (17.84%), צרבת ב-90 (16.22%), שיהוק ב-87 (15.68%), גיהוקים ב-87 (15.68%), וצואה רכה ב-77 (13.87%; איור 6A,B ו-טבלה 6).

עקומת הדרגה-שכיחות המלאה הציגה את התפלגות 37 המונחים במלואה, בעוד שהקו המצטבר סיכם את ריכוז כל זיהויי מילות המפתח על פני הדרגות (איור 6C). איור 6D מתעד את הרצף הניתן לשחזור ששימש ליצירת הספקטרום: נעילת המילון, סריקת טקסט היסטורי שעבר דה-אידנטיפיקציה, הסרת כפילויות של מושגים בתוך כל ביקור, וייצוא של ספירות ושיעורים מצטברים.

בכריית חוקי אסוציאציה (Association-rule mining) נעשה שימוש במטריצת נוכחות של ביקורי מרשם לפי צמחי מרפא, בעלת 555 שורות ובגרסה נעולה. חמישה עשר חוקים מכוונים של צמח בודד עמדו בתנאי תמיכה (support) ≥ 0.30, ביטחון (confidence) ≥ 0.70, וערך lift > 1.0 (איור 7A,B ו-טבלה 7). ערכי התמיכה שנשמרו נעו בין 0.3009 ל-0.7892, ערכי הביטחון בין 0.7302 ל-0.9748, וערכי ה-lift בין 1.0010 ל-1.1226.

הזוג המכוון שנרשם יחד בתדירות הגבוהה ביותר היה Chi Shao > Fu Ling, בהתבסס על 438 ביקורים, עם support של 0.7892, confidence של 0.9379, ו-lift של 1.0010. לכלל ההפוך היו אותו support ו-confidence של 0.8423, דבר המדגים מדוע יש לשמר את כיוון הכלל. רגישות לסף (threshold sensitivity) שימרה 18, 11, 21, 14, 7, ו-4 כללים תחת support ≥ 0.25 או ≥ 0.35, confidence ≥ 0.65 או ≥ 0.75, או lift > 1.02 או > 1.05, בהתאמה. בניתוח של ביקור אחד למטופל, אותו זוג הופיע ב-316 ביקורים, עם support של 0.7980, confidence של 0.9489, ו-lift של 0.9994; לכן, הוא לא נשמר תחת קריטריון ה-lift > 1.0. תוצאות הפרטורבציות של הסף ורגישות לביקורים חוזרים מופיעות ב-Supplementary Table 4, והחישוב מחדש הדטרמיני מופיע ב-Supplementary File 1. בהתאם לכך, אין לפרש support גבוה ברמת הביקור כתיקוף ברמת המטופל.

ערכי ה-lift הגבוהים ביותר נצפו עבור Gan Cao > stir-fried Bai Zhu (1.1226) ו-Gan Cao > Chi Shao (1.1200). איור 7A משלב את כל 15 הכללים שנשמרו ברשת דו-צדדית מכוונת, כאשר רוחב הקשת מקודד את ה-support וצבע הקשת מקודד את ה-lift. איור 7B מדרג את אותם כללים לפי lift, קובע את קנה המידה של כל נקודה לפי support, ומוסיף הערות לגבי ה-confidence. לפיכך, שני הלוחות מבחינים בין טופולוגיית הרשת לבין חוזקו הכמותי של הכלל, במקום לשכפל את אותו ייצוג חזותי.

ביצוע צביר היררכי (Hierarchical clustering) של 20 משתני הצמחים בעלי התדירות הגבוהה ביותר התבצע באמצעות מרחק ג'קארד (Jaccard distance) וקישור ממוצע (average linkage) (איור 7C). הדנדרוגרמה מספקת ייצוג גלובלי של דמיון בדפוסי הנוכחות ברמת הביקור, אשר משלים את המידע הכיווני המקומי המסופק על ידי כללי האסוציאציה. יחד, הפאנלים מדגימים כיצד ניתן לסנכרן נקודות מבט אנליטיות משלימות למטריצה בינארית אחת בגרסה נעולה.

השכיחות מותנית באבחנה חושבה עבור כבד שומני (77 ביקורים), שחמת הכבד (46 ביקורים) וגסטריטיס כרונית (133 ביקורים; איור 8A ו-טבלה 8). Bai Shao, Fu Ling ו-Dang Gui הראו שכיחות גבוהה בכל שלוש השכבות. ביקורים בשל שחמת הכבד הראו תיעוד בולט של Dan Shen (95.65%), E Zhu מעובד בחומץ (86.96%), Bie Jia מעובד בחומץ (84.78%) ו-Sheng Huang Qi (60.87%). ביקורים בשל כבד שומני הראו שכיחות גבוהה יותר של Yin Chen (41.56%) ו-Ze Xie (31.17%) מאשר בשכבות האחרות, בעוד שביקורים בשל גסטריטיס כרונית הראו הופעות חוזרות של Huang Lian (44.36%), Mu Xiang (34.59%) ו-Chai Hu (36.09%). לפיכך, מפת החום מספקת השוואה תיאורית תמציתית של דפוסי מרשמים מצטברים על פני הקשרי קליניים מרכזיים.

איור 8B מפריד בין החישוב לבין הפרשנות. רמזי היסטוריה מאושרים מקושרים להקשרי מומחים תמציתיים ולאחר מכן לשימושים מחקריים, כולל הקשרה של מרכיבי תסמונת, השוואת דפוסים מרוטבים לפי אבחנה, בחירת משתנים לוולידציה פרוספקטיבית ויצירת שאלות המשך. פאנל סופי זה מדגים כיצד מומחיות קלינית יכולה להעשיר את התוצר האנליטי תוך שהיא נותרת נפרדת באופן גלוי מהשכיחות המחושבת.

איור 8C מסכם את השחזוריות ואת גבול השחרור על ידי הבחנה בין רכיבים שאומתו מהמקור או נותחו מחדש, לבין אלמנטים הדורשים זהירות או אישור נוסף. שכבת ביקורת סופית זו מונעת הצגה של תוצרים אנליטיים לא פתורים או כאלו שלא ניתן לשחזר כתוצרים מתוקפים.

figure-results-1
איור 1: זרימת עבודה של כרייה של רשומות מקרים שעברו ביקורת מקור. שלבי זרימת העבודה המוצגים כשלבים עוקבים הם ממשל, נורמליזציה של טרמינולוגיה, ניתוח צבירים, סקירה קלינית ואריזת גרסה. פסים כחולים, ירוקים וכתומים מבדילים בין תחומי זרימת העבודה, וקוים אנכיים מקווקווים מציינים שערי ביקורת. חצים מציינים את רצף זרימת העבודה ואינם מרמזים על סיבתיות ביולוגית. כלל השחרור קובע כי רק פלטים מצטברים משוחררים, מזהי מטופלים מושמטים, וכל ערך שדווח נשאר ניתן למעקב אל טבלת מקור נעולה לגרסה. אין פסי שגיאה רלוונטיים. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

figure-results-2
איור 2: פרופיל סט הנתונים ודמוגרפיה ברמת המטופל. תיבות הסיכום מדווחות על 555 ביקורי מרשם, 396 מטופלים ייחודיים, טווח גילאים ברמת המטופל של 13–94 שנים עם גיל ממוצע של 47.11 ± 14.88 שנים, ו-324 תוויות צמחים ממוזגות המייצגות 9,339 מופעים של שימוש בצמחים. (A) התפלגות מין ברמת המטופל בקרב 396 מטופלים ייחודיים, כולל קטגוריות נשי, גברי ולא ידוע. (B) התפלגות גיל ברמת המטופל לפי מין בקרב אותם 396 מטופלים. תיבות הסיכום משתמשות במכנים המוצגים ברמת הביקור או ברמת המטופל, לפי העניין. הצבעים מבדילים בין קטגוריות מין ואלמנטים בסיכום ואין להם משמעות הסקתית. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

figure-results-3
איור 3: ספקטרומי מחלות שהתקבלו מביקורי מרשמים. (A) קבוצות מחלות מערביות היררכיות ו-(B) קבוצות מחלות TCM היררכיות שנגזרו מ-555 ביקורי מרשמים רלוונטיים. (C) אבחנות מערביות נורמליזיות מובילות ו-(D) שמות מחלות TCM נורמליזיות מובילות מאותו מכנה ברמת הביקור. מקטעי הטבעת והעמודות מייצגים את מספר הביקורים; הצבעים מבדילים בין מערכות אבחון או קטגוריות ואינם מייצגים השפעות טיפוליות. תוויות המקור של TCM שנשמרו מוגדרות ב-טבלה 3: Wei pi (תחושת מלאות או אי-נוחות באפגסטריום), Ji disease (תווית מקור TCM מסוג הצטברות), Gan pi (תווית מחלת TCM המשמשת להפרעות כבד שומני), Gan zhuo (מילולית, קיבוע כבד; תווית מחלת TCM קלאסית שנשמרה), Bi disease (מחלת חסימה), Xiao ke (צמא-בזבז), Xie xie (צואה רכה או מימית), ו-Fu xie (שלשול). הסברים אלו אינם ממירים את תוויות המקור לאבחנות ביו-רפואיות מודרניות. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

figure-results-4
איור 4: ספקטרום טקסט-תסמונית מפורש ומבנה של הופעה משותפת. (A) תדירויות ברמת הביקור של 14 רכיבי תסמונית מנורמלים לאחר הסרת כפילויות בתוך הביקור, תוך שימוש ב-555 ביקורי מרשם זכאים כמכנה. (B) רשת הופעה משותפת של 12 רכיבי התסמונית השכיחים ביותר; גודל הצומת מייצג את תדירות הביקור, ורוחב הקו והשקיפות מייצגים את ספירות ההופעה המשותפת בזוגות. (C) מטריצת ספירת הופעה משותפת סימטרית תואמת; תאי האלכסון מייצגים תדירויות ביקור בודדות, ותאים שאינם באלכסון מייצגים ספירות הופעה משותפת בזוגות. רצועת הביקורת מדווחת על 0 התאמות מדויקות של טקסט-תסמונית/אינדיקטור על פני 555 שורות וממוצע דמיון Jaccard של 0.1806 בין הטקסט לאינדיקטור; לפיכך, עמודי האינדיקטורים הישנים הוצאו מהדיווח המהותי. במטריצה, Qi def. מציין qi deficiency, ‏Qi stag. מציין qi stagnation, ו-Water ret. מציין water retention. פלטת הצבעים היא תיאורית. לא חלים פסי שגיאה. אנא לחץ כאן להצגת גרסה גדולה יותר של איור זה.

figure-results-5
איור 5: צמחים בשכיחות גבוהה ופרופילים מנורמלים של מאפייני Materia Medica. (A) עשרים תוויות הצמחים המנורמלות השכיחות ביותר מתוך 555 ביקורי מרשם רלוונטיים. (B) פרופיל דירוג-שכיחות של 36 תוויות צמחים מנורמלות מובילות. (C) התפלגות Four-Qi המבוססת על 9,115 מופעי שימוש בצמחים המקודדים לפי תכונות; Four-Qi הוא בעל ערך יחיד עבור כל מופע מקודד. (D) התפלגות חמשת הטעמים ו- (E) התפלגות נטיית המרידיאנים המבוססות על אותו מכנה של קידוד תכונות; שניהם הם מאפיינים רב-תוייתיים, ולכן ספירות הקטגוריות אינן בלעדיות. (F) יחידות ניתוח ברמת הביקור וברמת קידוד התכונות והקשר השחזור שלהן. אורות העמודות מייצגים ספירות, והצבעים מבדילים בין הפנלים. לא חולו סטיות תקן. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

figure-results-6
איור 6: ספקטרום מילות מפתח של תסמינים המופקות מההיסטוריה וזרימת עבודה לשכתוב נתונים הניתנת לשחזור. (A) פרופורציה של 555 ביקורי מרפאה רשומים שעמדו בקריטריונים והכילו לפחות מילת מפתח אחת מההיסטוריה שהוגדרה מראש; 474 ביקורים (85.41%) הכילו לפחות מילת מפתח אחת. (B) חמי עשר מושגי התסמינים השכיחים ביותר שהופקו מההיסטוריה. (C) התפלגות דרגה-שכיחות מלאה של 37 מונחים והנתח המצטבר של זיהויי מילות מפתח. (D) זרימת עבודה עם גרסה נעולה, מהמילון שהוגדר מראש ועד לפלטים המרוכזים. כל מושג נספר לכל היותר פעם אחת בביקור, בעוד שמושגים מרובים יכלו להופיע באותו ביקור. פסים כתומים מייצגים את ספירת מילות המפתח, וצבעי זרימת העבודה מבחינים בין שלבי העיבוד. לא הוספו פסי שגיאה. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

figure-results-7
איור 7: חוקי אסוציאציה מכוונים של צמחים וצבירה היררכית. (A) רשת דו-צדדית מכוונת של כל 15 חוקי האסוציאציה של צמחים בודדים העומדים בסף שנקבע מראש של support ≥ 0.30, confidence ≥ 0.70, ו-lift > 1.0. רוחב הקו מייצג support, וצבע הקו מייצג lift. (B) פרופיל חוזק-חוקים של אותם 15 חוקים המדורגים לפי lift; גודל הנקודה מייצג support, ותוויות סמוכות מדווחות על confidence (conf.). (C) צבירה היררכית בשיטת average-linkage של 20 משתני נוכחות הצמחים בעלי התדירות הגבוהה ביותר תוך שימוש במרחק Jaccard. כל הלוחות משתמשים בביקורי מרשם כיחידת ניתוח ומתארים דפוסי רישום משותף ולא יעילות, סינרגיה או שילוב קבוע מומלץ. לא חולו סטיות תקן. אנא לחץ כאן להצגת גרסה גדולה יותר של איור זה.

figure-results-8
איור 8: תבניות צמחים מצבוריות מובחנות לפי אבחנה, מפת תבניות קליניות וגבול שחרור. (A) מפת חום מובחנת לפי אבחנה המראה את השכיחות ברמת הביקור של 16 תוויות צמחים מנורמליות בכבד שומני (n = 77), שחמת הכבד (n = 46) וגסטריטיס כרונית (n = 133). כל תא מייצג את אחוז הביקורים המתאימים בתוך שכבת האבחנה המערבית המקבילה, תוך שימוש בסקאלת צבעים קבועה של 0%–100%. (B) מפת תבניות קליניות המופקת מרשומות, המקשרת בין רמזים מאומתים ברשומות לקבוצות טקסט מנורמליות ותוויות צמחים מצבוריות שנצפו. מחברים מקווקווים ללא כיוון מבדילים בין שכבת פרשנות תיאורית זו לבין שכיחות מחושבת; הפאנל אינו מהווה המלצה לטיפול. (C) שחזור וגבול שחרור המבדילים בין רכיבים מאומתים במקור או שנותחו מחדש לבין פריטים הדורשים זהירות או אישור. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

מדדערךיחידה/מכנהסטטוס
ביקורי מרשם555555 ביקורי מרשםאומת מקובץ XLSX שהושב
מטופלים ייחודיים396396 מטופלים ייחודייםאושר מתוך קובץ XLSX שהושב
טווח גילאים ברמת המטופל13-94שניםמאומת
ממוצע הגיל ברמת המטופל +/- SD47.11 +/- 14.88שניםמאומת
ממוצע גיל +/- SD ברמת הביקור48.22 +/- 15.82שניםמאומת
מין ברמת המטופלנקבות 228; זכרים 167; לא ידוע 1396 מטופליםמאומת
מין ברמת הביקורנקבות 327; זכרים 227; לא ידוע 1555 ביקוריםמאומת
צמחי מרפא משולבים324שמות ממוזגים נבדליםמאומת
מופעי שימוש בצמחי מרפא ממוזגים9339555 ביקורי מרשםמאומת

טבלה 1: פרופיל מערך הנתונים. מאפיינים דמוגרפיים ברמת המטופל ומשתנים ברמת המרשם-ביקור מדווחים באמצעות המכנים המתאימים להם. כמו כן, מוצגים סכומי צמחים מנורמלים.

שם המחלהמספר מקריםאחוז ביקורים
גסטריטיס כרונית13324
כבד שומני7713.9
שחמת הכבד468.3
גסטריטיס אטרופית כרונית224
כאבי בטן224
הפטיטיס B כרוני203.6
דיספפסיה193.4
oesophagitis רפלקסית81.4
גסטריטיס שטחית כרונית71.3
פנקראטיטיס כרונית61.1
קולונופתיס כיבית61.1
פוליפ בכיס המרה61.1
תסמונת לאחר כריתת כיס המרה61.1
תפקוד לקוי של המעיים61.1
אבני מרה61.1
הפטיטיס כרונית50.9
עייפות50.9
תפקוד לקוי של מערכת העיכול (תווית מקור לא ודאית)50.9
גסטריטיס כרונית (תווית מקור לא ודאית)50.9
שחמת הכבד אוטואימונית40.7

טבלה 2: אבחונות מערביות נורמליזציה מובילות. ספירה ואחוזים של אבחונות מערביות נורמליזציה מובילות שנרשמו ב-555 ביקורי מרשם זכאים. האחוזים מחושבים כאשר ביקורי מרשם זכאים משמשים כמכנה.

שם המחלה לפי הרפואה הסינית המסורתית (TCM)מספר מקריםאחוז הביקורים
Wei pi (תחושת מלאות או אי-נוחות באפיגסטריום)16329.4
מחלת Ji (תווית TCM מקורית מסוג הצטברות)8615.5
Gan pi (תווית מחלה ב-TCM המשמשת להפרעות של כבד שומני)7713.9
כאבי קיבה6111
כאבים באזור המכסות (Hypochondriac pain)325.8
כאבי בטן315.6
Gan zhuo (מילולית, קיבוע כבד; תווית מחלה קלאסית שנשמרה ב-TCM)285
שחיקה עקב חסר (Deficiency taxation)173.1
עלייה של חומצה (Acid regurgitation)91.6
Xie xie (צואה רכה או מימית)61.1
נדודי שינה40.7
דיסנטריה40.7
כאב ראש40.7
מחלת Bi (מחלת חסימה)40.7
הפרעה מחזורית30.5
חסימה בחזה30.5
הפרעת הזעה30.5
עצירות30.5
Fu xie (שלשול)20.4
Xiao ke (צמא-שחיקה)20.4

טבלה 3: שמות מחלות נפוצים ב-TCM לאחר נורמליזציה. ספירות ואחוזים של שמות מחלות נפוצים ב-TCM לאחר נורמליזציה שנרשמו ב-555 ביקורי מרשם זכאים. האחוזים מחושבים כאשר מכנה השבר הוא מספר ביקורי המרשם הזכאים. תוויות מקור שנשמרו והסברים מלווים אינם מעידים על שקילות לאבחנות ביו-רפואיות מודרניות.

דירוגמרכיב התסמונתביקורי מרשםביקורים זכאיםאחוז ביקורים
1טחול36255565.23%
2כבד30455554.77%
3חסר ב-qi29555553.15%
4קיבה17155530.81%
5לחות15155527.21%
6סטגנציית qi10955519.64%
7חום9755517.48%
8הצטברות נוזלים9455516.94%
9דם8755515.68%
10סטגנציית דם5855510.45%
11ערוצים5755510.27%
12כליות435557.75%
13לב375556.67%
14חסר ב-yin345556.13%

טבלה 4: רכיבי תסמונת נורמליים מובילים. רכיבי תסמונת הופקו מטקסט תסמונת נורמלי מפורש ועברו הסרת כפילויות בתוך כל ביקור למתן מרשם. הספירות משתמשות ב-555 ביקורים זכאים למתן מרשם כמכנה; האחוזים אינם בלעדיים מאחר שרכיבי תסמונת מרובים יכולים להתרחש בתוך ביקור אחד.

תווית צמח ממוזגתספירהאחוז ביקורים
Bai Shao53195.7
Fu Ling52093.7
Dang Gui51091.9
Chi Shao46784.1
Bai Zhu מטוגן36165
E Zhu מעובד בחומץ30755.3
Tai Zi Shen28451.2
Dan Shen28250.8
Gan Cao27850.1
Huang Lian19935.9
Sheng Huang Qi17631.7
Mu Xiang17631.7
Chai Hu14425.9
Ji Nei Jin מעובד בחומץ14225.6
Mu Dan Pi13724.7
Sheng Di Huang13123.6
Gan Cao מטוגן בדבש12923.2
Fa Ban Xia11921.4
Chuan Xiong11320.4
Hou Po מעובד בג'ינג'ר10619.1
Yin Chen10418.7
Sheng Bai Zhu9717.5
Dou Kou9617.3
Sheng Long Gu9216.6
Zhe Bei Mu9016.2
Huang Qin8815.9
Dang Shen8515.3
Bie Jia מעובד בחומץ8315
Gui Zhi8315
Sheng Mu Li8114.6
Jiao Zhi Zi7413.3
He Huan Hua6912.4
Huang Jing מעובד ביין6611.9
Chen Pi6411.5
Ze Xie6311.4
Jin Qian Cao6111

טבלה 5: תוויות צמחים מנורמלות מובילות לפי תדירות ביקורי מרשם. כל תווית צמחים מנורמלת נספרה לכל היותר פעם אחת לביקור מרשם. הספירות והאחוזים משתמשים ב-555 ביקורי מרשם זכאים כמכנה, וצורות עיבוד בעלות משמעות קלינית נשמרות כתוויות נפרדות.

דירוגמילת מפתח נגזרת מההיסטוריהביקורי מרשםביקורים רלוונטייםאחוז ביקורים
1גרון יבש17855532.07%
2עייפות15155527.21%
3שינה לקויה13955525.05%
4נפיחות בבטן11555520.72%
5רפלקס חומצי10055518.02%
6טעם מר9955517.84%
7צרבת9055516.22%
8שיהוק8755515.68%
9גיהוקים8755515.68%
10צואה רכה7755513.87%
11שלשולים7755513.87%
12נפיחות באפיגסטריום7655513.69%
13כאבי קיבה7355513.15%
14יקיצה קלה5955510.63%
15סחרחורת545559.73%
16הקאות525559.37%
17בחילות525559.37%
18כאב עמום515559.19%
19כאב נפיחות505559.01%
20חוסר תיאבון445557.93%
21כאבי בטן435557.75%
22לחץ בחזה275554.86%
23עצבנות265554.68%
24כאב ראש235554.14%
25בורבוריגמוס235554.14%
26אי-נוחות באפיגסטריום215553.78%
27דפיקות לב195553.42%
28שתן צהוב185553.24%
29תחושת גוף זר155552.70%
30כאב דוקר145552.52%
31עצירות135552.34%
32נמנומיות125552.16%
33תחושת גוף זר בלוע95551.62%
34הזעה מוגברת85551.44%
35כאב היפוכונדרי55550.90%
36טנזמוס55550.90%
37צואה יבשה35550.54%

טבלה 6: מילות מפתח מובילות של תסמינים שהופקו מההיסטוריה הרפואית. מושגי תסמינים מדויקים שזוהו בטקסט היסטורי שעבר דה-אידנטיפיקציה. כל מושג נספר לכל היותר פעם אחת בביקור מרשם אחד, בעוד שניתן היה להופיע מספר מושגים באותו ביקור. הספירות והאחוזים משתמשים ב-555 ביקורי מרשם זכאים כמכנה.

קדמוןתוצאהביקורים חופפיםתמיכהביטחוןהרמה
צ'י שאופו לינג4380.78920.93791.0010
פו לינגצ'י שאו4380.78920.84231.0010
Bai Zhu מטוגןפו לינג3500.63060.96951.0348
באי ז'ו מוקפץבאי שאו3480.62700.96401.0076
Bai Zhu מטוגןצ'י שאו3200.57660.88641.0535
Tai Zi Shenפו לינג2730.49190.96131.0260
Tai Zi Shenבאי שאו (Bai Shao)2720.49010.95771.0010
Gan Caoבאי שאו (Bai Shao)2710.48830.97481.0189
Gan Caoצ'י שאו2620.47210.94241.1200
Tai Zi Shenצ'י שאו2420.43600.85211.0127
Gan CaoBai Zhu מוקפץ2030.36580.73021.1226
Huang Lianפו לינג1870.33690.93971.0029
הואנג ליאןצ'י שאו1800.32430.90451.0750
Sheng Huang Qiדנג גוי (Dang Gui)1680.30270.95451.0388
מו שיאנגפו לינג1670.30090.94891.0127

טבלה 7: כללי אסוציאציה מכוונים של צמחי מרפא העומדים בסף שהוגדר מראש. הכללים הופקו מ-555 שורות בינאריות של מרשם-ביקור באמצעות תמיכה (support) ≥ 0.30, ביטחון (confidence) ≥ 0.70, ו-lift > 1.0. התמיכה משתמשת ב-555 ביקורי מרשם כמכנה, וכיוון הכלל נשמר מכיוון שהביטחון הוא כיווני.

שם הצמחכבד שומני (n)כבד שומני (N)כבד שומני (%)שחמת הכבד (n)שחמת הכבד (N)שחמת הכבד (%)גסטריטיס כרונית (n)גסטריטיס כרונית (N)גסטריטיס כרונית (%)
Bai Shao717792.21%444695.65%13013397.74%
Dang Gui727793.51%424691.30%11913389.47%
Dan Shen457758.44%444695.65%4313332.33%
Fu Ling707790.91%434693.48%12613394.74%
E Zhu מעובד בחומץ577774.03%404686.96%6113345.86%
Bie Jia מעובד בחומץ6777.79%394684.78%41333.01%
Bai Zhu מטוגן577774.03%334671.74%7613357.14%
Chi Shao697789.61%324669.57%12113390.98%
Huang Lian237729.87%74615.22%5913344.36%
Mu Xiang207725.97%134628.26%4613334.59%
Yin Chen327741.56%134628.26%101337.52%
Sheng Huang Qi237729.87%284660.87%2113315.79%
Gan Cao457758.44%184639.13%7713357.89%
Chai Hu127715.58%3466.52%4813336.09%
Huang Qin167720.78%4468.70%2513318.80%
Ze Xie247731.17%94619.57%71335.26%

טבלה 8: שכיחות שימוש בצמחי מרפא בחלוקה לפי אבחנה. מוני הלביש, מכנים ושכיחות ברמת הביקור עבור 16 תוויות צמחי מרפא מנורמליות בכבד שומני (n = 77), שחמת הכבד (n = 46) וגסטריטיס כרונית (n = 133). כל תווית צמח נספרה לכל היותר פעם אחת לביקור מרשם זכאי.

טבלה נלווית 1: רישום שקיפות וביקורת בסיוע AI. תיעוד המבדיל בין רישום הניתוח המקורי לבין סקר העקביות שנערך בשלב העריכה ב-21 באוגוסט 2026. הטבלה מתעדת את הכלי/מודל/גרסה, היקף הקלט, המטרה, חוסר התאמה מזוהה בקרדינליות של Four-Qi, תיקון אנושי, מגבלות שימוש, פרטי הסוקר, הכרעה ותבנית הפרומפט. לא סופקו למערכת ה-AI שורות נתונים גולמיות ברמת המטופל. אנא לחץ כאן כדי להוריד קובץ זה.

טבלה משלימה 2: תוצאות איכות נתונים של ביקורת מקורות. שלמות שדות משוחזרים, ממצאי ביקורת, פעולות אנליטיות ומצבי שחרור מדווחים עבור שדות קליניים של המקור ומבנים אנליטיים ישנים. הטבלה מתעדת החרגה של מחווני תסמונות ישנים שלא הותאמו, תיקון של סך כל הצמחים מנתונים מוקדמים, היעדר וקטורי התפלגות ניתנים לשחזור לפני ניקוי להערכת יציבות בין גרסאות, וכמויות שלא ניתן היה לשחזר. אנא לחץ כאן להורדת קובץ זה.

טבלה משלימה 3: מיפוי שמות צמחים. תוויות תצוגה מבוקרות של צמחים מקושרות למסייגי עיבוד, שמות סטנדרטיים של חומרי רפואה סינית (CMM), טרמינולוגיית מקור, מקורות בוטניים, זואולוגיים או מינרליים, גרסאות ייחוס, מזהי ראיות וגבולות ראיות. תוויות ספציפיות לעיבוד נשמרות כאשר יש להן משמעות קלינית. אנא לחצו כאן להורדת קובץ זה.

טבלה משלימה 4: ניתוחי רגישות לסף ולביקורים חוזרים. מדווחים שינויים בסף כללי האסוציאציה, השוואות של מערכי כללים של ביקור אחד למטופל, מדדי רגישות של Chi Shao > Fu Ling, והשוואת מרחק קלט לצבירה של 190 זוגות. אנא לחצו כאן כדי להוריד קובץ זה.

קובץ משלים 1: סקריפט לרגישות לסף דטרמיניסטי ולביקורים חוזרים. סקריפט דטרמיניסטי המשמש לשחזור מדדי סף מצטברים ומדדי רגישות לביקורים חוזרים מתוך מערך הנתונים המקורי עם גרסה נעולה. הקובץ אינו מכיל נתונים ברמת המטופל. אנא לחצו כאן כדי להוריד קובץ זה.

דיון

התרומה המרכזית של פרוטוקול זה היא נתיב מלא הניתן לבקרה, החל מרישומי מקרים של TCM ללא זיהוי ועד לדמויות מחקר מצטברות. השלבים הקריטיים ביותר הם הקפאת הכלל לזיהוי когоרט לפני בדיקת תוצאות הניתוח, הבחנה בין מטופלים ייחודיים לבין ביקורי מרשמים, שימור של כל מיפוי מונחים ממקור למנורמל, ואימות של כל מונה ומכנה לפני ההדמיה. בקרות אלו הופכות את ניקוי הנתונים מפעילות מקדימה בלתי נראית לרכיב מתועד של השיטה. הן גם מתאימות את זרימת העבודה לסטנדרטים של RECORD, STROBE, FAIR ומסגרות מבוססות לבקרת איכות נתוני EHR11,12,13,14,15. תוצאה נחשבת למוכנה להפצה רק כאשר ניתן לעקוב אחר שדה המקור, יחידת הניתוח, גרסת המילון, כלל החישוב, המכנה, הטבלה, הדמות והחלטת הבודק בתוך ספר הראיות.

השיטה היא חדשנית מכיוון שממשל, הנדסת טרמינולוגיה, חישוב, ויזואליזציה וסקירה קלינית משולבים יחד במקום להיתפס כמשימות נפרדות. מטריצת תסמינים מפורשת אחת מייצרת את ספקטרום התדירות, רשת השכיחות המשותפת ומפת החום. מטריצת מרשמים-ביקורים לפי צמח אחת תומכת בסיכומי תדירות, כללי אסוציאציה מכוונים ואשכולה היררכית19,20,21. טבלה אחת מרובדת לפי אבחנה תומכת הן באחוזים מדויקים והן במפת החום הסופית. זרימת העבודה האנליטית משתמשת בכלים של קוד פתוח, הניתנים לשחזור ובשליטה באמצעות סקריפטים36,37,38,39,40, מה שמאפשר לתיקון במילון מקדים או בהחלטה לגבי קוהורט להשפיע על כל התוצרים התלויים בו. עבודה קודמת עם מחסני נתונים קליניים מדגימה אף היא את החשיבות של עיבוד מקדים מקושר למקור ושימוש חוזר בנתונים מובנים41,42. ארכיטקטורה זו מפחיתה את התמלול הידני, שומרת על התאמה בין הקידודים הגרפיים לטבלאות המקור, ומקלה על ביקורת, הוראה והעברה לצוותי מחקר אחרים.

שלושה מחקרי כריית מאגרי נתונים מהזמן האחרון מספקים עקרונות תכנון מועילים, למרות שיחידת הניתוח שלהם היא פרסום ולא ביקור קליני. המחקר על דלקת מפרקים שיגרונית ודיכאון משלב אסטרטגיית חיפוש שהוגדרה מראש עם ניתוחים של מדינות, מוסדות, מחברים, כתבי עת, מילות מפתח וציר זמן26. המחקר על קוליטיס כיבית ומעכבי Janus kinase משתמש בניתוחי שיתוף פעולה מתואמים, ציטוטים משותפים (co-citation), אשכולות (clustering) וניתוחי התפרצות (burst analyses) כדי להבדיל בין נושאים מתמידים לבין חזיתות מחקר מתהוות27. המחקר על דלקת מפרקים שיגרונית ופיברומיאלגיה מרחיב את המיפוי הביבליומטרי באמצעות ביו-אינפורמטיקה, תוך שמירה על הבחנה בין שתי שכבות הראיות28. הפרוטוקול הנוכחי מיישם את אותו עיקרון של נקודות מבט אנליטיות מתואמות אך לא חלופיות. מעבר לתחומי הגינקולוגיה, רפואת נשימה, רהומטולוגיה או התמחות אחרת דורש בנייה מחדש של שדות ספציפיים להתמחות, מילוני מונחים, כללי הכללה והחרגה, תוצאים ונהלי סקירה קלינית לפני שימוש חוזר בסט הכללים. ספקטרומים של מחלות, רשתות תסמוניות, מילות מפתח של תסמינים, כללי אסוציאציה, אשכולות ודפוסים מופרדים לפי אבחנה נגזרים כולם ממקורות בעלי גרסה נעולה, אך כל אחד מהם עונה על שאלה נפרדת ושומר על המכנה וגבול הפרשנות שלו.

בינה מלאכותית תחת פיקוח אנושי יכולה לספק שכבת בקרת איכות נוספת כאשר היא מוגבלת לקטעים מאושרים שעברו הסרת זיהוי או לחומרים מאגדיים. במסגרת זרימת עבודה זו, הבינה המלאכותית יכולה להשוות טרמינולוגיה בין קבצים, לסמן חוסר עקביות בין כיתובים לטבלאות, לזהות תוויות החורגות מגבולות האיור, לוודא שלכל צומת רשת המוצג יש קשת תקינה, ולהציע ניסוח ברור יותר. הבינה המלאכותית אינה קובעת את זכאות הקוהורט, ממציאה מיפויים טרמינולוגיים, מסיקה השפעות טיפול או מחליפה את סקירת נתוני המקור. חלוקה זו של האחריות עקבית עם התפיסה הרחבה לפיה בינה מלאכותית רפואית צריכה להגביר את שיקול הדעת האנושי ולא לטשטש את האחריות33. היא משקפת גם את הדגש של DECIDE-AI על גורמים אנושיים שקופים, טיפול בשגיאות והערכה הניתנת לדיווח34. לפיכך, יש לשמור ביומן הביקורת את מטרת כל הנחיה (prompt), את הפלט שנבדק, את התיקון שהתקבל, את שם הבודק ואת התאריך, בכל פעם שנעשה שימוש בסיוע של בינה מלאכותית.

פתרון בעיות הוא חשוב במיוחד כאשר פלט נראה סביר מבחינה קלינית אך נכשל בהסדרה מול המקור. במקרים כאלו, יש להשהות את הפרשנות הבאה עד שניתן יהיה לייחס את חוסר העקביות לקביעת זכאות, הסרת כפילויות, מיפוי טרמינולוגיה, בחירת שדות, בחירת מכנה או הרכבת איורים. לאחר התיקון, יש להפיק מחדש את כל הפלטים התלויים. הדוגמה המעשית נשארת מאגר נתונים רטרוספקטיבי של מרפאה חיצונית מומחית במרכז אחד, שבו ביקורים חוזרים אינם בלתי תלויים זה בזה. ניתוח רגישות של ביקור אחד למטופל צמצם את סט הכללים שנשמר מ-15 ל-12, תוך שמירה על השיוך של כל 20 עשבי המרקसबसे הבולטים. מתוך כל 190 הזוגות הבלתי מסודרים בין 20 המשתנים המשותפים הללו, מתאם פירסון היה 0.9944, מדד Spearman rho היה 0.9836, השינוי המוחלט הממוצע במרחק ג'קארד היה 0.0146, והשינוי המקסימלי היה 0.0528 (טבלה משלימה 4). בהתאם לכך, אין לפרש תמיכה גבוהה ברמת הביקור כתיקוף ברמת המטופל. ספקטרום מילות המפתח של ההיסטוריה משקף תיעוד מילולי ולא סולם סימפטומים מתוקף. סיכומי Materia-medica משוקללים לפי שכיחות ולא לפי מינון. כללי אסוציאציה מתארים רישום משותף ולא סיבתיות. מפות חום מובחנות לפי אבחנה הן תיאוריות ואינן מבססות יעילות השוואית, ספציפיות למחלה או נחיצות טיפולית.

ניתן להחיל את הפרוטוקול על מחקרים בנושא ירושה של ניסיון קליני מומחה, תיאור של קבוצות מטופלים במרפאות חוץ של מומחים, הרמוניזציה של טרמינולוגיה רב-מרכזית, סקירת איכות התיעוד, בחירת משתנים עבור רשומות פרוספקטיביות והכנה של מאגרי נתונים שיתופיים מצובריים תוך שמירה על פרטיות. עבודות עתידיות יכולות לשלב איסוף פרוספקטיבי מובנה של תסמינים, מודלים מקובצים לפי מטופלים, משתני מינון מפורשים, היפותזה השוואתית שנקבעה מראש, תיקוף חיצוני, שירותי טרמינולוגיה מגרסאים, חישוב משמר פרטיות וספרי ראיות אינטראקטיביים. עיבוד שפה טבעית וסקירה בעזרת AI עשויים להפחית עוד יותר את הצורך באוצרות חוזרת, כאשר אלו מנוהלים על ידי כללים בעלי גרסה נעולה ואימות אנושי. באופן רחב יותר, הפרוטוקול מאפשר להפוך ניסיון קליני מפוזר לאובייקט מחקר שקוף שניתן לבחון, לשחזר, להטיל בספק ולהרחיב. השיטה אינה הופכת שכיחות ליעילות; תחת זאת, היא הופכת החלטות אנליטיות לא מתועדות לראיות גלויות, ובכך מספקת תשתית לשאלות קליניות קפדניות יותר ולמחקר TCM מהעולם האמיתי עמיד יותר.

גילויים

המחברים מצהירים כי אין ניגודי אינטרסים.

תודות

במהלך השכתוב של כתב היד נעשה שימוש בלעדי ב-OpenAI Codex (gpt-5.6-luna ו-gpt-5.6-sol) לצורך בדיקות עקביות בין קבצים ברמת המקבילים והצעות לניסוח. לא הועברו רשומות ברמת המטופל למערכת ה-AI. כל הפלטים שנוצרו בסיוע בינה מלאכותית אומתו באופן עצמאי מול חומרי המקור על ידי Tian Xia ב-21 באוגוסט 2026. המחברים סקרו ואישרו את התוכן הסופי ונושאים באחריות מלאה לכתב היד. פרויקט זה נתמך על ידי התוכנית הלאומית למחקר ופיתוח מפתח של סין, פרויקט מפתח מיוחד למודרניזציה של הרפואה הסינית המסורתית (מס' 2025YFC3512800); הפרויקט הלאומי הגדול למדע וטכנולוגיה של סין (פרויקט מס' 2026ZD0554100; תת-פרויקט מס' 2026ZD0554101); הפרויקט לשיפור יכולת המחקר הקליני ותרגום ההישגים של בתי חולים מרכזיים ברמה גבוהה לרפואה סינית מסורתית, פרויקט מיוחד להנחלת הניסיון האקדמי של מומחים בכירים ידועים לרפואה סינית מסורתית (מס' HLCMHPP2023016); והקרן למדעים טבעיים של האזור האוטונומי שינג'יאנג אויגור (מס' 2025D01C213).

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
גיליונות אלקטרוניים לניתוח מחדש של נתונים מצטבריםקבצים מקומיים שהופקו על ידי המחבריםלא רלוונטישימשו לספירות מצטברות, טבלאות והפקת איורים.
ייצוא רשומות מקרי מרפאות חוץ ללא זיהוימערכת רשומות רפואיות אלקטרוניות מוסדיתלא רלוונטישימש רק בסביבה מוסדית מבוקרת; רשומות ברמת מטופל אינן מהוות חומרי הגשה.
lxmllxml project6.1.1גרסת התוכנה ששימשה לסריאליזציה השומרת על מרחב השמות במהלך יצירה מחדש בשלב העריכה; אינה גרסה היסטורית של הניתוח המקורי.
MatplotlibMatplotlib project (matplotlib.org)3.11.1גרסה שנצפתה בסביבת היצירה מחדש בשלב העריכה ובמטא-נתוני SVG של איור 3; אינה גרסה היסטורית של הניתוח המקורי.
NetworkXNetworkX projectPyPI package: networkxמזהה החבילה תועד; הגרסה המדויקת בשלב העריכה לא אומתה בסביבה שהורשתה.
NumPyNumPy project2.3.5גרסת התוכנה ששימשה ליצירה מחדש של פלטי הנתונים המצטברים המעודכנים; אינה גרסה היסטורית של הניתוח המקורי.
openpyxlopenpyxl project3.1.5גרסת התוכנה ששימשה לכתיבת פלטי XLSX המצטברים המעודכנים; אינה גרסה היסטורית של הניתוח המקורי.
pandaspandas project3.0.1גרסת התוכנה ששימשה ליצירה מחדש של פלטי הנתונים המצטברים המעודכנים; אינה גרסה היסטורית של הניתוח המקורי.
PyMuPDFPyMuPDF project1.28.2גרסת התוכנה ששימשה ליצירה מחדש של פלטי איורים מעודכנים בשלב העריכה; אינה גרסה היסטורית של הניתוח המקורי.
PythonPython Software Foundation3.13.15גרסת התוכנה ששימשה ליצירה מחדש של פלטי הנתונים המצטברים המעודכנים; אינה גרסה היסטורית של הניתוח המקורי.
SciPySciPy projectPyPI package: scipyמזהה החבילה תועד; הגרסה המדויקת בשלב העריכה לא אומתה בסביבה שהורשתה.

מקורות

  1. Wang YH, et al. Study on knowledge discovery in traditional Chinese medical case records [in Chinese]. Zhong Xi Yi Jie He Xue Bao. 2007;5(4):368-372.
  2. Wang Y, et al. Automatic symptom name normalization in clinical records of traditional Chinese medicine. BMC Bioinformatics. 2010;11:40.
  3. Zhou L, et al. Natural language processing algorithms for normalizing expressions of synonymous symptoms in traditional Chinese medicine. Evid Based Complement Alternat Med. 2021;2021:6676607.
  4. Chu X, et al. Quantitative knowledge presentation models of traditional Chinese medicine (TCM): a review. Artif Intell Med. 2020;103:101810.
  5. Zhang T, et al. Constructing fine-grained entity recognition corpora based on clinical records of traditional Chinese medicine. BMC Med Inform Decis Mak. 2020;20:64.
  6. Wang Q, et al. A study of entity-linking methods for normalizing Chinese diagnosis and procedure terms to ICD codes. J Biomed Inform. 2020;105:103418.
  7. Zhang H, et al. Transformer- and generative adversarial network-based inpatient traditional Chinese medicine prescription recommendation: development study. JMIR Med Inform. 2022;10(5):e35239.
  8. Dan W, et al. SinoMedminer: an R package and Shiny application for mining and visualizing traditional Chinese medicine herbal formulas. Chin Med. 2025;20:80.
  9. Chinese Pharmacopoeia Commission. Pharmacopoeia of the People's Republic of China. 2025 ed. China Medical Science and Technology Press; Beijing; 2025.
  10. Editorial Committee of Zhonghua Bencao, State Administration of Traditional Chinese Medicine. Zhonghua Bencao. 10 vols. Shanghai Scientific and Technical Publishers; Shanghai; 1999. ISBN: 7532351068. Available from: National Diet Library record
  11. Benchimol EI, et al. The REporting of studies Conducted using Observational Routinely-collected health Data (RECORD) statement. PLoS Med. 2015;12(10):e1001885.
  12. von Elm E, et al. The Strengthening the Reporting of Observational Studies in Epidemiology (STROBE) statement: guidelines for reporting observational studies. Lancet. 2007;370(9596):1453-1457.
  13. Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Sci Data. 2016;3:160018.
  14. Weiskopf NG, Weng C. Methods and dimensions of electronic health record data quality assessment: enabling reuse for clinical research. J Am Med Inform Assoc. 2013;20(1):144-151.
  15. Kahn MG, et al. A harmonized data quality assessment terminology and framework for the secondary use of electronic health record data. EGEMS (Wash DC). 2016;4(1):18.
  16. Kovačević A, Bašaragin B, Milošević N, Nenadić G. De-identification of clinical free text using natural language processing: a systematic review of current approaches. Artif Intell Med. 2024;151:102845.
  17. Meystre SM, et al. Text de-identification for privacy protection: a study of its impact on clinical text information content. J Biomed Inform. 2014;50:142-150.
  18. Neamatullah I, et al. Automated de-identification of free-text medical records. BMC Med Inform Decis Mak. 2008;8:32.
  19. Agrawal R, Srikant R. Fast algorithms for mining association rules in large databases. Presented at: 20th International Conference on Very Large Data Bases; Santiago, Chile; 1994. p. 487-499.
  20. Hahsler M, Grün B, Hornik K. arules: a computational environment for mining association rules and frequent item sets. J Stat Softw. 2005;14(15):1-25.
  21. Murtagh F, Contreras P. Algorithms for hierarchical clustering: an overview. WIREs Data Min Knowl Discov. 2012;2(1):86-97.
  22. van Eck NJ, Waltman L. Software survey: VOSviewer, a computer program for bibliometric mapping. Scientometrics. 2010;84(2):523-538.
  23. Chen C. CiteSpace II: detecting and visualizing emerging trends and transient patterns in scientific literature. J Am Soc Inf Sci Technol. 2006;57(3):359-377.
  24. Aria M, Cuccurullo C. bibliometrix: an R-tool for comprehensive science mapping analysis. J Informetr. 2017;11(4):959-975.
  25. Donthu N, et al. How to conduct a bibliometric analysis: an overview and guidelines. J Bus Res. 2021;133:285-296.
  26. Zhao Y, Chen GY, Fang M. Research trends of rheumatoid arthritis and depression from 2019 to 2023: a bibliometric analysis. J Multidiscip Healthc. 2024;17:4465-4474.
  27. Wang Y, et al. Research trends and hotspots in JAK inhibitors for ulcerative colitis: a bibliometric analysis from 2015 to 2024. J Multidiscip Healthc. 2025;18:6755-6771.
  28. Chen G, Yan Z, Wang Y, Tao Q. Rheumatoid arthritis and fibromyalgia syndrome: a bibliometric and bioinformatics perspective on comorbidity research. J Multidiscip Healthc. 2025;18:6811-6827.
  29. Wang SL, et al. Yao Naili's experience in applying the harmonizing liver and spleen method. Journal of Traditional Chinese Medicine. 2008;49(7):596-597.
  30. Wang L, et al. Analysis of Professor Naili Yao's experience in treating spleen-stomach diseases [in Chinese]. Lishizhen Med Mater Med Res. 2022;33(6):1436-1438.
  31. Sandve GK, Nekrutenko A, Taylor J, Hovig E. Ten simple rules for reproducible computational research. PLoS Comput Biol. 2013;9(10):e1003285.
  32. Munafò MR, et al. A manifesto for reproducible science. Nat Hum Behav. 2017;1:0021.
  33. Topol EJ. High-performance medicine: the convergence of human and artificial intelligence. Nat Med. 2019;25(1):44-56.
  34. Vasey B, et al. Reporting guideline for the early-stage clinical evaluation of decision support systems driven by artificial intelligence: DECIDE-AI. Nat Med. 2022;28(5):924-933.
  35. Branch of Gastrointestinal Diseases, China Association of Chinese Medicine. Expert consensus on traditional Chinese medicine diagnosis and treatment of Gan pi (2023). Chinese Journal of Integrative Digestive Diseases. 2024;32(9):741-747.
  36. McKinney W. Data structures for statistical computing in Python [conference paper]. Presented at: 9th Python in Science Conference; Austin, TX; 2010. p. 56-61. doi:10.25080/Majora-92bf1922-00a.
  37. Harris CR, et al. Array programming with NumPy. Nature. 2020;585(7825):357-362.
  38. Virtanen P, et al. SciPy 1.0: fundamental algorithms for scientific computing in Python. Nat Methods. 2020;17(3):261-272.
  39. Hunter JD. Matplotlib: a 2D graphics environment. Comput Sci Eng. 2007;9(3):90-95.
  40. Hagberg AA, Schult DA, Swart PJ. Exploring network structure, dynamics, and function using NetworkX. Presented at: 7th Python in Science Conference; Pasadena, CA; 2008. p. 11-15. doi:10.25080/TCWV9851.
  41. Zhou X, et al. Development of traditional Chinese medicine clinical data warehouse for medical knowledge discovery and decision support. Artif Intell Med. 2010;48(2-3):139-152.
  42. Liu B, et al. Data processing and analysis in real-world traditional Chinese medicine clinical data: challenges and approaches. Stat Med. 2012;31(7):653-660.

הדפסות חוזרות והרשאות

תגיות

רשומות מקרים מהעולם האמיתיפרוטוקול מבוקר-מקורנורמליזציה של נתוניםספקטרום של מרכיבי תסמוניתשכיחות צמחיםפרופילי Materia Medicaכללי אסוציאציהויזואליזציה של נתונים קליניים