פרוטוקול זה מתאר את פיתוח והערכתו של צ'אטבוט מבוסס הנחיות, מבוסס הנחיות, שאוסף ומסכם תוכן מהנחיות פרקטיקה קלינית מבוססת רשת לסרטן כדי ליצור תגובות מבוססות התייחסות לשאילתות משתמשים.
מאמר שיטה
פרוטוקול זה מתאר את פיתוח והערכתו של צ'אטבוט מבוסס הנחיות, מבוסס הנחיות, שאוסף ומסכם תוכן מהנחיות פרקטיקה קלינית מבוססת רשת לסרטן כדי ליצור תגובות מבוססות התייחסות לשאילתות משתמשים.
הזמינות הנרחבת של מידע רפואי באינטרנט שיפרה את הגישה לידע הקשור לבריאות עבור המטופלים; עם זאת, היא גם הגבירה את החשיפה למידע רפואי שגוי. טיפול בסרטן כולל מידע מורכב, מה שמקשה על המטופלים לזהות מקורות מדויקים ומבוססי ראיות. מודלים גדולים מאפשרים אינטראקציה עם שפה טבעית אך לעיתים קרובות יוצרים הזיות, מה שמגביל את יישמתן בהעברת מידע רפואי. ייצור משודרג בשחזור (RAG) יכול להפחית סיכונים אלו על ידי עיגון תגובות במקורות ייחוס חיצוניים. מחקר זה מתאר את פיתוח והערכתו של צ'אטבוט RAG המבוסס על הנחיות, המשתמש בהנחיות קליניות מבוססות רשת לציבור. המערכת מחלקת כתובות URL מדפי תוכן העניינים של המנחה, מעבדת טקסט עמוד באמצעות ניתוח מורפולוגי ודמיון קוסינוסי בהתבסס על תדירות מונחים ותדירות הפוכה של מסמך, ובונה מידע הפניה מדפים רלוונטיים מאוד. מודל שפה גדול משתמש בהפניות אלו כדי לייצר תגובות המוגבלות לתוכן המנחה. מדריך JLCS לחולי סרטן ריאות ומשפחותיהם שימש כהנחיה עיקרית. מערכי השאלות כללו גם סוגי סרטן בתוך ההיקף המכוסים בהנחיה וגם סוגי סרטן מחוץ לתחום להערכת ביקורת תגובה. מידע רפואי חולץ בהצלחה מדפי תוכן העניינים, כאשר 98% מהכתובות שהופקו הכילו תוכן רפואי שניתן להתייחס. בשאלות בתוך היקף, הצ'אטבוט יצר תגובות על ידי סיכום תוכן ההנחיות, ולא זוהו הזיות במהלך הבדיקה הידנית תחת תנאי הבדיקה שהוגדרו. בשאלות מחוץ לתחום, הצ'אטבוט סירב בעקביות לענות והציין שהמידע הזמין אינו מספיק. מבנה האינטרנט של המדריך אפשר גירוד יעיל וארגון של תוכן ההפניה ברמת ה-URL. פרוטוקול זה מספק הנחיות מעשיות לבניית מערכות בינה מלאכותית המספקות מידע רפואי באמצעות הנחיות קליניות מבוססות רשת.
השימוש הנרחב באינטרנט וברשתות החברתיות הקל על המטופלים לגשת למידע רפואי 1,2. מידע על טיפול בסרטן הוא לעיתים קרובות מורכב ונרחב, מה שמקשה במיוחד על המטופלים לזהות מקורות מדויקים, רלוונטיים ומבוססים על ראיות מדעיות3. בעוד שמשאבים מקוונים יכולים לתמוך בהבנת המטופל, הם גם מכילים כמויות משמעותיות של מידע רפואי שגוי3, מה שעלול להשפיע לרעה על החלטות המטופלים לגבי הטיפול שלהם4. מכיוון שמידע שגוי הקשור לסרטן יכול להשפיע על תוצאות המטופלים5, יש צורך גובר במערכות בינה מלאכותית (AI) שיכולות לסייע למשתמשים בודדים לחפש, לסכם ולפרש מידע רפואי6.
מודלים לשוניים גדולים (LLMs) מאפשרים למשתמשים לגשת למידע דרך שיחה בשפה טבעית7; עם זאת, יצירת מידע שגוי (כלומר, הזיות) נותרה דאגה רצינית בתחום הרפואה 8,9,10,11. מקור מרכזי למידע שגוי הוא איכות ודיוק נתוני האימון ששימשו לפיתוח הצ'אטבוט. בנוסף, האופי הסטטי של אימון מודלים גורם לכך שהידע עלול להפוך למיושן עם הזמן, מה שמגביל את יכולתם של מודלים גדולים גדולים לספק מידע עדכני ורלוונטי להקשר12,13. מגבלות אלו מדגישות את החשיבות של אסטרטגיות ניהול ידע יעילות כדי להבטיח שתגובות הצ'אטבוטים יישארו מדויקות, רלוונטיות ומעודכנות. במיוחד, מערכות שיכולות לגשת בקלות ולהתייחסות למשאבים מבוססי ראיות עדכניים, כגון הנחיות לפרקטיקה קלינית, רצויות בסביבות רפואיות, שבהן ההמלצות והסטנדרטים של הטיפול משתנים כל הזמן. כדי להתמודד עם אתגר זה, יצירת שליפה-מוגברת (RAG), שמייצרת תגובות על ידי שילוב מידע ממקורות ידע חיצוניים, זכתה לתשומת לב גוברת 10,13,14,15,16,17.
למרות ש-RAG מיושם יותר ויותר בצ'אטבוטים רפואיים, הושם דגש מוגבל על האופן שבו יש לשלב באופן שיטתי הנחיות פרקטיקה קלינית כמקורות מידע עיקריים18. הנחיות רבות לפרקטיקה קלינית זמינות לציבור באינטרנט; עם זאת, עדיין לא ברור אם מבנה האינטרנט הקיים שלהם יכול לשמש ישירות כמסגרת שליפת למערכות RAG18. בנוסף, שיטות מעשיות לבניית מידע ייחוס ללא פיתוח מבוסס ידע ידני לא הוכחו היטב.
במחקר זה, מטרתנו לקבוע עקרונות עיצוב למערכות בינה מלאכותית המתייחסות להנחיות בתחום הרפואה על ידי פיתוח והערכה של צ'אטבוט RAG מבוסס הנחיות, המשתמש בהנחיות קליניות מבוססות רשת הזמינות לציבור, ובכך לאפשר גישה פשוטה ובזמן למידע מבוסס הנחיות. כהוכחת מושג, הערכנו את ההיתכנות הטכנית של שליפת הנחיות, יצירת תגובות והגבלת תגובה באמצעות מבנה האינטרנט הקיים של הנחיות לפרקטיקה קלינית זמינה לציבור, במטרה להציע פרוטוקול פיתוח שניתן לשחזר למערכות RAG המונחות על פי הנחיות.
מחקר זה אינו כולל נבדקים אנושיים הזקוקים להגנה מפני סיכונים הכרוכים במחקר. לכן, אין צורך בבדיקה של ועדת ביקורת מוסדית בהתאם להנחיות האתיקה היפניות למחקר רפואי הכולל נבדקיםאנושיים 19. מחקר זה מדווח בהתאם לדיווח שקוף של מודל רב-משתני לפוגנוזה או אבחון אישי (TRIPOD)-LLM20.
עיין באיור 1 לסקירה סכמטית של פרוטוקול הצ'אטבוט RAG המבוסס על הנחיות.

איור 1. זרימת העבודה של פרוטוקול הצ'אטבוט RAG מבוסס הנחיות. סקירה סכמטית של זרימת העבודה בצ'אטבוט RAG המבוססת על הנחיות. כתובות URL מופקות מדף תוכן העניינים של הנחיות קליניות מבוססות רשת ומשמשות לבניית מידע הפניות. שאילתות משתמשים מומרת למילות מפתח, ותוכן דף האינטרנט מעובד באמצעות טוקניזציה, וקטוריזציה של תדירות מונחים–הפוך לתדירות מסמכים, וניתוח דמיון קוסינוסי לזיהוי דפי הנחיות רלוונטיים. מידע ייחוס נבחר משולב ומסופק למודל שפה גדול כדי לייצר תגובות המבוססות אך ורק על תוכן ההנחיה המוזכר. הפאנל הימני מסכם את פריטי ההערכה ששימשו לכתובות URL שחולצו, מידע הפניה ותגובות לצ'אטבוט. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
1. הכנת מידע מקובע מהנחיות מבוססות רשת
2. יצירת מילות מפתח משאילתות משתמשים
"3. עיבוד טקסט וחישוב דמיון
4. בניית מידע רפרנס
5. יצירת תגובה מבוססת בינה מלאכותית
6. הנחיות מקורות וניסוח שאלות
7. הערכת תגובה
אחזור תוכן רפואי דרך דפי תוכן העניינים
ארכיטקטורת גרידת האתרים אספה כתובות URL מדף תוכן העניינים של ההנחיה. מתוך מדריך הריאות נלקחו 106 כתובות URL מדף תוכן העניינים, מתוכם 104 (98%) הכילו מידע רפואי (טבלה משלימה 1). היעילות של תגובות הצ'אטבוטים בהתבסס על דפי תוכן ההנחיה מסוכמת בטבלה 1. הצ'אטבוט יצר תשובות לכל ארבע מילות המפתח הקליניות כאשר השאלות היו בתחום ההנחיה. לצורך "אבחון גידול תימי" ו"אבחון פתולוגי", הוצאו שלושה כתובות URL קשורות לכל מילת מפתח, וכל כתובות ה-URL שחולצו נחשבו לתוקפות (100%). עבור "שיטות טיפול" ו"טיפול כירורגי", הוצאו 15 כתובות URL לכל מילת מפתח, כאשר 14 פריטים יעילים (93%).
| שאילתה | מילות מפתח | פריטי תוכן מוזכרים, n | פריטי ייחוס אפקטיביים, n (%) |
| אילו שיטות אבחון זמינות לגידולי תימיים? | אבחון גידול תימי | 3 | 3 (100) |
| מהן הגישות האבחנתיות הפתולוגיות לגידולי תימיים? | אבחנה פתולוגית של גידול תימי | 3 | 3 (100) |
| אילו אפשרויות טיפול קיימות לגידולים של תימיים? | שיטות טיפול בגידול תימי | 15 | 14 (93) |
| מהן אפשרויות הטיפול הכירורגי לגידולי תימיים? | טיפול כירורגי בגידול תימי | 15 | 14 (93) |
טבלה 1: תוכן מידע מקורי ותגובות לצ'אטבוטים בהתבסס על מדריך JLCS לחולי סרטן ריאות ומשפחותיהם. סיכום שאילתות המשתמשים, מילות מפתח שנוצרו, מספר פריטי התוכן שזוהו באמצעות שליפה מבוססת דמיון, ומספר פריטי ההתייחסות היעילים המכילים מידע רפואי. פריטי תוכן מוזכרים מייצגים את סך כל דפי האינטרנט הקשורים שזוהו ברמת כתובת ה-URL על בסיס כל מילת מפתח. פריטי עזר אפקטיביים מייצגים את מספר ואחוז הדפים הייחודיים המכילים מידע רפואי לאחר השלמת כתובות URL כפולות ודפי אינטרנט שאינם רפואיים.
תגובות צ'אטבוט לשאלות בתוך היקף
טבלה 2 מציגה את תגובות הצ'אטבוט לשאלות שנכנסו להיקף ההנחיות שסופקו. כאשר היה מידע מספק על הפניות, הצ'אטבוט יצר תגובות על ידי סיכום החלקים הרלוונטיים של טקסט ההנחיה. התשובות שנוצרו כללו כ-350 תווים יפניים. לא זוהו הזיות במהלך סקירה ידנית תחת תנאי הבדיקה שהוגדרו. לשאלות בתוך היקף אלו, מספר פריטים אפקטיביים עם הפניה תמכו ביצירת תשובות (טבלה 1). הטקסט היפני שנוצר תורגם לאנגלית באמצעות גרסת ChatGPT 5.2 ולאחר מכן נבדק על ידי החוקרים לדיוק ועקביות עם התגובות היפניות המקוריות.
| שאילתה | תגובות | מספר התווים | ||||
| אילו שיטות אבחון זמינות לגידולי תימיים? | האבחון של גידולים תימיים דורש גם אבחנה דימותית וגם אבחנה פתולוגית. לאבחון הדמיה, מבצעים CT לחזה ו-MRI לחזה. תימומה וקרצינומה תימית הן גידולים מוצקים שאינם מכילים רכיבים של אוויר או נוזלים בתוך הגידול, וחדירה לרקמות הטבעיות הסובבות ידועה כקלה בתימומה ובולטת יותר בקרצינומה. כאשר מחקרי הדמיה קובעים שאין חדירה לרקמות הסובבות או שאין גידולים מרוחקים מהנגע הראשי (גרורות), הגידול מוסר בניתוח ומתבצע אבחון פתולוגי באמצעות הדגימה הכירורגית. כאשר כריתה כירורגית קשה, מתבצעת ביופסיה מונחית CT, ואבחנה מתבצעת על ידי קבלת חלק מרקמת הגידול. באבחון פתולוגי, תימומות מסווגות לפי שיעור הלימפוציטים התקינים בתוך הגידול ומורפולוגיית תאי הגידול, בעוד שקרצינומות תימיות מסווגות בפירוט לפי תת-סוג היסטולוגי. לקביעת השלב הקליני (שלב), נלקח בחשבון היקף התפשטות הנגעים בגידול התימי, והגידולים מסווגים לשלבים I עד IV בהתבסס על שלוש מערכות סיווג שלבים. | 366 | ||||
| מהן הגישות האבחנתיות הפתולוגיות לגידולי תימיים? | באבחון פתולוגי של גידולי תימיים, מתבצעת בדיקה פתולוגית על ידי קבלת חלק או כל רקמת הגידול. תימומות מסווגות לתתי-סוגים כמו סוג A וסוג AB בהתבסס על שיעור הלימפוציטים התקינים הכלולים בגידול ומורפולוגיית תאי הגידול. לעומת זאת, קרצינומה תימית היא גידול ממאיר המאופיין באטיפיה תאית, וקרצינומה של תאי קשקש היא תת-הסוג ההיסטולוגי הנפוץ ביותר. באמצעות אבחון פתולוגי, מוערכים המאפיינים הביולוגיים ומידת התקדמות הגידול, דבר השימושי לבחירת אסטרטגיות טיפול מתאימות ולחיזוי פרוגנוזה. בנוסף, אבחון פתולוגי של גידולי תימיים מאפשר קביעת שלב המחלה, ומספק מידע חשוב לתכנון הטיפול. שלב קליני מסווג בשלושה מערכות—סיווג מסאוקה, סיווג מסאוקה–קוגה, וסיווג UICC–TNM—והגידולים מחולקים לארבעה שלבים, משלב I ועד שלב IV, בהתאם להיקף התפשטות ופלישה של הגידול. אבחון פתולוגי מספק מידע חיוני לטיפול המתאים ולהערכה פרוגנוסטית של גידולי תימיים. | 330 | ||||
| אילו אפשרויות טיפול קיימות לגידולים של תימיים? | אפשרויות הטיפול בגידולי תימיים כוללות טיפול כירורגי (ניתוח), טיפול קרינתי וטיפול תרופתי (כימותרפיה). הניתוח מתבצע כהליך שבו התימוס נכרך לחלוטין יחד עם הגידול, ובמקרים של תימומה, ייתכן שלא יידרש טיפול נוסף. בקרצינומה תימית, ניתן להוסיף טיפול קרינתי לאחר ניתוח כאשר הסרטן התפשט לרקמות הסובבות. כימותרפיה או כימורתרפיה רדיוטיפולית מתבצעת במקרים בהם ניתוח קשה או כאשר יש הישנות או גרורות מרוחקות, ואלו משמשים כחלק מטיפול תרופתי. בנוסף, עבור קרצינומה תימית מתקדמת או חוזרת, מתבצע טיפול המתמקד בכימותרפיה, וטיפול רב-מודלי המשלב ניתוח וטיפול קרינתי ניתן גם לפי הצורך. בנוסף, עבור קרצינומה תימית מתקדמת או חוזרת לאחר כימותרפיה, ניתן להשתמש בלנבטיניב, חומר טיפולי מולקולרי ממוקד. השילוב המתאים של שיטות הטיפול נבחר בהתאם למצב המחלה ולמצב הקליני של המטופל. | 342 | ||||
| מהן אפשרויות הטיפול הכירורגי לגידולי תימיים? | טיפול כירורגי לגידולי תימיים מתבצע כאשר הגידול נקבע כניתן לניתוח לחלוטין. בניתוח, נהוג להוציא את כל התימוס יחד עם הגידול. במקרים של תימומה, אם הגידול מוסר לחלוטין, אין צורך בטיפול נוסף. לעומת זאת, במקרים של קרצינומה תימית, כאשר חדירת סרטן לרקמות הסובבות, ניתן להוסיף טיפול קרינתי משני לאחר הניתוח. כאשר ניתוח נחשב קשה, מתבצעת תחילה כימותרפיה או כימותרפיה, ולאחר מכן נשקלת ניתוח אם הוא אפשרי. אם לא ניתן לבצע ניתוח, ניתן להמשיך בכימותרפיה או בכימורתרפיה. בנוסף, גם כאשר ניתוח אפשרי, אם לא ניתן להשיג כריתה מלאה, ניתן לבצע טיפול קרינתי או כימורטיפולי רדיוטיפולי לאחר ניתוח לטיפול בגידול שנותר. הטיפול הכירורגי נבחר בהתאם לסוג הגידול ולמידת התקדמות המחלה. | 342 | ||||
טבלה 2: תגובות שנוצרו על ידי הצ'אטבוט מבוסס הנחיה (RAG) המבוסס על מדריך JLCS לחולי סרטן ריאות ומשפחותיהם. תגובות מייצגות שנוצרו על ידי צ'אטבוט RAG המבוסס על הנחיות לשאלות הקשורות לגידולי תימיים באמצעות מידע הפניה שנלקח מהמדריך JLCS לחולי סרטן ריאות ומשפחותיהם (https://www.haigan.gr.jp/public/guidebook/2024/). הטבלה כוללת את שאילתת המשתמש, את התגובה שנוצרה על ידי צ'אטבוט, ואת אורך התגובה. מספר התווים נמדד בתגובות המקוריות ביפנית לפני התרגום לאנגלית באמצעות ChatGPT גרסה 5.2.
תגובות בצ'אטבוט לשאלות מחוץ לתחום
תגובות הצ'אטבוטים לשאלות שאינן בתחום מדריך הריאות מסוכמות בטבלה 3. למרות שמספר מוגבל של פריטי תוכן הופנו לשאלות אלו, מודל יצירת התשובה קבע שהמידע הזמין אינו מספיק ליצירת תגובה מבוססת ראיות. כתוצאה מכך, הצ'אטבוט החזיר תגובות שהצביעו על חוסר מידע מספק לשאילתות מחוץ לתחום היעד. האמירות "אין מספיק מידע בטקסט" ו"אין הפניות." היו תגובות מוגדרות מראש בהנחיות המערכת. הראשון הוחזר כאשר מידע ההתייחסות שהוחזר לא הספיק לענות על השאלה, בעוד שהשני הוחזר כאשר לא נאספה מידע ייחוס.
| שאילתה | מילות מפתח | פריטי תוכן מוזכרים, n | תגובת צ'אטבוט |
| אילו שיטות אבחון זמינות לגליומה בילדים? | אבחנת גליומה ילדים | 0 | אין כאן רפרנסים. |
| מהן הגישות האבחנתיות הפתולוגיות לגליומה ילדים? | אבחנה פתולוגית של גליומה בילדים | 13 | אין מספיק מידע בטקסט. |
| אילו אפשרויות טיפול זמינות לגליומה ילדים? | שיטות טיפול בגליומה ילדים | 13 | אין מספיק מידע בטקסט. |
| מהן אפשרויות הטיפול הכירורגי לגליומה בילדים? | טיפול כירורגי בגליומה ילדים | 12 | אין מספיק מידע בטקסט. |
טבלה 3: תגובות צ'אטבוט לשאלות מחוץ להיחום ברמת השאלה הקלינית בהתבסס על מדריך JLCS לחולי סרטן ריאות ומשפחותיהם. תגובות שנוצרו על ידי הצ'אטבוט RAG מבוסס הנחיה (RAG) לשאלות מחוץ להיקף ההנחיה המקורית. הטבלה מסכמת שאילתות משתמשים, מילות מפתח שנוצרו, מספר פריטי התוכן שזוהו באמצעות שליפה מבוססת דמיון, והתגובות שנוצרו בצ'אטבוט. פריטי תוכן מוזכרים מייצגים את סך כל דפי האינטרנט הקשורים שזוהו ברמת כתובת ה-URL על בסיס כל מילת מפתח. פריטי התייחסות אפקטיביים לא חושבו עבור שאלות מחוץ לתחום כי התוכן שנשלף לא הכיל מידע רלוונטי למחלה שנשאלה.
קובץ משלים 1. קוד פייתון לחילוץ כתובות URL וטקסט מתוך הנחיות לפרקטיקה קלינית מבוססת רשת. הקוד המשמש לחילוץ כתובות URL וטקסט דף אינטרנט מדפי תוכן העניינים של הנחיות לפרקטיקה קלינית מבוססת אינטרנט. כתובות ה-URL ותוכן הטקסט שהופקו שימשו לעיבוד טקסט נוסף, ניתוח דמיון ובניית מידע מקורות בתהליך העבודה של צ'אטבוט RAG מבוסס הנחיות. אנא לחצו כאן להורדת הקובץ הזה.
טבלה משלימה 1. רשימת כתובות URL שנלקחו מדף תוכן העניינים של ההנחיה המקוונת וסיווגן כמידע רפואי או לא-רפואי. כתובות URL שנלקחו מדף תוכן העניינים של מדריך JLCS לחולי סרטן ריאות ומשפחותיהם נבדקו ידנית וסווגו כמידע רפואי או לא-רפואי. מידע רפואי הוגדר כתוכן הנחיות שניתן להתייחס, כולל שאלות קליניות (CQs), שאלות רקע, מערכי שאלות וחומרי לימוד משלימים הרלוונטיים להנחיית מטופלים. מידע לא רפואי כלל דפי אינטרנט של חברה או ארגונים, דפי ניווט, קישורים ותכנים נלווים נוספים שלא שימשו כמידע ייחוס ליצירת תגובות בצ'אטבוט. הטבלה מסכמת את כל כתובות ה-URL שהופקו ואת תוצאות הסיווג שלהן. *כתובות URL נלקחו מדף תוכן העניינים של JLCS Guidebook לחולי סרטן ריאות ומשפחותיהם (https://www.haigan.gr.jp/public/guidebook/2024/). אנא לחצו כאן להורדת הקובץ הזה.
במחקר זה בחנו את התועלת של צ'אטבוט RAG מבוסס הנחיה שהשתמש במדריך קליני מבוסס רשת — מדריך JLCS לחולי סרטן ריאות ומשפחותיהם — כמקור מידע עיווני. הצ'אטבוט יצר תגובות מבוססות על תוכן ההנחיות על ידי ניצול מבנה האינטרנט של המדריך ושליפת דפים בהתבסס על הדמיון לשאילתות המשתמשים. גישה זו הראתה כי שליפה מבוססת דמיון בשילוב עם יצירת תגובות מבוססות הנחיה יכולה לתמוך בהעברת מידע רפואי אמין ויעיל. מחקרים עדכניים הדגישו הן את הפוטנציאל והן את המגבלות של צ'אטבוטים רפואיים מבוססי LLM, במיוחד בנוגע להזיות ולאמינות תגובה 12,13,14. בניגוד למחקרים קודמים שהתמקדו במסגרות כלליות של צ'אטבוטים 10,12,13, הפרוטוקול הנוכחי מציג גישה RAG מבוססת הנחיות שניתן לשחזר אותה, שמאחזרת תוכן הנחיות מטופל ברמת כתובת ה-URL ומייצרת תגובות המבוססות על מידע רפרנס מזוהה. לכן, מחקר זה מספק פרוטוקול שקוף להעברת מידע על סרטן במקום מערכת צ'אטבוט קלינית מאומתת במלואה.
במקום לאמן את הבינה המלאכותית על כל קורפוס ההנחיות, המערכת שלנו בחרה רק את ה-CQs הרלוונטיים ביותר לכל שאילתת משתמש כמידע הפניה (איור 1). הרלוונטיות בין טקסט השאלה לכל CQ הוערכה כמותית באמצעות חישובי דמיון קוסינוס מבוססי שפת תכנות עם ייצוגים וקטוריים של TF–IDF. בהתבסס על ציוני הדמיון הללו, CQs דורגו ונבחרו בסדר יורד של רלוונטיות, מה שאפשר חילוץ שיטתי של מקורות מידע מתאימים מתוך ההנחיה ללא הסתמכות על שיפוט סובייקטיבי (טבלה 1). יתרה מזאת, חיבור טקסטי CQ שנאספו והצגתם יחד לבינה המלאכותית סייע לשמור על בסיס ראייתי עקבי ליצירת תגובה, ובכך שיפר את הדיוק והקוהרנטיות ההקשרית של התגובות שנוצרו. במערכות RAG, יצירת מידע נכון תלויה באופן קריטי במקורות ייחוס מדויקים ומתאימים14. עיצוב זה אפשר למערכת לפצות על מידע שלא ניתן היה לכסות מספיק על ידי CQ יחיד, ותרם לתשובות מקיפות וסבירות יותר קלינית. בנוסף, RAG מאפשר שליפת תוכן CQ עדכני ומתאים היטב ליישומים רפואיים מבוססי ראיות10,11. למרות שגישות RAG מבוססות הנחיה תוארו בעבר 11,18, הפרוטוקול הנוכחי שונה בשימושו במבנה האינטרנט הקיים המבוסס על CQ, של הנחיה ממוקדת מטופל, כמסגרת השליפה הראשית. עיצוב זה מספק זרימת עבודה שקופה וניתנת לשחזור שניתן ליישם ללא בניית בסיס ידע ידנית או אימון מחדש של מודלים.
חשוב לציין שהצ'אטבוט הגביל את תגובותיו להיקף ההנחיות שהוזכרו. כאשר השאלות יצאו מתוכן ההנחיות, המערכת נמנעה במפורש מלספק תשובות, ובכך הפחיתה את הסיכון לתשובות לא מגובה. השימוש בדמיון בקוסינוס לבחירת רפרנס בשליטה שיפר עוד יותר את הבטיחות והאמינות של התגובות שנוצרו (טבלה 2). דפי הפניות נאספו גם עבור שאלות שמחוץ להיקף ההנחיות (טבלה 3). ערכי הדמיון בקוסינוס היו גבוהים יותר בשאלות בתוך הטווח (0.20–0.65) מאשר בשאלות מחוץ לתחום (0.20–0.31; הנתונים לא הוצגו), אך ציוני דמיון נמוכים עדיין הוקצו לדפי הנחיות מסוימים גם כאשר התוכן לא היה רלוונטי קלינית. זה קרה משום שהדמיון בקוסינוס חושב אך ורק על בסיס התאמת מילות המפתח בין השאילתה לטקסט ההנחיה. חשוב לציין שהפניות בעלות רלוונטיות נמוכה אלו לא הובילו לתגובות לא מתאימות, שכן הצ'אטבוט נמנע מלספק תשובות כאשר לא היה מידע מספק על הפניות. לא זוהו הזיות במהלך סקירה ידנית תחת תנאי הבדיקה שהוגדרו. סף הדמיון בקוסינוס של 0.2 נבחר אמפירית במהלך בדיקות ראשוניות כדי לאזן בין רגישות השחזור לספציפיות. למרות שסף זה היה יעיל בתנאי הבדיקה הנוכחיים, הערכה שיטתית של רגישות סף הייתה מעבר להיקף מחקר פרוטוקול זה. מחקרים עתידיים צריכים לחקור את השפעות הגדרות סף חלופיות באמצעות מאגרי נתונים גדולים יותר ומדדי שליפה כמותיים. ההתנהגות שנצפתה מצביעה על כך שבקרת פלט מבוססת RAG עשויה להיות שימושית ביישומי בינה מלאכותית רפואית. עם זאת, ההערכה הנוכחית התבססה על מספר מוגבל של שאלות בתוך היקף ומחוץ לתחום והייתה מיועדת בעיקר כהערכת הוכחת מושג של תהליך העבודה המוצע. לכן, אין לפרש את הממצאים כאימות מקיף של דיוק קליני, בטיחות או הכללה.
למחקר זה יש מספר מגבלות טכניות. השתמשנו באנלייזר המורפולוגי היפני וב-GPT-3.5-turbo-16k (LLM ליצירת תגובה). ה-LLM נבחר משום שהיה מודל זמין ויציב באופן נרחב בזמן פיתוח המערכת, ואפשר יישום שכפול של זרימת העבודה המוצעת. לאנלייזרים מורפולוגיים ולמודלים גדולים גדולים יש מאפיינים ייחודיים; לכן, הבחירה במודלים או ספריות משפיעה הן על דיוק חילוץ המידע והן על תוכן התשובות שנוצרו22,23. למרות שמודלים חדשים יותר (למשל, מודלים גדולים מסוג GPT-4 או GPT-5) עשויים לשפר ביצועים ותוקף חיצוני22, הערכת מודלים חלופיים הייתה מעבר להיקף מחקר הפרוטוקול הנוכחי. מודלים חדשים עשויים להציע יכולת הסקה משופרת, מעקב אחרי הוראות ואיכות תגובה; עם זאת, המטרה העיקרית של מחקר זה הייתה להעריך את היתכנות מסגרת RAG מבוססת הנחיה ולא להשוות את ביצועיהם של מודלים גדולים שונים. אופטימיזציה נוספת של רכיבים אלו עשויה לאפשר יצירת תגובה יעילה ומדויקת יותר, ויש צורך באימות באמצעות תצורות מודל שונות כדי להעריך את ההכללה של ממצאים אלו. בנוסף, הפרוטוקול הנוכחי פותח באמצעות הנחיה בשפה היפנית וניתוח מורפולוגי יפני. למרות שמסגרת השליפה המבוססת על וקטוריזציה של TF–IDF, דמיון קוסינוס ו-RAG היא עצמאית משפה בעיקרון, יישום בשפות אחרות ידרוש כלים לעיבוד טקסט ספציפיים לשפה ואימות. למרות שמחקר זה הוגבל להנחיות אחת ולכן אינו מאפשר השוואה ישירה של מבני הנחיות שונים, הארגון ברמת CQ הקל על חילוץ שיטתי של תוכן ההנחיה ותמך בבניית מידע הפניה לצ'אטבוט RAG המבוסס על הנחיות. במיוחד, מבנה האינטרנט של ההנחיה — שבו כל CQ משויך לכתובת URL ייחודית — שיחק תפקיד מעשי חשוב באפשרות גריטה יעילה וארגון תוכן רפרנס ברמת ה-URL. הנחיות עם פורמטים שונים, כולל מסמכים מבוססי PDF או אתרים ללא כתובות URL ברמת CQ, עשויות לדרוש אסטרטגיות חלופיות לסגמנטציה ושליפה. לכן, ההכללה של זרימת העבודה הנוכחית למבני הנחיות והתמחויות רפואיות אחרות עדיין לא ברורה. עבודה עתידית צריכה להעריך את היישום של גישה זו על פני מחלות רבות, פורמטים של הנחיות ומקורות מידע.
ממצאי המחקר מספקים הנחיות מעשיות לעיצוב מערכות בינה מלאכותית המתייחסות להנחיות, ומראים כי צ'אטבוט RAG מבוסס הנחיה שמתמקד בהנחיות קליניות מבוססות רשת בעל פוטנציאל לשמש ככלי להעברת מידע רפואי הקשור לסרטן. עם זאת, מחקר זה מהווה הערכת הוכחת היתכנות שמטרתה להוכיח את ההיתכנות הטכנית של שליפת הנחיות, יצירת תגובה ומנגנוני הגבלת תגובה, ואין לפרש אותו כאימות קליני פורמלי של מערכת מידע רפואית. היעילות הקלינית, הבטיחות והתוצאות של המשתמש לא הוערכו ועדיין לא נקבעו במחקרים עתידיים. מבחינה אתית ובטיחות משתמש, הגבלת תגובות למידע הנתמך בהנחיה עשויה להפחית את הסיכון לתגובות לא נתמכות או הזיות. עם זאת, התנהגות סירוב מופרזת עלולה גם להפחית את שביעות רצון המשתמש ואת תחושת התועלת שלהם. לכן, העבודה העתידית צריכה להעריך את האיזון בין בטיחות לשימושיות תוך שמירה על אמצעי הגנה מתאימים מפני מידע שגוי. באמצעות ניצול מבנה המידע של קווים מנחים מבוססי רשת ומתן תשובות ממוקדות לשאלות משתמשים, מערכת זו עשויה לשמש מודל שימושי ליישומים עתידיים של בינה מלאכותית בהעברת מידע רפואי.
המחברים מצהירים שאין להם אינטרסים מתחרים.
המחברים מודים לד"ר קניצ'י אינואה, דוקטור (מרכז השד בבית החולים שונאן ממוריאל), על תמיכתו הטכנית הנרחבת בפיתוח הצ'אטבוט המבוסס על הנחיות, מבוסס הנחיות. המחברים גם מודים לד"ר צ'יקקו ימאקי, ולכל חברי צוות המחקר במכון לבקרת סרטן, המרכז הלאומי לסרטן יפן (טוקיו, יפן), על מתן עצות חשובות בנושא שנדון במאמר זה. בנוסף, המחברים מודים ל-Editage על העריכה באנגלית. עבודה זו נתמכה במענק מחקר למדעי הבריאות והעבודה (R6–Cancer Control–23EA1026).
```html
| שם | חברה | מספר קטלוג | הערות |
|---|---|---|---|
| Beautiful Soup 4 (version 4.12.3) | פרויקט Beautiful Soup | לא חל | ספריית Python המשמשת לחילוץ URL ולניתוח HTML |
| ChatGPT version 4o | OpenAI | לא חל | משמש לייצור מילות מפתח |
| GPT-3.5-turbo | OpenAI | לא חל | משמש לייצור תגובות |
| JLCS Guidebook for Lung Cancer Patients and Families | Japan Lung Cancer Society | לא חל | הנחיה קלינית מבוססת אינטרנט המשמשת כמידע עזר |
| MeCab (version 0.996) | MeCab Project | לא חל | מנתח מורפולוגי יפני |
| OpenAI API | OpenAI | לא חל | משמש לייצור תגובות מבוססות AI |
| Python (version 3.12) | Python Software Foundation | לא חל | סביבת תכנות |
| Requests (version 2.32.3) | Requests Project | לא חל | ספריית Python המשמשת לשליפת דפי אינטרנט |
| scikit-learn (version 1.6.1) | מפתחי scikit-learn | לא חל | משמש לווקטוריזציה של TF–IDF וחישוב דמיון קוסינוס. |
| urllib.parse | Python Software Foundation | לא חל | ספריית Python המשמשת לנורמליזציה וחיבור URL |
בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה
בקש הרשאה