הרשמה ל-JoVE נדרשת לצפייה בתוכן זה. התחברו או התחילו בגרסת ניסיון בחינם.

מאמר מחקר

קריאות ואיכות של מידע להסברת מטופלים על נוירופתיה של עצב השלישייה שנוצר על ידי מודלי שפה גדולים: מחקר חתך

70 צפיות

⸱

DOI:

10.3791/70833

⸱

21 באוגוסט 2026

במאמר זה

סיכום

כאן אנו מציגים פרוטוקול להערכה שיטתית של קריאות, התאמה חינוכית ואיכות של מידע למטופלים על נוירופתיה של עצב השלישייה (trigeminal neuralgia) שהופק על ידי מודלי שפה גדולים, במטרה לבצע בנצ'מרק למודלים ולהנחות תקשורת מול מטופלים.

תקציר

מודלי שפה גדולים (LLMs) משמשים יותר ויותר לחינוך בריאותי של מטופלים, אך הקריאות והאיכות החינוכית של מידע על נוירופתיה של העצב השלישי (trigeminal neuralgia - TN) שהופק על ידי LLMs לא הוערכו באופן מספיק. מחקר השוואתי חתכי זה השווה תוכן חינוכי על TN שהופק על ידי חמישה LLMs הזמינים לציבור (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen, ו-GPT-5). עשרים שאלות נפוצות על TN, המכסות ידע בסיסי על המחלה, אטיולוגיה/גורמי סיכון, אבחנה, טיפול ומניעה/שיקום, הוצגו לכל מודל באמצעות הנחיות (prompts) סטנדרטיות. הקריאות הוערכה באמצעות שבעה מדדים מבוססים, ההתאמה החינוכית באמצעות כלי הערכת חומרי חינוך למטופלים להבנה וישימות (PEMAT), ואיכות המידע הכללית באמצעות מדד איכות גלובלי (GQS). שני מומחים קליניים העריכו באופן עצמאי את כל התשובות, כאשר מחלוקות נפתרו על ידי בורר בכיר. ניתוחים סטטיסטיים השוו את ביצועי המודלים, הבדלים תמתיים ומתאמים בין מדדי ההערכה. נצפו הבדלים משמעותיים בין המודלים במדדי הקריאות, ה-PEMAT וה-GQS. GPT-5 ייצר את התשובות המורכבות ביותר מבחינה לשונית, אך השיג את הדירוגים הגבוהים ביותר להתאמה חינוכית ואיכות מידע. לעומת זאת, Wenxin Yiyan הפיק את הטקסט הקריא ביותר, אך באופן כללי קיבל ציונים נמוכים יותר ב-PEMAT וב-GQS. קטגוריית התוכן השפיעה על הקריאות, כאשר נושאי מניעה/שיקום ואטיולוגיה/גורמי סיכון היו קשים יותר לקריאה, בעוד שערכי ה-PEMAT וה-GQS נותרו עקביים יחסית בין התמות השונות. מדדי הקריאות הראו עקביות פנימית חזקה ומתאמים חיוביים חלשים עד בינוניים עם PEMAT ו-GQS, בעוד ש-PEMAT ו-GQS הראו מתאם חיובי בינוני. ממצאים אלו מצביעים על כך שבחירת המודל משפיעה על ההתאמה החינוכית ואיכות המידע הכללית כפי שהוערכו על ידי מומחים, בעוד שמורכבות הנושא משפיעה בעיקר על הקריאות. מאחר שהבנת המטופל, שביעות רצונו, אמון, תוצאות בריאותיות, דיוק עובדתי ובטיחות קלינית לא הוערכו, יש לפרש תוצאות אלה כניתוח השוואתי המבוסס על דירוג מומחים ולא כראיה למוכנות קלינית.

מבוא

נוירופתיה של העצב השלישי (Trigeminal neuralgia, TN) היא תסמונת של כאב נוירופתי המאופיינת בפרקוסי רקורסיביים של כאב פנים חד-צדדי, קצר ועז ביותר, המתואר לרוב כדמוי שוק חשמלי או דקירה. על פי הסיווג הבינלאומי של הפרעות כאבי ראש, מהדורה שלישית (ICHD-3), הכאב ממוקם בדרך כלל בהתאמה לפיזור של ענף אחד או יותר של העצב השלישי, עוצמתו לרוב בלתי נסבלת, וניתן לעורר אותו על ידי גירויים תמימים כגון מגע קל, שטיפת פנים, צחצוח שיניים, דיבור או לעיסה. ההתקפים מאופיינים בהתחלה פתאומית ובסיום abrupt, עם משך זמן הנע בין שברירי שניות למספר דקות1,2. למרות ש-TN אינה מסכנת חיים בדרך כלל, הכאב העז והבלתי צפוי משבש באופן משמעותי פעילויות יומיומיות חיוניות, כולל אכילה, דיבור, שינה וויסות רגשי, מה שמוביל לנטל פסיכו-סוציאלי ניכר ולירידה באיכות החיים. ראיות מסקירות סיסטמטיות מצביעות על כך שאנשים הסובלים מ-TN עומדים בפני סיכון מוגבר משמעותית לדיכאון, חרדה והפרעות שינה בהשוואה לאוכלוסייה הכללית3,4. במחקרי קוהורט רחבים, כ-35–55% מהמטופלים עם TN מראים תסמינים משמעותיים מבחינה קלינית של חרדה או דיכאון, וקטסטרופיזציה של הכאב היא שכיחה מאוד, מה שמרמז על אינטראקציה דו-כיוונית בין כאב כרוני עז, נשירה מהשינה (insomnia) והפרעות רגשיות5,6. הערכות אפידמיולוגיות מצביעות על כך שהשכיחות של TN באוכלוסייה הכללית נעה בין כ-0.03% ל-0.3%, עם שכיחות גבוהה יותר בקרב נשים ומבוגרים, ושינויים ניכרים בין אזורים גיאוגרפיים, קבוצות אתניות ושכבות גיל7,8. במדינות מאוכלסות מאוד, כגון סין והודו, הזדקנות מהירה של האוכלוסייה לוותה בעלייה מתמדת במספר האנשים המושפעים מ-TN, ובכך הטילה נטל גדל על מערכות הבריאות והדגישה את הצורך בגישות יעילות יותר, ניתנות להרחבה ומבוססות נתונים להערכה וניהול של המחלה8,9.

ניתן לסווג את TN לתתי-סוגים קלאסיים, משניים ואידיופתיים, כאשר עדויות גוברות מדגימות הבדלים משמעותיים במנגנונים האטיולוגיים ובאסטרטגיות הטיפוליות בין קטגוריות אלו1,10. מחקרים נוכחיים מצביעים על כך ששינויים מבניים הקשורים לקונפליקט נוירו-וסקולרי באזור כניסת שורש העצב הטריגמינלי, היפר-אקסיטביליות של עצבים פריפריים ושינוי בוויסות הכאב המרכזי תורמים במשותף לפתוגנזה של המחלה11,12. קווים מנחים קליניים ממליצים על carbamazepine ו-oxcarbazepine כטיפולים ראשוניים, בעוד שגישות כירורגיות או התערבותיות נשקלות כאשר טיפול פרמקולוגי אינו יעיל או אינו נסבל10. למרות התקדמויות טיפוליות אלו, TN מאופיינת במהלך של התפרצויות והפסקות (relapsing–remitting), וחזרה של כאב לטווח ארוך נותרת נפוצה, מה שהופך השגת רמיסיה קבועה לקשה13. כתוצאה מכך, מעקב ארוך טווח וניהול מובנה של מחלה כרונית חיוניים לניטור סיכון לחזרה, תגובה לטיפול וסיבוכים. מחקרי קוהורט אורך מעידים כי תחת אסטרטגיות ניהול סטנדרטיות (כולל טיפול פרמקולוגי, התערבות כירורגית כאשר היא מומלצת, ומעקב מקיף), כחצי מהמטופלים המקבלים טיפול שמרני יכולים להגיע להפחתה של ≥50% בנטל הכאב הכולל בתוך שנתיים, ללא התקדמות בלתי נמנעת של המחלה14. ממצאים אלו מדגישים את החשיבות של מעורבות מתמשכת של המטופל וחינוך בריאותי יעיל לניהול המחלה לטווח ארוך. עדויות מצביעות על כך שמטופלים עם הבנה טובה יותר של אטיולוגיית המחלה, הפתופיזיולוגיה ואפשרויות הטיפול נוטים יותר להשתתף באופן פעיל ולדבוק במשטרי טיפול, מה שמוביל לתוצאות משופרות15. עם זאת, גישות מסורתיות לחינוך בריאותי מוגבלות לעיתים קרובות בהגעה ובמדרגיות. עם האימוץ הנרחב של האינטרנט, ובמיוחד פלטפורמות שאלות ותשובות מקוונות ומדיה חברתית, מטופלים מסתמכים יותר ויותר על מקורות דיגיטליים כדי להשיג מידע רפואי16,17. למרות זאת, שונות משמעותית באוריינות בריאותית אינדיבידואלית ובביכולת לגשת, לעבד ולהבין מידע בריאותי בסיסי לצורך קבלת החלטות מושכלת מהווה חסמים מרכזיים לחינוך יעיל של המטופל18. יתרה מכך, האיכות הבלתי אחידה של מידע בריאותי מקוון, כולל תוכן לא מדויק או מטעה, עלולה להשפיע לרעה על החלטות רפואיות של מטופלים ועל רווחתם הפסיכולוגית19.

טכנולוגיות בינה מלאכותית (AI), ובמיוחד הפיתוח המהיר של מודלי שפה גדולים (LLMs) בשנים האחרונות, יצרו הזדמנויות חדשות לתקשורת במדעי הרפואה ולהשכלה בריאותית20. מודלים אלו, שאומנו על קורפוסים טקסטואליים רחבי היקף, יכולים להפיק תגובות מובנות וקוהרנטיות לוגית באמצעות אינטראקציה בשפה טבעית21. מערכות בינלאומיות מייצגות, כגון ChatGPT, הדגימו פוטנציאל מבטיח במתן מענה לשאלות רפואיות, בייעוץ למטופלים ובחינוך רפואי22,23. מספר מודלי LLMs דומים תפקודית הופיעו בסין, עם כיסוי משתמשים ותרחישי יישום המתרחבים ללא הרף24. למרות התקדמויות אלו, יישומם של מודלי LLMs בהפצת ידע במדעי הרפואה עדיין עומד בפני אתגרים משמעותיים, הכוללים את אמינות נתוני האימון, תדירות העדכונים, הדיוק המדעי של התגובות המופקות ומחסור בתיקוף קליני25. בנוסף, הבדלים בין המודלים בסגנון השפה, בקריאות, במבנה הלוגי ובדיוק הציטוטים עשויים להשפיע ישירות על הבנת המטופלים ועל אמוןם במידע הקשור לבריאות26. נכון להיום, הערכות שיטתיות של ביצועי LLM בחינוך בריאותי הקשור ל-TN היו מוגבלות.

לפיכך, מחקר זה נועד להעריך ולהשוות באופן שיטתי את הביצועים של ארבעה מודלי שפה גדולים (LLMs) סיניים נפוצים (Doubao, DeepSeek, Wenxin Yiyan, ו-Tongyi Qianwen) ומודל שפה גדול בינלאומי מייצג (ChatGPT) במתן מענה לשאלות להדרכת מטופלים הקשורות ל-TN. באמצעות תכנון חתך, בנינו סט שאלות בנושא TN המבוסס על קווי דרישה קליניים ודאגות נפוצות של מטופלים, והערכנו את התגובות שהופקו על ידי חמישה מודלי שפה גדולים הזמינים לציבור (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen, ו-GPT-5). רמת הקריאות הוערכה באמצעות מדדים מרובים, והבנה ויכולת יישום נבחנו באמצעות כלי הערכת חומרי הדרכה למטופלים (PEMAT). איכות המידע הכללית הוערכה באמצעות מדד איכות גלובלי (GQS). בנוסף, ניתחנו כיצד נושאי חינוך לבריאות שונים משפיעים על מדדי הערכה אלו ועל הקשרים ביניהם, במטרה לספק הדרכה מבוססת ראיות לבחירה ואופטימיזציה של מודלי שפה גדולים בתקשורת בריאות קלינית.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

מחקר זה ניתח טקסטים שנוצרו על ידי בינה מלאכותית בלבד ולא כלל משתתפים אנושיים, בעלי חיים, דגימות ביולוגיות, רשומות רפואיות, מידע אישי מזוהה או התערבות בטיפול קליני. לפיכך, סקירת אתיקה והסכמה מדעית רשמית לא היו רלוונטיות.

מערך המחקר

מחקר חתך זה העריך את רמת הקריאות, האיכות וההתאמה הפדגוגית של תשובות שנוצרו על ידי חמישה מודלי שפה גדולים (LLMs) כמענה לשאלות נפוצות על TN.

זיהוי שאלות נפוצות הקשורות ל-TN

ב-25 בנובמבר 2025, שני מומחים קליניים בעלי ניסיון נרחב ברפואת כאב סקרו באופן עצמאי את ההנחיות הקליניות הנוכחיות לניורלגיה של עצב השלישייה (TN), כולל הסיווג הבינלאומי של הפרעות כאב ראש, מהדורה שלישית (ICHD-3), הנחיות האקדמיה האירופית לנוירולוגיה והנחיות האקדמיה האמריקאית לנוירולוגיה/פדרציית החברות הנוירולוגיות האירופית1,10,11. בעקבות דיון להשגת קונסנזוס, הם ערכו רשימה של 20 שאלות הקשורות ל-TN הנשאלות בדרך כלל בפרקטיקה הקלינית. מספר השאלות נקבע מראש כדי לספק כיסוי מאוזן של חמישה תחומים תמטיים שהוגדרו מראש, כאשר נבחרו ארבע שאלות לכל תחום, תוך שמירה על מספר התגובות שהופקו על ידי המודל בטווח שניתן לדירוג ואימות ידני על ידי מומחים. כדי לשפר את השחזוריות, תהליך הבחירה נעשה לפי מסגרת מוגדרת מראש המבוססת על תחומים: המומחים זיהו תחילה שאלות מועמדות בתוך כל תחום, סקרו אותן באופן עצמאי לבחינת הרלוונטיות הקלינית, ניסוח המכוון למטופל ומניעת כפילויות, ולאחר מכן הגיעו לקונסנזוס לגבי ארבע השאלות הסופיות לכל תחום. רשימת השאלות הסופית מופיעה ב-טבלה 1 וב-קובץ משלים 1. חמשת התחומים התמטיים שהוגדרו מראש היו ידע בסיסי על המחלה, אתיולוגיה וגורמי סיכון, אבחנה, טיפול, ומניעה ושיקום. מכיוון שערכת השאלות לא נגזרה מיומני חיפוש של מטופלים, שאילתות חיפוש מקוונות או ראיונות רשמיים עם מטופלים, הפוטנציאל להטיית בחירה מוכר כמגבלה של המחקר.

מודלי AI והליך איסוף נתונים

ב-25 בנובמבר 2025, הוגשה מערכת סופית של 20 שאלות הקשורות ל-TN לחמש פלטפורמות של מודלי שפה גדולים (LLM) נגישות לציבור: Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen ו-GPT-5/ChatGPT. הגישה לכל המודלים התבצעה באמצעות ממשקי הצ'אט הסטנדרטיים שלהם מבוססי האינטרנט; לא נעשה שימוש בגישה באמצעות ממשק תכנות יישומים (API). עבור כל פלטפורמה, נעשה שימוש במודל ברירת המחדל שהיה זמין לציבור בתאריך איסוף הנתונים, ללא שינוי של פרמטרי יצירה כלשהם. מכיוון שממשקי האינטרנט הציבוריים לא הציגו מזהי תצלומיות (snapshots) של מודלי ה-backend, הנחיות מערכת נסתרות, temperature, top-p, מספר מקסימלי של טוקנים בפלט או פרמטרי יצירה אחרים, פריטים אלו נרשמו כ"לא מוצגים בממשק האינטרנט הציבורי".

שפת הפקודות והתגובות הייתה אנגלית עבור כל המודלים. כל פקודה סטנדרטית consisted solely מהשאלה באנגלית כפי שנכתבה, ללא הוראות נוספות שספציפיות למודל. כל שאלה הוגשה באופן פרטני בשיחת צ'אט חדשה ועצמאית, ללא היסטוריית שיחות קודמת, קבצים שהועלו, תוספים, הוראות מותאמות אישית או פקודות המשך. הרשימה המלאה של הפקודות הסטנדרטיות והפלטים הגולמיים המתאימים של המודלים מופיעה בSupplementary File 1. מטא-נתונים של המודלים והגדרות איסוף הנתונים מסוכמים בSupplementary Table 1.

הערכת קריאות

קריאותן של התגובות שהופקו על ידי ה-LLM הוערכה באמצעות מספר נוסחאות קריאות מבוססות הזמינות דרך פלטפורמה מקוונת להערכת קריאות (http://readabilityformulas.com/). בהינתן היעדר תקן זהב מקובל באופן אוניברסלי להערכת קריאות, ובדומה למחקרים קודמים, נעשה שימוש במערב מקיפה של מדדי קריאות נפוצים23,27. שבעה מדדים נבחרו כדי לתפוס היבטים משלימים של קריאות, כולל אורך משפט, אורה של מילה, עומס הברות, מורכבות מבוססת תווים, קלות קריאה ורמת כיתה מוערכת, ובכך להפחית את ההסתמכות על נוסחה בודדת. באופן ספציפי, חושבו מדדי ה-Coleman-Liau Index (CL), Linsear Write Formula (LW), Automated Readability Index (ARI), Simple Measure of Gobbledygook (SMOG), Gunning Fog Index (GFOG), Flesch Reading Ease Score (FRES) ו-Flesch-Kincaid Grade Level (FKGL). מדדים אלו מעריכים את קשיי הקריאה או את רמת הכיתה ומספקים מדדים כמותיים לקריאות הטקסט (Table 2).

הערכת התאמה חינוכית ואיכות המידע

ההתאמה החינוכית הוערכה באמצעות הכלי להערכת חומרי הדרכה למטופלים (PEMAT), הכולל שני תחומים: מובנות ויכולת יישום28. הכלי כולל 24 פריטים, כאשר 16 מעריכים את המובנות ושמונה מעריכים את יכולת היישום. כל פריט דורג באופן דיכוטומי (0 = הקריטריון לא הושג; 1 = הקריטריון הושג), מה שהניב ציון כולל הנע בין 0 ל-24, כאשר ציונים גבוהים יותר מעידים על התאמה רבה יותר להדרכת מטופלים. איכות המידע הכללית הוערכה באמצעות מדד איכות גלובלי (GQS)27, סולם ליקרט בן חמש נקודות הנמצא בשימוש נרחב להערכת איכות של מידע רפואי (טבלה 3).

ב-25 בנובמבר 2025, שני מומחים קליניים עם ניסיון של למעלה מ-3 שנים בניהול TN העריכו את כל התגובות שהופקו על ידי AI באמצעות שני כלי ההערכה. לפני הניקוד, כל התגובות שהופקו על ידי AI עברו אנונימיזציה עם מזהי תגובה מקודדים, והבודקים היו מסווגים (blinded) לפלטפורמת ה-LLM במהלך הערכות ה-PEMAT וה-GQS. מחלוקות נפתרו על ידי מומחה בכיר שלישי, שפסק על הניקוד הסופי. מהימנות בין בודקים נמדדה באמצעות מקדם הקאפה של כהן (Cohen's kappa coefficient), כאשר ערכים >0.75 מעידים על הסכמה מצוינת, 0.40–0.75 מעידים על הסכמה מקובלת, ו-<0.40 מעידים על הסכמה דלה. ערכי הקאפה של כהן הן עבור ה-PEMAT והן עבור ה-GQS עלו על 0.75, מה שמעיד על מהימנות מצוינת בין הבודקים.

ניתוח סטטיסטי

כל הניתוחים הסטטיסטיים בוצעו באמצעות תוכנת R (גרסה 4.4.3). נורמליות הנתונים הוערכה באמצעות מבחן Shapiro-Wilk וגרפי Q-Q. משתנים בעלי התפלגות נורמלית סוכמו כממוצע ± סטיית תקן והושוו באמצעות ניתוח שונות חד-כיווני (ANOVA), ולאחריו מבחן post hoc של Tukey במידת הצורך. משתנים שאינם בעלי התפלגות נורמלית סוכמו כחציונים וטווחים בין-רבעוניים והושוו באמצעות מבחן Kruskal-Wallis, ולאחריו מבחן post hoc של Dunn עם תיקון Bonferroni להשוואות זוגיות. מתאמים בין מדדי קריאות, ציוני PEMAT וערכי GQS הוערכו באמצעות מקדם המתאם הרטבי של Spearman, תוך יישום תיקון Benjamini-Hochberg לבדיקות מרובות. ערך P דו-צדדי מתוקנן של < 0.05 נחשב למשמעותי מבחינה סטטיסטית.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

מחקר זה העריך באופן שיטתי את ההשפעות של מודלי שפה גדולים (LLMs) וקטגוריות שונות של תוכן חינוך לבריאות על קריאותן ואיכותן של טקסטים שנוצרו. ראשית, השווינו את הביצועים של חמישה מודלי LLM — Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen, ו-GPT-5 — ביחס להתאמתם לחינוך מטופלים, לאיכות המידע הכללית ולמדדי קריאות מרובים, כולל מדד PEMAT, מדד GQS ומדדי קריאות מבוססים (ARI, FRES, GFOG, FKGL, CL, SMOG, ו-LW). שנית, בחנו את אותם מדדי תוצאה בחמישה תחומים תמטיים של תוכן חינוך לבריאות: ידע בסיסי על מחלות, אטיולוגיה וגורמי סיכון, אבחנה,...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

מחקר השוואתי זה בחתך רוחבי השווה באופן שיטתי את רמת הקריאות, ההתאמה הפדגוגית ואיכות המידע הכללית של חומרי הדרכה למטופלים עם נוירופתיה של העצב התוך-לסתי (TN), אשר הופקו על ידי חמישה מודלי שפה גדולים (LLMs) הזמינים לציבור. עלו ארבעה ממצאים עיקריים. ראשית, רמת הקריאות הייתה שונה באופן משמעותי בין המודלים, כאשר GPT-5 הפיק את התשובות המורכבות ביותר מבחינה לשונית, בעוד ש-Wenxin Yiyan הפיק את התוכן הקריא ביותר. שנית, רמת הקריאות ואיכות המידע כפי שהוערכה על ידי מומחים היו ממדי הערכה נפרדים, כאשר GPT-5 השיג את ציוני ה-PEMAT וה-GQ...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

המחברים מצהירים כי אין להם ניגודי אינטרסים.

תודות

מחקר זה לא קיבל מענק ספציפי מכל סוכנות מימון במגזר הציבורי, המסחרי או ללא מטרות רווח. המחברים מודים לעמיתיהם הקליניים שסיפקו משוב על מערכת השאלות בנושא נוירופתיה טריגמינלית וסייעו בליטוש מסגרת ההערכה. אנו מודים גם לכל התורמים שתמכו בהכנת כתב היד ובביצוע העריכות.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
פלטפורמת הצ'אט DeepSeekDeepSeekhttps://chat.deepseek.com/ממשק מודל שפה גדול נגיש לציבור המשמש ליצירת תגובות
פלטפורמת הצ'אט DoubaoDoubaohttps://www.doubao.com/chat/ממשק מודל שפה גדול נגיש לציבור המשמש ליצירת תגובות
GPT 5 OpenAIhttps://chat.openai.com/ממשק מודל שפה גדול נגיש לציבור המשמש ליצירת תגובות
תוכנת R, גרסה 4.4.3R Foundation for Statistical Computingלא רלוונטיניתוח סטטיסטי והדמיה
מחשבון קריאות מקוון של Readability FormulasReadability Formulasלא רלוונטיכלי מקוון המשמש לחישוב מדדי קריאות
פלטפורמת הצ'אט Tongyi QianwenTongyi Qianwenhttps://www.tongyi.com/ממשק מודל שפה גדול נגיש לציבור המשמש ליצירת תגובות
פלטפורמת הצ'אט Wenxin YiyanWenxin Yiyanhttps://yiyan.baidu.com/ממשק מודל שפה גדול נגיש לציבור המשמש ליצירת תגובות

מקורות

  1. Headache Classification Committee of the International Headache Society (IHS). The International Classification of Headache Disorders, 3rd edition. Cephalalgia. 2018;38(1):1-211.
  2. Ashina S, et al. Trigeminal neuralgia. Nat Rev Dis Primers. 2024;10(1):39.
  3. Donertas-Ayaz B, Caudle RM. Locus coeruleus-noradrenergic modulation of trigeminal pain: Implications for trigeminal neuralgia and psychiatric comorbidities. Neurobiol Pain. 2023;13:100124.
  4. Martinelli R, et al. Psychological assessment in patients affected by trigeminal neuralgia: A systematic review. Neurosurg Rev. 2025;48(1):414.
  5. Melek LN, et al. Comparison of the neuropathic pain symptoms and psychosocial impacts of trigeminal neuralgia and painful posttraumatic trigeminal neuropathy. J Oral Facial Pain Headache. 2019;33(1):77-88.
  6. Zakrzewska JM, et al. Evaluating the impact of trigeminal neuralgia. Pain. 2017;158(6):1166-1174.
  7. Gambeta E, Chichorro JG, Zamponi GW. Trigeminal neuralgia: An overview from pathophysiology to pharmacological treatments. Mol Pain. 2020;16:1744806920901890.
  8. De Toledo IP, et al. Prevalence of trigeminal neuralgia: A systematic review. J Am Dent Assoc. 2016;147(7):570-576.e2.
  9. Svedung Wettervik T, et al. Incidence of trigeminal neuralgia: A population-based study in central Sweden. Eur J Pain. 2023;27(5):580-587.
  10. Bendtsen L, et al. European Academy of Neurology guideline on trigeminal neuralgia. Eur J Neurol. 2019;26(6):831-849.
  11. Cruccu G, et al. Trigeminal neuralgia: New classification and diagnostic grading for practice and research. Neurology. 2016;87(2):220-228.
  12. Araya EI, et al. Trigeminal neuralgia: Basic and clinical aspects. Curr Neuropharmacol. 2020;18(2):109-119.
  13. Chong MS, Bahra A, Zakrzewska JM. Guidelines for the management of trigeminal neuralgia. Cleve Clin J Med. 2023;90(6):355-362.
  14. Heinskou TB, et al. Favourable prognosis of trigeminal neuralgia when enrolled in a multidisciplinary management program: A two-year prospective real-life study. J Headache Pain. 2019;20(1):23.
  15. Liu S, et al. Comparative evaluation of ChatGPT and Gemini in brain-computer interface patient education: A multidimensional analysis of reliability, accuracy, comprehensibility, and readability. Int J Med Inform. 2026;206:106164.
  16. Forgie EME, et al. Social media and the transformation of the physician-patient relationship: Viewpoint. J Med Internet Res. 2021;23(12):e25230.
  17. Gantenbein L, Navarini AA, Maul LV, Brandt O, Mueller SM. Internet and social media use in dermatology patients: Search behavior and impact on the patient-physician relationship. Dermatol Ther. 2020;33(6):e14098.
  18. Youssef Y, et al. Social media and internet use among orthopedic patients in Germany: A multicenter survey. Front Digit Health. 2025;7:1486296.
  19. De Martino I, et al. Social media for patients: Benefits and drawbacks. Curr Rev Musculoskelet Med. 2017;10(1):141-145.
  20. Johnson KB, et al. Precision medicine, AI, and the future of personalized health care. Clin Transl Sci. 2021;14(1):86-93.
  21. Hirani R, et al. Artificial intelligence and healthcare: A journey through history, present innovations, and future possibilities. Life (Basel). 2024;14(5):557.
  22. Karatas G, Kirik F, Karatas ME, Cakir A, Ozdemir H. Comparative performance of ChatGPT o3-mini-high and DeepSeek-R1 in ophthalmology: An evaluation of diagnostic reasoning and case-based problem solving. J Fr Ophtalmol. 2025;49(1):104712.
  23. Hanci V, et al. Assessment of readability, reliability, and quality of ChatGPT, Bard, Gemini, Copilot, and Perplexity responses on palliative care. Medicine (Baltimore). 2024;103(33):e39305.
  24. Liu C, et al. Potential to perpetuate social biases in health care by Chinese large language models: A model evaluation study. Int J Equity Health. 2025;24(1):206.
  25. Haupt CE, Marks M. AI-generated medical advice—GPT and beyond. JAMA. 2023;329(16):1349-1350.
  26. Aydin S, Karabacak M, Vlachos V, Margetis K. Large language models in patient education: A scoping review of applications in medicine. Front Med (Lausanne). 2024;11:1477898.
  27. Kara M, et al. Evaluating the readability, quality, and reliability of responses generated by ChatGPT, Gemini, and Perplexity on the most commonly asked questions about ankylosing spondylitis. PLoS One. 2025;20(6):e0326351.
  28. Perez Rivera LR, et al. Evaluating the quality and reliability of large language models for plastic surgery patient education: A comparative analysis of ChatGPT and OpenEvidence. Aesthet Surg J. 2025. doi:10.1093/asj/sjaf249.
  29. Wilhelm TI, Roos J, Kaczmarczyk R. Large language models for therapy recommendations across three clinical specialties: Comparative study. J Med Internet Res. 2023;25:e49324.
  30. Will J, et al. Enhancing the readability of online patient education materials using large language models: Cross-sectional study. J Med Internet Res. 2025;27:e69955.
  31. Tukur Jido J, Al-Wizni A, Aung SL. Readability of AI-generated patient information leaflets on Alzheimer's disease, vascular dementia, and delirium. Cureus. 2025;17(6):e85463.
  32. Luo Z, Lin C, Kim TH, Shin YS, Ahn ST. Quality and readability analysis of artificial intelligence-generated medical information related to prostate cancer: A cross-sectional study of ChatGPT and DeepSeek. World J Mens Health. 2025. doi:10.5534/wjmh.250144.
  33. Joseph P, Silva NA, Nanda A, Gupta G. Evaluating the readability of online patient education materials for trigeminal neuralgia. World Neurosurg. 2020;144:e934-e938.
  34. Dong C, et al. Comparative evaluation of large language models in delivering guideline-compliant recommendations for topical NSAID use in musculoskeletal pain: A multidimensional analysis. Clin Rheumatol. 2025;44(11):4703-4710.
  35. Ozduran E, Buyukcoban S. Evaluating the readability, quality, and reliability of online patient education materials on post-COVID pain. PeerJ. 2022;10:e13686.
  36. Wang LW, Miller MJ, Schmitt MR, Wen FK. Assessing readability formula differences with written health information materials: Application, results, and recommendations. Res Social Adm Pharm. 2013;9(5):503-516.
  37. Singh SP, et al. Comprehension profile of patient education materials in endocrine care. Kans J Med. 2022;15(2):247-252.
  38. Marder RS, et al. ChatGPT-3.5 and ChatGPT-4.0 do not reliably create readable patient education materials for common orthopaedic upper- and lower-extremity conditions. Arthrosc Sports Med Rehabil. 2025;7(1):101027.
  39. Nasra M, et al. Can artificial intelligence improve patient educational material readability? A systematic review and narrative synthesis. Intern Med J. 2025;55(1):20-34.
  40. Bhatt C, et al. Evaluating readability, understandability, and actionability of online printable patient education materials for cholesterol management: A systematic review. J Am Heart Assoc. 2024;13(8):e030140.
  41. Avra TD, Le M, Hernandez S, Thure K, Ulloa JG. Readability assessment of online peripheral artery disease education materials. J Vasc Surg. 2022;76(6):1728-1732.
  42. Rooney MK, et al. Readability of patient education materials from high-impact medical journals: A 20-year analysis. J Patient Exp. 2021;8:2374373521998847.
  43. Ahmadzadeh K, et al. Patient education information material assessment criteria: A scoping review. Health Info Libr J. 2023;40(1):3-28.
  44. Duan L, Yao Z, Li X, Wu Y, Sheng D. Comparing large language models and human doctors in symptom-driven online medical consultations: A case study on trigeminal neuralgia. Digit Health. 2025;11:20552076251388140.
  45. Werner C, Harden J, Lawton J. Pathways to a diagnosis of trigeminal neuralgia: A qualitative study of patients' experiences. BMC Prim Care. 2025;26(1):65.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

תגיות

מודלי שפה גדוליםהערכת קריאותאיכות חינוכיתהערכת PEMATציון איכות גלובלי (GQS)איכות מידע בריאותיבינצ'מרקינג של מודליםהבנת המטופל