يصف هذا البروتوكول تطوير وتقييم روبوت دردشة قائم على الإرشادات ويعتمد على التوليد المعزز بالاسترجاع، والذي يسترجع ويلخص المحتوى من إرشادات الممارسة السريرية للسرطان عبر الإنترنت لتوليد ردود مبنية على المرجع على استفسارات المستخدمين.
مقالة منهجية
يصف هذا البروتوكول تطوير وتقييم روبوت دردشة قائم على الإرشادات ويعتمد على التوليد المعزز بالاسترجاع، والذي يسترجع ويلخص المحتوى من إرشادات الممارسة السريرية للسرطان عبر الإنترنت لتوليد ردود مبنية على المرجع على استفسارات المستخدمين.
أدى توفر المعلومات الطبية على نطاق واسع على الإنترنت إلى تحسين وصول المرضى إلى المعرفة المتعلقة بالصحة؛ ومع ذلك، زادت أيضا من التعرض لمعلومات طبية غير دقيقة. تشمل رعاية السرطان معلومات معقدة، مما يصعب على المرضى تحديد مصادر دقيقة ومبنية على الأدلة. نماذج اللغة الكبيرة تتيح التفاعل مع اللغة الطبيعية لكنها غالبا ما تولد هلوسات، مما يحد من تطبيقها في نقل المعلومات الطبية. التوليد المعزز بالاسترجاع (RAG) لديه القدرة على التخفيف من هذه المخاطر من خلال تثبيت الاستجابات على مصادر مرجعية خارجية. تصف هذه الدراسة تطوير وتقييم روبوت دردشة RAG قائم على الإرشادات يستخدم إرشادات ممارسة السرطان السريرية المتاحة للجمهور عبر الإنترنت. يستخرج النظام عناوين URL من صفحات جدول المحتويات في الإرشاد، ويعالج نص الصفحة باستخدام التحليل الشكلي والتشابه بين جيب تمام بناء على تكرار المصطلحات–تكرار الوثائق العكسي، ويبني معلومات مرجعية من صفحات ذات صلة عالية. يستخدم نموذج لغوي كبير هذه المراجع لتوليد ردود مقيدة بالمحتوى الإرشادي. تم استخدام دليل JLCS لمرضى وعائلات سرطان الرئة كمرجع. شملت مجموعات الأسئلة كلا من أنواع السرطان داخل النطاق التي تغطيها الإرشادات وأنواع السرطان خارج النطاق لتقييم الاستجابة الضابطة. تم استخراج المعلومات الطبية بنجاح من صفحات جدول المحتويات، حيث احتوت 98٪ من عناوين URL المستخرجة على محتوى طبي قابل للمراجعة. بالنسبة للأسئلة داخل النطاق، كان روبوت الدردشة يولد إجابات من خلال تلخيص محتوى الإرشادات، ولم يتم تحديد أي هلوسات أثناء المراجعة اليدوية تحت ظروف الاختبار المحددة. بالنسبة للأسئلة خارج نطاق النطاق، رفض روبوت الدردشة الإجابة باستمرار وأشار إلى أن المعلومات المتاحة غير كافية. سهل هيكل الويب للإرشاد عمليات جمع وتنظيم فعال لمحتوى المراجع على مستوى الرابط. يوفر هذا البروتوكول إرشادات عملية لبناء أنظمة ذكاء اصطناعي تقدم المعلومات الطبية باستخدام إرشادات الممارسة السريرية عبر الإنترنت.
الاستخدام الواسع للإنترنت ووسائل التواصل الاجتماعي سهل على المرضى الوصول إلى المعلومات الطبية 1,2. معلومات رعاية السرطان غالبا ما تكون معقدة وشاملة، مما يجعل من الصعب بشكل خاص على المرضى تحديد مصادر دقيقة وذات صلة ومبنية على أدلة علمية3. بينما يمكن للموارد الإلكترونية دعم فهم المرضى، إلا أنها تحتوي أيضا على كميات كبيرة من المعلومات الطبية غير الصحيحة3، مما قد يؤثر سلبا على قرارات المرضى بشأن رعايتهم4. نظرا لأن المعلومات المضللة المتعلقة بالسرطان يمكن أن تؤثر على نتائج المرضى5، هناك حاجة متزايدة لأنظمة الذكاء الاصطناعي (AI) التي تساعد المستخدمين الأفراد في البحث والتلخيص وتفسير المعلومات الطبية6.
نماذج اللغة الكبيرة (LLMs) تتيح للمستخدمين الوصول إلى المعلومات من خلال المحادثة باللغة الطبيعية7؛ ومع ذلك، لا يزال توليد المعلومات المضللة (أي الهلوسات) مصدر قلق جاد في المجال الطبي 8,9,10,11. أحد المصادر الرئيسية للمعلومات المضللة هو جودة ودقة بيانات التدريب المستخدمة في تطوير الدردشة الروبوتية. بالإضافة إلى ذلك، تعني الطبيعة الثابتة لتدريب النماذج أن المعرفة قد تصبح قديمة مع مرور الوقت، مما يحد من قدرة نماذج اللغة الكبيرة على توفير معلومات حالية ومناسبة للسياق12،13. تسلط هذه القيود الضوء على أهمية استراتيجيات إدارة المعرفة الفعالة لضمان بقاء ردود الدردشة دقيقة وذات صلة ومحدثة. على وجه الخصوص، الأنظمة التي يمكنها الوصول بسهولة إلى الموارد الحالية المبنية على الأدلة، مثل إرشادات الممارسة السريرية، مرغوبة في البيئات الطبية، حيث تتطور التوصيات ومعايير الرعاية باستمرار. لمواجهة هذا التحدي، حظي التوليد المعزز بالاسترجاع (RAG)، الذي يولد استجابات من خلال دمج المعلومات من مصادر معرفة خارجية، باهتمام متزايد 10,13,14,15,16,17.
على الرغم من أن RAG تم تطبيقه بشكل متزايد على روبوتات الدردشة الطبية، إلا أن اهتماما محدودا تم إيلاء كيف يجب دمج إرشادات الممارسة السريرية بشكل منهجي كمصادر مرجعية للمعلومات18. العديد من إرشادات الممارسة السريرية متاحة للجمهور على الإنترنت؛ ومع ذلك، لا يزال من غير الواضح ما إذا كان هيكل الويب الحالي لديهم يمكن أن يكون إطار استرجاع مباشر لأنظمة RAG18. بالإضافة إلى ذلك، لم تثبت الطرق العملية لبناء معلومات مرجعية دون تطوير قاعدة معرفية يدوية بشكل جيد.
في هذه الدراسة، هدفنا إلى وضع مبادئ تصميم لأنظمة الذكاء الاصطناعي الموجهة للإرشادات في المجال الطبي من خلال تطوير وتقييم روبوت دردشة RAG قائم على الإرشادات يستخدم إرشادات ممارسة السرطان السريرية المتاحة للجمهور عبر الإنترنت، مما يتيح وصولا بسيطا وفي الوقت المناسب إلى المعلومات المبنية على الإرشادات. كدليل على المفهوم، قمنا بتقييم الجدوى الفنية لاسترجاع الإرشادات، وتوليد الاستجابة، وتقييد الاستجابة باستخدام الهيكل الحالي لإرشادات الممارسة السريرية المتاحة للجمهور، بهدف اقتراح بروتوكول تطوير قابل للتكرار لأنظمة RAG المشار إليها بالإرشادات.
هذه الدراسة لا تشمل الأشخاص الذين يحتاجون إلى الحماية من المخاطر المرتبطة بالبحث. لذلك، لا يتطلب مراجعة من قبل مجلس مراجعة مؤسسي وفقا للإرشادات الأخلاقية اليابانية للأبحاث الطبية التي تشمل البشر19. تم الإبلاغ عن هذه الدراسة وفقا لإرشادات التقارير الشفافة لنموذج متعدد المتغيرات للتشخيص أو التشخيص الفردي (TRIPOD)-LLM20.
راجع الشكل 1 للحصول على نظرة عامة تخطيطية لبروتوكول الدردشة الآلية RAG المعتمد على الإرشادات.

الشكل 1. سير عمل بروتوكول الدردشة الروبوت المعتمد على الإرشادات (RAG). نظرة عامة تخطيطية لسير عمل روبوتات الدردشة RAG المبنية على الإرشادات. يتم استخراج عناوين URL من صفحة جدول المحتويات في إرشادات الممارسة السريرية عبر الويب وتستخدم لبناء معلومات المرجع. يتم تحويل استعلامات المستخدمين إلى كلمات مفتاحية، ويتم معالجة محتوى صفحة الويب من خلال الترميز، وتكرار المصطلحات–تكرار الوثائق العكسي، وتحليل التشابه الجيب لتحديد صفحات الإرشادات ذات الصلة. يتم دمج معلومات المراجع المختارة وتقديمها لنموذج لغوي كبير لتوليد ردود بناء فقط على محتوى الإرشادات المشار إليه. تلخص اللوحة اليمنى عناصر التقييم المستخدمة لعناوين URL المستخرجة، ومعلومات المراجع، وردود روبوتات الدردشة. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
1. إعداد معلومات مرجعية من الإرشادات المعتمدة على الويب
2. توليد الكلمات المفتاحية من استعلامات المستخدمين
"3. معالجة النصوص وحساب التشابه
4. بناء معلومات المرجع
5. توليد الاستجابة المعتمد على الذكاء الاصطناعي
6. الإرشادات المرجعية وصياغة الأسئلة
7. تقييم الاستجابة
قابلية استرجاع المحتوى الطبي عبر صفحات جدول المحتويات
كانت بنية جمع المواقع الإلكترونية روابط URL من صفحة جدول المحتويات في الإرشاد. من دليل الرئة، تم استخراج 106 روابط من صفحة جدول المحتويات، منها 104 (98٪) تحتوي على معلومات طبية (الجدول التكميلي 1). يتم تلخيص فعالية ردود الدردشة بناء على صفحات محتوى الإرشادات في الجدول 1. كان روبوت الدردشة يولد ردودا لجميع الكلمات المفتاحية السريرية الأربع عندما تقع الأسئلة ضمن نطاق الإرشادات. بالنسبة ل "تشخيص ورم الغدة الزعترية" و"التشخيص المرضي"، تم استخراج ثلاثة روابط مرتبطة لكل كلمة مفتاحية، واعتبرت جميع الروابط المستخرجة فعالة (100٪). بالنسبة ل "طرق العلاج" و"العلاج الجراحي"، تم استخراج 15 عنوان URL لكل كلمة مفتاحية، منها 14 عنصرا فعالا (93٪).
| استعلام | الكلمات المفتاحية | عناصر المحتوى المشار إليها، n | العناصر المرجعية الفعالة، n (٪) |
| ما هي طرق التشخيص المتاحة لأورام الغدة الزعترية؟ | تشخيص ورم الغدة الدعترية | 3 | 3 (100) |
| ما هي الأساليب التشخيصية المرضية للأورام الغدة الزعترية؟ | تشخيص مرضي للورم الغدة الزعرى | 3 | 3 (100) |
| ما هي خيارات العلاج المتاحة لأورام الغدة الزعترية؟ | طرق علاج أورام الغدة الدعترية | 15 | 14 (93) |
| ما هي خيارات العلاج الجراحي للأورام الغدة الزعترية؟ | العلاج الجراحي للورم الغدة الدعترية | 15 | 14 (93) |
الجدول 1: محتوى معلومات المراجع وردود روبوتات الدردشة بناء على دليل JLCS لمرضى سرطان الرئة وعائلاتهم. ملخص استفسارات المستخدمين، الكلمات المفتاحية المولدة، عدد عناصر المحتوى المشار إليها التي تم تحديدها من خلال الاسترجاع القائم على التشابه، وعدد العناصر المرجعية الفعالة التي تحتوي على معلومات طبية. تمثل عناصر المحتوى المشار إليها العدد الإجمالي لصفحات الويب ذات الصلة المحددة على مستوى الرابط بناء على كل كلمة مفتاحية. تمثل العناصر المرجعية الفعالة عدد ونسبة صفحات الويب الفريدة التي تحتوي على معلومات طبية بعد استبعاد عناوين URL المكررة وصفحات الويب غير الطبية.
ردود روبوتات الدردشة على الأسئلة ضمن نطاق الأسئلة
يوضح الجدول 2 إجابات روبوتات الدردشة على الأسئلة التي تقع ضمن نطاق الإرشادات المقدمة. عندما تتوفر معلومات مرجعية كافية، كان روبوت الدردشة يولد ردودا من خلال تلخيص الأجزاء ذات الصلة من نص الإرشاد. تكونت الردود المولدة من حوالي 350 حرفا يابانيا. لم يتم تحديد أي هلوسات أثناء المراجعة اليدوية ضمن شروط الاختبار المحددة. لهذه الأسئلة ضمن النطاق، دعمت عدة عناصر مرجعية فعالة توليد الردود (الجدول 1). تمت ترجمة النص الياباني المولد إلى الإنجليزية باستخدام ChatGPT الإصدار 5.2 وتمت مراجعته لاحقا من قبل المحققين للدقة والاتساق مع الردود اليابانية الأصلية.
| استعلام | الردود | عدد الحروف | ||||
| ما هي طرق التشخيص المتاحة لأورام الغدة الزعترية؟ | يتطلب تشخيص أورام الغدة الدعترية كلا من التشخيص بالتصوير والتشخيص المرضي. لتشخيص التصوير، يتم إجراء أشعة مقطعية للصدر وتصوير بالرنين المغناطيسي للصدر. الغدة الصعترية وسرطان الغدة الزعترية هما أورام صلبة لا تحتوي على هواء أو سوائل داخل الورم، ويعرف أن الغزو للأنسجة الطبيعية المحيطة يكون خفيفا في الغدة الزعترية وأكثر وضوحا في سرطان الغدة الزعترية. عندما تحدد الدراسات التصويرية عدم وجود غزو للأنسجة المحيطة أو عدم وجود أورام بعيدة عن الآفة الأولية (النقائل)، يتم استئصال الورم جراحيا، ويتم إجراء التشخيص المرضي باستخدام العينة الجراحية. عندما يكون الاستئصال الجراحي صعبا، يتم إجراء خزعة موجهة بالأشعة المقطعية، ويتم التشخيص عن طريق الحصول على جزء من نسيج الورم. في التشخيص المرضي، تصنف الورم الزعدي بناء على نسبة الخلايا اللمفاوية الطبيعية داخل الورم وشكل خلايا الورم، بينما تصنف سرطانات الغدة الدعترية بالتفصيل حسب النوع الفرعي النسيجي. لتحديد المرحلة السريرية (المرحلة)، يؤخذ مدى انتشار آفات ورم الغدة الدعترية في الاعتبار، وتصنف الأورام إلى مراحل من الأول إلى الرابع بناء على ثلاثة أنظمة تصنيف مرحلية. | 366 | ||||
| ما هي الأساليب التشخيصية المرضية للأورام الغدة الزعترية؟ | في التشخيص المرضي لأورام الغدة الزعترية، يتم إجراء الفحص المرضي عن طريق الحصول على جزء أو كامل نسيج الورم. تصنف الورم الزعدي إلى أنواع فرعية مثل النوع A والنوع AB بناء على نسبة الخلايا اللمفاوية الطبيعية الموجودة داخل الورم وشكل خلايا الورم. على النقيض من ذلك، سرطان الغدة الدعترية هو ورم خبيث يتميز بعدم النمطية الخلوية، وسرطان الخلايا الحرشفية هو النوع الفرعي الأكثر شيوعا في الخلايا النسيجية. من خلال التشخيص المرضي، يتم تقييم الخصائص البيولوجية ودرجة تقدم الورم، وهو أمر مفيد لاختيار استراتيجيات العلاج المناسبة والتنبؤ بالتشخيص. بالإضافة إلى ذلك، يسمح التشخيص المرضي لأورام الغدة الصعترية بتحديد مرحلة المرض، مما يوفر معلومات مهمة لتخطيط العلاج. يتم تصنيف المراحل السريرية باستخدام ثلاثة أنظمة — تصنيف ماساوكا، وتصنيف ماساوكا-كوغا، وتصنيف UICC–TNM — وتصنف الأورام إلى أربع مراحل، من المرحلة الأولى إلى المرحلة الرابعة، حسب مدى انتشار الورم وغزوه. يوفر التشخيص المرضي معلومات لا غنى عنها للعلاج المناسب والتقييم التنبؤي لأورام الغدة الزعترية. | 330 | ||||
| ما هي خيارات العلاج المتاحة لأورام الغدة الزعترية؟ | تشمل خيارات العلاج للأورام الغدة الدعترية العلاج الجراحي (الجراحة)، العلاج الإشعاعي، والعلاج الدوائي (العلاج الكيميائي). تجرى الجراحة كإجراء يتم فيه استئصال الغدة الزعترية بالكامل مع الورم، وفي حالات الورم الزعترية، قد لا تكون هناك حاجة لعلاج إضافي. في سرطان الغدة الزعترية، قد يضاف العلاج الإشعاعي بعد العملية عندما ينتشر السرطان إلى الأنسجة المحيطة. يتم إجراء العلاج الكيميائي أو العلاج الإشعاعي في الحالات التي تكون فيها الجراحة صعبة أو عندما يحدث عودة أو انتشار بعيد، وتستخدم هذه العلاجات كجزء من العلاج الدوائي. بالإضافة إلى ذلك، في حالة سرطان الغدة الدعترية المتقدم أو المتكرر، يجرى علاج يركز على العلاج الكيميائي، كما يمكن إعطاء العلاج متعدد الوسائط يجمع بين الجراحة والعلاج الإشعاعي حسب الحاجة. علاوة على ذلك، يمكن استخدام لينفاتينيب، وهو عامل علاجي جزيئي مستهدف، في حالات سرطان الغدة الدعترية المتقدم أو المتكرر بعد العلاج الكيميائي. يتم اختيار التركيبة المناسبة لأساليب العلاج بناء على حالة المرض والحالة السريرية للمريض. | 342 | ||||
| ما هي خيارات العلاج الجراحي للأورام الغدة الزعترية؟ | يتم إجراء العلاج الجراحي للأورام الغدة الدعترية عندما يقرر أن الورم قابل للاستئصال الكامل. في الجراحة، من الممارسات الشائعة عادة إزالة الغدة الزعترية بالكامل مع الورم. في حالات الورم الزعتري، إذا تم استئصال الورم بالكامل، فلا حاجة لعلاج إضافي. على النقيض من ذلك، في حالات سرطان الغدة الزعترية، عندما يكون غزو السرطان للأنسجة المحيطة، قد يضاف العلاج الإشعاعي المساعد بعد العملية. عندما يعتبر الجراحة صعبة، يتم إجراء العلاج الكيميائي أو الإشعاعي أولا، ثم ينظر في الجراحة إذا أصبح ممكنا. إذا لم يكن بالإمكان إجراء الجراحة، قد يستمر العلاج الكيميائي أو الإشعاعي الكيميائي. بالإضافة إلى ذلك، حتى عندما تكون الجراحة ممكنة، إذا لم يكن بالإمكان تحقيق الاستئصال الكامل، قد يتم إعطاء العلاج الإشعاعي أو العلاج الكيميائي الإشعاعي بعد العملية لعلاج الورم المتبقي. يتم اختيار العلاج الجراحي بشكل مناسب حسب نوع الورم ودرجة تقدم المرض. | 342 | ||||
الجدول 2: الردود التي تم إنشاؤها بواسطة روبوت الدردشة المعتمد على الإرشادات (RAG) المستند إلى دليل JLCS لمرضى وعائلات سرطان الرئة. ردود تمثيلية تم إنشاؤها بواسطة روبوت دردشة RAG المستند إلى الإرشادات لأسئلة تتعلق بأورام الغدة الدعترية باستخدام معلومات مرجعية مستخرجة من دليل JLCS لمرضى وعائلات سرطان الرئة (https://www.haigan.gr.jp/public/guidebook/2024/). يتضمن الجدول استعلام المستخدم، والرد الذي ينشئه روبوت الدردشة، وطول الرد. تم قياس عدد الأحرف في الردود الأصلية باللغة اليابانية قبل الترجمة إلى الإنجليزية باستخدام ChatGPT الإصدار 5.2.
ردود روبوتات الدردشة على الأسئلة خارج نطاق الأسئلة
تلخص إجابات روبوتات الدردشة على الأسئلة التي كانت خارج نطاق دليل الرئة في الجدول 3. على الرغم من أن عددا محدودا من عناصر المحتوى تم الإشارة إليه لهذه الأسئلة، إلا أن نموذج توليد الردود حدد أن المعلومات المرجعية المتاحة غير كافية لتوليد استجابة قائمة على الأدلة. وبالتالي، أعاد روبوت الدردشة ردودا تشير إلى عدم وجود معلومات كافية للاستفسارات خارج نطاق النطاق. العبارات "لا توجد معلومات كافية في النص" و"لا توجد مراجع." كانت ردودا محددة مسبقا محددة في ملف النظام. تم إعادة الأولى عندما لم تكن معلومات المرجع المسترجعة كافية للإجابة على السؤال، بينما تم إعادة الثانية عندما لم يتم استرجاع أي معلومات مرجعية.
| استعلام | الكلمات المفتاحية | عناصر المحتوى المشار إليها، n | استجابة روبوتات الدردشة |
| ما هي طرق التشخيص المتاحة للورم الدبقي لدى الأطفال؟ | تشخيص الورم الدبقي للأطفال | 0 | لا توجد مراجع. |
| ما هي الأساليب التشخيصية المرضية للورم الدبقي لدى الأطفال؟ | تشخيص مرضي للورم الدبقي للأطفال | 13 | لا توجد معلومات كافية في النص. |
| ما هي خيارات العلاج المتاحة للورم الدبقي للأطفال؟ | طرق علاج الورم الدبقي للأطفال | 13 | لا توجد معلومات كافية في النص. |
| ما هي خيارات العلاج الجراحي للورم الدبقي للأطفال؟ | علاج الورم الدبقي للأطفال الجراحي | 12 | لا توجد معلومات كافية في النص. |
الجدول 3: ردود روبوتات الدردشة على الأسئلة خارج نطاق الأسئلة السريرية بناء على دليل JLCS لمرضى سرطان الرئة والعائلات. الردود التي يولدها روبوت الدردشة المعتمد على الإرشادات (RAG) للأسئلة خارج نطاق الإرشاد المرجعي. يلخص الجدول استفسارات المستخدمين، والكلمات المفتاحية المولدة، وعدد عناصر المحتوى المشار إليها التي تم تحديدها من خلال الاسترجاع القائم على التشابه، والردود الناتجة على روبوتات الدردشة. تمثل عناصر المحتوى المشار إليها العدد الإجمالي لصفحات الويب ذات الصلة المحددة على مستوى الرابط بناء على كل كلمة مفتاحية. لم يتم حساب العناصر المرجعية الفعالة للأسئلة خارج النطاق لأن المحتوى المسترجع لم يحتوي على معلومات ذات صلة بالمرض المستعلم عليه.
الملف التكميلي 1. كود بايثون لاستخراج الرابط والنص من إرشادات الممارسة السريرية عبر الويب. الكود المستخدم لاستخراج الروابط ونص صفحة الويب من صفحات جدول المحتويات في إرشادات الممارسة السريرية عبر الويب. تم استخدام عناوين URL والمحتوى النصي المستخرج لمعالجة النصوص لاحقا، وتحليل التشابه، وبناء معلومات المراجع في سير عمل روبوتات الدردشة المعتمد على التوليد المعزز بالاسترجاع (RAG) المعتمد على الإرشادات. يرجى الضغط هنا لتحميل هذا الملف.
الجدول التكميلي 1. قائمة بعناوين URL المستخرجة من صفحة جدول المحتويات المعتمد على الويب والإرشادات وتصنيفها كمعلومات طبية أو غير طبية. تمت مراجعة الروابط المستخرجة من صفحة جدول المحتويات في دليل JLCS لمرضى وعائلات سرطان الرئة يدويا وتصنيفها كمعلومات طبية أو غير طبية. تم تعريف المعلومات الطبية كمحتوى إرشادي قابل للرجوع إليه، بما في ذلك الأسئلة السريرية (CQs)، والأسئلة الخلفية، ومجموعات الأسئلة، والمواد التعليمية الإضافية ذات الصلة بإرشاد المرضى. شملت المعلومات غير الطبية صفحات الويب المجتمعية أو المنظمة، وصفحات التنقل، والروابط، والمحتوى الإضافي الآخر الذي لم يستخدم كمعلومات مرجعية لتوليد استجابة روبوتات الدردشة. يلخص الجدول جميع عناوين URL المستخرجة ونتائج تصنيفها. *تم استخراج عناوين URL من صفحة جدول المحتويات (https://www.haigan.gr.jp/public/guidebook/2024/). يرجى الضغط هنا لتحميل هذا الملف.
في هذه الدراسة، درسنا فائدة روبوت دردشة RAG قائم على الإرشادات يستخدم إرشادات ممارسة سريرية عبر الويب—دليل JLCS لمرضى وعائلات سرطان الرئة—كمصدر مرجعي للمعلومات. كان روبوت الدردشة يولد ردودا تستند إلى محتوى الإرشادات من خلال استغلال هيكل الويب للإرشادات واسترجاع الصفحات بناء على تشابهها مع استفسارات المستخدمين. أظهر هذا النهج أن الاسترجاع القائم على التشابه مع توليد الاستجابة الموجهة إلى الإرشادات يمكن أن يدعم تقديم المعلومات الطبية بشكل موثوق وفعال. سلطت الدراسات الحديثة الضوء على إمكانيات وقيود روبوتات الدردشة الطبية المبنية على نماذج اللغة الكبيرة (LLM)، خاصة فيما يتعلق بالهلوسات وموثوقية الاستجابة 12,13,14. على عكس الدراسات السابقة التي ركزت على أطر روبوتات الدردشة العامة 10,12,13، يظهر البروتوكول الحالي نهج RAG القابل للتكرار قائما على الإرشادات يسترجع محتوى إرشادات المريض على مستوى الرابط ويولد ردودا مبنية على معلومات مرجعية يمكن التعرف عليها. لذا توفر هذه الدراسة بروتوكولا شفافا لتوصيل معلومات السرطان بدلا من نظام روبوتات دردشة سريرية معتمد بالكامل.
بدلا من تدريب الذكاء الاصطناعي على كامل مجموعة الإرشادات، اختار نظامنا فقط الأسئلة المرجعية الأكثر صلة بكل استفسار مستخدم (الشكل 1). تم تقييم الصلة بين نص السؤال وكل CQ بشكل كمي باستخدام حسابات تشابه جيب تمام تعتمد على لغة البرمجة مع تمثيلات متجهات TF–IDF. استنادا إلى هذه الدرجات التشابهية، تم تصنيف واختيار الأسئلة المعتمدة بترتيب تنازلي من حيث الصلة، مما أتاح الاستخلاص المنهجي لمصادر المعلومات المناسبة من داخل الإرشاد دون الاعتماد على الحكم الذاتي (الجدول 1). علاوة على ذلك، ساعد دمج نصوص CQ المسترجعة وعرضها بشكل جماعي للذكاء الاصطناعي في الحفاظ على أساس أدلة متسق لتوليد الردود، مما حسن من دقة وتماسك الردود المولدة في السياق. في أنظمة RAG، يعتمد توليد المعلومات الصحيحة بشكل حاسم على مصادر مرجعية دقيقةومناسبة 14. سمح هذا التصميم للنظام بتعويض المعلومات التي لا يمكن تغطيتها بشكل كاف من خلال CQ واحد، مما ساهم في إجابات أكثر شمولا وقابلية للواقعية سريريا. بالإضافة إلى ذلك، يتيح RAG استرجاع مرن لمحتوى CQ المحدث وهو مناسب جدا للتطبيقات الطبية المبنية على الأدلة10,11. على الرغم من أن مناهج RAG القائمة على الإرشادات قد وصفت سابقا11,18، إلا أن البروتوكول الحالي يختلف في استخدامه لهيكل الويب القائم على CQ القائم على إرشادات موجهة للمريض كإطار استرجاع أساسي. يوفر هذا التصميم سير عمل شفاف وقابل للتكرار يمكن تنفيذه دون الحاجة إلى بناء قاعدة معرفية يدوية أو إعادة تدريب النماذج.
ومن المهم أن روبوت الدردشة قيد ردوده ضمن نطاق الإرشادات المشار إليها. عندما كانت الأسئلة خارج محتوى الإرشادات، كان النظام يمتنع صراحة عن توليد إجابات، مما يقلل من خطر الإجابات غير المدعومة. وقد عزز استخدام تشابه جيب تمامي في اختيار المراجع في التحكم في سلامة وموثوقية الاستجابات المولدة (الجدول 2). كما تم استرجاع صفحات المراجع للأسئلة خارج نطاق الإرشاد (الجدول 3). كانت قيم التشابه في جيب تمامي أعلى للأسئلة داخل النطاق (0.20–0.65) مقارنة بالأسئلة خارج النطاق (0.20–0.31؛ البيانات غير معروضة)، لكن درجات التشابه المنخفضة كانت لا تزال تعطي لبعض صفحات الإرشادات حتى عندما لم يكن المحتوى ذا صلة سريرية. حدث ذلك لأن تشابه جيب تمام تم حسابه فقط بناء على مطابقة الكلمات المفتاحية بين الاستعلام ونص الإرشاد. ومن المهم أن هذه المراجع منخفضة الصلة لم تؤد إلى ردود غير مناسبة، حيث امتنع روبوت الدردشة عن توليد الإجابات عندما لا تتوفر معلومات مرجعية كافية. لم يتم تحديد أي هلوسات أثناء المراجعة اليدوية ضمن شروط الاختبار المحددة. تم اختيار عتبة التشابه في جيب تمامها 0.2 تجريبيا خلال الاختبارات الأولية لتحقيق التوازن بين حساسية الاسترجاع والنوعية. على الرغم من أن هذا الحد كان فعالا في ظروف الاختبار الحالية، إلا أن التقييم المنهجي لحساسية العتبة كان خارج نطاق هذه الدراسة البروتوكولية. ينبغي أن تبحث الدراسات المستقبلية في تأثيرات إعدادات العتبة البديلة باستخدام مجموعات بيانات أكبر ومعايير استرجاع كمي. تشير السلوكيات الملحوظة إلى أن التحكم في المخرجات المعتمد على RAG قد يكون مفيدا في تطبيقات الذكاء الاصطناعي الطبي. ومع ذلك، استند التقييم الحالي إلى عدد محدود من الأسئلة داخل النطاق وخارج النطاق، وكان الهدف الأساسي هو تقييم إثبات مفهوم لسير العمل المقترح. لذلك، لا ينبغي تفسير النتائج على أنها تحقق شامل للدقة السريرية أو السلامة أو قابلية التعميم.
هذه الدراسة لها عدة قيود تقنية. استخدمنا المحلل المورفولوجي الياباني وGPT-3.5-turbo-16k (LLM لتوليد الاستجابة). تم اختيار نموذج اللغة الكبيرة لأنه كان نموذجا متاحا ومستقرا على نطاق واسع في وقت تطوير النظام، مما أتاح تنفيذ سير العمل المقترح قابلا لإعادة إنتاجه. للمحللات الشكلية ونماذج اللغة الكبيرة خصائص مميزة؛ لذا، يؤثر اختيار النماذج أو المكتبات على دقة استخراج المعلومات ومحتوى الردود المولدة22,23. على الرغم من أن النماذج الأحدث (مثل نماذج اللغة الكبيرة من فئة GPT-4 أو GPT-5) قد تحسن الأداء والصلاحية الخارجية22، إلا أن تقييم النماذج البديلة كان خارج نطاق دراسة البروتوكول الحالية. قد تقدم نماذج اللغة الكبيرة الحديثة قدرة استدلالية محسنة، واتباع التعليمات، وجودة الاستجابة؛ ومع ذلك، كان الهدف الأساسي من هذه الدراسة هو تقييم جدوى إطار عمل RAG قائم على الإرشادات بدلا من مقارنة أداء نماذج اللغة الكبيرة المختلفة. قد يمكن تحسين هذه المكونات بشكل أكبر توليد استجابة أكثر كفاءة ودقة، ويعد التحقق باستخدام تكوينات نماذج مختلفة ضروريا لتقييم قابلية تعميم هذه النتائج. بالإضافة إلى ذلك، تم تطوير البروتوكول الحالي باستخدام إرشادات باللغة اليابانية وتحليل صرفي ياباني. على الرغم من أن إطار الاسترجاع القائم على التحويل بين TF–IDF، والتشابه في جيب تمام، وRAG مستقل عن اللغة من حيث المبدأ، إلا أن التنفيذ في لغات أخرى سيتطلب أدوات معالجة نصوص خاصة باللغة والتحقق من الصحة. على الرغم من أن هذه الدراسة كانت محدودة بإرشاد واحد وبالتالي لا تسمح بالمقارنة المباشرة بين هياكل الإرشادات المختلفة، إلا أن المنظمة على مستوى CQ سهلت الاستخلاص المنهجي لمحتوى الإرشادات ودعمت بناء معلومات مرجعية لروبوت دردشة RAG القائم على الإرشادات. على وجه الخصوص، لعبت بنية الويب للإرشاد—حيث يرتبط كل CQ بعنوان URL فريد—دورا عمليا مهما في تمكين جمع المحتوى المرجعي الفعال وتنظيمه على مستوى الرابط. قد تتطلب الإرشادات ذات الصيغ المختلفة، بما في ذلك المستندات المستندة إلى PDF أو المواقع التي لا تحتوي على روابط بمستوى CQ، استراتيجيات تقسيم واسترجاع بديلة. لذلك، لا يزال من الضروري إثبات قابلية تعميم سير العمل الحالي إلى هياكل الإرشادات والتخصصات الطبية الأخرى. يجب أن يقيم العمل المستقبلي مدى تطبيق هذا النهج عبر أمراض متعددة، وصيغ الإرشادات، ومصادر المعلومات.
توفر نتائج هذه الدراسة إرشادات عملية لتصميم أنظمة الذكاء الاصطناعي المستندة إلى الإرشادات، وتظهر أن روبوت دردشة RAG المبني على الإرشادات والمرجعية للإرشادات السريرية عبر الإنترنت لديه القدرة على أن يكون أداة لتقديم معلومات طبية متعلقة بالسرطان. ومع ذلك، تمثل هذه الدراسة تقييما إثباتا للمفهوم يهدف إلى إثبات الجدوى الفنية لاسترجاع الإرشادات، وتوليد الاستجابة، وآليات تقييد الاستجابة، ولا ينبغي تفسيرها على أنها تحقق سريري رسمي لنظام معلومات طبية. لم يتم تقييم الفعالية السريرية والسلامة ونتائج المستخدمين، ولا تزال الدراسات المستقبلية بحاجة إلى إثباتها. من منظور أخلاقي وسلامة المستخدم، قد يقلل تقييد الردود على المعلومات المدعومة بالإرشادات من خطر الردود غير المدعومة أو الهلوسية. ومع ذلك، قد يقلل سلوك الرفض المفرط أيضا من رضا المستخدمين ومدى الفائدة المدركة. لذا يجب أن يقيم العمل المستقبلي التوازن بين السلامة وسهولة الاستخدام مع الحفاظ على الضمانات المناسبة ضد المعلومات المضللة. من خلال الاستفادة من هيكل المعلومات في الإرشادات المعتمدة على الويب وتقديم إجابات مركزة على أسئلة المستخدمين، قد يكون هذا النظام نموذجا مفيدا للتطبيقات المستقبلية للذكاء الاصطناعي في تقديم المعلومات الطبية.
يعلن المؤلفون عدم وجود مصالح متنافسة.
يشكر المؤلفون كينيتشي إينووي، دكتور في الطب، دكتوراه في مركز ثدي مستشفى شونان التذكاري، على دعمه الفني المكثف في تطوير روبوت الدردشة المعتمد على الإرشادات والجيل المعزز بالاسترجاع. كما يشكر المؤلفون الدكتوراه شيكاكو ياماكي، وجميع أعضاء فريق البحث في معهد مكافحة السرطان، المركز الوطني للسرطان في اليابان (طوكيو، اليابان)، على تقديم نصائح قيمة حول الموضوع الذي تم تناوله في هذه الورقة. بالإضافة إلى ذلك، يشكر المؤلفون Editage على التحرير باللغة الإنجليزية. وقد تم دعم هذا العمل بمنحة بحثية من علوم الصحة والعمل (R6–Cancer Control–23EA1026).
```html
| الاسم | الشركة | رقم فهرسي | التعليقات |
|---|---|---|---|
| Beautiful Soup 4 (الإصدار 4.12.3) | مشروع Beautiful Soup | N/A | مكتبة Python المستخدمة لاستخراج الروابط URL وتحليل HTML |
| إصدار ChatGPT 4o | OpenAI | N/A | يستخدم لتوليد الكلمات الرئيسية |
| GPT-3.5-turbo | OpenAI | N/A | يستخدم لتوليد الردود |
| دليل JLCS لمرضى سرطان الرئة وعائلاتهم | جمعية اليابان لسرطان الرئة | N/A | إرشادات الممارسة السريرية على شبكة الإنترنت المستخدمة كمرجع |
| MeCab (الإصدار 0.996) | مشروع MeCab | N/A | محلل شكلي ياباني |
| واجهة برمجة التطبيقات الخاصة بـOpenAI | OpenAI | N/A | يستخدم لتوليد الردود القائمة على الذكاء الاصطناعي |
| Python (الإصدار 3.12) | مؤسسة برمجيات Python | N/A | بيئة برمجة |
| Requests (الإصدار 2.32.3) | مشروع Requests | N/A | مكتبة Python المستخدمة للحصول على صفحات الويب |
| scikit-learn (الإصدار 1.6.1) | مطورو scikit-learn | N/A | يستخدم لتحوير TF–IDF والحسابات المتشابهة للجيوب |
| urllib.parse | مؤسسة برمجيات Python | N/A | مكتبة Python المستخدمة لتطبيع الروابط URL وربطها |
طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه
طلب إذن