$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
سرعان ما أصبحت نماذج اللغات الكبيرة (LLMs) مثل ChatGPT من OpenAI أو Llama من Meta الذكاء الاصطناعي مصدرا شائعا لإنشاء نص ذي صلة بموجه المستخدم. تعمل هذه النماذج في الأصل للتنبؤ بالعناصر المعجمية التالية في تسلسل ، وقد تطورت لفهم السياق ، وترميز المعلومات السريرية ، وإظهار الأداء العالي في مجموعة متنوعة من المهام1،2،3،4. على الرغم من أن النماذج اللغوية تسبق هذه القدرات ومستوى شعبيتها الحالي بعقود5 ، إلا أن التطورات الحديثة في التعلم العميق وقدرات الحوسبة جعلت LLMs التجارية عالية الجودة المدربة مسبقا متاحة للمستخدمين على نطاق واسع عبر التقنيات المستندة إلى الويب وواجهات برامج التطبيقات (APIs) 6. ومع ذلك ، هناك العديد من القيود الملحوظة على استهلاك LLMs بهذا التنسيق.
التحدي 1: مجموعة التدريب الثابت
يتم تدريب LLMs على مجموعة هائلة (على سبيل المثال ، تريليوني رمز مميز في حالة Llama 27) ولكنها ثابتة من البيانات النصية. وهذا يشكل تحديا لإنتاج استجابات دقيقة تتعلق بالمجالات التي تشهد تطورا سريعا أو متغيرة الأدبيات. في هذا النهج الثابت ، ستتطلب LLMs إعادة تدريب متكررة لمواكبة أحدث البيانات ، وهي ليست عملية ولا قابلة للتطوير. علاوة على ذلك ، فإن المطالبات التي تتطلب استجابات بناء على معلومات غير موجودة في بيانات التدريب قد تمنع إنشاء نص مفيد أو تؤدي إلى الهلوسة8. تثير حالات الهلوسة أو تلفيق الحقائق مخاوف كبيرة بشأن موثوقية LLMs ، لا سيما في الأماكن التي تكون فيها دقة المعلومات حرجة9.
التحدي 2: عدم خصوصية المجال
غالبا ما يتم إنشاء نماذج تم تدريبها مسبقا للاستخدام العام ، بينما قد يحتاج المستخدمون إلى نموذج محسن خصيصا للأداء في مجال معين. بالإضافة إلى ذلك ، فإن الموارد والبيانات الحسابية المطلوبة لتدريب نموذج من جديد أو إجراء ضبط دقيق كبير باهظة بالنسبة للعديد من المستخدمين.
التحدي 3: انعدام الخصوصية
قد يكون المستخدمون الذين يتابعون التطبيقات التي تتضمن بيانات حساسة أو معلومات خاصة غير راغبين أو غير قادرين على استخدام بعض خدمات LLM لأنهم يفتقرون إلى معلومات حول كيفية تخزين البيانات أو استخدامها.
التحدي 4: الافتقار إلى الاستقرار المضمون
قد تقوم الخدمات ذات LLMs المملوكة بتغيير النماذج المتاحة أو تغيير السلوك في أي وقت ، مما يجعل الاستقرار مصدر قلق لتنفيذ التطبيقات التي تعتمد على هذه الخدمات.
التوليد المعزز بالاسترجاع (RAG) هو تقنية تم تطويرها لتحسين أداء LLM ، لا سيما في الاستعلامات المتعلقة بالمعلومات خارج مجموعة تدريب النموذج10،11. تعمل هذه الأنظمة على زيادة LLMs من خلال دمج المعلومات السياقية التي يجب مراعاتها عند إنشاء استجابة لاستعلام المستخدم. وصفت العديد من الأعمال الحديثة تطبيقات أنظمة RAG ومزاياهاالمحتملة 12،13،14.
الهدف من الطريقة الموضحة في هذا العمل هو إظهار بناء مثل هذا النظام وتوفير إطار عمل للباحثين للتجربة السريعة على LLMs المعززة الخاصة بالمجال. تنطبق هذه الطريقة على المستخدمين الذين يسعون إلى زيادة LLM بمصدر بيانات خارجي يستند إلى النص. على وجه التحديد ، يتمثل الهدف الشامل لهذا البروتوكول في توفير رمز خطوة بخطوة قابل للتوسيع لمجموعة متنوعة من تجارب LLM و RAG العملية دون الحاجة إلى خبرة فنية كبيرة في مجال نمذجة اللغة ، على الرغم من أن المعرفة العملية ب Python مطلوبة لتطبيق هذا النهج دون تعديل. لزيادة تحكم المستخدم والشفافية وقابلية النقل والقدرة على تحمل تكاليف الحلول ، يتم استخدام الأدوات مفتوحة المصدر والمتاحة للجمهور. يعالج النظام المقترح القضايا المذكورة سابقا بالطرق التالية:
الحلان 1 و2: مجموعة التدريب الثابت والافتقار إلى خصوصية المجال
تستفيد المنهجية المقدمة من نهج الفريق الاستشاري للاتصالات الراديوية ، باستخدام عمليات التضمين لتوفير معلومات خاصة بالمجال غير المدرجة في بيانات التدريب الأصلية. على مستوى عال ، تقوم نماذج التضمين بتحويل النص أو البيانات الأخرى إلى تمثيل كمتجه أو مصفوفة أحادية البعد من الأرقام. هذه التقنية مفيدة لأنها تحول المعلومات الدلالية الواردة في النص إلى شكل رقمي كثيف. من خلال إسقاط استعلام المستخدم في نفس مساحة التضمين ، يمكن استخدام خوارزميات مختلفة لحساب المسافة15 ، وبالتالي ، التشابه الدلالي التقريبي ، بين استعلام المستخدم وأقسام المستندات النصية. وبالتالي ، فإن إنشاء قاعدة بيانات لمثل هذه المتجهات من المستندات المقسمة إلى أقسام منفصلة يمكن أن يسهل البحث في عدد كبير من المستندات عن النص الأكثر صلة باستعلام المستخدم (الشكل 1). هذا النهج قابل للتوسيع لأي وثيقة نصية. في حين أن الأساليب الأخرى ، مثل قدرات البحث عبر الإنترنت ، بدأت في التنفيذ لزيادة LLMs ، فإن هذا النهج يسمح للمستخدمين باختيار المصادر التي تعتبر ذات جودة عالية بما فيه الكفاية لحالة الاستخدام الخاصة بهم.
الحل 2: الافتقار إلى الخصوصية
في هذا التنفيذ ، تم استخدام بيئة سحابية آمنة للاستضافة ، مع عدم وجود مطالبات من المستخدم أو استجابات تم إنشاؤها أو بيانات أخرى تغادر هذا النظام البيئي. ومع ذلك ، تتم كتابة جميع التعليمات البرمجية بطريقة حيادية للنظام الأساسي ، لضمان إمكانية استبدال موفر سحابة آخر أو أجهزة محلية.
الحل 3: عدم وجود استقرار مضمون
يستخدم هذا النهج مكتبات مفتوحة المصدر ويركز على زيادة LLMs بأوزان متاحة للجمهور ، مما يسمح بدرجة أعلى من الشفافية والاستقرار وتعيين الإصدار ، إذا لزم الأمر.
يظهر مخطط كامل لنظامنا المقترح في الشكل 2 ، ويتم توضيح التعليمات التفصيلية حول تكرار هذا النظام أو نظام مشابه في قسم البروتوكول. هناك اعتبار إضافي عند تغيير سلوك النموذج من خلال الضبط الدقيق أو الزيادة وهو تقييم الأداء. في نماذج توليد اللغة ، يمثل هذا تحديا فريدا لأن العديد من مقاييس التعلم الآلي التقليدية غير قابلة للتطبيق. على الرغم من وجود مجموعة متنوعة من التقنيات16 ، في هذه الدراسة ، تم استخدام أسئلة الاختيار من متعدد (MCQs) المكتوبة من قبل الخبراء لتقييم الدقة ومقارنة الأداء قبل وبعد الزيادة وكذلك مقابل LLMs البديلة الشائعة.