Method Article

زيادة نماذج اللغات الكبيرة عبر عمليات تضمين المتجهات لتحسين الاستجابة الخاصة بالمجال

DOI:

10.3791/66796

December 6th, 2024

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

في هذا البروتوكول ، يتم تحسين جودة استجابة نموذج اللغة الكبير من خلال الزيادة باستخدام مقالات علمية خاصة بالمجال تمت مراجعتها من قبل الأقران من خلال آلية تضمين المتجه. بالإضافة إلى ذلك ، يتم توفير التعليمات البرمجية للمساعدة في مقارنة الأداء عبر نماذج اللغات الكبيرة.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ظهرت نماذج اللغات الكبيرة (LLMs) كمورد شائع لإنشاء المعلومات ذات الصلة باستعلام المستخدم. يتم إنشاء هذه النماذج من خلال عملية تدريب كثيفة الاستخدام للموارد باستخدام مجموعة واسعة وثابتة من البيانات النصية. تؤدي هذه الطبيعة الثابتة إلى قيود على التبني في المجالات ذات المعرفة المتغيرة بسرعة ومعلومات الملكية والبيانات الحساسة. في هذا العمل ، تم تحديد طرق زيادة LLMs للأغراض العامة ، والمعروفة باسم النماذج التأسيسية ، مع المعلومات الخاصة بالمجال باستخدام نهج قائم على التضمين لدمج المخطوطات العلمية المحدثة التي راجعها الأقران. يتم تحقيق ذلك من خلال أدوات مفتوحة المصدر مثل Llama-Index والنماذج المتاحة للجمهور مثل Llama-2 لزيادة الشفافية وخصوصية المستخدم والتحكم فيه وقابلية التكرار. بينما يتم استخدام المخطوطات العلمية كمثال على حالة الاستخدام ، يمكن توسيع هذا النهج إلى أي مصدر بيانات نصي. بالإضافة إلى ذلك ، تتم مناقشة طرق تقييم أداء النموذج بعد هذا التحسين. تتيح هذه الأساليب التطوير السريع لأنظمة LLM للمجالات عالية التخصص بغض النظر عن شمولية المعلومات في مجموعة التدريب.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

سرعان ما أصبحت نماذج اللغات الكبيرة (LLMs) مثل ChatGPT من OpenAI أو Llama من Meta الذكاء الاصطناعي مصدرا شائعا لإنشاء نص ذي صلة بموجه المستخدم. تعمل هذه النماذج في الأصل للتنبؤ بالعناصر المعجمية التالية في تسلسل ، وقد تطورت لفهم السياق ، وترميز المعلومات السريرية ، وإظهار الأداء العالي في مجموعة متنوعة من المهام1،2،3،4. على الرغم من أن النماذج اللغوية تسبق هذه القدرات ومستوى شعبيتها الحالي بعقود5 ، إلا أن التطورات الحديثة في التعلم العميق وقدرات الحوسبة جعلت LLMs التجارية عالية الجودة المدربة مسبقا متاحة للمستخدمين على نطاق واسع عبر التقنيات المستندة إلى الويب وواجهات برامج التطبيقات (APIs) 6. ومع ذلك ، هناك العديد من القيود الملحوظة على استهلاك LLMs بهذا التنسيق.

التحدي 1: مجموعة التدريب الثابت
يتم تدريب LLMs على مجموعة هائلة (على سبيل المثال ، تريليوني رمز مميز في حالة Llama 27) ولكنها ثابتة من البيانات النصية. وهذا يشكل تحديا لإنتاج استجابات دقيقة تتعلق بالمجالات التي تشهد تطورا سريعا أو متغيرة الأدبيات. في هذا النهج الثابت ، ستتطلب LLMs إعادة تدريب متكررة لمواكبة أحدث البيانات ، وهي ليست عملية ولا قابلة للتطوير. علاوة على ذلك ، فإن المطالبات التي تتطلب استجابات بناء على معلومات غير موجودة في بيانات التدريب قد تمنع إنشاء نص مفيد أو تؤدي إلى الهلوسة8. تثير حالات الهلوسة أو تلفيق الحقائق مخاوف كبيرة بشأن موثوقية LLMs ، لا سيما في الأماكن التي تكون فيها دقة المعلومات حرجة9.

التحدي 2: عدم خصوصية المجال
غالبا ما يتم إنشاء نماذج تم تدريبها مسبقا للاستخدام العام ، بينما قد يحتاج المستخدمون إلى نموذج محسن خصيصا للأداء في مجال معين. بالإضافة إلى ذلك ، فإن الموارد والبيانات الحسابية المطلوبة لتدريب نموذج من جديد أو إجراء ضبط دقيق كبير باهظة بالنسبة للعديد من المستخدمين.

التحدي 3: انعدام الخصوصية
قد يكون المستخدمون الذين يتابعون التطبيقات التي تتضمن بيانات حساسة أو معلومات خاصة غير راغبين أو غير قادرين على استخدام بعض خدمات LLM لأنهم يفتقرون إلى معلومات حول كيفية تخزين البيانات أو استخدامها.

التحدي 4: الافتقار إلى الاستقرار المضمون
قد تقوم الخدمات ذات LLMs المملوكة بتغيير النماذج المتاحة أو تغيير السلوك في أي وقت ، مما يجعل الاستقرار مصدر قلق لتنفيذ التطبيقات التي تعتمد على هذه الخدمات.

التوليد المعزز بالاسترجاع (RAG) هو تقنية تم تطويرها لتحسين أداء LLM ، لا سيما في الاستعلامات المتعلقة بالمعلومات خارج مجموعة تدريب النموذج10،11. تعمل هذه الأنظمة على زيادة LLMs من خلال دمج المعلومات السياقية التي يجب مراعاتها عند إنشاء استجابة لاستعلام المستخدم. وصفت العديد من الأعمال الحديثة تطبيقات أنظمة RAG ومزاياهاالمحتملة 12،13،14.

الهدف من الطريقة الموضحة في هذا العمل هو إظهار بناء مثل هذا النظام وتوفير إطار عمل للباحثين للتجربة السريعة على LLMs المعززة الخاصة بالمجال. تنطبق هذه الطريقة على المستخدمين الذين يسعون إلى زيادة LLM بمصدر بيانات خارجي يستند إلى النص. على وجه التحديد ، يتمثل الهدف الشامل لهذا البروتوكول في توفير رمز خطوة بخطوة قابل للتوسيع لمجموعة متنوعة من تجارب LLM و RAG العملية دون الحاجة إلى خبرة فنية كبيرة في مجال نمذجة اللغة ، على الرغم من أن المعرفة العملية ب Python مطلوبة لتطبيق هذا النهج دون تعديل. لزيادة تحكم المستخدم والشفافية وقابلية النقل والقدرة على تحمل تكاليف الحلول ، يتم استخدام الأدوات مفتوحة المصدر والمتاحة للجمهور. يعالج النظام المقترح القضايا المذكورة سابقا بالطرق التالية:

الحلان 1 و2: مجموعة التدريب الثابت والافتقار إلى خصوصية المجال
تستفيد المنهجية المقدمة من نهج الفريق الاستشاري للاتصالات الراديوية ، باستخدام عمليات التضمين لتوفير معلومات خاصة بالمجال غير المدرجة في بيانات التدريب الأصلية. على مستوى عال ، تقوم نماذج التضمين بتحويل النص أو البيانات الأخرى إلى تمثيل كمتجه أو مصفوفة أحادية البعد من الأرقام. هذه التقنية مفيدة لأنها تحول المعلومات الدلالية الواردة في النص إلى شكل رقمي كثيف. من خلال إسقاط استعلام المستخدم في نفس مساحة التضمين ، يمكن استخدام خوارزميات مختلفة لحساب المسافة15 ، وبالتالي ، التشابه الدلالي التقريبي ، بين استعلام المستخدم وأقسام المستندات النصية. وبالتالي ، فإن إنشاء قاعدة بيانات لمثل هذه المتجهات من المستندات المقسمة إلى أقسام منفصلة يمكن أن يسهل البحث في عدد كبير من المستندات عن النص الأكثر صلة باستعلام المستخدم (الشكل 1). هذا النهج قابل للتوسيع لأي وثيقة نصية. في حين أن الأساليب الأخرى ، مثل قدرات البحث عبر الإنترنت ، بدأت في التنفيذ لزيادة LLMs ، فإن هذا النهج يسمح للمستخدمين باختيار المصادر التي تعتبر ذات جودة عالية بما فيه الكفاية لحالة الاستخدام الخاصة بهم.

الحل 2: الافتقار إلى الخصوصية
في هذا التنفيذ ، تم استخدام بيئة سحابية آمنة للاستضافة ، مع عدم وجود مطالبات من المستخدم أو استجابات تم إنشاؤها أو بيانات أخرى تغادر هذا النظام البيئي. ومع ذلك ، تتم كتابة جميع التعليمات البرمجية بطريقة حيادية للنظام الأساسي ، لضمان إمكانية استبدال موفر سحابة آخر أو أجهزة محلية.

الحل 3: عدم وجود استقرار مضمون
يستخدم هذا النهج مكتبات مفتوحة المصدر ويركز على زيادة LLMs بأوزان متاحة للجمهور ، مما يسمح بدرجة أعلى من الشفافية والاستقرار وتعيين الإصدار ، إذا لزم الأمر.

يظهر مخطط كامل لنظامنا المقترح في الشكل 2 ، ويتم توضيح التعليمات التفصيلية حول تكرار هذا النظام أو نظام مشابه في قسم البروتوكول. هناك اعتبار إضافي عند تغيير سلوك النموذج من خلال الضبط الدقيق أو الزيادة وهو تقييم الأداء. في نماذج توليد اللغة ، يمثل هذا تحديا فريدا لأن العديد من مقاييس التعلم الآلي التقليدية غير قابلة للتطبيق. على الرغم من وجود مجموعة متنوعة من التقنيات16 ، في هذه الدراسة ، تم استخدام أسئلة الاختيار من متعدد (MCQs) المكتوبة من قبل الخبراء لتقييم الدقة ومقارنة الأداء قبل وبعد الزيادة وكذلك مقابل LLMs البديلة الشائعة.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

في حالة الاستخدام الموضحة في هذه الورقة ، تم إنشاء مخزن المتجهات باستخدام إرشادات منشورة من مجموعة عمل إجماع شيكاغو17. تم إنشاء مجموعة الخبراء هذه لتطوير مبادئ توجيهية لإدارة السرطانات الصفاقية. تم اختيار مجال الموضوع كما هو ضمن مجال الخبرة السريرية للباحثين. تم الوصول إلى مجموعة الأوراق من مستودعات المجلات عبر الإنترنت بما في ذلك السرطان وحوليات الأورام الجراحية. تم استخدام نموذج تضمين مضغوط (33.4 مليون معلمة) تم إنشاؤه بواسطة أكاديمية بكين للذكاء الاصطناعي (BAAI ، https://www.baai.ac.cn/english.html) ، bge-small-en ، لإنشاء عمليات تضمين من مستندات المصدر. ثم تم استخدام قاعدة البيانات الناتجة لزيادة نماذج Llama 2 و Open-الذكاء الاصطناعي7. لراحة القارئ ، يتم توفير الكود من خلال GitHub (https://github.com/AnaiLab/AugmentedLLM). لضمان قابلية التكرار ، يوصى باستخدام نفس إصدارات المكتبات المستخدمة في قائمة المتطلبات المتوفرة بالإضافة إلى نفس إصدار Python. يمكن العثور على تفاصيل إضافية حول التثبيت أو الوثائق المتعلقة بالأدوات المستخدمة في الطرق التالية على المواقع الرسمية لموفري Python (https://www.python.org) و git (https://git-scm.com) و Llama-Index (https://llamaindex.ai) و Chroma (https://trychroma.com).

1. المتطلبات الأساسية: مراجعة التعليمات البرمجية وتثبيت المكتبات المطلوبة

  1. تحقق من تثبيت git وpython وpip.
    1. في المحطة الطرفية، قم بتشغيل الأوامر التالية للتحقق من التثبيت:
      git - الإصدار
      python3 - الإصدار
      pip3 - الإصدار
  2. تحقق من الكود ومتطلبات التثبيت.
    1. في المحطة الطرفية، قم بتشغيل الأوامر التالية:
      git clone https://github.com/AnaiLab/AugmentedLLM.git
      القرص المضغوط / AugmentedLLM /

      PIP3 تثبيت -R requirements.txt

2. إنشاء قاعدة بيانات متجهة باستخدام Llama-Index

  1. تحويل تنسيقات ملفات RTF (مطلوبة فقط إذا كانت الملفات بتنسيق RTF).
    1. قم بتحرير الملف بعنوان config.py، واستبدل مسارات الملفات في التعليمات البرمجية التالية بموقع مقالات RTF المراد تحويلها والموقع الذي ستكتب إليه ملفات النص العادي عن طريق كتابة الأوامر التالية. احفظ الملف.
      rtf_file_dir = './articles_rtf/'
      converted_file_dir = './articles_converted/'
    2. في محطة طرفية، في نفس الدليل، قم بتنفيذ التعليمات البرمجية لإنشاء إصدارات نص عادي من ملفات RTF عن طريق تشغيل الأمر التالي:
      python3 ./convert_rtf.py
  2. إنشاء قاعدة بيانات vector وحفظها.
    1. تحرير ملف config.py ، واستبدال قيمة المتغير التالي بمسار ملف المجلد الذي يحتوي على المستندات التي سيتم زيادة LLM بها ؛ احفظ الملف.
      article_dir = './articles/'
    2. في محطة طرفية، في نفس الدليل، قم بتنفيذ التعليمات البرمجية باستخدام الأمر التالي لإنشاء قاعدة البيانات واستمرارها تحقق من حفظ قاعدة البيانات الآن في المجلد vector_db.
      python3 ./build_index.py

3. زيادة نموذج لاما مع قاعدة بيانات المتجهات التي تم إنشاؤها في القسم 2

  1. إنشاء مثيل ل LLM مخصص محليا (اختياري)
    ملاحظة: تنفيذ هذه الخطوة مطلوب فقط إذا كنت ترغب في استخدام نموذج آخر غير Llama-2-7B الافتراضي. إذا كنت ترغب في استخدام النموذج الافتراضي، فانتقل إلى الخطوة 3.2.
    1. (باستخدام LLM مخصص) حدد LLM لتزييته عن طريق تحرير run_augmented_llm.py وتمرير كائن llama-index LLM في المنشئ كمعلمة llm في أسطر التعليمات البرمجية التالية بدلا من لا شيء.
      augmentedLLM = AugmentedLLM (vector_store ، llm = لا شيء)
  2. الاستعلام المعزز LLM
    1. قم بتشغيل الأمر التالي في المحطة الطرفية:
      python3 ./run_augmented_llm.py
    2. قم بتشغيل استعلامات المستخدم للحصول على استجابة معززة بالبيانات الموجودة في مجموعة المخطوطات (الشكل 3 والشكل 4). اضغط على CTRL + C للخروج عند الانتهاء.

4. مقارنة برمجية لمعاهد القانون البديلة

  1. إنشاء MCQs.
    1. قم بتحرير questions.py الملف ، مع ملاحظة تنسيق الأمثلة. أضف أسئلة بتنسيق مماثل. احفظ الملف.
  2. اتصل ب GPT-3.5 أو GPT-4 أو OpenChat أو نماذج المقارنة الأخرى عبر واجهة برمجة التطبيقات.
    1. قم بتحرير ملف config.py ، مع إضافة مفتاح واجهة برمجة التطبيقات ل OpenAI أو Huggingface إذا كان الهدف هو المقارنة مع النماذج من أي من المزودين. احفظ الملف.
      huggingface_key = ''
      openai_key = ''
    2. قم بتحرير ملف compare_llms.py ، واختر مجموعة النماذج التي تريد اختبارها عن طريق إلغاء التعليق (حذف الأحرف "#" عند استجداء هذا السطر) للمقارنة بها.
      ملاحظة: تتطلب بعض أدوات المقارنة مفتاح واجهة برمجة التطبيقات كما هو محدد في الخطوة 4.2.1. بالإضافة إلى ذلك ، قم بتحرير المعلمة output_dir لتغيير مكان تخزين إخراج LLM إذا رغبت في ذلك ؛ خلاف ذلك ، سيتم استخدام الافتراضي.
      output_dir = './llm_responses/'
    3. في المحطة الطرفية، قم بتنفيذ التعليمات البرمجية باستخدام الأمر التالي. بعد التنفيذ، اعرض استجابات النموذج في المجلد المحدد في الخطوة 4.2.2 للتقدير أو المراجعة الأخرى.
      python3 ./compare_llms.py
  3. (اختياري) جرب التقدير التلقائي لاستجابات MCQ. تستخدم التعليمات البرمجية للنموذج مكتبة LMQL لتقييد إخراج LLM بتنسيق متوقع.
    1. افتح automated_comparison.py الملف وبالمثل للخطوة 4.2.2 ، قم بإلغاء التعليق على النماذج المراد تضمينها ، أو تحرير المتغير output_dir ، أو تخصيصها بطريقة أخرى. لاحظ أنه سيظل يتم حفظ إخراج النموذج بطريقة مماثلة. احفظ الملف.
    2. قم بتشغيل التعليمات البرمجية من الخطوة 4.3.1 عن طريق تشغيل الأمر التالي في وحدة طرفية:
      python3 ./automated_comparison.py

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تم استخدام مجموعة من 22 منشورا من المبادئ التوجيهية لإدارة مجموعة عمل إجماع شيكاغو لزيادة نموذج Llama-7b الأساسي17. تم تحويل المستندات إلى فهرس متجه باستخدام أداة Llama-Index لإنشاء Llama-2-7b-CCWG-Embed. كما تم تعزيز طرازات OpenAI الشهيرة مثل GPT-3.5 و GPT-4 بطريقة مماثلة لإنتاج نماذج GPT-XX-CCWG-Embed. تم تطوير ما مجموعه 20 سؤالا متعدد الخيارات (MCQ) لتقييم المعرفة المتعلقة بإدارة مجموعة متنوعة من الأورام الخبيثة السطحية الصفاقية. تم إنشاء MCQs من قبل طبيب أورام جراحي معتمد من مجلس الإدارة لاختبار مستوى المعرفة المتوقع من زميل جراحة الأورام. كان أداء Llama-2-7b-CCWG-Embed أفضل بكثير من النموذج الأساسي (انظر الجدول 1) ، كما فعلت نماذج OpenAI المعززة. تعتبر هذه نتيجة إيجابية لهذه الطريقة حيث تم تحسين أداء النموذج مع الزيادة مقارنة بخط الأساس.

figure-results-1
الشكل 1: تخطيطي لإنشاء قاعدة بيانات متجهة من الأوراق الأكاديمية. الرجاء النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-2
الشكل 2: الرسم البياني العام للنظام ل LLM المعزز. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

figure-results-3
الشكل 3: نموذج Llama-2 المعزز الذي يعمل في محطة Linux. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

figure-results-4
الشكل 4: نتيجة الاستعلام من نموذج Llama-2 المعزز. الرجاء النقر هنا لعرض نسخة أكبر من هذا الشكل.

ماجستيرالنتيجة (٪ صحيحة)
لاما 2-7ب دردشة hf65%
اللامة-2-7ب-CCWG-التضمين75%
Openchat-3.5-01061865%
ميسترال-7ب-v0.11970%
جي بي تي -3.575%
GPT-3.5-CCWG-تضمين85%
جي بي تي -485%
GPT-4-CCWG-تضمين90%

الجدول 1: درجات (نسبة مئوية صحيحة) لمختلف LLMs في مجموعة من 20 سؤالا تتعلق بإدارة الأورام الخبيثة الصفاقية.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تهدف الأساليب المقدمة هنا إلى تسهيل البحث عن التطبيقات الخاصة بالمجال لماجستير القانون دون الحاجة إلى تدريب من جديد أو ضبط مكثف. نظرا لأن LLMs أصبحت مجالا ذا اهتمام بحثي كبير ، فإن مناهج زيادة قواعد المعرفة وتحسين دقة الردود ستصبح ذات أهميةمتزايدة 18،19،20،21. كما هو موضح في النتائج المقدمة ، يوفر البروتوكول الموضح تحسنا في الأداء في الأسئلة الخاصة بالمجال مقارنة بنفس LLM دون زيادة ويقترب من أداء النماذج الأكثر تعقيدا مثل نماذج OpenAI GPT. نظرا لأن LLMs يمكن أن تتطلب موارد حسابية هائلة لتوليد الاستجابات22،23 ، فإن زيادة نموذج أبسط قد يوفر وسيلة للتنفيذ في حالات الاستخدام المحدودة الموارد. علاوة على ذلك ، أنتج نظام RAG أيضا فوائد عند زيادة النماذج عالية التعقيد مثل تلك التي توفرها OpenAI. في حين أن النتائج المقدمة خاصة بإدارة سرطان الصفاق ، فقد تم إنتاج دراسات حديثة حول أنظمة RAG مع مجموعة متنوعة من مصادر البيانات في المجال والحجم ، مما يشير إلى قابلية التطبيق الواسع لهذه الأنظمة21 ، 24 ، 25 ، 26. نظرا لأن جودة الردود ترتبط ارتباطا وثيقا بالبيانات النصية المستخدمة في الزيادة ، فمن الأهمية بمكان أن يفكر المستخدمون بعناية في المصادر المثلى لمجالهم الخاص والتطبيق المطلوب. هذا الاعتبار له أهمية خاصة في مجالات مثل الرعاية الصحية ، والتي كانت محور تركيز خاص للدراسات المتعلقة بماجستير القانون. يتم استكشاف استخدام LLM للتشخيص27،28 ، والتجارب السريرية المطابقة29،30 ، والعديد من التطبيقات الأخرى ، وتتطلب موارد نصية موثوقة وجديرة بالثقة بدلا من الاعتماد على مجموعات تدريب غير معروفة.

تم قياس الأداء من خلال النسبة المئوية الصحيحة ل MCQs التي كتبها خبير في السرطانات البريتونية وإدارتها السريرية. تم تصنيف الردود على أنها صحيحة أو غير صحيحة من خلال المراجعة البشرية. ومع ذلك ، لتقليل المهام المتكررة للباحثين ، يتم توفير الكود الأساسي للبدء في الاقتراب من مقارنة أكثر آلية للأداء عبر LLMs.

تتمثل إحدى المزايا الرئيسية لهذا البروتوكول في الكود المقدم للوصول برمجيا إلى مجموعة متنوعة من LLMs. في السابق ، لتقييم الأداء على MCQs ، ربما كان المستخدمون الذين ليس لديهم القدرات التقنية المطلوبة يعتمدون على الاختبار اليدوي المتكرر من خلال واجهة قائمة على الويب. يوفر الكود المقدم فئات أساسية للتفاعل مع العديد من LLMs الشائعة جنبا إلى جنب مع أمثلة على كيفية تنفيذ الكود. الهدف من توفير هذه الأدوات هو السماح لمزيد من الباحثين بالتحرك نحو أتمتة سير العمل الذي يقيم الاستجابات للمطالبة عبر مجموعة متنوعة من LLMs ، مما يعزز القدرة على إجراء دراسات مقارنة.

علاوة على ذلك ، تم تصميم الأساليب الموضحة للتأكيد على المرونة وقابلية التوسعة. على الرغم من أنه يمكن استخدام الكود كما هو ، إلا أنه مكتوب بقصد مزيد من التفصيل لحالات استخدام محددة حسب الحاجة ، مثل استخدام LLMs المختلفة وتضمين النماذج للزيادة أو المقارنة. نظرا لأن مشهد LLM يتطور بسرعة ، ستصبح هذه القابلية للتوسعة ذات أهمية متزايدة لتلبية الاحتياجات المتنوعة للمستخدمين في مجالات مختلفة. بالإضافة إلى ذلك ، توفر مكتبة Llama-Index عددا كبيرا من الميزات غير المستخدمة في الطرق الموضحة والتي يمكن أن تمنح المستخدمين خيارات إضافية عند إنشاء أنظمة مماثلة. يمكن العثور عليها في الوثائق الرسمية لمؤشر اللاما.

يجب على القراء أيضا التفكير بعناية في طرق التقييم المثلى لحالة استخدامهم. في حين أن MCQs اكتسبت شعبية لمقارنات LLM نظرا لطبيعتها التي يمكن قياسها بسهولة31،32 ، يجب توخي الحذر عند اعتبارها مقياسا شاملا للأداء للأنظمة التوليدية. نفذت الأدبيات الحديثة مجموعة متنوعة من التقييمات ، بما في ذلك الأساليب النوعية ، والمراجعة البشرية ، وتقييم ستانفورد الشامل لنماذج اللغة (HELM) 33 ، ومقاييس معالجة اللغة الطبيعية القياسية مثل دراسة التقييم ثنائي اللغة (BLEU) ، وتقييم فهم اللغة العامة (GLUE) ، و ROUGE ، والحيرة ، ودرجة F134،35،36،37،38،39.

هناك قيود على هذه الأساليب كما هو منصوص عليه هنا. على سبيل المثال ، بينما تم تنفيذ الواجهات للعديد من موفري LLM الرائدين ، نظرا للطبيعة سريعة التطور لهذا المجال ومدى تنوع حالات الاستخدام ، قد لا يكون هذا التنفيذ شاملا. ومع ذلك ، تم تصميم الكود مع وضع ذلك في الاعتبار كما تمت مناقشته سابقا. بالإضافة إلى ذلك ، بينما تم توفير التعليمات البرمجية الأساسية للتحرك نحو الدرجات الآلية ، هناك مجال للتوسع في استخدام أدوات بديلة لتقدير الردود مثل HELM أو BLEU. علاوة على ذلك ، يمكن استخدام استخدام إضافي للأدوات لتقييد المخرجات وفقا للقواعد النحوية المحددة مسبقا ، مثل لغة استعلام نموذج اللغة (LMQL) ، للتوسع في هذا العمل وزيادة أتمتة دراسات LLM المقارنة. وبالإضافة إلى ذلك، ونظرا للتنوع الكبير في حالات الاستخدام المحتملة، يلزم إجراء مزيد من الدراسات حول تأثير أنظمة الفريق الاستشاري على الأداء العام خارج النطاق لتوصيف أي مقايضات في الأداء. أخيرا ، يجب الاستمرار في التحقيق في طرق إضافية لتحسين موثوقية وتقييم استجابات LLM.

لاحظ أنه لأسباب فنية ، يلزم استخدام python 3.10 أو أعلى. تتم كتابة مطالبات Shell ل bash أو zsh أو غيرها من المحطات الطرفية الشبيهة ب UNIX. يمكن تنفيذ الأوامر (يشار إليها باسم "تشغيل الأمر" في البروتوكول) ببساطة عن طريق كتابة النص متبوعا بمفتاح الإرجاع. لكل خطوة في البروتوكول ، قد يرغب المستخدم في فحص التعليمات البرمجية في الملف الذي يتم تنفيذه للحصول على فهم أكثر شمولا للآليات الكامنة وراء سير العمل.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ليس لدى المؤلفين أي تضارب في المصالح للإعلان عنه.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تم تسهيل هذا العمل من خلال العديد من المكتبات مفتوحة المصدر ، وأبرزها llama-index (https://www.llamaindex.ai/) و ChromaDB (https://www.trychroma.com/) و LMQL (https://lmql.ai/).

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
pip3 الإصدار 22.0.2 
إصدار Python 3.10.12

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Singhal, K., et al. Large language models encode clinical knowledge. Nature. 620 (7972), 172-180 (2023).
  2. Gilson, A., et al. How does ChatGPT perform on the United States medical licensing examination? The implications of large language models for medical education and knowledge assessment. JMIR Med Educ. 9 (1), e45312(2023).
  3. Guerra, G. A., et al. GPT-4 artificial intelligence model outperforms ChatGPT, medical students, and neurosurgery residents on neurosurgery written board-like questions. World Neurosurg. 179, e160-e165 (2023).
  4. Terwiesch, C. Would Chat GPT3 get a Wharton MBA? A prediction based on its performance in the Operations Management course. , https://mackinstitute.wharton.upenn.edu/wp-content/uploads/2023/01/Christian-Terwiesch-Chat-GTP.pdf (2023).
  5. Weizenbaum, J. ELIZA-a computer program for the study of natural language communication between man and machine. Communications of the ACM. 9 (1), 36-45 (1966).
  6. Wu, T., et al. A brief overview of ChatGPT: The history, status quo and potential future development. IEEE/CAA Journal of Automatica Sinica. 10 (5), 1122-1136 (2023).
  7. Touvron, H., et al. Llama 2: Open foundation and fine-tuned chat models. arXiv [cs.CL]. , http://arxiv.org/abs/2307.09288 (2023).
  8. Huang, L., et al. A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions. arXiv [cs.CL]. , http://arxiv.org/abs/2311.05232 (2023).
  9. Thirunavukarasu, A. J., et al. Large language models in medicine. Nature Med. 29 (8), 1930-1940 (2023).
  10. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. arXiv [cs.CL]. , http://arxiv.org/abs/2005.11401 (2020).
  11. Li, J., Yuan, Y., Zhang, Z. Enhancing LLM factual accuracy with RAG to counter hallucinations: A case study on domain-specific queries in private knowledge-bases. arXiv [cs.CL]. , http://arxiv.org/abs/2403.10446 (2024).
  12. Zhang, P., Xiao, S., Liu, Z., Dou, Z., Nie, J. -Y. Retrieve anything to augment large language models. arXiv [cs.IR]. , http://arxiv.org/abs/2310.07554 (2023).
  13. Ling, C., et al. Domain specialization as the key to make large language models disruptive: A comprehensive survey. arXiv [cs.CL]. , http://arxiv.org/abs/2305.18703 (2023).
  14. Ram, O., et al. In-Context retrieval-augmented language models. Trans Assoc Comput Linguist. 11, 1316-1331 (2023).
  15. Cormode, G. Sequence distance embeddings. , The University of Warwick. https://wrap.warwick.ac.uk/61310/7/WRAP_THESIS_Cormode_2003.pdf (2003).
  16. Guo, Z., et al. Evaluating large language models: A comprehensive survey. arXiv [cs.CL]. , http://arxiv.org/abs/2310.19736 (2023).
  17. Chicago Consensus Working Group. The Chicago Consensus Guidelines for peritoneal surface malignancies: Introduction. Cancer. 126 (11), 2510-2512 (2020).
  18. Wang, G., et al. OpenChat: Advancing open-source language models with mixed-quality data. arXiv [cs.CL]. , http://arxiv.org/abs/2309.11235 (2023).
  19. Jiang, A. Q., et al. Mistral 7B. arXiv [cs.CL]. , http://arxiv.org/abs/2310.06825 (2023).
  20. Megahed, F. M., et al. AI and the future of work in statistical quality control: Insights from a first attempt to augmenting ChatGPT with an SQC knowledge base (ChatSQC). arXiv [cs.HC]. , http://arxiv.org/abs/2308.13550 (2023).
  21. Wang, Y., Ma, X., Chen, W. Augmenting black-box LLMs with medical textbooks for clinical question answering. arXiv [cs.CL]. , http://arxiv.org/abs/2309.02233 (2023).
  22. Dodge, J., et al. Measuring the carbon intensity of AI in cloud instances. FACCT 2022. , (2022).
  23. Samsi, S., et al. From words to watts: Benchmarking the energy costs of large language model inference. arXiv [cs.CL]. , http://arxiv.org/abs/2310.03003 (2023).
  24. Khene, Z. -E., Bigot, P., Mathieu, R., Rouprêt, M., Bensalah, K. Development of a personalized chat model based on the European association of urology oncology guidelines: Harnessing the power of generative artificial intelligence in clinical practice. Eur Urol Oncol. 7 (1), 160-162 (2024).
  25. Kresevic, S., et al. Optimization of hepatological clinical guidelines interpretation by large language models: a retrieval augmented generation-based framework. NPJ Digit Med. 7 (1), 102(2024).
  26. Ge, J., et al. Development of a liver disease-specific large language model chat interface using retrieval augmented generation. medRxiv. , (2023).
  27. Rule-augmented artificial intelligence-empowered systems for medical diagnosis using large language models. Panagoulias, D. P., et al. 2023 IEEE 35th International Conference on Tools with Artificial Intelligence (ICTAI), , 70-77 (2023).
  28. Panagoulias, D. P., et al. Augmenting large language models with rules for enhanced domain-specific interactions: The case of medical diagnosis. Electronics. 13 (2), 320(2024).
  29. Jin, Q., et al. Matching patients to clinical trials with large language models. arXiv [cs.CL]. , http://arxiv.org/abs/2307.15051 (2023).
  30. Gupta, S. K., et al. PRISM: Patient records interpretation for semantic clinical trial matching using large language models. arXiv [cs.CL]. , http://arxiv.org/abs/2404.15549 (2024).
  31. Hendrycks, D., et al. Measuring massive multitask language understanding. arXiv [cs.CY]. , http://arxiv.org/abs/2009.03300 (2020).
  32. Lin, S., Hilton, J., Evans, O. TruthfulQA: Measuring how models mimic human falsehoods. arXiv [cs.CL]. , http://arxiv.org/abs/2109.07958 (2021).
  33. Bommasani, R., Liang, P., Lee, T. Holistic evaluation of language models. Ann N Y Acad Sci. 1525 (1), 140-146 (2023).
  34. Banerjee, D., Singh, P., Avadhanam, A., Srivastava, S. Benchmarking LLM powered Chatbots: Methods and Metrics. arXiv [cs.CL]. , http://arxiv.org/abs/2308.04624 (2023).
  35. Papineni, K., Roukos, S., Ward, T., Zhu, W. -J. Bleu. Proceedings of the 40th Annual Meeting on Association for Computational Linguistics - ACL '02. , (2001).
  36. Wang, A., Singh, A., Michael, J., Hill, F., Levy, O., Bowman, S. R. Glue: A multi-task benchmark and analysis platform for natural language understanding. , http://arxiv.org/abs/1804.07461 (2019).
  37. Johnson, D., et al. Assessing the accuracy and reliability of AI-generated medical responses: An evaluation of the chat-GPT model. Res Sq. , (2023).
  38. Lin, C. -Y. ROUGE: A package for automatic evaluation of summaries. Text Summarization Branches Out. , 74-81 (2004).
  39. Chen, S., et al. Evaluating the ChatGPT family of models for biomedical reasoning and classification. J Am Med Inform Assoc. 31 (4), 940-948 (2024).

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Large Language ModelsVector EmbeddingsDomain Specific AugmentationLlama IndexScientific ManuscriptsModel BenchmarkingOpen Source ToolsVector DatabaseModel EvaluationFoundation Models

Related Articles