$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
المنهجية المقترحة
تقترح هذه الدراسة إطارا توليديا يعتمد على الذكاء الاصطناعي لاكتشاف كوفيد-19 من إشارات السعال. يدمج الإطار النماذج التوليدية مع المصنفات التمييزية، مع الحفاظ على بيانات التدريب والتقييم منفصلة تماما. يوضح الشكل 1 البنية التفصيلية لإطار العمل المقترح GAN–VAE–ADCNN، موضحا التدفق من معالجة الصوت المسبقة واستخراج الميزات مرورا بتعلم التمثيل الكامن عبر المشفر الذاتي المتنوع (VAE)، وتوليد الميزات التركيبية باستخدام شبكة التعاكس التوليدية (GAN)، والتصنيف النهائي باستخدام الشبكات العصبية الالتفاهية العميقة (DCNN) وDCNN المعتمد على الانتباه (ADCNN). يظهر الشكل أن المكونات التوليدية تستخدم فقط أثناء التدريب، بينما يتم التصنيف باستخدام نماذج تمييزية.

الشكل 1: نظرة عامة على هندسة GAN–VAE–ADCNN. مخطط خط الأنابيب الهجين المقترح، حيث يتم ترميز الميزات الصوتية المشتقة من السعال باستخدام VAE، وتعزز من خلال توليد عينات صناعية معتمدة على GAN، ويتم تصنيفها باستخدام نماذج DCNN ونماذج DCNN المعتمدة على الانتباه (ADCNN). يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
بنية النموذج وتنفيذه
تم تنفيذ النماذج التوليدية والتمييز المستخدمة في هذا الإطار باستخدام هياكل ثابتة وقابلة للتكرار. يتكون GAN من مولد بثلاث طبقات متصلة بالكامل (128، 256، و512 وحدة) باستخدام تفعيل ReLU، ومميز بثلاث طبقات متصلة بالكامل (512، 256، و128 وحدة) باستخدام تفعيل LeakyReLU يتبعه مخرج سيغمويد.
يتكون مشفر VAE من طبقتين متصلتين بالكامل بمجموع 256 و128 وحدة، تليها تقدير المتوسط الكامن والتباين بأبعاد كامنة تبلغ 64. يعكس جهاز فك الترميز هذا الهيكل ويتم تدريبه باستخدام مزيج من فقدان إعادة البناء وتباعد كولباك–ليبلر لتعلم فضاء كامنة منظم واحتمالي.
يتضمن مصنف DCNN أربع كتل الالتفافية مع 3x3 نواة و32، 64، 128، و256 مرشحا على التوالي. يتبع كل كتلة تطبيع دفعي، وتفعيل ReLU، وتجميع أقصى 2x2. يقوم ADCNN بتوسيع DCNN من خلال دمج آلية انتباه على قناة بعد الكتلة الالفافية النهائية. تم تحسين جميع النماذج باستخدام محسن آدم بمعدل تعلم 0.0001 وحجم دفعة 32. كما هو موضح في الشكل 1، تعمل وحدات VAE وGAN فقط أثناء التدريب، بينما تستخدم DCNN وADCNN للتصنيف. يتم تلخيص عملية التدريب والتقييم الكاملة في الخوارزمية 1.
الخوارزمية 1: إطار عمل الكشف عن كوفيد-19 القائم على GAN–VAE
المدخلات: تسجيلات صوتية للسعال المعالجة مسبقا
المخرج: تصنيف التصنيف الثنائي (إيجابي/سلبي لكوفيد-19)
اتبعت إجراءات التدريب والتقييم خط أنابيب ثابت وقابل للتكرار. تم إعادة أخذ عينات جميع تسجيلات صوت السعال إلى 16 كيلوهرتز، وخضعت لتقليل الضوضاء، وتم تطبيع السعة. تم تقسيم التسجيلات إلى مقاطع ذات طول ثابت، تم استخراج منها MFCC والكروما والميزات الطيفية. تم استخراج ما مجموعه 40 معامل سيبستريل بتردد Mel (MFCCs) من كل مقطع صوتي. بالإضافة إلى ذلك، تم حساب 12 ميزة كروما. يشكل التمثيل الناتج متجه ميزة ذي 52 بعد لكل مقطع سعال. تم إجراء تقسيم على مستوى الموضوع لتقسيم البيانات إلى مجموعات تدريب، وتحقق من الصحة، ومجموعات اختبار. تم تدريب VAE على تعلم التمثيلات الكامنة الاحتمالية، وتم استخدام المتجهات الكامنة الناتجة لتدريب GAN على توليد الميزات التركيبية. تم تعزيز مجموعة بيانات التدريب باستخدام عينات مولدة بواسطة GAN–VAE، بينما تم استبعاد البيانات التركيبية من التحقق والاختبار. تم تدريب مصنفي DCNN وADCNN على بيانات التدريب المعززة، وأجري التقييم النهائي لمجموعة الاختبار التي تم الاحتفاظ بها باستخدام مقاييس الأداء القياسية.
إعداد التدريب، تقسيم البيانات، ومنع التسرب
أجريت جميع التجارب بتكوين تدريبي ثابت وقابل للتكرار. تم إجراء تقسيم البيانات على مستوى الموضوع قبل تقسيم الصوت لمنع تسرب البيانات. تم تقسيم مجموعة البيانات إلى مجموعات تدريب، والتحقق من الصحة، واختبارات بنسبة 80:10:10، مما يضمن تخصيص جميع المقاطع من نفس التسجيل إلى مجموعة فرعية واحدة. تم استخدام مجموعة التدريب لتعلم النماذج وتعزيز البيانات التوليدية، ومجموعة التحقق لضبط المعلمات الفائقة والإيقاف المبكر، وتم الاحتفاظ بمجموعة الاختبار للتقييم النهائي للأداء. تم استخدام العينات التركيبية التي يولدها إطار عمل GAN–VAE حصريا أثناء التدريب وتم استبعادها بشكل صارم من التحقق والاختبار لضمان تقييم عادل.
تم تدريب النماذج لحد أقصى 100 عصر، مع توقف مبكر بناء على فقدان التحقق وصبر 10 عصرات. تم تنفيذ التحسين باستخدام محسن آدم بمعدل تعلم 0.0001 وحجم دفعة 32. تم تطبيق فقدان الإنتروبيا المتقاطع الثنائي للتصنيف، بينما تم استخدام إعادة البناء والخسائر العدائية لتدريب مكونات VAE و GAN على التوالي. يضمن هذا البروتوكول الموحد للتدريب والتقييم قابلية التكرار، ويمنع تسرب البيانات، ويحافظ على فصل صارم بين مراحل التدريب والتقييم.
وصف مجموعة البيانات
تم استخدام مجموعتين من بيانات صوت السعال المتاحة للجمهور—COUGHVID وVirufy—لموازنة التنوع الصوتي واسع النطاق مع التسميات السريرية المشار إليها، مع أدوار منفصلة بوضوح في التدريب والتقييم.
COUGHVID هو مجموعة جماعية من تسجيلات السعال مع تعليقات جزئية من الخبراء وبيانات وصفية تم الإبلاغ عنها ذاتيا. لضمان جودة البيانات، تم اختيار 428 تسجيلا بعد تطبيق معايير مراقبة جودة محددة مسبقا، بما في ذلك الحد الأدنى من مدة الإشارة، ونسبة الإشارة إلى الضوضاء الكافية، وإزالة العينات التالفة أو الغامضة، ووجود أحداث سعال قابلة للتعرف عليها مع بيانات وصفية للأعراض. بعد المعالجة المسبقة والتقسيم، أسفرت هذه التسجيلات عن 1,719 فقرة سعال، موحدة على صيغة WAV بمعدل أخذ عينات 16 كيلوهرتز. تم استخدام COUGHVID لتدريب كل من النماذج التوليدية والمصنفات التمييزية.
يتكون فيروس من تسجيلات سعال تحت إشراف الطبيب مصنفة على أنها إيجابية أو سلبية ل RT-PCR لكوفيد-19. تم تضمين جميع التسجيلات ال16 المتاحة، مما أدى إلى 234 فقرة سعال بعد التقسيم، وتم توحيدها أيضا إلى 16 كيلوهرتز. استخدم فيروفي حصريا لتقييم مجموعات البيانات الخارجية لتقييم أداء التعميم، ولم يستخدم للتدريب أو الضبط الدقيق أو التعزيز التوليدي.
لذا يجب تفسير الإطار المقترح كنهج فحص إثبات مفهوم يقيم تحت ظروف تجريبية مضبوطة، وليس كنظام تشخيصي معتمد سريريا.
معالجة البيانات المسبق وتقسيمها
تم إعادة أخذ عينات جميع التسجيلات إلى 16 كيلوهرتز، وتحويلها إلى مونو، وخضعت لإزالة الصمت، وتقليل الضوضاء الطيفية، وتطبيع السعة. تم إجراء التقسيم بعد تقسيم مستوى الموضوع لمنع تسرب البيانات. تم تقسيم كل تسجيل إلى مقاطع متداخلة مدتها 2–4 ثوان، وتم التخلص من المقاطع منخفضة الطاقة أو الصامتة.
بروتوكول التحقق الخارجي
تم إجراء التحقق الخارجي من خلال تقييم عبر مجموعات البيانات. تم تقييم النماذج المدربة على COUGHVID باستخدام Virufy للتحقق من الخارج من الخارج. يقيم هذا البروتوكول التعميم عبر مجموعات البيانات التي تم جمعها تحت ظروف مختلفة بدلا من التحقق السريري المستقبلي. يوفر الشكل 2 نظرة عامة على مستوى البروتوكول لهذا سير العمل، موضحا استخدام مجموعات البيانات، والمعالجة المسبقة، واستخراج الميزات، وتدريب المصنفين، وسيناريوهات التقييم. بينما يركز الشكل 1 على هندسة النموذج الداخلية، يركز الشكل 2 على تصميم التجارب وتدفق البيانات عبر مراحل التدريب والاختبار.

الشكل 2: سير العمل لإطار عمل فحص السعال المقترح لكوفيد-19. توضيح لخط معالجة المعالجة الكامل، بما في ذلك المعالجة المسبقة، واستخراج الميزات (MFCC، chroma، الميزات الطيفية)، تعلم التمثيل القائم على GAN–VAE وتعزيز (التدريب فقط)، والتصنيف النهائي تحت تقسيم الموضوع وتقييم مجموعات البيانات عبر الموضوع. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.