مقالة بحثية

إطار عمل توليدي قائم على الذكاء الاصطناعي لفحص كوفيد-19 من إشارات صوت السعال

DOI:

10.3791/69874

مارس 10, 2026

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تقترح هذه الدراسة إطارا توليديا قائما على الذكاء الاصطناعي يدمج شبكات GAN، وVAEs، والشبكات الالمعقدة العميقة المعتمدة على الانتباه لاكتشاف كوفيد-19 من إشارات السعال الصوتية، مما يحسن المتانة، وتوازن البيانات، والتعميم عبر مجموعات البيانات للفحص القابل للتوسع وغير الجراحي.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يوفر تحليل صوت السعال مسارا عمليا لتطوير أدوات آلية لدعم فحص مرض كوفيد-19. على الرغم من الاهتمام المتزايد، لا تزال العديد من الأساليب الحالية حساسة للضوضاء، وعدم توازن الطبقات، وتقلب مجموعات البيانات، مما يحد من قابليتها للتكرار. يقدم هذا العمل منهجية منظمة مدفوعة بالذكاء الاصطناعي التوليدي لاكتشاف كوفيد-19 باستخدام تسجيلات صوت السعال. تجرى التجارب باستخدام مجموعتين بيانات متاحتين للعامة، COUGHVID وVirufy، وكلاهما يتكون من عينات سعال معنونة. يتكون البروتوكول المقترح من مراحل معالجة مسبقة متسلسلة، تشمل تقسيم السعال، وإزالة المعالجة، وتطبيع الإشارة. ثم تلتقط الخصائص الصوتية من خلال معاملات السيبستريل ميل-تردد، وواصفات اللون، وميزات التباين الطيفي. لتحسين تعلم التمثيل والتخفيف من اختلال في البيانات، يتم استخدام إطار عمل هجين توليدي يدمج المشفرات الذاتية المتغيرة والشبكات العدائية التوليدية لتركيب عينات على مستوى الميزات. يتم إجراء التصنيف لاحقا باستخدام نماذج الشبكات العصبية الالفافية العميقة ونماذج DCNN المعتمدة على الانتباه. يشير تقييم الأداء إلى أن دمج التعزيز التوليدي يتحسن باستمرار مقارنة بالقواعد غير التوليدية، محققا دقة تصنيف قصوى تبلغ 97.2٪ وAUROC عند 0.953 عبر مجموعات البيانات المقيمة. تظهر هذه النتائج فعالية النمذجة التوليدية في تعزيز الكشف عن كوفيد-19 القائم على السعال وتأسيس خط تحليل قابل للتكرار للأبحاث المستقبلية في مراقبة الصحة الصوتية.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تم استكشاف الصوتيات التنفسية بشكل متزايد كمصدر غير جراحي للمعلومات لتقييم الصحة، خاصة في سياق الأمراض المعدية والرئوية. مكنت التطورات في معالجة الإشارات والذكاء الاصطناعي من التحليل الآلي لأصوات السعال والتنفس، مما يدعم استخدامها كمؤشرات حيوية رقمية. تظهر الدراسات الحديثة أن الأصوات التنفسية الملتقطة باستخدام ميكروفونات مدمجة في الهواتف الذكية أو الأجهزة القابلة للارتداء أو أجهزة الاستشعار السريرية يمكن تحليلها بفعالية باستخدام نماذج التعلم العميق للكشف عن عدوى كوفيد-19 1,5. تسلط هذه التطورات الضوء على إمكانات الفحص المعتمد على الصوت كمكمل سريع وبدون تلامس وقابل للتوسع للإجراءات التشخيصية التقليدية. مرض فيروس كورونا 2019 (COVID-19)، الناتج عن فيروس SARS-CoV-2، يؤثر بشكل أساسي على الجهاز التنفسي ويحدث تغييرات قابلة للقياس في ديناميكيات تدفق الهواء، وظائف الرئة، وسلوك الجهاز الصوتي. على الرغم من أن اختبار التفاعل المتسلسل بالنسخ العكسي-البوليميراز (RT-PCR) لا يزال المعيار المرجعي للتشخيص، إلا أن قيوده اللوجستية ووقت الاستجابة المتأخر تحد من ملاءمته للفحص واسع النطاق أو المستمر، مما يدفع لاستكشاف طرق بديلة تعتمد على تحليل صوت التنفس.

وقد بحث عدد متزايد من الأدبيات في اكتشاف كوفيد-19 المدفوع بالذكاء الاصطناعي باستخدام إشارات السعال والتنفس والكلام. كما هو ملخص في الجدول 1، استكشفت الدراسات السابقة مجموعات بيانات متنوعة، وتمثيلات الميزات الصوتية (مثل MFCC، STFT، الميزات القائمة على الطيف)، ونماذج التعلم تتراوح من نماذج تعلم الآلة الكلاسيكية إلى هياكل الالتفافية العميقة، المتكررة، المعتمدة على الانتباه، والمحولات 8,9,10,11,12,13,14,15,16,17,18,19,20,21,22,23,24,25,26,27˒43,44,45. أظهرت عدة أعمال أداء واعدا في الفحص باستخدام الصوت التنفسي الجماعي والسريري المجمع. وعلى النقيض من ذلك، أكد آخرون على أهمية التعلم المنقول، وتعزيز البيانات، والذكاء الاصطناعي القابل للتفسير لتحسين المتانة والجدارة بالثقة. بدلا من تكرار مناقشة مفصلة كل دراسة على حدة، يقدم الجدول 1 نظرة عامة موحدة مقارنة لهذه الأساليب الممثلة، مما يتيح المقارنة المباشرة بين مجموعات البيانات والمنهجيات والنتائج المبلغ عنها.

على الرغم من هذه التطورات، تعيق عدة قيود متانة وقابلية تطبيق الأساليب الحالية على المستوى الواقعي. غالبا ما تجمع مجموعات بيانات الصوت التنفسي في ظروف تسجيل متجانسة، مما يؤدي إلى تباين كبير بين الأجهزة والبيئات الصوتية ومجموعات الأشخاص2،3،4. تعتمد العديد من مجموعات البيانات المتاحة للعامة على حالة كوفيد-19 المبلغ عنها ذاتيا، مما يخلق عدم يقين في موثوقية الملصقات7. بالإضافة إلى ذلك، فإن عدم توازن الفئة الواضح وتوفر العينات المعتمدة سريريا محدودا يحدان قدرة التعميم للنماذج التمييزية المدربة فقط على البياناتالمرصودة 4,5. وبالتالي، فإن أداء النموذج المبلغ عنه في إعدادات تجريبية محكمة لا يترجم باستمرار إلى نشر موثوق عبر سيناريوهات واقعية متنوعة.

وعند جمع هذه القيود مجتمعة، تبرز فجوة بحثية حاسمة: غياب إطار موحد يعالج في الوقت نفسه ندرة البيانات، وعدم توازن الطبقات، والتعميم القوي عبر مجموعات بيانات متنوعة. على الرغم من استكشاف النماذج التوليدية مثل الشبكات العدائية التوليدية (GANs) والمشفرات الذاتية التغيرية (VAEs) لتعلم التمثيلات الكامنة وتركيب إشارات طبية حيوية واقعية 6,7، إلا أن الدراسات الحالية عادة ما تستخدم هذه النماذج بشكل مستقل وتقيمها ضمن مجموعة بيانات واحدة. علاوة على ذلك، لا يزال دمجها مع البنى الالفافية المحسنة بالانتباه وتقييمها تحت ظروف عبر مجموعات البيانات غير محققة بشكل كاف.

لسد هذه الفجوة، تقترح الدراسة الحالية إطارا توليديا مدعوما بالذكاء الاصطناعي لاكتشاف كوفيد-19 من أصوات السعال يدمج استخراج الميزات الصوتية مع نموذج هجين بين GAN–VAE وشبكات عصبية الالتفافية العميقة المعتمدة على الانتباه (DCNNs). يخفف المكون التوليدي من عدم توازن الطبقات وتوفر العينات المحدود من خلال التعلم المنظم للتمثيل الكامن وتوليد البيانات التركيبية، بينما تعزز النماذج التمييزية متانة التصنيف عبر مجموعات البيانات غير المتجانسة. على عكس الأعمال السابقة التي تعتمد بشكل أساسي على التحقق من صحة داخل مجموعة البيانات، يتم تقييم الإطار المقترح باستخدام اختبار عبر مجموعات البيانات على مجموعة بيانات مستقلة، مما يتيح تقييما أكثر دقة لأداء التعميم. يهدف الإطار إلى أن يكون نهجا مهيدا للفحص بدلا من كونه أداة تشخيصية مستقلة، وتصميمه يأخذ في الاعتبار صراحة التغيرات في تسجيل وعدم اليقين في الملصقات لدعم النشر القابل للتكرار والموثوق.

في هذا السياق، فإن المساهمات الجديدة للدراسة الحالية ثلاثية. أولا، تم دمج إطار عمل هجين موحد بين GAN–VAE مع مصنفات DCNN المعتمدة على الانتباه لمعالجة عدم توازن الفئة، وتوفر البيانات المحدود، والتعلم القوي لتمثيل الميزات في فحص كوفيد-19 القائم على السعال. ثانيا، يتم تقييم النهج المقترح بشكل منهجي باستخدام التحقق من صحة مجموعات البيانات المتقاطعة، مما يوفر تقييما أكثر واقعية لتعميم النموذج مقارنة بالاختبارات التقليدية داخل مجموعة البيانات. ثالثا، تقدم الدراسة تحليلا مفصلا لتأثير التعزيز التوليدي تحت ظروف تسجيل غير متجانسة، مما يضع الإطار كدليل قابل للتكرار لفحص كوفيد-19 العملي والقابل للتوسع في التحليل.

المؤلف أو المؤلفون وسنةمجموعة البياناتالتقنيات / الميزات المستخدمةالنموذج / المصنفالدقة / المقاييسالقيود / الملاحظات
عمران وآخرون، 20208مجموعة بيانات السعال الجماعية (AI4COVID-19)MFCC، التعلم التحويلي، الميزات الواعية بالمجالالمصنف المتعدد الحذر من المخاطر (مجموعة DL + ML)الدقة: 92.6٪يعتمد على جودة السعال؛ التحقق السريري المحدود
براون وآخرون، 20209أصوات التنفس الجماعية (>7,000 مستخدم)ميزات صوتية مصممة يدويا، تضمينات VGGishنماذج تعلم آلا ضحلAUC > 80٪ضوضاء الملصق في البيانات الجماعية
لاغوارتا وآخرون، 202010مجموعة بيانات الصوت المفتوح في MIT (5,320 موضوعا)MFCC، المؤشرات الحيوية الصوتيةCNN (ResNet50، التعلم التحويلي)الحساسية: 98.5٪، النوعية: 94.2٪يتطلب مجموعة بيانات كبيرة للتدريب المسبق
كوارتييري وآخرون، 202011مقابلات الخطابة (5 أشخاص، قبل وبعد كوفيد)شدة التنفس، F0، CPP، الفورماناتالتحليل الإحصائي لحجم التأثيرتحقيق معدل تقريبي (AUC) يزيد عن 80٪ عبر جميع المهامحجم عينة صغير جدا
حسن وآخرون، 202012أصوات التنفسخصائص الكلام الزمنيRNNالسعال: 97٪، التنفس: 98.2٪، الصوت: 88.2٪نقص إحصائيات مجموعة البيانات التفصيلية
خامباريا وآخرون، 201913ESC-10، ESC-50الميزات القائمة على الصور في المخطط الطيفيسي إن إن، تي دي إس إنCNN: 77٪ (ESC-10)، 49٪ (ESC-50); رقم TDSN: 56٪ (ESC-10)الأصوات البيئية فقط؛ أداء أقل على مجموعات البيانات المعقدة
أيكنات وآخرون، 20171417,930 صوت رئوي من 1,630 شخصا (السماعة الطبية الإلكترونية)ميزات MFCC، صور الطيفيةSVM، CNNCNN/SVM: 86٪ (صحي مقابل مرضي)، 76٪/75٪ (رالي–رونخوس–طبيعي)، 80٪/80٪ (نوع واحد)، 62٪/62٪ (جميع الأنواع)يتطلب أجهزة متخصصة؛ ليس متعلقا بالأمراض الخاصة
بونومارشوك وآخرون، 202215كوسوارا، فيروفيMFCC، مقياس mel-spectrogram، ميزات المويجاتCNN، RNN، نماذج جماعيةAUC: 0.93 (داخلي)، 0.79 (خارجي)لا يزال التعميم عبر مجموعات البيانات تحديا
فينغ وآخرون، 202116كوسوارا، فيروفيSTFT، MFCCSVM (RBF)، CNNالدقة 81.25٪ (AUC 0.79)الأداء المعتمد على مجموعة البيانات
إسلام وآخرون، 202217تسجيلات السعال السريريةالميزات الطيفية وزمني-ترددالشبكات العصبية العميقةالدقة: 89.2٪مجموعة بيانات محدودة
منشوري، 202218فيروفيميزات التحليل الطيفيمصنفات التعلم الآلي الكلاسيكيةالدقة: 95.86٪دراسة تجريبية صغيرة النطاق
هوانغ وآخرون، 202019أصوات رئة من 10 مرضى كوفيد-19تحليل الصوت التنفسي الزمني والترددتحليل الخبراء السريريالتحقق النوعيمجموعة بيانات صغيرة؛ نموذج لا يحتوي على ML
دبليو. دي. بوجا وآخرون، 202420كوسوارا، فيروفي (مجموعات بيانات أصوات السعال)STFT، مخطط طياف ميل، MFCC، طاقة RMS، عرض النطاق الطيفي، مركز الطيفي، الانزلاق الطيفي، ZCR؛ استخراج الميزات العميقة المعتمد على CNNCNN أحادي الأبعاد (مستخرج الميزات) + غابة عشوائيةالدقة: 93٪يعتمد الأداء على جودة السعال؛ صمم للفحص وليس للتشخيص السريري؛ تباين البيانات المعتمدة على الجمهور
تشاداجا وآخرون، 202321تسجيلات صوتية للسعال من الجمهورمخطط ميل الطيفي والميزات الصوتية الزمنية-التردديةالشبكة العصبية الالتفافية (CNN)الدقة: 84٪، الدقة: 85٪، الاستدعاء: 84٪، F1-درجة: 84٪الأداء محدود بسبب عدم توازن البيانات، والتسميات التي يتم الإبلاغ عنها ذاتيا، والحساسية لظروف التسجيل
تشاداجا وآخرون، 202322كوفيد-19 الخفيف إلى المتوسط وعلامات أمراض الجهاز التنفسي الأخرىاختيار الأفلام (بيرسون، PSO); العلامات الرئيسية: إيوسينوفيل، ألبومين، ت. بيليروبين، ALP، ALT، AST، HBA1c، TWBCمجموعة مكدسة؛ 1D CNN، LSTM، DNN، وMLP المتبقيالدقة: 89٪الحالات الشديدة المستثناة؛ بديل ل RT-PCR؛ الذكاء الاصطناعي القابل للتفسير المطبق
دار وآخرون 202423مجموعة بيانات كوفيد-19تحسين SJHBO (جايا+HBO+SO)، العديد من الميزات الطيفيةشبكة ديب كيو (DQN)الدقة: 95.11٪، الحساسية: 95.06٪، النوعية: 94.69٪تعقيد عالي؛ يتم تحسين الضبط عبر محسن هجين
جينغ كويان وآخرون 202024تسجيلات الكلام من مرضى كوفيد-19مجموعات الميزات الصوتية؛ تحليل شدة المرض، جودة النوم، التعب، القلقآلات الدعم المتجهة (SVM)0.69 (شدة المرض)محدودة بميزات الصوت؛ دقة متوسطة؛ لم يتم تحديد حجم مجموعة البيانات؛ فقط أربعة جوانب صحية في الاعتبار
شارما، ج.، وآخرون. 202025أوربان ساوند8K، ESC-10، ESC-50قنوات متعددة الميزات: MFCC، GFCC، CQT، Chromagram؛ تعزيز بيانات الخلطCNN عميق مع التفافيات ووحدات انتباه قابلة للفصل مكانياUrbanSound8K: 97.52٪، ESC-10: 94.75٪، ESC-50: 87.45٪لم يتم اختباره على مجموعات بيانات غير معيارية أو واقعية؛ تعقيد الحاسوبية بسبب تعمق CNN ووحدات الانتباه
ليلا كيه كي، وآخرون 202126 أصوات التنفس؛ كوفيد-19، الربو، صحي)تعزيز البيانات؛ الميزات العميقة باستخدام مشفر إزالة الضوضاء التلقائي للبيانات (DDAE) بدلا من MFCCشبكة عصبية الالتفافية أحادية الأبعاد (CNN 1D)~90٪تفاصيل محدودة لمجموعة البيانات؛ ~4٪ تحسن مقارنة ب MFCC; عدم اختبار قابلية التعميم
أورلانديك وآخرون، 202127سعال (25 ألف + سعال)MFCCs، PSD، السمات الطيفية والزمنيةXGBoostAUC 96.5٪، الدقة 95.5٪كوفيد أبلغ عن نفسه بنفسه؛ تسميات الخبراء على المجموعة الفرعية
تشانغ وآخرون، 202343تقارير الحالات المنشورة لمرض الارتفاع العالي بعد تطعيم كوفيد-19 (قواعد بيانات الأدبيات)المراجعة المنهجية؛ تجميع الميزات السريرية؛ تحليل الالتحام الجزيئيغير قابل للتطبيق (مراجعة سريرية)الإحصاء الوصفي؛ النتائج السريريةتحليل الأحداث النادرة؛ حجم عينة صغير؛ الاعتماد على الحالات المبلغ عنها قد يؤدي إلى تحيز الإبلاغ
شو وآخرون، 202344الحالات المبلغ عنها لمرض VKH المرتبط باللقاحات من الأدبياتمراجعة حالة بأثر رجعي؛ تحليل الميزات السريرية والتصويريةغير قابل للتطبيق (دراسة رصدية سريرية)الاستجابة للعلاج ونتائج التعافي السريريعدد محدود من القضايا؛ غياب مجموعة التحكم؛ لا يمكن إثبات العلاقة السببية بشكل قاطع
هو وآخرون، 202545بيانات الشركة الأم والشركات التابعة لشركات أجهزة المعدات الطبية SRDI في الصين (قاعدة بيانات تشيشينباو)تحليل الشبكات الاجتماعية؛ مقاييس الشبكات المكانية؛ تحليل الكاشف الجغرافيغير قابل للتطبيق (تحليل الشبكات والسياسات)كثافة الشبكة، المركزية، مؤشرات الانتشارتصميم مقطعي؛ الوزن المتساوي للشركات؛ لا توجد مؤشرات أداء مباشرة أو نتائج سريرية

الجدول 1: ملخص الدراسات الحالية للكشف عن كوفيد-19 المعتمدة على الصوت المعتمدة على الصوت. نظرة مقارنة على أساليب فحص السعال/الصوت السابقة، بما في ذلك مجموعات البيانات والأساليب والأداء المبلغ عنها. يرجى الضغط هنا لتحميل هذا الجدول.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

المنهجية المقترحة

تقترح هذه الدراسة إطارا توليديا يعتمد على الذكاء الاصطناعي لاكتشاف كوفيد-19 من إشارات السعال. يدمج الإطار النماذج التوليدية مع المصنفات التمييزية، مع الحفاظ على بيانات التدريب والتقييم منفصلة تماما. يوضح الشكل 1 البنية التفصيلية لإطار العمل المقترح GAN–VAE–ADCNN، موضحا التدفق من معالجة الصوت المسبقة واستخراج الميزات مرورا بتعلم التمثيل الكامن عبر المشفر الذاتي المتنوع (VAE)، وتوليد الميزات التركيبية باستخدام شبكة التعاكس التوليدية (GAN)، والتصنيف النهائي باستخدام الشبكات العصبية الالتفاهية العميقة (DCNN) وDCNN المعتمد على الانتباه (ADCNN). يظهر الشكل أن المكونات التوليدية تستخدم فقط أثناء التدريب، بينما يتم التصنيف باستخدام نماذج تمييزية.

figure-protocol-1
الشكل 1: نظرة عامة على هندسة GAN–VAE–ADCNN. مخطط خط الأنابيب الهجين المقترح، حيث يتم ترميز الميزات الصوتية المشتقة من السعال باستخدام VAE، وتعزز من خلال توليد عينات صناعية معتمدة على GAN، ويتم تصنيفها باستخدام نماذج DCNN ونماذج DCNN المعتمدة على الانتباه (ADCNN). يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

بنية النموذج وتنفيذه

تم تنفيذ النماذج التوليدية والتمييز المستخدمة في هذا الإطار باستخدام هياكل ثابتة وقابلة للتكرار. يتكون GAN من مولد بثلاث طبقات متصلة بالكامل (128، 256، و512 وحدة) باستخدام تفعيل ReLU، ومميز بثلاث طبقات متصلة بالكامل (512، 256، و128 وحدة) باستخدام تفعيل LeakyReLU يتبعه مخرج سيغمويد.

يتكون مشفر VAE من طبقتين متصلتين بالكامل بمجموع 256 و128 وحدة، تليها تقدير المتوسط الكامن والتباين بأبعاد كامنة تبلغ 64. يعكس جهاز فك الترميز هذا الهيكل ويتم تدريبه باستخدام مزيج من فقدان إعادة البناء وتباعد كولباك–ليبلر لتعلم فضاء كامنة منظم واحتمالي.

يتضمن مصنف DCNN أربع كتل الالتفافية مع 3x3 نواة و32، 64، 128، و256 مرشحا على التوالي. يتبع كل كتلة تطبيع دفعي، وتفعيل ReLU، وتجميع أقصى 2x2. يقوم ADCNN بتوسيع DCNN من خلال دمج آلية انتباه على قناة بعد الكتلة الالفافية النهائية. تم تحسين جميع النماذج باستخدام محسن آدم بمعدل تعلم 0.0001 وحجم دفعة 32. كما هو موضح في الشكل 1، تعمل وحدات VAE وGAN فقط أثناء التدريب، بينما تستخدم DCNN وADCNN للتصنيف. يتم تلخيص عملية التدريب والتقييم الكاملة في الخوارزمية 1.

الخوارزمية 1: إطار عمل الكشف عن كوفيد-19 القائم على GAN–VAE

المدخلات: تسجيلات صوتية للسعال المعالجة مسبقا

المخرج: تصنيف التصنيف الثنائي (إيجابي/سلبي لكوفيد-19)

اتبعت إجراءات التدريب والتقييم خط أنابيب ثابت وقابل للتكرار. تم إعادة أخذ عينات جميع تسجيلات صوت السعال إلى 16 كيلوهرتز، وخضعت لتقليل الضوضاء، وتم تطبيع السعة. تم تقسيم التسجيلات إلى مقاطع ذات طول ثابت، تم استخراج منها MFCC والكروما والميزات الطيفية. تم استخراج ما مجموعه 40 معامل سيبستريل بتردد Mel (MFCCs) من كل مقطع صوتي. بالإضافة إلى ذلك، تم حساب 12 ميزة كروما. يشكل التمثيل الناتج متجه ميزة ذي 52 بعد لكل مقطع سعال. تم إجراء تقسيم على مستوى الموضوع لتقسيم البيانات إلى مجموعات تدريب، وتحقق من الصحة، ومجموعات اختبار. تم تدريب VAE على تعلم التمثيلات الكامنة الاحتمالية، وتم استخدام المتجهات الكامنة الناتجة لتدريب GAN على توليد الميزات التركيبية. تم تعزيز مجموعة بيانات التدريب باستخدام عينات مولدة بواسطة GAN–VAE، بينما تم استبعاد البيانات التركيبية من التحقق والاختبار. تم تدريب مصنفي DCNN وADCNN على بيانات التدريب المعززة، وأجري التقييم النهائي لمجموعة الاختبار التي تم الاحتفاظ بها باستخدام مقاييس الأداء القياسية.

إعداد التدريب، تقسيم البيانات، ومنع التسرب

أجريت جميع التجارب بتكوين تدريبي ثابت وقابل للتكرار. تم إجراء تقسيم البيانات على مستوى الموضوع قبل تقسيم الصوت لمنع تسرب البيانات. تم تقسيم مجموعة البيانات إلى مجموعات تدريب، والتحقق من الصحة، واختبارات بنسبة 80:10:10، مما يضمن تخصيص جميع المقاطع من نفس التسجيل إلى مجموعة فرعية واحدة. تم استخدام مجموعة التدريب لتعلم النماذج وتعزيز البيانات التوليدية، ومجموعة التحقق لضبط المعلمات الفائقة والإيقاف المبكر، وتم الاحتفاظ بمجموعة الاختبار للتقييم النهائي للأداء. تم استخدام العينات التركيبية التي يولدها إطار عمل GAN–VAE حصريا أثناء التدريب وتم استبعادها بشكل صارم من التحقق والاختبار لضمان تقييم عادل.

تم تدريب النماذج لحد أقصى 100 عصر، مع توقف مبكر بناء على فقدان التحقق وصبر 10 عصرات. تم تنفيذ التحسين باستخدام محسن آدم بمعدل تعلم 0.0001 وحجم دفعة 32. تم تطبيق فقدان الإنتروبيا المتقاطع الثنائي للتصنيف، بينما تم استخدام إعادة البناء والخسائر العدائية لتدريب مكونات VAE و GAN على التوالي. يضمن هذا البروتوكول الموحد للتدريب والتقييم قابلية التكرار، ويمنع تسرب البيانات، ويحافظ على فصل صارم بين مراحل التدريب والتقييم.

وصف مجموعة البيانات

تم استخدام مجموعتين من بيانات صوت السعال المتاحة للجمهور—COUGHVID وVirufy—لموازنة التنوع الصوتي واسع النطاق مع التسميات السريرية المشار إليها، مع أدوار منفصلة بوضوح في التدريب والتقييم.

COUGHVID هو مجموعة جماعية من تسجيلات السعال مع تعليقات جزئية من الخبراء وبيانات وصفية تم الإبلاغ عنها ذاتيا. لضمان جودة البيانات، تم اختيار 428 تسجيلا بعد تطبيق معايير مراقبة جودة محددة مسبقا، بما في ذلك الحد الأدنى من مدة الإشارة، ونسبة الإشارة إلى الضوضاء الكافية، وإزالة العينات التالفة أو الغامضة، ووجود أحداث سعال قابلة للتعرف عليها مع بيانات وصفية للأعراض. بعد المعالجة المسبقة والتقسيم، أسفرت هذه التسجيلات عن 1,719 فقرة سعال، موحدة على صيغة WAV بمعدل أخذ عينات 16 كيلوهرتز. تم استخدام COUGHVID لتدريب كل من النماذج التوليدية والمصنفات التمييزية.

يتكون فيروس من تسجيلات سعال تحت إشراف الطبيب مصنفة على أنها إيجابية أو سلبية ل RT-PCR لكوفيد-19. تم تضمين جميع التسجيلات ال16 المتاحة، مما أدى إلى 234 فقرة سعال بعد التقسيم، وتم توحيدها أيضا إلى 16 كيلوهرتز. استخدم فيروفي حصريا لتقييم مجموعات البيانات الخارجية لتقييم أداء التعميم، ولم يستخدم للتدريب أو الضبط الدقيق أو التعزيز التوليدي.

لذا يجب تفسير الإطار المقترح كنهج فحص إثبات مفهوم يقيم تحت ظروف تجريبية مضبوطة، وليس كنظام تشخيصي معتمد سريريا.

معالجة البيانات المسبق وتقسيمها

تم إعادة أخذ عينات جميع التسجيلات إلى 16 كيلوهرتز، وتحويلها إلى مونو، وخضعت لإزالة الصمت، وتقليل الضوضاء الطيفية، وتطبيع السعة. تم إجراء التقسيم بعد تقسيم مستوى الموضوع لمنع تسرب البيانات. تم تقسيم كل تسجيل إلى مقاطع متداخلة مدتها 2–4 ثوان، وتم التخلص من المقاطع منخفضة الطاقة أو الصامتة.

بروتوكول التحقق الخارجي

تم إجراء التحقق الخارجي من خلال تقييم عبر مجموعات البيانات. تم تقييم النماذج المدربة على COUGHVID باستخدام Virufy للتحقق من الخارج من الخارج. يقيم هذا البروتوكول التعميم عبر مجموعات البيانات التي تم جمعها تحت ظروف مختلفة بدلا من التحقق السريري المستقبلي. يوفر الشكل 2 نظرة عامة على مستوى البروتوكول لهذا سير العمل، موضحا استخدام مجموعات البيانات، والمعالجة المسبقة، واستخراج الميزات، وتدريب المصنفين، وسيناريوهات التقييم. بينما يركز الشكل 1 على هندسة النموذج الداخلية، يركز الشكل 2 على تصميم التجارب وتدفق البيانات عبر مراحل التدريب والاختبار.

figure-protocol-2
الشكل 2: سير العمل لإطار عمل فحص السعال المقترح لكوفيد-19. توضيح لخط معالجة المعالجة الكامل، بما في ذلك المعالجة المسبقة، واستخراج الميزات (MFCC، chroma، الميزات الطيفية)، تعلم التمثيل القائم على GAN–VAE وتعزيز (التدريب فقط)، والتصنيف النهائي تحت تقسيم الموضوع وتقييم مجموعات البيانات عبر الموضوع. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تركيب مجموعة البيانات وتحليل توزيع الفئات

بعد المعالجة المسبقة والتقسيم، أظهرت مجموعات بيانات COUGHVID وVirufy اختلافات كبيرة في كل من مقياس مجموعة البيانات وكثافة القطاعات. ساهم COUGHVID ب 428 من أصل 444 تسجيلا (96.4٪) و1,719 من أصل 1,953 قطعة سعال مستخرجة (88.0٪)، مما أكد دوره كمجموعة بيانات رئيسية لتدريب النماذج والتعزيز التوليدي (الشكل 3). في المقابل، ساهم Virufy فقط ب 16 تسجيلا (3.6٪) و234 فقرة سعال (12.0٪) و...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تظهر النتائج أن الإطار المقترح القائم على الذكاء الاصطناعي التوليدي يمكنه اكتشاف كوفيد-19 من إشارات السعال عبر مجموعات بيانات متجانسة. كما هو موضح في الجدولين 4 والجدول 6، حقق نموذج GAN–VAE الهجين أفضل أداء، بدقة 97.2٪ ودرجة AUROC 0.953، إلى جانب دقة عالية، واستدعاء، ودرجة F1، وخصوصية، مما يشير إلى أداء تصنيف متوازن.

تحسن الأداء باستمرار عند دمج النماذج التوليدية مع المصنفات التمييزية. كل من GAN–DCNN وVAE–ADCNN تفوقوا على نماذ...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لم يتم الإبلاغ عن أي تضارب محتمل في المصالح من قبل المؤلفين.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

نعبر عن امتناننا الصادق لأعضاء هيئة التدريس والمرشدين البحثيين في كلية علوم وهندسة الحاسوب على إرشاداتهم القيمة ودعمهم المستمر وردود الفعل البناءة أثناء إعداد هذه الورقة.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
مجموعة بيانات COUGHVIDÉ كول بوليتكنيكي Fé؛ dé رالي دي لوزان (EPFL)الإصدار العام (2021)مجموعة بيانات صوتية للسعال مجمعة مع بيانات وصفية تم الإبلاغ عنها ذاتيا وتعليقات جزئية للطبيب؛ يستخدم بشكل أساسي للتدريب وتعزيز البيانات.
مجموعة أدوات CUDANVIDIA11.3إطار عمل تسريع GPU يستخدم لتسريع تدريب النماذج والاستنتاج.
ليبروزاالمصدر المفتوح0.9مكتبة تحليل الصوت المستخدمة لإعادة العينات، والتقسيم، واستخراج MFCC، وحساب الميزات الطيفية.
نظام تشغيل لينكسالقانونيأوبونتو 20.04 LTSنظام التشغيل المستخدم لجميع التجارب وتدريب النماذج.
ماتبلوتليبالمصدر المفتوح3.5مكتبة التصور تستخدم لرسم توزيعات مجموعات البيانات ونتائج التقييم.
نومبايالمصدر المفتوح1.21مكتبة الحوسبة العددية المستخدمة في معالجة المصفوفة وعمليات معالجة الإشارات.
بطاقة رسومات NVIDIANVIDIAفئة تسلا / RTXوحدة معالجة الرسوميات تستخدم لتدريب النماذج العميقة والتوليدية.
لغة البرمجة بايثونمؤسسة بايثون للبرمجيات3.8بيئة البرمجة الأساسية المستخدمة في معالجة البيانات المسبقة، واستخراج الميزات، وتطوير النماذج، والتقييم.
بايتورشميتا (أبحاث الذكاء الاصطناعي على فيسبوك)1.12إطار عمل للتعلم العميق المستخدم لتنفيذ نماذج DCNN المعتمدة على الانتباه من GAN و VAE وDCNN.
سكيت-لرنالمصدر المفتوح1مكتبة تعلم الآلة تستخدم لتقسيم البيانات، ووزن الفئات، وحساب مقياس الأداء.
SciPyالمصدر المفتوح1.7مكتبة الحوسبة العلمية المستخدمة في المعالجة المسبقة للصوت وتحويلات الإشارات.
مجموعة بيانات Virufyفيروفيالإصدار العام (2021)تم جمع تسجيلات السعال سريريا باستخدام RT-PCR– ملصقات كوفيد-19 المؤكدة؛ يستخدم حصريا للتحقق الخارجي وتقييم مجموعات البيانات المتقاطعة.

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Aytekin, I., et al. COVID-19 detection from respiratory sounds with hierarchical spectrogram transformers. IEEE J. Biomed. Health Inform. 28 (3), 1273-1284 (2024).
  2. Walter, J. R., Lee, J. Y., Yu, L., et al. Use of artificial intelligence to develop predictive algorithms of cough and PCR-confirmed COVID-19 infections based on inputs from clinical-grade wearable sensors. Sci. Rep. 14, 8072(2024).
  3. Altae, A. A., Ehsani Rad, A., Mohebbi, K. Advanced COVID-19 detection using cough signals with space reconstruction and 3D deep convolutional neural networks. Sci. Rep. , (2025).
  4. Rao, S., Narayanaswamy, V., Esposito, M., Thiagarajan, J. J., Spanias, A. COVID-19 detection using cough sound analysis and deep learning algorithms. Intell. Decis. Technol. 15 (4), 655-665 (2021).
  5. Alkhodari, M., Khandoker, A. H. Detection of COVID-19 in smartphone-based breathing recordings: a pre-screening deep learning tool. PLoS One. 17 (1), e0262448(2022).
  6. Zhang, Y., et al. Research on a lung sound classification model based on a dual-channel CNN-LSTM algorithm. Biomed. Signal Process. Control. 94, 106257(2024).
  7. Askari Nasab, K., Mirzaei, J., Zali, A., Gholizadeh, S., Akhlaghdoust, M. Coronavirus diagnosis using cough sounds: artificial intelligence approaches. Front. Artif. Intell. 6, 1100112(2023).
  8. Imran, A., et al. AI4COVID-19: AI-enabled preliminary diagnosis for COVID-19 from cough samples via an app. Inform. Med. Unlocked. 20, 100378(2020).
  9. Brown, C., et al. Exploring automatic diagnosis of COVID-19 from crowdsourced respiratory sound data. Proc. KDD Health Day. , (2020).
  10. Laguarta, J., Hueto, F., Subirana, B. COVID-19 artificial intelligence diagnosis using only cough recordings. IEEE Open J. Eng. Med. Biol. 1, 275-281 (2020).
  11. Quartieri, T. F., Talker, T., Palmer, J. S. A framework for biomarkers of COVID-19 based on coordination of speech-production subsystems. IEEE Open J. Eng. Med. Biol. 1, 203-206 (2020).
  12. Hassan, A., Shahin, I., Alsabek, M. B. COVID-19 detection system using recurrent neural networks. Proc. CCCI. , 1-5 (2020).
  13. Khamparia, A., Gupta, D., Nguyen, N. G., et al. Sound classification using a convolutional neural network and a tensor deep stacking network. IEEE Access. 7, 7717-7727 (2019).
  14. Aykanat, M., Kilic, O., Kurt, B., et al. Classification of lung sounds using convolutional neural networks. J. Image Video Process. 65, (2017).
  15. Ponomarchuk, A., Burenko, I., Malkin, E., et al. Project Achoo: a practical model and application for COVID-19 detection from recordings of breath, voice, and cough. IEEE J. Sel. Top. Signal Process. 16 (2), 175-187 (2022).
  16. Feng, K., He, F., Steinmann, J., Demirkiran, I. Deep-learning based approach to identify COVID-19. Proc. SoutheastCon. , 1-4 (2021).
  17. Islam, R., Abdel-Raheem, E., Tarique, M. A study of using cough sounds and deep neural networks for the early detection of COVID-19. Biomed. Eng. Adv. 3, 100025(2022).
  18. Manshouri, N. M. Identifying COVID-19 by using spectral analysis of cough recordings: a distinctive classification study. Cogn. Neurodyn. 16 (1), 239-253 (2022).
  19. Huang, Y., et al. The respiratory sound features of COVID-19 patients fill gaps between clinical data and screening methods. medRxiv. , (2020).
  20. Puja, W. D., Sultana, S., Aowlad Hossain, A. B. M. COVID-19 detection from cough sound signal using random forest learning of deep spectral features. Proc. IEEE SPICSCON. , 1-4 (2024).
  21. Chadaga, K., Prabhu, S., Bhat, V., et al. COVID-19 diagnosis using clinical markers and multiple explainable artificial intelligence approaches: a case study from Ecuador. SLAS Technol. 28 (6), 393-410 (2023).
  22. Chadaga, K., Prabhu, S., Bhat, V., Sampathila, N., Umakanth, S., Chadaga, R. Artificial intelligence for diagnosis of mild-moderate COVID-19 using haematological markers. Ann. Med. 55 (1), 2233541(2023).
  23. Dar, J. A., Srivastava, K. K., Lone, S. A. Optimization-based deep learning for COVID-19 detection using respiratory sound signals. Cogn. Comput. 16 (4), 1927-1946 (2024).
  24. Qian, J., et al. An early study on intelligent analysis of speech under COVID-19: severity, sleep quality, fatigue, and anxiety. Proc. Interspeech. , (2020).
  25. Sharma, J., et al. Environment sound classification using multiple feature channels and an attention-based deep convolutional neural network. arXiv. , (2020).
  26. Lella, K. K., Pja, A. Automatic COVID-19 disease diagnosis using a 1D convolutional neural network and augmentation with human respiratory sound based on parameters: cough, breath, and voice. AIMS Public Health. 8 (2), 240-264 (2021).
  27. Orlandic, L., Teijeiro, T., Atienza, D. The COUGHVID crowdsourcing dataset, a corpus for the study of large-scale cough analysis algorithms. Sci. Data. 8, 156(2021).
  28. Lin, Y., et al. SympCoughNet: symptom-assisted audio-based COVID-19 detection. Front. Digit. Health. 7, 1551298(2025).
  29. Tena, A., Claria, F., Solsona, F. Automated detection of COVID-19 cough. Biomed. Signal Process. Control. 71, 103175(2022).
  30. Sharma, G., Umapathy, K., Krishnan, S. Audio texture analysis of COVID-19 cough, breath, and speech sounds. Biomed. Signal Process. Control. 76, 103703(2022).
  31. Hadjaidji, E., Korba, M. C. A., Khelil, K. COVID-19 detection from cough sounds using XGBoost and LSTM networks. Trait. Signal. 41 (2), 939-947 (2024).
  32. Despotovic, V., Ismael, M., Cornil, M., et al. Detection of COVID-19 from voice, cough, and breathing patterns: dataset and preliminary results. Comput. Biol. Med. 138, 104944(2021).
  33. Wang, W., Shang, Q., Lu, H. Automatic COVID-19 detection from cough sounds using multi-headed convolutional neural networks. Appl. Sci. 13, 6976(2023).
  34. Truong, T., Lenga, M., Serrurier, A., Mohammadi, S. Fused audio instance and representation for respiratory disease detection. arXiv. , (2023).
  35. Shati, A., Hassan, G. M., Datta, A. COVID-19 detection system: a comparative analysis of system performance based on acoustic features of cough audio signals. Proc. IEEE TrustCom. , 2706-2713 (2023).
  36. Pinkas, G., Karny, Y., Malachi, A., et al. SARS-CoV-2 detection from voice. IEEE Open J. Eng. Med. Biol. 1, 268-274 (2020).
  37. Hussain, S., et al. Cough2COVID-19 detection using an enhanced multi-layer ensemble deep learning framework and CoughFeatureRanker. Sci. Rep. 14, 25207(2024).
  38. Silva, L., Valadao, C., Lampier, L., et al. COVID-19 respiratory sound analysis and classification using audio textures. Front. Signal Process. 2, 986293(2022).
  39. Hamdi, S., Oussalah, M., Moussaoui, A., Saidi, M. Attention-based hybrid CNN-LSTM and spectral data augmentation for COVID-19 diagnosis from cough sound. J. Intell. Inf. Syst. 59 (2), 367-389 (2022).
  40. Banerjee, A., Nilhani, A. A residual network-based deep learning model for the detection of COVID-19 using cough sounds. Artificial Intelligence Strategies for Analyzing COVID-19 Pneumonia Lung Imaging. , IOP Publishing. (2022).
  41. Chowdhury, N. K., Kabir, M. A., Rahman, M. M., Islam, S. M. S. Machine learning for detecting COVID-19 from cough sounds: an ensemble-based MCDM method. Comput. Biol. Med. 145, 105405(2022).
  42. Chang, J., et al. UFRC: a unified framework for reliable COVID-19 detection on crowdsourced cough audio. arXiv. , (2022).
  43. Zhang, H. Q., et al. Analysis of reported cases of hemophagocytic lymphohistiocytosis after COVID-19 vaccination. Hum. Vaccin. Immunother. 19 (2), (2023).
  44. Xu, K., et al. Clinical features, diagnosis, and management of COVID-19 vaccine-associated Vogt-Koyanagi-Harada disease. Hum. Vaccin. Immunother. 19 (2), (2023).
  45. Hu, F., et al. Spatial networks of China's specialized, refined, distinctive, and innovative medical device firms based on parent-subsidiary contacts: implications for regional health policy. Front. Public Health. 13, 1676189(2025).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

Cough Audio AnalysisCough Sound RecordingsMel Frequency CepstralVariational AutoencodersGenerative Adversarial NetworksDeep Convolutional NetworksAcoustic Health MonitoringSignal Denoising

مقالات ذات صلة