مقالة بحثية

تعزيز التنبؤ بأمراض القلب من خلال نماذج التعلم الآلي الموزعة المرئية بالمجموعات من أجل رعاية صحية آمنة

DOI:

10.3791/69857

يوليو 7, 2026

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تطور هذه الدراسة إطارا قابلا للتوسع للتنبؤ بأمراض القلب باستخدام Hadoop MapReduce وتجميع K-Means. تعديل حدود التصنيف يؤثر على حساسية الكشف. يحسن CViHDKNN الكشف الإيجابي الحقيقي مع التحكم في الإيجابيات الكاذبة، بينما يقلل CViHDDT من الإيجابيات الكاذبة لكنه قد يفوت بعض حالات أمراض القلب.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لا يزال مرض القلب أحد الأسباب الرئيسية للوفيات على مستوى العالم، مما يخلق حاجة ملحة لأنظمة تنبؤية دقيقة وقابلة للتوسع تمكن من التشخيص المبكر والتدخل السريري في الوقت المناسب. غالبا ما تواجه أساليب التعلم الآلي التقليدية صعوبة في معالجة مجموعات البيانات الطبية واسعة النطاق بكفاءة وتفتقر إلى قابلية التفسير، مما يحد من فائدتها في دعم اتخاذ القرار السريري. لمعالجة هذه التحديات، تقترح هذه الدراسة إطار عمل التعلم الآلي الموزع المرئي بالمجموعات للتنبؤ بأمراض القلب. يدمج الإطار خوارزميتين موزعتين: شجرة القرار الموزعة البصرية العنقودية (CViHDDT) وأقرب جار موزع ل Hadoop البصري العنقودي (CViHDKNN). تستفيد النماذج المقترحة من إطار عمل MapReduce من Hadoop للحوسبة الموزعة عبر مجموعات بيانات كبيرة، مع دمج تجميع K-Means لتحسين تنظيم البيانات والتصور. يعزز هذا التصور القائم على التجمعات قابلية التفسير من خلال تمكين الأطباء من فهم أفضل للعلاقات بين عوامل الخطر للمرضى ونتائج التنبؤ. تم إجراء التقييم التجريبي باستخدام مجموعة بيانات أمراض القلب التابعة لجامعة كاليفورنيا في بيئة موزعة تعتمد على هادوب. تظهر النتائج أن CViHDKNN حقق أداء تنبؤيا متفوقا، حيث حقق دقة 85.25٪ واستدعاء 88٪، متفوقا على نموذج CViHDDT الذي حقق دقة 80.33٪. كما أثر تعديل قيم القطع في التصنيف على الحساسية ومعدلات الكشف: فقد حسن القطع المنخفضة الكشف الإيجابي الحقيقي مع الحفاظ على مستويات مقبولة من الإيجابيات الكاذبة. تظهر هذه النتائج أن التعلم الموزع المعزز بالتجميع يحسن قابلية التوسع، والدقة التنبؤية، وقابلية التفسير السريري للتنبؤ بأمراض القلب.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

أمراض القلب هي واحدة من الأسباب الرئيسية للوفاة على مستوى العالم وتمثل تحديا كبيرا في الصحة العامة. يبرز انتشار أمراض القلب والأوعية الدموية المتزايد الحاجة الملحة إلى نماذج تشخيصية متقدمة تدعم الكشف المبكر وعلاجه. تعتمد الأساليب التشخيصية التقليدية بشكل كبير على التقييم اليدوي والحكم السريري، اللذين غالبا ما يواجهان صعوبة في إدارة كميات كبيرة من البيانات الطبية بكفاءة. مؤخرا، لعبت تقنيات الذكاء الاصطناعي (AI) وتعلم الآلة (ML) دورا مهما في التحليلات التنبؤية للرعاية الصحية، مما مكن من التنبؤ بالأمراض المعتمدة على البيانات وتحسين دقة تقييم المخاطر في الأنظمة الطبية 1,2.

غالبا ما تعاني طرق التشخيص التقليدية وأنظمة اتخاذ القرار القائمة على القواعد من قابلية توسع محدودة ودقة أقل عند تطبيقها على مجموعات بيانات طبية معقدة. على الرغم من أن تقنيات التعلم الآلي حسنت أداء التنبؤ، إلا أن العديد من النماذج لا تزال تواجه تحديات في معالجة البيانات الطبية واسعة النطاق والحفاظ على قابلية التفسير لاتخاذ القرار السريري. قد تحقق نماذج التعلم العميق دقة تنبؤية عالية لكنها غالبا ما تعمل كأنظمة "صندوق أسود"، مما يصعب على العاملين في الرعاية الصحية فهم الأسباب وراء التنبؤات 3,4,5. هذا النقص في الشفافية يحد من اعتمادها في البيئات السريرية حيث يكون التفسير ضروريا 6,7,8,9,10.

لتجاوز هذه التحديات، تم اعتماد أطر الحوسبة الموزعة مثل Hadoop بشكل متزايد لتحليلات الرعاية الصحية واسعة النطاق. تمكن بنية هادوب الموزعة من معالجة مجموعات البيانات الكبيرة بالتوازي باستخدام نظام الملفات الموزعة هادوب (HDFS) وMapReduce، مما يحسن الكفاءة الحسابية وقابلية التوسع في تحليل البيانات الطبية. ومع ذلك، لا تزال نماذج التعلم الآلي الموزعة تتطلب آليات تعزز قابلية التفسير والشفافية. يمكن أن يساعد دمج تقنيات التجميع والتصور في كشف الأنماط الخفية في بيانات المرضى ودعم الأطباء في فهم النتائج التنبؤية بشكل أكثر فعالية 11,12,13,14,15,16.

استكشف العديد من الباحثين تقنيات التعلم الآلي الموزعة للتنبؤ بأمراض القلب باستخدام خوارزميات مثل أشجار القرار وK-أقرب جار (KNN). أظهرت نماذج شجرة القرار الموزعة (HDDT) المطبقة على أطر Hadoop تحسينات في قابلية التوسع ودقة التصنيف مقارنة بأساليب شجرة القرار التقليدية 17,18,19,20,21,22,23. وبالمثل، تستخدم طرق هادوب KNN الموزعة (HDKNN) المعالجة المتوازية لتحسين كفاءة التصنيف لمجموعات البيانات الطبية الكبيرة وعالية الأبعاد24،25،26. ومع ذلك، غالبا ما تفتقر هذه النماذج إلى آليات قوية للتفسير والتصور، وهي ضرورية لاتخاذ قرارات سريرية فعالة وفهم ملفات مخاطر المرضى. على الرغم من هذه التطورات، لا تزال النماذج الموزعة الحالية تفتقر إلى آليات متكاملة للتفسير والفهم البصري لأنماط مخاطر المرضى.

لمعالجة هذه القيود، تقترح هذه الدراسة إطار عمل التعلم الآلي الموزع المرئي بالمجموعات (CVDML) للتنبؤ بأمراض القلب. يقدم الإطار نموذجين تنبؤيين موزعين: شجرة القرار الموزعة المرئية في هادوب العنقودي (CViHDDT) وأقرب جار موزع ل Hadoop المرئية بالمجموعات (CViHDKNN). يطبق CViHDDT بناء شجرة القرار الموزعة لتحسين اختيار الميزات الطبية مثل الأعراض والتاريخ الطبي السابق، بينما يطبق CViHDKNN نهج KNN موزع ومتوازي لتصنيف المرضى بناء على خصائص طبية متشابهة. يحسن دمج تقنيات التجميع والتصور أداء التصنيف ويعزز قابلية التفسير من خلال تجميع المرضى الذين لديهم أنماط مرضية مشابهة.

الهدف الرئيسي من هذا البحث هو تطوير إطار عمل تعلم آلي موزع قابل للتوسع والتفسير للتنبؤ الدقيق بأمراض القلب باستخدام مجموعات بيانات طبية كبيرة. تشمل المساهمات الرئيسية لهذه الدراسة: (1) تطوير إطار عمل لتعلم الآلة الموزع القائم على Hadoop قادر على معالجة مجموعات بيانات الرعاية الصحية الكبيرة بكفاءة. (2) دمج تقنيات التصور التجميعي مع نماذج شجرة القرار الموزعة وKNN لتحسين قابلية التفسير والشفافية في تحليلات الرعاية الصحية التنبؤية27. (3) إثبات تحسين أداء التنبؤ من خلال تحسين الدقة والاسترجاع والقدرة على اكتشاف الشذوذات مقارنة بأساليب التعلم الآلي التقليدية28.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

جمع مجموعة البيانات

تعد مجموعة بيانات أمراض القلب في UCI مجموعة بيانات مستخدمة على نطاق واسع في أبحاث الطب وتعلم الآلة للتنبؤ بأمراض القلب. يحتوي على خصائص سريرية وتشخيصية متنوعة للمرضى، مما يمكن المتخصصين في الرعاية الصحية والباحثين من تطوير نماذج تنبؤ قائمة على البيانات. تصنف مجموعة البيانات الأفراد على أنهم إما محتملون أو غير محتملين للإصابة بأمراض القلب بناء على عدة سمات للمرضى، بما في ذلك العمر، الجنس، نوع ألم الصدر، ضغط الدم، مستويات الكوليسترول، ونتائج تخطيط القلب (https://archive.ics.uci.edu/dataset/45/heart+disease)29. يوضح سير العمل العام لإطار العمل المقترح للتنبؤ بأمراض القلب، بما في ذلك معالجة البيانات المسبقة، وتنفيذ النموذج الموزع، ومراحل التقييم، في الشكل 1.

إعدادات البيئة التجريبية

تم نشر البيئة التجريبية على Apache Hadoop 3.x كإطار عمل أساسي للحوسبة الموزعة لجميع التطبيقات. استخدم العنقود بنية رئيس-عامل مع عقدة رئيسية مخصصة وعدة عقد عامل. كانت العقدة الرئيسية تدير جدولة الوظائف، وتخصيص الموارد، وتنسيق العنقود باستخدام YARN (مفاوض موارد آخر)، بينما كانت عقد العمال تنفذ مهام الحوسبة الموزعة بالتوازي لمعالجة مجموعات البيانات الطبية واسعة النطاق بكفاءة. تم تزويد كل عقدة في العنقود بمعالجات Intel Core i7 (أو ما يعادلها)، وذاكرة RAM بسعة 16–32 جيجابايت، وحوالي 1 تيرابايت من التخزين.

إدخال البيانات إلى HDFS

تخزين مجموعة البيانات

تم تخزين مجموعة البيانات التجريبية في HDFS بصيغة موزعة على الكتل، مع وجود أو غياب مرض القلب، مع فصل المتغير عن مجموعة الميزات المستقلة، قبل التخزين عبر عقد العنقود. تم تطبيق معالجة مسبقة خاصة بالميزات على جميع كتل البيانات المخزنة باستخدام سير عمل MapReduce. تم تطبيع السمات العددية، بما في ذلك العمر، وضغط الدم، ومستويات الكوليسترول، ومعدل ضربات القلب باستخدام مقياس قوي يعتمد على النطاق الربعي، مما قلل من تأثير المؤشرات الشاذة التي تنتشر بشكل خاص في مجموعات البيانات الطبية حيث قد تمثل القيم القصوى حالات سريرية نادرة أو شديدة. تم تحويل المتغيرات الفئوية التي تحتوي على أكثر من فئتين، مثل cp، restecg، وthal، باستخدام ترميز أحادي الساخن، حيث تم تحويل السمات الفئوية إلى تمثيلات رقمية ثنائية متوافقة مع مدخلات خوارزميات التعلم الآلي30، 31، 32. تم تنفيذ جميع عمليات المعالجة المسبقة كوظائف MapReduce موزعة عبر كتل بيانات HDFS، مما يضمن تطبيقا موحدا لخط الأنابيب الكامل دون مركزية البيانات الخام في أي نقطة واحدة.

التقسيم عبر العقد

تم تقسيم مجموعة البيانات إلى مجموعات تدريب واختبار باستخدام تقسيم 80:20، حيث خصص 80٪ للتدريب و20٪ للتقييم على البيانات غير المرئية. تم تطبيق هذا التقسيم بشكل متسق عبر جميع عقد العمال الموزعة لضمان معالجة كل عقدة لجزء متناسب وممثل من مجموعة البيانات الكاملة، مما يمنع انحراف البيانات ويدعم تعميم النموذج المتوازن. ضمن التوسع أن جميع المتغيرات العددية ساهمت بالتساوي خلال التدريب الموزع من خلال منع الميزات ذات الأحجام الأكبر من السيطرة على عملية التعلم عبر العقد. عززت هذه الاستراتيجية المنظمة التقسيم من الموثوقية التنبؤية وساعدت في منع الإفراط في التركيب من خلال الحفاظ على فصل واضح بين بيانات التدريب والتقييم عبر العنقود الموزع.

معالجة البيانات المسبقة

فقدان معالجة القيم

غالبا ما تحتوي مجموعات البيانات الطبية على سجلات غير مكتملة بسبب أخطاء إدخال البيانات، أو أعطال في الجهاز، أو عدم استجابة المرضى أثناء جمع البيانات السريرية. قبل تدريب النماذج، تم فحص جميع سمات مجموعة البيانات بحثا عن القيم المفقودة أو الصفرية. تم تحديد الصفوف التي تحتوي على قيم مفقودة في السمات السريرية الحرجة مثل ضغط الدم والكوليسترول ومعدل ضربات القلب والتعامل معها باستخدام النسبة المتوسطة للمتغيرات العددية ونسبة النمط للمتغيرات التصنيفية. حافظ هذا النهج على التوزيع الإحصائي لمجموعة البيانات مع ضمان عدم التخلص من عينة تدريب دون داع، مع الحفاظ على أقصى توفر بيانات لتعلم النموذج عبر عقد HDFS الموزعة.

توسيع الميزات

تظهر الميزات الرقمية، بما في ذلك العمر وضغط الدم ومستويات الكوليسترول وأقصى معدل ضربات قلب، نطاقات قيم مختلفة بشكل ملحوظ، مما قد يجعل الميزات ذات الأحجام الأكبر تؤثر بشكل غير متناسب على تدريب النماذج. لمعالجة ذلك، تم تطبيق مقياس قوي يعتمد على النطاق بين الرباعي على جميع السمات العددية المستمرة. هذه الاستراتيجية المناسبة بشكل خاص لمجموعات البيانات الطبية حيث قد تؤدي القيم السريرية الشديدة التي تمثل الحالات النادرة أو الشديدة إلى تشويه عملية التعلم. ضمن التوسع أن جميع المتغيرات العددية ساهمت بالتساوي خلال تدريب النموذج وتم تطبيقها بشكل متسق عبر جميع عقد العمال الموزعة باستخدام سير العمل MapReduce (MapReduced).

الترميز

تم تحويل المتغيرات التصنيفية التي تحتوي على أكثر من فئتين مميزتين، بما في ذلك cp (نوع ألم الصدر)، restecg (نتائج تخطيط القلب أثناء الراحة)، والثال (نوع الثلاسيميا)، باستخدام ترميز one-hot. حولت هذه العملية كل سمة تصنيفية إلى مجموعة من أعمدة المؤشرات العددية الثنائية، مما أنتج تمثيلات يمكن لخوارزميات التعلم الآلي معالجتها بفعالية دون فرض علاقات ترتيبية اصطناعية بين قيم الفئات. تم الاحتفاظ بالمتغيرات التصنيفية الثنائية في شكلها العددي الأصلي. تم تنفيذ جميع عمليات الترميز كوظائف MapReduce موزعة عبر كتل بيانات HDFS، مما يضمن التحول المتسق عبر جميع شظايا مجموعات البيانات المقسمة.

تقسيم القطار/الاختبار

تم تقسيم مجموعة البيانات المعالجة مسبقا إلى مجموعات تدريب واختبار باستخدام تقسيم 80:20، حيث خصص 80٪ لتدريب النماذج و20٪ لتقييم الأداء على البيانات غير المرئية. تم فصل المتغير المستهدف، الذي يشير إلى وجود أو غياب مرض القلب، عن مجموعة السمات المستقلة قبل الانقسام. تم تطبيق هذا التقسيم بشكل موحد عبر جميع عقد HDFS الموزعة لضمان معالجة كل عقدة عاملة لجزء متناسب وممثل من مجموعة البيانات الكاملة، مما يمنع انحراف البيانات. عززت استراتيجية التقسيم بنسبة 80:20 الموثوقية التنبؤية، وحسنت تعميم النموذج، وحافظت على فصل واضح بين بيانات التدريب والتقييم عبر بيئة التجمعات الموزعة، مما منع الإفراط في التوافق.

تنفيذ النموذج

نموذج شجرة القرار الموزعة البصرية العنقودية (CViHDDT) يصنف المرضى إلى فئات المخاطر باستخدام شجرة قرار موزعة. تقوم خوارزمية شجرة القرار بتقسيم مجموعة البيانات بشكل متكرر بناء على الميزات الأكثر إفادة، مما يعظم الفصل بين المرضى المصابين بأمراض القلب وغير المصابين بها. داخل إطار العمل الموزع Hadoop، يتم تنفيذ هذه العملية عبر عقد حوسبة متعددة، مما يسمح بمعالجة مجموعات البيانات الكبيرة بكفاءة. تقلل البنية الموزعة من وقت الحساب مع تحسين قابلية التوسع. تستخدم خوارزمية Cluster Visualized Hadoop Distributed K-Nearest Neighbor (CViHDKNN) نفس مجموعة البيانات لكنها تطبق استراتيجية تصنيف مختلفة. بدلا من بناء شجرة قرار، يحدد النموذج أقرب المرضى المجاورين بناء على الصفات الطبية مثل ضغط الدم، ومستويات الكوليسترول، والذبحة الصدرية الناتجة عن التمارين. باستخدام الحوسبة الموزعة، تقوم خوارزمية KNN بتجميع المرضى ذوي الخصائص الطبية المتشابهة بكفاءة مع إدارة تعقيد الحاسوب.

مبدأ التصنيف لنموذج K-أقرب جار موزع موضح في الشكل 2، حيث يتم تعيين نسخة جديدة لفئة بناء على الفئة الأغلبية بين أقرب جيرانها. تمكن تقنيات التصور العنقودي من المتخصصين في الرعاية الصحية من تحديد مجموعات المرضى ذوي الخصائص السريرية المتشابهة، مما يحسن قابلية التفسير ويدعم توصيات العلاج الشخصية. يدمج إطار العمل المقترح للتنبؤ بأمراض القلب معالجة البيانات المسبقة، وخوارزميات التعلم الآلي الموزعة، وتقنيات التصور العنقودي. من خلال الاستفادة من قدرات الحوسبة الموزعة في هادوب، يعالج الإطار مجموعات بيانات الرعاية الصحية الكبيرة بكفاءة مع الحفاظ على دقة عالية في التنبؤ وقابلية التفسير، مما يمكن من الكشف المبكر عن أمراض القلب وتحسين اتخاذ القرارات السريرية.

شجرة القرار الموزعة في هادوب المرئية بالمجموعات (CViHDDT):

تدريب شجرة القرار الموزعة

نموذج شجرة القرار الموزعة المعتمدة من هادوب العنقودي المقترح (CViHDDT) يختلف بشكل جوهري عن بناء شجرة القرار التقليدي من خلال توزيع عملية بناء الشجرة عبر عقد متعددة في نظام هادوب البيئي بدلا من بناء الشجرة بأكملها على جهاز واحد. تقوم عقد العمال الفردية ببناء أشجار قرار جزئية محليا على المجموعة الفرعية المعينة لها من مجموعة البيانات باستخدام إما MapReduce أو Apache Spark للمعالجة المتوازية. يتم دمج هذه الأشجار الجزئية المحلية لاحقا في شجرة قرار شاملة شاملة تشمل مجموعة البيانات الموزعة الكاملة. تسرع هذه الاستراتيجية الموزعة بشكل كبير تدريب النماذج، مما يمكن الإطار من التعامل بكفاءة مع مجموعات بيانات طبية متعددة التيرابايتات على نطاق واسع. تضمن البنية التحتية للحوسبة المتوازية التي توفرها Hadoop أن نموذج CViHDDT قابل للتوسع بطبيعته ومناسب جيدا لحلول الرعاية الصحية المعتمدة على البيانات الضخمة. بعد بناء الشجرة الموزعة، تطبق تقنيات تصور المجموعات لتعزيز قابلية تفسير النموذج من خلال تجميع عقد شجرة القرار في مجموعات من المرضى الذين يعانون من حالات طبية متشابهة باستخدام خوارزميات مثل k-means والتجميع الهرمي. تنتج هذه العملية التجميع فئات مخاطر ذات معنى سريري—مثل أمراض القلب الخفيفة والمتوسطة والشديدة—مما يمكن المتخصصين في الرعاية الصحية من تحديد الأنماط في بيانات المرضى، وفهم تقدم المرض، ووضع خطط علاجية مخصصة.

اختيار الميزات

قبل تدريب شجرة القرار الموزعة، كان نموذج CViHDDT يطبق معالجة مسبقة منظمة وخط أنابيب اختيار الميزات على البيانات الطبية الخام التي يتم استيعابها من HDFS. يتم معالجة القيم المفقودة من خلال خوارزميات التصنيف لإدارة السجلات السريرية غير المكتملة ومنع فقدان البيانات دون التخلص من عينات المرضى. يتم تطبيق تطبيع مقياس قوي على السمات العددية مثل ضغط الدم ومستويات الكوليسترول للتخفيف من التأثير غير المتناسب للحالات الشذوذات السائدة في مجموعات البيانات الطبية. يتم تحويل المتغيرات الفئوية مثل الجنس والتاريخ العائلي لأمراض القلب باستخدام ترميز أحادي أو الترميز المطلق لإنتاج تمثيلات رقمية متوافقة مع خوارزميات التعلم الآلي. بعد المعالجة المسبقة، يتم استخراج السمات لتحديد السمات السريرية الرئيسية الأكثر تنبؤا بأمراض القلب. تلغي هذه المرحلة الميزات غير ذات الصلة والمتكررة من مجموعة البيانات، مما يقلل التكاليف الحسابية في مراحل التدريب الموزعة اللاحقة، ويضمن الاحتفاظ فقط بالسمات الأكثر فائدة تشخيصيا — مثل نوع ألم الصدر، ضغط الدم أثناء الراحة، الكوليسترول في المصل، الحد الأقصى لمعدل ضربات القلب، واكتئاب ST — كمدخلات لعملية بناء شجرة القرار الموزعة. يحسن هذا التقليل المنهجي من الميزات كفاءة النموذج، ويقلل من وقت التدريب عبر العقد الموزعة، ويعزز الموثوقية التنبؤية العامة لإطار عمل CViHDDT من خلال تركيز عملية التعلم على السمات ذات القوة التمييزية السريرية الأقوى.

سير العمل MapReduce

يشكل نموذج برمجة MapReduce العمود الفقري الحاسوبي لخط أنابيب التدريب الموزع CViHDDT، مما يتيح المعالجة المتوازية لمجموعة بيانات أمراض القلب عبر جميع عقد العمال في عنقود Hadoop. في مرحلة الخريطة، تعالج كل عقدة عاملة بشكل مستقل شظية بيانات HDFS المخصصة لها، مع حساب هياكل شجرة القرار الجزئية وإحصائيات التقسيم المحلية — بما في ذلك قيم كسب المعلومات وفهرس جيني — لكل سمة مرشحة، دون الحاجة إلى الوصول إلى البيانات المخزنة على عقد أخرى. في مرحلة التقليل، يتم تجميع الأشجار الجزئية المحسوبة محليا والإحصائيات الكافية عبر جميع العقد لبناء شجرة القرار العالمية الكاملة، مما يجمع المعرفة الموزعة التي تم تعلمها في كل عقدة في نموذج تنبؤي موحد واحد. يتيح هذا التحليل لعملية بناء الشجرة بتقليل الخرائط نموذج CViHDDT من التوسع خطيا مع عدد العقد العاملة، مما يجعل التحليل اللحظي لمجموعات البيانات الطبية واسعة النطاق ممكنا حسابيا. يدعم سير عمل MapReduce أيضا التنفيذ الموزع لإجراءات التصور الجماعي، حيث يتم تطبيق خوارزميات التجميع بالتوازي عبر كتل بيانات HDFS لتجميع سجلات المرضى في فئات المخاطر بناء على تعيينات عقد شجرة القرار الخاصة بهم. يستخدم تقييم الأداء للنموذج الناتج الدقة، والاسترجاع، ودرجة F1، ودقة التصنيف كمقاييس أساسية، مع تقليل التصور الموزع للمجموعات السلبية الكاذبة من خلال تمكين حدود قرار أدق داخل الشجرة — مما يحسن الحساسية مباشرة لتحديد المرضى المعرضين للخطر ويعزز الموثوقية السريرية لإطار التنبؤ بأمراض القلب CViHDDT.

أقرب جار موزع ل K-Nearest (CViHDKNN) مرئي ب Clusterized Hadoop Distributed (CViHDKNN)

التجميع

يبدأ إطار عمل CViHDKNN (الجار الموزع K-Nearest Distributed في التجمع) بتطبيق تقنيات التجميع على مجموعة بيانات أمراض القلب قبل التصنيف، حيث يتم تجميع المرضى ذوي الخصائص الطبية المتشابهة في مجموعات متماسكة قبل إجراء بحث KNN. تحتوي مجموعة بيانات أمراض القلب، التي تحتوي على ميزات سريرية مثل العمر، ومستوى الكوليسترول، وضغط الدم، ونتائج تخطيط القلب الكهربائي، ومعدل ضربات القلب، ويتم معالجتها مسبقا وتوزيعها عبر العقد في مجموعة Hadoop باستخدام HDFS. ثم يتم تطبيق خوارزميات التجميع، بما في ذلك K-Means والتجميع الهرمي، عبر هذه الأقسام الموزعة للبيانات لتقسيم مجموعة البيانات إلى مجموعات من المرضى الذين يشاركون ملفات طبية ذات صلة. تخدم هذه الخطوة التجميعية قبل التصنيف غرضا حسابيا حاسما: من خلال تقييد مساحة البحث في KNN على أكثر العنقود ملاءمة فقط بدلا من مجموعة البيانات بأكملها، تقلل الخوارزمية بشكل كبير من عدد عمليات الحسابات المطلوبة لكل حالة استعلام. يوفر تصور هذه التجمعات فائدة سريرية إضافية من خلال تمكين تحديد مجموعات المرضى ذات الخصائص الطبية المتقاربة ارتباطا وثيقا، ودعم تصنيف أكثر معنى لملفات المخاطر قبل مرحلة تصنيف الجار الأقرب. لا يقلل التحسين القائم على التجميع فقط من التكاليف الحسابية، بل يحسن أيضا دقة التصنيف من خلال ضمان مقارنة كل حالة استعلام فقط مع سجلات المرضى الأكثر تشابها سياقيا، مما يجعل هذا النهج مناسبا بشكل خاص لمجموعات بيانات أمراض القلب واسعة النطاق حيث يكون حساب المسافات الشاملة عبر مجموعة البيانات الكاملة مكلفا حسابيا.

KNN الموزعة

يعالج مكون KNN الموزع في CViHDKNN القيود الأساسية في قابلية التوسع في KNN التقليدية، والتي تتطلب تحميل مجموعة البيانات بالكامل في الذاكرة قبل حساب المسافات بين مثيل الاستعلام وجميع نقاط البيانات المخزنة. في إطار عمل CViHDKNN، يتم توزيع هذه المسافة على التوازي عبر عدة عقد عاملة في عنقود Hadoop باستخدام أقسام بيانات موزعة في HDFS، مما يضمن عدم وجود عقدة واحدة مطلوبة لمعالجة مجموعة البيانات الكاملة. تقوم كل عقدة عاملة بحساب المسافة بين مثيل الاستعلام وسجلات المرضى المخزنة في شظية بيانات HDFS المخصصة محليا، محددة أقرب الجيران محليا داخل قسمها. من خلال الاستفادة من قدرات المعالجة المتوازية في Hadoop، يحسن CViHDKNN بشكل كبير قابلية التوسع ويتيح الإدارة الفعالة لكميات هائلة من بيانات المرضى المتعلقة بالصحة. تعزز هذه البنية الموزعة أيضا أمان البيانات، حيث تبقى سجلات المرضى الحساسة داخل بيئة العنقود الموزعة بدلا من نقلها إلى خوادم سحابية خارجية أو أجهزة محلية مركزية. إن الجمع بين تقليل مساحة البحث الموجهة بالتجميع وحساب المسافات الموزعة بواسطة هادووب ينتج نظاما يحقق كل من الكفاءة الحسابية والدقة التنبؤية، مما يمكن التنبؤ بأمراض القلب في الوقت الحقيقي على مجموعات بيانات طبية واسعة النطاق. تؤكد النتائج التجريبية أن التنفيذ الموزع يحقق دقة تصنيف تبلغ 85.25٪، مما يمثل تحسنا كبيرا في الأداء مقارنة بخط الأساس التقليدي ل KNN غير الموزع، ويرجع ذلك مباشرة إلى استراتيجية المعالجة الموزعة والمعززة بالتجمع.

التصنيف

تقوم مرحلة التصنيف في CViHDKNN بتعيين كل حالة مريض استعلام إلى فئة أمراض القلب بناء على الأغلبية بين أقرب الجيران K الذين تم تحديدهم من خلال عملية البحث الموزعة. اختيار قيمة K يؤثر بشكل مباشر على نتائج التصنيف والدقة التنبؤية. عندما يكون K = 1، يتم تعيين نسخة الاستعلام إلى تسمية الفئة لأقرب جار لها، مما ينتج عنه حدود قرار محلية للغاية قد تكون حساسة للضوضاء في بيانات التدريب. عندما يكون K = 3، يتم تحديد التصنيف بواسطة الفئة الأغلبية بين أقرب ثلاثة جيران — على سبيل المثال، إذا كان هناك جار ينتمي إلى الفئة 1 (لا يوجد مرض قلبي) وواحد ينتمي إلى الفئة 2 (مرض القلب موجود)، يتم تصنيف حالة الاستعلام كفئة 1، مما يوفر قرارا أكثر قوة وتحملا للضوضاء. يقوم طور MapReduce بتجميع أقرب الجيران المعروفين محليا من جميع عقد العمال في قائمة مصنفة عالميا، يتم اختيار K أقرب الجيران منها، ثم يحسب تصويت الأغلبية لإنتاج توقع الفئة النهائي. يتم تقييم أداء إطار تصنيف CViHDKNN باستخدام الدقة، والاسترجاع، ودرجة F1، ودقة التصنيف العامة كمقاييس أساسية. يؤدي دمج البحث المقيد بالتجمعات مع تصويت الأغلبية الموزعة إلى إنتاج حدود قرارات أكثر دقة ودقة من KNN القياسي، مما يقلل من السلبيات الكاذبة في تحديد المرضى المعرضين للخطر ويحسن الحساسية، وهما متطلبان أساسيان للتنبؤ بأمراض القلب الموثوقة سريريا في بيئات تحليلات الرعاية الصحية الموزعة واسعة النطاق.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يظهر التقييم التجريبي أن نموذج CViHDKNN يحقق أداء تنبؤيا أعلى من نموذج CViHDDT في تصنيف أمراض القلب. حقق نموذج CViHDKNN دقة اختبار بلغت 85.25٪، بينما حقق نموذج CViHDDT دقة 80.33٪، مما يشير إلى تحسين القدرة التنبؤية لنهج K الموزع لأقرب جار. تلخص نتائج الأداء المقارن هذه في الجدول 1.

يظهر أداء التصنيف لنموذج CViHDDT قدرة تنبؤية متوسطة، مع دقة وقيم استدعاء تشير إلى اكتشاف متوازن لكل من الحالات المرضية وغير المرضي...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تم تطوير وتقييم طريقة فعالة للتنبؤ بأمراض القلب تعتمد على تقنية التجميع CViHDDT باستخدام إطار شجرة قرار موزعة قائم على Hadoop. حقق النموذج دقة تدريب تقارب 75.62٪ ودقة اختبار بلغت 80.33٪، مما يدل على قدرته على التعميم على البيانات غير المرئية. تشير دقة الاختبار الأعلى قليلا إلى أن معالجة Hadoop المتوازية تتعامل بكفاءة مع مجموعات البيانات الكبيرة مع تقليل التوافق الزائد. أفادت دراسات سابقة أيضا أن الأنظمة الموزعة المعتمدة على هادوب تحسن قابلية التوسع وكفاءة المعالجة في تحليلات الرعاية الصح...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

المؤلفون لا يفرضون أي تضارب مصالح.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يرغب المؤلفون في التعبير عن امتنانهم الصادق لجامعة SR في وارانجال، الهند، قسم علوم وهندسة الحاسوب، على منحهم الإذن وتقديم الدعم والتشجيع المستمر طوال هذا العمل البحثي. كما يشكر المؤلفون فريق البحث والتطوير الجامعي، ومختبرات البحث والتطوير، وأعضاء هيئة التدريس الكبار، والمرشدين على إرشادهم القيم والدعم الفني والتحفيز، الذين ساهموا بشكل كبير في إتمام هذه الورقة البحثية بنجاح.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
Apache SparkApache Software Foundation3.xمعالجة البيانات الموزعة
HDFSApache Software Foundationمتضمن في Hadoop 3.xتخزين الملفات الموزع
YARNApache Software Foundationمتضمن في Hadoop 3.xإدارة الموارد وجدوله المهام
Matplotlibفريق تطوير Matplotlibتصور البيانات
Seabornمطورو Seabornالرسم الإحصائي
نظام التشغيل UbuntuCanonical Ltd.20.04 LTSنظام تشغيل
RobustScalerScikit-learnتطبيع الميزات
مجموعة بيانات UCI لأمراض القلبمستودع UCI للتعلم الآليمعرف المجموعة 45مجموعة بيانات تجريبية

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

EngineeringHadoopDistributed systemshealth careAI
الفيديو قريباً

مقالات ذات صلة