$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
جمع مجموعة البيانات
تعد مجموعة بيانات أمراض القلب في UCI مجموعة بيانات مستخدمة على نطاق واسع في أبحاث الطب وتعلم الآلة للتنبؤ بأمراض القلب. يحتوي على خصائص سريرية وتشخيصية متنوعة للمرضى، مما يمكن المتخصصين في الرعاية الصحية والباحثين من تطوير نماذج تنبؤ قائمة على البيانات. تصنف مجموعة البيانات الأفراد على أنهم إما محتملون أو غير محتملين للإصابة بأمراض القلب بناء على عدة سمات للمرضى، بما في ذلك العمر، الجنس، نوع ألم الصدر، ضغط الدم، مستويات الكوليسترول، ونتائج تخطيط القلب (https://archive.ics.uci.edu/dataset/45/heart+disease)29. يوضح سير العمل العام لإطار العمل المقترح للتنبؤ بأمراض القلب، بما في ذلك معالجة البيانات المسبقة، وتنفيذ النموذج الموزع، ومراحل التقييم، في الشكل 1.
إعدادات البيئة التجريبية
تم نشر البيئة التجريبية على Apache Hadoop 3.x كإطار عمل أساسي للحوسبة الموزعة لجميع التطبيقات. استخدم العنقود بنية رئيس-عامل مع عقدة رئيسية مخصصة وعدة عقد عامل. كانت العقدة الرئيسية تدير جدولة الوظائف، وتخصيص الموارد، وتنسيق العنقود باستخدام YARN (مفاوض موارد آخر)، بينما كانت عقد العمال تنفذ مهام الحوسبة الموزعة بالتوازي لمعالجة مجموعات البيانات الطبية واسعة النطاق بكفاءة. تم تزويد كل عقدة في العنقود بمعالجات Intel Core i7 (أو ما يعادلها)، وذاكرة RAM بسعة 16–32 جيجابايت، وحوالي 1 تيرابايت من التخزين.
إدخال البيانات إلى HDFS
تخزين مجموعة البيانات
تم تخزين مجموعة البيانات التجريبية في HDFS بصيغة موزعة على الكتل، مع وجود أو غياب مرض القلب، مع فصل المتغير عن مجموعة الميزات المستقلة، قبل التخزين عبر عقد العنقود. تم تطبيق معالجة مسبقة خاصة بالميزات على جميع كتل البيانات المخزنة باستخدام سير عمل MapReduce. تم تطبيع السمات العددية، بما في ذلك العمر، وضغط الدم، ومستويات الكوليسترول، ومعدل ضربات القلب باستخدام مقياس قوي يعتمد على النطاق الربعي، مما قلل من تأثير المؤشرات الشاذة التي تنتشر بشكل خاص في مجموعات البيانات الطبية حيث قد تمثل القيم القصوى حالات سريرية نادرة أو شديدة. تم تحويل المتغيرات الفئوية التي تحتوي على أكثر من فئتين، مثل cp، restecg، وthal، باستخدام ترميز أحادي الساخن، حيث تم تحويل السمات الفئوية إلى تمثيلات رقمية ثنائية متوافقة مع مدخلات خوارزميات التعلم الآلي30، 31، 32. تم تنفيذ جميع عمليات المعالجة المسبقة كوظائف MapReduce موزعة عبر كتل بيانات HDFS، مما يضمن تطبيقا موحدا لخط الأنابيب الكامل دون مركزية البيانات الخام في أي نقطة واحدة.
التقسيم عبر العقد
تم تقسيم مجموعة البيانات إلى مجموعات تدريب واختبار باستخدام تقسيم 80:20، حيث خصص 80٪ للتدريب و20٪ للتقييم على البيانات غير المرئية. تم تطبيق هذا التقسيم بشكل متسق عبر جميع عقد العمال الموزعة لضمان معالجة كل عقدة لجزء متناسب وممثل من مجموعة البيانات الكاملة، مما يمنع انحراف البيانات ويدعم تعميم النموذج المتوازن. ضمن التوسع أن جميع المتغيرات العددية ساهمت بالتساوي خلال التدريب الموزع من خلال منع الميزات ذات الأحجام الأكبر من السيطرة على عملية التعلم عبر العقد. عززت هذه الاستراتيجية المنظمة التقسيم من الموثوقية التنبؤية وساعدت في منع الإفراط في التركيب من خلال الحفاظ على فصل واضح بين بيانات التدريب والتقييم عبر العنقود الموزع.
معالجة البيانات المسبقة
فقدان معالجة القيم
غالبا ما تحتوي مجموعات البيانات الطبية على سجلات غير مكتملة بسبب أخطاء إدخال البيانات، أو أعطال في الجهاز، أو عدم استجابة المرضى أثناء جمع البيانات السريرية. قبل تدريب النماذج، تم فحص جميع سمات مجموعة البيانات بحثا عن القيم المفقودة أو الصفرية. تم تحديد الصفوف التي تحتوي على قيم مفقودة في السمات السريرية الحرجة مثل ضغط الدم والكوليسترول ومعدل ضربات القلب والتعامل معها باستخدام النسبة المتوسطة للمتغيرات العددية ونسبة النمط للمتغيرات التصنيفية. حافظ هذا النهج على التوزيع الإحصائي لمجموعة البيانات مع ضمان عدم التخلص من عينة تدريب دون داع، مع الحفاظ على أقصى توفر بيانات لتعلم النموذج عبر عقد HDFS الموزعة.
توسيع الميزات
تظهر الميزات الرقمية، بما في ذلك العمر وضغط الدم ومستويات الكوليسترول وأقصى معدل ضربات قلب، نطاقات قيم مختلفة بشكل ملحوظ، مما قد يجعل الميزات ذات الأحجام الأكبر تؤثر بشكل غير متناسب على تدريب النماذج. لمعالجة ذلك، تم تطبيق مقياس قوي يعتمد على النطاق بين الرباعي على جميع السمات العددية المستمرة. هذه الاستراتيجية المناسبة بشكل خاص لمجموعات البيانات الطبية حيث قد تؤدي القيم السريرية الشديدة التي تمثل الحالات النادرة أو الشديدة إلى تشويه عملية التعلم. ضمن التوسع أن جميع المتغيرات العددية ساهمت بالتساوي خلال تدريب النموذج وتم تطبيقها بشكل متسق عبر جميع عقد العمال الموزعة باستخدام سير العمل MapReduce (MapReduced).
الترميز
تم تحويل المتغيرات التصنيفية التي تحتوي على أكثر من فئتين مميزتين، بما في ذلك cp (نوع ألم الصدر)، restecg (نتائج تخطيط القلب أثناء الراحة)، والثال (نوع الثلاسيميا)، باستخدام ترميز one-hot. حولت هذه العملية كل سمة تصنيفية إلى مجموعة من أعمدة المؤشرات العددية الثنائية، مما أنتج تمثيلات يمكن لخوارزميات التعلم الآلي معالجتها بفعالية دون فرض علاقات ترتيبية اصطناعية بين قيم الفئات. تم الاحتفاظ بالمتغيرات التصنيفية الثنائية في شكلها العددي الأصلي. تم تنفيذ جميع عمليات الترميز كوظائف MapReduce موزعة عبر كتل بيانات HDFS، مما يضمن التحول المتسق عبر جميع شظايا مجموعات البيانات المقسمة.
تقسيم القطار/الاختبار
تم تقسيم مجموعة البيانات المعالجة مسبقا إلى مجموعات تدريب واختبار باستخدام تقسيم 80:20، حيث خصص 80٪ لتدريب النماذج و20٪ لتقييم الأداء على البيانات غير المرئية. تم فصل المتغير المستهدف، الذي يشير إلى وجود أو غياب مرض القلب، عن مجموعة السمات المستقلة قبل الانقسام. تم تطبيق هذا التقسيم بشكل موحد عبر جميع عقد HDFS الموزعة لضمان معالجة كل عقدة عاملة لجزء متناسب وممثل من مجموعة البيانات الكاملة، مما يمنع انحراف البيانات. عززت استراتيجية التقسيم بنسبة 80:20 الموثوقية التنبؤية، وحسنت تعميم النموذج، وحافظت على فصل واضح بين بيانات التدريب والتقييم عبر بيئة التجمعات الموزعة، مما منع الإفراط في التوافق.
تنفيذ النموذج
نموذج شجرة القرار الموزعة البصرية العنقودية (CViHDDT) يصنف المرضى إلى فئات المخاطر باستخدام شجرة قرار موزعة. تقوم خوارزمية شجرة القرار بتقسيم مجموعة البيانات بشكل متكرر بناء على الميزات الأكثر إفادة، مما يعظم الفصل بين المرضى المصابين بأمراض القلب وغير المصابين بها. داخل إطار العمل الموزع Hadoop، يتم تنفيذ هذه العملية عبر عقد حوسبة متعددة، مما يسمح بمعالجة مجموعات البيانات الكبيرة بكفاءة. تقلل البنية الموزعة من وقت الحساب مع تحسين قابلية التوسع. تستخدم خوارزمية Cluster Visualized Hadoop Distributed K-Nearest Neighbor (CViHDKNN) نفس مجموعة البيانات لكنها تطبق استراتيجية تصنيف مختلفة. بدلا من بناء شجرة قرار، يحدد النموذج أقرب المرضى المجاورين بناء على الصفات الطبية مثل ضغط الدم، ومستويات الكوليسترول، والذبحة الصدرية الناتجة عن التمارين. باستخدام الحوسبة الموزعة، تقوم خوارزمية KNN بتجميع المرضى ذوي الخصائص الطبية المتشابهة بكفاءة مع إدارة تعقيد الحاسوب.
مبدأ التصنيف لنموذج K-أقرب جار موزع موضح في الشكل 2، حيث يتم تعيين نسخة جديدة لفئة بناء على الفئة الأغلبية بين أقرب جيرانها. تمكن تقنيات التصور العنقودي من المتخصصين في الرعاية الصحية من تحديد مجموعات المرضى ذوي الخصائص السريرية المتشابهة، مما يحسن قابلية التفسير ويدعم توصيات العلاج الشخصية. يدمج إطار العمل المقترح للتنبؤ بأمراض القلب معالجة البيانات المسبقة، وخوارزميات التعلم الآلي الموزعة، وتقنيات التصور العنقودي. من خلال الاستفادة من قدرات الحوسبة الموزعة في هادوب، يعالج الإطار مجموعات بيانات الرعاية الصحية الكبيرة بكفاءة مع الحفاظ على دقة عالية في التنبؤ وقابلية التفسير، مما يمكن من الكشف المبكر عن أمراض القلب وتحسين اتخاذ القرارات السريرية.
شجرة القرار الموزعة في هادوب المرئية بالمجموعات (CViHDDT):
تدريب شجرة القرار الموزعة
نموذج شجرة القرار الموزعة المعتمدة من هادوب العنقودي المقترح (CViHDDT) يختلف بشكل جوهري عن بناء شجرة القرار التقليدي من خلال توزيع عملية بناء الشجرة عبر عقد متعددة في نظام هادوب البيئي بدلا من بناء الشجرة بأكملها على جهاز واحد. تقوم عقد العمال الفردية ببناء أشجار قرار جزئية محليا على المجموعة الفرعية المعينة لها من مجموعة البيانات باستخدام إما MapReduce أو Apache Spark للمعالجة المتوازية. يتم دمج هذه الأشجار الجزئية المحلية لاحقا في شجرة قرار شاملة شاملة تشمل مجموعة البيانات الموزعة الكاملة. تسرع هذه الاستراتيجية الموزعة بشكل كبير تدريب النماذج، مما يمكن الإطار من التعامل بكفاءة مع مجموعات بيانات طبية متعددة التيرابايتات على نطاق واسع. تضمن البنية التحتية للحوسبة المتوازية التي توفرها Hadoop أن نموذج CViHDDT قابل للتوسع بطبيعته ومناسب جيدا لحلول الرعاية الصحية المعتمدة على البيانات الضخمة. بعد بناء الشجرة الموزعة، تطبق تقنيات تصور المجموعات لتعزيز قابلية تفسير النموذج من خلال تجميع عقد شجرة القرار في مجموعات من المرضى الذين يعانون من حالات طبية متشابهة باستخدام خوارزميات مثل k-means والتجميع الهرمي. تنتج هذه العملية التجميع فئات مخاطر ذات معنى سريري—مثل أمراض القلب الخفيفة والمتوسطة والشديدة—مما يمكن المتخصصين في الرعاية الصحية من تحديد الأنماط في بيانات المرضى، وفهم تقدم المرض، ووضع خطط علاجية مخصصة.
اختيار الميزات
قبل تدريب شجرة القرار الموزعة، كان نموذج CViHDDT يطبق معالجة مسبقة منظمة وخط أنابيب اختيار الميزات على البيانات الطبية الخام التي يتم استيعابها من HDFS. يتم معالجة القيم المفقودة من خلال خوارزميات التصنيف لإدارة السجلات السريرية غير المكتملة ومنع فقدان البيانات دون التخلص من عينات المرضى. يتم تطبيق تطبيع مقياس قوي على السمات العددية مثل ضغط الدم ومستويات الكوليسترول للتخفيف من التأثير غير المتناسب للحالات الشذوذات السائدة في مجموعات البيانات الطبية. يتم تحويل المتغيرات الفئوية مثل الجنس والتاريخ العائلي لأمراض القلب باستخدام ترميز أحادي أو الترميز المطلق لإنتاج تمثيلات رقمية متوافقة مع خوارزميات التعلم الآلي. بعد المعالجة المسبقة، يتم استخراج السمات لتحديد السمات السريرية الرئيسية الأكثر تنبؤا بأمراض القلب. تلغي هذه المرحلة الميزات غير ذات الصلة والمتكررة من مجموعة البيانات، مما يقلل التكاليف الحسابية في مراحل التدريب الموزعة اللاحقة، ويضمن الاحتفاظ فقط بالسمات الأكثر فائدة تشخيصيا — مثل نوع ألم الصدر، ضغط الدم أثناء الراحة، الكوليسترول في المصل، الحد الأقصى لمعدل ضربات القلب، واكتئاب ST — كمدخلات لعملية بناء شجرة القرار الموزعة. يحسن هذا التقليل المنهجي من الميزات كفاءة النموذج، ويقلل من وقت التدريب عبر العقد الموزعة، ويعزز الموثوقية التنبؤية العامة لإطار عمل CViHDDT من خلال تركيز عملية التعلم على السمات ذات القوة التمييزية السريرية الأقوى.
سير العمل MapReduce
يشكل نموذج برمجة MapReduce العمود الفقري الحاسوبي لخط أنابيب التدريب الموزع CViHDDT، مما يتيح المعالجة المتوازية لمجموعة بيانات أمراض القلب عبر جميع عقد العمال في عنقود Hadoop. في مرحلة الخريطة، تعالج كل عقدة عاملة بشكل مستقل شظية بيانات HDFS المخصصة لها، مع حساب هياكل شجرة القرار الجزئية وإحصائيات التقسيم المحلية — بما في ذلك قيم كسب المعلومات وفهرس جيني — لكل سمة مرشحة، دون الحاجة إلى الوصول إلى البيانات المخزنة على عقد أخرى. في مرحلة التقليل، يتم تجميع الأشجار الجزئية المحسوبة محليا والإحصائيات الكافية عبر جميع العقد لبناء شجرة القرار العالمية الكاملة، مما يجمع المعرفة الموزعة التي تم تعلمها في كل عقدة في نموذج تنبؤي موحد واحد. يتيح هذا التحليل لعملية بناء الشجرة بتقليل الخرائط نموذج CViHDDT من التوسع خطيا مع عدد العقد العاملة، مما يجعل التحليل اللحظي لمجموعات البيانات الطبية واسعة النطاق ممكنا حسابيا. يدعم سير عمل MapReduce أيضا التنفيذ الموزع لإجراءات التصور الجماعي، حيث يتم تطبيق خوارزميات التجميع بالتوازي عبر كتل بيانات HDFS لتجميع سجلات المرضى في فئات المخاطر بناء على تعيينات عقد شجرة القرار الخاصة بهم. يستخدم تقييم الأداء للنموذج الناتج الدقة، والاسترجاع، ودرجة F1، ودقة التصنيف كمقاييس أساسية، مع تقليل التصور الموزع للمجموعات السلبية الكاذبة من خلال تمكين حدود قرار أدق داخل الشجرة — مما يحسن الحساسية مباشرة لتحديد المرضى المعرضين للخطر ويعزز الموثوقية السريرية لإطار التنبؤ بأمراض القلب CViHDDT.
أقرب جار موزع ل K-Nearest (CViHDKNN) مرئي ب Clusterized Hadoop Distributed (CViHDKNN)
التجميع
يبدأ إطار عمل CViHDKNN (الجار الموزع K-Nearest Distributed في التجمع) بتطبيق تقنيات التجميع على مجموعة بيانات أمراض القلب قبل التصنيف، حيث يتم تجميع المرضى ذوي الخصائص الطبية المتشابهة في مجموعات متماسكة قبل إجراء بحث KNN. تحتوي مجموعة بيانات أمراض القلب، التي تحتوي على ميزات سريرية مثل العمر، ومستوى الكوليسترول، وضغط الدم، ونتائج تخطيط القلب الكهربائي، ومعدل ضربات القلب، ويتم معالجتها مسبقا وتوزيعها عبر العقد في مجموعة Hadoop باستخدام HDFS. ثم يتم تطبيق خوارزميات التجميع، بما في ذلك K-Means والتجميع الهرمي، عبر هذه الأقسام الموزعة للبيانات لتقسيم مجموعة البيانات إلى مجموعات من المرضى الذين يشاركون ملفات طبية ذات صلة. تخدم هذه الخطوة التجميعية قبل التصنيف غرضا حسابيا حاسما: من خلال تقييد مساحة البحث في KNN على أكثر العنقود ملاءمة فقط بدلا من مجموعة البيانات بأكملها، تقلل الخوارزمية بشكل كبير من عدد عمليات الحسابات المطلوبة لكل حالة استعلام. يوفر تصور هذه التجمعات فائدة سريرية إضافية من خلال تمكين تحديد مجموعات المرضى ذات الخصائص الطبية المتقاربة ارتباطا وثيقا، ودعم تصنيف أكثر معنى لملفات المخاطر قبل مرحلة تصنيف الجار الأقرب. لا يقلل التحسين القائم على التجميع فقط من التكاليف الحسابية، بل يحسن أيضا دقة التصنيف من خلال ضمان مقارنة كل حالة استعلام فقط مع سجلات المرضى الأكثر تشابها سياقيا، مما يجعل هذا النهج مناسبا بشكل خاص لمجموعات بيانات أمراض القلب واسعة النطاق حيث يكون حساب المسافات الشاملة عبر مجموعة البيانات الكاملة مكلفا حسابيا.
KNN الموزعة
يعالج مكون KNN الموزع في CViHDKNN القيود الأساسية في قابلية التوسع في KNN التقليدية، والتي تتطلب تحميل مجموعة البيانات بالكامل في الذاكرة قبل حساب المسافات بين مثيل الاستعلام وجميع نقاط البيانات المخزنة. في إطار عمل CViHDKNN، يتم توزيع هذه المسافة على التوازي عبر عدة عقد عاملة في عنقود Hadoop باستخدام أقسام بيانات موزعة في HDFS، مما يضمن عدم وجود عقدة واحدة مطلوبة لمعالجة مجموعة البيانات الكاملة. تقوم كل عقدة عاملة بحساب المسافة بين مثيل الاستعلام وسجلات المرضى المخزنة في شظية بيانات HDFS المخصصة محليا، محددة أقرب الجيران محليا داخل قسمها. من خلال الاستفادة من قدرات المعالجة المتوازية في Hadoop، يحسن CViHDKNN بشكل كبير قابلية التوسع ويتيح الإدارة الفعالة لكميات هائلة من بيانات المرضى المتعلقة بالصحة. تعزز هذه البنية الموزعة أيضا أمان البيانات، حيث تبقى سجلات المرضى الحساسة داخل بيئة العنقود الموزعة بدلا من نقلها إلى خوادم سحابية خارجية أو أجهزة محلية مركزية. إن الجمع بين تقليل مساحة البحث الموجهة بالتجميع وحساب المسافات الموزعة بواسطة هادووب ينتج نظاما يحقق كل من الكفاءة الحسابية والدقة التنبؤية، مما يمكن التنبؤ بأمراض القلب في الوقت الحقيقي على مجموعات بيانات طبية واسعة النطاق. تؤكد النتائج التجريبية أن التنفيذ الموزع يحقق دقة تصنيف تبلغ 85.25٪، مما يمثل تحسنا كبيرا في الأداء مقارنة بخط الأساس التقليدي ل KNN غير الموزع، ويرجع ذلك مباشرة إلى استراتيجية المعالجة الموزعة والمعززة بالتجمع.
التصنيف
تقوم مرحلة التصنيف في CViHDKNN بتعيين كل حالة مريض استعلام إلى فئة أمراض القلب بناء على الأغلبية بين أقرب الجيران K الذين تم تحديدهم من خلال عملية البحث الموزعة. اختيار قيمة K يؤثر بشكل مباشر على نتائج التصنيف والدقة التنبؤية. عندما يكون K = 1، يتم تعيين نسخة الاستعلام إلى تسمية الفئة لأقرب جار لها، مما ينتج عنه حدود قرار محلية للغاية قد تكون حساسة للضوضاء في بيانات التدريب. عندما يكون K = 3، يتم تحديد التصنيف بواسطة الفئة الأغلبية بين أقرب ثلاثة جيران — على سبيل المثال، إذا كان هناك جار ينتمي إلى الفئة 1 (لا يوجد مرض قلبي) وواحد ينتمي إلى الفئة 2 (مرض القلب موجود)، يتم تصنيف حالة الاستعلام كفئة 1، مما يوفر قرارا أكثر قوة وتحملا للضوضاء. يقوم طور MapReduce بتجميع أقرب الجيران المعروفين محليا من جميع عقد العمال في قائمة مصنفة عالميا، يتم اختيار K أقرب الجيران منها، ثم يحسب تصويت الأغلبية لإنتاج توقع الفئة النهائي. يتم تقييم أداء إطار تصنيف CViHDKNN باستخدام الدقة، والاسترجاع، ودرجة F1، ودقة التصنيف العامة كمقاييس أساسية. يؤدي دمج البحث المقيد بالتجمعات مع تصويت الأغلبية الموزعة إلى إنتاج حدود قرارات أكثر دقة ودقة من KNN القياسي، مما يقلل من السلبيات الكاذبة في تحديد المرضى المعرضين للخطر ويحسن الحساسية، وهما متطلبان أساسيان للتنبؤ بأمراض القلب الموثوقة سريريا في بيئات تحليلات الرعاية الصحية الموزعة واسعة النطاق.