مقالة بحثية

نهج المعلوماتية الحيوية للتنبؤ بالسرطان باستخدام خوارزمية التجميع الكمومي للتشابه السلوكي في التعبير الجيني

DOI:

10.3791/68890

يناير 9, 2026

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يهدف هذا البروتوكول إلى تجميع بيانات التعبير الجيني لتصنيف السرطان باستخدام خوارزمية K-Means الهجينة الكمومية التي تكتشف تلقائيا العدد الأمثل من المجموعات وتفصلها بكفاءة، مما يعزز تطبيقات المعلوماتية الحيوية على أجهزة الكم المتوسطة الضوضاء (NISQ).

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تقدم هذه الدراسة خوارزمية هجينة لتجميع القيم الكمومية K-Means مع الكشف التلقائي عن التجمع لتصنيف بيانات التعبير الجيني السرطانية وغير السرطانية. تستخدم الطريقة رسم الخرائط الكمومية متعددة الميزات لترميز الحالة، وتقدير المسافة الكمومية المعتمد على اختبار التبادل، والتحسين القائم على التدرج الكمومي لتحديد العدد الأمثل للعناقيد ديناميكيا عن طريق تقليل التباين داخل العنقود. يتم اختيار المركزيات الأولية من خلال استراتيجية المسافة الاحتمالية النسبية، مما يحسن الاستقرار والدقة. عند تطبيقها على مجموعات بيانات سرطان الثدي، يتجاوز هذا النهج خوارزمية K-Means الكمومية الموجودة، محققا درجة ظلال تبلغ 0.641 (مقارنة ب 0.601)، ومؤشر كالينسكي-هاراباز 766.57 (مقارنة ب 617.65)، ومؤشر ديفيز-بولدين 0.659 (مقارنة ب 0.704). تشير هذه النتائج إلى تفوق في تجمع وفصل العنقود. على الرغم من أن الخوارزمية المقترحة تظهر تعقيد زمني أعلى قليلا O (N×K max×Mobs) بسبب التحسين التكراري، إلا أنها تتفوق بشكل كبير على المتوسطات الكمومية المعرفة مسبقا في K في دقة التجميع، وتقليل الأخطاء، والجدوى العملية. تسلط كفاءتها في التعامل مع البيانات عالية الأبعاد ومرونتها أمام الضوضاء الكمومية الضوء على إمكاناتها في تطبيقات المعلوماتية الحيوية الواقعية، لا سيما في تصنيف السرطان باستخدام ملفات التعبير الجيني.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

في الهندسة الطبية الحيوية، والمعلوماتية الحيوية، والإحصاء، والعلوم الاجتماعية، والاقتصاد، يعد التجميع تقنية أساسية لتنظيم البيانات في مجموعات متجانسة ذات معنى. على سبيل المثال، تم تطبيق تحليل البيانات الطوبولوجية (TDA) على مجموعات بيانات تعبير جينات السرطان لكشف أنماط هيكلية في فضاءات عالية الأبعاد1، ينظم التجميع البيانات بحيث توضع الأجسام ذات التشابه العالي داخل نفس العنقود، بينما يتم تعيين كائنات مختلفة إلى عناقيد مختلفة. هذا يندرج تحت التعلم غير المراقب ولا يتطلب بيانات تدريب معنة.

على مدى العقود الماضية، تم تطوير العديد من خوارزميات التجميع. تشمل الأساليب الكلاسيكية التجميع القائم على التقسيم2˒3، والتجميع القائم على الكثافة 4,5، والتجميع الهرمي 6,7، والتجميع القائم على الشبكة8˒9، والتجميع القائم على النماذج10. تبرز مراجعات هذه الطرق نقاط قوتها ولكن أيضا محدودياتها11. على الرغم من فعاليتها في سياقات محددة، إلا أن معظم الخوارزميات الكلاسيكية تواجه صعوبة في التعامل مع البيانات عالية الأبعاد أو الصاخبة أو الموزعة بشكل غير منتظم. وبالتالي، لا توجد طريقة تجميع شاملة تؤدي الأداء الأمثل عبر جميع أنواع البيانات.

لمواجهة هذه التحديات، ظهر التجميع الكمومي كبديل واعد¹². على عكس الخوارزميات الكلاسيكية، تستفيد الأساليب المستوحاة من الكم من التراكب والتشابك ومبادئ أخرى في ميكانيكا الكم لاستكشاف مساحات البيانات بشكل أكثر كفاءة. أصبح هذا النموذج مقبولا بشكل متزايد داخل مجتمع البحث13˒14˒15˒16˒17˒18، حيث يظهر مزايا محتملة مقارنة بالتجميع الكلاسيكي في التعامل مع مجموعات البيانات عالية الأبعاد والضوضاء. ومع ذلك، غالبا ما تعاني طرق التجميع الكمومي الحالية من أعداد تجمعات محددة مسبقا أو تهيئة مركزية غير مستقرة، مما يقلل من متانتها في التطبيقات العملية.

في هذا العمل، تم تقديم خوارزمية تجميع كمومية K-Means هجينة جديدة قائمة على التقسيم، تدمج أربعة ابتكارات مميزة: (1) رسم الخرائط الكمومي متعددة الميزات لترميز بيانات تعبير الجينات في فضاء هيلبرت عالي الأبعاد؛ (2) تهيئة مركز مركزي يعتمد على المسافة النسبية الاحتمالية، مما يحسن الاستقرار مقارنة بالتهيئة العشوائية؛ (3) تقدير المسافة الكمومية المعتمدة على اختبار التبديل لقياس التشابه بدقة؛ و(4) التحسين القائم على التدرج الكمومي لتحديد العدد الأمثل للعناقيد ديناميكيا عن طريق تقليل التباين داخل العنقود. تميز هذه المساهمات الطريقة المقترحة عن أساليب التجميع الكمومي السابقة19,20، مما يعزز المتانة وقابلية التوسع وقابلية التطبيق في سيناريوهات المعلوماتية الحيوية الواقعية.

يعد تجميع بيانات تعبير الجينات مهمة حاسمة في المعلوماتية الحيوية، خاصة للتمييز بين الخلايا السرطانية وغير السرطانية بناء على ملفاتها الجينية. طرق التجميع التقليدية، مثل المتوسطات الكلاسيكية K، غالبا ما تواجه صعوبة مع الطبيعة عالية الأبعاد لمجموعات بيانات التعبير الجيني، مما يؤدي إلى تصنيف غير مثالي. لتجاوز هذه التحديات، نقدم خوارزمية المتوسطات الكمومية K مع تحديد التجمعات الأمثل، والتي تستفيد من رسم الخرائط الكمومية وتهيئة المركزيات الاحتمالية لتحقيق أداء تجميع متفوق. لا تقتصر هذه الخوارزمية على تجميع بيانات تعبير الجينات بكفاءة، بل تحدد تلقائيا العدد الأمثل من التجمعات، مما يمكن من تحديد الأنواع الفرعية المميزة للسرطان

يتم تطبيق الخوارزمية المقترحة على مجموعات البيانات التي تحتوي على ملفات تعريف تعبير جيني سرطانية وغير سرطانية، وتجميعها بناء على التشابه السلوكي لتقييم فعاليتها.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. رسم الخرائط الكمومية للميزات

يتم ترميز نقاط البيانات الكلاسيكية إلى حالات كمومية عن طريق ربطها إلى فضاء هيلبرت الكمومي، والذي يمكن الوصول إليه والتحكم فيه بكفاءة بواسطة حاسوب كمومي16˒17,19. تستخدم هذه العملية خريطة ميزات كمومية غير خطية تدمج البيانات الكلاسيكية في فضاء هيلبرت (الشكل 1). تحول خريطة ميزات الدائرة الكمومية الثابتة نقاط البيانات المدخلة إلى حالاتكمومية 17، بينما تمكن الدوائر التغيرية مهام التعلم الآلي من خلال تعديل أساس القياس22. تتكون الدائرة التغيرية من مجموعة من البوابات الكمومية المعدلة، تم تحسينها من خلال تقنيات هجينة كموميةكلاسيكية 23.

figure-protocol-1
الشكل 1: رسم الخرائط للميزات في فضاء هيلبرت الكمومي. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

2. ترميز نقطة الهدف والمراكز المركزية إلى كيوبتات

لترميز ميزات نقاط بياناتنا، نحتاج إلى إجراء دورات باستخدام بوابات U3.

figure-protocol-2

هذا يدور راديان الكيوبت θ بعيدا عن المحور z الموجب، وراديان Φ عن المحور x الموجب.

تم تهيئة جميع الكيوبتات في حالة ∣0〉 قبل بدء عملية الترميز. تم تطبيع كل قيمة تعبير جيني إلى النطاق [0,1] وتحويلها إلى زاوية دوران باستخدام العلاقة θi=πxi. ثم تم تطبيق بوابة وحدة معلمية على كل كيوبت لترميز الميزة المقابلة، وتم تنفيذها في كيسكيت باستخدام عملية qc.u(theta_i, pi, pi, qubit_index). عند ترميز عدة ميزات، كان يتم تكرار إجراء الدوران عبر الكيوبتات المناسبة لإنشاء تمثيل متعدد الميزات. بعد هذه العمليات، تمثل الحالة الكمومية الناتجة ∣ψ〉 متجه الميزة المشفر في فضاء هيلبرت. لم يتم إجراء أي قياس خلال هذه المرحلة، حيث تم حجز الحالة المعدة لتقدير التشابه لاحقا.

3. مقارنة الحالات الكمومية

نتائج التجارب الكمومية عشوائية بطبيعتها لأن الكيوبتات غير مستقرة بطبيعتها، كما هو موصوف في الفيزياء الكمومية. وبالتالي، يجب التعبير عن الاستنتاجات والتنبؤات من خلال الاحتمالات والشكوك. لذا فإن استخلاص استنتاجات واضحة يمثل تحديا حقيقيا. ومع ذلك، عندما تكون الحالات الكمومية قيد النظر نقية، يمكن التنبؤ بالفروق بين الحالات (باحتمالية غير صفرية) بشكل لا لبس فيه من خلال التجارب24˒25.

تم تحميل حالتين كموميتين، ∣ψ〉 و ∣φ〉، أولا في سجلات كمومية منفصلة. ثم تم تهيئة كيوبت التابع في الحالة ∣0〉 للتحكم في عملية التبديل. تم تطبيق بوابة هادامارد على الأنسيلا لوضعها في وضع تراكب قبل تنفيذ عملية SWAP المسيطر عليها. استخدمت بوابة فريدكين (CSWAP) الأنسيلا ككيوبت تحكم وسجلي البيانات كأهداف، مما مكن التداخل بين الحالات. بعد هذه العملية، تم تطبيق بوابة هادامارد ثانية على الهيكل لإكمال نمط التداخل. تم قياس الكيوبت التابع فقط، وكانت نتيجته في القياس ترمز للتشابه بين الحالتين. عندما كانت الحالات متطابقة، تعطي الأنسيلا النتيجة 0 باحتمال 1، بينما تنتج الحالات المتعامدة النتيجة 0 باحتمال 0.5.

figure-protocol-3
الشكل 2: توضيح المقارنة القائمة على الاحتمال، إذا كانت الحالتين ρ و ξ مختلفتين، فإن توزيع الاحتمال المرصود ينتمي إلى PE \ PE+. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

عامل الكثافة ρ مرتبط بأي حالة كمومية ρ ∈ S(H)، بحيث tr[ρ] = 1 و ρ ≥ 0. هنا، مجموعة كل الحالة S(H) لنظام مرتبط بفضاء هيلبرت H. مقياس القيمة للمؤثر الموجب (POVM) هو قياس للخصائص الإحصائية الكمومية وهو مجموعة من المؤثرات الموجبة E1، . . . ، En ك E (التي تؤثر على H) والهوية I = figure-protocol-4. توزيع figure-protocol-5figure-protocol-6 الاحتمالية يخصص القياس E لكل حالة ρ ρ ∈ S(H) حيث pj = tr[Ejρ]≥ 0 و figure-protocol-7 = 126.

4. مقارنة الحالات الكمومية القائمة على SWAP

يمكن قياس الفرق بين حالتين كموميتين باستخدام إجراء اختبار SWAP في الحوسبة الكمومية. تم تقديم هذه الطريقة لأول مرة بواسطة بارينكو وآخرين.27 وأعيد اكتشافها لاحقا جون واتروس، رونالد دي وولف، هاري بورمان، وريتشارد كليف 28. تم تطبيق اختبار SWAP على الحوسبة الكمومية وتعلم الآلة الكمومي 15، 29.

يأخذ اختبار SWAP حالات إدخال ب ∣ψ〉 و ∣φ〉 ويخرج 1 (متغير عشوائي برنولي) باحتمال 1/2 - 1/2〈φ,ψ〉2 ، والذي يقدر حاصل الضرب الداخلي المربع للحالتين 30.

شرح الدائرة

اعتبر حالتين ∣φ〉 و ∣ψ〉 من النظام، حيث يكون البروتوكول في البداية هو ∣0,φ,ψ〉. بعد تطبيق بوابة هادامارد، تتغير الحالة إلى figure-protocol-8 ∣0,φ,ψ〉 + ∣1,φ,ψ〉. تحول بوابة CSWAP الحالة إلى figure-protocol-9 (0,φ,ψ〉 + ∣1,ψ,φ〉). بعد بوابة هادامارد الثانية، تصبح الحالة 1/2(|0,φ,ψ〉 + ∣1,φ,ψ〉 + |0,ψ,φ〉 - ∣1,ψ,φ〉)= 1/2∣0〉(|φ,ψ〉 + |ψ,φ〉) +  1/2|1〉(|φ,ψ〉 - |ψ,φ〉). يتم بعد ذلك قياس الكيوبت الأول، واحتمالية الحصول على النتيجة 0 هي P(أول كيوبت = 0) = 1/2 (〈φ|〈ψ| + 〈ψ|〈φ|) 1/2 (|φ,ψ〉 + |ψ,φ〉) = 1/2 + 1/2 |〈ψ|φ〉|2. إذا كان ψ و φ متعامدين (|〈ψ|ϕ〉|2 = 0)، إذا احتمال الحصول على 0 هو 1/2. إذا كانت الحالات متطابقة (|〈ψ|ϕ〉|2 = 1) إذا احتمال الحصول على 0 هو 1. 24

figure-protocol-10
الشكل 3: (أ) دائرة بوابة فريدكين ذات الحالة القطبية المقابلة للقطب، (ب) مخطط مخرجات الاحتمال المقاس، (ج) دائرة بوابة فريدكين مع بوابة هادامارد، (د) خرج الاحتمالات القياسي للرسم البياني المقاس. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

استخدمت الدائرة كيوبت مساعد واحد مع سجلين يشفران الحالات الكمومية ∣ψ〉 و ∣φ〉. تم تهيئة جميع الكيوبتات قبل بدء مرحلة الترميز. ثم تم ترميز ميزات التعبير الجيني في السجلات المعنية باستخدام إجراء تعيين الميزات. تم تطبيق بوابة هادامارد على كيوبت التابع لإنشاء تراكب وضعي، وبعدها تم إجراء عملية SWAP محكومة بين سجلي الحالة مع وجود الأنسيلا كعنصر تحكم. تم تطبيق بوابة هادامارد ثانية على الأنسيلا لإكمال نمط التداخل، وتم قياس كيوبت الأنسيلا لاحقا. عندما كانت الحالتان المشفرتان متطابقتين، تنتج الأنسيلا النتيجة 0 باستمرار. عندما كانت الحالات متعامدة، تعطي الأنسيلا النتيجة باحتمال 0.5. بالنسبة للحالات المتشابهة جزئيا، يكون احتمال الحصول على 0 بين 0.5 و1، مما يعكس درجة التشابه بين الحالات.

5. تقدير المسافة الكمومية

في تحليل البيانات الكلاسيكي، يمكن حساب المسافات بين نقاط البيانات مباشرة باستخدام مقاييس مثل مسافة الإقليدية أو مانهاتن 2,3. في حالة الكيوبتات على الحاسوب الكمومي، تكون هذه المهمة أكثر تعقيدا بسبب الطبيعة الاحتمالية للحالات الكمومية. بينما يمكن قياس فروق الطور وسعات الاحتمالية، لا يمكن تمثيلها مباشرة كمسافات بين متجهين 24 و26.

للتجميع، من الضروري تقييم المواقع النسبية لنقاط البيانات بالنسبة إلى مراكز العنقود13. لتعيين كل كيوبت للمجموعة المناسبة، يجب تعريف معلمة تعمل كمؤشر على القرب من مركز العنقود المقابل.

لتحقيق ذلك، يتم إدخال معامل يرتبط إيجابيا بالتشابه، مما يعمل كبديل لمقاييس المسافة التقليدية 15,30.

بدأت عملية تقدير المسافة بحالة كمومية مطبعة ∣Ψ〉 وكيوبت مساعد مبدأ بالصفر ∣q0〉. كان الهدف تقدير المسافة بين نقطة البيانات الجديدة المشفرة ب ∣q1〉 ومركز التجمع المشفر في ∣q2〉. لتحضير التراكب المطلوب لنمط التداخل، تم تطبيق بوابة هادامارد على كيوبت المساعد، مما أنتج الحالة figure-protocol-11 ( ∣0〉 + ∣1〉 ) ⊗ ∣Ψ〉 ). ثم تم تطبيق بوابة SWAP محكومة (فريدكين) مع الأنسيلا كضابط، مما أدى إلى تشابك الأنسيلا مع الحالتين المشفرتين ومكن تداخلهما من التأثير على نتيجة القياس. أنتجت هذه العملية الحالة figure-protocol-12( ∣0〉 ⊗ ∣Ψ〉 + ∣1〉 ⊗F swap(∣Ψ〉))، والتي يمكن منها استخراج المسافة القائمة على الضرب الداخلي من خلال قياس لاحق للضبط.

تنفيذ الدائرة والإخراج

تقوم هذه الدائرة الكمومية بترميز بيانات التعبير الجيني إلى كيوبتات باستخدام ترميز الطور، ثم تقارن حالتين لتعبير الجين عبر بوابة التبديل المتحكم به (CSwap)، المعروفة أيضا باسم اختبار التبديل12.

لإنشاء التراكب المطلوب، تطبق بوابات هادامارد على جميع الكيوبتات(q 0 إلىq 4)، مما ينتج تراكب متساو لجميع حالات الأساس |Ψ〉 = figure-protocol-13، وهذا التهيئة يتيح حسابا متوازيا على عدة قيم تعبير جينية. يخضع كل كيوبت بعد ذلك لدوران طور، figure-protocol-14حيث θx يتوافق مع قيمة التعبير الجيني المترجمة. المشغلات الوحدوية U(θ,π,π) المطبقة على الكيوبتات q1-q 4 ترمز مستويات التعبير للجينات الفردية، حيث تمثل كل زاوية θ نسخة محولة من تعبير الجين. تقوم هذه العملية بتحويل البيانات البيولوجية الكلاسيكية إلى حالات كمومية من خلال ترميز الطور، مما يسمح بتمثيل عدة جينات في فضاء كمومي عالي الأبعاد6.

تستخدم بوابات CSwap بعد ذلك لمقارنة الحالات المشفرة عن طريق تشابكها. الكيوبت المساعد q0 يعمل كضابط، ويحدد ما إذا كانت حالات q1-q 4 قد تم تبديلها. تولد الحالات الكمومية المشابهة تداخلا بناءا في q0، مما يؤدي إلى احتمال أعلى لقياس ∣0〉. وعلى العكس، تزيد الحالات المختلفة من احتمال قياس ∣1〉. بوابة هادامارد لاحقة على q0 تضمن تداخل السعة، مما يمكن استخراج معلومات التشابه من خلال القياس.

افترض أن حالتين كموميتين ∣ψ〉 و ∣φ〉 تمثلان مجموعات بيانات تعبير جيني مميزة، |ψ〉 = ∑iai |i〉, |φ〉 = ∑ibi |أنا〉 .

اختبار التبديل يقيم الدقة (الحاصل الداخلي) بينهما:

P (0) = figure-protocol-15،

حيث يدل ∣〈ψ∣φ〉∣ إلى حاصل الضرب الداخلي. إذا كان P(0) ≈ 1، فإن الحالات متشابهة؛ إذا كان P(0) ≈ 0.5 أو أقل، فهما مختلفان.

يتيح هذا الإطار مقارنة مجموعات البيانات بين المرضى أو الحالات التجريبية (مثل الأنسجة الطبيعية مقابل النسيج المريض). يوفر أساسا فعالا لتجميع البيانات عالية الأبعاد ضمن نماذج التعلم الآلي الكمومي. يدعم اختبار التبادل تحديد أوجه التشابه بين الحالات الكمومية، والتي يمكن استخدامها لتجميع العينات في عناقيد ذات معنى4.

figure-protocol-16
الشكل 4: دائرة قياس المسافة بين نقاط البيانات والمراكز المركزية. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

figure-protocol-17
الشكل 5: مخطط مخرجات الاحتمالات المقاس. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

تم ترميز نقطة بيانات أولا إلى الحالة الكمومية ∣ψ〉، وتم ترميز مركز العنقود المقابل إلى الحالة ∣φ〉. ثم تم تنفيذ إجراء اختبار التبديل الموصوف سابقا لمقارنة هاتين الحالتين، وتم تسجيل احتمال قياس المؤشر P(0). تم الحصول على الدقة بين الحالات على النحو التالي F=∣〈ψ∣φ〉∣2، وتم تعريف المسافة الكمومية ك D (ψ,φ) = figure-protocol-18. أشارت قيمة أقل ل D إلى أن نقطة البيانات أقرب إلى مركز الوسط في فضاء الميزات الكمومية.

6. اختيار مركز المركز الأولي

يعد تهيئة مراكز المجموعات أمرا بالغ الأهمية لاستقرار ودقة تجميع K-Means. قد ينتج الانتقاء العشوائي مراكز مركزية غير موزعة بشكل جيد، مما يؤدي إلى تقارب بطيء ونتائج غير مثالية. لمعالجة هذه المشكلة، يتم استخدام طريقة المسافة النسبية الاحتمالية المستوحاة من استراتيجية K-Means++20 . في النهج المعزز بالكم، يتم تقييم المسافات باستخدام مقدر المسافة الكمومية بناء على اختبار SWAP، لضمان أن المركزيات المختارة تمثل توزيع البيانات الأساسي بشكل أفضل. تعزز هذه الاستراتيجية فصل المجموعات وتحسن المتانة الخوارزمية، خاصة في مجموعات البيانات عالية الأبعاد.

بدأت عملية تهيئة مركز المركز باختيار نقطة بيانات عشوائية لتكون أول مركز مركزي. ثم تم حساب المسافة الكمومية بين هذا المركز المركزي وكل نقطة بيانات متبقية باستخدام إجراء تقدير المسافة الكمومية. استنادا إلى هذه القيم المسافية، تم إنشاء توزيع احتمالي حيث تم تخصيص احتمال اختيار لكل نقطة يتناسب مع تربيع المسافة المربعة من أقرب مركز مركزي. تم أخذ عينات من مراكز مركزية جديدة وفقا لهذا التوزيع، وتم تكرار العملية حتى يتم الحصول على العدد المطلوب من مراكز K المطلوبة. أنتج هذا النهج مجموعة مركزية أولية بفصل أفضل بكثير من الانتقاء العشوائي.

7. حساب التباين الكمومي

يحدد تباين العنقود كمية انضغاص نقاط البيانات حول مركزها، مما يجعله مقياسا حاسما لتقييم جودة التجميع. في المتوسطات الكلاسيكية K، يحسب التباين كمتوسط مربع المسافة بين نقاط البيانات والمركزيات المخصصة لها. في النهج المعزز بالكم، يتم الحصول على هذه المسافات باستخدام مقدر المسافة الكمومية (عبر اختبار SWAP)، الذي يحسب التشابهات القائمة على الدقة بين الحالات الكمومية. من خلال جمع المسافات المربعة داخل كل عنقود وتطبيع حجم العنقود، نحصل على قيمة تباين تعكس درجة التماسك داخل العنقود. تقليل هذا التباين يضمن تجمعات أكثر إحكاما وتأثيرا، وهو أمر مهم بشكل خاص في مجموعات بيانات التعبير الجيني عالية الأبعاد لتمييز العينات السرطانية وغير السرطانية.

تم تنفيذ تعيين المجموعات عن طريق تعيين كل نقطة بيانات كمومية مشفرة إلى أقرب مركز مركزي باستخدام تقدير المسافة الكمومية. لكل عنقود Ck، تم حساب المسافة الكمومية Di,Ck) بين كل نقطة بيانات ومركزها. ثم تم حساب التباين داخل العنقود باستخدام figure-protocol-19 ، الذي يقيس انضغاط كل عنقود. تم الحصول على التباين الكلي من خلال جمع التباين الفردي عبر جميع التجمعات. تم تسجيل هذه القيمة الكلية للتباين لتحديد العدد الأمثل للعناقيد ولتقييم الأداء العام للتجمعات.

8. تحسين قائم على التدرج الكمومي

تحديد العدد الأمثل للعناقيد (K) هو تحد أساسي في مهام التجميع. تتطلب المتوسطات التقليدية K أن تكون K محددة مسبقا، مما يؤدي غالبا إلى التجميع الناقص أو المفرط. في نهجنا المعزز بالكم، ندمج التحسين القائم على التدرج الكمومي (QGBO) لتحديد عدد التجمعات الأمثل بشكل تكيفي. تزيد الخوارزمية K بشكل تكراري، وتعيد حساب التباين في كل خطوة، وتقيم تقليل التباين (ΔV). عندما تنخفض التحسينات في التباين إلى ما دون عتبة، يتم إنهاء التجميع. يتم حساب التدرج الكمومي باستخدام قاعدة إزاحة المعاملات، التي تقدر مشتقات القيم المتوقعة من الدوائر الكمومية. يضمن هذا النهج أن يوازن العدد النهائي من التجمعات بين الدقة والكفاءة، مما يجعله مفيدا بشكل خاص في تطبيقات المعلوماتية الحيوية حيث لا يعرف العدد الحقيقي للأنواع الفرعية البيولوجية مسبقا.

بدأت عملية التجميع ب K=1، وتم حساب التباين الكلي V(K) باستخدام إجراء حساب التباين الكمومي. ثم زاد عدد العناقيد إلى K+1، وأعيد حساب التباين V(K+1). تم تقييم تقليل التباين، ΔV=V(K)−V(K+1)، لتحديد ما إذا كانت المجموعات الإضافية ستستمر في تحسين انضغاط البيانات. توقفت التكرار عندما انخفض ΔV إلى ما دون العتبة المحددة مسبقا، مما يشير إلى أن الزيادات الإضافية في K لم تحقق تحسينات ذات معنى. تم بناء دائرة كمومية معلمية مع بوابات تغيرية لمراقبة تغيرات الانحناء في اتجاه التباين، وكانت هذه المعلومات توجه عملية تحسين العنقود. تم اختيار العدد الأمثل للعناقيد كقيمة K التي استقر عندها تقليل التباين، مما أدى إلى مجموعات مضغوطة ومنفصلة جيدا.

9. حساب تباين المجموعات والتخزين فيقائمة V

بمجرد تكوين المجموعات المستقرة، تحسب الخوارزمية تباين العنقود لقياس انضغاط كل عنقود. يتم تحديد التباين Vkj لمجموعة معينة باستخدام المسافات بين كل نقطة بيانات في العنقود ومركز العنقود:

figure-protocol-20

حيث: x يمثل عينة تعبير جينية، Ci يمثل عنقودا، Cci هو مركز العنقود Ci، Vkj يمثل التباين المسجل للتكرار j مع k عناقود.

يتم تخزين هذا التباين في قائمة من القائمة V، والتي ستستخدم لاحقا لتحديد العدد الأمثل للعناصر.

10. تحديد العدد الأمثل للعناقيد

لإيجاد العدد الأمثل للعناقيد K، تقوم الخوارزمية بعدة تكرارات، مع ملاحظة شروط بداية مختلفة. تشمل الخطوات الرئيسية:

حددت الخوارزمية أولا قيمة التباين الأدنى من قائمة التباينات المحسوبة لقيم مختلفة من K. ثم تم قياس تقليل التباين بين عد العناقيد المتتالية باستخدام التعبير ΔV=∣Vk−Vk−1، حيث Vk يرمز إلى التباين ل K عناقيد وVk−1 يمثل التباين لمجموعات K−1 . إذا انخفض التقليل ΔV إلى ما دون العتبة المحددة مسبقا، مما يشير إلى تحسن طفيف في التجميع، يتم إنهاء الإجراء. وإلا، كان عدد العناقيد يتزايد، ويتكرر الحساب حتى يتم الوصول إلى العدد الأمثل للعناصر.

11. الانتهاء من المجموعات لتصنيف السرطان وغير السرطاني

بمجرد تحديد العدد الأمثل للعناقيد K ، تمثل المجموعة النهائية مجموعات مميزة ضمن بيانات التعبير الجيني. عادة، ينتج عن الخوارزمية مجموعتين رئيسيتين:

تجمع واحد يمثل الخلايا السرطانية (يتميز بتوقيعات تعبير جينية مميزة مرتبطة بالسرطان).

تجمع واحد يمثل خلايا غير سرطانية (تحتوي على ملفات تعبير جينية طبيعية).

المعلمات والمتغيرات والثوابت المستخدمة في خوارزمية التجميع الكمومي المقترحة ل-K-Means مدرجة في الجدول 1. حدد أبعاد مجموعة البيانات، وحدد عدد العناقيد K، وطبق معايير التوقف وعتبات التحسين لتوجيه العملية. قم بضبط الإعدادات الحسابية مثل عدد التسديدات في كل جولة وتوزيع البذور العشوائي لضمان قابلية التكرار. قم بتهيئة المراكز المركزية باستخدام طريقة اختيار قائمة على الاحتمالات وتحديثها بشكل تكراري حتى التقارب. يحدد الجدول أيضا المخرجات المتوقعة، بما في ذلك تسميات العنقود، والمراكز المركزية، وK الأمثل، ومقاييس التقييم، ومخططات التصور.

الفئةالمعلمةالقيمة / الافتراضيملاحظات
مجموعة البياناتمجموعة بيانات سرطان الثدي569 عينة × 32 ميزة (تم تقليلها إلى مكونين PCA)تقليل الأبعاد باستخدام PCA
عدد العناقيدKديناميكي، في البداية 1، حتى 5تم تحسينها باستخدام تقليل التباين
أقصى مجموعاتكي ماكس5الحد الأعلى للبحث
عدد الضربات لكل جولةN1024القياسات لكل تنفيذ دائرة
تحمل التوقفε1 × 10^-14معيار تقارب التباين
عتبة ميل التباينΔV9.9 × 10^-4عتبة التوقف من أجل التحسين
ملاحظاتموبسرف3التشغيلات المستقلة لكل حجم عنقود
حد التكرار10أقصى خطوة لتحديث المركز المركزي لكل جولة
البذرة العشوائية42يضمن قابلية التكرار
النتائج المتوقعةتسميات العنقود، المراكز المركزية، K الأمثل، مقاييس التقييم، الرسوم البيانيةتم تصديرها كملفات .csv و.png
الاختلافات بين المجموعاتالشريطفارغيكتشف K الأمثل
السنترويد جسي جييتم تهيئة بواسطة الدالة (بناء على احتمالات تتناسب مع تربيع المسافات بين النقاط)تم تحديثها بشكل تكراري وتخزين السنترويدات النهائية

الجدول 1: المواد، البرمجيات، وإعدادات قابلية التكرار

الخطوةالدالة / واجهة برمجة التطبيقات (من كودك)الحدثالنتيجة المتوقعة
ترميز الميزاتqc.u(ثيتا، باي، باي، كيوبت)ترميز الميزة الكلاسيكية المطبعة في دوران الكيوبتحالة الكيوبت
اختبار SWAP / المسافة الكموميةget_Distance(x, y) باستخدام qc.cswap()بناء دائرة 3 كيوبت (ancilla + حالتان)مطابقة → P(0) ≈ 1.0؛ → عمودي P(0) ≈ 0.5
تنفيذ الدائرةسامبلر V2 مع AerSimulator (1024 طلقة)تشغيل الدائرة على المحاكي مع التحويل (المستوى 1 الاختياري)توزيع الاحتمالات لكيوبت المساعد
تهيئة المركز المركزيinitialize_centroids_kmeans_pp(نقاط، k)اختر الجنود المركزية الابتدائية التي تتناسب مع المسافةمراكز بداية متنوعة
إعادة تعيين العنقودfind_nearest_neighbour(نقاط، مركزات)تعيين نقاط لأقرب مركز مركزيعضويات المجموعات المستقرة
حساب التباينcalculate_variance(الوسط، centers_distance)حساب تباين داخل العنقوديقلل التباين من كل تكرار
ميل التباينgrad_slope(ك، V_k، ك-1، V_k-1)قارن ΔV مع ε = 1e-14 وعتبة الميل ΔV ≤ 0.000099تم اكتشاف K الأمثل
التصورmatplotlib.pyplot، plot_histogramرسم التوزيع والنتائج الكموميةمخططات التشتت في تحليل التخمير، مخططات التباين، المخططات التكرارية
الحساب المتريsilhouette_score، calinski_harabasz_score، davies_bouldin_scoreتقييم جودة التجميعالظل ≈ 0.64، المعدل ≈ 766، ≈ التوازن 0.65

الجدول 2: تفاصيل التنفيذ القابلة للتشغيل للخوارزمية المقترحة.

التنفيذ والخوارزميات

خوارزمية المتوسطات الكمومية K مع تحديد العناقيد الأمثل هي طريقة تجميع معززة بالكموم تحدد ديناميكيا العدد الأمثل من العناقيد مع استخدام رسم الخرائط الكمومية19 تبدأ العملية باعتبار جميع نقاط البيانات تنتمي إلى عنقود واحد. ثم يزداد عدد العناقيد K تدريجيا. يتم تهيئة مراكز التجمع احتمالية حسب المسافات بين النقاط، وبعد ذلك يتم تعيين كل نقطة بيانات لأقرب مركز مركزي لها، مكونة K عناقود. يتم حساب تباين العنقود لاحقا، ويتم تحديث المراكز المركزية. يتم تكرار عملية إعادة التعيين هذه بشكل تكراري حتى لا تحدث تغييرات أخرى.

تقوم الخوارزمية بتقييم التباين عبر عدة تكرارات، وتخزن قيم التباين المقابلة لعدد مجموعات مختلفة. يتم تحديد القيمة المثلى ل K عن طريق تقليل التباين مع مراقبة تقليل التباين ΔV. إذا أصبح ΔV صغيرا بشكل ضئيل، تنتهي الإجراء؛ وإلا، يتم زيادة K وإعادة بدء عملية التجميع. تضمن هذه الاستراتيجية التكيفية تقسيما فعالا ودقيقا للبيانات، خاصة في فضاءات الميزات عالية الأبعاد.

figure-protocol-21
الشكل 6: مخطط تدفق لإجراء التجميع الهجين الكمومي K-Means المقترح، يوضح رسم الخرائط الكمومية، وتهيئة المركز، وتعيين التجمع التكراري، وحساب التباين الكمومي، وفحص التقارب القائم على التباين، والاختيار بمساعدة التدرج الكمومي للعدد الأمثل من العناصر. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

توضح الخطوات التالية خوارزمية الميثال الكمومية K لتجميع بيانات تعبير الجينات من السرطان وغير السرطان.

الخوارزمية: تجميع بيانات تعبير الجينات للخلايا السرطانية وغير السرطانية باستخدام خوارزمية المتوسطات الكمومية

الخطوة 1: رسم الخرائط الكمومية للميزات (ترميز متعدد الميزات).
الخطوة 2: بافتراض أن جميع نقاط البيانات في البداية تنتمي إلى نفس العنقود، لذا اضبط قيمة K=1 (حيث K: هو عدد العناقيد المثلى، V: هو تباين العنقود، وΔV: تقليل التباين).
الخطوة 3: تهيئة المراكز (اختيار نقاط المركز الأولية باستخدام نسبة الاحتمالات للمسافات بين نقاط البيانات).
الخطوة 4: قم بتعيين كل نقطة بيانات لأقرب مركز مركزي لها، والتي ستشكل مجموعات 'K' المحددة مسبقا.
الخطوة 5: احسب تباين العنقود وضع مركز جديد لكل عنقود.
الخطوة 6: كرر الخطوة الرابعة، أي إعادة تعيين كل نقطة بيانات إلى أقرب مركز مركزي جديد لكل عنقود.
الخطوة 7: إذا حدث أي إعادة تعيين، اذهب إلى الخطوة 5 وإلا انتقل إلى الخطوة 8.
الخطوة 8: الآن حصلنا على العنقود Cj ('التكرار j مع 'k' عدد من العناقيد) ونحسب التباين Vkj= figure-protocol-22 ، حيث 'x': نقطة البيانات تنتمي إلى العنقود Ci، وCci: مركز العنقود في العنقود Ci. احتفظ بسجل التباين Vkj في قائمة V وابدأ من جديد التجميع مع مراكز جديدة من الخطوة 3 (عدد قليل من المرات، أي 'j' مرة، حيث 1 ≤ j ≤ Mobsrv) بنفس 'K'.
الخطوة 9: ابحث عن الحد الأدنى للتباين Vمن قائمة V مع 'K' عدد من التجمعات.
الخطوة 10: احسب ΔV (ΔV = |Vk - Vk-1حيث Vk: هو التباين مع 'K' عدد من العناقيد وVk-1: هو التباين مع 'K-1' بدون عناقيد بالكامل)، إذا كان ΔV محسنا بناء على التدرج الكمومي (تقليل كبير) فإن FINISH إذا زاد K (K=K+1) وبدأ الخطوة 3 مع 'K' الجديد.
الخطوة 11: العناقيد جاهزة والعدد الأمثل للمجموعات هو 'K'.

خوارزمية رسم الخرائط للميزات الكمومية

خوارزمية 1: رسم خرائط الميزات الكمومية

المدخلات: P تشير إلى كل حالة من الحالات الكمومية |ψ〉 و |Φ〉
المخرج: تقدير ل | 〈 ψ | Φ〉 |2
خطوات الخوارزمية:
الخطوة 1: نأخذ كيوبت ونهيئه على الصفر؛ طبق بوابة هادامارد وقم بتدويرها من أساس Z إلى محور X.
Step 2: نحدد φ (0 ≤ φ ≤ π ) بالراديان وفقا لقيمة نقطة البيانات بالنسبة للميزة 1.
φ = 2*rad(cos-1)(d0))، حيث d0 تمثل قيم بيانات الميزة 1 و d0 ∈ [0, 1].
الخطوة 3: نحدد θ (0 ≤ θ ≤ π ) بالراديان وفقا لقيمة نقطة البيانات بالنسبة للميزة 2.
θ = 2 * rad(cos-1(d1))، حيث d1 تمثل قيم بيانات الميزة 2 وd1 ∈ [0, 1].
الخطوة 4: نستخدم بوابة U3 الكمومية لتنفيذ الدورانات التي تقوم بترميز ميزات نقاط البيانات.
figure-protocol-23
هذا يدور كيوبت Φ من حيث الراديان بالنسبة للمحور الموجب x وθ بالنسبة لراديان θ لمحور z الموجب.

مقارنة خوارزمية الحالات الكمومية

الخوارزمية 2: مقارنة الحالات الكمومية

المدخلات: كيوبت |q 1〉 و |q2〉 كل من الحالات الكمومية |ψ〉 و |Φ〉
المخرج: تقدير ل | 〈ψ|Φ〉 |2
خطوات الخوارزمية:
الخطوة 1: اعتبار الكيوبت A كأداة وتهيئتها حسب الحالة |0
الخطوة 2: تطبيق بوابة هادامارد على الكيوبت A
الخطوة 3: تطبيق CSWAP على الكيوبت |q1 〉 و |q2 〉 (على الحالة|ψو |Φ〉)، حيث يكون A كيوبت التحكم
الخطوة 4: تطبيق بوابة هادامار على الكيوبت A
الخطوة 5: قم بقياس A على أساس Z وسجل نتيجة القياس ك M
العودة M كتقديرنا ل
| 〈 ψ|Φ 〉 |2

خوارزمية تقدير المسافة الكمومية ل k-means-التجميع

الخوارزمية 3: مقدر المسافة الكمومية واختيار مركز عنقود جديد

المدخلات: P رقم نقاط البيانات وK لا من مراكز العنقود، كل من الحالات الكمومية |ψ〉 و |Φ
المخرج: مركز مركزي جديد مرتبط بنقاط البيانات
خطوات الخوارزمية:
ل i في القيم التي تتراوح من 1 إلى P:
اختر نقطة البيانات وسجلها على |qi

ل j في النطاق من 1 إلى K:
اختر jth مركز مركزي متجمع وضبطه على |q j

قارن بين الحالات الكمومية |qi و |qj أيi الكيوبتمع j مركز الوسط وتسجيل القياس ب M ك (Mi, j)
نهاية ل
ابحث عن الحد الأدنى للمسافة (Mmin ,min) من M والمجموعة الأدنى هي المركزي الجديد ل |qi
وسجلها ك Ci
نهاية ل
العودة C كقائمتنا الجديدة للمركز المركزي

M = قائمة جميع المسافة المركزية المتجمعة من |qi ith كيوبت
C = قائمة جميع المركزيات الدقيقة المتجمعة ذات المسافة الدنيا المحسوبة حديثا Ci ل |qi 〉; ∀(i∈{1,...,P})

خوارزمية اختيار المركزية الأولية

الخوارزمية 4: حساب نقاط المركزية الأولية باستخدام نسبة الاحتمالية للمسافات بين نقاط البيانات

المدخلات: m عدد نقاط البيانات (X1, X2,...,Xm)، كل من الحالات الكمومية |ψ〉 و |Φ
المخرج: إرجاع مجموعة S مع K مركزات ابتدائية
خطوات الخوارزمية:
الخطوة 1: اختر نقطة X عشوائيا من نقاط البيانات Xi (1 ≤ im) وأضفها إلى المجموعة S
الخطوة 2: لكل Xi، احسب المسافة بين Xi باستخدام مقدر المسافة الكمومي وأقرب نقطة مركزية في S وحدد المسافة كD dist(Xi)
الخطوة 3: اختر رقما Y بشكل موحد بين 0 وD dist(X1)2 + Ddist (X2)2 + ...+D dist (Xm)2
الخطوة 4: ابحث عن عدد صحيح فريد i بحيث
D dist (X1)2 +D dist (X2)2 + ...+D dist (Xi)2 >= Y >D dist (X1)2 + Ddist (X2)2 + ...+D dist (Xi-1)2
الخطوة 5: أضف Xi إلى S
الخطوة 6: حتى يتم العثور على مراكز K (مركزات)، كرر الخطوات 2 – 4

العودة S كنقطة مركزية أولية

خوارزمية حساب التباين الكمومي

الخوارزمية 5: حساب التباين الكمومي

المدخلات: P رقم من نقاط البيانات، كل حالة من الحالات الكمومية | ψ〉 و |Φ
المخرج: إرجاع تباين نقاط البيانات
خطوات الخوارزمية:
التباين الكامل 0
ل i في الفئة التي تتراوح من 1 إلى K:
اختر مركز التجمع وضبطه على |qi

totalVariancei 0, M 0
لكل من ∈
P، مرتبط بمركز العنقود i:
اختر jنقطة البيانات وضبطها على |q j

قارن بين الحالات الكمومية |qi و |qj أيأن المركز المركزيمع نقطة البيانات j وتسجيل القياس في Mj
م
M + Mj
نهاية ل
التباينالكامل i
figure-protocol-24 [Ci هو المجموعةi ؛i | هي لا توجد نقاط بيانات في المجموعة وDk هي نقطة البيانات ∈ Ci و Mk
هي المسافة بين مركز Ci إلى Dk]
التباين الكامل totalVariance + totalVariancei
نهاية ل
التباين الكامل للعودة

خوارزمية التحسين القائمة على التدرج الكمومي (الحصول على عدد مثالي من التجمعات)

تحدد خطوة التحسين القائمة على التدرج الكمومي العدد الأمثل للعناقيد من خلال مراقبة كيفية تغير تباين التدرجات داخل العنقود مع زيادة K. احسب التباين للقيم المتتالية ل K وقيم التغير بينها. عندما ينخفض الانخفاض في التباين إلى ما دون العتبة المحددة مسبقا، لا تحسن التجمع الإضافي الاندماج، ويتم اختيار K المقابل كالأمثل. يضمن هذا المعيار القائم على الانحناء أن يتوقف التجميع عند النقطة التي يتم فيها التقاط البنية الطبيعية في البيانات دون تقسيم مفرط.

الخوارزمية 6: تحسين التدرج الكمومي

المدخلات:
دائرة كمومية معلمية QC(θ) مع بوابة دوران كيوبت واحدة RY(θ).
الملاحظة figure-protocol-25 الكمومية = Z (القيمة المتوقعة لباولي-زد).
نطاق من قيم المعلمات θ.
المخرج: المشتقة الثانية f′′(θ) لقيمة التوقع 〈Z〉 بالنسبة ل θ.
خطوات الخوارزمية:
الخطوة 1: تهيئة دائرة كمومية أحادية الكيوبت QC(θ) ب:
بوابة دوران معلمية RY(θ).
القياس في الأساس الحاسوبي (Z).
الخطوة 2: عرف الدالة Evaluate_ التوقع(θ) أي f′(θ) = figure-protocol-26
ربط المعامل θ بالدائرة.
نفذ الدائرة على محاكي كمومي مع عدد لقطات .
قس احتمالات النتائج P(0) و P(1).
حساب القيمة المتوقعة:
f(θ)=P(0)−P(1)
الخطوة 3: احسب المشتقة الثانية باستخدام قاعدة إزاحة المعاملات:
اضبط قيمة الإزاحة s = figure-protocol-27
حساب القيم المتوقعة عند النقاط المتغيرة:
f(θ+s)، f(θ)، f(θ−s)
احسب المشتقة الثانية:
f ′′(θ) = figure-protocol-28
الخطوة 4: f ′′(θ) لتحليل سلوك تقليل التباين.

تفاصيل تنفيذ نهج التجميع الكمومي المقترح موضحة في الجدول 2. يحدد الجدول الدوال القابلة للتشغيل وواجهات برمجة التطبيقات المستخدمة في كل مرحلة من مراحل الخوارزمية، بما في ذلك ترميز الميزات في الدوائر الكمومية، تنفيذ اختبار SWAP لتقدير المسافة، تهيئة المركزيات، إعادة تعيين العنقود التكرارية، وتقييم التباين/ΔV. كما تم إدراج معلمات تنفيذ الدوائر، مثل استخدام SamplerV2 مع الخلفية لجهاز AerSimulator عند 1024 طلقة ومستوى تحسين النقل 1. علاوة على ذلك، يوضح الجدول طرق التصور المطبقة لإنشاء مخططات التشتت PCA، ومخططات التباين، والمخططات التكرارية، بالإضافة إلى مقاييس تقييم التجميع (silhouette_score، calinski_harabasz_score، و davies_bouldin_score). من خلال تفصيل دوال وواجهات برمجة تطبيقات محددة على مستوى الأوامر، يضمن الجدول قابلية تكرار جميع الخطوات الحسابية في الخوارزمية المقترحة.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تعتمد المجموعة الجيدة على عدة عوامل مثل المسافة بين المجموعات، وداخل المسافة بين العنقود، ومعيار نسبة التباين، وغيرها. لذا، تم تقييم أداء التجميع باستخدام ثلاثة مؤشرات قياسية: درجة الظل، مؤشر كالينسكي-هاراباس (مؤشر CH)، ومؤشر ديفيز-بولدين (مؤشر DB). تقيس درجة الظل الفصل بين العناقيد كالتالي

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تقترح هذه الدراسة خوارزمية هجينة كمومية K-Means للتجميع مع الكشف الأمثل عن التجمعات، مصممة خصيصا لتصنيف العينات السرطانية وغير السرطانية باستخدام بيانات تعبير جيني عالية الأبعاد. يدمج هذا النهج رسم الخرائط الكمومية متعددة الميزات، وتقدير المسافة الكمومية المعتمدة على اختبار التبديل، والتحسين القائم على التدرج الكمومي لتحديد العدد الأمثل للعناقيد بشكل ديناميكي. على عكس خوارزميات K-Means التقليدية التي تتطلب عددا محددا مسبقا من العناقيد وتكون حساسة لاختيار المركزيات الأولي...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لا يوجد تضارب مصالح لدى المؤلفين.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يقر المؤلفون باستخدام مجموعات بيانات التعبير الجيني مفتوحة الوصول ومحاكيات كمومية جعلت التحقق العملي لهذا العمل ممكنا.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
ماك بوك برو من آبل (شريحة M1)شركة آبل-معالج 8 نواة / 8 ؟ معالج رسوميات نواة، 16؟ ذاكرة GB الموحدة و mdash; يستخدم في المحاكاة المحلية
مجموعة بيانات تعبير جينات سرطان الثديكاجل-مجموعة بيانات تحتوي على 569 عينة، 32 ميزة (تم تقليلها عبر تحليل المكونات في الدراسة)
نظام التشغيل ماك أو إس مونتيريشركة آبل12.6.9بيئة وقت التشغيل المستخدمة على الجهاز المحلي
الرياضيات (مكتبة بايثون القياسية)مؤسسة بايثون للبرمجياتمدمجةالدوال الرياضية الأساسية
ماتبلوتليبمجتمع ماتبلوتليب3.8.4التخطيط والتصوير
NoiseModel، QuantumError، ReadoutError (Qiskit Aer)مشروع IBM / Qiskitجزء من إير 0.13.3يستخدم لمحاكاة الضوضاء الكمومية الواقعية
نومبايمطورو NumPy1.26.4العمليات العددية والتلاعب بالمصفوفة
الباندافريق تطوير البانداز2.2.2معالجة البيانات، الإدخال/الإخراج، العمليات الجدولية
بايثونمؤسسة بايثون للبرمجيات3.10.12لغة برمجة، تستخدم في بيئة Jupyter / IPython
كيسكيت آيرمشروع IBM / Qiskit0.13.3واجهة محاكاة خلفية، مع نمذجة وتنفيذ الضوضاء
Qiskit IBM Runtime – Session، SamplerV2مشروع IBM / Qiskit0.41.1إطار عمل التنفيذ للدوائر في المحاكي
كيسكيت تيرامشروع IBM / Qiskit0.45.0الإطار الكمومي لبناء الدوائر والنقل الكهربائي
سكيكيت-لرنمطورو SCIKIT-Learn1.4.2تحليل PCA، مقاييس التجميع، معالجة البيانات المسبقة

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Mehta, V., Agarwal, M., Kaliyar, R. K. A comprehensive and analytical review of text clustering techniques. Int. J. Data Sci. Anal. 18 (3), 239-258 (2024).
  2. Bezdek, J. C. Pattern recognition with fuzzy objective function algorithms. , Springer Science & Business Media. (2013).
  3. MacQueen, J. Classification and analysis of multivariate observations. 5th Berkeley Symposium on Mathematical Statistics and Probability, , Univ. California. 281-297 (1967).
  4. Ester, M., Kriegel, H. P., Sander, J., Xu, X. A density-based algorithm for discovering clusters in large spatial databases with noise. KDD, 96 (34), 226-231 (1996).
  5. Roy, S., Bhattacharyya, D. K. An approach to find embedded clusters using density based techniques. Distributed Computing and Internet Technology (ICDCIT 2005), , Springer. 523-535 (2005).
  6. Guha, S., Rastogi, R., Shim, K. CURE: An efficient clustering algorithm for large databases. ACM SIGMOD Rec. 27 (2), 73-84 (1998).
  7. Zhang, T., Ramakrishnan, R., Livny, M. BIRCH: An efficient data clustering method for very large databases. ACM SIGMOD Rec. 25 (2), 103-114 (1996).
  8. Agrawal, R., Gehrke, J., Gunopulos, D., Raghavan, P. Automatic subspace clustering of high dimensional data for data mining applications. Proc. 1998 ACM SIGMOD Int. Conf. Management of Data, , 94-105 (1998).
  9. Wang, W., Yang, J., Muntz, R. STING: A statistical information grid approach to spatial data mining. VLDB, 97, 186-195 (1997).
  10. Theodoridis, S., Koutroumbas, K. Pattern recognition. , Elsevier. (2006).
  11. Mitsuda, N., et al. Approximate complex amplitude encoding algorithm and its application to data classification problems. Phys. Rev. A. 109 (5), 052423(2024).
  12. Horn, D., Gottlieb, A. Algorithm for data clustering in pattern recognition problems based on quantum mechanics. Phys. Rev. Lett. 88 (1), 018702(2001).
  13. Von Luxburg, U. A tutorial on spectral clustering. Stat. Comput. 17 (4), 395-416 (2007).
  14. Schölkopf, B., Smola, A., Müller, K. R. Nonlinear component analysis as a kernel eigenvalue problem. Neural Comput. 10 (5), 1299-1319 (1998).
  15. Schuld, M., Sinayskiy, I., Petruccione, F. An introduction to quantum machine learning. Contemp. Phys. 56 (2), 172-185 (2015).
  16. Schuld, M., Killoran, N. Quantum machine learning in feature Hilbert spaces. Phys. Rev. Lett. 122 (4), 040504(2019).
  17. Lloyd, S., Schuld, M., Ijaz, A., Izaac, J., Killoran, N. Quantum embeddings for machine learning. arXiv preprint. arXiv:2001.03622, (2020).
  18. Shao, J., Ahmadi, Z., Kramer, S. Prototype-based learning on concept-drifting data streams. Proc. 20th ACM SIGKDD Int. Conf. Knowledge Discovery and Data Mining, , 412-421 (2014).
  19. Lloyd, S., Mohseni, M., Rebentrost, P. Quantum algorithms for supervised and unsupervised machine learning. arXiv preprint. arXiv:1307.0411, (2013).
  20. Arthur, D., Vassilvitskii, S. K-means++: The advantages of careful seeding. Proc. 18th Annual ACM-SIAM Symp. Discrete Algorithms, , 1027-1035 (2007).
  21. Havlíček, V., et al. Supervised learning with quantum-enhanced feature spaces. Nature. 567 (7747), 209-212 (2019).
  22. Qi, J., Yang, C. H., Chen, S. Y. C., Chen, P. Y. Quantum machine learning: An interplay between quantum computing and machine learning. arXiv preprint. arXiv:2411.09403, (2024).
  23. Kang, M. S., Heo, J., Choi, S. G., Moon, S., Han, S. W. Implementation of SWAP test for two unknown states in photons via cross-Kerr nonlinearities under decoherence effect. Sci. Rep. 9 (1), 6167(2019).
  24. Barnett, S. M., Chefles, A., Jex, I. Comparison of two unknown pure quantum states. Phys. Lett. A. 307 (4), 189-195 (2003).
  25. Andersson, E., Curty, M., Jex, I. Experimentally realizable quantum comparison of coherent states and its applications. Phys. Rev. A. 74 (2), 022304(2006).
  26. Filippov, S. N., Ziman, M. Probability¬based comparison of quantum states. Phys. Rev. A. 85 (6), 062301(2012).
  27. Barenco, A., et al. Stabilization of quantum computations by symmetrization. SIAM J. Comput. 26 (5), 1541-1557 (1997).
  28. Buhrman, H., Cleve, R., Watrous, J., De Wolf, R. Quantum fingerprinting. Phys. Rev. Lett. 87 (16), 167902(2001).
  29. Kang, M. S., Heo, J., Choi, S. G., Moon, S., Han, S. W. Implementation of SWAP test for two unknown states in photons via cross-Kerr nonlinearities under decoherence effect. Sci. Rep. 9 (1), 6167(2019).
  30. De Wolf, R. Quantum computing: Lecture notes. arXiv preprint. arXiv:1907.09415, (2019).
  31. Mashatola, L., Kader, Z., Abdulla, N., Kaur, M. Enhancing the Vietoris-Rips simplicial complex for topological data analysis: Applications in cancer gene expression datasets. Int. J. Data Sci. Anal. , 1-18 (2024).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

K Means

مقالات ذات صلة