$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Önerilen metodoloji
Önerilen Karşı Dayanıklı Federasyon Öğrenme (AR-FL) modeli, hasta ölüm riskini farklı sağlık kurumları arasında güvenli ve iş birliği içinde tahmin etmeyi, veri gizliliğini korumayı ve sistemi düşman sorunlarına karşı dayanıklı kılmayı amaçlamaktadır. Dağıtım dört ana unsuru içerir: (1) Federe Öğrenme yapısı, (2) minimum maksimum optimizasyona dayalı düşman eğitimi, (3) alan farkında dikkat mekanizması ve (4) gizliliği koruyan parametre toplama. Metodoloji, ölüm riskini tahmin etmek için düşmanca sağlam federasyon öğrenme için sistematik bir akışla yürütülür. Şekil 2'de gösterilen süreç, birçok sağlık kuruluşundan veri toplama ile başlar, ardından özellikleri standartlaştırmak ve eksik değerleri yönetmek için veri ön işleme yapılır. Küresel bir model başlangıçta merkezi bir sunucu tarafından oluşturulur ve ardından her sağlık kurumuna gönderilir. Yerel rakip eğitim, sağlık kurumlarında gerçekleşir; bu da modelin bozulmalara karşı dayanıklılığını artırırken alan özgüslü verilere uyarlanmasına olanak tanır. Eğitimden sonra, yerel modellerin parametreleri güvenli parametre toplama yöntemiyle sunucuya güvenli şekilde iletilir. Sunucu, küresel modeli güncellemek için bu yerel model katkılarını kullanır. Bu süreç, modelin işbirlikçi şekilde geliştirilmesini kolaylaştırmak için yinelemeli bir optimizasyonda birkaç kez tekrarlanır. Sonuç olarak, model tahmin performansını, rakip dayanıklılığını ve kurumlar arasında genellemesini değerlendiren klinik kıyaslamalarla titizlikle değerlendirilir.

Şekil 2: Önerilen AR-FL modeli. Bu şekil, önerilen Karşı Dayanıklı Federasyon Öğrenme modelinin genel mimarisini, düşmanca eğitim, alan farkında dikkat ve gizliliği koruyan güvenli toplama dahil olmak üzere sunmaktadır. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Veri toplama
Bu çalışma için, kamuya açık iki Elektronik Sağlık Kaydı (EHR) veri seti kullanılmıştır: MIMIC-III4 ve eICU İşbirlikçi AraştırmaVeritabanı 6. MIMIC-III, tek bir büyük hastaneden 40.000'den fazla yoğun bakım yatışı sağlarken, eICU verileri ABD'deki çeşitli hastanelerden 200.000'den fazla yoğun bakım bakımını içermektedir. İlgili hasta demografiği, klinik ölçümler, laboratuvar test sonuçları, grafiklenmiş olaylar ve bu veri akışlarında kaydedilen sonuçlar, ölüm riski tahmini görevi için onları oldukça cazip kılar. EHR veri setleri, gerçekçi çok kurumsal federe dayalı bir öğrenme ortamı oluşturmak için farklı parçalara ayrılmıştır; her parça farklı bir hastane veya kurumu temsil eder. Yöntem, hastaların özellikleri, klinik protokolleri, dokümantasyon tarzları ve veri erişilebilirliği açısından kurumlar arasındaki farkları yakalar. Her simüle edilen kurum yalnızca kendi veri alt kümesine erişebilir ve merkezi sunucu veya diğer katılımcı istemcilerle herhangi bir ham kayıt paylaşmaz. Bu yaklaşım, gizlilik koruma ilkelerine tam uyumu garanti ederken aynı zamanda hastaneler arası iş birliğinin gerçek hayat sınırlamalarını simüle eder. Ölüm etiketleri, veri setlerinde belirtilen sonuç alanlarından, örneğin hastane içi ölüm göstergelerinden çıkarılır. Bu etiketler, federasyon öğrenme modeli için tahmin hedefleri olarak görev yapar. Her kurum, ölüm sonuçlarıyla ilgili kendi yerel hasta özellik kayıtlarını tutar ve hassas hasta bilgilerini ortaya çıkarmadan merkeziyetsiz model eğitimini mümkün kılar.
Veri ön işleme
Her kurum, model eğitimi başlamadan önce yerel EHR verilerini bağımsız olarak işliyor. Federe öğrenim, katılımcı kurumlar arasında hasta düzeyinde verilerin veya özet istatistiklerin paylaşılmasına izin vermediğinden, tüm ön işleme adımları her kurumda yerel olarak yapılır ve yalnızca o kurumun veri setindeki bilgilere dayanır. Ön işleme akışı bazı önemli adımlardan oluşur. Başlangıçta, hayati bulgelemeler, laboratuvar test sonuçları ve fizyolojik ölçümler gibi sayısal klinik değişkenler normalleştirilir; böylece değer aralıklarındaki farklar ortadan kaldırılır ve model yakınsamasını stabilize edilir. Her kurumun yerel verileri, normalleştirme için kullanılan istatistikleri hesaplamak için tek kaynaktır. Sonrasında, cinsiyet, kabul türü veya tanısal kategoriler gibi kategorik özellikler, tek bir sıcak kodlama veya kuruma özgü eşlemeler gibi yöntemlerle sayısal temsillere dönüştürülür. Bu nedenle, federasyon modeli, paylaşılan kodlama sözlüklerine veya kurumlar arası referans tablolarına ihtiyaç duymadan kategorik verileri işleyebilir. Üçüncüsü, klinik veri setlerinde yaygın olan eksik veriler yerel emputasyon teknikleriyle işlenir. Özellik türüne ve klinik bağlama bağlı olarak, kurumlar ortalama hesaplama, önceki gözlemlere dayanarak ileriye aktarma veya hatta kural tabanlı klinik değişimler gibi yöntemlere başvurabilir. Her kurum bağımsız olarak emputasyon yaptığı için, harici meta veri veya ortak emputasyon parametreleri gerekmez. Bu prosedürleri takip ederek, her kurum ilgili ölüm sonuçlarıyla birlikte tam bir işlenmiş özellik veri seti oluşturabilir. Yerel veri setleri daha sonra federasyon model eğitimi için girdi olarak kullanılır. Tüm ön işleme süreci boyunca, kurum dışına ham veri, türetilen istatistikler veya ara çıktılar iletilmez ve bu da gizlilik koruyucu veri yönetimi uygulamalarına sıkı bir şekilde bağlılık sağlanır.
Model başlatma
K {1, 2,..., K}, her kurumun yerel bir veri setine sahip olduğu kurumların (müşterilerin) koleksiyonu olsun.
{
burada
giriş EHR özelliklerini temsil eder ve
Associated ölüm etiketi (ikili veya kategorik) olarak belirlenir. Küresel bir model
, tüm istemciler arasında işbirlikle eğitilir ve burada θ paylaşılan model parametreleridir.
Süreç, standart Federated Average (FedAvg) protokolünü takip eder:
Merkezi sunucu, küresel
parametreleri başlatır ve bunları yayınlar. Her istemci k∈K, verilerini kullanarak yerel eğitim yapar ve modeli günceller.
Sunucu, güncellemeleri ağırlıklı ortalamayı alarak birleştirir:

, burada n =
Merkezi sunucu başlatma prosedürü ve yerel eğitim adımları, T küresel iletişim turları için devam eder.
Yerel düşman eğitimi (Min–Max optimizasyonu)
Dayanıklılığı artırmak için, her müşteri kendi yerel sahasında rakip eğitimi uygular. Temiz veri üzerindeki ampirik riski en aza indirmek yerine, müşteriler bir min-max problemi ile uğraşır:
(x+δ),y)
L: Kayıp fonksiyonu
δ: Düşman rahatsızlığı 
S: Düşman tehdit alanı
(x+δ): Bozuk girdi altında tahmin
Her yerel dönemde, Projeksiyonlu Gradient Descent (PGD) veya Hızlı Gradient İşaret Yöntemi (FGSM) kullanılarak karşıt örnekler oluşturulur. Daha sonra, modelin eğitimi bu örneklerle devam ederek dayanıklılığını artırır.
Alan farkında dikkat mekanizması
Farklı kurumlardan alınan Elektronik Sağlık Kayıtları (EHR) verileri, veri dağılımı, özellik anlamanlamı ve klinik uygulamalar açısından büyük farklılıklar gösterebilir. Bu sorunu çözmek için AR-FL modeli, modeline alana özgü bir dikkat modülü içeriyor.
Kurum k'den giriş vektörü böylesin
. Her özellik j∈ {1..., d} için dikkat ağırlıkları
şu şekilde hesaplanır:
=
burada eğitilebilir dikkat ağırlıkları vardır. Girdi şu şekilde yeniden ağırlıklandırılır:

Bu mekanizma sayesinde, model kurumun kullandığı verilerin niteliğine göre klinik uygulama için önemli olan özellikleri vurgulayabilir ve böylece kurumun uyum sağlama ve yorumlanabilirliğini artırır.
Gizlilik koruyucu parametre toplama
AR-FL, iletişim sırasında en yüksek gizlilik seviyesini korumak için gerekirse çok güvenli toplama ve farklılık gizlilik teknikleri kullanır. Güvenli Toplama: Kullanıcılar model güncellemelerini öyle şifreler; sunucu sadece toplamı hesaplayabiliyor, ayrı katkıları hesaplayamıyor.
Diferansiyel Gizlilik: Model güncellemelerine gürültü ekler:

Burada σ gizlilik-doğruluk dengesini kontrol eder.
Dağıtık güncellemeler sırasında, bu yaklaşımlar özel hasta verilerinin veya kurumsal bilgilerin sızdırma riski altında olmamasını sağlar.
Küresel model güncellemesi
Her kurumda yerel eğitim aşaması tamamlandıktan sonra, merkezi sunucu istemci tarafından gönderilen model güncellemelerini toplar. Bu güncellemeler yalnızca model parametrelerindeki değişikliklerden oluşur ve ham hasta verisi veya ara özellik temsili içermez. Çeşitli kurumlardan edinilen bilgileri birleştirmek için sunucu, Federated Average (FedAvg) yöntemini uygular. Bu süreçte, sunucu, her kurumda mevcut veri miktarına göre yerel modellerin ağırlıklı ortalamasını hesaplar. Daha büyük veri setleri sağlayan kurumlar, güncellenmiş küresel model üzerinde orantılı olarak daha fazla etkiye sahiptir. Güncellemeler güvenli toplama teknikleriyle iletildiyinden, sunucu herhangi bir kurumun parametrelerini göremez veya izole edemez. Bunun yerine, sunucu yalnızca şifreli veya gizlilik korumalı birleşik bir temsil alır. Bu, eğitim sürecinin gizliliğini ve tespit edilmiş kuruma özgü kalıpların veya hasta özelliklerinin yok edilmesini garanti eder. Toplu güncelleme hesaplandıktan sonra, sunucu, o iletişim turunda tüm işbirliği yapan kurumlardan elde edilen toplam bilgiyi temsil eden taze bir küresel model hazırlar. Yeni küresel model, yerel rekabet eğitiminin bir sonraki turunun başlaması için her kuruma geri gönderiliyor.
Yinelemeli optimizasyon
Federe öğrenme, birkaç iletişim turunu içeren çok aşamalı bir süreçtir. Her tur, yerel modelin eğitimi, güncellemelerin güvenli şekilde gönderilmesi, küresel toplama ve geliştirilmiş modelin katılımcılara dağıtılmasından oluşur. Tekrarlanan turlar, modelin yavaş yavaş sağlam ve kararlı bir çözüme doğru ilerlemesine yardımcı olur. Bu turlar sırasında, her kuruluş hasta popülasyonuna dair bilgilerini getirir ve böylece farklı ortamlarda klinik kalıpları belirleyebilen bir model oluşturur. Rekabetçi eğitim ve alan farkında dikkat mekanizmasının bazen her turda yerel eğitim yoluyla uygulandığı belirtilmelidir. Bu nedenle, model sürekli olarak geliştirilmekte ve düşman saldırılarla mücadele gücü artmakta, kurumlar arasında farklı özellik dağılımlarına uyum sağlama yeteneği de artmaktadır. Yinelemeli optimizasyon sayesinde, model sadece genelleme performansını iyileştirmekle kalmaz, aynı zamanda veri dengesizliği, kurumsal varyasyon ve düşman ortamlara karşı giderek daha hoşgörülü hale gelir. İşlem, önceden belirlenmiş bir iletişim tur sayısına ulaşılana veya küresel model kararlı yakınsamayı gösterene kadar uygulanır.
Değerlendirme
Tüm iletişim turlarının sonunda, nihai küresel model katılımcıların veri setlerinden türetilen beklenmiş test setleri kullanılarak kapsamlı şekilde değerlendirilir. Bu test setleri model eğitimi için kullanılmadığından, modelin performansının adil ve tarafsız bir ölçüsünü sağlarlar. Model etkinliği, farklı metriklerin çeşitli açılardan hesaplanması yoluyla değerlendirilir. Temiz doğruluk, normal koşulların olduğu durumu değerlendirir. Modelin ölüm sonuçlarını tahmin etmedeki doğruluğunu ölçür. Buna karşılık, karşıt doğruluk modeli, girdi verileri düşmanca değiştirildiğinde bile modelin performansını ne ölçüde koruyabildiğini tahmin eder. Alıcı operasyonel karakteristikli (ROC) eğrisinin (AUC-ROC) altındaki alan, modelin yaşayan ve ölen hastaları ayırt etme becerisine dair içgörü sağlar. F1 puanı, özellikle dengesiz klinik veri setleri için önemli olan hassasiyet-hatırlama ilişkisinin bir göstergesi olarak hizmet eder. Genelleştirme farkı, farklı kurumlar arasındaki performans farkını ortaya koyuyor ve böylece modelin çeşitli veri kaynaklarına uyum sağlama konusundaki çok yönlülüğünü gösteriyor. Gizlilik riski, güvenli toplama ve isteğe bağlı farklılık gizliliğinin hasta gizliliğini korumada etkili olup olmadığını belirleyen simüle edilmiş düşman saldırılarıyla nihayet ölçülür. Tüm bu değerlendirme metrikleri birlikte modelin öngörü gücü, düşman saldırılarına karşı direnci, farklı kurumlar arasında istikrar ve gizlilik koruma gereksinimlerine bağlılığı hakkında kapsamlı bir tablo ortaya çıkarır. Aşağıdaki algoritma 1 (Ek Dosya 1), Ölüm Riski Tahmini için Karşı Güçlü Federe Öğrenme (AR-FL) yöntemini gösterir.