Veri kaynağı
Bu çalışma, Physical Net (https://physionet.org/content/mimiciv/3.1/) üzerinde barındırılan halka açık bir kritik bakım veritabanı olan Medical Information Mart for Intensive Care IV (MIMIC-IV, sürüm 3.1) veritabanına dayanan retrospektif bir analizdir. Veritabanı, Massachusetts Teknoloji Enstitüsü Hesaplamalı Fizyoloji Laboratuvarı, Beth Israel Deaconess Tıp Merkezi ve Philips arasında iş birliği ile geliştirilmiştir ve demografik bilgiler, hayati belirtiler, laboratuvar ölçümleri ve ilaç kayıtları dahil olmak üzere kapsamlı kimliği yok edilmiş klinik verileri içerir.
MIMIC-IV'teki tüm hasta verileri Sağlık Sigortası Taşınabilirlik ve Hesap Verebilirlik Yasası (HIPAA) uyarınca tamamen dekimliği altına alınmıştır ve bu nedenle bu çalışma kurumsal inceleme kurulu (IRB) onayı gerektirmemiştir. Veritabanının kullanımı, veri kullanım anlaşması (DUA) ile yönetilir ve erişim yalnızca gerekli eğitim ve sertifikayı tamamlamış yetkili kullanıcılara verilir. Yazarlar gerekli eğitimi tamamlayıp erişim kimlik belgeleri (PhysioNet yetkili kullanıcı) almış ve bu çalışmayı tüm ilgili veri kullanım düzenlemelerine uygun şekilde yürütmüştürler.
Çalışma popülasyonu ve veri çıkarımı
Omurilik nörocerrahisi işlemleri geçiren yetişkin hastalar (≥18 yaş) prosedürle ilgili ICD kodları kullanılarak MIMIC-IV veritabanından tespit edildi. Omurilik beyin cerrahisi işlemleri, 03 ile başlayan ICD-9 kodları (omurilik ve omurilik kanalı operasyonları) ve 00B, 00H, 00J, 00N, 00P, 00Q, 00R, 00S, 00T veya 00U (omurilik ile ilgili işlemler) ile başlayan ICD-10 kodları olarak tanımlandı. Birden fazla hastaneye yatışı olan hastalarda, aynı kişiden tekrar ölçümlerin kaçınılması için yalnızca nitelikli bir prosedür içeren ilk kabul tutuldu.
Sonuç değişkeni osteoporoz, indeks başvurusu sırasında kaydedilen 733 ile başlayan ICD-9 kodları ve M80, M81 veya M82 ile başlayan ICD-10 kodlarına dayanarak tanımlandı. Hem tahmin ediciler hem de sonuçlar aynı hastaneye yatıştan türetildiği için, bu çalışmadaki analitik görev prospektif risk tahmini yerine hastane içi sınıflandırma olarak çerçevelendi.
Toplamda 10.803 hasta dahil etme kriterlerini karşıladı. Katmanlı bölünmeden sonra, veri seti bir eğitim kümesi (n = 7.561), bir doğrulama kümesi (n = 1.621) ve bir test kümesi (n = 1.621) olarak bölündü. Tüm bölümler arasında sınıf dağılımı oldukça dengesizdi. Eğitim setinde 499 hasta (%6,60) osteoporoz pozitif ve 7.062 hasta (%93,40) osteoporoz negatifti. Doğrulama setinde 107 hasta (%6,60) pozitif, 1.514 hasta (%93,40) negatif çıktı. Test seti aynı dağılımı gösterdi; 107 pozitif (%6,60) ve 1.514 negatif (%93,40) vaka vardı.
Klinik veriler, MIMIC-IV'ten ilişkisel veritabanı yönetim yazılımı kullanılarak çıkarıldı. Çıkarılan değişkenler arasında demografik özellikler (örneğin yaş ve cinsiyet), laboratuvar ölçümleri, hayati belirtiler ve ilaç kayıtları yer aldı. Her hasta için, indeks kabulünden elde edilen veriler sonraki özellikler oluşturma için kullanıldı.
Geçerli model değerlendirmesini sağlamak için, veri seti önce stratifikasyonlu örnekleme (%70, %15 ve %15) kullanılarak eğitim, doğrulama ve test setlerine ayrılmıştır.3,7. Öne çıkan önyargı getirebilecek tüm sonraki ön işleme adımları, özellik seçimi ve yeniden örnekleme dahil, yalnızca eğitim seti içinde gerçekleştirildi. Eğitim setindeki sınıf dengesizliği, çoğunluk sınıfının aşağı örneklemesi ve Sentetik Azınlık Aşırı Örnekleme Tekniği (SMOTE) kombinasyonuyla ele alındı; doğrulama ve test setleri ise gerçek dünya yaygınlığını yansıtmak için orijinal sınıf dağılımını korudu.
Özellik mühendisliği
Model performansını artırmak ve yorumlanabilirliği korumak için çok aşamalı bir özellik mühendisliği boru hattı uygulandı. Her hasta için, indeks başvurusundan elde edilen ilaçlar, laboratuvar ve hayati işaret kayıtları özet düzeyinde özelliklere (örneğin, tekrarlayan ölçümler için ortalama değerler ve ilaçlar için ortalama maruziyet) toplandı.
Özellik seyrekliğini azaltmak için, %30'dan fazla eksik değeri olan aday özellik grupları hariç tutuldu. Veri sızıntısını önlemek için bu filtreleme adımı yalnızca eğitim seti kullanılarak gerçekleştirildi ve aynı özellik seti doğrulama ve test setlerine uygulandı.
Daha sonra, osteoporoz pozitif ve osteoporoz negatif hastalar arasındaki dağılımları karşılaştırmak için Mann–Whitney U testi kullanılarak özellik grubu düzeyinde tek değişkenli özellik taraması yapıldı. Özellik grupları istatistiksel anlamlılığa göre sıralandı ve en üst k grupları (k = 20) aşağı akış modelleme için korundu. Bu seçim prosedürü de bilgi sızıntısını önlemek için yalnızca eğitim seti içinde gerçekleştirilmiştir.
Aday özellik grupları arasında nispeten yüksek eksiklik derecesi göz önüne alındığında, bu üst-k seçim adımının birincil rolü, özellik boyutluluğunu kesin optimize etmek yerine zayıf istatistiksel sinyallere sahip özellikleri filtrelemekti. Pratikte, model performansı makul bir aralıkta k'nın tam değerine çok duyarlı değildi; bu adımın esas olarak düşük bilgilendirici özellikleri dışlayan ve klinik olarak ilgili sinyalleri koruyan sağlamlık odaklı bir tarama prosedürü olduğunu düşündürmektedir.
Tüm modellerde temel demografik özellikler korundu. Bu demografik değişkenlerdeki eksik değerler, eğitim setinden hesaplanan ortalama değer kullanılarak hesaplandı. Ortalama ödünleşme, bu büyük veri setinde sadeliği ve istikrarı nedeniyle seçilmiştir, ancak varyansı azaltabilir ve yanlılık yaratabilir; Bu sınırlama kabul edilmektedir.
Seçilmiş ilaç, laboratuvar ve hayati işaret özellikleri için, kaydedilmiş bir ölçüm veya maruziyetin olmaması, model eğitimi için tutarlı sayısal girdi sağlamak amacıyla sıfır olarak kodlandı. Bu yaklaşımın, gerçek sıfır değerlerini, özellikle sıfırın fizyolojik olarak anlamlı olmadığı değişkenler için, eksiklik veya poz vermeme ile karıştırabileceğini kabul ediyoruz. Ancak bu kodlama stratejisi tüm örneklerde tutarlı şekilde uygulanmış ve ardından ölçekle ilgili bozulmayı azaltan Z-puan standartlaştırması uygulanmıştır. Bu varsayımın potansiyel etkisi bir sınırlama olarak tartışılmaktadır.
Tüm sayısal özellikler, eğitim setinden tahmin edilen ortalama ve standart sapmaya dayalı Z-puanı normalizasyonu kullanılarak standartlaştırıldı:
z = (x — μ)/σ
Burada x, ham özellik değerini, μ ve σ ise eğitim kümesinden hesaplanan ortalama ve standart sapmayı gösterir. Kategorik değişkenler, derin öğrenme modellerinin giriş gereksinimlerini karşılamak için sayısal olarak kodlanmıştır.
Bu özellik mühendisliği stratejisi, demografi, böbrek fonksiyonu, hematolojik indeksler, inflamatuar belirteçler ve metabolik parametreler gibi klinik olarak ilgili alanları korurken boyutluluğun sistematik olarak azaltılmasını mümkün kıldı. Çalışmanın eğitim popülasyonunun eğitim, doğrulama ve test setleri boyunca ayrıntılı temel özellikleri Tablo 1'de sunulmaktadır.
| Özellikler | Toplam | Eğitim seti | Doğrulama kümesi | Test seti | P değeri |
| (n=5238) | (n=1996) | (n=1621) | (n=1621) |
| Cinsiyet | | <0.001 |
| Erkek | 2477 (47.29%) | 834 (41.78%) | 797 (49.17%) | 846 (52.19%) | |
| Kadın | 2761 (52.71%) | 1162 (58.22%) | 824 (50.83%) | 775 (47.81%) | |
| Yaş | 60.69 (48.29, 70.61) | 63.45 (52.00, 72.41) | 58.00 (46.00, 69.00) | 60.00 (46.00, 70.00) | <0.001 |
| Boy | 165.23 (160.79, 171.21) | 164.25(161.41, 172.23) | 166.32 (161.85, 171.22) | 165.22 (161.31, 169.89) | <0.001 |
| Ağırlık | 72.01 (56.77, 82.46) | 75.45 (63.22, 81.45) | 70.55 (60.22, 79.33) | 73.62 (65.22, 81.88) | <0.001 |
| Senna | 1.00 (-0.73, 8.60) | 1.00 (-0.30, 8.60) | 1.00 (-1.00, 8.60) | 1.00 (-1.00, 8.60) | <0.001 |
| Docusate Sodyum | 100.00 (100.00, 100.00) | 100.00 (100.00, 100.00) | 100.00 (100.00, 100.00) | 100.00 (100.00, 100.00) | 0.001 |
| Heparin | 5000.00 (1655.28, 5000.00) | 5000.00 (-1.00, 5000.00) | 5000.00 (1600.00, 5000.00) | 5000.00 (3750.00, 5000.00) | 0.292 |
| Sodyum klorür %0,9 Flush | 3.00 (1.76, 3.00) | 3.00 (3.00, 3.00) | 3.00 (-1.00, 3.00) | 3.00 (3.00, 3.00) | <0.001 |
| Kırmızı Kan Hücreleri | 3.96 (3.51, 4.35) | 3.90 (3.49, 4.28) | 4.02 (3.53, 4.40) | 3.97 (3.50, 4.38) | <0.001 |
| Hemoglobin | 11.81 (10.51, 13.02) | 11.66 (10.47, 12.82) | 11.91 (10.58, 13.14) | 11.90 (10.49, 13.15) | <0.001 |
| RDW | 13.98 (13.22, 15.15) | 14.12 (13.35, 15.24) | 13.90 (13.10, 15.06) | 13.90 (13.18, 15.13) | <0.001 |
| Hematokrit | 35.67 (31.95, 39.00) | 35.32 (31.63, 38.50) | 36.00 (32.28, 39.37) | 35.77 (32.01, 39.25) | <0.001 |
| Özgül Ağırlık | 1.01 (1.01, 1.02) | 1.01 (1.01, 1.02) | 1.01 (1.01, 1.02) | 1.01 (1.01, 1.02) | <0.001 |
| Bikarbonat | 25.72 (24.04, 27.15) | 25.86 (24.17, 27.27) | 25.65 (23.92, 27.03) | 25.62 (24.00, 27.12) | <0.001 |
| Nötrofiller | 68.67 (60.52, 76.23) | 69.41 (61.90, 76.52) | 68.10 (59.60, 75.88) | 68.34 (59.75, 76.23) | <0.001 |
| Kreatinin | 0.82 (0.68, 1.02) | 0.81 (0.68, 1.00) | 0.83 (0.69, 1.02) | 0.83 (0.68, 1.03) | <0.001 |
| Fosfat | 3.29 (2.92, 3.64) | 3.27 (2.93, 3.57) | 3.30 (2.93, 3.69) | 3.30 (2.90, 3.65) | 0.002 |
| Urea Azotu | 15.43 (12.08, 20.18) | 15.74 (12.50, 20.20) | 15.00 (11.64, 19.89) | 15.48 (12.00, 20.43) | <0.001 |
| Lenfositler | 19.12 (12.22, 26.15) | 18.81 (12.49, 25.30) | 19.36 (12.40, 27.07) | 19.24 (11.72, 26.27) | 0.001 |
| Alanin Aminotransferaz (ALT) | 20.49 (10.84, 32.82) | 20.47 (11.67, 32.06) | 20.00 (10.00, 32.93) | 21.00 (10.67, 33.67) | 0.3283 |
| MCV | 90.90 (87.50, 94.32) | 91.03 (87.64, 94.51) | 90.64 (87.43, 94.00) | 91.00 (87.40, 94.40) | <0.001 |
| MCHC | 33.14 (32.37, 33.92) | 33.11 (32.37, 33.88) | 33.16 (32.38, 33.97) | 33.16 (32.35, 33.93) | <0.001 |
| Basofiller | 0.42 (0.27, 0.61) | 0.41 (0.27, 0.59) | 0.45 (0.29, 0.63) | 0.41 (0.26, 0.60) | 0.037 |
Tablo 1. Çalışma popülasyonunun temel özellikleri, eğitim, doğrulama ve test setleriyle katmanlandırılmıştır.
Model mimarisi
Heterojen tablo klinik özellikler arasındaki karmaşık ilişkileri modellemek için, PyTorch framework6 kullanılarak uygulanan TabTransformer tabanlı bir mimari kullandık. Model, hem kategorik hem de sayısal değişkenleri işlemek ve özellikler arasındaki bağlamsal etkileşimleri öz-dikkat mekanizması aracılığıyla yakalamak üzere tasarlandı.
Giriş temsili
Kategorik değişkenler ilk olarak yoğun gömmelere dönüştürülmüştür. Her kategorik özellik, boyutu d(embedding_dim = 256) bir göme vektörüne eşlenmiştir. Sayısal özellikler, Z-skor normalizasyonu kullanılarak standartlaştırıldı ve ardından aynı göme alanına doğrusal dönüşüm katmanı aracılığıyla yansıtıldı, böylece kategorik özelliklerle ortak işlem yapılmasını mümkün kıldı.
Gömülü özellik vektörleri, bir token dizisi oluşturmak üzere birleştirildi:
X = [x1,x 2,... xn]
burada her xi ∈ Rd gömülü bir özelliği temsil eder.
Transformatör kodlayıcı
Birleştirilmiş özellik gömmeleri, Transformer kodlayıcı katmanlarından oluşan bir yığın üzerinden geçirildi (num_layers = 3). Her katman, çoklu başlı öz-dikkatle takip edilen konum bazında bir aktarma ağından oluşuyordu.
Çok başlı öz-dikkat mekanizması şöyle tanımlanır:
—> Dikkat(Q,K,V) = softmax
V
Burada Q, K ve V sorgu, anahtar ve değer matrislerini gösterir. Birden fazla dikkat başlığı (num_heads = 8) çeşitli özellik etkileşimlerini yakalamak için kullanıldı.
Her transformatör bloğu, çoklu başlık öz-dikkat, kalıntı bağlantı ve katman normalizasyonu, besleme ağı ve katlama (oran = 0.243) içeriyordu.
Özellik toplanması ve sınıflandırması
Son Transformatör katmanının çıktısı düzleştirildi ve sınıflandırma için çok katmanlı bir perceptron (MLP) üzerinden geçirildi. MLP, doğrusal olmayan aktivasyon fonksiyonlarına sahip bir veya daha fazla tam bağlantılı katmandan oluşuyordu.
Son çıkış katmanı, osteoporoz olasılığını öngören bir sigmoid aktivasyon fonksiyonu kullanarak üretildi:
—>
= σ(z)
Burada z logit çıktısıdır.
Kayıp fonksiyonu ve eğitim stratejisi
Model, ikili çapraz entropi kaybı kullanılarak eğitilmiştir:
—> L = −(1/N) Σ [ yi log(ŷi) + (1 − yi) log(1 − ŷi)]
Burada yi gerçek etiketi ve
i tahmin edilen olasılığı belirtir.
Model, Adam optimizatörü kullanılarak (öğrenme oranı = 1.9e-4, parti büyüklüğü = 64) 100 dönem için optimize edildi. Erken durdurma, doğrulama performansına göre uygulandı (sabır = 15) ve aşırı fitin önlenmesi için. Tekrarlanabilirliği desteklemek için tüm deneysel prosedürler sabit rastgele bir tohum kullanılarak gerçekleştirildi (tohum = 42).
Model yorumlanabilirliği
Yorumlanabilirliği artırmak için, eğitilen modele SHapley Additive açıklamaları (SHAP) uygulanmıştır. SHAP değerleri, her özelliğin tahmin edilen sonuca katkısını niceliklendirmek için test setinde hesaplandı; böylece model davranışının hem küresel hem de bireysel düzeyde yorumlanmasını mümkün kılmıştır.
Şekil 1'de gösterildiği gibi, iş akışı MIMIC-IV veri ön işlemesinden model oluşturma ve sınıflandırmaya kadar süreci özetler. TabTransformer mimarisi, heterojen tablo özellikler arasındaki etkileşimleri öz-dikkat yoluyla yakalarken, SHAP tabanlı görselleştirme özellik katkılarına yorumlanabilir içgörüler sağlar. Bu çerçeve, heterojen bir omurga nörocerrahi kohortunda osteoporozla ilgili kalıpların içsel olarak doğrulanmış analizini mümkün kılar.

Şekil 1. İş akışı ve model mimarisi inceleyin. Bu şekil , kohort seçimi, veri ön işleme, özellik mühendisliği, veri seti bölmesi ve model geliştirme dahil olmak üzere genel çalışma tasarımını göstermektedir. Ayrıca, sınıflandırma için kullanılan TabTransformer mimarisini, özellik gömme, Transformer kodlayıcı katmanları ve nihai sınıflandırma çıktısını özetlemektedir. Hasta başına yalnızca ilk nitelikli kabul kabul edildi. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.