$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Choroba zwyrodnieniowa stawów kolana (KOA) to długotrwała, postępująca choroba stawów, która jest jedną z głównych przyczyn, dla których starsi ludzie na całym świecie stają się niepełnosprawni. Wczesne wykrywanie subtelnych zmian strukturalnych jest kluczowe dla skutecznej interwencji; jednak tradycyjne instrumenty diagnostyczne, takie jak system oceniania Kellgren-Lawrence (KL) oraz indeksy kliniczne jak WOMAC, są ograniczone subiektywnością i zmiennością między obserwatorami1.
Wraz ze wzrostem dostępności dużych repozytoriów obrazowania kolan, takich jak OAI i MOST, na znaczeniu zyskały priorytety podejścia obliczeniowe do obiektywnej oceny KOA2. Wczesne metody analizy radiograficznej oparte na ręcznie wykonanych deskryptorach i klasyfikacji statystycznej wykazały ograniczoną odporność na dane obrazowania o wysokich wymiarach2. Nowsze ramy modelowania oparte na obrazach poprawiły wrażliwość na wczesne stadium KOA, ale nadal napotykają wyzwania w zakresie interpretowalności klinicznej i przejrzystości decyzji.
Analiza oparta na AI pozwala wykryć chorobę zwyrodnieniową stawów kolana wcześnie i bez operacji, co ogranicza potrzebę powtarzania zdjęć rentgenowskich oraz wpływu na środowisko dużych obrazów i diagnostyki papierowej3. Do tej pory modele uczenia maszynowego, takie jak Drzewa Decyzyjne i Losowe Lasy, były w stanie przewidzieć ryzyko dokładności na poziomie WOMAC i KL (Rysunek 1); jednak mają trudności z danymi obrazowymi o wysokiej wymiarowości4. Architektury głębokiego uczenia, zwłaszcza CNN i sieci ResNet, automatyzowały wyodrębnianie cech i osiągały lepszą dokładność, ale były trudne do zrozumienia. Vision Transformers (ViT) przyniosły globalne zrozumienie kontekstu poprzez samouwagę.
Ramy DeciViT-F wspierają zrównoważone praktyki kliniczne, tworząc rozwiązania medyczne, które są dokładne, zrozumiałe i przystępne cenowo. To pomaga osobom z przewlekłymi niepełnosprawnościami i poprawia jakość ich życia, zwłaszcza osób starszych. Jest to wyjaśnialna logika rozmyta bayesowska, która promuje etyczne wykorzystanie AI, zapewniając zaufanie, inkluzywność i przejrzystość w podejmowaniu decyzji klinicznych. Ostatecznie takie podejście doprowadzi do lepszej, sprawiedliwszej i bardziej przyjaznej środowisku przyszłości dla nas wszystkich.
Ramy DeciViT-Knee 2025 zostały niniejszym ustanowione jako hybrydowy, interpretowalny proces rozwiązywania tych problemów. Wykorzystuje ViT-B/16 do głębokiej reprezentacji obrazu 2,4, drzewa decyzyjne Bayesowskie do jasnej i probabilistycznej klasyfikacji oraz warstwę wnioskowania rozmytego5, która zamienia niepewność w język zrozumiały przez użytkowników. Ta trójwarstwowa fuzja zapewnia wysoką dokładność diagnostyczną, silną kalibrację i możliwość interpretacji na poziomie klinicysty.
Przegląd literatury
Żadne wcześniejsze badania nie połączyły całkowicie ekstrakcji cech opartej na ViT-B/16 z bayesowskimi drzewami decyzyjnymi do probabilistycznego rozumowania na danych multimodalnych KOA. Najnowsze badania nad interpretowalnością wykazały, jak logika rozmyta może pomóc połączyć precyzyjne liczby z rozumowaniem opartym na języku. Układy rozmyte umożliwiają częściowe przedstawienia prawdy (np. łagodna utrata chrząstki lub obecność osteofitów na granicy), co odpowiada niepewności często wyrażanej w badaniach radiologicznych. Wykazano, że warstwy wnioskowania rozmytego zmniejszają zmienność między obserwatorami i poprawiają interpretowalność kliniczną, gdy są włączane do głębokich sieci 5,6,7,8,9,10. Nakładanie warstwy Fuzzy-Bayesowskiej na osadzenia ViT tworzy granice decyzyjne, które są zarówno probabilistyczne, jak i lingwistycznie istotne. To zamienia abstrakcyjne aktywacje w zestawy reguł, które ludzie mogą zrozumieć, na przykład: JEŚLI przerzedzenie chrząstki jest umiarkowane A zmienność intensywności kości jest duża, TO TO prawdopodobnie ≥ stopniu KL 2.
DeciViT-Knee 2025 ma na celu zapewnienie wczesnego, wyraźnego i powtarzalnego wykrywania KOA poprzez ramy ViT-Fuzzy-Bayesowskie, zoptymalizowane do zastosowań klinicznych. To skutecznie zlikwiduje różnicę między dokładnością, interpretowalnością a przejrzystością językową.
Poniższe podejście daje jasny, powtarzalny opis każdego kroku, od konfiguracji środowiska i przygotowania zbioru danych po trenowanie, testowanie i wizualizację modelu. To pomoże naukowcom i klinicystom powtarzać i rozwijać te prace w celu precyzyjnej diagnostyki zaburzeń układu mięśniowo-szkieletowego
Wybór i ustawienie modelu
Wybraliśmy Vision Transformer (ViT-B/16) jako główny ekstraktor cech obrazu, ponieważ potrafi wykorzystywać wielogłowicową samouwagę do modelowania globalnych relacji kontekstowych na obrazach radiograficznych 2,4,11. Struktura ViT umożliwia jednoczesną analizę zarówno drobnoziarnistych zmian tekstury, jak i długozasięgowych zależności przestrzennych, które są istotne do odróżnienia subtelnych zmian osteoartrytycznych w klasach KL 0-4, 2,4,12. Różni się to od architektur opartych na CNN, które wykorzystują zlokalizowane pola recepcyjne11.
Między wyjściem osadzenia transformatora a klasyfikatorem probabilistycznym dodano warstwę wnioskowania rozmytego (FIL), aby poradzić sobie z niepewnością związaną z gradacją radiograficzną, zwłaszcza dla KOA na granicy i we wczesnym stadium (Rysunek 2)13,14. FIL przekształca aktywacje ciągłego osadzania w rozmyte zbiory, które mają sens językowy (na przykład łagodna, umiarkowana lub ciężka utrata chrząstki) i tworzy stopnie członkostwa, które pokazują, jak niepewna jest diagnoza 7,8. Ten projekt ułatwia zrozumienie poprzez dopasowanie przewidywań liczbowych do jakościowych wzorców rozumowania, których używają radiolodzy15.
Zespół bayesowskich drzew decyzyjnych (BDTE) został użyty do przekształcenia osadzeń cech wzmocnionych rozmytym w wyniki klasyfikacji probabilistycznej, tak aby prognozy były dokładne i łatwe do zrozumienia 16,17,18,19. Każde drzewo w zespole oblicza prawdopodobieństwa posteriorne i przedziały ufności, co pomaga ustalić dobrze skalibrowane granice decyzyjne13. Metoda ta łączy statystyczną dokładność wnioskowania bayesowskiego z klarownością drzew decyzyjnych opartą na regułach, dając każdemu wynikowi diagnostycznemu zarówno pewność ilościową, jak i zrozumiały powód, dla którego został wprowadzony19.
Benchmarking przez porównanie
Stosowaliśmy te same podziały treningowe i walidacyjne, aby systematycznie porównać hybrydowy pipeline ViT + FIL + BDTE z bazowymi CNN i ResNet-50. Do porównania użyliśmy dokładności klasyfikacji, AUC, wyniku Briera oraz interpretowalności ocenianej przez klinicystów na pięciopunktowej skali. Zastosowanie kilku linii bazowych umożliwiało uczciwe testowanie uogólnialności modelu, spójności kalibracji oraz wyjaśnialności między architekturami.