Artykuł badawczy

Nowatorskie podejście wykorzystujące transformator AI-vision do analizy tomografii komputerowej w celu wykrywania raka płuc

DOI:

10.3791/69302

28 listopada 2025

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Zastosowanie transformatorów wzroku w tym badaniu pozwala klasyfikować raka płuc na podstawie obrazów tomografii komputerowej, osiągając dokładność 98,18% przy 1 190 skanach. Model zachował satysfakcjonujący poziom odporności, z dokładnością w zakresie (80–88%) przy obrazach zaszomionych i rozmytych, w porównaniu ze standardowymi modelami sieci konwolucyjnych neuronowych (CNN) w zastosowaniach diagnostycznych zdrowia konsumentów.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diagnozowanie raka płuc pozostaje trudne ze względu na subtelne różnice między chorobami łagodnymi a złośliwymi w badaniach obrazowych. Chociaż tradycyjne, splotowe sieci neuronowe (CNN) były podstawą analizy obrazowej medycznej, nadal mają ograniczoną użyteczność i odporność przy różnorodności metod obrazowania. Postęp uczenia maszynowego przekształca tradycyjne metody diagnostyki w technologiach opieki zdrowotnej skierowanej do konsumentów, zmieniając procesy dostępności i spersonalizowanej opieki nad pacjentem. Niniejszy artykuł opisuje zastosowanie transformatorów wzroku (ViT) do klasyfikacji raka płuc za pomocą tomografii komputerowej, co jest związane z zastosowaniami konsumenckimi w ochronie zdrowia. Model Vision Transformer został wytrenowany na pełnym zbiorze danych 1 190 obrazów CT i osiągnął wskaźnik klasyfikacji na poziomie 98,18% przy współczynniku korelacji Matthewsa na poziomie 0,9676. Dodatkowo wydajność modelu została zweryfikowana na symulowanych scenariuszach czasu rzeczywistego z wykorzystaniem szumów w czasie rzeczywistym i rozmytych zbiorów danych. Chociaż zachowywał metody walidacji z dużą dokładnością diagnostyczną, w całym zbiorze danych model ViT również przewyższał konwencjonalną metodę walidacji, wykazując dokładność od 80-88% do rozróżnienia między obrazami szumowymi a rozmytymi, nawet w tych warunkach. Chociaż wstępne wyniki dostarczają obiecujących informacji o odporności ViT w pracy ze zmiennością obrazu, należy zachować ostrożne podejście do kontekstualizacji wyników, ponieważ badania ewaluacyjne zostały przeprowadzone w stosunkowo niewielkim zbiorze danych i w warunkach symulacji. Dla przyszłych badań będzie cenne wykorzystanie większych zbiorów danych, które lepiej reprezentatywne dla prawdziwych schorzeń klinicznych oraz zbiorów danych klinicznie zweryfikowanych, aby określić, czy ViT są korzystne dla klinicznej identyfikacji diagnostyki onkologicznej i poprawy wczesnego wykrywania.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Rak płuc stanowi znaczne globalne obciążenie, wpływając każdego roku na miliony istnień. Ze względu na agresywny charakter raka i częste późne objawy choroby, śmiertelność związana z rakiem płuc jest wysoka. Wczesne wykrycie jest niezbędne, ponieważ interwencja może znacznie poprawić skuteczność leczenia i wskaźniki przeżywalności.1. Konwencjonalne podejście do wstępnego badania przesiewowego i diagnozy pozostaje przy użyciu tomografii komputerowej (CT), która umożliwia dokładniejszą wizualizację struktur płucnych. Jednak ocena obrazów tomografii komputerowej jest złożona i całkowicie zależy od recenzentów jako radiologów. Zmienność guza w cechach takich jak rozmiar, kształt i gęstość również obniża wiarygodność obserwacji człowieka. Czynniki środowiskowe mogą utrudniać dokładność i powtarzalność podejmowania decyzji na podstawie analizy ludzkiej.
Mając na uwadze te ograniczenia, ostatnia literatura mocno naciska na zastosowanie sztucznej inteligencji (AI) w obrazowaniu medycznym, ze szczególnym naciskiem na modele uczenia głębokiego (DL). DL, zwłaszcza dzięki sieciom konwolucyjnym (CNN), zakłóciła wzorzec obserwacji w obrazowaniu medycznym, zmieniając analizę obrazów2. CNN znacząco usprawniły procesy diagnostyczne w onkologii, wykazując zdolność do identyfikowania subtelnych i złożonych cech w danych obrazowych, które często są nieodróżnialne dla ludzkiego oka. Pomimo tych postępów, CNN napotykają ograniczenia związane z nadmiernym dopasowaniem na małych zbiorach danych, obniżoną odpornością w zmiennych warunkach akwizycji oraz poleganiem na lokalnych polach recepcyjnych, które mogą pomijać globalne zależności. Chociaż hybrydowe podejścia CNN-Transformer próbują łączyć konwolucyjne priorytety z mechanizmami uwagi, nadal dziedziczą one uprzedzenia architektur splotowych. Rysunek 1 pokazuje kilka instancji z zestawu danych prezentujących różne klasy.

figure-introduction-1
Rysunek 1: Ilustracja wizualna różnych klas pokazująca reprezentatywne przecięcia tomografii komputerowej prawidłowych, łagodnych i złośliwych płuc, podkreślająca ich podobieństwa i różnice. Proszę kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

Reprezentatywne obrazy tomografii komputerowej są pokazywane dla przypadków normalnych, łagodnych i złośliwych. Chociaż wyraźne oznaczanie obszarów dyskryminujących ułatwiałoby wizualną interpretację, ręczne adnotacje wymagają ekspertów radiologów i wykraczają poza zakres tego badania.

Transformatory Wizji (ViT), pierwotnie wprowadzone do klasyfikacji obrazunaturalnego 3, stanowią obiecującą alternatywę. W przeciwieństwie do CNN czy hybryd CNN-Transformer, ViT wykorzystują w pełni uwagą opartą na ramach, które rejestrują globalne informacje kontekstowe na całym obrazie. Badanie to jest szczególnie istotne dla obrazowania tomografii komputerowej, gdzie rozproszone i nieregularne cechy guza mogą rozciągać się w różnych obszarach, a nie ograniczać się tylko do lokalnych pól receptywnych. Podczas gdy hybrydowe sieci CNN-Transformer stabilizują konwolucyjne błędy indukcyjne, Vision Transformers (ViT) implementują całkowicie ukierunkowaną architekturę uwagi, pozwalając modelowi ViT rejestrować zależności na dalekim zasięgu na całych obrazach tomografii komputerowej – co jest korzystne przy ocenie rozproszonych lub nieregularnych cech guza płuc.

Pojawienie się modeli opartych na transformatorach w dziedzinie obrazowania medycznego jest stosunkowo nowe, z przykładami w radiologii miękkiej i histopatologii,4,5,6, które wykazały znaczące zalety odporności na szumy, rozmycia i zmienność między skanerami w porównaniu do tradycyjnych systemów CNN, wspierając uzasadnienie ViT w takim kontekście klinicznym, nie przeceniając nowości. Biorąc pod uwagę bardziej rygorystyczne podejście do obrazowania raka płuc w porównaniu do zastosowań konsumenckich, to badanie ma na celu uzasadnienie praktyczności w solidnym obszarze medycyny opartej na dowodach, jednocześnie plasując się wśród nie do końca przytłaczającej literatury ostatnio dostępnej na temat transformatorów i ich zastosowań. Wcześniejsza literatura wykazała, że dokładność metod diagnostycznych CNN znacznie spada z powodu zmienności akwizycji7, gdzie odpowiadający ViT lepiej radzi sobie przy tych samych zaburzeniach,8 co potwierdza koncepcję stosowania ViT w modalnościach oceny i oferuje możliwość zwiększenia powtarzalności w procesach diagnostycznych. Ponadto w badaniu wyraźnie uwzględniono praktyczne kwestie, takie jak wymagany rozmiar zbioru danych, obciążenie obliczeniowe oraz uogólnialność na różne środowiska kliniczne, przy zastosowaniu metod takich jak augmentacja danych, uczenie transferowe oraz efektywne warianty ViT 9,10, aby sprostać tym potencjalnym wyzwaniom w praktyce.

Badanie to rozwija ten postęp, wdrażając ViT do zaawansowania raka płuc z wykorzystaniem danych obrazowych z tomografii komputerowej oraz analizując odporność i uogólnialność modelu w obliczu rzeczywistych problemów obrazowych. Dane z tomografii komputerowej mogą obejmować artefakty, szum i rozmycia w częstym stopniu, który może zaciemniać cechy istotne dla klinicystów. Poprzez badanie odporności na te zmiany w obrazowaniu, badanie to ma na celu zaoferowanie dodatkowego ram etapowych, na których można polegać w praktyce przy podejmowaniu decyzji dotyczących opieki i leczenia.

Wkład tego badania obejmuje: i) specyficzne wykrywanie raka płuc na podstawie obrazów tomografii komputerowej w zbiorze danych IQ-OTH/NCCD poprzez wykorzystanie i analizę wydajności modelu Vision Transformer; ii) ocenę, jak model radzi sobie w rzeczywistych scenariuszach obrazowania klinicznego typowych dla danych TK, takich jak szum i rozmycie; iii) porównanie dokładności, czułości i specyficzności ViT jako alternatywy dla tradycyjnych modeli CNN.

Organizacja pozostałej części tego artykułu przedstawia się następująco: Sekcja II omawia przegląd literatury, przedstawiając wcześniejsze prace związane z wykrywaniem raka płuc z wykorzystaniem technik głębokiego uczenia oraz postęp od CNN do bardziej zaawansowanych architektur, takich jak ViT. Sekcja III przedstawia podejście stosowane w tej pracy, które obejmuje wstępne przetwarzanie danych, informacje o architekturze modelu oraz szczegóły procedur treningowych. Sekcja IV przedstawia wyniki dotyczące konkretnie właściwości przepisowych ViT jako metody klinicznej oraz tego, jak mogą one zwiększyć dokładność i wiarygodność badań przesiewowych raka płuc. Sekcja V podsumowuje wyniki i wkład w praktykę oraz omawia przyszłe kierunki w kontekście głębokiego uczenia w środowisku medycznym.

POWIĄZANE PRACE:

Uczenie głębokie (DL) zrewolucjonizowało obrazowanie medyczne w ciągu ostatnich dziesięciu lat, zwłaszcza w diagnozowaniu raka płuc. Początkowo ta dziedzina opierała się na konwencjonalnych technikach uczenia maszynowego, takich jak maszyny wektorowe wspierające (SVM) i drzewa decyzyjne, które były ograniczone potrzebą dobrze zbudowanych, poprawnie uzyskanych funkcji. Te materiały źle radziły sobie ze zawiłościami zdjęć medycznych i często wprowadzały subiektywność.

Znaczącą zmianę nastąpiło wraz z wynalezieniem splotowych sieci neuronowych (CNN), które umożliwiły automatyczne wyodrębnianie cech hierarchicznych z danych11. CNN są szeroko stosowane w zaawansowaniu nowotworów na podstawie tomografii komputerowej, wykrywaniu guzków oraz klasyfikacji jako łagodne lub złośliwe. CNN odnoszą sukcesy, ale mają swoje ograniczenia. Należą do nich różnice w ustawieniach zbierania obrazów oraz potrzeba posiadania dużych, adnotowanych zbiorów danych, które są trudne do zdobycia ze względu na kwestie prywatności i pracochłonność medycznej adnotacji. Tabela 1 12,13,14,15,16,17,18,19,20 przedstawia podsumowanie najnowszych badań przeprowadzonych w dziedzinie diagnostyki raka płuc.

Crasta, Lavina Jean, Rupal Neema i Alwyn Roshan Pais (2024) [20]Przedstawienie nowatorskich ram głębokiego uczenia do wykrywania i klasyfikacji raka płuc z wykorzystaniem obrazów tomografii [20].Artykuł wprowadza 3D-VNet do segmentacji oraz 3D-ResNet do klasyfikacji, prezentując poprawę dokładności i odporności w porównaniu z wcześniejszymi metodami.
Crasta, Lavina Jean, Rupal Neema i Alwyn Roshan Pais (2024) [20]Przedstawienie nowatorskich ram głębokiego uczenia do wykrywania i klasyfikacji raka płuc z wykorzystaniem obrazów tomografii [20].Artykuł wprowadza 3D-VNet do segmentacji oraz 3D-ResNet do klasyfikacji, prezentując poprawę dokładności i odporności w porównaniu z wcześniejszymi metodami.

Tabela 1: Podsumowanie najnowszych badań przedstawiających stosowane techniki i raportowane wyniki dla kontekstu.

Dzięki zastosowaniu procesów samouwagi, które uwzględniają cały kontekst obrazu naraz, transformatory wzroku (ViT) zaczynają wyłaniać się jako konkurencyjna alternatywa dla CNN w zadaniach związanych z obrazem. ViT są szczególnie obiecujące dla obrazowania medycznego, ponieważ znaczenie niektórych regionów może zależeć od dalszych fragmentów obrazu ze względu na ich globalne możliwości przetwarzania. Jednak pomimo ich zdolności do wykonywania skomplikowanych zadań, takich jak rozpoznawanie korelacji między licznymi wskaźnikami choroby w badaniach obrazowych, ViT wciąż nie są dobrze zbadane w dziedzinie obrazowania medycznego.

ViT nie zostały szeroko zbadane w dziedzinie urządzeń medycznych skoncentrowanych na konsumencie. Celem tego badania jest zniwelowanie różnicy między wysoką dokładnością a mniejszymi opóźnieniami dla urządzeń medycznych skoncentrowanych na konsumentach, gdzie mogą one dobrze działać i dostarczać trafnych prognoz w czasie rzeczywistym.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Zbiór danych zawiera łącznie 1 190 przekrojów tomografii komputerowej z 110 przypadków, podzielonych na trzy kategorie: normalne (55 przypadków), łagodne (15 przypadków) i złośliwe (40 przypadków). Każda przypadek składa się z wielu przekrojów tomografii (od około 80 do 200 nacięć na przypadek), oferując różnorodne aksie, widoki na okolicę klatki piersiowej. Obrazy CT zostały uzyskane w DICOM za pomocą skanera SOMATOM ze standardowymi parametrami obrazowania: napięcie rurki = 120 kV, grubość przekroju = 1 mm, szerokość okna = 350–1 200 jednostek Hounsfielda (HU) oraz wartości środka okna = 50–600 HU, podczas pełnego wstrzymania oddechu.

Wszystkie obrazy zostały całkowicie zdeanonimowane przed analizą, aby usunąć wszelkie dane osobowe (PII). Zbiór danych został etycznie zatwierdzony przez instytucjonalne komisje rewizyjne uczestniczących ośrodków medycznych, a pisemna zgoda została zrzeczona przez komisję nadzorczą. Sprawy obejmowały osoby o różnym pochodzeniu, takie jak pracownicy rządowi, rolnicy oraz mieszkańcy kilku prowincji Iraku (w tym Bagdadu, Wasit, Diyala, Salahuddin i Babilonu), o zróżnicowanym płci, wieku, poziomie wykształcenia i statusie zamieszkania.

Ponieważ zbiór danych jest publicznie dostępny i bez identyfikacji, nie było potrzeby dodatkowej zgody etycznej do jego wykorzystania w tym badaniu. Zbiór danych spełnia warunki określone przez jego pierwotnych współtwórców oraz platformę hostingową.

Metodologia tych badań wykorzystuje wieloetapowy proces zaprojektowany do stworzenia modelu predykcyjnego z pomocą zestawu danych IQ-OTH/NCCD dotyczącego raka płuc21. Ta metodologia tworzy solidne podstawy dla urządzeń medycznych skoncentrowanych na konsumencie, gdzie wymagane są mniejsze opóźnienia, co może zapewnić lepszą dokładność. Rysunek 2 przedstawia mechanizm działania proponowanego modelu.

figure-protocol-1
Rysunek 2: Diagram workflow proponowanego modelu przedstawiający etapy wstępnego przetwarzania, augmentacji, klasyfikacji Vision Transformer oraz ewaluacji. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

1. Opis zbioru danych

Zbiór danych IQ-OTH/NCCD dotyczący raka płuc został zebrany w Szpitalu Klinicznym Iracko-Onkologicznym/Narodowym Centrum Chorób Nowotworowych jesienią 2019 roku. Część treningowa użytego zbioru danych zawierała 1 097 obrazów, których opis przedstawiono w Tabeli 2, ilustrującej liczbę przykładów różnych klas.

KlasaLiczba obrazów
Normalne416
Łagodne120
Złośliwy561

Tabela 2: Przykładowe przypadki prawidłowych, łagodnych i złośliwych obrazów tomografii komputerowej z tego zbioru danych.

Zestaw danych IQ-OTH/NCCD dotyczący raka płuc został wybrany ze względu na kompleksową reprezentację prawidłowych, łagodnych i złośliwych tomografii komputerowej. Chociaż dostępne są inne zbiory danych, takie jak LIDC-IDRI i NSCLC-Radiomics, skupiają się one głównie na wykrywaniu guzków lub nie mają wystarczającej liczby próbek przypadków łagodnych. Zbiór danych IQ-OTH/NCCD jest szczególnie odpowiedni do naszych badań, ponieważ pozwala Transformatorowi Wzroku poznać cechy dyskryminacyjne we wszystkich trzech klasach, umożliwiając solidną klasyfikację subtelnych wzorców w obrazach tomografii płuc.

2. Wstępne przetwarzanie danych

Wstępne przetwarzanie jest ważnym krokiem w poprawie wydajności modelu poprzez spójność i odpowiednie dostosowania danych przetwarzanych przez sieć neuronową. Aby zapewnić spójność rozmiaru wejścia dla sieci neuronowej, przeskalowaliśmy wszystkie obrazy do tego samego wymiaru 256 x 256 pikseli i znormalizowaliśmy dane do wartości pikseli między 0 a 1, mając nadzieję na poprawę trenowania i zbieżności modeli. Tabela 3 zawiera wartości technik augmentacji.

TechnikaWartość
Normalizacja-
Zmiana rozmiaruimage_size x image_size
RandomRotationczynnik=0,02
RandomZoomheight_factor=0,2, width_factor=0,2

Tabela 3: Stosowane techniki augmentacji z zakresami parametrów.

Aby zwiększyć odporność modelu na nadmierne dopasowanie i poprawić jego zdolność do uogólniania, stosuje się techniki uzupełniania danych, takie jak losowe obroty i zoomy, symulujące różne kąty i rozmiary objawów raka płuc, tak jak mogą pojawić się u różnych pacjentów. W badaniu zastosowano losowe rotacje o kątach jednolicie pobieranych z 0,02 radiana oraz losowe transformacje powiększenia o zmiennych współczynnikach wysokości i szerokości. Obrazy po augmentacji przedstawiono na Rysunku 3.

figure-protocol-2
Rysunek 3: Obrazy CT po augmentacji pokazujące rotację, powiększenie i normalizację w celu poprawy uogólnienia modelu. Proszę kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

Te techniki wstępnego przetwarzania są wymagane, a we wszystkich klasach zastosowano augmentację, aby zapewnić odporność modelu.

3. Architektura modelu

Dostosowując nowatorski framework Vision Transformer (ViT) do efektywnej obsługi skomplikowanych danych obrazowych, architektura modelu ma na celu podzielić tomografię komputerową na trzy kategorie: normalne, łagodne i złośliwe. Tą metodą przetwarzane są obrazy wejściowe o wymiarach 256 x 256 pikseli. Aby zagwarantować spójność i promować bardziej efektywne uczenie się modeli, każdy obraz przechodzi kilka operacji wstępnego przetwarzania, takich jak zmiana rozmiaru i normalizacja. Aby zwiększyć odporność modelu na zmiany skali i orientacji obrazu, projekt rozpoczyna się od warstwy augmentacji danych, która wykorzystuje metody takie jak normalizacja, zmiana rozmiaru, losowe obroty 0,02 radiana oraz losowe powiększenia do 20%. Po augmentacji model usuwa 16 x 16 pikseli z każdego zdjęcia, dzięki czemu każdy obraz ma 256 fragmentów.

Algorytm 1 definiuje przepływ pracy, proponowany model i sposób jego budowy, a także precyzyjne dostrojenie względem modelu.

Algorytm 1: Klasyfikacja raka płuc z użyciem transformatorów wzroku
Wejście wejściowe: Zestaw obrazów CT I z zestawu danych IQ-OTH/NCCD
Wyniki: Wyniki klasyfikacji C do kategorii: Normalne, Łagodne, Złośliwe
Wstępne przetwarzanie:
   for each image i in I do
i <- Resize(i, 256 x 256)         // Normalize and resize images
i <- Normalize(i)
i <- DataAugmentation(i)        // Apply random rotations and zooms
   end for

Konfiguracja modelu:
  Initialize Vision Transformer (ViT) Model
  Set number of patches P = 16 x 16
  Set number of heads H = 6 in multi-head attention

Szkolenia:
  for epoch = 1 to MaxEpochs do
    for each batch b in I do
      Patches <- ExtractPatches(b, P)
      EncodedPatches <- PatchEncoder(Patches)
      AttentionWeights <- MultiHeadAttention(EncodedPatches, H)
      ClassLogits <- TransformerEncoder(AttentionWeights)
      Loss <- ComputeLoss(ClassLogits, TrueLabels)
      UpdateModelWeights(Loss)
    end for
    if EarlyStoppingCriteriaMet (Val_Loss No Improvement Patience = 5 Epochs) then
      break
    end if
  end for

Weryfikacja:
  Split data into TrainingSet (80%) and ValidationSet (20%)
  ComputeValidationMetrics(ValidationSet)

Ocena:
  C <- Classify(I)
  ComputePerformanceMetrics(C)
  Return C

Aby zachować relacje przestrzenne między łatkami, łaty te są spłaszczane (równanie 1) do 768-wymiarowych wektorów (ponieważ każdy łat ma 16 x 16 x 3 = 768), a następnie przesyłane przez warstwę kodującą łatki, która rzutuje każdy wektor do przestrzeni 64-wymiarowej poprzez integrację osadzeń pozycyjnych. Rdzeń architektury składa się z ośmiu warstw transformatorów, z których każda posiada mechanizm skupienia uwagi z wieloma głowami i sześcioma głowami, pozwalający modelowi jednocześnie skupić się na różnych częściach obrazu i uchwycić szeroki zakres cech. Jest reprezentowany za pomocą równań 2, 3 i 4.

figure-protocol-3

Gdzie μ to średnia, aσ 2 to wariancja wejścia x, a ε jest małą stałą, aby zapobiec dzieleniu przez zero.

figure-protocol-4

Gdzie Q to macierz zapytania, K macierz klucza, V macierz wartości, a dk to wymiar wektorów klucza.

figure-protocol-5
figure-protocol-6

Gdzie WiQ, WiK i W iV to macierze wag nauczonych dla zapytań, kluczy i wartości, a WO to macierz wag wyjściowych.

Diagram blokowy proponowanego modelu został przedstawiony na Rysunku 4.

figure-protocol-7
Rysunek 4: Schemat blokowy modelu Vision Transformer z głowicą MLP, przedstawiający główne warstwy przetwarzania i architekturę. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Każda warstwa transformatora zawiera percepcję wielowarstwową (MLP) z ukrytymi jednostkami najpierw skalowanymi do 128, a następnie z powrotem do 64, skutecznie rozszerzając i kompresując przepływ informacji, aby uchwycić złożone zależności.

Rezygnacja jest strategicznie stosowana w tempie 0,1 w mechanizmach uwagi i MLP, aby zapobiec nadmiernemu dopasowaniu. Wyjście z enkodera transformatora jest przetwarzane przez głowicę MLP składającą się z dwóch gęstych warstw o odpowiednio 2 048 i 1 024 jednostkach, wykorzystując do aktywacji jednostki liniowe błędu Gaussa (GELU), które wykazują dobre wyniki w aplikacjach głębokiego uczenia. Osiąga się to za pomocą równania 5.

figure-protocol-8

Gdy W1 i W2 to macierze wagowe, b1 i b2 to błędy, a GELU to używana funkcja aktywacji.

W warstwach transformatorów zastosowano wypadek 0,1, aby zapobiec nadmiernemu dopasowaniu bez utraty ważnych informacji o cechach. Funkcja aktywacji GELU została wykorzystana ze względu na jej gładkie, nieliniowe właściwości, które sprzyjają przepływowi gradientowemu i zbieżności w modelach opartych na transformatorach. Przerwanie jest regularizowane za pomocą równania 6.figure-protocol-9

Gdzie p to wskaźnik dropoutu (np. 0,1 lub 0,5), a warstwa dropout losowo ustawia ułamek p jednostek wejściowych na zero podczas treningu.

Wskaźnik wypadania 0,5 w tych warstwach dodatkowo pomaga w ograniczaniu nadmiernego dopasowania. Ostatnią warstwą modelu jest warstwa logitów (równanie 7), która generuje trzy klasy logitów odpowiadające kategoriom normalnym, łagodnym i złośliwym, wykorzystując rzadką kategoryczną funkcję strat entropii krzyżowej (równanie 8), odpowiednią dla tego wieloklasowego ustawienia klasyfikacji.

figure-protocol-10

figure-protocol-11

Gdzie zi jest wektorem logitów dla klasy i, SoftMax(zi)) reprezentuje przewidywane prawdopodobieństwa, a yi to prawdziwa etykieta klasy.

Model jest kompilowany za pomocą optymalizatora AdamW (równania 9, 10, 11, 12 i 13), rozszerzenia optymalizatora Adama, które skuteczniej obsługuje spadek wagi, ustawiony z częstotliwością uczenia 0,001 i spadkiem wagi 0,0001, optymalizując zarówno szybkość uczenia, jak i stabilność modelu.

figure-protocol-12

figure-protocol-13
figure-protocol-14
figure-protocol-15
figure-protocol-16

Gdzie mt i vt to pierwszy i drugi moment gradientów, figure-protocol-17 a figure-protocol-18 są momentami skorygowanymi przez polaryzację, η to szybkość uczenia się, a ε jest małą stałą zapobiegającą dzieleniu przez zero.

Model po wytrenowaniu wykorzystuje rozmiar partii 32, aby wykorzystać akcelerację GPU dla szybszych obliczeń i jest skonfigurowany do trenowania przez 100 epok.

Jednak trening ma mechanizm wczesnego zatrzymania straty walidacyjnej, aby ograniczyć trening, gdy model przestaje się poprawiać, oszczędzając zasoby obliczeniowe i unikając przetrenowania w 5 kolejnych epokach. Wydajność modelu śledzi się za pomocą wskaźników takich jak rzadka dokładność kategoryczna oraz dokładność top 2, które informują o zdolności modelu do klasyfikacji w najbardziej prawdopodobnych przewidywanych kategoriach. Callbacki do treningu modelu obejmują checkpointy, które zapisują najlepiej działający model według dokładności walidacji, aby zapewnić zachowanie najbardziej skutecznej wersji modelu po zakończeniu procesu treningowego. Ta solidna i dobrze zaplanowana architektura wykorzystuje możliwości transformatorów do przetwarzania danych obrazowania medycznego, oferując zaawansowane podejście do wykorzystania współczesnych metod AI w kluczowych zastosowaniach w diagnostyce opieki zdrowotnej.

4. Szkolenie i walidacja

Model był trenowany w środowisku Kaggle z użyciem karty NVIDIA P100, a podczas procesu treningowego zastosowano mini-batch gradient descent o rozmiarze partii 32. Optymalizator używany podczas treningu to AdamW o tempie uczenia 0,001 i spadku wagi 0,0001; To była dobra równowaga między szybką konwergencją a pewną regularizacją. Model był trenowany przez 100 epok, jednak stosowano wczesne zatrzymanie się na utracie walidacji z cierpliwością 5 epok. Mówiąc prosto, jeśli trening nie poprawiałby utraty walidacyjnej przez 5 ciągłych epok, trening zatrzymałby się z powodu nadmiernego dopasowania i efektywności obliczeniowej. W większości przypadków model ten przywracał wagi z epoki przy najmniejszych stratach walidacyjnych, co wskazywało, że działał optymalnie i nie musiał uruchamiać całych 100 epok. Łącznie około 32 minuty na wytrenowanie modelu.

Podczas szkolenia metryki obejmowały rzadką dokładność kategoryczną oraz dokładność z dwóch najwyższych ocen, monitorowane zarówno na zestawach treningowych, jak i walidacyjnych. Te metryki dają wgląd w to, jak często model przewiduje właściwą klasę oraz czy właściwa klasa znajduje się w dwóch najważniejszych prognozach, co jest istotne w zastosowaniach medycznych, ponieważ błędne klasyfikacje o wysokim stopniu pewności mogą mieć istotne konsekwencje. Krzywe uczenia się strat i dokładności przedstawiono na Rysunku 5.

.figure-protocol-19

Rysunek 5: Krzywe dokładności i strat treningu i walidacji na przestrzeni 50 epok pokazujące stabilne uczenie się i minimalne nadmierne dopasowanie. Proszę kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

W obecnym badaniu nie przeprowadzono żadnej walidacji krzyżowej. Takie rozwiązanie pozwalało na efektywne eksperymentowanie z architekturą modelu, w tym dostosowania warstw transformatorów i rozmiarów głowic MLP, jednocześnie zapewniając dobre uogólnienie modelu na podstawie niewidocznych danych walidacyjnych.

5. Analiza statystyczna

Wydajność modelu Vision Transformer została statystycznie przeanalizowana na podstawie zbioru danych IQ-OTH/NCCD dotyczących raka płuc. Precyzja, przypomnienie, wynik F1 i dokładność zostały obliczone za pomocą równań odpowiednio 14, 15, 16, 17. Te cztery są uznawane za konwencjonalne miary stosowane w zadaniach klasyfikacji, ponieważ mogą ujawniać informacje o wydajności modelu przy klasyfikowaniu i klasyfikowaniu na zasadzie każdej klasy.

figure-protocol-20
figure-protocol-21
figure-protocol-22
figure-protocol-23

Przypomnienie to miara zdolności modelu do identyfikacji wszystkich istotnych przypadków w klasie, natomiast precyzja to proporcja pozytywnych identyfikacji, które faktycznie były poprawne. Wynik F1 łączy przywołanie i precyzję, gdy oba są ważne.
Do tego zadania użyto miar wydajności Współczynnika Korelacji Matthewsa (MCC) 18 oraz Kappy 19 Cohena.

figure-protocol-24
figure-protocol-25

Gdzie P0 to zaobserwowane porozumienie, a Pe to oczekiwane porozumienie.

MCC jest wszechstronnym pomiarem wydajności klasyfikacji, uwzględniającym zarówno prawdziwie pozytywne, jak i negatywne wyniki oraz fałszywe pozytywy oraz fałszywe negatywy. Jej wartość może mieścić się w przedziale od -1 do 1, gdzie 1 to perfekcyjne przewidywanie, 0 to losowa, a -1 to całkowite niezgodność między przewidywaną a prawdziwą etykietą. MCC był cenny do porównań między różnymi wynikami modeli, gdy był stosowany do niezrównoważonych zbiorów danych oraz zapewniał miarę zrównoważoną niezależnie od różnic wielkości klas.

W ramach dodatkowej analizy statystycznej obliczono wynik F2, z priorytetem przypominania, zgodnie z równaniem 20.

figure-protocol-26

Wydajność modelu była również kwantyfikowana za pomocą średniego błędu kwadratowego (MSE), rdzenia średniego błędu kwadratowego (RMSE) oraz średniego błędu bezwzględnego (MAE) – które zazwyczaj są pomiarami do zadań regresji, ale tutaj zmodyfikowanymi dla zadania klasyfikacyjnego, aby określić, jak duży był średnio błąd bez uwzględnienia kierunku.

Aby ustalić, czy praktyczne byłoby integrowanie ViT z urządzeniami medycznymi skierowanymi do konsumentów, przeprowadziliśmy szeroko zakrojone wyniki oceny wydajności, skupiając się wyłącznie na efektywności czasowej modelu. Stworzyliśmy funkcje raportujące czas potrzebny na przewidzenie pojedynczego lub po prostu wielu obrazów, ponieważ jest to szczególnie istotne w zastosowaniach w czasie rzeczywistym. Dla każdego obrazu, przed rozpoczęciem przewidywania, dane są najpierw wstępnie przetwarzane, aby miały kształt obrazu, jaki model chce. Czas rozpoczęcia prognozy i czas jej zakończenia zapisywaliśmy, aby uzyskać wyniki dotyczące czasu i opóźnień. Czas i średnie opóźnienie zostały obliczone odpowiednio za pomocą równania 21 i 22.

figure-protocol-27
figure-protocol-28

Gdzie:

  • N to liczba obrazów (próbek).
  • tend to czas zapisywany po przewidywaniu i-tego obrazu.
  • Tstart to czas zapisany przed przewidywaniem i-tego obrazu.

Przeprowadzono dalsze eksperymenty, aby ocenić odporność modelu Vision Transformer, który zaproponowaliśmy, systematycznie wprowadzając dodatkowy szum i rozmycie do obrazów. Do każdego piksela dodawano szum gaussowski o współczynniku szumu 0,4, a wartości pikseli przycinano w zakresie [0,1]. Czynnik rozmycia został zmniejszony przez rozmycie Gaussa o rozmiarze jądra 45× 45. Eksperymenty te mają na celu kompleksową ocenę modelu przy symulowanych pogorszeniu jakości obrazu percepcyjnego.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Model Vision Transformer wykazał wyjątkowe wyniki na wielu metrykach oceny na zbiorach danych IQ-OTH/NCCD dotyczących raka płuc, skutecznie rozróżniając obrazy tomografii komputerowej normalnej, łagodnej i złośliwej. Ogólna wydajność modelu osiągnęła wysoką dokładność 98,18% w całym zbiorze danych testowych składającym się z 220 obrazów. Ta niezwykle wysoka dokładność wskazuje, że model potrafi bardzo skutecznie uogólniać i może być stosowany w warunkach klinicznych.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Osiągnęła ona niezwykłe wyniki w ocenie i wdrożeniu modelu Vision Transformer na zbiorze danych IQ-OTH/NCCD dotyczącym raka płuc z wysoką dokładnością. Ogólna dokładność klasyfikacji tomografii komputerowej jako normalnej, łagodnej i złośliwej wynosi 98,18% przy użyciu tego modelu.

Ta wyższa dokładność jest dodatkowo potwierdzona przez wyniki modelu w innych kluczowych wynikach, takich jak 100% precyzja w wykrywaniu przypadków złośliwych, co jest bardzo ważne we wczesnej diagnozie i leczeniu.<...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy deklarują, że nie mają żadnych konfliktów interesów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Prace te zostały wsparte przez księżniczkę Nourah bint Abdulrahman University Researchers Supporting Project numer (PNURSP2025R432), Princess Nourah bint Abdulrahman University, Rijad, Arabia Saudyjska. Autorzy są wdzięczni Dziekanowi Studiów Podyplomowych i Badań Naukowych na Uniwersytecie Najran za sfinansowanie tych działań w ramach kodu grantowego Programu Growth Funding Program (NU/GP/SERC/13/575-6).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Karta graficzna A100 (CUDA)NVIDIACUDA Wersja 11.6Przyspieszenie GPU do trenowania i oceny modeli.
Procesor AMD EPYC-7502PAMDNie maProcesor używany do obliczeń o wysokiej wydajności.
Gigabit EthernetIntelNie maNetworking do bezpiecznej komunikacji peer-to-peer w CPS.
MatplotlibPython Software FoundationWersja 3.5Biblioteka wizualizacji do wykresowania wyników.
Kryptosystem PaillieraOpen Source (implementowane przez TenSEAL)Nie maUmożliwia addytywne szyfrowanie homomorficzne na gradientach.
PySyftOpenMinedWersja 0.6.0Biblioteka różnicowa prywatności i federated learning.
Python (Dystrybucja Anaconda)Anaconda IncWersja 3.9Zawiera preinstalowane pakiety i narzędzia do zarządzania środowiskiem, wykorzystywane do skryptów i tworzenia frameworków.
PyTorchMeta AIWersja 1.12Ramy uczenia głębokiego do treningu modeli.
RAMCorsair256 Gigabajtów (GB)  Wysokie wsparcie pamięci przy intensywnym treningu.
Scikit-learnPython Software FoundationWersja 1.1Narzędzia do oceny wydajności uczenia maszynowego.
SeabornPython Software FoundationWersja 0.11Biblioteka wizualizacji danych statystycznych.
Przechowywanie danych SSDSeagate1 Terabajt (TB)Dla szybkiego przechowywania i pobierania danych.
TenSEALOpenMinedWersja 0.3Homomorficzna biblioteka szyfrowania dla bezpiecznej agregacji.
TensorFlowGoogleWersja 2.9Ramy głębokiego uczenia dla modeli dyfuzji.
Ubuntu OSKanoniczneWersja 20.04 LTSSystem operacyjny używany we wszystkich eksperymentach.

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wang, L., et al. Transformer-based deep learning model for the diagnosis of suspected lung cancer in primary care based on electronic health record data. EBioMedicine. 110, 105442(2024).
  2. Kshatri, S. S., Singh, D. Convolutional neural network in medical image analysis: a review. Arch. Comput. Methods Eng. 30 (4), 2793-2810 (2023).
  3. Atabansi, C. C., et al. A survey of transformer applications for histopathological image analysis: new developments and future directions. Biomed. Eng. Online. 22 (1), 1-26 (2023).
  4. Xu, H., et al. Vision transformers for computational histopathology. IEEE Rev. Biomed. Eng. 17, 63-79 (2024).
  5. Xia, K., Wang, J. Recent advances of transformers in medical image analysis: a comprehensive review. MedComm Future Med. 2 (1), e38(2023).
  6. Kim, J. W., et al. Systematic review of hybrid vision transformer architectures for radiological image analysis. J. Imaging Inform. Med. , (2025).
  7. Suresh, S., Mohan, S. ROI-based feature learning for efficient true positive prediction using convolutional neural network for lung cancer diagnosis. Neural Comput. Appl. 32 (20), 15989-16009 (2020).
  8. Fanizzi, A., et al. Comparison between vision transformers and convolutional neural networks to predict non-small lung cancer recurrence. Sci. Rep. 13 (1), 48004(2023).
  9. Alijani, S., et al. Vision transformers in domain adaptation and domain generalization: a study of robustness. Neural Comput. Appl. 36 (29), 17979-18007 (2024).
  10. Rane, N. Transformers for medical image analysis: applications, challenges, and future scope. SSRN Electron. J. , (2023).
  11. Taye, M. M. Theoretical understanding of convolutional neural network: concepts, architectures, applications, future directions. Computation. 11 (3), 52(2023).
  12. Mothkur, R., Veerappa, B. N. Classification of lung cancer using lightweight deep neural networks. Procedia Comput. Sci. 218, 1869-1877 (2023).
  13. Alsadoon, A., et al. DFCV: a framework for evaluation deep learning in early detection and classification of lung cancer. Multimed. Tools Appl. , (2023).
  14. Mohamed, T. I. A., et al. Automatic detection and classification of lung cancer CT scans based on deep learning and ebola optimization search algorithm. PLoS ONE. 18 (8), e0285796(2023).
  15. Sangeetha, S. K. B., et al. An enhanced multimodal fusion deep learning neural network for lung cancer classification. Syst. Soft Comput. 6, 200068(2024).
  16. Raza, R., et al. Lung-EffNet: lung cancer classification using EfficientNet from CT-scan images. Eng. Appl. Artif. Intell. 126, 106902(2023).
  17. Dunn, B., et al. Automated classification of lung cancer subtypes using deep learning and CT-scan based radiomic analysis. Bioengineering. 10 (6), 690(2023).
  18. Wani, N. A., et al. DeepXplainer: an interpretable deep learning based approach for lung cancer detection using explainable artificial intelligence. Comput. Methods Programs Biomed. 243, 107879(2024).
  19. Subash, J., Kalaivani, S. Dual-stage classification for lung cancer detection and staging using hybrid deep learning techniques. Neural Comput. Appl. 36 (14), 8141-8161 (2024).
  20. Yin, P., et al. Imaging of tumor boundary based on multielements and molecular fragments heterogeneity in lung cancer. IEEE Trans. Instrum. Meas. 70, 1-7 (2021).
  21. AL-Huseiny, M. S., Sajit, A. S. Transfer learning with GoogLeNet for detection of lung cancer. Indones. J. Electr. Eng. Comput. Sci. 22 (2), 1078-1086 (2021).
  22. Gupta, A., et al. UDCT: lung cancer detection and classification using U-net and DARTS for medical CT images. Multimed. Tools Appl. 84 (18), 19065-19085 (2024).
  23. Bagheri Tofighi, A., et al. Improving lung cancer detection via MobileNetV2 and stacked-GRU with explainable AI. Int. J. Inf. Technol. 17 (2), 1189-1196 (2024).
  24. Kareem, H. F., et al. Evaluation of SVM performance in the detection of lung cancer in marked CT scan dataset. Indones. J. Electr. Eng. Comput. Sci. 21 (3), 1731-1738 (2021).
  25. Lung tumor detection and recognition using deep convolutional neural networks. Solyman, S., Schwenker, F. Pan-Afr. Conf. Artif. Intell, , 79-91 (2023).
  26. Das, S., et al. Automated prediction of lung cancer using deep learning algorithms. Applied Artificial Intelligence. , 93-120 (2023).
  27. Abe, A. A., et al. A robust deep learning algorithm for lung cancer detection from computed tomography images. SSRN Electron. J. , (2023).
  28. Mathews, A. B., Karani, K. P. Lung cancer segmentation and classification using integration of convolutional neural network & U-net network over CT images: a deep learning approach. Int. J. Manag. Technol. Soc. Sci. , 520-534 (2022).
  29. MAT-VIT: a vision transformer with MAE-based self-supervised auxiliary task for medical image classification. Han, Y., et al. 27th Int. Conf. Comput. Support Coop. Work Des. (CSCWD), , 2046-2052 (2024).
  30. Ko, J., et al. Optimization of vision transformer-based detection of lung diseases from chest X-ray images. BMC Med. Inform. Decis. Mak. 24 (1), 1-15 (2024).
  31. Apostolidis, K. D., Papakostas, G. A. A survey on adversarial deep learning robustness in medical image analysis. Electronics. 10 (17), 2132(2021).
  32. Hybrid design of CNN and vision transformer: a review. Long, H. 7th Int. Conf. Comput. Inf. Sci. Artif. Intell, , 121-127 (2024).
  33. Papanastasiou, G., et al. Is attention all you need in medical image analysis? A review. IEEE J. Biomed. Health Inform. 28 (3), 1398-1411 (2024).
  34. Advancing healthcare in low-resource environments through an optimization and deployment framework for medical multimodal large language models. El Mir, A., et al. 2024 IEEE EMBS Int. Conf. Biomed. Health Inform. (BHI), , 1-8 (2024).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Sztuczna inteligencja w obrazowaniu medycznymuczenie maszynowe w ochronie zdrowiaklasyfikacja raka p ucaodporno obrazowaniadok adno diagnostycznaszum w obrazowaniu medycznymdiagnostyka onkologiczna

Powiązane artykuły