Artykuł metodologiczny

Innowacyjne hybrydowe modele głębokiego uczenia CNN-Transformer do automatycznej diagnozy ospy małpiej na podstawie obrazów medycznych

DOI:

10.3791/70533

29 maja 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wykorzystanie wyselekcjonowanej kolekcji 2 280 obrazów zmian skórnych stworzyło ustandaryzowany binarny proces głębokiego uczenia do klasyfikacji obecności mpox na każdym obrazie. Porównano niestandardowy model InceptionV3, ResNetV2, ResNet50, DenseNet121 oraz hybrydowy model CNN-transformator w kontekście wspólnego potoku wstępnego i treningowego.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wygląd wizualny zmian skórnych ospy małpy pozostaje słabo ustalony ze względu na ich podobieństwo do innych chorób skóry pęcherzyków i krost. Artykuł ten testował hipotezę, że hybrydowy model głębokiego uczenia, zintegrowany z konwolucyjnymi i transformatorowymi enkoderami cech, może automatycznie klasyfikować obrazy mpox w ramach zunifikowanego eksperymentalnego pipeline'u. Aby zapewnić spójność między modelami i raportami, główna analiza została przeprowadzona jako zadanie binarne: mpox kontra inne schorzenia o podobnym lub podobnym charakterze. Dane referencyjne obejmowały 2 280 obrazów: 1 020 obrazów mpox i 1 260 obrazów zmian niezwiązanych z mpox. Obrazy zostały zredukowane do standardowego rozmiaru wejściowego 150 × 150 pikseli, a wartości mieściły się w zakresie [0, 1]. Podczas szkolenia obrazy były wzbogacane o rotację, translację, ścinanie, powiększenie oraz poziome przewracanie. Porównano niestandardowe sekwencyjne CNN, InceptionV3, ResNetV2, ResNet50, DenseNet121 oraz proponowaną hybrydową architekturę transformatora CNN. Każdy model bazowy był trenowany przez 15 epok z wykorzystaniem optymalizatora Adama oraz binarnej utraty entropii krzyżowej. Mierzono dokładność treningu i walidacji, straty, precyzję, przywołanie, wynik F1 oraz obszar poniżej krzywej charakterystyki operacyjnej odbiornika, aby ocenić wydajność, jeśli to możliwe. Najlepszą raportowaną dokładność wewnętrznej walidacji zaobserwowano za pomocą sekwencyjnego CNN, a model hybrydowy osiągnął precyzję 98,50, wycofanie 98,50 oraz wynik F1 98,58, co dało zrównoważony profil dyskryminacyjny. InceptionV3 wykazuje oznaki nadmiernego dopasowania, a ResNetV2 nie dostarczył wystarczających danych walidacyjnych, aby wspierać solidny test generalizacyjny. Ogólnie rzecz biorąc, model hybrydowy można uznać za realną i zrównoważoną strategię, niekoniecznie lepszą od wszystkich bazowych modeli.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Automatyczne i szybkie wykrywanie mpox w przypadkach medycznych jest klinicznie istotne, ponieważ choroba może być podobna do różnych innych wylęgów pęcherzykowych lub krostowych podczas początkowej oceny wzrokowej. Klinicyści w praktyce nie zwracają dużej uwagi wyłącznie na morfologię zmian, ale łączą wzorzec, rozmieszczenie, historię, ryzyko narażenia, kontekst epidemiologiczny oraz potwierdzenie laboratoryjne1. Niemniej jednak narzędzia obliczeniowe wykorzystują obrazy i mogą również przeprowadzić skuteczne zabiegi triage w środowiskach, gdzie profesjonalne badania dermatologiczne są ograniczone lub opóźnione. Jest szczególnie przydatna w śledzeniu epidemii, przesiewaniu teledermatologicznym oraz w miejscach ograniczonych zasobów i znacznej liczbie możliwych przypadków, które powinny być priorytetowo traktowane pod kątem testów potwierdzających.

Podejścia oparte na uczeniu głębokim również okazały się atrakcyjne do tego zadania, ponieważ potrafią wykrywać dyskryminujące obrazy zmian bez użycia ręcznych deskryptorów2. Najpopularniejszy przegląd literatury nadal należy do sieci neuronowych splotowych ze względu na ich skuteczność w rozpoznawaniu lokalnej tekstury, zakresu kolorów i marginesów zmian3. Najnowsze badania dodatkowo rozwinęły ten paradygmat przy pomocy uczenia transferowego, mechanizmów uwagi oraz modułów transformatorów, które próbują modelować większą zależność przestrzenną obrazu. Niemniej jednak literatura dotycząca mpox wykazuje wysokie wyniki i należy podchodzić do nich ostrożnie. Wiele badań korzystało z rzadkich publicznych zbiorów danych, posiadało różne zestawy heterogenicznych klas lub porównywało wyniki z różnymi reżimami wstępnego przetwarzania i walidacji4. W związku z tym często pojawia się dylemat, czy wzrost wydajności jest wynikiem naprawdę lepszego modelu, pożądanego podziału, energicznego wzmocnienia lub różnic w formułowaniu zadania.

Mpox pozostaje jedną z istotnych chorób zakaźnych o negatywnym wpływie na zdrowie publiczne, ponieważ jego zmiany związane z infekcjami skóry mogą być mylone z innymi zmianami pęcherzykowymi i krostowymi na granicy podczas badań ocznych w trakciebadania pierwszego 5. W praktyce klinicyści nie dokonują diagnozy mpox na podstawie morfologii: wzorzec, rozmieszczenie, historia, epidemiologia i potwierdzenie laboratoryjne są elementami decyzji diagnozy6. Niemniej jednak, mogą odegrać korzystną rolę w procesie triage dzięki narzędziom obliczeniowym opartym na obrazach, zwłaszcza gdy doświadczenie dermatologów jest niewystarczające, wolne lub niedostępne. Mogą być stosowane w teledermatologii, w przypadkach, gdy ognisko ma być zwalczane badaniami przesiewowymi, oraz w miejscach o ograniczonych zasobach, gdzie podejrzewane przypadki z listy priorytetów muszą być szybko rozpatrywane7.

Metody oparte na uczeniu głębokim, ponieważ pozwalają na naukę dyskryminacyjnych reprezentacji zmian, byłyby atrakcyjne do tego zadania, ponieważ uczą się takich reprezentacji bez ręcznie tworzonych deskryptorów, w zależności od cech obrazów wejściowych8. W dziedzinie obrazów dermatologicznych panuje gorączka za wykorzystaniem splotowych sieci neuronowych (CNN) do analizy obrazów, ponieważ potrafią one kodować lokalną fakturę, peryferię zmian oraz wyrafinowane znaczenie morfologiczne. Późniejsze badania dostarczyły ten paradygmat poprzez uczenie transferowe, uwagę oraz podmoduły oparte na transformatorach, aby poznać bardziej ogólne relacje przestrzenne i trendy kontekstowe9. Niemniej jednak literatura dotycząca obrazowania mpox jest nadal zróżnicowana. Nie jest rzadkością, że wydajność opiera się nie tylko na wyborze architektury, ale także na strukturze zbioru danych, planie augmentacji, definicji klas oraz strukturze walidacji10. Wtedy dobre wyniki nagłówków niekoniecznie oznaczają wzrost uogólnień.

W obecnych pracach problem ten rozwiązano poprzez zastosowanie bardziej dostrzegalnego i wewnętrznie spójnego binarnego benchmarku klasyfikacji obrazów mpox11. Nie omawia wkładu w formacie proponowania całkowicie nowej architektury hybrydowej, ponieważ metody CNN-transformatora zostały już rozsiane w całej literaturze12. Eksperyment wprowadza standardowe porównanie z jawnym pierwotnym rozkładem binarnym, gdzie dodatkowe wieloklasowe dowody, wstępne przetwarzanie/trening oraz wydajność modelu są rozpatrywane w sposób przyjazny protokołowi, a wydajność modelu w sposób zachowawczy w porównaniu do środowiska eksperymentalnego13. W tym paradygmatze model transformatora CNN może nadal mieć znaczenie funkcjonalne, ponieważ CNN są optymalnie ustrukturyzowane do rejestrowania informacji o lokalnych zmianach, podczas gdy reprezentacje oparte na transformatorze mają potencjał reprezentowania także długodystansowej struktury przestrzennej interesującej w dermatologii.

Najnowsze badania nad klasyfikacją obrazów mpox można podzielić na trzy szerokie nurty badań oparte na określonej metodologii. Ta ostatnia opiera się na konwencjonalnych CNN i transfer-learning ze względu na dojrzałość, szybkość obliczeń oraz odtwarzanie tekstur specyficznych dla zmian14. Ten ostatni bada modele oparte na uwadze lub transformatory, lepiej przystosowane do nauki globalnego kontekstu zmian. Trzecia integruje konwolucyjne i uwagi w hybrydowych potokach, aby zachować lokalną czułość, ale wykorzystując modelowanie kontekstowe większego ciała. Kilka z tych badań wykazuje wysokie wyniki, których nie da się łatwo bezpośrednio porównać, ponieważ różnią się rozmiarem zbioru danych, strategią kuracji, strukturą klas, protokołem wstępnego przetwarzania i walidacji15. Są one zorientowane na klasyfikację binarną, wieloklasowe dyskryminację dermatologiczną, z których nie wszystkie mają takie same kryteria oceny. Zbiory danych Mpox udostępnione publicznie mogą również zawierać niemal duplikaty lub bardzo podobne obrazy, które będą wymagały pozornego zwiększenia wydajności, jeśli split control nie jest wystarczający16.

Przedstawiona analiza opiera się na kontrolowanym zestawie binarnym 2 280 zdjęć zmian skórnych, planowano 1 020 zdjęć mpox oraz 1 260 fotografii innych. Kategoria Inna pokrywa się z zmianami niezwiązanymi z mpox widocznymi gołym okiem, co stawia zadanie klinicznie interesującą formułą wczesnej triage, w porównaniu do pełnego systemu lokalizacji dermatologicznej17. Wszystkie obrazy były zmieniane rozmiarem, normalizowane, standaryzowane, rozszerzone i oceniane w typowym wewnętrznym procesie treningowo-walidacyjnym. Głównym celem było porównanie zachowania konwencjonalnych i hybrydowych modeli głębokiego uczenia w przejrzystym benchmarku oraz wniosek, czy proponowana architektura hybrydowa oferuje lepszą równowagę między dyskryminacją a interpretowalnością w porównaniu do popularnych punktów wyjściowych.

Wyraźną luką, którą obecnie poprawiona wersja wypełnia, nie jest więc tylko prezentacja modelu hybrydowego, ponieważ strategie hybrydowego transformatora CNN zostały już omówione w literaturze. Zamiast tego rozbieżność polega na tym, że potrzebny był bardziej wyraźny, wewnętrznie spójny wskaźnik, który pomija główne binarne zadania i eksploracyjne wyniki wieloklasowe, charakteryzuje proces wstępnego przetwarzania i treningu w sposób powtarzalny oraz prezentuje wydajność modelu w sposób, który nie przecenia nowości ani klinicznej gotowości18. W tym kontekście warto rozważyć architekturę hybrydową, ponieważ CNN doskonale wyróżniają się w lokalnej ekstrakcji cech, a transformatorowa uwaga może teoretycznie modelować globalne konfiguracje zmian i dłuższe połączenia przestrzenne, aby wspomóc diagnostykęwzrokową 19. Praktyczne pytanie nie dotyczy tego, czy projekt hybrydowy będzie miał korzystną równowagę między rozróżnieniem, stabilnością i interpretowalnością w porównaniu z typowymi bazami dotyczącymi tego samego wyselekcjonowanego aspektu danych, lecz czy zapewnia dobrą równowagę opodatkowania, stabilności i interpretowalności.

Najnowsze prace nad analizą obrazów mpox można podzielić na trzy główne nurty badań metod. Pierwsza z nich wykorzystuje tradycyjne CNN i architektury transfer-learning ze względu na ich dojrzałość, efektywność obliczeniową oraz zdolność do uczenia się specyficznych dla zmian tekstur i lokalnych cech morfologicznych20. Drugi strumień umożliwia transformatorowi wzroku lub modelom z wzmocnioną uwagą możliwość uchwycenia szerszych powiązań przestrzennych na polu zmian, szczególnie gdy plamy tekstury składają się z kontekstowego rozkładu zmian, co może być równie ważne jak poszczególne fragmenty tekstury. Trzeci nurt dodaje konwolucyjne i uwagi, aby wspierać hybrydowe potoki, próbując utrzymać lokalną czułość CNN, wykorzystując jednocześnie możliwość modelowania kontekstowego bloków uwagi.

Mimo że większość tych prac deklaruje doskonałą dokładność, porównanie badań krzyżowych nie jest łatwym zadaniem ze względu na różnice w wielkości, strategii kuracji, składzie klas i projekcie walidacji między zbiorami danych21. Istnieją publikacje oceniające rozróżnienie binarne, a te, które oceniają wieloklasową kategoryzację dermatologiczną – niektóre są również zrównoważone pod względem dokładności i przypominania raportu, a inne skupiają się na dokładności22. Ponadto zgłoszone zbiory danych mpox mogą opierać się na zbiorach obrazów online, kuratorowanych kolekcjach lub rozszerzonych podzbiorach, co może zwiększyć raportowaną wydajność, gdy wycieki walidacji pociągów lub niemal duplikaty obrazów nie są dobrze zarządzane. Tabela 1 nie jest zatem jedynie kompendium wcześniejszych prac, lecz raczej schematyczną mapą rodzin modeli, ograniczeń zbioru danych oraz możliwości oferowanych metodami dostępnych w tym badaniu.

Wartość metodologiczna danej pracy odzwierciedla się w bardziej ograniczony i bardziej obronny sposób. W niniejszym artykule omówimy konieczność posiadania przezroczystego binarnego benchmarku z pomocą dostarczonego, kuratorowanego zbioru danych, przedstawimy procedurę wstępnego przetwarzania i treningu oraz bezpośrednio porównamy proponowany model hybrydowy z popularnymi bazami23. Zmiany te oddzielają także główny eksperyment binarny od dowodów multiklasowania uzupełniającego w sposób umożliwiający powiązanie roszczeń dotyczących wydajności z odpowiednim kontekstem eksperymentalnym24. Różnica ta ma decydujący wpływ na analizę dyskursywną zachowania modelu, raportowanych miar i praktyczności.

Głównym eksperymentem tego pisma jest eksperyment klasyfikacji binarnej na mniejszym zbiorze 2280 obrazów zmian skórnych, który został ręcznie wyselekcjonowany. W tym zbiorze danych liczba obrazów zidentyfikowanych jako mpox wynosiła 1 020, a tych sklasyfikowanych jako inne – 1 260. Druga kategoria obejmuje objawy dermatologiczne niezwiązane z mpox o charakterze wzrokowym, głównie zmiany, które w rękopisie określa jako zmiany przypominające ospę wietrzną i odrę25. Ta podwójna nomenklatura czyni tę grupę binarną klinicznie istotną jako prymitywną formułę przesiewową, ponieważ model pyta, czy model potrafi rozbić podejrzenia mpox i wizualnie mylące alternatywy, a jednocześnie jest mniej złożony niż pełny benchmark dermatologii wieloklasowej.

Trening modeli musiał być standaryzowany, a wszystkie obrazy musiały być wstępnie przetwarzane przed trenowaniem. W manuskrypcie wspomniane są także zmiany rozmiaru, normalizacja intensywności, augmentacja oraz konwersja etykiet kategorycznych na binarne. Jednak w zaktualizowanym znaczeniu te kroki są traktowane jako składniki powtarzalnego potoku, a nie jako notatki zapisywane na obrzeżach. Jego zestaw został dalej podzielony na podzbiory szkoleniowe i walidacyjne, składające się z katalogów, a wspomniane wskaźniki wydajności powinny być postrzegane jako wewnętrzne skutki walidacji, a nie jako wskaźniki całkowicie niezależnej grupy testów zewnętrznych. Dla jasności, ta kolekcja 2 280 zdjęć będzie traktowana jako oficjalne dane, na których zostanie przeprowadzona główna analiza. Ujęcie binarne zostało wybrane, ponieważ odzwierciedla wczesne pytanie o segregację, powszechne w praktyce: czy obraz podejrzanej zmiany bardziej prawdopodobne jest mpox niż inne podobne wizualnie schorzenia? To ujęcie jest ograniczone w porównaniu z rozbudowaną diagnozą dermatologiczną, ale stanowi ważny i technicznie interpretowalny punkt wyjścia do porównawczych benchmarków.

Zaktualizowany opis zbioru danych uwzględnia również fakt, że artykuł zawiera dodatkowe wyniki uzyskane przy pomocy różnych struktur klas lub wzbogaconych podzbiorów, które przedstawiono na Rysunkach 1A–I. Zamiast usuwać te materiały, rękopis umieszcza je teraz bezpośrednio w kontekście, umożliwiając czytelnikom przeglądanie wyników będących częścią binarnego benchmarku oraz tych będących częścią eksperymentów wtórnych. Ta metoda zachowa całą dokumentację tego badania, ale nie pozwoli na integrację żadnych niekompatybilnych eksperymentów w jedno twierdzenie.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

UWAGA: Do głównego eksperymentu użyj wyselekcjonowanego zbioru danych obrazów mpox binarnych opisanych w manuskrypcie. Zbiór danych zawiera 2 280 obrazów zmian skóry, w tym 1 020 obrazów mpox oraz 1 260 obrazów oznaczonych jako Inne. Używaj wyłącznie analizy obrazu wtórnego; Nie przeprowadzaj bezpośredniej rekrutacji pacjentów, interwencji klinicznej, eksperymentów na zwierzętach ani tworzenia nowych próbek biologicznych w ramach tego workflow.

1. Zdobyć i dopracować zbiór danych

  1. Zdefiniuj binarny schemat etykietowania z dwoma klasami: mpox i Inne.
  2. Przypisz wizualnie podobne zmiany niezwiązane z mpox do klasy In.
  3. Przefiltruj wszystkie obrazy pod kątem czytelności, tożsamości klasy oraz odpowiedniości do klasyfikacji obrazów nadzorowanych.
  4. Wyłącz nieużyteczne lub niejednoznaczne obrazy podczas kuracji.
  5. Organizuj wyselekcjonowane obrazy w folderach klas opartych na katalogach, aby następnie ładować je za pomocą generatorów obrazów.

2. Zmień rozmiar i normalizuj obrazy

  1. Przed trenowaniem modelu zmień rozmiar wszystkich obrazów do 150 x 150 pikseli.
  2. Stosuj interpolację bikubową podczas zmiany rozmiaru, aby zachować płynne przejścia obrazów.
  3. Skaluj intensywność pikseli, dzieląc każdą wartość piksela przez 255.
  4. Normalizuj wszystkie natężenia obrazu do zakresu [0,1].
    UWAGA: Stosuj tę samą procedurę rozdzielczości przestrzennej i normalizacji dla wszystkich modeli, aby zapewnić uczciwe porównanie między architekturami.

3. Wzbogać obrazy treningowe

  1. Stosuj augmentację tylko do podzbioru treningowego.
  2. Ustaw zakres obrotu na 20°.
  3. Ustaw zakres przesunięcia szerokości na 0,2.
  4. Ustaw zakres zmiany wysokości na 0,2.
  5. Ustaw zakres ścinania na 0,2.
  6. Ustaw zakres powiększenia na 0,2.
  7. Włącz poziome flipowanie.
  8. Użyj wypełnienia najbliższego sąsiada dla pikseli wprowadzonych podczas augmentacji.
  9. Wykonuj augmentację online podczas treningu, zamiast trwale duplikować pliki obrazów.
    UWAGA: Nie rozszerzaj obrazów walidacyjnych; Tylko je przeskaluj.

4. Zakoduj etykiety i podziel zbiór danych

  1. Zakoduj obie klasy jako etykiety binarne.
  2. Ładuj obrazy za pomocą generatorów opartych na katalogach w trybie klas binarnych.
  3. Ustaw rozmiar partii na 32.
  4. Podziel zbiór danych na podzbiory treningowe i walidacyjne.
    UWAGA: Manuskrypt raportuje wyłącznie wewnętrzne testy walidacyjne i nie zawiera niezależnej zewnętrznej grupy testowej.

5. Zbuduj podstawowe modele CNN

  1. Skonstruuj sekwencyjną bazę CNN z trzema blokami splotowymi.
  2. Użyj 32 filtrów w pierwszym bloku konwolucyjnym i podążaj za blokiem z maksymalną pulą.
  3. Użyj 64 filtrów w drugim bloku splotowym i podążaj za blokiem z maksymalną pulą.
  4. Użyj 128 filtrów w trzecim bloku splotowym i podążaj za nim z maksymalną pulą.
  5. Spłaszcz wyodrębnione mapy cech.
  6. Dodaj warstwę gęstą o 512 jednostkach.
  7. Aplikuj z rezygnacją ze studiów z wskaźnikiem 0,5.
  8. Do klasyfikacji binarnej używaj warstwy wyjściowej sigmoidalnej.
  9. Uwzględnij InceptionV3, ResNetV2, ResNet50 oraz DenseNet121 jako porównawcze architektury bazowe.
    UWAGA: Używaj tego samego kuratorowanego zbioru danych binarnych i potoku wstępnego do wszystkich porównań bazowych, gdzie to możliwe.

6. Zdefiniuj hybrydowy model transformatora CNN

  1. Użyj modułu CNN jako lokalnego enkodera cech.
  2. Wyodrębnij teksturę zmiany, krawędź oraz lokalne wzorce morfologiczne za pomocą składu CNN.
  3. Użyj modułu opartego na transformatorze jako enkodera kontekstu.
  4. Modeluj szersze zależności przestrzenne w wyuczonej reprezentacji za pomocą komponentu transformatora.
  5. Rzutuj wektory cech CNN i transformatora na tę samą wymiarowość i fuzuj je poprzez dodawanie elementów po elementach.
  6. Odwzoruj spójną reprezentację na binarny wynik mpox-versus-Other przez głowicę klasyfikacji.
    UWAGA: Raportuj architekturę hybrydową na poziomie modułu, jeśli liczba głowic uwagi, wymiarów osadzenia i warstw transformatora nie jest wyraźnie dostępna.

7. Proces szkoleniowy i praktyka wyceny

  1. Złóż binarny klasyfikator za pomocą zaimplementowanego modelu z optymalizatorem Adama, utratą entropii krzyżowej binarnej oraz dokładnością jako główną metryką treningową.
  2. Wytrenuj jasno zdefiniowany model bazowy dla 15 epok na wyselekcjonowanym zbiorze danych mpox-versus-inne.
  3. Wszystkie eksperymenty przeprowadz w środowisku głębokiego uczenia opartym na Pythonie na systemie wyposażonym w GPU, a zasoby oprogramowania i uogólnione środowisko obliczeniowe podsumowuj w Tabeli Materiałów.
  4. Monitoruj krzywe strat treningowych i walidacyjnych podczas treningu oraz obliczaj dokładność, precyzję, przypomnienie, F1-score i AUC dla każdego indywidualnego modelu, gdy jest dostępny.
  5. Interpretuj wydajność modelu, kładąc nacisk na spójność zachowań raportowania i uogólniania, a priorytetowo traktuj równowagę między czułością a specyficznością nad pojedynczymi wartościami dokładności szczytowej.
  6. Sformułuj dwa pytania ewaluacyjne dla każdego modelu: (i) jak dobrze model pasuje do danych treningowych oraz (ii) jak dobrze wyuczona reprezentacja przenosi się na obrazy walidacyjne z tego samego wyselekcjonowanego źródła.
    UWAGA: Przedstaw te dwa aspekty wyraźnie w rękopisie, aby odróżnić zdolność reprezentatywną od użytecznego uogólnienia.
  7. Interpretuj wysoką dokładność treningową jako dowód wystarczającej zdolności reprezentacyjnej, a wysoką i stabilną wydajność walidacji jako bardziej znaczący wskaźnik użytecznego uogólnienia.

8. Analizy eksperymentalne

  1. Raportuj tylko wyniki bezpośrednio poparte zarejestrowanymi wynikami i unikaj ekstrapolacji poza udokumentowane dowody.
  2. Wyraźnie określaj ograniczenia tam, gdzie brakuje informacji walidacyjnych lub gdy tabela odzwierciedla inną strukturę klas.
  3. Traktuj binarne zadanie klasyfikacji mpox-kontra-inne jako główną analizę i używaj go jako wewnętrznego odniesienia dla wszystkich eksperymentów.
  4. Przetłumacz oryginalny kod implementacyjny na protokół narracyjny oraz na Tabelę 2 , aby zbiór danych, środowisko programowe, rodziny modeli i konfiguracja treningowa były zwięźle podsumowane dla powtarzalności.
  5. Uogólnij opisy sprzętu i oprogramowania tak, aby nacisk pozostał na metodologicznej powtarzalności, a nie na jednej platformie specyficznej dla dostawcy.
  6. Wyniki modelowe są prezentowane w tej samej kolejności, w której wprowadzane są architektury, co ułatwia porównanie zachowań treningowych, walidacyjnych oraz kompletności raportowania.
  7. Opisz sekwencyjną bazową wartość CNN jako osiągającą bardzo wysoką wewnętrzną walidację, jednocześnie ostrzegając, że może to odzwierciedlać korzystne cechy podziału i nie uogólniać się na zewnątrz.
  8. Interpretuj model sekwencyjny jako silne wewnętrzne odniesienie, a nie ostateczną demonstrację wdrożalnej odporności diagnostycznej.
  9. Uzasadnienie zachowania oddzielnych paneli InceptionV3, ponieważ trajektorie strat i dokładności razem ujawniają efektywną optymalizację treningową, ale niespójne zachowania walidacyjne.
  10. Opisz ResNetV2 jako informacyjny, ale częściowo raportowany punkt wyjściowy, ponieważ porównywalne metryki walidacyjne nie były dostępne.
  11. Traktuj eksperyment wieloklasowy ResNet50 jako dowód uzupełniający odrębny od głównego binarnego benchmarku.
  12. Interpretuj DenseNet121 jako średni benchmark o konkurencyjnej, ale nie dominującej wydajności na zgłoszonym podzbiorze binarnym.
  13. Opisz hybrydowy transformator CNN jako osiągający zrównoważoną dyskryminację klasową, a nie jednostronny wzrost w jednym wskaźniku.
  14. Unikaj twierdzenia, że model hybrydowy ma uniwersalną wyższość nad wszystkimi bazami, ponieważ niektóre modele były oceniane w różnych warunkach raportowania.
  15. Pozycjonuj model hybrydowy jako obiecujący kompromis między wysoką wydajnością walidacji a równowagą metryczną i zaleć dalszą ocenę na standaryzowanych, zewnętrznie testowanych benchmarkach.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Porównanie wykraczające poza dokładność nagłówków

Wyniki pokazują, że porównania modeli w analizie obrazów medycznych powinny koncentrować się nie tylko na dokładności nagłówków, ale także na zachowaniu architektur w odniesieniu do wielu wskaźników i różnych środowisk eksperymentalnych. Przez całe eksperymenty modele nie zachowywały się podobnie: prosty sekwencyjny CNN osiągał bardzo wysoką wydajność na wewnętrznym podziale walidacji, InceptionV3 był nadmiernie dopasowany, Res...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Kluczowym rezultatem badania jest możliwość binarnej klasyfikacji mpox versus wizualnie podobnych zmian, zwanej klasyfikacją automatyczną, dzięki wyselekcjonowanemu zbiorowi danych użytemu w tym badaniu, jednak taki sukces w dużej mierze zależy od interpretacji dowodów27. Odpowiednio rozdzielając eksperymenty, manuskrypt przedstawia dowody na to, że zarówno konwencjonalne, jak i proponowane architektury hybrydowe mogą być użyte do osiągnięcia silnej wydajności28. Dlatego ni...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy deklarują, że nie mają znanych konkurujących ze sobą interesów finansowych ani niefinansowych, które mogłyby wpłynąć na pracę opisaną w tym manuskrypcie.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy z wdzięcznością doceniają wsparcie finansowe otrzymane od Vel Tech Rangarajan Dr. Sagunthala R&D Institute of Science and Technology, w ramach Funduszu Badawczo-Rozwojowego (RDF), Grant nr VTU/RDF/FY2026-27/009. To wsparcie było kluczowe dla pomyślnej realizacji tych badań.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Zbiór danychKuratorowany zbiór danych obrazów mpox; 2 280 obrazów dla głównego benchmarku binarnego (1 020 mpox i 1 260 innych)Źródło podstawowego szkolenia i wewnętrznej walidacji
Definicja zadaniaKlasyfikacja binarna dla badania podstawowego; Uzupełniające podsumowania wieloklasowe i rozszerzone zachowane oddzielnieZapewnia spójną interpretację raportowanych wskaźników
Środowisko programistyczneWorkflow notatników oparty na PythonieObsługa danych, trenowanie modeli i wykresy
Ramy uczenia głębokiegoImplementacja TensorFlow / Keras została zgłoszona w przesłanym kodzieRozwój i optymalizacja modeli
Narzędzia obrazoweImageDataGenerator z przeskalowaniem i augmentacją; Biblioteki do rysowania krzywych treningowychWstępne przetwarzanie, augmentacja i raportowanie wizualne
Architektury bazoweSequential CNN, InceptionV3, ResNetV2, ResNet50, DenseNet121Porównawcze porównanie
Proponowana architekturaHybrydowy klasyfikator transformatora CNNGłówny wkład metodologiczny
Ustawienia treningoweRozmiar wejścia 150 x 150; wielkość partii 32; Adam optymalizator; binarna entropia krzyżowa; 15 epok zgłoszonych dla dostarczonego kodu bazowegoPowtarzalność rdzeniowego przepływu pracy
Środowisko obliczeniowesystem obliczeniowy z GPU; Szczegóły sprzętowe uogólnione w narracjiPrzyspieszanie modelu podczas treningu

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Diagnostyka ospy ma piejhybrydowe g bokie uczenieklasyfikacja obraz w medycznychobrazy zmian sk rnychklasyfikacja binarnaaugmentacja obrazuwalidacja modelu

Powiązane artykuły