Methodenartikel

MixKNet: een gemodificeerd U-vormig netwerk met hybride kanaalconvolutie voor segmentatie van medische beelden

DOI:

10.3791/68450

15 juli 2025

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie presenteert een lichtgewicht U-Net-variant met verbeterde segmentatienauwkeurigheid met behulp van hybride convolutie en kanaalaandacht, waardoor state-of-the-art resultaten worden bereikt op MoNuseg en GlaS met minder parameters.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Kunstmatige neurale netwerkgebaseerde computerbeeldverwerkingstechnologie heeft zich de afgelopen jaren snel ontwikkeld en wijdverbreide toepassingen gevonden op meerdere gebieden. In de medische beeldverwerking hebben UNet en zijn varianten veel succes geboekt bij het detecteren van laesies, celsegmentatie en poliepsegmentatie. Dit onderzoek presenteert een gemodificeerd U-vormig netwerk met verminderde netwerkparameters die worden bereikt door de netwerkdiepte te verkleinen en de netwerkkanalen te vergroten om het leervermogen van het model te verbeteren. Om de vermindering van het leervermogen als gevolg van dieptecompressie tegen te gaan, wordt een convolutionele module met hybride kanalen geïntroduceerd ter vervanging van de convolutionele module van het oorspronkelijke netwerk. Het model introduceert een kanaalaandachtsmechanisme tussen de laag en de puntconvolutielaag om het praktische extractievermogen van de kanaalfunctie te verbeteren. Het artikel concludeert ook dat het gebruik van convolutie met gemengde diepte de groottespanwijdte van het segmentatiedoel effectief kan oplossen, waardoor het moeilijk wordt om één model geschikt te maken voor meerdere datasets. Het voorgestelde model behaalt state-of-the-art resultaten op twee populaire openbare datasets, MoNuseg en GlaS, met een gemiddelde dobbelsteentoename van respectievelijk 1,0% en 1,37%. De totale parameters van het gewijzigde model zijn teruggebracht tot 1,71 miljoen, wat neerkomt op een vermindering van 38,6x in vergelijking met UCtransNet, met 65,6 miljoen parameters.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Segmentatie van medische beelden is van cruciaal belang in verschillende klinische toepassingen, waaronder diagnose, behandelplanning en ziektebewaking. Traditionele beeldverwerkingsmethoden op basis van feature engineering-algoritmen zijn niet langer geschikt voor het verwerken van de grote hoeveelheden gegevens die in moderne zorgomgevingen worden gegenereerd. Gelukkig hebben de vooruitgang van kunstmatige neurale netwerktechnologie en verbeteringen in de mogelijkheden van computerhardware het mogelijk gemaakt om grootschalige neurale netwerkmodellen te trainen en in te zetten. Als gevolg hiervan worden computervisieverwerkingsalgoritmen op basis van machine learning-modellen continu ontwikkeld en toegepast op verschillende gebieden.

De meest representatieve modelstructuur in de semantische segmentatie van medische beelden is UNet1 met een coderings-decoderingsarchitectuur. Het model gebruikt eerst een encoder met meerdere niveaus om kenmerken van verschillende schalen uit het invoerbeeld te extraheren. Vervolgens upsamplet de decoder stap voor stap terwijl de semantische kenmerken van de encoder van het overeenkomstige niveau worden gecombineerd als een skip-verbinding. De prestaties van de UNet-architectuur kunnen echter verder worden verbeterd door verschillende methoden toe te passen. Het is bijvoorbeeld aangetoond dat aandachtsmechanismen effectief zijn bij het verbeteren van de prestaties van convolutionele neurale netwerken. Deze mechanismen kunnen selectief de essentiële kenmerken in de invoergegevens benadrukken, wat leidt tot een betere representatie, leren en segmentatienauwkeurigheid.

Op dit moment richten veel onderzoekers zich op het effectief samenvoegen van de functies die door de encoder in de decoderingsfase zijn geëxtraheerd. Enkele van de meest voorkomende varianten van UNet zijn Attention UNet2, Recurrent UNet3 en V-Net4. Deze benaderingen maken gebruik van aandachtsmechanismen5, zoals ruimtelijke aandacht, om informatieve gebieden van de functiekaarten te markeren en de niet-informatieve regio's te onderdrukken. Bovendien bevatten sommige varianten terugkerende neurale netwerken om de sequentiële aard van de medische beelden te modelleren en de functierepresentaties te verbeteren. Pre-trainingsmodellen, zoals VGG6, ResNet7 en DenseNet8, zijn op grote schaal gebruikt om de prestaties van U-vormige netwerken te verbeteren door gebruik te maken van hun rijke kennis die is opgedaan in grootschalige datasets. Bovendien zijn transformatormechanismen, zoals zelfaandacht en aandacht van meerdere koppen, geïntroduceerd in modelafhankelijkheden op lange termijn en leggen ze wereldwijde contextuele informatie vast, wat leidt tot betere segmentatieprestaties.

Hoewel deze varianten zijn verbeterd ten opzichte van de oorspronkelijke UNet1, hebben ze nog steeds bepaalde beperkingen bij het verwerken van complexe medische beelden met verschillende schalen en vormen. Bovendien leidt de toegenomen complexiteit van deze varianten vaak tot hogere rekenkosten en langere trainingstijden, wat hun toepasbaarheid in de praktijk beperkt.

Om de UNet1-architectuur te verbeteren, wordt een aangepast model met de naam MixKNet (Mix Kernel Size U-shape Net) voorgesteld, dat de netwerkdiepte vermindert en tegelijkertijd het aantal kanalen vergroot om de leercapaciteit te verbeteren. De vermindering in diepte kan echter leiden tot een afname van de algehele prestaties. Om dit probleem op te lossen, wordt een convolutionele module met hybride kanalen geïntroduceerd, die de oorspronkelijke convolutionele neurale module vervangt. Deze module bevat een kanaalaandachtsmechanisme tussen de diepte- en puntsgewijze convolutielagen, met als doel het vermogen van het model om effectieve kanaalkenmerken te extraheren te versterken.

Om de praktische toepasbaarheid te begeleiden, is het belangrijk op te merken dat de voorgestelde methode werd geëvalueerd op relatief kleinschalige medische beelddatasets, met individuele beeldresoluties variërend van 500 × 500 tot 1000 × 1000 pixels. Voor modeltraining werden alle afbeeldingen verkleind tot 224 × 224 pixels. De implementatie werd uitgevoerd met behulp van PyTorch op een enkele NVIDIA RTX 3090 GPU. Deze operationele parameters suggereren dat de methode computationeel haalbaar is voor matige experimentele opstellingen en kan worden aangepast aan beperkte datasetgroottes.

Concluderend presenteert dit artikel een nieuwe wijziging in de U-vormige netwerkstructuur en introduceert het een hybride kanaalconvolutiemodule samen met een kanaalaandachtsmechanisme, die beide de segmentatieprestaties op medische beelddatasets verbeteren. De belangrijkste bijdragen van dit werk zijn de volgende: (1) Voorstellen van een gewijzigde U-vormige netwerkstructuur met een hybride deep-wised convolutiemodule die de oorspronkelijke convolutionele neurale module vervangt. (2) Introductie van een kanaalaandachtsmechanisme tussen de diepe en de puntige convolutielaag om het effectieve extractievermogen van het model te verbeteren. (3) Het gelijktijdig bereiken van state-of-the-art resultaten op twee populaire openbare datasets in de MoNuseg9 nucleaire segmentatiedataset met aanzienlijk minder modelparameters (vergeleken met UCtransNet10 met 64M-parameters) en verbeterde prestaties op de GlaS11 kliersegmentatiedataset.

De rest van dit artikel is als volgt ingedeeld. Stap 2 biedt een uitgebreid overzicht van eerdere studies over UNet1 en de variaties in medische beeldsegmentatie. De sterke punten en beperkingen van bestaande benaderingen worden onderzocht, samen met gerelateerd werk aan aandachtsmechanismen, mixed-depthwise convolutionele netwerken en hun toepassingen in segmentatiemodellen. Stap 3 beschrijft de architectuur van het voorgestelde MixKNet-model, inclusief wijzigingen in de UNet-structuur, de integratie van een kanaalaandachtsmechanisme en het gebruik van convolutie met gemengde diepte. Stap 4 rapporteert de resultaten van uitgebreide experimenten, vergezeld van een discussie en een ablatiestudie om de bijdragen van elk onderdeel te evalueren. Ten slotte concludeert stap 5 het artikel en schetst het mogelijke richtingen voor toekomstig onderzoek.

Dit deel begint met een overzicht van eerdere studies over UNet en zijn varianten in medische beeldsegmentatie, waarbij de sterke punten en beperkingen van bestaande methoden worden geschetst. Daarnaast wordt gerelateerd onderzoek naar aandachtsmechanismen en hun toepassingen in segmentatiemodellen besproken. Recente ontwikkelingen met betrekking tot diepgaande convolutietechnieken voor het verbeteren van segmentatieprestaties worden ook onderzocht. Een vergelijkende analyse van de voorgestelde MixKNet (c) en andere modellen wordt weergegeven in figuur 1, waar stippellijnen skip-verbindingen aangeven.

UNet en zijn variaties
De UNet-architectuur werd voor het eerst voorgesteld door Ronneberger et al. in 20151 en wordt sindsdien veel gebruikt in de segmentatie van medische beelden. Het model bestaat uit een coderingspad en een decoderingspad. De encoder extraheert kenmerken op hoog niveau uit het invoerbeeld, terwijl de decoder de functies upsamplet en combineert om een segmentatiekaart te genereren. Sindsdien zijn er verschillende wijzigingen aangebracht in de UNet-architectuur om de prestaties op het gebied van medische beeldsegmentatie te verbeteren. Een van de meest voorkomende wijzigingen is de introductie van skip-verbindingen, waarvan is aangetoond dat ze de nauwkeurigheid van de segmentatie verbeteren. Zhou et al.12 stelden een UNet-variant voor die gebruik maakt van dichte skip-verbindingen, waardoor het model ruimtelijke informatie beter kan bewaren.

Een andere populaire wijziging aan de UNet-architectuur is de toevoeging van aandachtsmechanismen. Deze mechanismen kunnen het model helpen om selectief de belangrijkste kenmerken te benadrukken, wat leidt tot een betere representatie, leren en segmentatienauwkeurigheid. Enkele voorbeelden van varianten met aandachtsmechanismen zijn Attention UNet2, ResUNet met attention gates13 en Dense-UNet met attention gates14. Naast de bovenstaande wijzigingen zijn er nog vele andere varianten van de UNet-architectuur voorgesteld voor segmentatie van medische beelden. UCTransNet10 is een variant van de U-Net-architectuur die skip-verbindingen en een Transformer-module bevat. De skip-verbindingen in UCTransNet10 zijn heroverwogen vanuit een kanaalgewijs perspectief, wat een beter hergebruik van functies mogelijk maakt en het aantal parameters vermindert. De Transformer-module is toegevoegd om afhankelijkheden op lange afstand vast te leggen en de vertaalkwaliteit te verbeteren. Het is aangetoond dat UCTransNet10 state-of-the-art resultaten behaalt op verschillende benchmarks voor machinevertalingen. Zihan et al. stelde een deep learning-model voor, LViT15 genaamd, dat ze toepasten op medische beeldanalysetaken. Om de semi-gesuperviseerde versie van LViT15 uit te breiden en het kwaliteitstekort in beeldgegevens te compenseren, stelden ze het Exponential Pseudo Label Iteration-mechanisme (EPI) voor. Om de lokale kenmerken van afbeeldingen te behouden, stelden ze bovendien de Pixel-Level Attention Module (PLAM) voor, die zich selectief richt op belangrijke afbeeldingskenmerken.

Attentie mechanisme
Aandachtsmechanismen zijn uitgebreid bestudeerd in machine learning, met name in natuurlijke taalverwerking en computervisie. In de afgelopen jaren zijn aandachtsmechanismen ook toegepast op medische beeldanalysetaken, waaronder beeldsegmentatie. Bahdanau et al.16 introduceerden een aandachtsmechanisme in neurale machinevertaling om de kwaliteit van de vertaling te verbeteren. Het mechanisme stelt het model in staat om selectief te focussen op relevante delen van de invoersequentie, waardoor de vertaalkwaliteit wordt verbeterd. Sindsdien zijn er verschillende aandachtsmechanismen voorgesteld voor beeldanalysetaken. Een veelvoorkomend type aandachtsmechanisme is het ruimtelijke aandachtsmechanisme, waarbij een gewicht wordt toegepast op elke pixel in de functiekaart op basis van het belang ervan. Guo et al.17 stelden bijvoorbeeld een ruimtelijk aandachtsmechanisme voor de taak van segmentatie van retinale vaten. Het mechanisme maakt gebruik van een poortmechanisme om de weging van de ruimtelijke kenmerken aan te passen, waardoor het model beter in staat is om onderscheid te maken tussen de pixels van het schip en niet-schepen. Een ander type aandachtsmechanisme is kanaalaandacht, dat zich richt op het aanpassen van het gewicht van functiekaarten over kanalen heen. Hu et al.18 stelden een squeeze-and-excitation network (SENet) voor dat kanaalgewijze aandacht toepast op de feature maps, waardoor de prestaties van de beeldclassificatietaak worden verbeterd. Meer recentelijk zijn aandachtsmechanismen gecombineerd met convolutionele neurale netwerken (CNN's) voor beeldsegmentatietaken. Chen et al.19 stelden bijvoorbeeld een aandachtsgeleid netwerk voor hersentumorsegmentatie voor dat ruimtelijke en kanaalgewijze aandachtsmechanismen combineert.

Recente ontwikkelingen op het gebied van semi-gesuperviseerd en multimodaal leren voor medische beeldanalyse en teledetectie hebben veelbelovende prestatieverbeteringen aangetoond. Yang et al.20 stelden UMSCS voor, een nieuw ongepaard multimodaal segmentatiekader dat gebruikmaakt van cross-modaliteit generatief leren en semi-gesuperviseerde strategieën. Zhang et al. introduceerden verschillende geavanceerde technieken: een bewijskrachtig drietaks consistentiemodel voor semi-gesuperviseerde segmentatie21, een zelfbewust en cross-sample prototypisch leerraamwerk voor medische beeldsegmentatie22, en een tijdfrequentiebewuste hiërarchische benadering voor functie-optimalisatie voor herkenning van synthetische apertuurradar (SAR) in het lucht- en ruimtevaartdomein23. Deze werken benadrukken samen het belang van hybride supervisie en domeinbewuste functiemodellering in zowel medische als technische beeldvormingstaken.

Diepte-gewelfde convolutie
Dieptegewijze convolutie is ontworpen om kanaalgewijze correlaties vast te leggen in de invoerfunctiekaarten en het is aangetoond dat het de efficiëntie en nauwkeurigheid van convolutionele neurale netwerken verbetert.

Een van de vroegste en meest invloedrijke dieptegewijze convolutiemodellen is MobileNet24, voorgesteld door Howard et al. in 2017. MobileNet maakt gebruik van scheidbare convolutie op de diepte, waarbij een convolutie op de diepte wordt toegepast, gevolgd door een puntsgewijze convolutie, om het aantal parameters en berekeningen dat nodig is voor convolutionele lagen te verminderen. Hierdoor kan MobileNet state-of-the-art nauwkeurigheid bereiken bij beeldclassificatietaken, terwijl het aanzienlijk minder parameters gebruikt dan traditionele convolutionele neurale netwerken. Sinds de introductie van MobileNet zijn er een aantal andere diepgaande convolutiearchitecturen voorgesteld, waaronder ShuffleNet25, Xception26 en ResNeXt27. Deze modellen variëren in hun specifieke implementatie van deep-wise convolutie, maar ze hebben allemaal het doel om de computationele complexiteit van convolutionele lagen te verminderen met behoud of verbetering van de nauwkeurigheid. Diepe convolutie is ook toegepast op de taak van semantische segmentatie, waarbij modellen zoals PSPNet28 dieptegewijze scheidbare convolutie gebruiken om de reken- en geheugenvereisten van grootschalige convolutionele lagen te verminderen. MixNet29 breidt het idee van deep-wise convolutie verder uit door een gemengde depth-wise convolutie te introduceren, die gebruik maakt van meerdere kernelgroottes om functies op verschillende schalen vast te leggen. Het is aangetoond dat het beter presteert dan andere state-of-the-art modellen met behoud van vergelijkbare parameters en FLOP's. Deze modellen hebben aanzienlijke verbeteringen in nauwkeurigheid en efficiëntie aangetoond ten opzichte van traditionele convolutionele neurale netwerken bij verschillende semantische segmentatietaken.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

In dit gedeelte wordt de voorgestelde MixKNet-architectuur voor segmentatie van medische beelden beschreven. Het MixKNet-model breidt de UNet-architectuur uit en bevat aandachtsmechanismen en gemengde convolutielagen in de diepte. De software die in dit onderzoek is gebruikt, staat vermeld in de Materiaaltabel.

1. Algemene architectuur

  1. De MixKNet-architectuur, weergegeven in figuur 2, volgt de standaard UNet-structuur, bestaande uit een encoder en een decoder. Stel de invoervorm in op 224 × 224 × 3. Gebruik in de encoder twee DownBlock-modules, elk met een 1×1 dieptegewijze convolutie, een maximale poolinglaag van 2×2 en een multi-kernel convolutie (MDConv) met kernelgroottes zoals [1, 3, 5] of [3-13].
  2. Gebruik in de decoder twee UpBlock-modules: elk voert bilineaire upsampling, verbindingsaaneenschakeling overslaan, een 1×1 dieptegewijze convolutie en een multi-kernel convolutie uit.
  3. Gebruik ReLU-activeringen na elk convolutioneel blok. Pas een laatste 1×1 convolutie toe om de uitvoer te produceren, gevolgd door een Sigmoïde activering voor binaire segmentatie, of laat uitgeschakeld voor externe Softmax in taken met meerdere klassen.

2. Afgeplatte U-vorm

OPMERKING: Verminder de diepte van de neurale netwerkarchitectuur om de computationele complexiteit en modelgrootte te verminderen, terwijl u zich ervan bewust bent dat dit de capaciteit om complexe gegevensrepresentaties te leren kan verminderen.

  1. Breng een UNet-architectuur met vier niveaus terug tot een versie met twee niveaus, zoals weergegeven in afbeelding 3, om het aantal modelparameters te verminderen met behoud van de kerncoderings- en decoderingscomponenten.
    1. Bouw de afgevlakte architectuur door niveaus 3 en 4 te verwijderen uit zowel het coderings- als het decoderpad, en behoud functieverbindingen op niveau 2.
    2. Pas de downsampling en upsampling bewerkingen dienovereenkomstig aan om overeen te komen met de verminderde diepte, gebruik slechts één downsampling stap voor het knelpunt en één upsampling stap erna.
      OPMERKING: Deze vermindering in diepte kan het leervermogen van het model verminderen, omdat het mogelijk geen complexe relaties tussen invoer en uitvoer vastlegt. Door het aantal basisconvolutiekanalen in elke modellaag te vergroten, kan deze beperking worden overwonnen door het vermogen van het model om discriminerende kenmerken te leren te verbeteren. Met meer convolutiekanalen kan het model complexere patronen en relaties in de invoergegevens vastleggen, waardoor de verminderde diepte wordt gecompenseerd en de prestaties worden verbeterd.
  2. Bedenk dat het vergroten van het aantal convolutiekanalen ook de computationele complexiteit en het geheugengebruik van het model kan verhogen, wat een afweging vormt voor training en inferentiesnelheid. Zoek een juiste balans tussen modelcapaciteit en rekenefficiëntie.

3. Meng de korrelgrootte voor de encoder

  1. Om de prestaties van de encoder te verbeteren, gebruikt u een benadering met gemengde kernelgrootte in de DC-CA-module (Depthwise Convolution and Channel Attention), zoals geïllustreerd in afbeelding 4. In plaats van te vertrouwen op een enkele kernelgrootte, past u meerdere diepgaande convoluties toe parallel aan verschillende kernelgroottes (bijv. 1, 3, 5, 7, 9, 11, 13) om objecten op meerdere receptieve velden te extraheren.
  2. Pas batchnormalisatie en ReLU-activering toe op elke tak afzonderlijk vóór aaneenschakeling. Consecuteer de uitvoer van elke kerneltak langs de kanaaldimensie.
  3. Gebruik een puntsgewijze 1×1 convolutie na aaneenschakeling om functies samen te voegen en projecteer ze op een vast aantal uitvoerkanalen, waarbij de consistentie met de verwachte invoergrootte van de volgende laag behouden blijft.
    OPMERKING: De gemengde convolutielaag in de diepte bestaat uit meerdere convoluties in de diepte met verschillende korrelgroottes, gevolgd door een puntsgewijze convolutie. Dit ontwerp maakt het mogelijk om kenmerken op verschillende schalen vast te leggen, wat van cruciaal belang is bij segmentatietaken voor medische beelden. De eerste module maakt gebruik van drie kernelgroottes - 1, 3 en 5 - om het receptieve veld te vergroten, terwijl de tweede module grotere kernelgroottes en meer groepen gebruikt, met name 3, 5, 7, 9, 11 en 13.

4. Aandacht kanaliseren

  1. Integreer een kanaalaandachtsmechanisme in de DC-CA-module om de weergave van functies te verbeteren.
    1. Gebruik een 1×1 convolutie met "dezelfde" opvulling om kanaalgewijze aandachtskaarten te genereren. Pas globale gemiddelde pooling toe over ruimtelijke dimensies om een compacte descriptor voor elk kanaal te produceren.
    2. Gebruik een lichtgewicht convolutioneel netwerk dat bestaat uit twee 1×1 convoluties met een ReLU-activering ertussen. Vermijd gewichtsverdeling tussen kanalen - leer unieke aandachtsgewichten per kanaal.
    3. Pas een sigmoïde activering toe op de uiteindelijke uitvoer om genormaliseerde aandachtsscores te verkrijgen. Herweeg de toewijzingen van invoerfuncties via kanaalgewijze vermenigvuldiging.
      OPMERKING: Laat de invoertensor x zijn. Kanaalaandacht wordt geïmplementeerd door middel van de volgende expressie:
      (let op)_tensor = σ(conv(ReLU(conv(x)))) (1)
      waarbij σ staat voor de sigmoïde activeringsfunctie, conv voor de convolutiebewerking en ReLU voor de gerectificeerde lineaire eenheidsactiveringsfunctie.
  2. Verkrijg de aandachtskaart door een adaptieve gemiddelde pooling-bewerking uit te voeren op de aandachtstensor, gevolgd door deze uit te breiden om overeen te komen met de grootte van de uitvoertensor na convolutie met een andere kernelgrootte y:
    aandacht = uitbreiden(avg_pool([aandacht]_tensor),grootte(y)) (2)
  3. Bereken de uitvoertensor z door elementsgewijze vermenigvuldiging van de invoertensor y uit te voeren met de aandachtskaart:
    z = z * aandacht (3)
    waarbij * staat voor elementgewijze vermenigvuldiging

5. Gegevensreeksen

OPMERKING: In dit onderzoek worden twee openbaar beschikbare datasets voor medische beelden gebruikt, zoals weergegeven in tabel 1 en tabel 2: GlaS (Sirinukunwattana et al.11) en MoNuSeg (Kumar et al.9).

  1. Gebruik de Gland Segmentation-dataset (Sirinukunwattana et al.11), verkregen met behulp van een digitale pathologiescanner en handmatig geannoteerd om individuele klierstructuren in weefselmonsters te segmenteren.
    OPMERKING: De dataset bestaat uit 165 afbeeldingen, elk met een resolutie van 500 × 500 pixels, samen met bijbehorende segmentatiemaskers voor grondwaarheid. De MoNuSeg-dataset (Kumar et al.9) bestaat uit 51 afbeeldingen van microscopisch kleine kernen, elk met een resolutie van 1000 × 1000 pixels.

6. Details van de implementatie

  1. Implementeer het model met behulp van PyTorch op een enkele NVIDIA RTX 3090 GPU. Gebruik Ubuntu 22.04 als besturingssysteem.
  2. Wijzig het formaat van alle invoerafbeeldingen naar een vaste grootte van 224 × 224 pixels. Pas data-augmentatietechnieken toe om de diversiteit van trainingen te vergroten.
    1. Pas augmentaties willekeurig toe in de volgende volgorde: horizontale flip → verticale flip → rotatie → gammacorrectie → logaritmische transformatie → willekeurige schaling.
    2. Pas willekeurige horizontale flips toe met een waarschijnlijkheid van 0,5, verticale flips met een waarschijnlijkheid van 0,5 en rotaties binnen ±15 graden met een waarschijnlijkheid van 0,5.
    3. Pas gammacorrectie toe met een waarschijnlijkheid van 0,3, logaritmische transformatie met een waarschijnlijkheid van 0,3 en willekeurige schaling met een schaalfactor tussen 0,9 en 1,1, toegepast met een waarschijnlijkheid van 0,3.
    4. Normaliseer afbeeldingen met behulp van gemiddelde waarden van [0,485, 0,456, 0,406] en standaarddeviaties van [0,229, 0,224, 0,225].
  3. Train het model met behulp van de Adam-optimizer met een leersnelheid van 0,001 en een batchgrootte van 4. Gebruik de Cosinus Gloeien met Warm Restarts leersnelheidsplanningstechniek om variabiliteit in het leersnelheidsschema te introduceren en convergentie naar lokale optima te voorkomen.
    OPMERKING: Gebruik de ingebouwde torch.optim.lr_scheduler van PyTorch. CosineAnnealingWarmRestarts scheduler. De optimizer en scheduler zijn als volgt geïmplementeerd:
    optimizer = fakkel.optim.Adam(model.parameters(), lr=0.001, weight_decay=1e-5)
    planner = torch.optim.lr_scheduler. CosineGloeienWarmStart opnieuw(
    optimizer, T_0=10, T_mult=2, eta_min=1e-6)
    Hier geeft T_0=10 het aantal epochs aan vóór de eerste herstart, T_mult=2 verdubbelt de herstartperiode na elke cyclus, en eta_min=1e-6 stelt de minimale leersnelheid in. Werk de leersnelheid aan het einde van elk tijdperk bij door scheduler.step() aan te roepen.
  4. Gebruik binaire kruisentropie als verliesfunctie. Breng vroegtijdig stoppen aan om overfitting te voorkomen. Train het model voor maximaal 5000 epochs.
  5. Evalueer de modelprestaties met behulp van de gemiddelde Intersection over Union (mIoU) en de dobbelsteencoëfficiënt.
    Dobbelstenen =(2|A∩B|)/(|EEN|+|B|) (4)
    IoU=(|A∩B|)/(|A∪B|) (5)
    OPMERKING: De mIoU is de verhouding van de intersectie tussen de voorspelde en grondwaarheidssegmentatiemaskers tot hun vereniging. Tegelijkertijd is de dobbelsteencoëfficiënt de verhouding van tweemaal het snijpunt tot de som van de voorspelde en grondwaarheidssegmentatiemaskers.
  6. Voer een rigoureuze evaluatie uit op kleine datasets met behulp van drie rondes van 5-voudige kruisvalidatie, wat resulteert in een totaal van 15 evaluaties. Schud willekeurig de kruisvalidatiesplitsingen in elke ronde om variabiliteit tussen vouwen te garanderen. Stratificeer de vouwen op basis van klasseverdelingen om het labelevenwicht binnen elke vouw te behouden.
  7. Bereken de gemiddelde prestaties over vouwen om het risico van convergentie naar lokale optima te beperken. Voer een statistische test uit om aan te tonen dat de voorgestelde aanpak statistisch significante verbeteringen oplevert ten opzichte van vergelijkbare methoden.
  8. Toon representatieve validatievoorspellingen tijdens de training in Figuur 5 om de geleidelijke verbetering van de segmentatiekwaliteit te illustreren. Nadat de training is voltooid, laadt u het best presterende modelcontrolepunt op basis van validatieprestaties (bijv. hoogste mIoU- en dobbelsteenscore).
    1. Voer het model uit op de validatieset om voorspelde segmentatiemaskers te genereren met behulp van de opgeslagen parameters.
    2. Visualiseer de resultaten met Matplotlib door de invoerafbeelding, het grondwaarheidsmasker en het voorspelde masker naast elkaar weer te geven.
    3. Benadruk de superioriteit van de voorgestelde methode op het gebied van segmentatieprestaties door representatieve regio's te markeren met rode vakken in de visualisatie.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Vergelijking met state-of-the-art methoden
De MixKNet-architectuur is geëvalueerd op twee datasets voor medische beeldsegmentatie, GlaS en MoNuSeg, en vergeleken met state-of-the-art methoden in het veld. De evaluatie is uitgevoerd door de dobbelsteen- en IoU-scores van de voorgestelde methode en verschillende vergelijkbare modellen te rapporteren, zoals weergegeven in tabel 3. De resultaten geven aan dat de MixKNet-ar...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie presenteert MixKNet, een nieuwe wijziging van de UNet1-architectuur voor medische beeldsegmentatie, waarbij convolutie met gemengde diepte en een kanaalaandachtsmechanisme worden geïntegreerd om de segmentatieprestaties te verbeteren en tegelijkertijd de computationele complexiteit aanzienlijk te verminderen. De hybride kanaalconvolutie combineert meerdere convolutionele kernels die op afzonderlijke kanaalgroepen werken. Dit ontwerp stelt het netwerk i...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs verklaren geen tegenstrijdige financiële belangen of andere belangenconflicten.

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De tweede batch van Ningbo City's 2023 Social Welfare Research Projects: onderzoek en toepassing van sleuteltechnologieën voor identificatie van telecomnetwerkfraude op basis van ontologie en NLP (2023S169).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
Linux OS (Ubuntu 22.04) Various (Open Source Community)N/A(Version 22.04 LTS)Open-source besturingssysteem voor ontwikkeling
https://releases.ubuntu.com/22.04/
NVIDIA RTX 3090 GPUNVIDIA3090Hoogwaardige GPU voor deep learning
https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/
PythonPython Software FoundationN/A (Versie ≥ 3.8)Programmeertaal voor AI/ML ontwikkeling
https://www.python.org/
PyTorchMeta AIN/A (Versie 1.13)Open-source machine learning framework
https://pytorch.org/
Visual Studio Code (VS Code)MicrosoftN/ALichtgewicht en krachtige code-editor
https://code.visualstudio.com/

Referenties

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ronneberger, O., Fischer, P., Brox, T. U-Net: Convolutional networks for biomedical image segmentation. Med Image Comput Comput Assist Interv. 9351, 234-241 (2015).
  2. Oktay, O., et al. Attention U-Net: Learning where to look for the pancreas. arXiv. , (2018).
  3. Alom, M. Z., Yakopcic, C., Hasan, M., Taha, T. M., Asari, V. K. Recurrent residual U-Net for medical image segmentation. J Med Imaging. 6 (1), 014006-014006 (2019).
  4. Milletari, F., Navab, N., Ahmadi, S. -A. V-Net: Fully convolutional neural networks for volumetric medical image segmentation. 3DV. , 565-571 (2016).
  5. Vaswani, A., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  6. Simonyan, K., Zisserman, A. Very deep convolutional networks for large-scale image recognition. arXiv. , (2014).
  7. Deep residual learning for image recognition. He, K., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 770-778 (2016).
  8. Densely connected convolutional networks. Huang, G., Liu, Z., Van der Maaten, L., Weinberger, K. Q. Proc IEEE Conf Comput Vis Pattern Recognit, , 4700-4708 (2017).
  9. Kumar, N., et al. A dataset and a technique for generalized nuclear segmentation for computational pathology. IEEE Trans Med Imaging. 36 (7), 1550-1560 (2017).
  10. Wang, H., Cao, P., Wang, J., Zaiane, O. R. UCTransNet: Rethinking the skip connections in U-Net from a channel-wise perspective with Transformer. Proc AAAI Conf Artif Intell. 36 (3), 2441-2449 (2022).
  11. Sirinukunwattana, K., et al. Gland segmentation in colon histology images: The GlaS challenge contest. Med Image Anal. 35, 489-502 (2017).
  12. Zhou, Z., Rahman Siddiquee, M. M., Tajbakhsh, N., Liang, J. UNet++: A nested U-Net architecture for medical image segmentation. Lect Notes Comput Sci. 11045, 3-11 (2018).
  13. Diakogiannis, F. I., Waldner, F., Caccetta, P., Wu, C. ResUNet-a: A deep learning framework for semantic segmentation of remotely sensed data. ISPRS J Photogramm Remote Sens. 162, 94-114 (2020).
  14. Cai, S., Tian, Y., Lui, H., Zeng, H., Wu, Y., Chen, G. Dense-UNet: A novel multiphoton in vivo cellular image segmentation model based on a convolutional neural network. Quant Imaging Med Surg. 10 (6), 1275-1285 (2020).
  15. Li, Z., et al. LViT: Language meets Vision Transformer in medical image segmentation. IEEE Trans Med Imaging. 43 (1), 96-107 (2023).
  16. Bahdanau, D., Cho, K., Bengio, Y. Neural machine translation by jointly learning to align and translate. arXiv. , (2014).
  17. Guo, C., Szemenyei, M., Yi, Y., Zhou, W., Bian, H. Residual spatial attention network for retinal vessel segmentation. Proc ICONIP. 27, 509-519 (2020).
  18. Squeeze-and-excitation networks. Hu, J., Shen, L., Sun, G. Proc IEEE Conf Comput Vis Pattern Recognit, , 7132-7141 (2018).
  19. Chen, H., Qi, X., Yu, L., Dou, Q., Qin, J., Heng, P. -A. DCAN: Deep contour-aware networks for object instance segmentation from histology images. Med Image Anal. 36, 135-146 (2017).
  20. Yang, F., Li, X., Wang, B., Teng, P., Liu, G. UMSCS: A novel unpaired multimodal image segmentation method via cross-modality generative and semi-supervised learning. Int J Comput Vis. , 1-23 (2025).
  21. Zhang, Z., et al. An evidential-enhanced tri-branch consistency learning method for semi-supervised medical image segmentation. IEEE Trans Instrum Meas. , 1-15 (2024).
  22. Zhang, Z., et al. Self-aware and cross-sample prototypical learning for semi-supervised medical image segmentation. Med Image Comput Comput Assist Interv. 14372, 192-201 (2023).
  23. Zhang, Z., et al. A time-frequency-aware hierarchical feature optimization method for SAR jamming recognition. IEEE Trans Aerosp Electron Syst. , 1-15 (2025).
  24. Howard, A. G., et al. MobileNets: Efficient convolutional neural networks for mobile vision applications. arXiv. , (2017).
  25. ShuffleNet: An extremely efficient convolutional neural network for mobile devices. Zhang, X., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 6848-6856 (2018).
  26. Xception: Deep learning with depthwise separable convolutions. Chollet, F. Proc IEEE Conf Comput Vis Pattern Recognit, , 1251-1258 (2017).
  27. Aggregated residual transformations for deep neural networks. Xie, S., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 1492-1500 (2017).
  28. Pyramid scene parsing network. Zhao, H., Shi, J., Qi, X., Wang, X., Jia, J. Proc IEEE Conf Comput Vis Pattern Recognit, , 2881-2890 (2017).
  29. Tan, M., Le, Q. V. MixConv: Mixed depthwise convolutional kernels. arXiv. , (2019).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

U Net variantenkanaalattentiemixed depth convolutielaesiedetectiecelsegmentatiepoliepsegmentatiereductie van modelparameterskenmerkextractie
Video binnenkort beschikbaar

Gerelateerde artikelen