Articolo metodologico

Swin-PSAxialNet: un'efficiente tecnica di segmentazione multiorgano

DOI:

10.3791/66459

5 luglio 2024

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il presente protocollo descrive un efficiente metodo di segmentazione multiorgano chiamato Swin-PSAxialNet, che ha raggiunto un'eccellente accuratezza rispetto ai precedenti metodi di segmentazione. I passaggi chiave di questa procedura includono la raccolta di set di dati, la configurazione dell'ambiente, la pre-elaborazione dei dati, l'addestramento e il confronto dei modelli e gli esperimenti di ablazione.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La segmentazione multiorgano addominale è uno degli argomenti più importanti nel campo dell'analisi delle immagini mediche e svolge un ruolo importante nel supportare i flussi di lavoro clinici come la diagnosi della malattia e la pianificazione del trattamento. In questo studio, viene proposto un efficiente metodo di segmentazione multiorgano chiamato Swin-PSAxialNet basato sull'architettura nnU-Net. È stato progettato specificamente per la segmentazione precisa di 11 organi addominali nelle immagini TC. La rete proposta ha apportato i seguenti miglioramenti rispetto a nnU-Net. In primo luogo, sono stati introdotti i moduli SPD (Space-to-depth) e i blocchi di estrazione delle caratteristiche dell'attenzione assiale condivisa con parametri (PSAA), migliorando la capacità di estrazione delle caratteristiche delle immagini 3D. In secondo luogo, è stato impiegato un approccio di fusione di immagini multiscala per acquisire informazioni dettagliate e caratteristiche spaziali, migliorando la capacità di estrarre caratteristiche sottili e caratteristiche di bordo. Infine, è stato introdotto un metodo di condivisione dei parametri per ridurre il costo computazionale del modello e la velocità di addestramento. La rete proposta raggiunge un coefficiente medio di Dice di 0,93342 per il compito di segmentazione che coinvolge 11 organi. I risultati sperimentali indicano la notevole superiorità di Swin-PSAxialNet rispetto ai precedenti metodi di segmentazione tradizionali. Il metodo mostra un'eccellente accuratezza e bassi costi computazionali nella segmentazione dei principali organi addominali.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L'intervento clinico contemporaneo, compresa la diagnosi delle malattie, la formulazione dei piani di trattamento e il monitoraggio dei risultati del trattamento, si basa sull'accurata segmentazione delle immagini mediche1. Tuttavia, le complesse relazioni strutturali tra gli organi addominali2rendono un compito impegnativo ottenere una segmentazione accurata di più organi addominali3. Negli ultimi decenni, i fiorenti sviluppi nell'imaging medico e nella visione artificiale hanno presentato nuove opportunità e sfide nel campo della segmentazione multiorgano addominale. La risonanza magnetica avanzata (MRI)4 e la tomografia computerizzata (TC)5 ci consentono di acquisire immagini addominali ad alta risoluzione. La segmentazione precisa di più organi dalle immagini TC ha un valore clinico significativo per la valutazione e il trattamento di organi vitali come fegato, reni, milza, pancreas, ecc.6,7,8,9,10 Tuttavia, l'annotazione manuale di queste strutture anatomiche, in particolare quelle che richiedono l'intervento di radiologi o radioterapisti, richiede tempo ed è suscettibile di influenze soggettive11. Pertanto, vi è un urgente bisogno di sviluppare metodi automatizzati e accurati per la segmentazione multiorgano addominale.

Le ricerche precedenti sulla segmentazione delle immagini si sono basate prevalentemente sulle reti neurali convoluzionali (CNN), che migliorano l'efficienza della segmentazione impilando i livelli e introducendo ResNet12. Nel 2020, il team di ricerca di Google ha introdotto il modello Vision Transformer (VIT)13, segnando un esempio pionieristico di incorporazione dell'architettura Transformer nel dominio visivo tradizionale per una serie di attività visive14. Mentre le operazioni convoluzionali possono contemplare solo le informazioni sulle caratteristiche locali, il meccanismo di attenzione in Transformers consente la considerazione completa delle informazioni sulle funzionalità globali.

Considerando la superiorità delle architetture basate su Transformer rispetto alle tradizionali reti convoluzionali15, numerosi team di ricerca hanno intrapreso un'ampia esplorazione per ottimizzare la sinergia tra i punti di forza dei Transformers e le reti convoluzionali 16,17,18,19. Chen et al. hanno introdotto il TransUNet per le attività di segmentazione delle immagini mediche16, che sfrutta i trasformatori per estrarre caratteristiche globali dalle immagini. A causa dell'elevato costo della formazione della rete e dell'incapacità di utilizzare il concetto di gerarchia di estrazione delle caratteristiche, i vantaggi di Transformer non sono stati pienamente realizzati.

Per affrontare questi problemi, molti ricercatori hanno iniziato a sperimentare l'incorporazione dei trasformatori come spina dorsale per l'addestramento delle reti di segmentazione. Liu et al.17 hanno introdotto il trasformatore Swin, che impiegava un metodo di costruzione gerarchico per l'estrazione di caratteristiche stratificate. È stato proposto il concetto di Windows Multi-Head Self-Attention (W-MSA), che riduce significativamente i costi computazionali, in particolare in presenza di mappe di funzionalità di livello superficiale più grandi. Se da un lato questo approccio ha ridotto i requisiti computazionali, dall'altro ha isolato la trasmissione delle informazioni tra diverse finestre. Per risolvere questo problema, gli autori hanno ulteriormente introdotto il concetto di Shifted Windows Multi-Head Self-Attention (SW-MSA), che consente la propagazione delle informazioni tra finestre adiacenti. Basandosi su questa metodologia, Cao et al. hanno formulato lo Swin-UNet18, sostituendo le circonvoluzioni 2D in U-Net con i moduli Swin e incorporando W-MSA e SW-MSA nei processi di codifica e decodifica, ottenendo risultati di segmentazione lodevoli.

Al contrario, Zhou et al. hanno evidenziato che il vantaggio del funzionamento conv non può essere ignorato durante l'elaborazione di immagini ad alta risoluzione19. Il loro proposto nnFormer impiega un metodo di calcolo dell'auto-attenzione basato su blocchi di immagini tridimensionali locali, costituendo un modello Transformer caratterizzato da una struttura a forma di croce. L'utilizzo dell'attenzione basata su blocchi tridimensionali locali ha ridotto significativamente il carico di formazione sulla rete.

Dati i problemi con lo studio di cui sopra, viene proposta un'efficiente struttura gerarchica ibrida per la segmentazione di immagini mediche 3D, denominata Swin-PSAxialNet. Questo metodo incorpora un blocco di downsampling, il blocco Space-to-depth (SPD)20 , in grado di estrarre informazioni globali21. Inoltre, aggiunge un modulo PSAA (Parameter Shared Axial Attention), che riduce il numero di parametri di apprendimento da quadratico a lineare e avrà un buon effetto sull'accuratezza dell'addestramento della rete e sulla complessità dei modelli di addestramento22.

Rete Swin-PSAxialNet
L'architettura complessiva della rete adotta la struttura a forma di U di nnU-Net23, costituita da strutture di encoder e decoder. Queste strutture si occupano dell'estrazione di feature locali e della concatenazione di feature da immagini di grandi e piccole dimensioni, come illustrato nella Figura 1.

figure-introduction-1
Figura 1: Diagramma schematico dell'architettura di rete di Swin-PSAxialNet. Fare clic qui per visualizzare una versione più grande di questa figura.

Nella struttura dell'encoder, il tradizionale blocco Conv è combinato con il blocco SPD20 per formare un volume di downsampling. Il primo livello dell'encoder incorpora Patch Embedding, un modulo che partiziona i dati 3D in patch figure-introduction-23D, (P1, P2, P3) rappresenta patch non sovrapposte in questo contesto, figure-introduction-3 indica la lunghezza della sequenza di patch 3D. Dopo lo strato di inclusione, la fase successiva prevede un'unità di downsampling convoluzionale non sovrapposta che comprende sia un blocco convoluzionale che un blocco SPD. In questa configurazione, il blocco convoluzionale ha uno stride impostato su 1 e il blocco SPD viene impiegato per il ridimensionamento dell'immagine, portando a una riduzione di quattro volte della risoluzione e a un aumento di due volte dei canali.

Nella struttura del decoder, ogni blocco di upsampling dopo il livello Bottleneck Feature è costituito da una combinazione di un blocco di upsampling e di un blocco PSAA. La risoluzione della mappa delle caratteristiche è raddoppiata e il numero di canali è dimezzato tra ogni coppia di stadi del decoder. Per ripristinare le informazioni spaziali e migliorare la rappresentazione delle caratteristiche, viene eseguita la fusione delle caratteristiche tra immagini su larga e piccola scala tra i blocchi di upsampling. Infine, i risultati dell'upsampling vengono inseriti nel livello Head per ripristinare le dimensioni originali dell'immagine, con una dimensione di output di (H × W × D × C, C = 3).

Architettura a blocchi SPD
Nei metodi tradizionali, la sezione di sottocampionamento impiega un singolo passo con una dimensione del passo di 2. Ciò comporta il pooling convoluzionale in posizioni locali nell'immagine, limitando il campo ricettivo e confinando il modello all'estrazione di caratteristiche da piccole patch dell'immagine. Questo metodo utilizza il blocco SPD, che divide finemente l'immagine originale in tre dimensioni. L'immagine 3D originale viene segmentata uniformemente lungo gli assi x, y e z, ottenendo quattro corpi di sottovolume. (Figura 2) Successivamente, i quattro volumi vengono concatenati attraverso l'operazione "cat" e l'immagine risultante subisce una convoluzione 1 × 1 × 1 per ottenere l'immagine sottocampionata20.

figure-introduction-4
Figura 2: Diagramma a blocchi SPD. Fare clic qui per visualizzare una versione più grande di questa figura.

Architettura a blocchi PSAA
A differenza delle tradizionali reti CNN, il blocco PSAA proposto è più efficace nel condurre un focus sull'informazione globale e più efficiente nell'apprendimento e nella formazione della rete. Ciò consente l'acquisizione di immagini e caratteristiche spaziali più ricche. Il blocco PSAA include l'apprendimento dell'attenzione assiale basato sulla condivisione di parametri in tre dimensioni: altezza, larghezza e profondità. Rispetto al meccanismo di attenzione convenzionale che esegue l'apprendimento dell'attenzione per ogni pixel nell'immagine, questo metodo conduce in modo indipendente l'apprendimento dell'attenzione per ciascuna delle tre dimensioni, riducendo la complessità dell'auto-attenzione da quadratica a lineare. Inoltre, viene impiegato un meccanismo di condivisione dei parametri key-queries apprendibile, che consente alla rete di eseguire operazioni del meccanismo di attenzione in parallelo attraverso le tre dimensioni, ottenendo una rappresentazione delle caratteristiche più veloce, superiore ed efficace.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il presente protocollo è stato approvato dal Comitato Etico dell'Università di Nantong. Implica la valutazione intelligente e la ricerca di dati multimodali acquisiti non invasivi o minimamente invasivi, tra cui immagini mediche umane, movimenti degli arti e imaging vascolare, utilizzando la tecnologia dell'intelligenza artificiale. La Figura 3 illustra il diagramma di flusso complessivo della segmentazione multiorgano. Tutti i collegamenti web necessari sono forniti nella Tabella dei Materiali.

figure-protocol-1
Figura 3: Diagramma di flusso generale della segmentazione multiorgano. Fare clic qui per visualizzare una versione più grande di questa figura.

1. Raccolta di set di dati

  1. Scarica il set di dati AMOS202224 (vedi Tabella dei materiali).
  2. Selezionare 160 immagini come set di dati di training e 40 immagini come set di dati di test.
  3. Esegue terminalmente mkdir ~/PaddleSeg/contrib/MedicalSeg/data/raw_data.
  4. Apri il percorso di raw_data.
  5. Posizionare il set di dati nella directory raw_data e assicurarsi che corrisponda correttamente ai nomi dei file nelle directory "imagesTr" e "labelsTr".
  6. Creare dataset.json file.
  7. Aggiungere informazioni sul set di dati, ad esempio numTraining, numTest e nome delle etichette , nel file "dataset.json".
    NOTA: Il set di dati per questo studio è costituito da 200 set di dati CT di alta qualità selezionati dal set di dati ufficiale AMOS2022 500 CT per scopi di formazione e test. Il set di dati comprende 11 organi, tra cui milza, rene destro, rene sinistro, cistifellea, esofago, fegato, stomaco, aorta, vena cava inferiore, pancreas e vescica.

2. Configurazione dell'ambiente

  1. Installare l'ambiente Paddlepaddle (vedi Tabella dei materiali) e la corrispondente versioneCUDA 25.
    NOTA: Si consiglia di utilizzare Paddlepaddle versione 2.5.0 e CUDA versione 11.7.
  2. Git clona il repository PaddleSeg25.
  3. Esecuzione terminale cd ~/PaddleSeg/contrib/MedicalSeg/.
  4. Esegui pip install -r requirements.txt.
  5. Esegui pip install medpy.

3. Pretrattamento dei dati

  1. Modifica il file "yml", inclusi parametri come data_root, batch_size, modello, train_dataset, val_dataset, ottimizzatore, lr_scheduler e perdita.
  2. Specifica i parametri richiesti per l'esecuzione, inclusi "-config, --log_iters, --precision, --nnunet, --save_dir, --save_interval, ecc.
    NOTA: Il "raw_data" originale viene trasformato in tre tipi di file di dati: "Ritagliato", "Decathlon" e "Pre-elaborato", che soddisfano diversi requisiti di formazione e valutazione per migliorare le prestazioni del modello e l'efficacia dell'addestramento.

4. Addestramento e confronto dei modelli

NOTA: Come linea di base ampiamente utilizzata nel campo della segmentazione delle immagini, nnU-Net23 funge da modello di base nello studio. Il processo di confronto dei modelli specifico è il seguente.

  1. Treno nnU-Net
    1. Configura con una dimensione del batch di 2 e 80.000 iterazioni, registra ogni 20 iterazioni e utilizza la precisione fp16.
    2. Impostate il save_dir come cartella "output" all'interno della directory di lavoro, con un intervallo di salvataggio impostato a 1.000 iterazioni.
    3. Aggiungere il parametro --use_vdl per la visualizzazione dei parametri VisualDL.
    4. Esegui train.py.
    5. Crea quattro file yml , specifica le pieghe 1-4 e addestra il modello con la convalida incrociata a cinque pieghe.
  2. Treno Swin-UNet
    1. Mantenere la coerenza con le condizioni sperimentali precedentemente stabilite.
    2. Rimuovi il parametro --nnunet e usa --swinunet.
    3. Esegui il file train.py.
    4. Il treno piega 1-4 individualmente e poi soggetto a elaborazione d'insieme.
  3. Treno TransUNet
    1. Seguire le procedure descritte nel passaggio 4.1.
    2. Apri il file yml .
    3. Modificare type: nnunet in type: transunet.
    4. Modificare il parametro --nnunet in --transunet.
    5. Eseguire il file train.py.
    6. Treno piega da 1 a 4 individualmente ed elabora l'elaborazione dell'insieme.
  4. Treno UNETR
    1. Mantenere variabili sperimentali coerenti.
    2. Ripetere le procedure descritte in precedenza come Swin-UNet e TransUNet (passaggio 4.2 e passaggio 4.3).
    3. Esegui train.py.
    4. Treno piega da 1 a 4 individualmente ed elabora l'elaborazione dell'insieme.
  5. Treno nnFormer
    1. Modifica i parametri come Swin-UNet e TransUNet.
    2. Esegui una piega singola train.py.
    3. Eseguire l'elaborazione dell'ensemble.

5. Esperimento di ablazione

  1. Blocco PSAA per l'intera rete
    1. Mantieni le variabili coerenti con il passaggio 4.1.
    2. Imposta volume_shape = (64,192,192) e Axial_attention = Vero.
    3. Esegui una piega singola train.py.
    4. Elabora l'elaborazione dell'ensemble su cinque pieghe.
  2. Blocco SPD per l'intera rete
    1. Mantieni le variabili coerenti con il passaggio 4.1.
    2. Imposta SPD_enable = True e Axial_attention = False.
    3. Esegui una piega singola train.py.
    4. Elabora l'elaborazione dell'ensemble su cinque pieghe.
  3. Blocco PSAA per l'upsampling
    NOTA: Non utilizzare il blocco SPD per il downsampling.
    1. Utilizzare il blocco PSAA per l'upsampling.
    2. Mantieni le variabili coerenti con il passaggio 4.1.
    3. Impostare Axial_attention = False nella parte di downsampling e SPD_enable = False.
    4. Esegui una piega singola train.py.
    5. Elabora cinque volte l'elaborazione dell'insieme.
  4. Blocco PSAA per l'upsampling
    NOTA: Utilizzare il blocco SPD per il downsampling.
    1. Utilizzare il blocco SPD per il downsampling e il blocco PSAA per l'upsampling.
    2. Mantieni le variabili coerenti con il passaggio 4.1.
    3. Impostare Axial_attention = False nella parte di downsampling e SPD_enable = True.
    4. Esegui una piega singola train.py.
    5. Elabora cinque volte l'elaborazione dell'insieme.
    6. Impostare il numero di iterazioni su 2.00.000 a causa dei risultati superiori.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo protocollo utilizza due metriche per valutare il modello: il punteggio di somiglianza dei dadi (DSC) e la distanza di Hausdorff del 95% (HD95). Il DSC misura la sovrapposizione tra le previsioni di segmentazione dei voxel e la verità di base, mentre il 95% HD valuta la sovrapposizione tra i limiti di previsione della segmentazione dei voxel e la verità di base, filtrando il 5% dei valori anomali. La definizione di DSC26 è la seguente:

figure-results-1(1)

Dove T e P rappresentano rispettivamente i valori di verità di base e i valori previsti per tutti i voxel. La definizione di 95% HD26 è la seguente:

figure-results-2(2)

Dove d T,P, è la distanza del 95° percentile del massimo HD95 tra la verità di base e i voxel previsti, e d T,P, rappresenta la distanza del 95° percentile del massimo HD95 tra i voxel previsti e la verità di base.

Swin-PSAxialNet è stato confrontato con vari algoritmi di segmentazione multiorgano tradizionali nella Tabella 1. I risultati dimostrano un miglioramento delle prestazioni di segmentazione per gli organi addominali nell'algoritmo proposto. L'accuratezza dei dadi del metodo di segmentazione supera il valore medio dei dadi di altri metodi di 2-3 punti percentuali e supera persino nnFormer di 1 punto percentuale. Swin-PSAxialNet mostra anche un'elevata precisione nella segmentazione dei confini, con un coefficiente HD95 medio di 5,63, il più basso tra tutti gli algoritmi confrontati.

MetodiLknSplLivPadellaAroBlaStoGbdPosEsoRknMedio
DSCHD95
nnU-Net96.396.897.2185.295.2286.5791.4784.791.7982.595.4491.27.13
Swin-Unet96.0396.6897.2285.7495.387.8291.7784.6491.6783.2696.1491.489.68
TransUNet96.4296.7497.0585.0994.8685.291.8183.3391.5282.2296.1290.9413.77
UNETR95.9496.4896.8584.1494.6285.0190.1881.1690.7980.3495.1590.0612.92
nnPrecedente96.5997.2297.3386.7995.3189.7492.8284.8892.4384.2496.3292.156.59
Swin-PSAxialNet96.8597.6797.6488.3995.9792.0394.487.7893.1586.2496.5993.345.63

Tabella 1: Confronto tra gli algoritmi di segmentazione tradizionali. Le abbreviazioni stanno per i seguenti organi: Lkn per rene sinistro, Spl per milza, Liv per fegato, Pan per pancreas, Aro per aorta, Bla per vescica, Sto per stomaco, Gbd per cistifellea, Pos per postcava, Eso per esofago, Rkn per rene destro e DSC per il coefficiente medio di Dadi, HD95 per la distanza media di Hausdorff del 95%.

Inoltre, l'introduzione di un meccanismo di condivisione dei parametri e i miglioramenti alla struttura del trasformatore forniscono vantaggi significativi sia in termini di complessità del modello che di velocità di inferenza (Tabella 2, Figura 4 e Figura 5).

ModelliParametri (M)FLOP (G)Tempo di inferenza (s)
nn-Unet17.96398.549.07
UNETR89.5839.6712.51
nnPrecedente134.78152.4311.24
Swin-PSAxialNet37.6443.1510.31

Tabella 2: Tabella di confronto degli indicatori dei modelli di rete.

figure-results-3
Figura 4: Curva di variazione dei dadi della rete di addestramento del modello. (A) La rete attuale. (B) nnPrecedente. (C) nnU-Net. (D) UNETR. Clicca qui per visualizzare una versione più grande di questa figura.

figure-results-4
Figura 5: Confronto dei risultati dell'addestramento del modello. La figura evidenzia i risultati della rete attuale, i risultati di nnFormer, i risultati di nnU-Net e i risultati di UNETR. Clicca qui per visualizzare una versione più grande di questa figura.

Questo studio ha condotto esperimenti di ablazione completi sulla rete di algoritmi, utilizzando il blocco PSAA e il blocco SPD come variabili e confrontando l'addestramento a piega singola con l'addestramento a cinque volte. I coefficienti dei dadi dei risultati sperimentali sono presentati nella Tabella 3. Questi risultati dimostrano che l'utilizzo del blocco SPD per il downsampling e del blocco PSAA per l'upsampling migliora efficacemente le prestazioni di segmentazione rispetto alla nnU-Net non modificata (Figura 6).

ModelliBlocco PSAA per l'intera reteBlocco SPD per l'intera reteBlocco PSAA solo per l'upsamplingBlocco PSAA per l'upsampling, utilizzare SPD
Formazione in un'unica piega92.1790.5192.2492.39
Allenamento in cinque fasi92.8291.2692.7993.34

Tabella 3: I risultati dell'esperimento di ablazione di Swin-PSAxialNet. Vengono presentati i risultati dell'esperimento di ablazione di Swin PSAxialNet. Nell'esperimento di ablazione, è stato confrontato l'uso del blocco PSAA e del blocco SPD e i risultati dell'addestramento del DSC sono mostrati nella tabella.

figure-results-5
Figura 6: I risultati della segmentazione. Fare clic qui per visualizzare una versione più grande di questa figura.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La segmentazione degli organi addominali è un lavoro complicato. Rispetto ad altre strutture interne del corpo umano, come il cervello o il cuore, la segmentazione degli organi addominali sembra più impegnativa a causa del basso contrasto e dei grandi cambiamenti di forma nelle immagini TC27,28. Swin-PSAxialNet è proposto qui per risolvere questo difficile problema.

Nella fase di raccolta dei dati, questo studio ha scaricato 200 immagini dal sito ufficiale AMOS202224. Nella fase di configurazione dell'ambiente, la configurazione sperimentale includeva l'ambiente Paddlepaddle insieme alla corrispondente versione CUDA. Durante la fase di pre-elaborazione dei dati, sono stati applicati il ritaglio casuale e il capovolgimento casuale per migliorare la robustezza dei dati. Nelle fasi di addestramento e confronto del modello, basate sul modello di base nnU-Net, l'esperimento ha aggiunto il blocco SPD per il downsampling e il blocco di estrazione delle funzioni PSAA per l'upsampling, ottenendo eccellenti risultati di segmentazione. Swin-PSAxialNet è stato confrontato con vari modelli di segmentazione tradizionali e ha dimostrato risultati promettenti sul set di dati pubblico AMOS2022. Ha raggiunto una maggiore precisione di segmentazione rispetto agli altri metodi di segmentazione menzionati in questo studio 16,17,18,19. Nella sezione dell'esperimento di ablazione, l'utilizzo del blocco PSAA e del blocco SPD è stato variato per trovare la rete di segmentazione ottimale. I risultati dell'esperimento di ablazione hanno indicato che l'utilizzo del modulo PSAA solo per l'upsampling consente di ottenere un punto percentuale in più rispetto all'utilizzo per l'intera rete.

Le innovazioni di questo studio sono le seguenti: in primo luogo, il modulo SPD è incorporato nella rete per costituire l'unità di downsampling insieme al blocco Conv, migliorando così le capacità di estrazione delle caratteristiche della rete. In secondo luogo, l'introduzione del blocco di estrazione delle funzionalità PSAA riduce efficacemente la complessità della rete migliorando al contempo l'accuratezza dell'addestramento. Infine, l'introduzione di un meccanismo di condivisione dei parametri riduce significativamente la complessità del modello di addestramento.

Questo studio presenta limitazioni nei seguenti aspetti: è stato applicato solo al set di dati AMOS2022 e i risultati non sono stati convalidati su altri set di dati. Ancora una volta, sebbene nnU-Net abbia raggiunto prestazioni elevate nelle attività di segmentazione degli organi addominali dopo una serie di ottimizzazioni come framework di segmentazione automatizzata, alcuni parametri hanno ancora un certo grado di soggettività, come il tasso di apprendimento iniziale, il numero di iterazioni, l'architettura di rete, ecc. La ricerca futura esplorerà i metodi per il calcolo automatico di questi parametri29.

Swin-PSAxialNet ha ottenuto eccellenti risultati di segmentazione nelle attività di segmentazione degli organi addominali, dimostrando forti capacità di generalizzazione e stabilità. Nella ricerca futura, verranno utilizzati ulteriori set di dati per studiare ulteriormente le capacità di generalizzazione dell'algoritmo e apportare modifiche al modello. Inoltre, la struttura dell'algoritmo può essere ulteriormente ottimizzata per migliorare l'accuratezza e la robustezza complessive della rete. L'obiettivo è quello di integrare la rete con capacità multimodali per trasformarla in un modello medico multimodale.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori dichiarano di non avere conflitti di interesse.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio è stato sostenuto dal progetto di ingegneria '333' della provincia di Jiangsu ([2022]21-003), dal Wuxi Health Commission General Program (M202205) e dal Wuxi Science and Technology Development Fund (Y20212002-1), i cui contributi sono stati inestimabili per il successo di questo lavoro". Gli autori ringraziano tutti gli assistenti di ricerca e i partecipanti allo studio per il loro sostegno.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
AMOS2022 set di datiNessunoNessunoSet di dati per l'addestramento e il test della rete. Il link è: https://pan.baidu.com/s/1x2ZW5FiZtVap0er55Wk4VQ?pwd=xhpb
Mainframe ASUSASUShttps://www.asusparts.eu/en/asus-13020-01910200
CUDA versione 11.7NVIDIAhttps://developer.nvidia.com/cuda-11-7-0-download-archive
NVIDIA GeForce RTX 3090NVIDIAhttps://www.nvidia.com/en-in/geforce/graphics-cards/30-series/rtx-3090-3090ti/
Ambiente paddlepaddle BaiduNessunoPreparazione ambientale per la formazione in rete. Il link è: https://www.paddlepaddle.org.cn/
PagaiaSegBaiduNessunoLa linea di base che utilizziamo: https://github.com/PaddlePaddle/PaddleSeg

Riferimenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Liu, X., Song, L., Liu, S., Zhang, Y. A review of deep-learning-based medical image segmentation methods. Sustain. 13 (3), 1224(2021).
  2. Popilock, R., Sandrasagaren, K., Harris, L., Kaser, K. A. CT artifact recognition for the nuclear technologist. J Nucl Med Technol. 36 (2), 79-81 (2008).
  3. Rehman, A., Khan, F. G. A deep learning based review on abdominal images. Multimed Tools Appl. 80, 30321-30352 (2021).
  4. Schenck, J. F. The role of magnetic susceptibility in magnetic resonance imaging: Mri magnetic compatibility of the first and second kinds. Med Phys. 23 (6), 815-850 (1996).
  5. Palmisano, A., et al. Myocardial late contrast enhancement ct in troponin-positive acute chest pain syndrome. Radiol. 302 (3), 545-553 (2022).
  6. Chen, E. -L., Chung, P. -C., Chen, C. -L., Tsai, H. -M., Chang, C. -I. An automatic diagnostic system for CT liver image classification. IEEE Trans Biomed Eng. 45 (6), 783-794 (1998).
  7. Sagel, S. S., Stanley, R. J., Levitt, R. G., Geisse, G. J. R. Computed tomography of the kidney. Radiol. 124 (2), 359-370 (1977).
  8. Freeman, J. L., Jafri, S., Roberts, J. L., Mezwa, D. G., Shirkhoda, A. CT of congenital and acquired abnormalities of the spleen. Radiographics. 13 (3), 597-610 (1993).
  9. Almeida, R. R., et al. Advances in pancreatic CT imaging. AJR Am J Roentgenol. 211 (1), 52-66 (2018).
  10. Eisen, G. M., et al. Guidelines for credentialing and granting privileges for endoscopic ultrasound. Gastrointest Endosc. 54 (6), 811-814 (2001).
  11. Sykes, J. Reflections on the current status of commercial automated segmentation systems in clinical practice. J Med Radiat Sci. 61 (3), 131-134 (2014).
  12. He, K., Zhang, X., Ren, S., Sun, J. Deep residual learning for image recognition. 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). , Vegas, NV, USA. 770-778 (2016).
  13. Dosovitskiy, A., et al. An image is worth 16x16 words: Transformers for image recognition at scale. arXiv. arXiv. , 11929(2020).
  14. Ramachandran, P., et al. Stand-alone self-attention in vision models. Adv Neural Inf Process Syst. 32, NIPS2019 (2019).
  15. Vaswani, A., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, NIPS2019 (2017).
  16. Chen, J., et al. TransUNET: Transformers make strong encoders for medical image segmentation. arXiv. , arXiv:2102 04396(2021).
  17. Liu, Z., et al. Swin transformer: Hierarchical vision transformer using shifted windows. Proc IEEE Int Conf Comput Vis. , 10012-10022 (2021).
  18. Cao, H., et al. Swin-UNET: Unet-like pure transformer for medical image segmentation. Comput Vis ECCV. , 205-218 (2022).
  19. Zhou, H. -Y., et al. nnformer: Interleaved transformer for volumetric segmentation. arXiv. arXiv. , arXiv:2109 03201(2021).
  20. Sunkara, R., Luo, T. No more strided convolutions or pooling: A new CNN building block for low-resolution images and small objects. Mach Learn Knowl Discov Databases. , 443-459 (2023).
  21. Çiçek, Ö, Abdulkadir, A., Lienkamp, S. S., Brox, T., Ronneberger, O. 3D U-Net: learning dense volumetric segmentation from sparse annotation. Med Comput Vis Bayesian Graph Models Biomed Imaging. 2016, 424-432 (2016).
  22. Kim, H., et al. Abdominal multi-organ auto-segmentation using 3D-patch-based deep convolutional neural network. Scientific reports. 10 (1), 6204(2020).
  23. Isensee, F., et al. nnu-net: Self-adapting framework for u-net-based medical image segmentation. arXiv. , arXiv:1809 10486(2018).
  24. Ji, Y., et al. A large-scale abdominal multi-organ benchmark for versatile medical image segmentation. Adv Neural Inf Process Syst. 35, 36722-36732 (2022).
  25. Liu, Y., et al. Paddleseg: A high-efficient development toolkit for image segmentation. arXiv. , arXiv:2101 06175(2021).
  26. Hatamizadeh, A., et al. UNETR: Transformers for 3D medical image segmentation. Proc IEEE Int Conf Comput Vis. , https://api.semanticscholar.org/CorpusID:232290634 574-584 (2022).
  27. Zhou, H., Zeng, D., Bian, Z., Ma, J. A semi-supervised network-based tissue-aware contrast enhancement method for ct images. Nan Fang Yi Ke Da Xue Xue Bao. 43 (6), 985-993 (2023).
  28. Ma, J., et al. Abdomenct-1k: Is abdominal organ segmentation a solved problem. IEEE Trans Pattern Anal Mach Intell. 44 (10), 6695-6714 (2021).
  29. Galván, E., Mooney, P. Neuroevolution in deep neural networks: Current trends and future challenges. IEEE Trans Artif Intell. 2 (6), 476-493 (2021).

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

Segmentazione degli organi addominaliAnalisi delle immagini medicheSegmentazione di immagini TCArchitettura nnU NetModulo Space To DepthAttenzione assialeFusione di immagini multi scalaCoefficiente di Dice

Articoli correlati