$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
A incidência do câncer de tireoide tem aumentado rapidamente desde 1970, especialmente entre mulheres de meia-idade1. Nódulos tireoidianos podem predizer o surgimento de câncer de tireoide, e a maioria dos nódulos tireoidianos é assintomática2. A detecção precoce de nódulos tireoidianos é muito útil na cura do câncer de tireoide. Portanto, de acordo com as diretrizes atuais de prática, todos os pacientes com suspeita de bócio nodular ao exame físico ou com achados de imagem anormais devem ser submetidos a exames complementares 3,4.
A ultrassonografia (US) tireoidiana é um método comumente utilizado para detectar e caracterizar lesões tireoidianas5,6. Os EUA são uma tecnologia conveniente, barata e livre de radiação. Entretanto, a aplicação da US é facilmente afetada pelo operador 7,8. Características como forma, tamanho, ecogenicidade e textura dos nódulos tireoidianos são facilmente distinguíveis nas imagens ultrassonográficas. Embora certas características ultrassonográficas - calcificações, ecogenicidade e bordas irregulares - sejam frequentemente consideradas critérios para identificação de nódulos tireoidianos, a presença de variabilidade interobservador éinevitável8,9. Os resultados diagnósticos de radiologistas com diferentes níveis de experiência são diferentes. Radiologistas inexperientes são mais propensos a diagnosticar erroneamente do que radiologistas experientes. Algumas características do US como reflexos, sombras e ecos podem degradar a qualidade da imagem. Essa degradação na qualidade da imagem causada pela natureza da US dificulta a localização precisa dos nódulos, mesmo por médicos experientes.
O diagnóstico auxiliado por computador (DAC) para nódulos tireoidianos desenvolveu-se rapidamente nos últimos anos e pode efetivamente reduzir os erros causados por diferentes médicos e ajudar os radiologistas a diagnosticar nódulos de forma rápida e precisa10,11. Vários sistemas CAD baseados em CNN têm sido propostos para análise de nódulos na US tireoidiana, incluindo segmentação12,13, detecção14,15 eclassificação16,17. A CNN é um modelo de aprendizagem supervisionadomulticamadas 18, e os módulos principais da CNN são as camadas de convolução e pooling. As camadas de convolução são usadas para extração de feição, e as camadas de agrupamento são usadas para downsampling. As camadas convolucionais de sombra podem extrair características primárias, como textura, bordas e contornos, enquanto as camadas convolucionais profundas aprendem características semânticas de alto nível.
As CNNs têm tido grande sucesso em visão computacional 19,20,21. No entanto, as CNNs não conseguem capturar dependências contextuais de longo alcance devido ao limitado campo receptivo válido das camadas convolucionais. No passado, as arquiteturas de backbone para classificação de imagens usavam principalmente CNNs. Com o advento do Vision Transformer (ViT)22,23, essa tendência mudou, e agora muitos modelos de última geração utilizam transformadores como backbone. Com base em patches de imagem não sobrepostos, o ViT usa um codificador de transformadorpadrão 25 para modelar globalmente as relações espaciais. O Swin Transformer24 introduz ainda janelas de mudança para aprender recursos. As janelas de mudança não só trazem maior eficiência, mas também reduzem muito o comprimento da sequência, porque a autoatenção é calculada na janela. Ao mesmo tempo, a interação entre duas janelas adjacentes pode ser feita através da operação de deslocamento (movimento). A aplicação bem sucedida do transformador Swin em visão computacional levou à investigação de arquiteturas baseadas em transformadores para análise de imagens deultrassom26.
Recentemente, Li e col. propuseram uma abordagem de aprendizado profundo28 para detecção de câncer papilar de tireoide inspirada no Faster R-CNN27. O R-CNN mais rápido é uma arquitetura clássica de detecção de objetos baseada na CNN. O Faster R-CNN original tem quatro módulos: o backbone CNN, a rede de proposta de região (RPN), a camada de pool de ROI e o cabeçote de detecção. O backbone da CNN usa um conjunto de camadas básicas conv+bn+relu+pooling para extrair mapas de feição da imagem de entrada. Em seguida, os mapas de feição são alimentados na camada de pool de RPN e ROI. O papel da rede RPN é gerar propostas regionais. Este módulo usa softmax para determinar se as âncoras são positivas e gera âncoras precisas por regressão de caixa delimitadora. A camada de pool de ROI extrai os mapas de feição da proposta coletando os mapas de feição de entrada e as propostas e alimenta os mapas de feição da proposta no cabeçalho de detecção subsequente. A cabeça de detecção usa os mapas de recursos propostos para classificar objetos e obter posições precisas das caixas de detecção por regressão de caixa delimitadora.
Este trabalho apresenta uma nova rede de detecção de nódulos tireoidianos denominada Swin Faster R-CNN formada pela substituição do backbone CNN em Faster R-CNN pelo Swin Transformer, que resulta na melhor extração de recursos para detecção de nódulos a partir de imagens de ultrassom. Além disso, a rede de pirâmide característica (FPN)29 é utilizada para melhorar o desempenho de detecção do modelo para nódulos de diferentes tamanhos, agregando características de diferentes escalas.