$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Die Inzidenz von Schilddrüsenkrebs hat seit 1970 rapide zugenommen, insbesondere bei Frauen mittleren Alters1. Schilddrüsenknoten können die Entstehung von Schilddrüsenkrebs vorhersagen, und die meisten Schilddrüsenknoten sind asymptomatisch2. Die Früherkennung von Schilddrüsenknoten ist sehr hilfreich bei der Heilung von Schilddrüsenkrebs. Daher sollten sich nach den aktuellen Praxisleitlinien alle Patienten mit Verdacht auf knotigen Kropf bei der körperlichen Untersuchung oder mit auffälligen Bildgebungsbefunden einer weiteren Untersuchung unterziehen 3,4.
Der Schilddrüsenultraschall (US) ist eine gängige Methode zur Erkennung und Charakterisierung von Schilddrüsenläsionen 5,6. US ist eine bequeme, kostengünstige und strahlungsfreie Technologie. Die Anwendung von US wird jedoch leicht durch den Operatorbeeinflusst 7,8. Merkmale wie Form, Größe, Echogenität und Textur von Schilddrüsenknoten sind auf US-Bildern leicht zu unterscheiden. Obwohl bestimmte US-Merkmale - Verkalkungen, Echogenität und unregelmäßige Grenzen - oft als Kriterien für die Identifizierung von Schilddrüsenknoten angesehen werden, ist das Vorhandensein von Interobserver-Variabilität unvermeidlich 8,9. Die Diagnoseergebnisse von Radiologen mit unterschiedlichem Erfahrungsstand sind unterschiedlich. Unerfahrene Radiologen stellen häufiger Fehldiagnosen als erfahrene Radiologen. Einige Merkmale von US wie Reflexionen, Schatten und Echos können die Bildqualität beeinträchtigen. Diese Verschlechterung der Bildqualität, die durch die Art der US-Bildgebung verursacht wird, macht es selbst erfahrenen Ärzten schwer, Knötchen genau zu lokalisieren.
Die computergestützte Diagnose (CAD) von Schilddrüsenknoten hat sich in den letzten Jahren rasant weiterentwickelt und kann Fehler, die von verschiedenen Ärzten verursacht werden, effektiv reduzieren und Radiologen helfen, Knoten schnell und genau zu diagnostizieren10,11. Für die Analyse von US-Knoten in der Schilddrüse wurden verschiedene CNN-basierte CAD-Systeme vorgeschlagen, darunter Segmentierung 12,13, Detektion 14,15 und Klassifizierung 16,17. CNN ist ein mehrschichtiges, überwachtes Lernmodell18, und die Kernmodule von CNN sind die Faltungs- und Pooling-Schichten. Die Faltungs-Layer werden für die Feature-Extraktion verwendet, und die Pooling-Layer werden für das Downsampling verwendet. Die Faltungsebenen für Schatten können primäre Merkmale wie Textur, Kanten und Konturen extrahieren, während tiefe Faltungsebenen semantische Merkmale auf hoher Ebene erlernen.
CNNs haben große Erfolge im Bereich Computer Vision 19,20,21 erzielt. CNNs sind jedoch nicht in der Lage, weitreichende kontextuelle Abhängigkeiten zu erfassen, da das Feld der Faltungsschichten begrenzt ist. In der Vergangenheit verwendeten Backbone-Architekturen für die Bildklassifizierung meist CNNs. Mit dem Aufkommen von Vision Transformer (ViT)22,23 hat sich dieser Trend geändert, und jetzt verwenden viele moderne Modelle Transformatoren als Backbone. Basierend auf nicht überlappenden Bildfeldern verwendet ViT einen Standard-Transformator-Encoder25, um räumliche Beziehungen global zu modellieren. Der Swin Transformer24 führt außerdem Shift-Fenster ein, um Funktionen zu erlernen. Die Verschiebungsfenster bringen nicht nur eine höhere Effizienz, sondern reduzieren auch die Länge der Sequenz erheblich, da die Selbstaufmerksamkeit im Fenster berechnet wird. Gleichzeitig kann die Interaktion zwischen zwei benachbarten Fenstern durch den Vorgang des Verschiebens (Bewegens) erfolgen. Die erfolgreiche Anwendung des Swin-Transformators in der Computer Vision hat zur Untersuchung von transformatorbasierten Architekturen für die Ultraschallbildanalyse geführt26.
Kürzlich schlugen Li et al. einen Deep-Learning-Ansatz28 für die Erkennung von papillärem Schilddrüsenkrebs vor, der von Faster R-CNN27 inspiriert ist. Faster R-CNN ist eine klassische CNN-basierte Objekterkennungsarchitektur. Das ursprüngliche Faster R-CNN besteht aus vier Modulen: dem CNN-Backbone, dem Region Proposal Network (RPN), der ROI-Pooling-Schicht und dem Detektionskopf. Der CNN-Backbone verwendet eine Reihe grundlegender conv+bn+relu+pooling-Layer, um Feature-Maps aus dem Eingabebild zu extrahieren. Anschließend werden die Feature-Karten in den RPN- und den ROI-Pooling-Layer eingespeist. Die Aufgabe des RPN-Netzwerks besteht darin, regionale Vorschläge zu erstellen. Dieses Modul verwendet softmax, um zu bestimmen, ob Anker positiv sind, und generiert genaue Anker durch Regression des Begrenzungsrahmens. Der ROI-Pooling-Layer extrahiert die Vorschlags-Feature-Maps, indem er die Eingabe-Feature-Maps und -Vorschläge sammelt und die Proposal-Feature-Maps in den nachfolgenden Erkennungskopf einspeist. Der Erkennungskopf verwendet die Vorschlags-Feature-Karten, um Objekte zu klassifizieren und genaue Positionen der Erkennungsfelder durch Begrenzungsrahmenregression zu erhalten.
In diesem Artikel wird ein neues Netzwerk zur Erkennung von Schilddrüsenknoten namens Swin Faster R-CNN vorgestellt, das durch den Ersatz des CNN-Backbones in Faster R-CNN durch den Swin-Transformator gebildet wird, was zu einer besseren Extraktion von Merkmalen für die Erkennung von Knoten aus Ultraschallbildern führt. Darüber hinaus wird das Merkmalspyramidennetzwerk (FPN)29 verwendet, um die Detektionsleistung des Modells für Knoten unterschiedlicher Größe durch die Aggregation von Merkmalen unterschiedlicher Maßstäbe zu verbessern.