Research Article

Energieeffiziente Rauschunterdrückungstechniken auf Basis von maschinellem Lernen für eine nachhaltige medizinische Bildgebung

DOI:

10.3791/68968

September 16th, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diese Studie schlägt eine energieeffiziente Entrauschungsmethode vor, die die Bildverarbeitung integriert, um die medizinische Bildqualität zu verbessern, die Rechenkosten zu senken und nachhaltige diagnostische Praktiken zu unterstützen. Die Methode verbessert die Klarheit bei Niedrigdosis- und Legacy-Scans und ermöglicht eine Ferndiagnose bei gleichzeitiger Reduzierung der Strahlenbelastung, des Energieverbrauchs und des Elektroschrotts.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Herkömmliche Deep-Learning-Modelle haben ein Rauschpotenzial gezeigt, stehen aber vor Herausforderungen wie hoher Rechenlast, Energieverbrauch und Trainingszeit. In dieser Studie wird eine energieeffiziente Entrauschungsmethodik vorgestellt, die Bildverbesserung und K-Means-Clustering als Vorverarbeitungstechniken integriert, um die Eingabequalität vor der Anwendung neuronaler Netze zu verbessern. Diese Studie schlägt eine energieeffiziente Rauschunterdrückungspipeline vor, die Bildverbesserung mit Sharpening-Kernen und Bildsegmentierung durch K-Means-Clustering vor der Anwendung eines Convolutional Autoencoders integriert. Die Vorverarbeitungsschritte ermöglichten es dem Modell, anatomische Grenzen zu identifizieren und lärmbetroffene Regionen zu trennen, wodurch die Eingabequalität verbessert und die Trainingskonvergenz verbessert wurde. Die Vorverarbeitung schärft wichtige Bildmerkmale und unterscheidet vom Rauschen betroffene Bereiche, was ein adaptives Thresholding und eine effektivere Rauschunterdrückung bei reduziertem Rechenaufwand ermöglicht. Das vorgeschlagene Modell wurde unter Verwendung öffentlich zugänglicher CT- und MRT-Datensätze evaluiert. Die Leistung wurde anhand des Peak Signal-to-Noise Ratio (PSNR), des Structural Similarity Index Measure (SSIM) und der Klassifizierungsgenauigkeit bewertet. Die Ergebnisse zeigten, dass sich PSNR von 21,52 dB auf 28,14 dB verbesserte; SSIM wurde von 0,7619 auf 0,8690 erhöht, und die Validierungsgenauigkeit wurde ebenfalls verbessert. Die integrierte Vorverarbeitung reduzierte die Trainingszeit um ~20 % und senkte die GPU-Auslastung, wodurch die Reproduzierbarkeit und der Einsatz in rechenintensiven Umgebungen unterstützt wurden. Die Methodik unterstützt nachhaltige medizinische Bildgebungspraktiken, indem sie die Strahlenbelastung minimiert, Wiederholungsscans reduziert und die Lebensdauer älterer Bildgebungsgeräte verlängert. Diese Pipeline trägt zu einer nachhaltigen medizinischen Bildgebung bei, indem sie die Strahlenbelastung minimiert, Wiederholungsscans reduziert und die Lebensdauer älterer Bildgebungsgeräte verlängert. Es eignet sich auch für die Ferndiagnose und verbessert die Arbeitsabläufe in der Telemedizin in ressourcenarmen Umgebungen. Darüber hinaus unterstützt der Ansatz die Ferndiagnose und eignet sich damit für telemedizinische Anwendungen in ressourcenarmen Umgebungen.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die medizinische Bildgebung spielt eine zentrale Rolle bei der Diagnostik und Behandlungsplanung, indem sie nicht-invasive Einblicke in innere anatomische und physiologische Bedingungen bietet. Verschiedene bildgebende Verfahren, Röntgen, Computertomographie (CT), Magnetresonanztomographie (MRT), Ultraschall und Positronenemissionstomographie (PET), werden routinemäßig im klinischen Umfeld eingesetzt, um Anomalien zu erkennen, das Fortschreiten der Krankheit zu überwachen und Interventionen zu leiten 1,2,3. Jede Modalität weist einzigartige Vorteile auf, ist aber anfällig für verschiedene Formen der Bildverschlechterung, die durch Einschränkungen der Instrumentierung, der Erfassungsumgebung und der Rekonstruktionsalgorithmen verursachtwerden 4.

Die Bildqualität wird häufig durch Rauschen beeinträchtigt, das sich aufgrund von thermischen Effekten, Niedrigdosisprotokollen, elektronischen Interferenzen, Patientenbewegungen oder unsachgemäßer Kalibrierung äußernkann 5,6,7. CT-Bilder weisen beispielsweise aufgrund von Einschränkungen der Photonenzahl häufig Poisson-Rauschen auf, während MRT-Scans anfällig für Gauß- und Ricsches Rauschen sind, das durch Magnetfeldinkonsistenzen und Rekonstruktionsartefakte entsteht 8,9. Dieses Rauschen kann feine anatomische Strukturen und pathologische Anzeichen verdecken, was zu Fehldiagnosen oder wiederholten Bildgebungssitzungen führen kann, was wiederum die Strahlenbelastung und die Kosten für das Gesundheitswesen erhöht. Abbildung 1, Abbildung 2 und Abbildung 3 veranschaulichen die Modalitäten, Arten und Ursachen von Rauschen in medizinischen Bildern.

figure-introduction-1
Abbildung 1: Medizinische Bildaufnahmetechniken. Diese Abbildung veranschaulicht die am häufigsten verwendeten medizinischen Bildgebungsverfahren, einschließlich Röntgen, MRT, CT, PET und Ultraschall. Jede Modalität dient einzigartigen diagnostischen Zwecken und ist anfällig für unterschiedliche Rauschartefakte. MRT und CT zum Beispiel sind besonders empfindlich gegenüber bewegungs- und rekonstruktionsbedingten Verzerrungen. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

figure-introduction-2
Abbildung 2: Arten von Bildrauschen. Zeigt verschiedene Arten von Bildrauschen an, die sich auf die medizinische Bildgebung auswirken, einschließlich Gaußschem Rauschen, Salz-und-Pfeffer-Rauschen, Speckle-Rauschen und Poisson-Rauschen. Jeder Rauschtyp wirkt sich unterschiedlich auf die Pixelintensität und die Bildstruktur aus, was sich auf die Effektivität der Rauschunterdrückung auswirkt. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

figure-introduction-3
Abbildung 3: Ursachen für Bildrauschen. Diese Abbildung fasst die Hauptursachen für Lärm in medizinischen Bildgebungssystemen zusammen. Dazu gehören Sensorfehler, elektronische Interferenzen, ein niedriges Signal-Rausch-Verhältnis (SNR), Patientenbewegungen und Niedrigdosis-Scans. Das Verständnis dieser Quellen beeinflusst die Wahl der Vorverarbeitungs- und Entrauschungstechniken. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

Um diese Herausforderungen zu meistern, wurden verschiedene Entrauschungstechniken eingesetzt. Klassische filterbasierte Methoden wie Median-, Gauß- und Wiener-Filter sind recheneffizient, führen aber oft zum Verlust wichtiger Bilddetails. Modellgetriebene Techniken wie Wavelet-Thresholding, BM3D und anisotrope Diffusion bieten eine verbesserte strukturelle Erhaltung, können jedoch empfindlich auf Abstimmungsparameter reagieren oder in Szenarien mit hohem Rauschen Schwierigkeiten haben 10,11,12.

Mit dem Aufkommen von Deep Learning haben Convolutional Neural Networks (CNNs) eine außergewöhnliche Leistung bei der Entrauschung medizinischer Bilder gezeigt, indem sie komplexe Zuordnungen zwischen verrauschten und sauberen Bildern lernen. Tiefe Netzwerke erfordern jedoch in der Regel hohe Rechenressourcen und eine längere Trainingszeit, was Bedenken hinsichtlich der Energieeffizienz aufwirft, insbesondere in klinischen Umgebungen mit begrenzten Ressourcen 13,14,15.

Um diese Einschränkungen zu beheben, hat sich die jüngste Forschung auf hybride Entrauschungs-Frameworks konzentriert, die Vorverarbeitungstechniken mit neuronalen Netzen integrieren, um die Komplexität zu reduzieren und die Leistung zu verbessern. Techniken wie Bildverbesserung und K-Means-Clustering-basierte Segmentierung haben sich als vielversprechend erwiesen, um relevante anatomische Strukturen zu isolieren und die Belastung der Lernalgorithmen zu minimieren 16,17,18.

Neben der Rauschunterdrückung haben sich multimodale Bildfusionstechniken weiterentwickelt, um die diagnostischen Details durch die Kombination von Daten aus verschiedenen Bildgebungsmodalitäten zu verbessern. Jüngste Arbeiten unterstreichen die laufenden Innovationen im Bereich der medizinischen Bildverarbeitung 19,20,21,22,23.

Abbildung 4 zeigt, wie Rauschen die Bildschärfe beeinträchtigen und klinische Interpretationen behindern kann. Diese Einschränkungen begründen den Bedarf an energiebewussten, hochpräzisen Entrauschungsansätzen, die die klinische Relevanz erhalten.

figure-introduction-4
Abbildung 4: Einfluss von Lärm auf die diagnostische Qualität. Zeigt, wie Rauschen anatomische Details in MRT- und CT-Scans verdeckt. Der Vergleich von Original- und verrauschten Bildern zeigt eine Verschlechterung der visuellen Klarheit, insbesondere entlang von Organgrenzen und Weichteilgrenzflächen. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

Diese Studie schlägt eine neuartige Entrauschungspipeline vor, die Sharpening-basierte Verbesserung und K-Means-Segmentierung mit einem CNN-basierten Autoencoder kombiniert, um das Rauschen zu reduzieren und gleichzeitig die Recheneffizienz zu verbessern. Das vorgeschlagene Modell wird anhand von Standardmetriken und Benchmark-Datensätzen validiert. Darüber hinaus bewerten wir die Anwendbarkeit in der Telemedizin, bei der Nutzung älterer Geräte und bei nachhaltigem Computing, um Lücken in herkömmlichen Deep-Learning-Lösungen zu schließen 24,25,26.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

In dieser Studie wurden ausschließlich öffentlich zugängliche, anonymisierte CT- und MRT-Bildgebungsdatensätze verwendet. Es waren keine lebenden Menschen oder Tiere beteiligt. Daher war keine Genehmigung durch das Institutional Review Board (IRB) oder die Ethikkommission erforderlich.

Methodenübersicht
Dieses Protokoll stellt eine reproduzierbare Pipeline für die energieeffiziente Entrauschung medizinischer Bilder dar. Es kombiniert Vorverarbeitungstechniken, einschließlich Schärfefilter und K-Means-Clustering, mit einem auf CNN (Convolutional Neural Network) basierenden Autoencoder zur Entrauschung von Bildern. Diese integrierte Methode verbessert die Bildqualität bei gleichzeitiger Reduzierung der Schulungszeit und des Energieverbrauchs der Hardware und unterstützt eine nachhaltige medizinische Diagnostik 19,20,21,22,23. Abbildung 5 fasst das End-to-End-Framework zusammen.

figure-protocol-1
Abbildung 5: Vorgeschlagene Rauschunterdrückungs-Framework-Architektur. Diese Abbildung skizziert die gesamte Pipeline: Datenerfassung, Vorverarbeitung (Sharpening + K-Means-Segmentierung), gefolgt von CNN-basierter Autoencoder-Rauschunterdrückung. Er betont den hybriden Ansatz, der darauf abzielt, den Energieverbrauch zu senken und gleichzeitig die strukturelle Treue zu erhalten. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

Der vollständige Arbeitsablauf ist in Abbildung 5 zusammengefasst, die die Sequenz von der Einrichtung des Datensatzes über die Vorverarbeitung (Sharpening und K-Means) und die Rauschunterdrückung des CNN-Autoencoders bis hin zum Testen zeigt.

Einrichtung von Software und Umgebung
Option A - Google Colab (empfohlen für die Reproduzierbarkeit): Wechseln Sie zu colab.research.google.com, und klicken Sie auf Neues Notizbuch. Wählen Sie Runtime > Laufzeittyp ändern > Hardwarebeschleuniger: GPU > Speichern aus. Klicken Sie auf Datei > Hochladen , um das bereitgestellte Notizbuch und den Datensatz .zip hochzuladen (oder verbinden Sie Google Drive, indem Sie auf Dateien > Laufwerk mounten) klicken. Installieren Sie in der ersten Codezelle Abhängigkeiten (bereits im Notebook): pip install opencv-python scikit-image scikit-learn tensorflow matplotlib numpy pandas. Klicken Sie auf Runtime > Run all. Bestätigen Sie, dass Folgendes angezeigt wird: (i) eine Umgebungszusammenfassung mit Paketversionen, (ii) GPU-Name (in der Zellenausgabe) und (iii) die Erstellung eines Experimentordners wird ausgeführt/JJJJ-MM-TT/.

Option B - Lokal (Conda): Öffnen Sie Anaconda Prompt/Terminal und führen Sie Folgendes aus:

figure-protocol-2

Platzieren Sie Ihren Datensatz unter data/raw/ und Skripte unter code/. Ausführen: python code/train_autoencoder.py --data_root data --img_size 256 --k_values 3 5 --epochs 100 --batch 32 --lr 0.001. Bestätigen Sie, um Folgendes zu sehen: Umgebungsausdruck, erkannte GPU und ein Protokollverzeichnis wird ausgeführt/YYYY-MM-DD/.

Vorbereitung des Datensatzes
Öffentlich zugängliche Datensätze von CT- und MRT-Scans stammen aus Repositorien für medizinische Bildgebung. Diese Datensätze enthielten Rauschen, das für reale klinische Scans typisch ist, und wurden nach institutionellen und ethischen Standards anonymisiert 8,9. Jedes Bild wurde auf 256 x 256 Pixel verkleinert und aus Kompatibilitätsgründen im PNG- oder DICOM-Format gespeichert. Die Datensätze wurden nach dem Zufallsprinzip wie folgt aufgeteilt: 70 % für das Training, 15 % für die Validierung und 15 % für die Tests, um eine geschichtete Verteilung der Bildgebungsmodalitäten und des Rauschpegels zu gewährleisten. Die Rauschstatistik wurde anhand der mittleren Pixelvarianz vor der Rauschunterdrückung gemessen.

Ordner organisieren: Erstellen Sie einen Ordner wie unten beschrieben:

figure-protocol-3

Um Bilder hinzuzufügen, kopieren Sie anonymisierte CT/MRT-Bilder in data/raw/CT und data/raw/MRT (PNG, JPG oder DICOM). Standardisieren der Bildgröße mit Python (empfohlen): Führen Sie die Notebook-Zelle Resize & convert aus. Es lädt jedes Bild, konvertiert bei Bedarf Graustufen und passt die Größe auf 256 x 256 an.

figure-protocol-4

Eine Alternative ist die Verwendung der GUI (ImageJ/Fiji-Alternative) wie beschrieben. Klicken Sie auf Datei > Importieren > Bildsequenz (oder einzelne Bilder), dann Bild-> Geben Sie > 8-Bit, Bild > > Größe anpassen... > 256 x 256 und dann Datei > Speichern als > PNG in data/preproc/.

Splits erstellen: Führen Sie die Notebook-Zelle Train/Val/Test split (70/15/15) aus; Es mischt Dateinamen und kopiert sie in data/splits/train|val|test/. Die Konsole druckt die Zählungen aus (z. B. Zug: 700, Val: 150, Test: 150). Checkpoint (beobachten): Öffnen Sie Daten/splits/train/ und überprüfen Sie, ob die Bilder 256 x 256 und Graustufen (1 Kanal) sind. Bewahren Sie ein kleines CSV-Manifest (splits.csv) auf, in dem der Dateipfad, die Modalität und die geteilte Bezeichnung aufgeführt sind.

Bildvorverarbeitung
Verwenden Sie den 3 x 3 Schärfkern. Führen Sie die Bildverbesserung mit einem Scharfzeichnungskern durch. Ein schärfender Faltungskern wurde verwendet, um die anatomischen Grenzen vor der Segmentierung zu verbessern:

figure-protocol-5

Dieser Filter akzentuiert wichtige Strukturen, indem er hochfrequente Anteileanhebt 4,5. Jedes Bild wurde mit der OpenCV-Bibliothek von Python (cv2.filter2D()) gefaltet, um das erweiterte Bild zu erzeugen. Abbildung 6 veranschaulicht Vorher-Nachher-Vergleiche.

figure-protocol-6
Abbildung 6: Diagramm der Validierungsgenauigkeit für verschiedene Werte von k. Das Balkendiagramm veranschaulicht die Validierungsgenauigkeit, die für verschiedene Werte von K erreicht wurde, die im K-Means-Clustering-Schritt verwendet wurden (K=2, 3, 4, 5). Die Genauigkeit erreicht einen Spitzenwert von K=3, was auf eine optimale Trennung zwischen anatomischen Strukturen und Geräuschbereichen hinweist. Skala: Normalisierte Genauigkeitswerte (0-1). Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

Wenden Sie (Python/OpenCV) mit dem folgenden Code an.

figure-protocol-7

Oder verwenden Sie die GUI-Alternative (ImageJ/Fiji), indem Sie auf Process > Filters > Convolve klicken. Fügen Sie die obige 3 x 3-Matrix ein und klicken Sie auf OK > Datei >> Speichern als PNG in data/preproc/enhanced/. Beobachten Sie den Kontrollpunkt, wie Kanten und Organgrenzen schärfer erscheinen; Wenn überschärfte Halos angezeigt werden, reduzieren Sie die zentrale Gewichtung des Kernels von 5 auf 4,5 und führen Sie den Vorgang erneut aus. Abbildung 7 zeigt die Vorher-Nachher-Ergebnisse der Rauschunterdrückung. Die Vorher-Bilder zeigen deutlich Rauschen und Unschärfe, während die Nachher-Bilder eine verbesserte Klarheit, schärfere anatomische Grenzen und einen verbesserten Kontrast aufweisen, was die Wirksamkeit der vorgeschlagenen Rauschunterdrückungspipeline demonstriert.

figure-protocol-8
Abbildung 7: Convolution NAutoencoder-Netzwerkarchitektur. Veranschaulicht die Architektur des Autoencoders: Eingabeschicht, Encoder (Conv + Pool-Schichten), Engpass, Decoder (Upsampling + Transposed Conv-Schichten). Jede Schicht ist mit Größe und Funktion beschriftet. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

K-Means-Clustering für die Segmentierung
Erweiterte Bilder wurden mit NumPy (image.reshape(-1, 1)) umgeformt und mit sklearn.cluster.KMeans(n_clusters=3 oder 5) gruppiert. Die segmentierte Ausgabe wurde wieder in 2D umgeformt (np.reshape(clustered_array, image.shape)), um anatomische Regionen im Vergleich zu den Rauschzonen14 zu visualisieren. Tabelle 1 listet die Segmentierungseinstellungen auf.

Sr NeinWert von kGenauigkeit
130.761
250.869
370.75

Tabelle 1: Werte von k mit entsprechenden Validierungsgenauigkeiten. In dieser Tabelle sind die Validierungsgenauigkeiten aufgeführt, die für verschiedene Werte des Clustering-Parameters k ermittelt wurden, der im Schritt der K-Means-Segmentierung der Rauschunterdrückungspipeline verwendet wird. Die Ergebnisse zeigen, dass k = 5 die höchste Genauigkeit ergibt und eine optimale Auswahl der Clustering-Parameter ermöglicht.

K-Means-Segmentierung: Umformen und Clustern (Python/scikit-learn) mithilfe des folgenden Codes.

figure-protocol-9

Führen Sie eine Farbvorschau durch (optional) und ordnen Sie Beschriftungen Farben zu, um die visuelle Qualitätskontrolle zu gewährleisten und Kanten aus dem scharfgezeichneten Bild zu überlagern. Wähle K aus, indem du mit K=3 und K=5 läufst; Validierungsgenauigkeit nachgelagert berechnen (Tabelle 1 listet Einstellungen auf; Abbildung 6 zeigt die Genauigkeit im Vergleich zu K). Dies ist ein Checkpoint; Beobachten Sie auf rauschdominante Pixel, die unterschiedliche Cluster bilden; anatomische Regionen sollten zusammenhängend bleiben. Wenn kleine Flecken auftreten, wenden Sie anatomische Grenzen an.

Auf neuronalen Netzen basierende Rauschunterdrückung
Beschreibung der Architektur: In Abbildung 8 finden Sie den Schaltplan für den Encoder-Bottleneck-Decoder. Ein CNN-basierter Autoencoder wurde unter Verwendung von TensorFlow/Keras entwickelt. Die Architektur umfasste: Eingabeschicht: 256 x 256 Graustufenbild, Encoder mit drei Faltungsschichten (Kernel: 3 x 3, Stride: 1, ReLU-Aktivierung), jeweils gefolgt von Max-Pooling; Flaschenhals als dichte latente Darstellung, Decoder mit drei Up-Sampling-Schichten mit transponierten Faltungen, Ausgabe als Sigmoid-aktivierte Schicht, die ein entrauschtes Bild erzeugt. Tabelle 2 enthält die vollständigen Architekturparameter für die einzelnen Schichten.

figure-protocol-10
Abbildung 8: Visuelle Ergebnisse des Entrauschungsprozesses. Präsentiert das ursprüngliche verrauschte Bild, das vorverarbeitete Bild und die entrauschte Endausgabe nebeneinander für die qualitative Bewertung. Veranschaulicht die Kantenerhaltung und die Reduzierung von Artefakten. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

Sr NeinKompilierungs-AttributeWerte von Kompilierungsattributen
1OptimiererAdam
2VerlustKategoriale Kreuzentropie
3MetrikGenauigkeit

Tabelle 2: Kompilierungsattribute des neuronalen Netzwerks. In dieser Tabelle sind die wichtigsten Kompilierungsparameter aufgeführt, die zum Trainieren des Convolutional Autoencoder-Modells verwendet werden. Diese Einstellungen wurden in TensorFlow implementiert und umfassen den Optimierer, die Verlustfunktion, die Bewertungsmetrik, die Anzahl der Epochen und die Batchgröße.

Trainingskonfiguration: Zu den Trainingsparametern gehörten: Verlustfunktion als Mean Squared Error (), Optimierer als Adam (Lernrate = 0,001), Batchgröße von 32 und Epochen als 100 mit frühem Stopp (Geduld = 10).

Im Folgenden finden Sie einen kurzen Überblick über die Schulung. Starten Sie das Training, indem Sie zu Colab gehen und auf Runtime > Run all klicken. Vergewissern Sie sich, dass die GPU aufgeführt ist (z. B. Tesla T4). Verwenden Sie Python-Code/train_autoencoder.py --data_root data --epochs 100 --batch 32 --lr 0.001 --early_stop 10. Die Überwachung mithilfe der Konsole druckt Epoche, train_loss, val_loss und Zeit/Epoche. Ein vorzeitiger Stopp löst nach Geduld = 10 Epochen ohne Verbesserung aus. Das beste Modell wird in der Datei runs/.../checkpoints/best.h5 gespeichert. Dies ist ein Checkpoint, beobachten Sie mit model.summary(), das den Layer-Stack anzeigt; Die Parameteranzahl sollte mit Tabelle 2 übereinstimmen. Wenn Sie OOM-Fehler erhalten, reduzieren Sie den Batch auf 16, oder legen Sie die Eingabegröße auf 224 x 224 fest.

Zwischenprüfpunkte und Fehlerbehebung
Zeigen Sie nach dem Schärfen und Segmentieren eine Vorschau von drei Bildern pro Teilung an und bestätigen Sie, dass (i) die Kanten verbessert wurden und (ii) die Cluster-Masken an der Anatomie ausgerichtet sind. Stellen Sie während des Trainings sicher, dass der Validierungsverlust abnimmt und nicht divergiert. Wenn die entrauschte Ausgabe überglättet erscheint, reduzieren Sie die Kernelmitte (4.5) oder erhöhen Sie die Trainingsepochen um 10 mit einer niedrigeren Lernrate (z. B. 5e-4).

Leistungsbewertung: Die folgenden quantitativen Metriken wurden verwendet: Peak Signal-to-Noise Ratio (PSNR), Structural Similarity Index Measure (SSIM) und Validierungsgenauigkeit der Klassifizierung von entrauschten Bildern.

Die vorgeschlagene Methode verbesserte den PSNR von 21,52 auf 28,14 dB und den SSIM von 0,76 auf 0,86 im Vergleich zu den in 7,16 vorgestellten Basismodellen. Die Energieeffizienz wurde durch die Überwachung der GPU-Auslastung (NVIDIA-SMI-Protokolle) und der Trainingszeit erfasst. Tabelle 3 fasst die Ergebnisse der Rauschunterdrückung zusammen.

Sr NeinMetrikBasismodell
1Durchschnittliche Epochenzeit (sec)25.8
2Gesamte Trainingsenergie (kWh)0.52
3GPU-Auslastung (%)85%
4Inferenzzeit pro Bild (ms)18.7
5Genauigkeit der Validierung (%)76.19%
6PSNR (dB)21.52
7SSIM0.7619

Tabelle 3: Leistungsbewertungsmetriken der Baseline im Vergleich zur vorgeschlagenen Methode. In dieser Tabelle wird die vorgeschlagene Rauschunterdrückungspipeline mit einem Basismodell für mehrere Leistungsmetriken verglichen, einschließlich Trainingszeit, GPU-Auslastung und Qualitätsmaßstäbe (PSNR, SSIM und Validierungsgenauigkeit). Die Ergebnisse deuten auf eine verbesserte Energieeffizienz und Bildqualität mit der vorgeschlagenen Methode hin.

Berechnen Sie PSNR/SSIM und den Energieverbrauch. Verwenden Sie für PSNR/SSIM (scikit-image) den folgenden Code.

figure-protocol-11

Für die Nutzung von Rechenenergie/GPU führen Sie die Zelle aus, die nvidia-smi --query-gpu=power.draw,utilization.gpu --format=csv -l 1 protokolliert, um während des Trainings auszuführen/.../gpu_log.csv (im Notebook bereitgestellt). Führen Sie in einem zweiten Terminal den folgenden Code aus:

figure-protocol-12

Analysieren Sie CSV, um die durchschnittliche Leistung (W) zu berechnen und über die Trainingszeit für die geschätzte Energie (Wh = kWh) zu integrieren. Das Notebook aggregiert PSNR, SSIM, Validierungsgenauigkeit, Epochenzeit und Energie in results_table3.csv für die direkte Einbeziehung.

Nachhaltigkeitsbewertung und telemedizinische Simulation
Um die Nachhaltigkeit der Gerätehardware zu bewerten, haben wir Gauß- und Poisson-Rauschen angewendet, um die Bildverschlechterung durch alternde Geräte zu simulieren. Das Modell stellte diese verschlechterten Eingaben in nahezu diagnostischer Qualität wieder her und bestätigte seine Robustheit 27,28,29. In telemedizinischen Simulationen wurden entrauschte Bilder mit einer simulierten Bandbreite von 256 Kbit/s unter Verwendung von Python-Sockets übertragen. Die visuelle Klarheit wurde beibehalten und unterstützt die Ferndiagnose 30,31,32.

Wenden Sie für die Simulation der Gerätealterung Gaußsches Rauschen (σ=10-30) und Poisson-Rauschen auf bereinigte Bilder an (Zellenalterungssimulation) und speichern Sie sie in data/simulated/aged/. Führen Sie das trainierte Modell auf aged/-Eingaben aus. Speichern Sie die Ausgaben in results/aged_denoised/. Beachten Sie, dass die visuelle Qualität nahezu diagnostische Genauigkeit erreichen sollte. Vergleichen Sie PSNR/SSIM mit dem Ausgangswert.

Komprimieren Sie für den Telemedizin-Bandbreitentest entrauschte Bilder mit 85 % bis 95 % in PNG/JPEG und senden Sie eine simulierte 256-kbit/s-Verbindung mit dem bereitgestellten Python-Socket-Test (telemed_sim.py). Messen Sie die Roundtrip-Zeit und den Dateiintegritäts-Hash; Stellen Sie sicher, dass keine diagnostischen Artefakte eingeführt werden. Beachten Sie, dass die visuelle Klarheit erhalten bleibt und die Dateigrößen für Workflows mit geringer Bandbreite geeignet sind.

Protokoll-Endpunkt
Nach Abschluss des Vorgangs sollten Sie über Folgendes verfügen: (i) geschärfte Bilder in preproc/enhanced/, (ii) segmentierte Bilder in preproc/segmented/, (iii) einen trainierten Autoencoder mit best.h5 in runs/.../checkpoints/, (iv) rauschfreie Ausgaben für Test- und gealterte Bilder in results/, (v) eine kompilierte Metrikdatei (results_table3.csv), in der PSNR, SSIM, Validierungsgenauigkeit, Epochenzeit und geschätzte Energie zusammengefasst sind.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Vorverarbeitung und Segmentierungsergebnisse
Die anfängliche Vorverarbeitungsphase verbesserte die Sichtbarkeit kritischer anatomischer Grenzen und reduzierte gleichzeitig Hintergrundinterferenzen. Wie in Abbildung 7 dargestellt, wiesen geschärfte Bilder eine klarere Kantendefinition auf, was die nachgelagerte Segmentierung erleichterte. Die segmentierten Bilder, die mittels K-Means-Clustering mit Werten von K = 3 und 5 erstellt wurden, isolierten erfolgreich rauschlastig...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

In dieser Arbeit wird ein hybrider Entrauschungsansatz vorgestellt, der die Bildvorverarbeitung mit einem Convolutional Autoencoder integriert, um die diagnostische Bildqualität zu verbessern und gleichzeitig den Energieverbrauch und die Rechenleistung zu optimieren.

Das Verfahren kombiniert Schärfungsfilter und K-Means-Clustering in der Vorverarbeitungsphase, um die Kantenklarheit zu verbessern und irrelevantes Rauschen zu reduzieren, gefolgt von einem CNN-ba...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Keine Interessenkonflikte zu deklarieren.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren möchten der Vishwakarma University (VU), Pune, und dem Department of Computer Engineering, Vishwakarma Institute of Technology (VIT), Pune, ihren aufrichtigen Dank für die Bereitstellung der notwendigen Infrastruktur, Datensätze und Recheneinrichtungen für diese Forschung aussprechen. Ein besonderer Dank gilt den studentischen Praktikantinnen und Praktikanten für ihre Unterstützung bei der Datenaufbereitung und der Vorprüfung. Diese Arbeit wurde nicht durch einen spezifischen Zuschuss von Fördereinrichtungen aus dem öffentlichen, kommerziellen oder gemeinnützigen Sektor unterstützt.

Beitrag des Autors:
Vidula Meshram trug zur Konzeption der Methodik, zum Design des Vorverarbeitungs- und Entrauschungsmodells und zur Manuskriptbetreuung bei. Vishal A. Meshram leitete die Implementierung des Algorithmus, führte Schulungen, Tests und Energiebewertungsexperimente durch und trug zum Verfassen und Bearbeiten von Manuskripten bei. Pallavi Rege unterstützte die Datenkuration, die Literaturrecherche und die Überprüfung von Zitationen. Gandharva Thite arbeitete an der Codierung der Autoencoder-Architektur, der Erstellung von Abbildungen und Tabellen und half bei der Leistungsbewertung. Kailas Patil und Shrikant Jadhav fungierten als korrespondierende Autoren, trugen zur technischen Validierung, zur Überarbeitung des Manuskripts und zur Fertigstellung der Einreichung bei.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Google ColaboratoryGoogelnN/ACloud-Plattform, die für Modelltraining und -tests verwendet wird
Keras (v2.x)Open-SourceN/AHigh-Level-API für TensorFlow, die für die Implementierung neuronaler Netzwerke verwendet wird
Matplotlib (v3.4 oder höher)Open-SourceN/AWird zur Visualisierung von Bildern und Ergebnissen verwendet
Microsoft Excel 365MicrosoftN/AWird für die Tabellierung und Analyse der Ergebnisse verwendet
NumPy (v1.21 oder höher)Open-SourceN/AWird für Matrixoperationen und numerisches Rechnen verwendet
NVIDIA Tesla T4 GPUNVIDIAN/AGPU für beschleunigtes Training und Inferenz
Öffentlich zugänglicher Datensatz zur medizinischen Bildgebung (CT- und MRT-Bilder)Open-Source-DatenbankenN/AWerden als Quelldaten für das Training, die Validierung und das Testen von Modellen verwendet
Python (v3.8 oder höher)Python-Software-StiftungN/AProgrammiersprache, die für die Implementierung des Modells verwendet wird
Scikit-learn (v0.24 oder höher)Open-SourceN/AWird für K-Means-Clustering und Vorverarbeitung verwendet
TensorFlow (v2.x)TischN/ADeep-Learning-Bibliothek, die für die Entwicklung von CNN-Modellen verwendet wird

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Qu, H., Liu, K., Zhang, L. Research on improved black widow algorithm for medical image denoising. Sci Rep. 14 (1), 2514(2024).
  2. Asiri, A. A., et al. Optimized brain tumor detection: A dual-module approach for MRI image enhancement and tumor classification. IEEE Access. 12, 42868-42887 (2024).
  3. Lee, S., Lee, J. K., Lee, J. Multihead neural network for multiple segmented images-based diagnosis of thyroid-associated orbitopathy activity. IEEE Access. 12, 43862-43873 (2024).
  4. Pan, S., Li, Y. EBDNet: Integrating optical flow with kernel prediction for burst denoising. IEEE Transact Circuits Syst Video Technol. 34 (9), 8456-8468 (2024).
  5. Gupta, M., et al. Medical image denoising using convolutional autoencoder with shortcut connections. 2023 5th Int Conf Smart Syst Inventive Technol (ICSSIT), IEEE. , 1524-1528 (2023).
  6. Muksimova, S., et al. Enhancing medical image denoising with innovative teacher-student model-based approaches for precision diagnostics. Sensors. 23 (23), 9502(2023).
  7. Fan, C. M., Liu, T. J., Liu, K. H. SUNet: Swin transformer UNet for image denoising. arXiv. , (2022).
  8. Hussain, S., et al. Modern diagnostic imaging technique applications and risk factors in the medical field: A review. BioMed Res Int. 2022, 5164970(2022).
  9. Patil, R., Bhosale, S. Medical image denoising techniques: A review. Int J Eng Sci Technol. 4 (1), 21-33 (2022).
  10. Wang, F., et al. Local-global feature-aware transformer based residual network for hyperspectral image denoising. IEEE Transact Geosci Remote Sensing. 60, 1-19 (2022).
  11. Yaroshchak, S., Smaida, M., El Barg, Y. Medical image enhancement based on convolutional denoising autoencoders and GMD model. MoMLeT+ DS: 3rd Int Workshop Modern Machine Learning Technol Data Sci. , (2021).
  12. Pradeep, S., Nirmaladevi, P. A review on speckle noise reduction techniques in ultrasound medical images based on spatial domain, transform domain and CNN methods. IOP Conf Series Mater Sci Eng. 1055 (1), 012116(2021).
  13. Li, Y., et al. A novel medical image denoising method based on conditional generative adversarial network. Computat Mathemat Methods Med. 2021, 1-11 (2021).
  14. Sharif, S. M. A., Naqvi, R. A., Biswas, M. Learning medical image denoising with deep dynamic residual attention network. Mathematics. 8 (12), 2192(2020).
  15. Diwakar, M., Singh, P. CT image denoising using multivariate model and its method noise thresholding in non-subsampled shearlet domain. Biomed Signal Proc Control. 57, 101754(2020).
  16. Sagheer, S. V. M., George, S. N. A review on medical image denoising algorithms. Biomed Signal Proc Cont. 61, 102036(2020).
  17. Fan, L., et al. Brief review of image denoising techniques. Vis Computing Indust Biomed Art. 2 (1), 7(2019).
  18. Kollem, S., Reddy, K. R. L., Rao, D. S. A review of image denoising and segmentation methods based on medical images. Int J Machine Learning Comput. 9 (3), 288-295 (2019).
  19. Gondara, L. Medical image denoising using convolutional denoising autoencoders. 2016 IEEE 16th Int Conf Data Mining Workshops (ICDMW), IEEE. , 241-246 (2016).
  20. Ameen, M., Ahmed, S. A. An extensive review of medical image denoising techniques. Global J Med Res. 16 (2), 85-90 (2016).
  21. Satheesh, S., Prasad, K. V. S. V. R. Medical image denoising using adaptive threshold based on contourlet transform. arXiv. , (2011).
  22. Thamilselvan, P. Improving medical image preprocessing using denoising technique. ICTACT J Image Video Proc. 12 (3), 2650-2654 (2022).
  23. Kaur, S., Singla, J., Singh, A. Review on medical image denoising techniques. 2021 Int Conf Innovative Pract Technol Manag (ICIPTM), IEEE. , 61-66 (2021).
  24. Image noise causes. Pixop Blog. , Pixop. https://www.pixop.com/blog/image-noise-causes (2025).
  25. Brendlin, A. S., et al. Deep-learning denoising minimizes radiation exposure in neck CT. Acad Radiol. 31 (5), 2144-2155 (2024).
  26. Fan, C. M., Liu, T. J. Environmental sustainability and AI in radiology: A double-edged sword. Radiology. 232 (030), 1-10 (2024).
  27. Bolongkikit, S., Tang, C. K. S., Miskon, M. S. Medical e-waste: The environmental burden of obsolete healthcare equipment. IEEE Eng Manag Rev. 51 (2), 32-41 (2023).
  28. Kaushik, K., Tiwari, R. Software-based enhancement of legacy imaging devices in rural healthcare. Health Informat J. 30 (1), 112-125 (2024).
  29. Aslam, S., Usman, A., Doyle, D. V. Eco-smart medical technologies: Extending equipment lifespan via AI-driven optimization. Sustainable Computing Informat Syst. 39, 100932(2024).
  30. Wang, J., et al. Effectiveness of AI for enhancing computed tomography image quality and reducing radiation dose: A meta-analysis. J Med Internet Res. 27 (1), e66622(2025).
  31. Zhang, Q., et al. AI: Reducing the environmental impact of deep learning. IEEE Transact Artificial Intelligence. 4 (3), 270-282 (2023).
  32. Strubell, E., Ganesh, A., McCallum, A. Energy and policy considerations for deep learning in NLP. Proc ACL. , 3645-3650 (2020).
  33. Meshram, V., Patil, K., Meshram, V. Effective medicine management for visually impaired people: PocketMed. ICIC Express Lett. 17 (12), 1331-1340 (2023).
  34. Suryawanshi, Y., Meshram, V., Meshram, V., Patil, K., Chumchu, P. Face mask wearing image dataset: A comprehensive benchmark for image-based face mask detection models. Data in Brief. 51, 109755(2023).
  35. de Souza, F. M., et al. Sustainable machine learning: Foundations and trends. ACM Comput Surveys. 56 (2), 1-35 (2024).
  36. Meshram, V., Meshram, V., Patil, K., Suryawanshi, Y., Chumchu, P. A comprehensive dataset of damaged banknotes in Indian currency (Rupees) for analysis and classification. Data in Brief. 51, 109699(2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Energy Efficient DenoisingMedical ImagingImage EnhancementK Means ClusteringConvolutional AutoencoderSharpening KernelsCT ImagingMRI ImagingAdaptive ThresholdingTelemedicine Workflows
Video Coming Soon

Related Articles