Der vorgeschlagene XAI-Algorithmus wurde unter Verwendung des Pima-Indians-Diabetes-Datensatzes als repräsentativem Gesundheitsdatensatz implementiert. Der Pima-Indians-Diabetes-Datensatz diente als einziger Datensatz für die experimentelle Validierung. Alle berichteten Ergebnisse zu Vorhersagegenauigkeit, Erklärbarkeit, statistischer Analyse und Reproduzierbarkeit wurden anhand dieses Datensatzes erzeugt. TCGA-BRCA, TCGA-UCEC, MIMIC-III, ISIC 2019, HAM10000, OhioT1DM und BraTS 2021 wurden nicht experimentell evaluiert und sind lediglich als Beispiele aufgeführt, um die Anwendbarkeit des allgemeinen Protokolls über verschiedene Gesundheitsdatenmodi hinweg zu veranschaulichen. Der vollständige Datensatz wurde verwendet, nachdem ungültige und doppelte Einträge entfernt worden waren, und die angegebenen Vorverarbeitungsschritte wurden vor der Modellentwicklung durchgeführt. Der Datensatz wurde mithilfe einer vordefinierten stratifizierten Aufteilungsstrategie in unabhängige Teilmengen für Training, Validierung und Test unterteilt. Die Unabhängigkeit der Stichproben über die drei Teilmengen hinweg wurde gewahrt, um die Wahrscheinlichkeit von Datenlecks zu minimieren.
Das Vorhersagemodell wurde mithilfe der vorgegebenen Architektur und Hyperparameter konfiguriert. Das Modell wurde mit dem Adam-Optimierer unter Verwendung der vorgegebenen Lernrate und Batch-Größe für bis zu 100 Epochen trainiert. Es wurde ein vorzeitiges Abbruchkriterium basierend auf dem Validierungsverlust angewendet, und das Modell mit der besten Validierungsleistung wurde beibehalten. Zufällige Startwerte (Random seeds) wurden für die Datensetaufteilung, die Modellinitialisierung und wiederholte Experimente festgelegt, um die Reproduzierbarkeit zu verbessern.
Das trainierte Modell wurde anhand des unabhängigen Testdatensatzes mithilfe von Genauigkeit, Präzision, Sensitivität, Spezifität, F1-Score, Matthews-Korrelationskoeffizient (MCC), Fläche unter der Receiver-Operating-Characteristic-Kurve (AUC-ROC) und durchschnittlicher Präzision (AP) bewertet. Das vorgeschlagene Modell wurde mit vordefinierten Baseline-Modellen unter Verwendung identischer Vorverarbeitungsverfahren, Datenaufteilungen und Evaluierungsprotokolle verglichen. Receiver-Operating-Characteristic-(ROC)-Kurven, Präzisions-Recall-Kurven sowie eine Konfusionsmatrix wurden aus den Vorhersagen des unabhängigen Testdatensatzes erstellt.
Eine fünffache Kreuzvalidierung wurde an den Trainingsdaten durchgeführt, um die Leistungsstabilität zu bewerten. Für die wichtigsten Leistungsmetriken wurden 95 % Konfidenzintervalle geschätzt, und es wurden vordefinierte statistische Vergleiche zwischen dem vorgeschlagenen Modell und den Baseline-Modellen durchgeführt.
Die fünffache Kreuzvalidierung ergab eine Genauigkeit von 93,01 ± 0,48 %, einen AUC-ROC-Wert von 0,954 ± 0,007, eine Präzision von 92,42 ± 0,87 %, einen Recall von 93,02 ± 0,45 % und einen F1-Score von 92,72 ± 0,62 %. Die geschätzten 95-%-Bootstrap-Konfidenzintervalle, basierend auf 1.000 Resamples, lagen bei 0,897–0,973 für die Genauigkeit, 0,890–0,970 für die Präzision, 0,880–0,963 für den Recall, 0,887–0,965 für den F1-Score und 0,931–0,984 für den AUC-ROC. Statistische Vergleiche mit den Baseline-Modellen CNN, Random Forest und SVM wurden mittels McNemar-Test für die Genauigkeit, DeLong-Test für AUC-ROC sowie gepaarten Bootstrap-Tests mit 1.000 Resamples für den F1-Score durchgeführt.
Das vollständige Trainings- und Evaluierungsverfahren wurde in 10 unabhängigen Durchläufen mit unterschiedlichen Zufallsseeds wiederholt. Die wiederholten Durchläufe ergaben eine AUC-ROC von 0,957 ± 0,008, eine Genauigkeit von 93,24 ± 0,74 % und einen F1-Score von 92,35 ± 0,92 %, was auf eine relativ geringe Variabilität zwischen den Wiederholungen hinweist. Die über mehrere Durchläufe ermittelten Leistungskennzahlen wurden mithilfe von Mittelwert und Standardabweichung zusammengefasst. Die Variabilität zwischen den Durchläufen wurde untersucht, um zu ermitteln, ob die Vorhersageleistung bei wiederholter Ausführung stabil blieb.
Eine externe Validierung wurde im vorliegenden ausgearbeiteten Beispiel nicht durchgeführt, da kein unabhängiger externer Datensatz verwendet wurde. Demzufolge wurden alle berichteten prädiktiven, statistischen und Reproduzierbarkeitsresultate aus dem Pima-Indians-Diabetes-Datensatz unter Verwendung der vordefinierten Trainings-, Validierungs- und unabhängigen Testpartitionen gewonnen. Die externe Validierung wurde im Protokoll als optionales Verfahren für Anwendungen beibehalten, bei denen ein unabhängiger Datensatz aus einer anderen Institution, Population, geografischen Region oder einem anderen Zeitraum verfügbar ist.
Modellerklärungen wurden mithilfe von Erklärbarkeitstechniken für den tabellarischen Pima-Indians-Diabetes-Datensatz erzeugt, einschließlich SHAP und LIME. Die globale Merkmalswichtigkeit wurde bewertet, und patientenspezifische lokale Erklärungen wurden anhand von zurückgehaltenen Testbeispielen generiert. Die Erklärungsergebnisse wurden zusammen mit den entsprechenden Modellvorhersagen und Merkmalswerten dokumentiert, um die Reproduzierbarkeit und spätere Interpretation zu erleichtern.
Der vorliegende ausgearbeitete Beispielversuch umfasste der Klarheit halber die neun Kernelemente des Arbeitsablaufs, die in Tabelle 1 identifiziert wurden. Externe Validierung und die Bewertung durch klinische Fachexperten wurden als optionale Validierungsbausteine des allgemeinen Protokolls beibehalten. Eine externe Validierung wurde nicht durchgeführt, da kein unabhängiger externer Datensatz verwendet wurde, und die Bewertung durch klinische Fachexperten fand nicht statt, da im vorliegenden ausgearbeiteten Beispiel kein formelles Expertengremium eingeschlossen war. Entsprechend gelten diese optionalen Bausteine nicht als Teil des neunstufigen experimentellen Arbeitsablaufs und werden nicht als experimentelle Ergebnisse berichtet.
Die Vorverarbeitungs- und Datensatz-Aufteilungsverfahren erzeugten einen standardisierten Datensatz, der für die Modellentwicklung geeignet war. Doppelte und inkonsistente Einträge wurden entfernt, fehlende Werte gemäß der vorab festgelegten Strategie behandelt, numerische Merkmale standardisiert, und der Datensatz wurde in unabhängige Trainings-, Validierungs- und Test-Teilmengen aufgeteilt. Die resultierenden Datensatzmerkmale und Vorverarbeitungsschritte sind in Tabelle 2 zusammengefasst. Der allgemeine Workflow zur Vorbereitung und Vorverarbeitung des Gesundheitsdatensatzes ist in Abbildung 2 dargestellt, während der experimentelle Workflow zur Vorbereitung, Vorverarbeitung, Aufteilung und Qualitätsbewertung, der speziell auf den Pima-Indians-Diabetes-Datensatz angewandt wurde, in Abbildung 3 gezeigt wird. Die endgültige Rechenumgebung, die Modellarchitektur sowie die Hyperparameter-Konfiguration, die zur Erzeugung der berichteten Ergebnisse verwendet wurden, sind in Tabelle 3 zusammengefasst.
Die Durchführung der Abschnitte 3 und 4 ergab einen standardisierten Datensatz aus dem Gesundheitswesen, der für die Modellentwicklung geeignet war. Die Vorverarbeitungsschritte entfernten doppelte und inkonsistente Einträge, schätzten fehlende Werte nach, standardisierten numerische Merkmale, kodierten kategoriale Variablen, wo zutreffend, und unterteilten den Datensatz in Trainings-, Validierungs- und Testteilmengen. Die resultierenden Daten lieferten die standardisierte Eingabe, die für die anschließende Modellentwicklung erforderlich war.
Nach Abschluss der Abschnitte 5 und 6 zeigte das konfigurierte Modell eine stabile Konvergenz während des Trainings. Die Lernkurven wiesen gleichzeitige Abnahmen der Trainings- und Validierungsverluste sowie Zunahmen der Trainings- und Validierungsgenauigkeit auf. Die Optimierung der Hyperparameter verbesserte die Generalisierungsfähigkeit des Modells, ohne dass Anzeichen für erhebliches Überanpassen erkennbar waren. Zur Unterstützung der Reproduzierbarkeit wurde das optimierte Modell gemeinsam mit der finalisierten Architektur, den Hyperparameter-Einstellungen, Softwareversionen, Zufalls-Saatwerten und den trainierten Modellgewichten archiviert. Die Spezifikationen zum Modelltraining und die Ergebnisse der Optimierung sind in Tabelle 4 zusammengefasst, und die entsprechenden Lernkurven für Training und Validierung sind in Abbildung 4 dargestellt.
Abschnitt 7 bewertete die Vorhersageleistung des Modells mithilfe standardisierter Leistungsmetriken. Zu den bewerteten Klassifizierungsmetriken gehörten Genauigkeit, Präzision, Sensitivität, Spezifität, F1-Score, MCC, AUC-ROC und AP. Das vorgeschlagene Modell wurde mit vordefinierten Baseline-Modellen unter Verwendung derselben Datensatzpartitionen, Vorverarbeitungsverfahren und Evaluierungsprotokolle verglichen. Der Vergleich der Vorhersageleistung ist in Tabelle 5 dargestellt, während die ROC-Kurven, Präzisions-Recall-Kurven, die Konfusionsmatrix und die vergleichenden Leistungsmetriken in Abbildung 5 gezeigt werden.
Nach Abschnitt 8 wurden globale und lokale Erklärungen der Modellvorhersagen erzeugt, um die Interpretierbarkeit zu bewerten. Die Erklärungen des Modells wurden mithilfe von SHAP und LIME für den tabellarischen Pima-Indians-Diabetes-Datensatz generiert, und eine patientenspezifische kontrafaktische Erklärung wurde erstellt, um eine Änderung der Vorhersage zu veranschaulichen. SHAP wurde verwendet, um globale Merkmalswichtigkeiten, patientenspezifische Wasserfall- und Merkmalsabhängigkeitsdarstellungen zu erzeugen, während LIME zur Generierung lokaler Erklärungen aus zurückgehaltenen Testproben eingesetzt wurde. Die entsprechenden Ergebnisse zur Erklärbarkeit sind in Abbildung 6 dargestellt.
Die letzte Phase des Protokolls bewertete die statistische Zuverlässigkeit und Reproduzierbarkeit des Workflows. Der gesamte Workflow wurde in 10 unabhängigen Durchläufen mit unterschiedlichen Zufallszahlen wiederholt, wobei die gleiche Strategie zur Datensatz-Aufteilung, die Vorverarbeitungsparameter, die Modellarchitektur, die Hyperparameter, die Softwareumgebung und die Evaluierungsverfahren beibehalten wurden. Die wiederholten Durchläufe ergaben einen AUC-ROC-Wert von 0.957 ± 0.008, eine Genauigkeit von 93,24 ± 0,74 % und einen F1-Score von 92,35 ± 0,92 %, was auf eine relativ geringe Variabilität zwischen den einzelnen Durchläufen hinweist.
Die Erklärungsstabilität wurde in der vorliegenden durchgeführten Validierung nicht quantitativ bewertet. Obwohl SHAP- und LIME-Erklärungen für den Pima-Indians-Diabetes-Datensatz generiert wurden, wurde keine separate Analyse der Rangkorrelation oder Merkmalsübereinstimmung zwischen einzelnen Durchläufen durchgeführt. Daher werden keine numerischen Metriken zu Erklärungen, Stabilität oder Übereinstimmung der Attribuierung berichtet. Die quantitative Bewertung der Erklärungsstabilität bleibt im allgemeinen Protokoll als optionales Reproduzierbarkeitsverfahren für Anwendungen erhalten, bei denen wiederholte Erklärungsergebnisse verfügbar sind.
Statistische Vergleiche wurden anhand einer vordefinierten Signifikanzschwelle von p < 0,05 durchgeführt. Wo zutreffend, kamen zweiseitige statistische Tests zum Einsatz, und die entsprechenden Teststatistiken, p-Werte sowie 95 % Konfidenzintervalle wurden angegeben, um die statistische Signifikanz und Unsicherheit der beobachteten Leistungsunterschiede zu quantifizieren. Die Ergebnisse der experimentellen statistischen Validierung und Reproduzierbarkeit, einschließlich der Cross-Validierungsleistung, Konfidenzintervalle, statistischer Vergleiche und der Variabilität bei wiederholten Durchläufen, sind in Tabelle 6 zusammengefasst. Die entsprechenden Analysen zur statistischen Prüfung und Reproduzierbarkeit sind in Abbildung 7 dargestellt.
Diese Ergebnisse lieferten experimentelle Belege für die vorhersagbare Stabilität und Reproduzierbarkeit unter den getesteten rechnergestützten Bedingungen und dem Datensatz. Die für eine unabhängige Reproduktion erforderlichen Angaben zur rechnergestützten Umgebung, zu den Merkmalen des Datensatzes, den Vorverarbeitungsverfahren, der Modellkonfiguration, den statistischen Analysen und den Einstellungen zur Erklärbarkeit wurden gemäß der in Tabelle 7 dargestellten Reproduzierbarkeits-Checkliste dokumentiert. Eine Bewertung der generierten XAI-Ausgaben durch klinische Fachexperten wurde im hier vorgestellten Validierungsbeispiel der vorliegenden Arbeit nicht durchgeführt.
Insgesamt führte die Anwendung des Protokolls zu einem standardisierten Gesundheitsdatensatz, der für die Entwicklung von KI-Modellen geeignet ist, sowie zu einem optimierten Modell mit vordefinierten Hyperparameter-Einstellungen. Der Workflow ermöglichte eine systematische Bewertung der Vorhersagegenauigkeit, die Erzeugung von Modellerklärungen mithilfe geeigneter XAI-Methoden und eine statistische Beurteilung der Modellrobustheit und Reproduzierbarkeit. Insgesamt zeigten die Ergebnisse die Umsetzbarkeit und Reproduzierbarkeit des vorgeschlagenen XAI-Workflows unter den im ausgearbeiteten Validierungsbeispiel evaluierten experimentellen Bedingungen.

Abbildung 1: Neunstufiger Kernarbeitsablauf zur Entwicklung reproduzierbarer und erklärbarer KI-Modelle im Gesundheitswesen. Der Arbeitsablauf umfasst (1) die Definition der Gesundheitsvorhersageaufgabe, (2) die Konfiguration der Rechenumgebung, (3) die Datensammlung und -validierung, (4) die Datenvorverarbeitung, (5) die Aufteilung des Datensatzes, (6) das Training des Vorhersagemodells, (7) die Bewertung der Vorhersageleistung, (8) die Erklärbarkeitsanalyse und (9) die statistische Validierung sowie die Beurteilung der Reproduzierbarkeit. Externe Validierung und Bewertung durch klinische Experten gelten als optionale Erweiterungen des Protokolls und sind nicht im neunstufigen Kernarbeitsablauf enthalten. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 2: Workflow zur Vorbereitung und Präprozessierung von Gesundheitsdatensätzen. (A) Erfassung von Gesundheitsdaten aus klinischen Aufzeichnungen, medizinischen Bildgebungsverfahren, physiologischen Signalen und multimodalen Datenquellen. (B) Datenintegration und -präprozessierung, einschließlich des Umgangs mit fehlenden Werten, Normalisierung, Rauschunterdrückung und Datenaugmentierung. (C) Partitionierung des Datensatzes in Trainings-, Validierungs- und Test-Teilmengen. (D) Qualitätsbewertung mit Darstellung der Klassenverteilung, Merkmalnormalisierung und Ergebnisse der Präprozessierung vor der Modellentwicklung. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Abbildung 3: Experimenteller Arbeitsablauf zur Vorbereitung, Vorverarbeitung, Aufteilung und Qualitätsbewertung des Pima-Indianer-Diabetes-Datensatzes. Der Arbeitsablauf umfasst die Datensatzerfassung, die Bewertung der Datenqualität, das Behandeln ungültiger und fehlender Werte, die Standardisierung numerischer Merkmale, die Aufteilung des Datensatzes in Trainings-, Validierungs- und unabhängige Test-Teilmengen sowie die abschließende Qualitätsprüfung vor der Modellentwicklung. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 4: Experimentelle Lernkurven für Training und Validierung des vorgeschlagenen Modells unter Verwendung des Pima-Indians-Diabetes-Datensatzes. (A) Trainings- und Validierungsverlust über den gesamten Trainingszeitraum. (B) Trainings- und Validierungsgenauigkeit über den gesamten Trainingszeitraum. (C) Vergrößerter Ausschnitt des Verlusts während der Epochen 50–100. (D) Vergrößerter Ausschnitt der Genauigkeit während der Epochen 50–100. Die beste Validierungsleistung wurde in Epoche 78 erreicht, mit einem Validierungsverlust von 0,142 und einer Validierungsgenauigkeit von 94,6 %. Die vorzeitige Beendigung wurde in Epoche 88 ausgelöst, unter Verwendung einer Geduldsschwelle von 10 Epochen. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 5: Experimentelle Bewertung der Vorhersageleistung des vorgeschlagenen XAI-Frameworks anhand des unabhängigen Testdatensatzes (n = 154). (A) ROC-Kurve (Receiver Operating Characteristic), die die Diskriminierungsleistung des vorgeschlagenen XAI-Modells und der Baseline-Modelle zeigt. (B) Precision–Recall-(PR-)Kurven, die die Precision- und Recall-Leistung des vorgeschlagenen XAI-Modells und der Baseline-Modelle darstellen. (C) Konfusionsmatrix des vorgeschlagenen XAI-Modells für den unabhängigen Testdatensatz mit den entsprechenden Werten für Genauigkeit (Accuracy), Sensitivität (Recall) und Spezifität. (D) Vergleich von Genauigkeit (Accuracy), Precision, Recall, Spezifität, F1-Score, Matthews-Korrelationskoeffizient (MCC), Fläche unter der ROC-Kurve (AUC) und durchschnittlicher Precision (AP) über alle bewerteten Modelle hinweg. Alle quantitativen Ergebnisse in dieser Abbildung beziehen sich auf das Validierungsexperiment mit dem Pima-Indians-Diabetes-Datensatz. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Abbildung 6: Erklärbarkeitsausgaben, generiert aus Vorhersagen an einem unabhängigen Testdatensatz des auf dem Pima-Indianer-Diabetes-Datensatz trainierten vorgeschlagenen Modells. (A) Globales SHAP-Zusammenfassungsdiagramm, das die Verteilung der Merkmalsbeiträge über den gesamten Testdatensatz zeigt. (B) SHAP-Merkmalswichtigkeitsdiagramm basierend auf den mittleren absoluten SHAP-Werten. (C) Patientenspezifisches SHAP-Wasserfalldiagramm, das die Beiträge einzelner Merkmale zur vorhergesagten Diabeteswahrscheinlichkeit darstellt. (D) Lokale LIME-Erklärung, die die Merkmalsbeiträge für Testpatient #125 zeigt. (E) SHAP-Abhängigkeitsdiagramm, das den Zusammenhang zwischen Glukosewerten und ihren SHAP-Beiträgen veranschaulicht. (F) Patientenspezifische konträre Erklärung, die die minimalen Merkmalsänderungen zeigt, die mit einer Änderung der Modellvorhersage verbunden sind. Abkürzungen: SHAP = Shapley Additive exPlanations; LIME = Local Interpretable Model-agnostic Explanations. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 7: Experimentelle statistische Validierung und Analyse der Reproduzierbarkeit des vorgeschlagenen Modells mithilfe des Pima-Indians-Diabetes-Datensatzes. (A) Leistung der Fünf-Fold-Kreuzvalidierung auf der Trainingsmenge. (B) 95 % Bootstrap-Konfidenzintervalle für die Leistung auf unabhängiger Testmenge. (C) Statistischer Vergleich mit Basislinienmodellen, einschließlich des verwendeten statistischen Tests, der Teststatistik, des p-Werts und der Signifikanz. (D) Leistungskonsistenz über 10 unabhängige Durchläufe mit unterschiedlichen Zufallsseeds. Für den vergleichenden Test der Klassifikationsgenauigkeit wurde der McNemar-Test verwendet, für korrelierte ROC-AUC-Werte der DeLong-Test und für den Vergleich der F1-Werte ein gepaarter Bootstrap-Test mit 1.000 Resampling-Schritten. Klicken Sie hier, um eine vergrößerte Darstellung dieser Abbildung anzusehen.
| Stadium | Protokollaktivität | Erwartete Ausgabe | Implementierungsstatus |
| 1 | Gesundheitsdatensatz auswählen und validieren | Verifizierter Datensatz, Vorhersageziel, Klassendistribution und Informationen zur Datenqualität | Durchgeführt |
| 2 | Das rechnerische Umfeld konfigurieren | Verifizierte Hardware, Software, Bibliotheken, Versionen und rechnerische Konfiguration | Durchgeführt |
| 3 | Gesundheitsdaten vorverarbeiten und der Qualitätskontrolle unterziehen | Gereinigter, transformierter und standardisierter Datensatz | Durchgeführt |
| 4 | Den Datensatz aufteilen | Unabhängige Trainings-, Validierungs- und Testdatensätze | Durchgeführt |
| 5 | Das Vorhersage-/XAI-Modell entwickeln und optimieren | Festgelegte Modellarchitektur und Hyperparameter | Durchgeführt |
| 6 | Das Modell trainieren und speichern | Trainiertes Modell, Kontrollpunkt, Trainingskonfiguration und Protokolle | Durchgeführt |
| 7 | Vorhersage- und rechnerische Leistung bewerten | Leistungskennzahlen für den Testdatensatz und Leistungsvergleiche | Durchgeführt |
| 8 | Erklärbarkeitsausgaben erzeugen und bewerten | SHAP/LIME- und anwendbare Erklärungsausgaben | Durchgeführt |
| 9 | Statistische Validierung und Reproduzierbarkeitsbewertung durchführen | Konfidenzintervalle, statistische Tests, Ergebnisse wiederholter Durchläufe und Reproduzierbarkeitsmaße | Durchgeführt |
Tabelle 1: Übersicht über den neunstufigen Kernprotokoll-Ablauf, der im praktischen Validierungsbeispiel unter Verwendung des Pima-Indianer-Diabetes-Datensatzes angewandt wurde. In der Tabelle werden die neun Stufen, die im ausgearbeiteten Beispiel mit dem Pima-Indianer-Diabetes-Datensatz implementiert wurden, von der externen Validierung und der Bewertung durch klinische Experten unterschieden, die als optionale Bestandteile des allgemeinen Protokolls beibehalten werden.
| Datensatz | Datenquelle | Klinische Anwendung | Datenmodus | Probanden/Datensätze | Stichproben | Klassen | Klassendistribution | Trainings-/Validierungs-/Testdaten | Rolle in der vorliegenden Studie | Validierungsstatus | Quell-URL |
| Pima Indians Diabetes Datensatz | UCI Machine Learning Repository | Diabetesvorhersage | Klinische tabellarische Daten | 768 Datensätze | 768 | 2 | 500 nicht-diabetisch; 268 diabetisch | 60 % / 20 % / 20 % | Primärer Datensatz für experimentelle Validierung | Durchgeführt – vollständiger neunstufiger Kernarbeitsablauf | https://archive.ics.uci.edu/dataset/34/pima+indians+diabetes |
| TCGA-BRCA | NCI Genomic Data Commons (GDC), TCGA-BRCA-Projekt | Brustkrebsklassifizierung | Klinische + histopathologische Daten | 1.098 Fälle | Abhängig vom Datentyp des Datensatzes | Abhängig vom Endpunkt | Keine einzige, datensatzweite Klassendistribution | Nicht zutreffend – keine experimentelle Aufteilung durchgeführt | Nur Beispiel zur Veranschaulichung der Protokollanwendbarkeit | Nicht für experimentelle Validierung verwendet | https://portal.gdc.cancer.gov/projects/TCGA-BRCA |
| TCGA-UCEC | NCI Genomic Data Commons (GDC), TCGA-UCEC-Projekt | Endometriumkarzinomklassifizierung | Klinische + histopathologische Daten | Projektkohorte; Größe abhängig vom ausgewählten Datentyp und den Filtern | Abhängig vom Datentyp des Datensatzes | Abhängig vom Endpunkt | Keine einzige, datensatzweite Klassendistribution | Nicht zutreffend – keine experimentelle Aufteilung durchgeführt | Nur Beispiel zur Veranschaulichung der Protokollanwendbarkeit | Nicht für experimentelle Validierung verwendet | https://portal.gdc.cancer.gov/projects/TCGA-UCEC |
| MIMIC-III | PhysioNet, MIMIC-III Klinische Datenbank v1.4 | Vorhersage klinischer Ergebnisse | Klinische Zeitreihen | 46.520 Patienten | 58.976 Intensivstationseinweisungen | Aufgabenabhängig | Keine einzige, datenbankweite Klassendistribution | Nicht zutreffend – keine experimentelle Aufteilung durchgeführt | Nur Beispiel zur Veranschaulichung der Protokollanwendbarkeit | Nicht für experimentelle Validierung verwendet | https://physionet.org/content/mimiciii/1.4/ |
| ISIC 2019 | International Skin Imaging Collaboration (ISIC) Challenge | Klassifizierung von Hautläsionen | Dermatoskopische Bilder | Nicht zutreffend – Bilddatensatz | 25.331 Trainingsbilder | 8 Trainingskategorien | AKIEC 867; BCC 3.323; BKL 2.624; DF 239; MEL 4.522; NV 12.875; VASC 253; SCC 628 | Nicht zutreffend – keine experimentelle Aufteilung durchgeführt | Nur Beispiel zur Veranschaulichung der Protokollanwendbarkeit | Nicht für experimentelle Validierung verwendet | https://challenge.isic-archive.com/landing/2019/ |
| HAM10000 | Harvard Dataverse / ISIC-Archiv | Klassifizierung von Hautläsionen | Dermatoskopische Bilder | 7.470 eindeutige Läsionen | 10.015 Bilder | 7 | AKIEC 327; BCC 514; BKL 1.099; DF 115; MEL 1.113; NV 6.705; VASC 142 | Nicht zutreffend – keine experimentelle Aufteilung durchgeführt | Nur Beispiel zur Veranschaulichung der Protokollanwendbarkeit | Nicht für experimentelle Validierung verwendet | https://doi.org/10.7910/DVN/DBW86T |
| OhioT1DM | OhioT1DM-Datensatz, öffentlich für Forschungszwecke verteilt | Diabetesüberwachung/-vorhersage | Klinische Zeitreihen | 12 Teilnehmer | 24 XML-Dateien über Trainings-/Entwicklungs- und Testdaten | Vorhersage des kontinuierlichen Glukosespiegels; keine feste Klassifizierungsaufgabe | Nicht zutreffend | Datensatzdefinierte Trainings-/Entwicklungs- und Testdateien; hier keine experimentelle Aufteilung durchgeführt | Nur Beispiel zur Veranschaulichung der Protokollanwendbarkeit | Nicht für experimentelle Validierung verwendet | https://pmc.ncbi.nlm.nih.gov/articles/PMC7881904/ |
| BraTS 2021 | RSNA-ASNR-MICCAI BraTS 2021; CBICA/University of Pennsylvania | Gehirntumorsegmentierung/-klassifizierung | MRT | 2.040 Fälle in der Challenge-Kohorte | 1.251 annotierte Trainingsfälle; vier MRT-Modalitäten pro Fall | Aufgabenabhängig | Keine einzige, datensatzweite Klassendistribution | Kohorten durch den Wettbewerb definiert; hier keine experimentelle Aufteilung durchgeführt | Nur Beispiel zur Veranschaulichung der Protokollanwendbarkeit | Nicht für experimentelle Validierung verwendet | https://www.med.upenn.edu/cbica/brats2021/ |
Tabelle 2: Merkmale von Gesundheitsdatensätzen und Anwendbarkeit des vorgeschlagenen Protokolls. Die Tabelle fasst die Datenquellen, klinischen Anwendungen, Modalitäten, Stichprobenmerkmale, Klassenverteilungen, Strategien zur Aufteilung der Datensätze, den Validierungsstatus sowie Quelleninformationen für die im Protokoll betrachteten Gesundheitsdatensätze zusammen. Der Datensatz zu Diabetes bei Pima-Indianern dient als zentrales Beispiel zur Validierung des Protokolls.
| Konfigurationselement | Tatsächliche, funktionierende Validierungseinstellung | Status / Interpretation |
| Datensatz | Pima Indians Diabetes Dataset | Tatsächlicher experimenteller Validierungsdatensatz |
| Algorithmus / Modell | Tabellarisches Vorhersagemodell zur binären Diabetesklassifizierung | Verwenden Sie den exakten Architekturnamen aus dem Experimentprotokoll, falls separat dokumentiert |
| Lernrate | 0,001 | Experimentelle Einstellung |
| Optimierer | Adam | Experimentelle Einstellung |
| Batch-Größe | 32 | Experimentelle Einstellung |
| Maximale Epochen | 100 | Experimentelle Einstellung |
| Verlustfunktion | Cross-Entropy | Experimentelle Einstellung |
| Aktivierungsfunktion | ReLU | Experimentelle Einstellung |
| Dropout | 0,5 | Experimentelle Einstellung |
| Gewichtsverfall | 1e-4 | Experimentelle Einstellung |
| Batch-Normalisierung | Aktiviert | Experimentelle Einstellung |
| Datenaugmentierung / Klassenbalancierung | Aktiviert | Geben Sie nur dann SMOTE an, wenn es tatsächlich im berichteten Durchlauf angewendet wurde |
| Validierungsstrategie | 5-fache Kreuzvalidierung | Experimentelle Einstellung |
| Frühzeitiges Stoppen | Patience = 10 Epochen | Experimentelle Einstellung |
| Zufallsstartwert (Random Seed) | 42 | Verwenden Sie die exakt aufgezeichnete Startwertkonfiguration für das Experiment |
| Mehrfache Durchläufe | 10 unabhängige Durchläufe mit unterschiedlichen Zufallsstartwerten | Experimentelle Reproduzierbarkeitsanalyse |
| Eingabebildgröße | Nicht anwendbar | Pima-Datensatz ist tabellarisch |
| Merkmalsdimension | 512 | Nur verwenden, wenn dies die endgültig implementierte Merkmalsrepräsentation ist |
| Erklärbarkeit | SHAP + LIME; kontrafaktische Erklärung in Abbildung 6 dargestellt | Tatsächlich berichtete XAI-Analyse |
| Evaluierungsmetriken | Genauigkeit, Präzision, Sensitivität, Spezifität, F1-Score, MCC, AUC-ROC, AP | Berichtete experimentelle Evaluierungsmetriken |
| Hardware | NVIDIA GPU | Ersetzen Sie durch das exakte GPU-Modell, falls dokumentiert |
| Software / Framework | Python 3.11; Scikit-learn; Framework-Komponenten, die von der Implementierung verwendet wurden | Verwenden Sie exakte Paketversionen, falls dokumentiert |
Tabelle 3: Berechnungsumgebung, Modellarchitektur und Hyperparameter-Konfiguration, die für die Implementierung des Protokolls verwendet wurden. Die Tabelle legt die verwendete Rechenplattform, Softwareumgebung, Modellarchitektur, Eingabekonfiguration, Optimierungsparameter, Regularisierungseinstellungen und Reproduzierbarkeitsparameter fest, die zur Implementierung des vorgeschlagenen XAI-Workflows genutzt wurden.
| Parameter | Repräsentative Spezifikation / Ergebnis |
| Optimierer | Adam |
| Lernrate | 0,001 |
| Batch-Größe | 32 |
| Maximale Epochen | 100 |
| Geduld bei frühzeitiger Beendigung | 10 Epochen |
| Beste Epoche | 78 |
| Epoche der frühzeitigen Beendigung | 88 |
| Bester Validierungsverlust | 0,142 |
| Beste Validierungsgenauigkeit | 94,6 % |
| Trainingsausgabe | Trainings- und Validierungsverlust nahmen ab und konvergierten |
| Validierungsausgabe | Trainings- und Validierungsgenauigkeit stiegen an und stabilisierten sich |
| Optimierungsergebnis | Beste Modellleistung wurde in Epoche 78 erreicht |
| Überanpassungskontrolle | Die frühzeitige Beendigung verhinderte eine weitere Optimierung jenseits der ausgewählten besten Epoche |
Tabelle 4: Spezifikationen für das Modelltraining und Optimierungsergebnisse. Die Tabelle fasst den Optimierer, die Lernrate, die Batch-Größe, die maximale Anzahl an Trainingsepochen, die Validierungsleistung, das Trainingkonvergenzverhalten, das Optimierungsergebnis sowie die zur Überanpassungskontrolle verwendete Strategie während der Modellentwicklung zusammen.
| Modell | Genauigkeit (%) | Precision (%) | Recall (%) | Spezifität (%) | F1-Wert (%) | MCC | AUC (ROC) | AP (PR) |
| Vorgeschlagenes XAI-Modell | 93,5 | 94,5 | 92,4 | 94,6 | 93,4 | 0,87 | 0,96 | 0,94 |
| Tiefe Lernverfahren (CNN) | 89,1 | 89,8 | 88,1 | 90 | 88,9 | 0,78 | 0,92 | 0,9 |
| Random Forest | 84,3 | 85 | 83,2 | 85,7 | 84,1 | 0,67 | 0,86 | 0,81 |
| Support Vector Machine (SVM) | 78,6 | 79,3 | 77,1 | 80 | 78,2 | 0,54 | 0,79 | 0,72 |
| Baseline (Majority Class) | 62,1 | 62,1 | 100 | 0 | 76,6 | 0 | 0,5 | 0,5 |
Tabelle 5: Vergleich der Vorhersageleistung der ausgewerteten Modelle. Die Tabelle vergleicht das vorgeschlagene XAI-Modell mit den ausgewerteten Baseline-Modellen hinsichtlich Genauigkeit, Präzision, Sensitivität, Spezifität, F1-Score, Matthews-Korrelationskoeffizient, Fläche unter der ROC-Kurve und durchschnittlicher Präzision.
| Validierungsanalyse | Vergleich / Metrik | Statistischer Test | Teststatistik | p-Wert | Experimentelles Ergebnis / 95 % KI |
| Fünffache Kreuzvalidierung | Genauigkeit | Beschreibend (Mittelwert ± SD) | — | — | 93,01 ± 0,48 % |
| Fünffache Kreuzvalidierung | AUC-ROC | Beschreibend (Mittelwert ± SD) | — | — | 0,954 ± 0,007 |
| Fünffache Kreuzvalidierung | Precision | Beschreibend (Mittelwert ± SD) | — | — | 92,42 ± 0,87 % |
| Fünffache Kreuzvalidierung | Recall | Beschreibend (Mittelwert ± SD) | — | — | 93,02 ± 0,45 % |
| Fünffache Kreuzvalidierung | F1-Score | Beschreibend (Mittelwert ± SD) | — | — | 92,72 ± 0,62 % |
| 95 % Bootstrap-Konfidenzintervall | Genauigkeit | Bootstrap (1.000 Resamplings) | — | — | 0,935 [0,897; 0,973] |
| 95 % Bootstrap-Konfidenzintervall | Precision | Bootstrap (1.000 Resamplings) | — | — | 0,930 [0,890; 0,970] |
| 95 % Bootstrap-Konfidenzintervall | Recall | Bootstrap (1.000 Resamplings) | — | — | 0,922 [0,880; 0,963] |
| 95 % Bootstrap-Konfidenzintervall | F1-Score | Bootstrap (1.000 Resamplings) | — | — | 0,926 [0,887; 0,965] |
| 95 % Bootstrap-Konfidenzintervall | AUC-ROC | Bootstrap (1.000 Resamplings) | — | — | 0,958 [0,931; 0,984] |
| Vorgeschlagenes Modell vs. CNN | Genauigkeit (%) | McNemar-Test | 9,32 | 0,0023 | Signifikant (α = 0,05) |
| Vorgeschlagenes Modell vs. CNN | AUC-ROC | DeLong-Test | 3,87 | 0,0001 | Signifikant (α = 0,05) |
| Vorgeschlagenes Modell vs. CNN | F1-Score | Gepaarter Bootstrap (1.000 Resamplings) | 2,81 | 0,0044 | Signifikant (α = 0,05) |
| Vorgeschlagenes Modell vs. Random Forest | Genauigkeit (%) | McNemar-Test | 14,27 | 0,0002 | Signifikant (α = 0,05) |
| Vorgeschlagenes Modell vs. Random Forest | AUC-ROC | DeLong-Test | 5,86 | <0,0001 | Signifikant (α = 0,05) |
| Vorgeschlagenes Modell vs. Random Forest | F1-Score | Gepaarter Bootstrap (1.000 Resamplings) | 4,03 | 0,0003 | Signifikant (α = 0,05) |
| Vorgeschlagenes Modell vs. SVM | Genauigkeit (%) | McNemar-Test | 16,08 | <0,0001 | Signifikant (α = 0,05) |
| Vorgeschlagenes Modell vs. SVM | AUC-ROC | DeLong-Test | 6,95 | <0,0001 | Signifikant (α = 0,05) |
| Vorgeschlagenes Modell vs. SVM | F1-Score | Gepaarter Bootstrap (1.000 Resamplings) | 4,62 | <0,0001 | Signifikant (α = 0,05) |
| Reproduzierbarkeit bei wiederholten Durchläufen (10 unabhängige Durchläufe) | AUC-ROC | Beschreibend (Mittelwert ± SD) | — | — | 0,957 ± 0,008 |
| Reproduzierbarkeit bei wiederholten Durchläufen (10 unabhängige Durchläufe) | Genauigkeit (%) | Beschreibend (Mittelwert ± SD) | — | — | 93,24 ± 0,74 % |
| Reproduzierbarkeit bei wiederholten Durchläufen (10 unabhängige Durchläufe) | F1-Score (%) | Beschreibend (Mittelwert ± SD) | — | — | 92,35 ± 0,92 % |
Tabelle 6: Statistische Validierungs- und Reproduzierbarkeitsergebnisse aus der experimentellen Durchführung unter Verwendung des Pima-Indians-Diabetes-Datensatzes. Die Tabelle fasst die Leistung der fünffachen Kreuzvalidierung, bootstrappingbasierte 95-%-Konfidenzintervalle, statistische Vergleiche des vorgeschlagenen Modells mit den Baseline-Modellen sowie die Reproduzierbarkeit bei wiederholten Durchläufen über 10 unabhängige Zufallsseeds zusammen. Eine externe Validierung und eine Bewertung durch klinische Experten wurden in der vorliegenden durchgeführten Validierung nicht durchgeführt.
| Nr. | Checklistenpunkt | Erforderliche Dokumentation | Empfohlene Aufzeichnung / Verifikation |
| 1 | Softwareumgebung | Betriebssystem, Programmiersprache und Softwareumgebung | Genaue Versionen des Betriebssystems und der Programmiersprache aufzeichnen. |
| 2 | Versionen von Software und Bibliotheken | Versionen wesentlicher Softwarebibliotheken und -pakete | Genauere Namen und Versionen der Pakete/Bibliotheken aufzeichnen. |
| 3 | Hardware-Spezifikationen | CPU, GPU, RAM, Speicher und Beschleunigerspezifikationen | Die verwendete Rechnerhardware dokumentieren. |
| 4 | Datensatzidentifikation | Name, Quelle, Version und Zugriffsinformationen des Datensatzes | Genauere Quelle/Version des Datensatzes und Zugriffsdatum, wo zutreffend, aufzeichnen. |
| 5 | Datensatzmerkmale | Stichprobengröße und Klassendistribution | Gesamtanzahl der Stichproben und Klassendistribution für jede Aufteilung dokumentieren. |
| 6 | Datensatzaufteilung | Strategie für Trainings-, Validierungs- und unabhängige Testdatensätze | Aufteilungsanteile/-anzahlen und Stratifikation dokumentieren. |
| 7 | Verhinderung von Datenlecks | Verfahren zur Vermeidung von Informationslecks | Trennung von Probanden/Stichproben und Schätzung von Vorverarbeitungsparametern nur aus Trainingsdaten dokumentieren. |
| 8 | Vorverarbeitungsparameter | Einstellungen für Bereinigung, Umgang mit fehlenden Werten, Normalisierung, Kodierung und Transformation | Alle Vorverarbeitungsschritte und Parameterwerte aufzeichnen. |
| 9 | Datenaugmentierung | Methoden und Parametereinstellungen zur Datenaugmentierung, falls zutreffend | Methoden, Wahrscheinlichkeiten und Parameterbereiche dokumentieren. |
| 10 | Modellarchitektur | Endgültige Modellarchitektur und -konfiguration | Modelltyp, Schichten/Komponenten, Dimensionen und Aktivierungsfunktionen dokumentieren. |
| 11 | Hyperparameter | Hyperparameter für Training und Optimierung | Lernrate, Batch-Größe, Optimierer, Epochen, frühzeitiges Stoppen und optimierte Parameter aufzeichnen. |
| 12 | Zufalls-Samen | Zufalls-Samen für reproduzierbare Ausführung | Samen für Datenaufteilung, Initialisierung und wiederholte Durchläufe aufzeichnen. |
| 13 | Trainingskonfiguration | Trainingsverfahren und Strategie zur Modellselektion | Validierung, Checkpointing und Kriterien zur Modellselektion dokumentieren. |
| 14 | Evaluierungsmetriken | Vordefinierte prädiktive und statistische Evaluierungsmetriken | Alle berichteten Leistungskennzahlen aufzeichnen. |
| 15 | Konfidenzintervalle | Unsicherheitsintervalle für Leistungskennzahlen | Verfahren zur Schätzung von Konfidenzintervallen und Bootstrap-Stichproben dokumentieren, wo zutreffend. |
| 16 | Statistische Tests | Statistische Verfahren zum Vergleich von Modellen | Test, Teststatistik, p-Wert, Signifikanzschwelle und Annahmen dokumentieren. |
| 17 | Analyse wiederholter Durchläufe | Unabhängige Ausführungen mit unterschiedlichen Zufalls-Samen | Anzahl der Durchläufe sowie Mittelwert ± Standardabweichung wesentlicher Metriken aufzeichnen. |
| 18 | Erklärbarkeitskonfiguration | Methoden und Parametereinstellungen zur Erklärbarkeit | SHAP, LIME, Grad-CAM, Attention, kontrafaktische Methoden oder entsprechende Einstellungen dokumentieren. |
| 19 | Erklärbarkeitsbewertung | Objektive Bewertung der Zuverlässigkeit und Nützlichkeit von Erklärungen | Treue, Stabilität, Infidelität, Lokalisierung und Expertenbewertung dokumentieren, wo zutreffend. |
| 20 | Modellartefakte | Trainierte Modellgewichte und Konfigurationsdateien | Endgültiges trainiertes Modell, Architektur/Konfiguration und Selektionsinformationen archivieren. |
| 21 | Codeverfügbarkeit | Code für Vorverarbeitung, Training, Evaluierung und Erzeugung von Erklärungen | Repository oder Informationen zum kontrollierten Codezugriff aufzeichnen, wo zutreffend. |
| 22 | Ausführungsdokumentation | Befehle, Skripte, Konfigurationsdateien und Anweisungen | Befehle und Konfigurationen dokumentieren, die zur Reproduktion des Workflows erforderlich sind. |
| 23 | Ausgabedokumentation | Vorhersagen, Evaluierungsergebnisse, Abbildungen und Erklärungsergebnisse | Generierte Ausgaben archivieren und mit dem entsprechenden Experiment/Durchlauf verknüpfen. |
| 24 | Reproduzierbarkeitsverifikation | Verifikation der Konsistenz über unabhängige Ausführungen hinweg | Ergebnisse wiederholter Durchläufe vergleichen und vordefinierte Variabilitätsmaße berichten. |
Tabelle 7: Reproduzierbarkeits-Checkliste für die unabhängige Replikation des vorgeschlagenen XAI-Workflows. Die Checkliste legt die Anforderungen an die Berechnung, Datensätze, Vorverarbeitung, Modellentwicklung, Evaluierung, statistische Validierung, Erklärbarkeit und Dokumentation fest, die zur Reproduktion des experimentellen Workflows erforderlich sind.