Ein Abonnement von JoVE ist erforderlich, um diesen Inhalt anzuzeigen. Melden Sie sich an oder beginnen Sie noch heute mit einer kostenlosen Testphase.

Forschungsartikel

Deep Learning von lateralen thorakolumbalen Röntgenaufnahmen und klinische Risikofaktoren für neu auftretende Wirbelkörperfrakturen: retrospektive Einzelzentrums-Kohortenstudie

105 Aufrufe

⸱

DOI:

10.3791/71628

⸱

18. August 2026

In diesem Artikel

Zusammenfassung

Ein aus lateralen Röntgenaufnahmen des thorakolumbalen Übergangs extrahierter Deep-Learning-Score, kombiniert mit klinischen Risikofaktoren, ermöglichte eine genaue Vorhersage von neu aufgetretenen Wirbelkörperfrakturen innerhalb von zwei Jahren. Das intern validierte Modell wies eine bessere Diskriminierung, Kalibrierung, Neuklassifizierung und einen höheren Entscheidungsnutzen als das klinische Modell auf und unterstützt damit individuelle Risikostratifizierungs- und frühzeitige präventive Managementstrategien.

Zusammenfassung

Die frühe Identifizierung von Patienten mit erhöhtem Risiko für eine neue Wirbelkörperfraktur bleibt herausfordernd, da die routinemäßige klinische Risikobewertung die lokale Wirbelsäulenfragilität nicht vollständig erfasst. Diese einzentrische retrospektive Kohortenstudie untersuchte, ob durch Deep-Learning-(DL-)Merkmale, die aus initialen lateralen Thorakolumbal-Röntgenaufnahmen extrahiert wurden, die Vorhersage einer neuen Wirbelkörperfraktur innerhalb von zwei Jahren verbessert werden kann, wenn sie mit klinischen Risikofaktoren kombiniert werden. Insgesamt wurden 2.173 Patienten eingeschlossen und chronologisch in eine Entwicklungs-Kohorte (n = 1.449) und eine interne Validierungs-Kohorte (n = 724) unterteilt. Die DL-Merkmale wurden aus den Basis-Röntgenaufnahmen abgeleitet, und mittels LASSO-Cox-Regression wurden Prädiktoren ausgewählt sowie ein klinisches Modell, ein DL-Modell und ein kombiniertes Modell erstellt. Die Leistungsfähigkeit wurde mittels Bootstrap-Optimismuskorrektur, zeitlicher interner Validierung, Kalibrierung, Entscheidungskurvenanalyse, zeitabhängiger netto-Reklassifizierungsverbesserung (NRI), integrierter Diskriminierungsverbesserung (IDI) sowie Sensitivitätsanalysen bewertet. Von 2.048 potenziellen DL-Merkmalen wurden 5 beibehalten, um einen DL-Score zu generieren, der im kombinierten Modell ein unabhängiger Prädiktor blieb (HR 1,64, 95 % KI 1,34–2,01; P < 0,001). In der internen Validierung erreichte das kombinierte Modell einen C-Index von 0,759, eine AUC nach zwei Jahren von 0,774 und einen Brier-Score nach zwei Jahren von 0,077, alles Werte, die über denen des klinischen Modells lagen, bei guter Kalibrierung (Interzept 0,012; Steigung 0,972). Im Vergleich zum klinischen Modell verbesserte das kombinierte Modell zudem die Reklassifizierung (NRI nach zwei Jahren 0,316 in der Entwicklungs-Kohorte und 0,241 in der Validierungs-Kohorte) und die Diskriminierung (IDI nach zwei Jahren 0,047 bzw. 0,033; alle P < 0,01) und zeigte eine höhere Nettobilanz in der Entscheidungskurvenanalyse. Die Sensitivitätsanalysen bestätigten die primären Ergebnisse. Die Kombination von DL-Merkmalen aus lateralen Thorakolumbal-Röntgenaufnahmen mit klinischen Risikofaktoren könnte eine genauere individuelle Vorhersage einer neuen Wirbelkörperfraktur innerhalb von zwei Jahren ermöglichen.

Einleitung

Wirbelbrüche gehören zu den häufigsten Arten von osteoporotischen Fragilitätsfrakturen und treten insbesondere im thorakolumbalen Bereich auf. Sie können zu chronischen Schmerzen, Körpergrößeverlust, kyphotischer Deformität, eingeschränkter Beweglichkeit führen und das Risiko für erneute Frakturen sowie eine ungünstige Prognose erhöhen1. In der klinischen Praxis weist ein erheblicher Anteil der Patienten vor dem Frakturereignis keine typischen Symptome auf, und viele Fälle werden erst bei der bildgebenden Kontrolluntersuchung erkannt. Dies deutet darauf hin, dass eine alleinige Orientierung an Symptomen oder eine retrospektive Diagnosestellung die rechtzeitige Screening-Identifikation von Hochrisikopopulationen erschwert2,3. Die bestehende Risikobewertung stützt sich hauptsächlich auf Informationen wie Alter, Geschlecht, Body-Mass-Index, vorangegangene Fragilitätsfrakturen, Diabetes, Glukokortikoid-Exposition und Knochendichte, die den Hintergrund einer systemischen Knochenfragilität widerspiegeln können. Allerdings ist es schwierig, damit die lokale strukturelle Fragilität und mechanische Anomalien der thorakolumbalen Wirbelsäule vollständig zu erfassen – ein zentrales, lang bestehendes Problem bei der Vorhersage des Risikos für neue Wirbelkörperfrakturen4. Die laterale Thorakolumbalaufnahme ist eine der am häufigsten verwendeten und leicht zugänglichen bildgebenden Untersuchungen der Wirbelsäule in der klinischen Praxis. Sie kann nicht nur die Wirbelkörpermorphologie darstellen, sondern auch okkulte Phänotypen enthalten, die mit zukünftigen Frakturen assoziiert sind, wie Veränderungen der Endplatte, eine durchscheinende Knochenstruktur, leichte Keilformung oder eine Fehlstellung der Achse5. Frühere Studien konzentrierten sich überwiegend auf die Detektion bestehender Wirbelkörperfrakturen, die Diagnose von Osteoporose oder die Risikobewertung mittels manuell ermittelter Parameter6,7. Neuere Belege zeigen, dass mittels Deep Learning identifizierte prävalente Wirbelkörperfrakturen und Osteoporose in seitlichen Wirbelsäulenaufnahmen zusammen mit klinischen Risikofaktoren die Vorhersage von incidenten Frakturen verbessern können5. Dennoch bleibt die Evidenz für die Vorhersage von incidenten Wirbelkörperfrakturen bei Patienten ohne vorhandene Zielwirbelfraktur zum Zeitpunkt der Basisuntersuchung unter Verwendung routinemäßiger lateraler Thorakolumbalaufnahmen und lokaler Deep-Learning-(DL-)Merkmale begrenzt. Künstliche-Intelligenz-Methoden wurden bereits für die Analyse spinaler Bildgebung eingesetzt, aber Studien, die direkt auf dieses spezifische klinische Szenario abzielen, sind weiterhin rar, und eine systematische Evaluierung der Kalibrierung, des Nettogewinns aus der Entscheidungsanalyse sowie einer zeitlich getrennten Validierung fehlt in diesem Kontext bislang weitgehend8.

Daher ist es schwierig, eine klinisch relevantere Frage zu beantworten: Können die durch maschinelles Lernen aus routinemäßigen lateralen Thorakolumbal-Röntgenaufnahmen extrahierten Merkmale unabhängige und aussagekräftige zusätzliche Informationen über die klinische Risikobewertung hinaus liefern9? Auf Grundlage der oben genannten Hintergründe verfolgte diese Studie ein einzentriges retrospektives Kohortendesign, extrahierte Merkmale mittels Deep Learning aus lateralen Thorakolumbal-Röntgenaufnahmen und kombinierte diese mit klinischen Risikofaktoren, um ein Risikovorhersagemodell für neu auftretende Wirbelkörperfrakturen innerhalb von zwei Jahren zu erstellen. Die Diskriminationsfähigkeit, Kalibrierung, Robustheit und der klinische Nutzen des Modells wurden mittels zeitlicher interner Validierung, Bootstrap-Optimismuskorrektur und Sensitivitätsanalyse bewertet. Die Studie konzentrierte sich auf individuelle Risikowarnungen anhand routinemäßiger Röntgenaufnahmen und integrierte okkulte lokale bildgebende Fragilitätsphänotypen sowie systemische klinische Anfälligkeitseigenschaften in ein interpretierbares Vorhersagewerkzeug, um eine Grundlage für die Identifizierung von Hochrisikopatienten, intensivierte Nachsorge und präventive Interventionen zu schaffen.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Diese Studie wurde vom Medizinischen Ethikkomitee des Achten Volkskrankenhauses von Shanghai, Shanghai, China, überprüft und genehmigt (Zulassungsnummer 2026-102-03-02). Da es sich bei dieser Studie um eine retrospektive Studie handelte und alle Daten vor der Analyse anonymisiert worden waren, verzichtete das Ethikkomitee auf die Einholung der informierten Einwilligung der Patienten.

Studienaufbau:

Studientyp

Diese Studie war eine einzentrische retrospektive Kohortenstudie, und die Studiendatenbank wurde mithilfe von Daten aus dem Bildarchivierungssystem (PACS), dem Informationssystem der Radiologie (RIS) und dem elektronischen Patientenakten-System des Krankenhauses erstellt. Die Studienpopulation umfasste aufeinanderfolgende Patienten, die am Krankenhaus eine digitale seitliche Röntgenuntersuchung des Thorax- und Lendenwirbelsäulenbereichs durchlaufen hatten. Der Einschlusszeitraum erstreckte sich vom 1. Januar 2018 bis zum 31. Dezember 2023, und die Nachbeobachtungsfrist endete am 31. Dezember 2025. Der Studienbericht folgte den Empfehlungen von TRIPOD+AI und STROBE, um die Standardisierung der Berichterstattung bei Prognosemodell-Studien, die künstliche Intelligenz betreffen, sowie bei Beobachtungsstudien sicherzustellen.

Studiensetting und Fallquelle

Die Fälle wurden aus dem routinemäßigen klinischen Diagnose- und Behandlungsprozess von ambulanten, Notfall- und stationären Patienten des Krankenhauses abgeleitet. Die Bilddaten stammten sämtlich aus den ursprünglichen DICOM-Dateien im PACS-System, und die klinischen Daten wurden aus strukturierten elektronischen Patientenakten, Laborsystemen und Verschreibungsunterlagen gewonnen. Als Basisdatum wurde das Datum der ersten seitlichen Thorakolumbal-Röntgenuntersuchung festgelegt, die während des Studienzeitraums die Einschlusskriterien erfüllte; wenn ein und derselbe Patient mehrere Untersuchungen aufwies, die die Kriterien erfüllten, wurde nur die früheste als Basisuntersuchung beibehalten, um eine mehrfache Einschreibung zu vermeiden. Alle Daten wurden vor der Analyse anonymisiert, und Bild- sowie klinische Informationen wurden mithilfe einer eindeutigen Studienkennnummer verknüpft.

Studienpopulation:

Einschlusskriterien

Die Einschlusskriterien waren wie folgt: Alter von 50 Jahren oder älter; Abschluss einer standardmäßigen stehenden lateralen digitalen Röntgenuntersuchung des thorakolumbalen Bereichs im Krankenhaus während des Studienzeitraums; Basislinienbildgebung im nachvollziehbaren DICOM-Format; vollständige Darstellung der Wirbel T10 bis L4 in der Basislinienbildgebung; keine bestehende Wirbelfraktur von T10 bis L4 bei der Beurteilung der Basislinienbildgebung; extrahierbare, vorab festgelegte klinische Basisliniendaten aus den elektronischen Patientenakten; mindestens eine Nachuntersuchung mittels thorakolumbaler Röntgenaufnahme, CT oder MRT innerhalb von 24 Monaten nach der Basislinie oder das Auftreten einer bildgebend bestätigten neuen Wirbelfraktur innerhalb von 24 Monaten nach der Basislinie.

Ausschlusskriterien

Die Ausschlusskriterien waren wie folgt: Wirbelkörperfraktur von T10 bis L4 im Ausgangszustand; ein eindeutiger Befund einer hochenergetischen, gewaltsamen Verletzung im Ausgangszustand oder während der Nachbeobachtung; primärer oder metastasierender spinaler Tumor, spinale Infektion oder destruktive Knochenerkrankung; vorherige thorakolumbale instrumentelle Fixation, Vertebroplastie oder Kyphoplastie; Skoliose mit einem Cobb-Winkel größer als 30° oder offensichtliche kyphotische Deformität (einschließlich kyphotischer Deformität vom Scheuermann-Typ, falls vorhanden), die eine genaue Identifizierung der Endplatten von T10 bis L4 verhinderte; offensichtliche Bewegungsartefakte, abnorme Belichtung, metallische Überlagerung oder unzureichender Darstellungsbereich in der Bildgebung; Unfähigkeit, wichtige Basisvariablen oder Ergebnisinformationen aus den elektronischen Patientenakten zu bestätigen.

Prozess zur Konstruktion einer retrospektiven Kohorte

Die Studienpopulationsscreening wurde unabhängig voneinander von zwei Forschern gemäß den vorab festgelegten Kriterien durchgeführt, und Unstimmigkeiten wurden durch Diskussion zur Erreichung eines Konsenses behoben. Nach Abschluss des Fall-Screenings erfolgte die Zeitreiheneinteilung entsprechend dem Basisliniendatum: Die Patienten, die vom 1. Januar 2018 bis zum 31. Dezember 2021 eingeschlossen wurden, bildeten die Entwicklungsgruppe zur Merkmalsauswahl und Modellerstellung; die Patienten, die vom 1. Januar 2022 bis zum 31. Dezember 2023 eingeschlossen wurden, bildeten die interne Validierungsgruppe zur Bewertung der Modellleistung. Die zeitliche Aufteilung anstelle einer zufälligen Aufteilung kann das Risiko von Informationslecks verringern und entspricht eher dem realen Anwendungsszenario des Modells bei nachfolgenden Patienten. Der Prozess der Studienpopulationsscreening wird in Form eines Flussdiagramms dargestellt.

Primäres Ergebnis und dessen Bestimmung:

Definition des primären Endpunkts

Das primäre Ergebnis dieser Studie war die erste auftretende Wirbelfraktur im Bereich T10 bis L4 innerhalb von 24 Monaten nach der Basislinie. Das vorgegebene Vorhersagezeitfenster der Studie betrug 2 Jahre, und die Modellausgabe war die individuelle Wahrscheinlichkeit für das Auftreten einer Wirbelfraktur innerhalb von 2 Jahren.

Kriterien zur Bestimmung einer traumatisch bedingten Wirbelfraktur

Ein vorliegender Wirbelkörperbruch wurde wie folgt definiert: Im Vergleich zur Basislinienbildgebung zeigte die Nachuntersuchungsbildgebung eine Abnahme der vorderen, mittleren oder hinteren Höhe eines Wirbelkörpers von T10 bis L4 um 20 % oder mehr, verbunden mit einer absoluten Höhenabnahme von mindestens 4 mm, oder das Auftreten eines neuen Endplattenkollapses oder einer kortikalen Unterbrechung10. Die Beurteilung des Ergebnisses erfolgte umfassend anhand von Nachuntersuchungs-Röntgenaufnahmen des Thorax- und Lendenbereichs, CT- und MRT-Bildern. Die Bildauswertung wurde unabhängig voneinander durch zwei Muskuloskelettradiologen mit 8 bzw. 12 Jahren relevanter diagnostischer Erfahrung durchgeführt; keiner hatte während der Bildauswertung Zugang zu klinischen Daten oder Modellergebnissen. Bei Uneinigkeit erfolgte die Entscheidung durch einen erfahrenen Muskuloskelettradiologen mit 18 Jahren Berufserfahrung. Wirbelkörperbrüche, die durch Tumore, Infektionen oder hochenergetische Gewalteinwirkung verursacht wurden, wurden nicht als Ergebnisereignisse gezählt.

Zeitpunkt des Beginns, Endes und Beobachtungsfenster der Nachuntersuchung

Der Zeitpunkt des Beginns der Nachuntersuchung war das Datum der basaalen lateralen Röntgenuntersuchung des Thorakolumbalsegments. Der Endpunkt der Nachuntersuchung wurde als der früheste der folgenden Zeitpunkte definiert: das Datum des ersten auftretenden Wirbelkörperbruchs, 24 Monate nach der Basisuntersuchung, das Datum der letzten spinalen Bildgebung, die das Fehlen eines Wirbelkörperbruchs bestätigte, oder das Datum des Todes. Brüche, die erstmals nach 24 Monaten auftraten, wurden nicht in das primäre Ergebnis einbezogen. Patienten ohne Ereignisse hinsichtlich des Endpunkts galten als zensiert.

Erhebung klinischer Daten und Definition von klinischen Zielvariablen:

Demografische und allgemeine klinische Daten

Die basale klinische Daten wurden von zwei Forschern gemäß einem einheitlichen Fallberichtsbogen aus dem elektronischen Krankenakten-System extrahiert, ohne während der Extraktion die Ergebnisse der Outcome-Bestimmung einzusehen. Die erfassten demografischen und allgemeinen klinischen Daten umfassten Alter, Geschlecht, Körpergröße, Körpergewicht und Body-Mass-Index. Das Alter wurde als das tatsächliche Alter zum Zeitpunkt des Basalstatus definiert; Gewicht und Körpergröße wurden aus dem Eintrag entnommen, der innerhalb von 30 Tagen vor oder nach dem Basalzeitpunkt dem Basalzeitpunkt am nächsten lag; der Body-Mass-Index wurde berechnet als das Gewicht geteilt durch das Quadrat der Körpergröße in Kilogramm pro Quadratmeter.

Medizinische Anamnese, Medikamenteneinnahme und datenbezogene Knochenstoffwechsel

Basierend auf klinischer Verfügbarkeit und Übertragbarkeit des Modells wurden die folgenden klinischen Risikofaktoren a priori zur Aufnahme festgelegt: Anamnese einer vorherigen Fragilitätsfraktur, Typ-2-Diabetes mellitus, rheumatoide Arthritis, chronische orale Glukokortikoidtherapie und antiosteoporotische Behandlung zum Studienbeginn. Standardisierte Messungen der Knochendichte und der FRAX-Score wurden nicht als vorgegebene Prädiktoren festgelegt, da sie nicht einheitlich als standardisierte Basisvariablen für die gesamte Kohorte verfügbar waren; stattdessen wurden mehrere klinische Faktoren im Zusammenhang mit FRAX separat als individuelle Kandidatenvariablen berücksichtigt. Die Anamnese einer vorherigen Fragilitätsfraktur, die Diagnose zugrundeliegender Erkrankungen sowie Medikationsinformationen wurden alle aus elektronischen Patientenakten, Entlassungsberichten und Verschreibungssystemen vor dem Studienbeginn abgeleitet, und es wurde gefordert, dass alle Variablen vor dem Studienbeginn bestanden, um sicherzustellen, dass die Prädiktoren zeitlich vor dem Outcome-Ereignis lagen.

Definitionskriterien für klinische Variablen

Die Anamnese einer vorherigen Fragilitätsfraktur wurde definiert als eine Fraktur nach dem 40. Lebensjahr, verursacht durch ein Trauma geringer Energie, und eindeutig in der Krankenakte dokumentiert; Frakturen des Schädels, der Gesichtsbeine, der Fingerknochen und der Zehenknochen wurden von dieser Definition ausgeschlossen. Typ-2-Diabetes mellitus wurde definiert als eine eindeutige, vor dem Basiszeitpunkt dokumentierte Diagnose oder eine langfristige Einnahme von blutzuckersenkenden Medikamenten. Rheumatoide Arthritis wurde definiert als eine klare Diagnose, die von einem Facharzt für Rheumatologie in der Krankenakte gestellt wurde. Die chronische orale Gabe von Glukokortikoiden wurde definiert als eine Prednison-äquivalente Dosis von mindestens 5 mg/Tag über einen Zeitraum von mindestens 3 Monaten innerhalb des Jahres vor dem Basiszeitpunkt. Eine antiosteoporotische Behandlung zum Basiszeitpunkt wurde definiert als kontinuierliche Anwendung eines der folgenden Wirkstoffe – Bisphosphonate, Denosumab, Teriparatid, Raloxifen, Calcitonin, Alfacalcidol oder Calcitriol – innerhalb von 3 Monaten vor dem Basiszeitpunkt über eine Dauer von mindestens 8 Wochen. Alter und Body-Mass-Index wurden in der Modellierung als kontinuierliche Variablen behandelt und nicht künstlich kategorisiert.

Bildgebungsdatenaufnahme und Bildvorverarbeitung

Protokoll zur Aufnahme von lateralen Thorakolumbal-Röntgenbildern

Alle Basislinienbilder waren standardmäßige seitliche Thorakolumbal-Röntgenaufnahmen im Stehen, die mit dem digitalen Radiographiesystem des Krankenhauses angefertigt wurden. Während der Untersuchung nahmen die Patienten eine natürliche Standposition ein, wobei beide oberen Extremitäten nach vorne gebeugt wurden, um eine Überlappung der Schultern zu vermindern; der Bildgebungsbereich reichte von T10 bis L4. Für die Untersuchung wurde eine automatische Belichtungssteuerung verwendet, mit einer Röhrenspannung von 80–95 kV und einem Abstand zwischen Strahlenquelle und Detektor von 110 cm. Bei denselben Patienten wurde, falls am Basislinientermin mehrere geeignete seitliche Röntgenaufnahmen verfügbar waren, diejenige mit vollständigem Darstellungsbereich und bester Bildqualität als Analyseobjekt ausgewählt.

Bildausschlusskriterien und Qualitätskontrolle

Die Basislinienbilder mussten die folgenden Qualitätsanforderungen erfüllen: vollständige Darstellung der Wirbel T10 bis L4 sowie deren oberer und unterer Endplatten; klare Wirbelkörper-Anterior- und -Posteriorränder, Endplatten und kortikale Begrenzungen; keine offensichtlichen Bewegungsartefakte; keine starke Über- oder Unterbelichtung; keine großflächige Metallverdeckung; sowie keine offensichtliche morphologische Verzerrung aufgrund einer Rotationsstellung des Körpers. Bilder mit schweren degenerativen Veränderungen oder Osteophyten, die eine zuverlässige Identifizierung der Wirbelränder oder Endplatten verhinderten, wurden ebenfalls ausgeschlossen. Zwei Muskuloskelettspezialisten führten die Qualitätsprüfung aller Basislinienbilder durch, und jedes Bild, das auch nur ein wesentliches Qualitätskriterium nicht erfüllte, wurde ausgeschlossen.

Bildvorverarbeitung und Standardisierung

Alle DICOM-Bilder wurden vor der Analyse anonymisiert. Die Vorverarbeitungsschritte umfassten die Vereinheitlichung der Bildorientierung, eine Neubewertung auf eine räumliche Auflösung von 0,30 mm × 0,30 mm, die Begrenzung der Grauwerte auf den Bereich zwischen dem 0,5.ten und dem 99,5.ten Perzentil sowie die Standardisierung der Pixelwerte auf das Intervall 0–1 mithilfe der Min-Max-Normalisierungsmethode. Der oben beschriebene Vorverarbeitungsworkflow wurde sowohl in der Entwicklungsgruppe als auch in der Validierungsgruppe einheitlich beibehalten und vollständig automatisch durch vordefinierte Skripte durchgeführt, um Verzerrungen durch manuelle Eingriffe zu minimieren.

Extraktion von Bildmerkmalen mittels Deep Learning:

Bestimmung des interessierenden Bereichs

Die Region von Interesse war der seitliche Projektionsbereich der Wirbelsäule zwischen der oberen Endplatte von T10 und der unteren Endplatte von L4. Ein muskuloskelettaler Radiologe mit 8-jähriger Erfahrung führte die rechteckige Box-Anmerkung aller Basislinienbilder in der ITK-SNAP-Software durch, wobei die vordere Grenze 5 mm vor dem vorderen Wirbelrand und die hintere Grenze 5 mm hinter dem hinteren Wirbelrand festgelegt wurde11; ein weiterer muskuloskelettaler Radiologe mit 12-jähriger Erfahrung überprüfte die Bilder fallweise. Die ROI war eine rechteckige Box auf Regionsebene und keine exakte Segmentierung der Wirbelkontur; daher wurden häufige marginale Osteophyten nicht separat entfernt und konnten teilweise einbezogen werden, sofern sie innerhalb der vorgegebenen Grenze lagen, während Fälle mit degenerativen Veränderungen, die stark genug waren, um die Wirbelränder oder Endplatten zu verdecken, bereits während der Bildqualitätsüberprüfung ausgeschlossen worden waren. Um die Reproduzierbarkeit der Regionsanmerkung zu bewerten, wurden 50 Bilder zufällig ausgewählt und vom selben Radiologen nach 4 Wochen erneut annotiert sowie unabhängig davon vom zweiten Radiologen erneut annotiert, um anschließend eine Analyse der Merkmalstabilität durchzuführen. Nach dem Zuschneiden der ROI wurden alle Bilder einheitlich auf 224 × 224 Pixel skaliert.

Architektur des Deep-Learning-Modells und Prozess der Merkmalsextraktion

In dieser Studie wurde das ResNet50-Convolutional-Neural-Network als Deep-Learning-Feature-Extraktor verwendet. Die Netzwerkparameter wurden mit vortrainierten ImageNet-Gewichten initialisiert, und eine selbstüberwachte Domänenanpassung wurde an allen Basis-ROI-Bildern des Herleitungs-Kohortenkollektivs durchgeführt, ohne dabei Ergebnislabels im Anpassungsprozess zu verwenden. Konkret kam eine kontrastive, selbstüberwachte Aufgabe zum Einsatz, bei der zwei unabhängig augmentierte Ansichten, die aus demselben ROI-Bild erzeugt wurden, als positives Paar betrachtet wurden, während Ansichten von verschiedenen Patienten innerhalb desselben Mini-Batches als negative Paare galten, sodass sich der Encoder an die Verteilung der Studienbilder anpassen konnte. Für das Modelltraining wurde der AdamW-Optimierer verwendet, mit einer anfänglichen Lernrate von 1 × 10^-4, einer Batch-Größe von 64 und 200 Trainingsepochen; während des Trainings wurde Data Augmentation mit einer Rotation von ±5°, einer Skalierung um den Faktor 0,9–1,1, einer Translation um maximal 10 Pixel sowie einer Kontraststörung von ±10%12 durchgeführt. Diese Augmentierungen dienten der Erzeugung von gepaarten Ansichten für die selbstüberwachte Aufgabe, und in diesem Stadium wurden ausschließlich unmarkierte Bilder aus dem Herleitungs-Kohortenkollektiv verwendet. Nach der Domänenanpassung erfolgte keine überwachte Feinabstimmung anhand der Ergebnisvariablen, und der angepasste Encoder-Backbone wurde für die Merkmalsextraktion fixiert. Nach Abschluss der Domänenanpassung wurde der 2.048-dimensionale Vektor, der von der globalen Durchschnittspooling-Schicht ausgegeben wurde, als potenzielles Deep-Learning-Feature für jeden Patienten extrahiert.

Bildgebungsmerkmals-Screening und Dimensionsreduktion

Zunächst wurde der Intraklassenkorrelationskoeffizient (ICC) der Merkmale basierend auf den 50 Bildern mit wiederholter Annotation berechnet, und Merkmale mit einem intra- und interobserverlichen ICC von mindestens 0,80 wurden beibehalten, um die Stabilität der Merkmale gegenüber geringfügigen ROI-Variationen sicherzustellen. Anschließend wurden die beibehaltenen Merkmale im Entwicklungs-Kollektiv anhand der Z-Score-Standardisierung transformiert, Merkmale mit Null-Varianz entfernt, und bei Merkmalen mit einem absoluten paarweisen Korrelationskoeffizienten größer als 0,90 wurde nur eines beibehalten. Schließlich wurde eine LASSO-Cox-Regression zur Merkmalsauswahl verwendet, wobei der Strafparameter anhand der 1-SE-Regel mittels 10-facher Kreuzvalidierung bestimmt wurde. Merkmale mit nicht-null Regressionskoeffizienten wurden gemäß ihren Koeffizienten gewichtet und summiert, um den Deep-Learning-Score (DL-Score)13 zu konstruieren. Nachdem diese Bewertungsformel im Entwicklungs-Kollektiv festgelegt war, blieb sie unverändert und wurde direkt auf das interne Validierungskollektiv angewandt.

Vorverarbeitung und Integration von Kandidatenprädiktoren:

Umgang mit fehlenden Daten und Datenstandardisierung

Alle kandidatenbezogenen klinischen Variablen wurden aus strukturierten Feldern der medizinischen Dokumentation gewonnen. Variablen mit einer Fehlerrate von über 20 % wurden vom Modellierungsprozess ausgeschlossen. Die verbleibenden fehlenden Werte wurden mittels multipler Imputation durch verkettete Gleichungen behandelt, wobei 10 imputierte Datensätze generiert wurden; das Imputationsmodell enthielt alle kandidatenbezogenen Prädiktoren, die Outcome-Indikatorvariable sowie die Nelson-Aalen-Schätzung des kumulativen Hazards, um die Informationen zum Zeitpunkt des Eintritts des Ereignisses so weit wie möglich zu bewahren. Stetige klinische Variablen und der DL-Score wurden anhand des Mittelwerts und der Standardabweichung der Entwicklungsgruppe standardisiert, und dieselben Transformationsparameter wurden auf die Validierungsgruppe angewandt; binäre Variablen wurden einheitlich als 0 oder 1 codiert.

Auswahl klinischer Risikofaktoren

Die vorab festgelegte Spezifikation klinischer Risikofaktoren basierte auf klinischer Interpretierbarkeit, bisherigen Belegen und Datenverfügbarkeit; eine Screening-Methode anhand von Einzelvariablen-P-Werten wurde nicht angewandt. Die klinischen Variablen, die in die LASSO-Cox-Auswahl eingingen, waren Alter, Geschlecht, Body-Mass-Index, Vorgeschichte fragiler Frakturen, Typ-2-Diabetes mellitus, rheumatoide Arthritis, chronische orale Glukokortikoidanwendung und antiosteoporotische Basistherapie; Körpergröße und Körpergewicht wurden deskriptiv erfasst und zur Berechnung des Body-Mass-Index verwendet, jedoch nicht separat in die Modellierung einbezogen. Die LASSO-Cox-Regression wurde separat in den 10 imputierten Datensätzen der Entwicklungsgruppe durchgeführt, wobei der Strafparameter mittels 10-facher Kreuzvalidierung ausgewählt wurde; Variablen mit nicht-null-Koeffizienten in mindestens 7 imputierten Datensätzen gingen in das endgültige klinische Modell ein. Alter und Body-Mass-Index wurden beide hinsichtlich nichtlinearer Zusammenhänge mittels restriktiver kubischer Splines geprüft; falls der nichtlineare Term statistisch nicht signifikant war, wurde die lineare Form beibehalten. Multikollinearität wurde anhand des Varianzinflationsfaktors überprüft, und Variablen mit einem Varianzinflationsfaktor größer als 5 wurden nicht gleichzeitig beibehalten.

Aufbau des kombinierten Prädiktorensatzes

Um eine Überanpassung zu vermeiden, die durch die direkte Eingabe hochdimensionaler bildgebender Merkmale in das Modell entstehen könnte, wurde die Deep-Learning-Information zunächst in eine einzige kontinuierliche Variable, die DL-Score, komprimiert und anschließend gemeinsam mit den ausgewählten klinischen Risikofaktoren in ein kombiniertes Modell aufgenommen. Im kombinierten Modell wurden keine Wechselwirkungsterme vorab festgelegt, um die Sparsamkeit und Interpretierbarkeit des Modells zu bewahren. Der endgültige Satz kombinierter Prädiktoren bestand aus dem DL-Score und den beibehaltenen klinischen Variablen.

Konstruktion des Risikovorhersagemodells:

Modellierungsstrategie

In der Herleitungs-Kohorte wurden das klinische Modell, das Deep-Learning-Modell und das kombinierte Modell separat erstellt. Für die Modelle wurde eine Cox-Regression mit proportionalen Hazards verwendet, wobei der erste auftretende fragilitätsbedingte Wirbelkörperbruch innerhalb von 24 Monaten nach der Basislinie als Studienendpunkt diente; die Zensierungsregeln sind in der oben beschriebenen Nachbeobachtungsdefinition erläutert. Um eine Überanpassung zu vermeiden, wurde die Komplexität des kombinierten Modells vor der Modellierung eingeschränkt, und ein relativ hohes Verhältnis von Ereignissen pro Parameter wurde so weit wie möglich beibehalten. Die endgültigen Regressionskoeffizienten und Standardfehler jedes Modells wurden separat in den 10 imputierten Datensätzen geschätzt und anschließend nach den Rubin-Regeln zusammengefasst. Die Baseline-Gefährdungsfunktion wurde nach der Breslow-Methode geschätzt, und die individuelle 2-Jahres-Risikowahrscheinlichkeit wurde berechnet.

Aufbau des klinischen Modells

Das klinische Modell umfasste die klinischen Risikofaktoren, die nach der LASSO-Cox-Auswahl beibehalten wurden. Alle stetigen Variablen blieben in stetiger Form und wurden nicht dichotomisiert. Nach der Modellanpassung wurde die Annahme proportionaler Hazardraten mittels Schoenfeld-Residuen überprüft; für Variablen, die die Annahme proportionaler Hazardraten nicht erfüllten, wurde ein Interaktionsterm mit ln(Zeit) zur Korrektur hinzugefügt. Das klinische Modell diente dazu, die Vorhersagekraft traditioneller klinischer Informationen für das Auftreten von Wirbelkörperfrakturen zu charakterisieren.

Aufbau des Deep-Learning-Bildgebungsmodells

Das Deep-Learning-Modell wurde als Cox-Regressionsmodell mit proportionalen Hazards unter Verwendung des DL-Scores als einziger Prädiktor etabliert, um die Vorhersagefähigkeit von Deep-Learning-Merkmalen aus einem initialen lateralen Thorakolumbal-Röntgenbild bezüglich des Risikos für eine neue Wirbelkörperfraktur innerhalb von 2 Jahren zu quantifizieren. Dieses Modell berücksichtigte keine klinischen Informationen und diente somit als bildgebendes unimodales Modell zum Vergleich mit den anderen Modellen.

Konstruktion des kombinierten Modells

Dem klinischen Modell wurde das DL-Score hinzugefügt, wodurch das kombinierte Modell erstellt wurde, das auf tiefenlernbasierten Merkmalen aus seitlichen Röntgenaufnahmen des thorakolumbalen Bereichs in Kombination mit klinischen Risikofaktoren basiert. Nach der Erstellung des kombinierten Modells wurde anhand seiner Regressionskoeffizienten ein Nomogramm für die Risikoschätzung über einen Zeitraum von 2 Jahren angefertigt, um individuelle Risikobewertungen und die klinische Anwendung darzustellen.

Interne Validierung und Leistungsbewertung des Modells:

Interne Validierungsmethode

Die interne Validierung verwendete eine zeitlich getrennte, einzentrische interne Validierungsstrategie. Alle im Ableitungskollektiv erstellten Modelle wurden direkt auf das Validierungskollektiv angewandt, das vom 1. Januar 2022 bis zum 31. Dezember 2023 rekrutiert wurde, nachdem die Parameter festgelegt und ohne erneutes Anpassen übernommen wurden. Zusätzlich wurden innerhalb des Ableitungskollektivs 1.000 Bootstrap-Stichproben gezogen, um optimistischkeitskorrigierte Leistungsschätzungen zu erhalten und so die Modellstabilität zu bewerten.

Bewertung der Diskriminierung

Die Modell-Diskriminierung wurde mittels des Harrell-Konkordanzindexes und der zeitabhängigen AUC nach 2 Jahren bewertet, die beide basierend auf der Methode der inversen Wahrscheinlichkeitsgewichtung bei Zensur berechnet wurden und jeweils mit 95-%-Konfidenzintervallen angegeben sind. Eine höhere Diskriminierung bedeutet, dass das Modell besser in der Lage ist, Personen voneinander zu unterscheiden, bei denen in Zukunft eine neue Wirbelfraktur auftreten wird oder nicht. Unterschiede in der Diskriminierung zwischen den Modellen wurden mittels der Bootstrap-Methode mit 95-%-Konfidenzintervallen berechnet.

Beurteilung der Kalibrierung

Die Modellkalibrierung wurde anhand der Kalibrierungskurve für das 2-Jahres-Risiko, des Kalibrierungsachsenabschnitts, der Kalibrierungssteigung und der Brier-Score für 2 Jahre bewertet. Die Kalibrierungskurve wurde basierend auf Dezilen des vorhergesagten Risikos erstellt und mittels Bootstrap-Korrektur angepasst. Ein Kalibrierungsachsenabschnitt nahe 0, eine Kalibrierungssteigung nahe 1 und eine niedrigere Brier-Score weisen auf eine gute Übereinstimmung zwischen dem vorhergesagten Risiko und dem tatsächlich beobachteten Risiko hin.

Auswertung des klinischen Anwendungswerts

Der klinische Anwendungswert des Modells wurde mittels einer zweijährigen Entscheidungskurvenanalyse bewertet, die den Nettovorteil bei verschiedenen Schwellenwahrscheinlichkeiten verglich. Der Bereich der Schwellenwahrscheinlichkeit wurde im Voraus auf 0,05–0,30 festgelegt, um das Risikointervall abzudecken, das klinisch für eine intensivierte Nachsorge, eine weitere Knochendurchmusterung oder ein interventionelles Management verwendet werden könnte14. Ein Modell mit einem höheren Nettovorteil galt als besserer klinischer Entscheidungsunterstützungswert.

Modellvergleich und Bestimmung des besten Modells

Das klinische Modell, das Deep-Learning-Modell und das kombinierte Modell wurden umfassend hinsichtlich Diskriminierung, Kalibrierung, Brier-Score und Entscheidungskurve verglichen. Der Zugewinn des kombinierten Modells gegenüber dem klinischen Modell wurde weiter quantifiziert mittels der netto-Reklassifizierungsverbesserung und der integrierten Diskriminierungsverbesserung, jeweils zeitabhängig über 2 Jahre. Das beste Modell wurde a priori als dasjenige festgelegt, das gleichzeitig eine höhere Diskriminierung, eine gute Kalibrierung, einen geringeren Vorhersagefehler und einen größeren Nettovorteil aufwies.

Statistische Analyse:

Kontinuierliche Variablen wurden zunächst mittels des Shapiro-Wilk-Tests auf ihr Verteilungsmuster überprüft; solche, die einer Normalverteilung entsprachen, wurden als Mittelwert ± Standardabweichung angegeben, während solche mit schiefer Verteilung als Median und Interquartilbereich berichtet wurden; kategoriale Variablen wurden als Anzahl der Fälle und Prozentangabe dargestellt. Der Vergleich der Basislinienmerkmale zwischen der Entwicklungs- und der Validierungsgruppe erfolgte mittels des t-Tests für unabhängige Stichproben, des Mann-Whitney-U-Tests, des χ2-Tests bzw. des exakten Fisher-Tests. Die Vergleiche zur Basislinie dienten lediglich der Beschreibung der Kohortenmerkmale und wurden nicht als Grundlage für die Variablenselektion herangezogen. Alle statistischen Tests waren zweiseitig, und ein P < 0,05 galt als statistisch signifikant. Die statistischen Analysen wurden in der R-Software durchgeführt, hauptsächlich unter Verwendung der Pakete survival, glmnet, mice, rms, timeROC und rmda; die Bildvorverarbeitung und die Deep-Learning-Analyse wurden in der Python- und PyTorch-Umgebung durchgeführt. Zur Beurteilung der Robustheit der Ergebnisse wurde zusätzlich eine Analyse der vollständigen Fälle als Sensitivitätsanalyse durchgeführt.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Prozess zur retrospektiven Kohortenkonstruktion und Baseline-Charakteristika der Kohorten

Während des Studienzeitraums wurden laterale Röntgenaufnahmen des Thorax- und Lendenbereichs ausgewertet, und nach Entfernung von Dubletten wurden 6.114 Patienten zur Einschreibung für die Studie herangezogen. Nach schrittweiser Ausschluss von Patienten im Alter von < 50 Jahren, von Personen mit bestehenden Frakturen zum Zeitpunkt der Basislinie sowie von Patienten mit unzureichender N...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Das kombinierte Modell behielt auch nach Korrektur für Optimismus und zeitlicher interner Validierung die optimale Leistung bei, was darauf hindeutet, dass die Merkmale des maschinellen Lernens aus der seitlichen Röntgenaufnahme des thorakolumbalen Bereichs keine einfache Wiederholung klinischer Informationen darstellen, sondern unabhängige und überprüfbare zusätzliche Informationen für die Risikobewertung von neu auftretenden Wirbelkörperfrakturen innerhalb von zwei Jahren liefern können. Seine Bedeutung liegt darin, de...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Die Autoren erklären, dass sie keine Interessenkonflikte haben.

Danksagungen

Die Autoren danken dem Personal des Studienkrankenhauses für die Unterstützung bei der Bildbeschaffung, Datenauswertung und Datenverwaltung. Die Autoren danken außerdem allen Ärzten und radiologischen Technologen, die an der Patientenversorgung und der Bildakquise beteiligt waren. Diese Studie wurde finanziell unterstützt durch das Medizinische Forschungsprojekt im Bezirk Xuhui im Jahr 2024 (SHXH202405).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
glmnet-PaketCRANN/VWird für die LASSO-Cox-Regressionsanalyse verwendet.
ITK-SNAPUniversity of Pennsylvania / ITK-SNAP-ProjektN/VWird für die ROI-Auszeichnung von Basisbildern verwendet.
mice-PaketCRANN/VWird für multiple Imputation verwendet.
PythonPython Software FoundationVersion 3.10Wird für die Bildvorverarbeitung und Deep-Learning-Analyse verwendet.
PyTorchPyTorch Foundation / Linux FoundationVersion 2.1Wird für die Entwicklung von Deep-Learning-Modellen und die Merkmalsextraktion verwendet.
R-VersionR Foundation for Statistical ComputingVersion 4.3.2Wird für die statistische Analyse verwendet.
rmda-PaketCRANN/VWird für die Entscheidungskurvenanalyse verwendet.
rms-PaketCRANN/VWird für die Modellerstellung und Kalibrationsanalyse verwendet.
survival-PaketCRANN/VWird für die Cox-Regression mit proportionalen Hazards verwendet.
timeROC-PaketCRANN/VWird für die zeitabhängige AUC-Analyse verwendet.

Referenzen

  1. Daskalakis II, Bastian JD, Mavrogenis AF, Tosounidis TH. Osteoporotic vertebral fractures: an update. SICOT J. 2025;11:40.
  2. Na D et al. Underdiagnosis and underreporting of vertebral fractures on chest radiographs in men aged over 50 years or postmenopausal women with and without type 2 diabetes mellitus: a retrospective cohort study. BMC Med Imaging. 2022;22(1):81.
  3. Urrutia J, Besa P, Piza C. Incidental identification of vertebral compression fractures in patients over 60 years old using computed tomography scans showing the entire thoraco-lumbar spine. Arch Orthop Trauma Surg. 2019;139(11):1497-1503.
  4. Zerikly R, Demetriou EW. Use of Fracture Risk Assessment Tool in clinical practice and Fracture Risk Assessment Tool future directions. Women's Health (Lond). 2024;20:17455057241231387.
  5. Hong N et al. Deep learning-based identification of vertebral fracture and osteoporosis in lateral spine radiographs and DXA vertebral fracture assessment to predict incident fracture. J Bone Miner Res. 2025;40(5):628-638.
  6. Hong N et al. Deep-Learning-Based Detection of Vertebral Fracture and Osteoporosis Using Lateral Spine X-Ray Radiography. J Bone Miner Res. 2023;38(6):887-895.
  7. Johansson L et al. Grade 1 Vertebral Fractures Identified by Densitometric Lateral Spine Imaging Predict Incident Major Osteoporotic Fracture Independently of Clinical Risk Factors and Bone Mineral Density in Older Women. J Bone Miner Res. 2020;35(10):1942-1951.
  8. Li Y et al. Machine learning value in the diagnosis of vertebral fractures: A systematic review and meta-analysis. Eur J Radiol. 2024;181:111714.
  9. Kong SH et al. Development of a Spine X-Ray-Based Fracture Prediction Model Using a Deep Learning Algorithm. Endocrinol Metab (Seoul). 2022;37(4):674-683.
  10. Lunt M et al. Defining incident vertebral deformities in population studies: a comparison of morphometric criteria. Osteoporos Int. 2002;13(10):809-815.
  11. Da Mutten R et al. Whole Spine Segmentation Using Object Detection and Semantic Segmentation. Neurospine. 2024;21(1):57-67.
  12. Xiao W, Chen R. A study on ACCC surface defect classification method using ResNet18 with integrated SE attention mechanism. Appl Sci. 2026;16(4):1899.
  13. Liu F, Zhang DB, Cheng SH, Gu GS. A radiomics and deep learning nomogram developed and validated for predicting no-collapse survival in patients with osteonecrosis after multiple drilling. BMC Med Inform Decis Mak. 2025;25(1):26.
  14. Yokota T et al. Internal validation of an 11-yr prediction model for new vertebral fractures using the vertebral bone quality score: a prospective cohort study. JBMR Plus. 2025;9(11):ziaf155.
  15. Chen W, Mao M, Fang J, Xie Y, Rui Y. Fracture risk assessment in diabetes mellitus. Front Endocrinol (Lausanne). 2022;13:961761.
  16. Kong SH. Incorporating Artificial Intelligence into Fracture Risk Assessment: Using Clinical Imaging to Predict the Unpredictable. Endocrinol Metab (Seoul). 2025;40(4):499-507.
  17. Schini M et al. An overview of the use of the fracture risk assessment tool (FRAX) in osteoporosis. J Endocrinol Invest. 2024;47(3):501-511.
  18. LeBoff MS et al. The clinician's guide to prevention and treatment of osteoporosis. Osteoporos Int. 2022;33(10):2049-2102.
  19. Gu Y, Wang Y, Li M, Wang R. Current applications of deep learning in vertebral fracture diagnosis. Osteoporos Int. 2025;36(11):2071-2082.
  20. Cavati G et al. Role of Advanced Glycation End-Products and Oxidative Stress in Type-2-Diabetes-Induced Bone Fragility and Implications on Fracture Risk Stratification. Antioxidants (Basel). 2023;12(4):928.
  21. Hofbauer LC, Compston JE, Saag KG, Rauner M, Tsourdi E. Glucocorticoid-induced osteoporosis: novel concepts and clinical implications. Lancet Diabetes Endocrinol. 2025;13(11):964-979.
  22. Saravi B et al. Integrating radiomics with clinical data for enhanced prediction of vertebral fracture risk. Front Bioeng Biotechnol. 2024;12:1485364.
  23. Zhang J et al. Differentiation of acute and chronic vertebral compression fractures using conventional CT based on deep transfer learning features and hand-crafted radiomics features. BMC Musculoskelet Disord. 2023;24(1):165.
  24. McGrath LJ et al. Using negative control outcomes to assess the comparability of treatment groups among women with osteoporosis in the United States. Pharmacoepidemiol Drug Saf. 2020;29(8):854-863.
  25. Piovani D, Sokou R, Tsantes AG, Vitello AS, Bonovas S. Optimizing Clinical Decision Making with Decision Curve Analysis: Insights for Clinical Investigators. Healthcare (Basel). 2023;11(16):2244.
  26. Nguyen HT et al. A predictive nomogram for selective screening of asymptomatic vertebral fractures: The Vietnam Osteoporosis Study. Osteoporos Sarcopenia. 2025;11(1):9-14.
  27. Hu Y et al. Beyond Comparing Machine Learning and Logistic Regression in Clinical Prediction Modelling: Shifting from Model Debate to Data Quality. J Med Internet Res. 2025;27:e77721.
  28. Groot OQ et al. Availability and reporting quality of external validations of machine-learning prediction models with orthopedic surgical outcomes: a systematic review. Acta Orthop. 2021;92(4):385-393.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Tags

LASSO-Cox-RegressionModellvalidierungRisikoprognoseEntscheidungskurvenanalyseNet Reclassification Improvement