흉요추 측면 방사선 사진에서 추출한 딥러닝 점수를 임상적 위험 요인과 결합하여 2년 이내의 척추 골절 발생을 정확하게 예측할 수 있었습니다. 내부 검증을 거친 이 모델은 임상 모델보다 더 우수한 판별력, 보정력, 재분류 및 결정 이득을 보여주었으며, 이는 개별화된 위험 층화 및 조기 예방 관리 전략을 뒷받침합니다.
연구 논문
흉요추 측면 방사선 사진에서 추출한 딥러닝 점수를 임상적 위험 요인과 결합하여 2년 이내의 척추 골절 발생을 정확하게 예측할 수 있었습니다. 내부 검증을 거친 이 모델은 임상 모델보다 더 우수한 판별력, 보정력, 재분류 및 결정 이득을 보여주었으며, 이는 개별화된 위험 층화 및 조기 예방 관리 전략을 뒷받침합니다.
정기적인 임상 위험 평가가 국소적인 척추 취약성을 완전히 포착하지 못하기 때문에, 신규 척추 골절 위험이 있는 환자를 조기에 식별하는 것은 여전히 어려운 과제로 남아 있습니다. 본 단일 센터 후향적 코호트 연구에서는 기본 흉요추 측면 방사선 사진에서 추출한 딥러닝(DL) 특징이 임상적 위험 요인과 결합되었을 때 2년 이내의 신규 척추 골절 예측력을 향상시키는지 평가하였습니다. 총 2,173명의 환자가 포함되었으며, 시간 순서에 따라 도출 코호트(n = 1,449)와 내부 검증 코호트(n = 724)로 나누었습니다. 기본 방사선 사진으로부터 DL 특징을 도출하였으며, LASSO-Cox 회귀 분석을 사용하여 예측 변수를 선택하고 임상 모델, DL 모델 및 결합 모델을 구축하였습니다. 성능은 부트스트랩 낙관성 보정, 시간적 내부 검증, 보정, 결정 곡선 분석, 시간 의존적 순 재분류 개선도(NRI), 통합 판별 개선도(IDI) 및 민감도 분석을 통해 평가하였습니다. 2,048개의 후보 DL 특징 중 5개가 DL 점수를 생성하는 데 유지되었으며, 이는 결합 모델에서 독립적인 예측 변수로 남았습니다(HR 1.64, 95% CI 1.34–2.01; P < 0.001). 내부 검증에서 결합 모델은 C-index 0.759, 2년 AUC 0.774, 2년 Brier score 0.077을 달성하였으며, 이는 모두 임상 모델보다 우수했고 좋은 보정 상태(절편 0.012; 기울기 0.972)를 보였습니다. 임상 모델과 비교하여 결합 모델은 재분류(2년 NRI가 도출 코호트에서 0.316, 검증 코호트에서 0.241) 및 판별력(2년 IDI가 각각 0.047 및 0.033; 모두 P < 0.01)을 개선하였으며, 결정 곡선 분석에서 더 큰 순 이득을 제공하였습니다. 민감도 분석 결과는 일차 결과와 일치하였습니다. 흉요추 측면 방사선 사진의 DL 특징을 임상적 위험 요인과 결합하면 2년 이내의 신규 척추 골절에 대해 더 정확한 개인별 예측이 가능할 것으로 보입니다.
척추 골절은 골다공성 취약성 골절의 가장 흔한 유형 중 하나이며, 특히 흉요추 부위에서 빈번하게 발생합니다. 이는 만성 통증, 신장 감소, 후만성 변형, 가동성 제한으로 이어질 수 있으며, 재골절의 위험과 부정적인 예후를 증가시킵니다1. 임상 실무에서 상당수의 환자는 골절 발생 전 전형적인 증상이 없으며, 많은 사례가 추적 관찰 영상에서만 발견되는데, 이는 증상이나 회고적 진단에만 의존해서는 고위험군에 대한 적시 스크리닝을 완료하기 어렵다는 점을 시사합니다2,3. 기존의 위험 평가는 주로 연령, 성별, 체질량 지수, 이전의 취약성 골절, 당뇨병, 글루코코르티코이드 노출 및 골밀도와 같은 정보에 의존하며, 이는 전신적 골 취약성의 배경을 반영할 수는 있으나 흉요추 척추의 국소적 구조적 취약성과 기계적 이상을 완전히 특성화하기는 어렵습니다. 그리고 이는 새로운 척추 골절 위험 예측에서 오랫동안 존재해 온 핵심적인 어려움이기도 합니다4. 흉요추 측면 방사선 촬영은 임상 실무에서 가장 흔히 사용되고 접근 가능한 척추 영상 검사 중 하나입니다. 이는 척추의 형태를 보여줄 뿐만 아니라, 종판 변화, 희박한 골 조직, 경미한 쐐기형 변형, 정렬 불균형과 같이 향후 골절과 관련된 잠재적 표현형을 포함하고 있을 수 있습니다5. 이전 연구들은 대부분 기존의 척추 골절 검출, 골다공증 진단 또는 수동 측정 지표를 이용한 위험 평가에 집중해 왔습니다6,7. 최근의 근거는 측면 척추 영상에서 딥러닝으로 식별된 유병 척추 골절 및 골다공증이 임상적 위험 요인과 결합될 때 발생 골절의 예측력을 향상시킬 수 있음을 보여주었습니다5. 그러나 일반적인 흉요추 측면 방사선 사진과 국소 딥러닝(DL) 특징을 사용하여, 기저 시점에 표적 척추 골절이 없는 환자들만을 대상으로 발생 척추 골절을 예측하는 근거는 여전히 제한적입니다. 인공지능 방법이 척추 영상 분석에 사용되어 왔으나, 이러한 특정 임상 시나리오를 직접적으로 겨냥한 연구는 여전히 부족하며, 이 환경에서의 보정(calibration), 결정 분석을 통한 순 이익 및 시간적 분할 검증에 대한 체계적인 평가는 여전히 미흡한 실정입니다8.
따라서 임상적으로 더 유의미한 질문, 즉 일상적인 흉요추 측면 X-ray에서 딥러닝으로 추출한 특징이 임상적 위험 평가9를 바탕으로 독립적이고 의미 있는 추가 정보를 제공할 수 있는지에 대해 답하는 것은 어렵습니다. 이러한 배경을 바탕으로, 본 연구는 단일 센터 회고적 코호트 설계를 채택하여 흉요추 측면 X-ray에서 딥러닝 특징을 추출하고, 이를 임상적 위험 요인과 결합하여 2년 이내의 척추 골절 발생 위험 예측 모델을 구축하였으며, 시간적 내부 검증, 부트스트랩 낙관성 보정 및 민감도 분석을 통해 모델의 판별력, 보정력, 강건성 및 임상적 가치를 평가하였습니다. 본 연구는 일상적인 X-ray 하에서의 개별화된 위험 경고에 초점을 맞추어, 잠재적인 국소 영상 취약성 표현형과 전신적 임상 감수성 정보를 해석 가능한 예측 도구로 통합함으로써 고위험군 식별, 집중 추적 관찰 및 예방적 개입의 근거를 제공하고자 하였습니다.
본 연구는 중국 상하이의 상하이 제8인민병원 의료윤리위원회의 심의 및 승인을 받았습니다(승인 번호 2026-102-03-02). 본 연구는 회고적 연구이며 분석 전 모든 데이터의 익명화 처리가 완료되었으므로, 윤리위원회는 환자의 고지된 동의 절차를 면제하였습니다.
연구 설계:
연구 유형
본 연구는 단일 기관 후향적 코호트 연구로, 연구 데이터베이스는 병원의 의료영상저장전송시스템(PACS), 방사선 정보 시스템(RIS) 및 전자의무기록 시스템의 데이터를 활용하여 구축되었습니다. 연구 대상은 해당 병원에서 흉요추 측면 디지털 X-선 검사를 받은 연속 환자군으로 구성되었습니다. 대상자 선정 기간은 2018년 1월 1일부터 2023년 12월 31일까지였으며, 추적 관찰 마감일은 2025년 12월 31일이었습니다. 본 연구 보고서는 인공지능을 포함한 예측 모델 연구 및 관찰 연구의 보고 표준화를 보장하기 위해 TRIPOD+AI 및 STROBE 권고안을 준수하였습니다.
연구 환경 및 사례 출처
사례는 병원의 외래 환자, 응급 환자 및 입원 환자의 일상적인 임상 진단 및 치료 과정에서 도출되었습니다. 영상 데이터는 모두 PACS의 원본 DICOM 파일에서 얻었으며, 임상 데이터는 구조화된 전자 의료 기록, 실험실 시스템 및 처방 기록에서 도출되었습니다. 연구 기간 중 선정 기준을 충족하는 첫 번째 흉요추 측면 X-ray 검사 날짜를 기점으로 정의하였습니다. 동일 환자가 기준을 충족하는 여러 번의 검사를 받은 경우, 중복 등록을 방지하기 위해 가장 이른 검사만을 기점 검사로 유지하였습니다. 모든 데이터는 분석 전 비식별 처리되었으며, 영상 및 임상 정보는 고유 연구 식별 번호를 사용하여 매칭되었습니다.
연구 대상:
선정 기준
선정 기준은 다음과 같았다: 연령 50세 이상; 연구 기간 동안 해당 병원에서 표준 기립 흉요추 측면 디지털 X-ray 검사를 완료한 자; 추적 가능한 DICOM 형식의 기저 영상 보유; 기저 영상에서 T10부터 L4 척추까지 전체 시각화가 가능한 자; 기저 영상 검토 결과 T10부터 L4까지 기존의 척추 골절이 없는 자; 전자의무기록에서 사전에 지정된 기저 임상 변수 추출이 가능한 자; 기저 검사 후 24개월 이내에 최소 1회의 흉요추 X-ray, CT 또는 MRI 추적 검사를 받았거나, 24개월 이내에 영상으로 확인된 새로운 척추 골절이 발생한 자.
제외 기준
제외 기준은 다음과 같았습니다: 기저 상태에서 T10에서 L4 사이의 척추 골절; 기저 상태 또는 추적 관찰 기간 중 고에너지 외상의 명확한 병력; 원발성 또는 전이성 척추 종양, 척추 감염 또는 파괴성 골질환; 이전에 시행한 흉요추 내고정술, 척추성형술 또는 풍선 척추성형술; Cobb angle이 30°보다 큰 척추측만증 또는 T10에서 L4까지의 종판을 정확하게 식별할 수 없게 만드는 명백한 후만성 변형(Scheuermann형 후만 변형 포함); 영상 촬영 시 명백한 움직임 아티팩트, 비정상적인 노출, 금속 가림 또는 불충분한 표시 범위; 전자 의무 기록을 통해 주요 기저 변수 또는 결과 정보를 확인할 수 없는 경우.
후향적 코호트 구축 과정
연구 대상자 선별은 사전 정의된 기준에 따라 두 명의 연구자가 독립적으로 수행하였으며, 의견 불일치 사항은 논의를 통해 합의에 도달함으로써 해결하였습니다. 사례 선별이 완료된 후, 기준 날짜에 따라 시계열 그룹화를 수행하였습니다. 2018년 1월 1일부터 2021년 12월 31일까지 등록된 환자들은 특성 선택 및 모델 구축을 위한 유도 코호트를 구성하였으며, 2022년 1월 1일부터 2023년 12월 31일까지 등록된 환자들은 모델 성능 평가를 위한 내부 검증 코호트를 구성하였습니다. 무작위 분할보다 시간적 분할을 사용하는 것이 정보 누출의 위험을 줄일 수 있으며, 이후 환자들에게 모델을 적용하는 실제 응용 시나리오에 더 가깝습니다. 연구 대상자 선별 과정은 흐름도 형태로 제시되었습니다.
1차 결과 및 측정 방법:
일차 결과 지표의 정의
본 연구의 일차 결과 지표는 베이스라인 이후 24개월 이내에 T10에서 L4 사이에 발생한 첫 취약성 척추 골절이었습니다. 연구의 예측 시간 창은 2년으로 사전 설정되었으며, 모델의 출력값은 2년 이내에 척추 골절이 발생할 개별 위험 확률이었습니다.
발생 척추 골절의 판단 기준
발생 척추 골절은 다음과 같이 정의하였다: 기저 영상과 비교하여, 추적 관찰 영상에서 T10부터 L4까지의 모든 척추체 전방, 중앙 또는 후방 높이가 20% 이상 감소하고 절대 높이가 최소 4 mm 이상 감소한 경우, 또는 새로운 종판 함몰이나 피질 중단이 나타난 경우로 정의하였다10. 결과 판정은 추적 관찰 흉요추 X-ray, CT 및 MRI를 기반으로 종합적으로 이루어졌다. 영상 판독은 각각 8년과 12년의 관련 진단 경험이 있는 2명의 근골격계 영상의학 전문의가 독립적으로 수행하였으며, 판독 중 두 전문의 모두 임상 데이터나 모델 출력 결과에 접근하지 않았다. 의견 불일치가 발생한 경우, 18년 경력의 선임 근골격계 영상의학 전문의가 최종 판정을 내렸다. 종양, 감염 또는 고에너지 외상으로 인한 척추 골절은 결과 이벤트로 산입하지 않았다.
추적 관찰 시작점, 종료점 및 관찰 창
추적 관찰 시작점은 기초 흉요추 측면 X-선 검사일로 설정하였다. 추적 관찰 종료점은 첫 번째 척추 골절 발생일, 기초 조사 후 24개월이 되는 시점, 척추 골절이 없음을 확인한 마지막 척추 영상 검사일, 또는 사망일 중 가장 빠른 시점으로 정의하였다. 24개월 이후에 처음 나타난 골절은 일차 결과 분석에서 제외하였다. 결과 이벤트가 발생하지 않은 환자는 중도 절단된 것으로 처리하였다.
임상 데이터 수집 및 후보 임상 변수 정의:
인구통계학적 및 일반 임상 데이터
기초 임상 데이터는 두 명의 연구자가 통합 사례 보고서 양식에 따라 전자 의무 기록 시스템에서 추출하였으며, 추출 과정에서 결과 판정 결과는 검토하지 않았습니다. 수집된 인구통계학적 및 일반 임상 데이터에는 연령, 성별, 신장, 체중 및 체질량 지수가 포함되었습니다. 연령은 기초 조사일 기준의 실제 연령으로 정의하였으며, 체중과 신장은 기초 조사일 전후 30일 이내의 기록 중 기초 조사일에 가장 가까운 값을 사용하였습니다. 체질량 지수는 체중을 신장의 제곱으로 나누어 kg/m² 단위로 계산하였습니다.
병력, 약물 사용 및 골대사 관련 데이터
임상적 가용성과 모델의 일반화 가능성을 바탕으로, 다음과 같은 후보 임상 위험 요인들을 포함하기로 사전 정의하였습니다: 이전의 취약성 골절 이력, 제2형 당뇨병, 류마티스 관절염, 만성 경구 글루코코르티코이드 사용 및 기저 골다공증 치료 여부입니다. 표준화된 기저 골밀도 측정값과 FRAX 점수는 전체 코호트에서 표준화된 기저 변수로 일관되게 가용하지 않았기 때문에 후보 예측 인자로 사전 정의하지 않았으며, 대신 여러 FRAX 관련 임상 요인들을 개별 후보 변수로 별도로 고려하였습니다. 이전의 취약성 골절 이력, 기저 질환 진단 및 약물 정보는 모두 기저 시점 이전의 전자의무기록, 퇴원 기록 및 처방 시스템에서 도출되었으며, 예측 인자가 결과 사건보다 시간적으로 앞서도록 하기 위해 모든 변수는 기저 시점 이전에 존재해야 했습니다.
임상 변수에 대한 정의 기준
이전의 취성 골절력은 40세 이후에 발생하고, 저에너지 손상에 의해 유발되었으며, 의무 기록에 명확히 기재된 골절로 정의하였다. 두개골, 안면골, 손가락뼈 및 발가락뼈 골절은 이 정의에서 제외되었다. 제2형 당뇨병은 베이스라인 이전에 기록된 명확한 진단 또는 혈당 강하제의 장기 사용으로 정의하였다. 류마티스 관절염은 의무 기록상 류마티스 내과 전문의에 의해 내려진 명확한 진단으로 정의하였다. 만성 경구 글루코코르티코이드 사용은 베이스라인 전 1년 이내에 prednisone 당량으로 5 mg/d 이상의 용량을 3개월 이상 사용한 것으로 정의하였다. 베이스라인 골다공증 치료는 베이스라인 전 3개월 이내에 bisphosphonates, denosumab, teriparatide, raloxifene, calcitonin, alfacalcidol 또는 calcitriol 중 어느 하나를 8주 이상 지속적으로 사용한 것으로 정의하였다. 연령과 체질량 지수는 모델링에서 연속 변수로 처리하였으며 인위적으로 범주화하지 않았다.
영상 데이터 획득 및 영상 전처리
흉요추 측면 X선 촬영 프로토콜
모든 기저 영상은 병원의 디지털 방사선 촬영 시스템으로 획득한 표준 기립 흉요추 측면 X-ray 영상이었다. 검사 시 환자는 자연스러운 기립 자세를 취하였으며, 어깨의 중첩을 줄이기 위해 양쪽 상지를 앞으로 굴곡시켰고, 촬영 범위는 T10에서 L4까지 포함하였다. 검사에는 자동 노출 제어(Automatic exposure control)가 사용되었으며, 관전압 범위는 80–95 kV, 초점-영상 간 거리(source-to-image distance)는 110 cm였다. 동일 환자에 대해 기저 날짜에 사용 가능한 측면 방사선 사진이 여러 장 있을 경우, 표시 범위가 완전하고 영상 화질이 가장 좋은 사진을 분석 대상으로 선정하였다.
이미지 포함 기준 및 품질 관리
기초선 영상은 다음과 같은 품질 요건을 충족해야 했습니다: T10에서 L4 척추 및 해당 척추의 상하 말단판의 완전한 시각화, 명확한 척추 전후방 경계, 말단판 및 피질 경계, 뚜렷한 움직임 아티팩트 없음, 심한 과노출 또는 저노출 없음, 넓은 부위의 금속 가려짐 없음, 신체 자세 회전으로 인한 뚜렷한 형태적 왜곡 없음. 척추 경계나 말단판의 신뢰할 수 있는 식별을 방해하는 심한 퇴행성 변화 또는 골극이 있는 영상 또한 제외되었습니다. 두 명의 근골격계 방사선 전문의가 모든 기초선 영상의 품질 검토를 수행했으며, 주요 품질 기준 중 어느 하나라도 충족하지 못한 영상은 모두 제외되었습니다.
이미지 전처리 및 표준화
모든 DICOM 영상은 분석 전 익명화 처리되었습니다. 전처리 단계에는 영상 방향의 통일, 0.30 mm × 0.30 mm의 공간 해상도로의 리샘플링, 0.5th 백분위수와 99.5th 백분위수 사이의 그레이스케일 값 절단, 그리고 min-max 정규화 방법을 이용한 0–1 구간으로의 픽셀 값 표준화가 포함되었습니다. 상기 전처리 워크플로는 도출 코호트와 검증 코호트에서 일관되게 유지되었으며, 수동 작업으로 인한 편향을 줄이기 위해 미리 지정된 스크립트에 의해 모두 자동으로 완료되었습니다.
딥러닝 이미지 특징 추출:
관심 영역 결정
관심 영역(ROI)은 T10의 상단 종판과 L4의 하단 종판 사이의 척추 외측 투영 영역으로 설정하였다. 8년 경력의 근골격계 영상의학 전문의 한 명이 ITK-SNAP 소프트웨어를 사용하여 모든 베이스라인 이미지에 대해 직사각형 박스 어노테이션을 수행하였으며, 전방 경계는 척추 전방 마진에서 전방으로 5 mm, 후방 경계는 척추 후방 마진에서 후방으로 5 mm로 설정하였다11. 이후 12년 경력의 또 다른 근골격계 영상의학 전문의가 사례별로 이미지를 검토하였다. ROI는 엄격한 척추 윤곽 분할이 아닌 영역 수준의 직사각형 박스로 설정되었으므로, 일반적인 주변부 골극은 별도로 제거하지 않았으며 미리 지정된 경계 내에 포함될 경우 일부 포함될 수 있었다. 반면, 척추 마진이나 종판을 가릴 정도로 퇴행성 변화가 심한 사례는 이미지 품질 검토 단계에서 이미 제외되었다. 영역 어노테이션의 재현성을 평가하기 위해, 50장의 이미지를 무작위로 선택하여 4주 후 동일한 전문의가 다시 어노테이션하였고, 두 번째 전문의가 독립적으로 다시 어노테이션하여 이후 특성 안정성 분석에 사용하였다. ROI 크롭 후, 모든 이미지는 224 × 224 픽셀로 동일하게 크기를 조정하였다.
딥러닝 모델 구조 및 특징 추출 과정
본 연구에서는 ResNet50 컨볼루션 신경망을 딥러닝 특징 추출기로 사용하였다. 네트워크 파라미터는 ImageNet으로 사전 학습된 가중치로 초기화되었으며, 적응 과정 중 결과 레이블을 사용하지 않고 유도 코호트의 모든 베이스라인 ROI 이미지에 대해 자기 지도 도메인 적응(self-supervised domain adaptation)을 수행하였다. 구체적으로, 동일한 ROI 이미지에서 생성된 두 개의 독립적인 증강 뷰를 양성 쌍으로 처리하고, 동일한 미니 배치 내의 서로 다른 환자로부터 얻은 뷰를 음성 쌍으로 처리하는 대조적 자기 지도 작업(contrastive self-supervised task)을 사용하여 인코더가 연구 이미지의 분포에 적응하도록 하였다. 모델 학습에는 AdamW 옵티마이저를 사용하였으며, 초기 학습률은 1 × 10^-4, 배치 크기는 64, 학습 에포크는 200회로 설정하였다. 학습 중 데이터 증강은 ±5° 회전, 0.9–1.1배 스케일링, 10픽셀 이하의 이동, ±10%의 대비 섭동을 통해 수행되었다12. 이러한 증강 기법들은 자기 지도 작업을 위한 쌍 뷰를 생성하는 데 사용되었으며, 이 단계에서는 유도 코호트의 레이블이 없는 이미지들만 사용되었다. 도메인 적응 후에는 결과 기반의 지도 미세 조정(outcome-supervised fine-tuning)을 수행하지 않았으며, 적응된 백본 인코더를 특징 추출을 위해 고정하였다. 도메인 적응이 완료된 후, 전역 평균 풀링(global average pooling) 레이어에서 출력된 2,048차원의 벡터를 각 환자의 후보 딥러닝 특징으로 추출하였다.
영상 특징 스크리닝 및 차원 축소
먼저, 반복 주석이 달린 50장의 이미지를 바탕으로 특성의 급내 상관계수(intraclass correlation coefficient)를 계산하였으며, 약간의 ROI 변동에도 특성의 안정성을 보장하기 위해 관찰자 내 및 관찰자 간 ICC가 모두 0.80 이상인 특성만을 유지하였습니다. 이어서, 유지된 특성들을 도출 코호트에서 Z-점수 표준화하였고, 분산이 0인 특성들은 제거하였으며, 절대 쌍 상관계수가 0.90보다 큰 특성들에 대해서는 그중 하나만 유지하였습니다. 마지막으로, 특성 선택을 위해 LASSO-Cox 회귀 분석을 사용하였으며, 페널티 매개변수는 1-SE 기준에 따라 10-겹 교차 검증으로 결정하였습니다. 회귀 계수가 0이 아닌 특성들은 해당 계수에 따라 가중치를 두어 합산함으로써 딥러닝 점수(DL score)13를 구축하였습니다. 도출 코호트에서 이 점수 산출 공식이 결정된 후, 이를 변경 없이 고정하여 내부 검증 코호트에 직접 적용하였습니다.
후보 예측 인자의 전처리 및 통합:
결측 데이터 처리 및 데이터 표준화
모든 후보 임상 변수는 구조화된 의료 기록 필드에서 얻었습니다. 결측률이 20%를 초과하는 변수는 모델링 과정에서 제외되었습니다. 나머지 결측값은 연쇄 방정식에 의한 다중 대체법(multiple imputation by chained equations)을 사용하여 10개의 대체 데이터셋을 생성하여 처리하였습니다. 대체 모델에는 모든 후보 예측 변수, 결과 지표 변수, 그리고 Nelson-Aalen 누적 위험 추정치를 포함하여 사건 발생 시간 결과 정보를 최대한 보존하였습니다. 연속형 임상 변수와 DL 점수는 유도 코호트의 평균과 표준 편차를 사용하여 표준화하였으며, 검증 코호트에도 동일한 변환 파라미터를 적용하였습니다. 이진 변수는 일관되게 0 또는 1로 코딩되었습니다.
임상적 위험 요인 선택
후보 임상 위험 요인의 사전 지정은 임상적 해석 가능성, 이전의 근거 및 데이터 가용성을 기반으로 하였으며, 단변량 P-value 스크리닝은 사용하지 않았다. LASSO-Cox 선택에 포함된 후보 임상 변수는 연령, 성별, 체질량 지수, 이전의 취약성 골절 이력, 제2형 당뇨병, 류마티스 관절염, 만성 경구 글루코코르티코이드 사용 및 기저 항골다공증 치료였다. 신장과 체중은 기술적으로 수집되어 체질량 지수를 도출하는 데 사용되었으나, 모델링에 별도로 입력되지는 않았다. LASSO-Cox 회귀 분석은 도출 코호트의 10개 대체 데이터셋에서 각각 수행되었으며, 벌점 매개변수는 10겹 교차 검증을 사용하여 선택하였다. 최소 7개의 대체 데이터셋에서 0이 아닌 계수를 가진 변수가 최종 임상 모델에 포함되었다. 연령과 체질량 지수는 모두 제한적 삼차 스플라인(restricted cubic splines)을 사용하여 비선형 관계를 테스트하였으며, 비선형 항이 통계적으로 유의하지 않은 경우 선형 형태를 유지하였다. 다중공선성은 분산 팽창 요인(variance inflation factor)으로 평가하였으며, 분산 팽창 요인이 5보다 큰 변수는 동시에 유지하지 않았다.
결합 예측 변수 세트의 구축
고차원 영상 특징을 모델에 직접 입력함으로써 발생하는 과적합을 방지하기 위해, 딥러닝 정보는 먼저 단일 연속 변수인 DL score로 압축되었으며, 이후 선택된 임상 위험 요인들과 함께 결합 모델에 공동으로 입력되었습니다. 모델의 간결성과 해석 가능성을 유지하기 위해 결합 모델에서는 어떠한 상호작용 항도 사전에 지정하지 않았습니다. 최종 결합 예측 세트는 DL score와 유지된 임상 변수들로 구성되었습니다.
위험 예측 모델 구축:
모델링 전략
유도 코호트에서 임상 모델, 딥러닝 모델 및 결합 모델을 각각 수립하였다. 모델에는 Cox 비례 위험 회귀 분석을 사용하였으며, 베이스라인 이후 24개월 이내에 발생한 첫 취약성 척추 골절을 연구 종점으로 설정하고, 중단 규칙은 위의 추적 관찰 정의에 기술된 바와 같다. 과적합을 제어하기 위해 모델링 전 결합 모델의 복잡성을 제한하였으며, 매개변수당 이벤트 비율을 가능한 한 상대적으로 높게 유지하였다. 각 모델의 최종 회귀 계수와 표준 오차는 10개의 대체 데이터 세트에서 각각 추정된 후 Rubin의 규칙을 사용하여 통합되었다. 베이스라인 위험 함수는 Breslow 방법으로 추정하였으며, 개별 2년 위험 확률을 계산하였다.
임상 모델 구축
임상 모델에는 LASSO-Cox 선택 후 유지된 임상적 위험 요인들이 포함되었습니다. 모든 연속형 변수는 이분법적으로 구분하지 않고 연속형 형태 그대로 유지하였습니다. 모델 적합 후, Schoenfeld 잔차를 사용하여 비례 위험 가정을 검정하였으며, 비례 위험 가정을 충족하지 않는 변수의 경우 보정을 위해 ln(time)과의 상호작용 항을 추가하였습니다. 이 임상 모델은 발생한 척추 골절에 대한 전통적인 임상 정보의 예측 능력을 규명하는 데 사용되었습니다.
딥러닝 이미징 모델 구축
기초 흉요추 측면 X-ray의 딥러닝 특징이 2년 내 발생한 척추 골절 위험을 예측하는 능력을 정량화하기 위해, DL score를 유일한 예측 변수로 사용하는 Cox 비례 위험 모델로 딥러닝 모델을 구축하였습니다. 이 모델에는 어떠한 임상 정보도 포함되지 않았으며, 따라서 다른 모델들과의 비교를 위한 영상 단일 모달 모델로 사용되었습니다.
결합 모델 구축
결합 모델은 임상 모델을 기반으로 DL 점수를 추가하여, 흉요추 측면 X-ray의 딥러닝 특징과 임상 위험 요인을 결합한 종합적인 예측 모델을 구축하였습니다. 결합 모델이 수립된 후, 개별적인 위험도 추정과 임상적 적용을 위해 회귀 계수에 따라 2년 위험 노모그램을 작성하였습니다.
모델의 내부 검증 및 성능 평가:
내부 검증 방법
내부 검증은 시간적으로 분리된 단일 센터 내부 검증 전략을 채택하였습니다. 유도 코호트에서 구축된 모든 모델은 매개변수를 고정한 후, 재적합 과정 없이 2022년 1월 1일부터 2023년 12월 31일까지 등록된 검증 코호트에 직접 적용되었습니다. 또한, 모델의 안정성을 평가하기 위해 유도 코호트 내에서 1,000회의 붓스트랩 재표본 추출을 수행하여 낙관주의 보정 성능 추정치를 얻었습니다.
판별력 평가
모델의 판별력은 Harrell 일치 지수와 검열 역확률 가중치법을 기반으로 계산된 2년 시간 의존적 AUC를 통해 평가되었으며, 두 지표 모두 95% 신뢰 구간과 함께 보고되었습니다. 판별력이 높을수록 모델이 향후 척추 골절이 발생할 개인과 발생하지 않을 개인을 더 잘 구분할 수 있음을 나타냅니다. 모델 간 판별력의 차이는 95% 신뢰 구간을 적용한 부트스트랩 방법을 사용하여 계산되었습니다.
교정 평가
모델 보정은 2년 위험 보정 곡선, 보정 절편, 보정 기울기 및 2년 Brier score를 사용하여 평가되었습니다. 보정 곡선은 예측된 위험의 10분위수를 기준으로 작성되었으며 부트스트랩 보정이 이루어졌습니다. 보정 절편이 0에 가깝고, 보정 기울기가 1에 가까우며, Brier score가 낮을수록 예측된 위험과 실제 관찰된 위험 사이의 일치도가 높음을 나타냅니다.
임상 적용 가치 평가
임계 확률의 차이에 따른 순이익(net benefit)을 비교하는 2년 결정 곡선 분석(decision curve analysis)을 통해 모델의 임상 적용 가치를 평가하였습니다. 임계 확률 범위는 집중 추적 관찰, 추가 골 평가 또는 중재 관리 시 임상적으로 사용될 수 있는 위험 구간을 포함하도록 0.05–0.30으로 사전 설정하였습니다14. 순이익이 더 높은 모델일수록 임상적 의사결정 지원 가치가 더 높은 것으로 간주하였습니다.
모델 비교 및 최적 모델의 결정
임상 모델, 딥러닝 모델 및 결합 모델을 판별력, 보정, Brier score 및 결정 곡선을 통해 종합적으로 비교하였습니다. 임상 모델 대비 결합 모델의 이점은 2년 시간 의존적 순 재분류 개선도(net reclassification improvement)와 통합 판별 개선도(integrated discrimination improvement)를 사용하여 추가로 정량화하였습니다. 최적의 모델은 판별력이 더 높고, 보정 능력이 우수하며, 예측 오차가 낮고, 순 이익이 더 큰 모델로 사전 정의하였습니다.
통계 분석:
연속형 변수의 분포 패턴은 먼저 Shapiro-Wilk 검정을 통해 평가하였으며, 정규 분포를 따르는 변수는 평균 ± 표준 편차로, 편향된 분포를 보이는 변수는 중앙값 및 사분위 범위로 나타냈습니다. 범주형 변수는 사례 수와 백분율로 나타냈습니다. 도출 코호트와 검증 코호트 간의 기저 특성 비교는 각각 독립 표본 t-검정, Mann-Whitney U 검정, χ2 검정 또는 Fisher의 정확 검정을 사용하여 수행하였습니다. 기저 비교는 코호트 특성을 기술하는 용도로만 사용되었으며, 변수 선택의 근거로 사용되지 않았습니다. 모든 통계 검정은 양측 검정으로 수행되었으며, P < 0.05를 통계적으로 유의한 것으로 간주하였습니다. 통계 분석은 R 소프트웨어에서 주로 survival, glmnet, mice, rms, timeROC 및 rmda 패키지를 사용하여 완료하였으며, 이미지 전처리 및 딥러닝 분석은 Python 및 PyTorch 환경에서 수행하였습니다. 결과의 견고성을 평가하기 위해 민감도 분석으로서 완전 사례 분석(complete-case analysis)을 추가로 수행하였습니다.
회고적 코호트 구축 과정 및 코호트의 기선 특성
연구 기간 동안 흉요추 측면 X선 기록을 수집하였으며, 중복 제거 후 6,14명의 환자를 스크리닝 대상으로 포함하였다. 다음의 연령 기준에 따라 환자들을 단계적으로 제외한 후... < 50세 미만, 기저 시점에 골절이 있었던 환자, 추적 관찰이 불충분한 환자를 제외하여 최종적으로 총 2,173명의 환자가 포함되었으며, 이 중 1,449명은 도출 코호트에, 724명은 내부 검증 코호트에 배정되었다(그림 1). 유도 코호트와 내부 검증 코호트의 기선 특성 분포는 전반적으로 균형을 이루었으며, 연령, 성별, 체질량 지수 또는 주요 임상 위험 요인에서 통계적으로 유의미한 차이는 없었습니다 (모두 P > 0.05). 두 코호트의 중앙 추적 관찰 기간은 각각 23.4개월과 23.1개월이었으며, 발생한 척추 골절 사건은 각각 131건과 63건이었다. 2년 누적 발생률은 각각 9.21%와 8.91%로, 통계적으로 유의미한 차이는 없었다 (P = 0.812) (표 1).
임상 위험 요인 선택, 영상 특징 스크리닝 및 위험 예측 모델 구축
LASSO-Cox 선택 결과, 연령, 여성, 체질량 지수, 과거 취약성 골절 이력, 제2형 당뇨병, 만성 경구 글루코코르티코이드 사용이 사전 지정된 포함 빈도 임계값에 도달하였으며; 2,048개의 딥러닝 특성을 단계별로 스크리닝한 후, DL 점수를 구축하기 위해 λ1se에서 계수가 0이 아닌 5개 특성이 유지되었습니다 (그림 2A–C). 선택된 임상 변수와 DL 점수를 기반으로 임상 모델, 딥러닝 모델 및 통합 모델을 추가로 수립하였습니다. 다변량 Cox 회귀 분석 결과, 위의 임상 변수들은 모두 2년 이내의 척추 골절 발생 위험과 연관이 있었으며(모두 P < 0.05), 임상 모델에 DL 점수를 추가한 후에도 통합 모델에서 독립적인 예측 인자로 유지되었습니다 (HR = 1.64, 95% CI 1.34–2.01, P < 0.01) (표 2). 이에 따라 개별적인 2년 척추 골절 발생 위험 추정을 위해 통합 모델의 노모그램을 작성하였으며, 총점이 높을수록 예측된 위험도가 높게 나타났습니다 (그림 2D).
모델의 내부 검증 및 성능 평가
유도 코호트(derivation cohort)에서 부트스트랩 낙관론 교정(bootstrap optimism correction) 후에도 결합 모델은 여전히 최상의 예측 성능을 유지했습니다. 내부 검증 결과, 결합 모델의 C-index와 AUC₂y는 각각 0.759와 0.74로 나타나 임상 모델보다 모두 높았습니다. 또한 Brier₂y는 가장 낮았고(0.07), 교정 절편(calibration intercept)은 0에 가깝고 교정 기울기(calibration slope)는 1에 가까워, 이 모델이 우수한 판별력과 교정 성능을 가졌음을 보여주었습니다(표 3). 유도 코호트에서는 겉보기 교정 곡선(apparent calibration curve)과 부트스트랩 편향 교정 곡선(bootstrap bias-corrected curve) 모두 이상적인 선에 근접했습니다. 내부 검증 코호트에서는 예측된 2년 위험도가 일반적으로 Kaplan-Meier 관찰 위험도와 일치했으며, 십분위수 교정 지점(decile calibration points)이 이상적인 선 근처에 분포하여 결합 모델의 2년 위험도 교정 성능이 우수함을 나타냈습니다(그림 3A, B).
모델 비교 및 임상 적용 가치 평가
임상 모델과 비교하여, 결합 모델은 도출 코호트와 내부 검증 코호트 모두에서 유의미한 순 재분류 개선 및 판별력 개선을 달성하였으며, NRI₂y 값은 각각 0.316 및 0.241, IDI₂y 값은 각각 0.047 및 0.033이었다 (모두 P < 0.01) (표 4). 도출 코호트와 내부 검증 코호트에서 결합 모델은 일반적으로 0.05 – 0.30의 사전 설정된 임계 확률 범위 내에서 가장 높은 순 이익을 달성하였으며, 결정 곡선이 대부분 Treat-all 및 Treat-none보다 위에 위치하여 임상적 적용 가치가 더 높음을 나타냈다 (그림 4A, B).
민감도 분석 결과
완전 사례 민감도 분석 결과, 일차 분석의 결론은 기본적으로 안정적으로 유지되는 것으로 나타났다. 유도 코호트와 내부 검증 코호트 모두에서 결합 모델의 C-index와 AUC₂y는 임상 모델보다 높았으며, Brier₂y는 더 낮았다. 내부 검증 코호트에서 결합 모델의 보정 절편(calibration intercept)과 보정 기울기(calibration slope)는 각각 0.019와 0.964로 나타나, 모델의 강건성이 우수함을 시사했다(표 5). 추적 관찰 기간 동안 유도 코호트에서 27명, 내부 검증 코호트에서 13명의 사망이 기록되었다. 사망을 경쟁 사건으로 처리한 Fine–Gray 경쟁 위험 민감도 분석에서도 DL 점수는 결합 모델에서 발생 척추 골절과 독립적인 연관성을 유지했으며(subdistribution HR = 1.58, 95% CI 1.28–1.95, P < 0.01), 전체적인 결론은 변함이 없었다.
요약하자면, 기저선 흉요추 측면 방사선 사진의 딥러닝 점수와 선택된 임상적 위험 요인을 통합한 결합 모델이 2년 이내의 신규 척추 골절 예측에서 가장 우수한 전반적 성능을 보였습니다. 임상 모델과 비교했을 때, 이 모델은 도출 코호트와 내부 검증 코호트 모두에서 더 높은 판별력, 더 나은 보정, 더 낮은 예측 오차, 개선된 재분류 및 더 큰 순 이익을 나타냈습니다. 딥러닝 점수의 독립적인 예측 가치와 완전 사례 및 경쟁 위험 민감도 분석에서의 일관된 결과는 주요 결과의 강건함을 더욱 뒷받침하였습니다.
데이터 가용성:
원시 데이터는 보충 파일 1로 업로드되었습니다.

그림 1. 연구 대상자 스크리닝 흐름도. 동일 환자에게서 여러 건의 검사가 선정 기준을 충족한 경우, 가장 이른 시점의 검사만을 기선 검사로 유지하였습니다. 각 제외 사유는 미리 지정된 순서에 따라 순차적으로 적용되었으며, 각 환자는 제외 대상으로 단 한 번만 집계되었습니다. 이 그림의 확대 버전을 보시려면 여기를 클릭하십시오.

그림 2임상 위험 요인과 딥러닝 특성에 대한 LASSO-Cox 선택 및 결합 모델의 노모그램. (A10개의 대체 데이터 세트에서 후보 임상 변수의 포함 빈도이며, 점선은 70% 임계값을 나타냅니다.B) 딥러닝 특징들의 LASSO-Cox 계수 경로. (C) 10-겹 교차 검증을 통한 부분 우도 편차 곡선이며, 수직 점선은 각각 $\lambda_{min}$과 $\lambda_{1se}$를 나타냅니다. (D결합 모델의 2년 위험도 노모그램으로, 각 예측 변수는 특정 점수에 해당하며, 이 점수들을 합산하여 총점을 구하고, 이를 다시 개별적인 2년 내 척추 골절 발생 위험도로 변환합니다. DL score: 딥러닝 점수. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 3유도 코호트와 내부 검증 코호트에서 결합 모델의 2년 위험 교정 곡선. (A) 도출 코호트. (B) 내부 검증 코호트. 보정점은 예측 위험도의 십분위수에 따라 생성되었으며, 관찰된 위험도는 Kaplan-Meier법을 사용하여 추정되었다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

그림 4유도 코호트와 내부 검증 코호트에서 세 가지 모델의 결정 곡선 분석. (A) 유도 코호트. (B) 내부 검증 코호트. 가로축은 임계 확률을 나타내며, 세로축은 순 이익(net benefit)을 나타냅니다. Treat-all은 모든 대상에게 중재를 시행하는 것을 의미하며, Treat-none은 아무에게도 중재를 시행하지 않는 것을 의미합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.
| 변수명 | 결측값, n (%) | 유도 코호트 (n=149) | 내부 검증 코호트 (n=724) | P |
| 기초 특성 | ||||
| 표본 크기, n | — | 1449 | 724 | — |
| 연령, 세 | 0 (0.00) | 68.41 ± 8.37 | 68.96 ± 8.56 | 0.155 |
| 여성, n (%) | 0 (0.00) | 962 (66.39%) | 463 (63.95%) | 0.259 |
| 신장, cm | 16 (0.74) | 158.42 ± 7.91 | 157.98 ± 8.16 | 0.232 |
| 체중, kg | 21 (0.97) | 59.76 ± 9.88 | 59.21 ± 10.14 | 0.23 |
| 체질량 지수, kg/m² | 28 (1.29) | 23.77 ± 3.28 | 23.69 ± 3.34 | 0.597 |
| 이전 취약성 골절 병력, n (%) | 0 (0.00) | 171 (11.80%) | 96 (13.26%) | 0.329 |
| 제2형 당뇨병, n (%) | 0 (0.00) | 303 (20.91%) | 158 (21.82%) | 0.624 |
| 류마티스 관절염, n (%) | 0 (0.00) | 49 (3.38%) | 29 (4.01%) | 0.461 |
| 만성 경구 글루코르티코이드 사용, n (%) | 0 (0.00) | 65 (4.49%) | 38 (5.25%) | 0.43 |
| 기초 골다공증 치료제, n (%) | 0 (0.00) | 131 (9.04%) | 75 (10.36%) | 0.323 |
| 추적 관찰 및 결과 설명 | ||||
| 추적 관찰 기간, 개월 | 0 (0.00) | 23.4 [18.7, 24.0] | 23.1 [18.4, 24.0] | 0.341 |
| 발생한 척추 골절 사건 수, n | 0 (0.00) | 131 | 63 | — |
| 척추 골절 발생의 2년 누적 발생률, % (95% CI) | — | 9.21 (7.82, 10.60) | 8.91 (6.79, 11.03) | 0.812 |
표 1: 두 코호트의 기저 특성 및 결과. 결측치 열은 원래 관찰된 데이터를 기반으로 했으며, 다중 대체법은 모델링에만 사용되었습니다. 연속 변수는 분포에 따라 x̄ ± s 또는 M[IQR]로 표시하였으며, 그룹 간 비교는 독립 표본 t-검정 또는 Mann-Whitney U 검정을 사용하여 수행하였습니다. 범주형 변수는 n (%)로 표시하였으며, 그룹 간 비교는 χ2 검정을 사용하여 수행하였습니다. 척추 골절의 2년 누적 발생률은 Kaplan-Meier 방법으로 추정하여 95% CI와 함께 보고하였으며, 그룹 간 비교는 log-rank 검정을 사용하여 수행하였습니다. P 값은 두 코호트 간의 구성 차이를 설명하는 데에만 사용되었으며, 예측 변수 선택에는 사용되지 않았습니다.
| 예측 인자 | β | 심박수 | 95% 신뢰구간 | P |
| 임상 모델 | ||||
| 연령 (1 표준편차 증가당) | 0.28 | 1.33 | 1.10–1.60 | 0.003 |
| 여성 (예 vs 아니오) | 0.26 | 1.29 | 1.02–1.63 | 0.031 |
| 체질량 지수 (1 SD 증가당) | −0.19 | 0.83 | 0.70–0.98 | 0.03 |
| 이전 취약성 골절 병력 (있음 vs 없음) | 0.66 | 1.93 | 1.38–2.71 | <0.001 |
| 제2형 당뇨병 (유 vs 무) | 0.31 | 1.36 | 1.06–1.75 | 0.016 |
| 만성 경구 글루코르티코이드 사용 여부 (예 vs 아니오) | 0.49 | 1.63 | 1.14–2.33 | 0.008 |
| 딥러닝 모델 | ||||
| DL 점수 (1 SD 증가당) | 0.58 | 1.78 | 1.46–2.17 | <0.001 |
| 결합 모델 | ||||
| 연령 (1 SD 증가당) | 0.22 | 1.25 | 1.07–1.46 | 0.004 |
| 여성 (예 vs 아니오) | 0.23 | 1.26 | 1.01–1.56 | 0.04 |
| 체질량 지수 (1 표준편차 증가당) | −0.18 | 0.84 | 0.72–0.98 | 0.031 |
| 이전의 취약성 골절 병력 (예 vs 아니오) | 0.59 | 1.8 | 1.27–2.56 | 0.001 |
| 제2형 당뇨병 (예 vs 아니오) | 0.27 | 1.31 | 1.01–1.70 | 0.044 |
| 만성 경구 글루코코르티코이드 사용 여부 (예 vs 아니요) | 0.42 | 1.53 | 1.05–2.21 | 0.026 |
| DL 점수 (1 SD 증가당) | 0.5 | 1.64 | 1.34–2.01 | <0.001 |
표 2: 세 가지 모델의 예측 변수 및 Cox 회귀 분석 결과. 임상 모델과 통합 모델의 파라미터 추정치는 Rubin의 규칙에 따라 10개의 대체 데이터 세트에서 통합되었으며, P 값은 Wald 검정을 통해 산출되었다. 연속 변수와 DL 점수는 표준화된 값으로 모델에 입력되었으며, HR은 1 SD 증가당 수치에 해당한다. 이분형 변수의 참조 범주는 일관되게 "no" 또는 "none"으로 정의되었다. DL 점수는 딥러닝 특징에 가중치를 두어 얻은 복합 점수이다. 세 가지 모델의 2년 기준 생존율 S₀ (2 years)은 각각 0.9387, 0.9194, 0.9413이었다. 통합 모델의 2년 위험도는 다음과 같이 계산되었다: 2 - yearrisk = 1 - [S0(2 years)]exp(LP).
| 모델 | 겉보기 C (95% CI) | 교정된 C | 검증 C (95% 신뢰구간) | ΔC (95% CI) | 겉보기 AUC₂y (95% CI) | 보정된 AUC₂y | 검증 AUC₂y (95% CI) | ΔAUC₂y (95% CI) | 겉보기 Brier₂y | 보정된 Brier₂y | 검증 Brier₂y | 검정 절편 | 검증 기울기 |
| 임상 모델 | 0.702 (0.657–0.747) | 0.691 | 0.687 (0.619–0.754) | 참고문헌 | 0.711 (0.665–0.757) | 0.7 | 0.694 (0.626–0.762) | 참고문헌 | 0.081 | 0.082 | 0.082 | 0.073 | 0.901 |
| 딥러닝 모델 | 0.734 (0.691–0.777) | 0.722 | 0.713 (0.648–0.778) | 0.026 (−0.018–0.070) | 0.743 (0.698–0.789) | 0.731 | 0.722 (0.658–0.786) | 0.028 (−0.016–0.072) | 0.079 | 0.08 | 0.08 | 0.058 | 0.843 |
| 결합 모델 | 0.787 (0.748–0.826) | 0.773 | 0.759 (0.699–0.819) | 0.072 (0.030–0.114) | 0.799 (0.758–0.841) | 0.785 | 0.774 (0.715–0.833) | 0.080 (0.038–0.122) | 0.075 | 0.076 | 0.077 | 0.012 | 0.972 |
표 3: 세 가지 모델의 예측 성능, 낙관주의 교정 성능 및 내부 검증 결과. 교정된 결과는 1,0회의 부트스트랩 낙관주의 교정을 거친 점 추정치입니다. ΔC 및 ΔAUC₂y는 임상 모델 대비 차이를 나타냅니다. C 및 AUC₂y 값이 더 크고 Brier₂y 값이 더 작을수록 모델 성능이 우수함을 나타내며, 보정 절편(calibration intercept)이 0에 가깝고 보정 기울기(calibration slope)가 1에 가까울수록 보정 상태가 더 양호함을 나타냅니다. C, Harrell의 일치 지수; AUC₂y, 2년 시점의 시간 의존적 ROC 곡선 하 면적; Brier₂y, 2년 Brier 점수.
| 코호트 | NRI₂y | 95% CI | P | IDI₂y | 95% CI | P |
| 유도 코호트 | 0.316 | 0.174–0.463 | <0.01 | 0.047 | 0.024–0.073 | <0.01 |
| 내부 검증 코호트 | 0.241 | 0.058–0.389 | 0.09 | 0.033 | 0.09–0.058 | 0.07 |
표 4: 임상 모델 대비 결합 모델의 2년 NRI 및 IDI. NRI₂y 및 IDI₂y의 양수 값은 결합 모델이 임상 모델보다 더 나은 증분 예측 가치를 가짐을 나타냅니다. NRI₂y와 IDI₂y는 모두 2년 시간 의존적 방법으로 계산되었으며, 절단 데이터는 절단 역확률 가중치법을 사용하여 처리되었습니다. 95% CI는 1,00회의 부트스트랩 재표집을 통해 얻었으며, P 값은 양측 검정으로 산출되었습니다. NRI₂y, 2년 순 재분류 개선도; IDI₂y, 2년 통합 판별 개선도.
| 모델 | 유도군 n | 유도군 이벤트 수 | 유도군 C (95% CI) | 유도군 AUC₂y (95% CI) | 유도군 Brier₂y | 검증군 n | 검증군 이벤트 수 | 검증군 C (95% CI) | 검증군 AUC₂y (95% CI) | 검증군 Brier₂y | 검증군 절편 | 검증군 기울기 |
| 임상 모델 | 1431 | 129 | 0.69 (0.654–0.74) | 0.707 (0.61–0.752) | 0.082 | 714 | 62 | 0.681 (0.613–0.749) | 0.690 (0.62–0.759) | 0.083 | 0.084 | 0.892 |
| 복합 모델 | 1431 | 129 | 0.783 (0.74–0.82) | 0.795 (0.753–0.837) | 0.076 | 714 | 62 | 0.753 (0.692–0.814) | 0.769 (0.709–0.829) | 0.078 | 0.019 | 0.964 |
표 5: 완전 사례 민감도 분석. 완전 사례는 해당 모델에 필요한 모든 변수에 대해 원래 관찰된 값을 가진 환자로 정의되었습니다. 민감도 분석은 다중 대체법을 사용하지 않은 완전 사례 분석을 통해 수행되었습니다. 95% CI는 1,0회의 부트스트랩 재표집을 통해 얻었습니다. C, Harrell의 일치 지수; AUC₂y, 2년 시간 의존적 ROC 곡선 아래 면적; Brier₂y, 2년 Brier 점수.
보충 파일 1: 원시 데이터 이 파일을 다운로드하려면 여기를 클릭하십시오.
결합 모델은 낙관적 보정 및 시간적 내부 검증 후에도 최적의 성능을 유지했으며, 이는 흉요추 측면 X-ray의 딥러닝 특성이 단순히 임상 정보의 반복이 아니라, 2년 내 척추 골절 발생 위험 평가에 있어 독립적이고 검증 가능한 증분 정보를 제공할 수 있음을 시사합니다. 이 모델의 의의는 전신적 취약성과 국소적 척추 구조적 취약성의 배경을 동일한 예측 프레임워크에 통합했다는 점에 있습니다. 연령, 여성, 낮은 체질량 지수, 이전의 취약성 골절, 당뇨병 및 글루코코르티코이드 노출은 골량 감소, 골질 저하, 근육 지지 부족 및 재골절 취약성을 반영하며 환자의 전반적인 기저 골절 위험을 결정합니다15. 반면 딥러닝 특성은 일상적인 영상 판독으로는 안정적으로 정량화하기 어려운 흉요추 부위의 척추 종판 형태, 경미한 쐐기 모양 변형, 성긴 골 조직, 피질 경계 변화 및 비정상적인 기계적 분포를 포착할 가능성이 더 높으며, 이를 통해 국소 영상 수준에서의 취약성 정보를 보완합니다16. 이 두 가지 유형의 정보는 서로 다른 병리학적 수준에 대응하며, 결합 후 변별력, 보정, 예측 오차, 재분류 능력 및 임상적 순이익이 모두 향상되었으며, 이러한 일관성은 모델의 개선이 우연이 아니었음을 뒷받침합니다. 임상 변수에만 의존하는 전통적인 위험 모델은 적용이 편리하지만, 척추의 국소적 이질성을 식별하기 어렵습니다17. 골밀도 또는 FRAX로 대표되는 평가 전략은 전신적 골절 경향에 더 치중되어 있어, 흉요추 부위의 즉각적인 구조적 취약성을 충분히 반영하지 못할 수 있습니다18. 기존의 인공지능 연구들은 대부분 기존 척추 골절의 검출이나 골다공증 분류에 집중해 왔으며, 임상적 조기 경고 단계까지는 여전히 한 단계가 남아 있었습니다19. 현재의 결과는 실제 의사 결정 시나리오에 더 가까우며, 일반적인 X-ray에 포함된 잠재적 표현형이 딥러닝을 통해 추출되었을 때 임상적 위험 층화를 실질적으로 강화할 수 있음을 나타냅니다.
척추 골절 위험 평가에서 CT, MRI, 골밀도 기반 평가 및 기타 영상 분석 방법은 각각 적용 가능한 시나리오가 다릅니다. CT는 척추의 형태, 종판 변화 및 피질골 파괴를 더 직접적으로 묘사하고, MRI는 골수 부종, 연조직 침범 및 급성 골절 평가에 더 큰 장점이 있지만, 두 방법 모두 검사 비용, 접근성 및 정기적인 추적 관찰 가능성 측면에서 흉요추 측면 방사선 사진보다 열세하여, 낮은 문턱값으로 대규모 조기 위험 층화 도구로 사용하기 어렵습니다. 골밀도 측정과 FRAX는 전신적 골 취약성의 배경을 반영하는 데 더 적합하며 전반적인 골절 경향에 중요한 참고 가치가 있지만, 흉요추 부위의 국소적 구조 취약성, 경미한 쐐기형 변형, 미세한 종판 이상 및 국소적 기계적 불균형을 반영하는 데는 상대적으로 제한적입니다. 기존의 라디오믹스 방법은 방사선 사진, CT 또는 MRI에서 사전 정의된 정량적 특징을 추출할 수 있어 위험 평가 가능성이 있지만, 대개 수동으로 정의된 특징 공간과 상대적으로 엄격한 분할 절차에 의존합니다. 이러한 방법들과 비교하여, 본 연구는 일상적인 흉요추 측면 방사선 사진을 기반으로 모델을 구축하는 방법을 선택하였습니다. 이는 CT, MRI 또는 골밀도 평가를 대체하는 것이 아니라, 임상 현장에서 가장 쉽게 이용 가능한 영상 양식을 바탕으로 기존의 임상 평가로는 포착하기 어려운 잠재적인 국소 취약성 정보를 보완함으로써, 발생 가능한 척추 골절의 조기 식별을 위해 더 일반화 가능한 위험 층화 경로를 제공하는 데 중점을 두었습니다.
최종 모델에 포함된 임상 변수들은 명확한 병태생리학적 의미를 가지고 있으며, 이는 본 예측 프레임워크가 우연한 선택의 결과가 아님을 시사합니다. 연령 증가, 여성, 낮은 체질량 지수는 골량 감소, 근육 지지력 약화 및 낙상 취약성 증가와 상응하며, 이는 척추 취약성의 기본적인 배경을 구성합니다. 과거의 취약성 골절 병력은 개인의 지속적인 전신 골 취약성을 나타내며 재골절의 중요한 표지자가 됩니다. 제2형 당뇨병 환자의 경우 골밀도가 유의하게 감소하지 않았더라도, 최종당화산물의 침착, 비정상적인 골 교체 및 미세구조적 손상으로 인해 척추의 기계적 강도가 약해질 수 있습니다20. 장기간의 경구 글루코코르티코이드 사용은 골 형성을 억제하고 골 흡수를 촉진하며, 소주골의 무결성을 손상시켜 골절 위험을 증가시킵니다21. 안정성, 상관관계 및 페널티 회귀 분석을 통한 스크리닝 후, DL 점수를 구축하기 위해 딥러닝 특징 중 극소수만이 유지되었는데, 이는 모델이 안정적이며 결과와 연관된 영상 정보를 포착했음을 나타냅니다. 이러한 특징들은 단일 수동 지표와 일대일로 대응시키기는 어려우나, 종판의 미세한 붕괴 전 변화, 척추 형태의 가벼운 불균형, 희소한 골 질감, 피질 윤곽의 변화, 그리고 흉요추 부위의 비정상적인 국소 응력 분포를 종합적으로 반영할 가능성이 더 높습니다. 따라서 임상 변수를 보정한 후에도 독립적인 예측 가치를 유지했습니다22. 기존의 역학적 근거를 통해 위의 임상 요인들이 취약성 골절과 밀접하게 관련되어 있음이 확인되었으며, 본 연구의 결과 또한 이와 기본적으로 일치합니다. 기존의 수동 측정이나 사전 정의된 라디오믹스 특징과 비교하여, 딥러닝은 특징을 미리 지정할 필요가 없으므로 X-ray 상의 잠재적이고 복잡한 취약성 표현형을 식별하는 데 더 적합합니다23. 류마티스 관절염과 기저 항골다공증 치료는 최종 모델에 포함되지 않았는데, 이는 전자의 낮은 유병률과 후자의 치료 적응증 편향과 관련이 있을 수 있습니다24. 따라서 본 모델은 단순한 변수의 누적이 아니라, 임상적 위험 스펙트럼과 X-ray 상의 잠재적 취약성 표현형의 상호 보완적 통합을 바탕으로 구축되었음을 알 수 있습니다.
부트스트랩 낙관도 교정(bootstrap optimism correction), 시계열 내부 검증 및 완전 사례 민감도 분석 후에도 결합 모델의 이점이 안정적으로 유지되었으며, 이는 모델의 예측 능력이 표본 내 적합(within-sample fitting)으로 인한 것이 아니라 우수한 내부 타당성을 가지고 있음을 나타냅니다. 시계열 분할 검증은 무작위 분할보다 실제 적용 시나리오에 더 가까우며, 이후 환자군에 대한 모델의 성능을 더 엄격하게 테스트할 수 있습니다. 낙관도 교정은 과적합 위험을 식별하는 데 도움이 되므로, 교정 후에도 우위가 지속된다는 점은 결과의 강건성을 더욱 강력하게 뒷받침합니다. 보정 곡선(calibration curve)은 이상적인 직선에 가까웠고, 검증 절편은 0에, 기울기는 1에 가까워 모델 출력값이 단순한 순위 점수가 아니라 실제 사건 발생 수준과 비교적 일치하는 절대적 위험 확률임을 보여주었습니다. 이는 추적 관찰 강도, 추가 골 평가 및 예방적 개입 시점을 결정하는 데 있어 더 큰 임상적 의미를 가집니다. 미리 지정된 임계값 범위 내에서 더 높은 순 이익(net benefit)이 나타난 것은 X-ray의 딥러닝 특징을 추가한 후 모델의 개선이 통계적 지표뿐만 아니라 의사 결정 단계의 잠재적 이익으로도 반영되었음을 의미합니다25. 노모그램(nomogram)은 결합 모델을 해석 가능한 개별화된 도구로 변환하여, 일상적인 흉요추 측면 X-ray 검사를 기반으로 위험 층화를 완료하는 데 유용합니다26. 이전의 많은 인공지능 예측 연구들은 주로 판별력(discrimination)만을 보고하고 보정, 과적합 제어 및 임상적 순 이익에는 충분한 주의를 기울이지 않았으며, 시계열 검증이나 민감도 분석이 부족하여 실제 환경에서의 전이 가능성이 제한적이었습니다27,28. 판별력, 보정, 예측 오차, 결정 곡선 및 민감도 분석을 중심으로 형성된 완전한 근거 체계는 이 결합 모델이 발생 척추 골절의 위험 층화 도구로서 임상에 적용되는 것을 더 잘 뒷받침할 수 있습니다.
본 연구는 단일 센터 회고적 코호트 연구였으며, 모든 사례는 흉요추 측면 X선 검사를 받고 영상 추적 관찰을 완료한 병원 환자들로부터 도출되었습니다. 표본 구성은 의뢰 패턴, 검사 적응증 및 추적 관찰 준수 여부의 영향을 받았으며 선택 편향이 존재했습니다. 따라서 결과를 다른 센터, 지역 사회 선별 검사 대상자 또는 다른 장비 조건으로 일반화할 때는 주의가 필요합니다. 연구 기간 동안 기초 방사선 사진은 여러 방사선 시스템/제조사가 아닌 단일 제조사의 병원 디지털 방사선 촬영 시스템을 사용하여 획득되었으며, 이는 제조사 간의 기술적 이질성을 줄였으나 다른 영상 플랫폼으로의 일반화 가능성을 제한할 수 있습니다. 특히 결과 확인을 위해 추적 영상이 필요했으므로, 24개월 이내에 영상 추적 관찰이 이루어지지 않은 환자들은 제외되었으며, 이로 인해 증상이 더 많거나 의료 서비스 이용률이 높거나 기초 위험도가 높은 환자들이 우선적으로 포함되어 관찰된 사건 발생률이 증가했을 수 있습니다. 또한 추적 영상이 고정된 프로토콜이 아닌 일상적인 임상 진료 과정에서 획득되었기 때문에, 중단 데이터(censoring)가 완전히 비정보적이지 않았을 수 있으며, Cox 기반 위험 추정치가 추적 영상 과정의 영향을 받았을 가능성이 있습니다. 시간적 내부 검증, 부트스트랩 낙관성 교정 및 완전 사례 민감도 분석을 수행하였으나, 독립적인 외부 검증은 아직 실시되지 않았으며, 모델의 센터 간 안정성과 일반화 가능성은 여전히 확인이 필요합니다. 본 연구는 획득과 보급이 쉽다는 장점이 있는 일상적인 측면 X선에 의존하였으나, CT, MRI 또는 골밀도 검사와 비교했을 때 골 미세구조, 골량 상태 및 인접 조직 정보의 표현은 제한적입니다. 딥러닝 특징이 예측 성능을 향상시킬 수 있지만, 그 구체적인 영상 및 생물학적 의미는 여전히 충분히 직관적이지 않습니다. 또한 전용 특징 기여도 또는 돌출 맵(saliency) 분석이 수행되지 않았으므로, 관련 생물학적 해석은 직접적으로 검증된 것이 아니라 가설 생성 단계로 간주되어야 합니다. 후보 변수들은 주로 구조화된 의료 기록과 일상적인 임상 데이터에서 도출되었으며, 낙상 이력, 신체 기능, 영양 상태, 골 대사 실험실 지표 또는 표준화된 골밀도 측정값은 포함되지 않았습니다. 따라서 잔여 교란 요인이 여전히 존재할 수 있습니다. 아울러 본 연구에서는 BMD 또는 FRAX 기반 모델을 평가하지 않았으므로, DL 점수의 증분 가치는 미리 지정된 임상 모델에 대해서만 설정되었습니다. 향후 연구에서는 일반화 가능성, 해석 가능성 및 모델의 실질적인 적용 가치를 높이기 위해 서로 다른 장비와 임상 환경을 갖춘 여러 센터에서 외부 검증을 수행하고, 골밀도, 실험실 지표 및 다른 영상 양식과의 통합 방안을 탐색해야 합니다.
저자들은 이해 상충 관계가 없음을 선언합니다.
저자들은 이미지 검색, 데이터 추출 및 데이터 관리에 도움을 준 연구 병원 직원들에게 감사드립니다. 또한 환자 진료 및 영상 획득에 참여한 모든 임상의와 방사선사들에게 감사드립니다. 본 연구는 2024년 서후이 구 의료 연구 프로젝트(SHXH202405)의 재정적 지원을 받았습니다.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| glmnet 패키지 | CRAN | N/A | LASSO-Cox 회귀 분석에 사용됨. |
| ITK-SNAP | 펜실베이니아 대학교 / ITK-SNAP 프로젝트 | N/A | 기초 영상의 ROI 주석 달기에 사용됨. |
| mice 패키지 | CRAN | N/A | 다중 대치법에 사용됨. |
| Python | Python Software Foundation | version 3.10 | 영상 전처리 및 딥러닝 분석에 사용됨. |
| PyTorch | PyTorch Foundation / Linux Foundation | version 2.1 | 딥러닝 모델 개발 및 특징 추출에 사용됨. |
| R 버전 | R Foundation for Statistical Computing | version 4.3.2 | 통계 분석에 사용됨. |
| rmda 패키지 | CRAN | N/A | 결정 곡선 분석에 사용됨. |
| rms 패키지 | CRAN | N/A | 모델 개발 및 보정 분석에 사용됨. |
| survival 패키지 | CRAN | N/A | Cox 비례 위험 회귀 분석에 사용됨. |
| timeROC 패키지 | CRAN | N/A | 시간 의존적 AUC 분석에 사용됨. |