Conception de l'étude et population de patients
Cette étude rétrospective a analysée des examens échographiques thyroïdiens réalisés entre le 13 juin 2024 et le 13 janvier 2025. Le protocole de l'étude a été approuvé par le Comité d'éthique de l'Hôpital d'amitié de Pékin, Université médicale de la Capitale (n° d'approbation BFHHZS20240300) et a été mené conformément aux principes éthiques énoncés dans la Déclaration d'Helsinki, et le consentement éclairé a été dispensé en raison de la conception rétrospective. Le jeu de données comprenait 68 nodules thyroïdiens provenant de 63 patients (30 bénins et 38 malins), le nodule constituant l'unité d'analyse. Les diagnostics de référence étaient basés sur la cytologie par aspiration à l'aiguille fine (AAF) guidée par échographie. Le groupe malin comprenait 38 nodules rapportés comme carcinome thyroïdien papillaire à l'AAF.
Critères d'inclusion
Les patients éligibles devaient remplir tous les critères suivants : (1) avoir subi une échographie en niveaux de gris conventionnelle et une échographie Doppler, suivies d'une échographie avec contraste (CEUS) offrant une qualité d'image satisfaisante permettant une analyse ultérieure du flux microvasculaire ; (2) avoir un diagnostic cytopathologique de carcinome papillaire de la thyroïde (PTC) confirmé par biopsie à l’aiguille fine, avec ou sans test concomitant positif pour la mutation BRAFV600E ; ou présenter un résultat cytologique de catégorie III de Bethesda (atypie d’incertitude), mais avec test concomitant positif pour la mutation BRAFV600E ; (3) avoir un diagnostic cytopathologique de nodules bénins prolifératifs, de nodules adénomateux ou de nodules folliculaires bénins relevant de la catégorie II de Bethesda, sans test concomitant positif pour la mutation BRAFV600E.
Critères d'exclusion
Les patients ont été exclus de l'étude si l'une des conditions suivantes était présente : (1) des images EBUS de mauvaise qualité ou un signal insuffisant des microbulles, empêchant une évaluation fiable du flux microvasculaire ; (2) l'absence de résultats cytologiques ou pathologiques ; (3) un diagnostic histopathologique d'un sous-type rare ou particulier de carcinome thyroïdien (par exemple, les variants anaplasiques) ; ou (4) des anomalies cytologiques suggérant un néoplasme folliculaire (catégorie Bethesda IV) ou toute lésion d'origine folliculaire indéterminée, indépendamment du statut mutationnel ; (5) une thyroïdite de Hashimoto
Acquisition par échographie, échographie avec contraste (CEUS) et échographie par balayage ultrasonore (SRUS)
Tous les examens ont été réalisés à l'aide du système d'échographie référencé et d'une sonde linéaire. Les patients étaient placés en position supine avec le cou en extension. Le nodule cible a été localisé et mesuré en échographie en mode B ; les microcalcifications ont été notées, et le même plan d'imagerie centré sur la lésion a été utilisé pour évaluer la vascularisation intranodulaire par Doppler couleur.
Après la mise en place d'un accès intraveineux, le système a été basculé en mode CEUS/URM à faible indice mécanique (URM signifie imagerie par microscopie ultra-résolutive). L'examen CEUS a été réalisé par injection intraveineuse en bolus de 1,2 mL de SonoVue, suivie immédiatement d'un rinçage avec 5 ml de sérum physiologique ; le chronomètre affiché à l'écran et l'acquisition cinématographique continue ont été lancés dès l'administration du bolus. La sonde a été maintenue dans un plan fixe avec une pression minimale, et le patient a été prié d'éviter de déglutir pendant les phases d'arrivée et d'élimination du produit.
Pour l'ECUS quantitative, une région d'intérêt limitée à la lésion a été utilisée pour obtenir les paramètres intensité-temps. Pour l'URSM, le flux de travail URM a localisé et suivi les signaux des microbulles après correction des mouvements, puis a généré des mesures de rapport vasculaire, de complexité, de densité microvasculaire, d'indice de perfusion et de vitesse d'écoulement. Les exports d'images représentatifs montraient les réglages VSP 4, RES 2, CTR 3, SM 2, VEN 3 et CPT 10 s ; les réglages correspondants n'étaient pas disponibles pour les examens restants.
Les 25 variables d'entrée du modèle sont énumérées dans le Tableau 1 et regroupées par modalité d'acquisition : âge et sexe ; microcalcifications en mode B ; vascularisation intranodulaire en Doppler couleur ; échographie de contraste qualitative ; échographie de contraste quantitative ; et 11 mesures microvasculaires SRUS.
Sélection des caractéristiques
Toutes les 25 caractéristiques quantitatives ont été conservées dans les modèles d'apprentissage automatique. Seules les caractéristiques numériques ont été utilisées ; les noms des patients, les numéros d'enregistrement et les champs de taille des lésions ont été exclus. Aucune sélection de caractéristiques fondée sur les données n'a été effectuée, et les mêmes prédicteurs prédéfinis ont été introduits dans chaque classificateur.
Standardisation des caractéristiques
Aucune transformation, imputation ou mise à l'échelle globale n'a été appliquée avant la validation croisée. La standardisation a uniquement été appliquée au SVM à fonction de base radiale via un pipeline StandardScaler. Le module de mise à l'échelle a été ajusté sur les nodules d'entraînement de chaque pli, puis appliqué aux nodules de validation de ce même pli. Les classificateurs basés sur les arbres ont reçu les échelles numériques d'origine :

où x est la valeur initiale de la caractéristique, µ est la moyenne de l'ensemble d'apprentissage et σ est l'écart type de l'ensemble d'apprentissage. Le prétraitement par pli a empêché les observations de validation de contribuer aux paramètres de mise à l'échelle du SVM.
Partitionnement des données
L'évaluation principale des performances a utilisé une validation croisée stratifiée en cinq groupes (StratifiedGroupKFold) avec shuffle = True et random_state = 42. Un identifiant patient a défini 63 groupes, et tous les nodules provenant d'un même patient ont été affectés au même groupe. Aucun patient n'a contribué de nodules à la fois aux sous-ensembles d'apprentissage et de validation d'un groupe.
Entraînement et validation du modèle
Protocole d'entraînement
Cinq classificateurs ont été évalués : forêt aléatoire (100 arbres ; random_state = 42), SVM à fonction de base radiale (C = 1,0 ; gamma = scale ; probability = True ; pipeline StandardScaler ; random_state = 42), arbre de décision (critère de Gini ; profondeur illimitée ; random_state = 42), XGBoost (100 estimateurs ; learning_rate = 0,3 ; max_depth = 6 ; subsample = 1,0 ; colsample_bytree = 1,0 ; random_state = 42) et boosting par gradient (100 estimateurs ; learning_rate = 0,1 ; max_depth = 3 ; random_state = 42). Aucune recherche en grille, optimisation bayésienne, réglage de seuil ou sélection imbriquée de modèle n’a été effectuée.
Validation croisée
Dans chacun des cinq plis regroupés par patient, les modèles ont été entraînés sur les groupes de patients restants et évalués sur les groupes exclus. La précision, la sensibilité, la spécificité, la valeur prédictive positive, le score F1 et l'aire sous la courbe ROC ont été calculés pour chaque pli et résumés sous la forme moyenne ± écart-type. Les prédictions hors échantillon (OOF) ont été regroupées pour l'ensemble des 68 nodules afin de produire une courbe ROC validée croisée et une matrice de confusion pour chaque modèle.
Évaluation des performances
Métriques d'évaluation
Les performances du modèle ont été évaluées au sein de chaque pli de validation groupé par patient et à partir des prédictions agrégées hors échantillon (OOF) en utilisant les métriques suivantes :
Précision : Proportion globale de prédictions correctes

Sensibilité (rappel) : proportion de nodules malins réels correctement identifiés

Spécificité : Proportion de nodules bénins réels correctement identifiés

Précision (valeur prédictive positive) : proportion de cas prédits comme malins qui étaient effectivement malins

Score F1 : moyenne harmonique de la précision et du rappel

Surface sous la courbe caractéristique de fonctionnement du récepteur (ROC-AUC) : Mesure de la capacité du modèle à discriminer entre les nodules bénins et malignes à tous les seuils de classification
où TP = vrais positifs (nodules malins correctement identifiés), TN = vrais négatifs (nodules bénins correctement identifiés), FP = faux positifs (nodules bénins classés à tort comme malins) et FN = faux négatifs (nodules malins classés à tort comme bénins).
Analyse de la matrice de confusion
Les matrices de confusion OOF ont été générées en regroupant les prédictions faites pour chaque nodule uniquement dans le pli où ce patient avait été mis de côté. Ainsi, chaque nodule a reçu une prédiction à partir d'un modèle entraîné sur des nodules provenant d'autres patients.
Analyse de l'importance des caractéristiques
Pour le modèle de forêt aléatoire, les scores d'importance des caractéristiques ont été calculés en fonction de la diminution moyenne de l'impureté de Gini sur l'ensemble des arbres de décision. Les 15 caractéristiques les plus importantes ont été identifiées et classées afin de déterminer quels paramètres microvasculaires contribuaient le plus significativement à la performance de classification.
Analyse exploratoire SHAP
Une analyse OOF SHAP ciblée utilisant un explicateur basé sur les permutations a été réalisée pour le SVM. Pour chaque nodule mis de côté, seules les observations correspondantes de l'échantillon d'apprentissage ont été utilisées comme distribution de référence (128 permutations antithétiques ; graine aléatoire = 20260716). Les valeurs SHAP absolues moyennes ont résumé l'ampleur des contributions, tandis que les valeurs signées ont indiqué le sens de celles-ci. L'analyse était exploratoire et n'a pas été utilisée pour inférer une causalité, identifier des biomarqueurs indépendants ou définir des seuils cliniques.
Analyse statistique
Analyse comparative
Les performances du modèle ont été résumées de manière descriptive selon les cinq plis de validation regroupés par patient et dans les prédictions globales hors échantillon. Aucun test d'hypothèse formel entre modèles ni aucun classement fondé sur des valeurs P n'a été effectué, car les plis sont liés et la cohorte est de petite taille.
Pour les comparaisons de groupes au moment de la ligne de base, la normalité des variables continues a été évaluée au sein de chaque groupe d'issue à l'aide du test de Shapiro-Wilk. Le test de Welch t un test a été utilisé lorsque les deux groupes présentaient une distribution normale ; sinon, un test de Mann-Whitney bilatéral U Le test a été utilisé. Les variables catégorielles ont été évaluées à l'aide du test du chi-deux de Pearson, complété par le test exact de Fisher pour les tableaux 2 x 2 peu fournis. Les valeurs de p étaient bilatérales, exploratoires et non ajustées (alpha = 0,05).
Reproductibilité
La reproductibilité a été assurée par une définition précise du groupe de patients, une graine aléatoire fixée (42), des configurations fixes du classificateur et un prétraitement par pli. Les identifiants ont été utilisés uniquement pour le regroupement et n'ont pas été introduits comme prédicteurs ni exportés avec les sorties du modèle.