Research Article

Biomarqueurs moléculaires multimodaux basés sur l’apprentissage automatique pour l’analyse prédictive de la santé

DOI:

10.3791/69241

January 16th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’apprentissage automatique avec biomarqueurs multimodaux améliore la prédiction et le suivi des maladies, offrant des perspectives d’avancées en santé dans divers domaines, améliorant les résultats de santé grâce à une prédiction précise des maladies.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Chaque année, de nombreuses personnes à travers le monde sont progressivement touchées par des problèmes de santé dévastateurs tels que les maladies cardiaques, les infections respiratoires, les dysfonctionnements neurologiques, le stress cognitif, le cancer, les AVC, le diabète, etc., qui entraînent de graves complications de santé et des anomalies associées. Ainsi, les analyses précoces de la santé sont cruciales, car elles permettent une intervention rapide grâce à des thérapies ciblées, offrant potentiellement un soulagement immédiat et des bénéfices durables à long terme qui peuvent ralentir la progression de la maladie. En raison des processus pathophysiologiques complexes et des essais cliniques hétérogènes dans diverses pathologies, il est nécessaire de biomarqueurs multimodaux hautement sensibles et d’approches d’investigation efficaces pour détecter et surveiller avec précision les résultats de santé des patients. Par conséquent, des algorithmes d’apprentissage automatique avec diverses catégories et techniques sont pris en compte pour prédire les résultats, notamment le pronostic, l’évaluation des risques, la stratification des patients et la surveillance de la maladie. Le déroulement du travail proposé est divisé en trois étapes, la première étape définissant l’importance des soins de santé avec des études de cas, suivie par les algorithmes traditionnels d’apprentissage automatique (ML), les approches traditionnelles de Deep Learning (DL) et les techniques modernes de DL (TabNet et AutoInt) dans la seconde phase. Enfin, les expériences sont réalisées pour justifier les résultats. Ce travail met en lumière le regroupement des modalités en intégrant des biomarqueurs moléculaires de protéines, chimiques et génétiques avec des caractéristiques émergentes de l’apprentissage automatique. Les résultats indiquent une amélioration significative de la prédiction de la précision en utilisant la méthodologie proposée.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le système de santé utilise de plus en plus l’analytique prédictive pour surveiller les patients et diagnostiquer les résultats de santé en temps voulu, facilitant ainsi des soins proactifs et améliorant les résultats pour les patients. En intégrant l’analytique prédictive aux biomarqueurs, les cliniciens peuvent améliorer la précision diagnostique, identifier des traitements efficaces, suivre l’évolution des traitements et obtenir des informations précieuses sur les mécanismes de la maladie, conduisant finalement à des décisions thérapeutiques plus éclairées et efficaces. Les biomarqueurs désignent les caractéristiques de molécules biologiques ou d’indicateurs trouvés dans les échantillons, tels que les biofluides, les tissus, les cellules, l’ADN, l’ARN, le sang et l’urine, qui mesurent la présence ou la progression d’une maladie dans le corps humain, aidant ainsi à évaluer l’efficacité dutraitement 1.

Les avancées dans l’application des biomarqueurs moléculaires jouent un rôle crucial en médecine personnalisée en mesurant précisément des molécules spécifiques afin d’identifier des problèmes de santé uniques chez les patients, permettant ainsi des stratégies de traitement ciblées dès les premiersstades 2. À l’avenir, les approches multimodales aideront à intégrer plusieurs modalités de schémas pathologiques complexes, permettant une identification plus précise du pronostic des maladies dans le cancer et les maladies neurodégénératives grâce à des techniques analytiques prédictivesavancées 3. Cette méthodologie de pointe utilise des données multi-omiques, la bioinformatique et des algorithmes de ML pour identifier de nouveaux biomarqueurs, permettant un profilage des risques spécifiques au patient et des stratégies de traitement subjectives pour les maladies cardiovasculaires (MCV) et autres maladiescomplexes 4. La combinaison des biomarqueurs moléculaires et des approches multi-omiques promet d’améliorer la précision diagnostique et la stratification thérapeutique dans les maladiesneurologiques 5.

Avec l’avancement des techniques de ML, les biomarqueurs moléculaires multimodaux peuvent intégrer divers types de données pour identifier de nouvelles signatures de maladie dans diverses pathologies, permettant un diagnostic plus précis et des stratégies de traitement personnalisées. S’appuyant sur ce potentiel, l’auteur explore diverses techniques d’apprentissage automatique en santé pour prédire les facteurs de risque de diagnostic des maladies et souligne leur importance dans différents secteursde la santé 6. Avec la transformation du diagnostic et du traitement des maladies par l’apprentissage automatique, les cabinets pharmaceutiques utilisent de plus en plus les algorithmes décisionnels pour analyser les résultats de santé des patients et répondre à leurs besoins quotidiens, permettant ainsi des soins plus éclairés etefficaces 7. En tirant parti du besoin potentiel d’intégration multimodale des données, cette étude a développé des biomarqueurs utilisant des données multimodales (IRM et génétiques) pour prédire le développement et la progression de la maladie d’Alzheimer, montrant que les données génétiques prédisaient mieux la progression future de l’Alzheimer chez des sujets témoins normaux, tandis que les données IRM caractérisaient mieux un trouble cognitif léger stable, combinant les deux, une performance de classification de meilleurequalité 8.

Pour faire progresser l’application de l’analyse multimodale des données, l’apprentissage profond multimodal utilise les données d’expression génique pour identifier des médicaments ciblant des lignées cellulaires spécifiques de nouvelles molécules biologiques, élucidant ainsi comment les variations génomiques influencent la réponse autraitement 9. Parallèlement aux avancées dans l’analyse multimodale des données, les biomarqueurs non invasifs, évalués à l’aide de métriques d’IA et d’apprentissage automatique, émergent comme des outils prometteurs pour le diagnostic, avec des profils de spécificité et de sensibilité variables par rapport aux biomarqueurs invasifs, selon l’application spécifique et le contexte desdonnées 10. En accord avec l’importance croissante de l’analyse multimodale des données, les modèles d’ensemble d’apprentissage profond (DL) peuvent traiter efficacement des données complexes en intégrant de nouveaux biomarqueurs, y compris les interactions gène-protéine, afin d’améliorer la recherche sur le cancer et d’optimiser les stratégiesthérapeutiques 11. Alors que les modèles d’ensemble DL continuent de faire progresser la recherche sur le cancer, l’analytique prédictive joue un rôle crucial dans le diagnostic et le traitement des maladies en analysant de grandes quantités de données collectives provenant de multiples sources, y compris des pathologies diverses, afin de fournir une vue d’ensemble complète de l’état, comme l’évaluation des risques etle diagnostic 12.

L’objectif du protocole proposé est de mettre en œuvre des algorithmes basés sur le ML et le DL qui intègrent les marqueurs biologiques distincts afin d’améliorer la précision des analyses en santé. Les techniques de prédiction conventionnelles utilisant des biomarqueurs reposent généralement sur des données monomodales et des modèles statistiques linéaires, ce qui peut ne pas suffisamment capturer les relations complexes et non linéaires qui influencent le développement des maladies et les différences individuelles. L’intégration de grandes quantités de données issues d’observations, de dossiers de santé électroniques, de lectures de laboratoire, de mesures physiques et d’évaluations cliniques offre une opportunité significative de synthétiser et d’optimiser l’évaluation des risques dans le diagnostic patient13. Les biomarqueurs jouent un rôle crucial en médecine de précision, permettant un traitement ciblé au bon moment. Bien que les biomarqueurs soient complexes et posent des défis pour mesurer les sous-types de maladies et la croissance moléculaire, ils sont inestimables pour évaluer les réactions toxiques dans diverses conditions anormales, facilitant ainsi une analyse ultérieure. En utilisant des biomarqueurs lors de l’observation clinique, les professionnels de santé peuvent prédire plus précisément la progression de la maladie et surveiller les réponses au traitement. En fin de compte, la convergence des biomarqueurs moléculaires multimodaux en analytique de santé avec l’IA permet une reconnaissance de motifs plus efficace, en alignant les caractéristiques existantes pour atténuer l’impact clinique.

Comparé aux approches de pointe, en particulier les travaux de Somepalli et al.14, où les auteurs ont proposé des algorithmes d’apprentissage automatique sur des données génomiques, telles que les données métaboliques, épigénétiques et protéomiques, et ont proposé des lignes directrices générales pour la sélection des algorithmes d’apprentissage automatique. Cependant, l’analyse des données existe une limite. Dans les travauxexistants, 15 méthodes d’intégration non supervisées ont été appliquées aux données omiques, en se concentrant sur les défis computationnels. En revanche, il existe des limites quant à la portée et à l’analyse des méthodes. De plus, Huang et al.16 ont couvert la plupart des méthodes DL pour analyser diverses applications, visant à comprendre la puissance du big data et des cadres computationnels. Les inconvénients comprenaient un déséquilibre des données, un surajustement et des problèmes d’interprétation. Le protocole proposé est crucial pour combler une lacune critique dans la recherche sur les biomarqueurs intégratifs, car les techniques actuelles ne combinent pas efficacement des données biologiques de grande dimension et diverses. En utilisant un ML et un DL sophistiqués qui excellent dans la reconnaissance de motifs, la sélection des caractéristiques et la fusion multimodale, la proposition vise à identifier des signatures prédictives robustes qui améliorent le diagnostic précoce, le pronostic et les options de traitement individuelles. Ce protocole répond directement aux limites des évaluations de biomarqueurs disjoints en présentant un modèle complet, basé sur les données, qui permet des prédictions de santé évolutives, interprétables et cliniquement pertinentes.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Flux de travail expérimental

La Figure 1 illustre un flux de travail organisé et modulaire conçu pour catégoriser les biomarqueurs moléculaires en catégories de risque ou d’indication diagnostique, à l’aide de techniques d’apprentissage automatique et d’apprentissage profond. Voici une explication détaillée étape par étape du processus :

  1. Acquisition de jeux de données
    L’ensemble de données est collecté à partir de MarkerDB 2.0, une base de données soigneusement sélectionnée de biomarqueurs moléculaires.
  2. Prétraitement des données
    Cela garantit la qualité et la cohérence des données en gérant les valeurs nulles et les entrées manquantes, en encodant les caractéristiques catégoriques avec LabelEncoder, et en mettant en valeur les caractéristiques numériques (par exemple, entrez_gene_id) avec StandardScaler.
  3. Ingénierie des caractéristiques
    Il est recommandé de sélectionner des caractéristiques pertinentes qui influencent la classification des biomarqueurs, évitent les fuites de données et améliorent les performances du modèle.
  4. Développement de modèles
    Les approches utilisées sont Régression Logistique, Forêt Aléatoire, XGBoost, tandis que dans DL : MLP, MLP avec LR Scheduler, AutoInt, TabNet. Les activités réalisées sont l’ajustement des hyperparamètres, la validation croisée et l’optimisation pour les tâches de classification.
  5. Répartition des données
    Ici, le Ensemble d’entraînement (80 %) est utilisé pour apprendre les paramètres du modèle, et le Set de test (20 %) est utilisé pour évaluer le modèle sur des données invisibles. À la dernière étape, des indicateurs d’évaluation sont utilisés pour garantir que la performance est mesurée de manière globale, en particulier dans les scénarios de classe déséquilibrés.

figure-protocol-1
Figure 1 : Diagramme de flux du travail proposé. Le flux de travail du problème proposé est illustré dans cette figure. Les étapes sont le prétraitement des données, l’ingénierie des fonctionnalités, le développement de modèles, la scindation, l’évaluation des modèles à l’aide de métriques et l’analyse des biomarqueurs. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

2. Description du jeu de données

Le nom du jeu de données est all_sequence_variants avec l’extension csv. Il existe des colonnes avec des noms tels que « id », « variation », « position », « external_link », « gene_symbol », « entrez_gene_id », « référence », « conditions », « indication_types », où toutes sont de type objet sauf id comme type d’int et entrez_gene_id comme type flottant. Le nombre total de lignes est de 42 818 avec 9 colonnes. De plus, le jeu de données contient des valeurs nulles pour la variation, la position, la external_link, la entrez_gene_id, la référence, les conditions et indication_types. Le jeu de données est tiré du lien donné :https://markerdb.ca/downloads 17

3. Prétraitement des ensembles de données

À ce stade, le prétraitement des données commence par la collecte d’informations sur le jeu de données, la description, l’identification des doublons et la localisation des valeurs manquantes ou nulles. Il n’y a pas d’impact de la caractéristique external_link lorsqu’elle est mesurée par le coefficient de corrélation, et elle est donc supprimée. Les valeurs nulles des colonnes catégorielles et numériques sont remplies respectivement par la médiane et la moyenne. Enfin, la forme des données d’entrée et de sortie est (42787, 6)(42787,). Les colonnes d’entrée sont « id », « variation », « position », « gene_symbol », « entrez_gene_id », « conditions », tandis que la colonne cible est indication_types.

4. Biomarqueurs : Catégories, défis liés aux données et rôle du risque moléculaire

Un biomarqueur est un trait quantifiable qui signifie soit des activités biologiques normales, soit des réactions anormales à diverses expositions ou interventions. Les biomarqueurs peuvent être de nature moléculaire, histologique, radiographique ou physiologique et sont divisés en sept catégories principales : (1) Un biomarqueur diagnostique détermine si un individu souffre d’une maladie ou d’un trouble spécifique et s’il relève d’un sous-type, (2) Un biomarqueur de surveillance indique la progression d’une maladie et sa réponse au traitement, (3) Un biomarqueur de réponse indique si un patient réagit à un médicament ou à une thérapie, comme un changement de fréquence cardiaque, (4) Un biomarqueur prédictif peut déterminer si une personne est à risque de développer une certaine maladie et comment elle peut réagir à un traitement particulier, (5) Un biomarqueur pronostique peut offrir des indications sur la probabilité de progression ou de récidive de la maladie si un patient est prédisposé à un résultat de santé spécifique, (6) Un biomarqueur de risque évalue le niveau potentiel de risque pour une affection avant qu’un patient ne reçoive un diagnostic officiel, et (7) Un biomarqueur de sécurité évalue le potentiel de réactions toxiques ou indésirables pouvant survenir du traitement. Cette étude se concentre principalement sur l’analyse des biomarqueurs moléculaires liés à l’évaluation des risques et au diagnostic, comme indiqué à la Figure 2. Compte tenu de la grande quantité de données cliniques accessibles dans le monde, les biomarqueurs sont essentiels pour orienter les décisions cliniques, faire progresser la recherche et faciliter la médecine personnalisée.

figure-protocol-2
Figure 2 : Catégorie des biomarqueurs pour la prise de décision clinique. Les décisions du biomarqueur sont représentées dans ce schéma. Sur la base des analyses appliquées aux biomarqueurs, les décisions cliniques sont prises en compte et des algorithmes d’apprentissage automatique sont mis en place. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Trouver et comprendre des informations cliniquement utiles sur les biomarqueurs est un défi en raison de la grande diversité des types, caractéristiques et qualités de biomarqueurs. La croissance rapide des études sur les biomarqueurs au cours des deux dernières décennies a encore compliqué l’accès à des données complètes et à jour, en particulier pour les biomarqueurs moléculaires. Cela a conduit à des problèmes tels que des résultats incohérents, une redécouverte redondante de biomarqueurs existants, des résultats contradictoires et des opportunités négligées d’utiliser des biomarqueursétablis 18. L’émergence des mesures « omiques » a aggravé ce problème, entraînant une prolifération de nouveaux biomarqueurs moléculaires dans les essais cliniques et la littérature, ce qui rend de plus en plus difficile la navigation et l’application efficace des connaissances sur lesbiomarqueurs 19.

MarkerDB 2.0 donne accès à divers biomarqueurs moléculaires à des finsexpérimentales 20. Divers biomarqueurs sont utilisés dans la recherche clinique et les applications de santé pour diagnostiquer, prédire et surveiller les maladies. Parmi ceux-ci, les biomarqueurs protéiques utilisent des biofluides tels que le sérum, le sang, le liquide céphalorachidien (LCR), le liquide péritonéal, le liquide amniotique, le plasma et l’urine pour analyser des affections telles que le diabète sucré, la tuberculose, la trisomie 21 et les troubles liés à la myopathie. De même, les biomarqueurs génétiques utilisent des symboles génétiques comme LRP1, LPP, MAPT et SPI1 pour analyser des affections telles que la dégénérescence maculaire liée à l’âge, les maladies allergiques, la maladie d’Alzheimer, le cancer et l’asthme. De plus, les biomarqueurs moléculaires multimodaux aident à mesurer le risque chez le patient et à mesurer les indicateursdiagnostiques 21. Ce travail met en lumière la nécessité d’analyser les soins de santé utilisant des approches ML pour améliorer le diagnostic, la prédiction et le traitement personnalisé des maladies.

5. Modélisation des approches statistiques d’apprentissage automatique pour la découverte de biomarqueurs

L’application des approches d’apprentissage automatique a transformé le domaine de la santé de nombreuses façons. Plus précisément, les biomarqueurs moléculaires ont été analysés à l’aide de diverses techniques d’apprentissage automatique, notamment l’analyse des composantes principales (PCA), le clustering K-means (KMA), l’analyse des plus proches voisins (NNA) et les algorithmes de réseauxneuronaux 22. Ces modèles identifient des motifs complexes à partir de caractéristiques choisies, gèrent des données incomplètes ou incohérentes, et assurent le suivi en temps réel de l’évolution de la maladie. En plus du diagnostic des maladies, les algorithmes de ML fournissent des informations importantes sur les problèmes des patients grâce à l’examen et à la visualisation des données, permettant des soins rapides etciblés 23. En conséquence, cela améliore les résultats de santé des patients dans des conditions inhabituelles. De plus, la capacité de l’apprentissage automatique à révolutionner la découverte de biomarqueurs et les résultats thérapeutiques dans diverses maladies, y compris l’analyse des biomarqueurs moléculaires, devient de plus en plus dynamique.

Les algorithmes d’apprentissage automatique sont classés en cinq types principaux, comme indiqué à la Figure 3. L’apprentissage supervisé est le processus d’entraînement sur des ensembles de données marqués pour comprendre les relations entrée-sortie, ce qui le rend idéal pour des tâches telles que la classification et la régression, comme les arbres de décision et les machines à vecteurs de support. L’apprentissage non supervisé identifie des motifs au sein de données non étiquetées, et est souvent appliqué pour le regroupement et la réduction de dimensionnalité, avec des techniques telles que le regroupement k-means et l’analyse des composantes principales. L’apprentissage semi-supervisé fusionne à la fois les données étiquetées et non étiquetées pour générer des prédictions. L’apprentissage par renforcement se concentre sur la prise de décision fondée sur les retours de l’environnement, et est fréquemment utilisé dans le jeu vidéo et la robotique, avec des méthodes telles que l’apprentissage Q et les réseaux d’apprentissage par renforcement profond. L’apprentissage profond utilise des réseaux de neurones artificiels à plusieurs couches pour identifier des motifs complexes dans les données. Cette technique aide à prédire les biomarqueurs des maladies courantes, notamment le cancer, l’AVC, la maladie d’Alzheimer et la maladie de Parkinson. De nombreux programmes cliniquement approuvés utilisent cettetechnologie 24,25. Le diagnostic précis des patients atteints de tumeurs malignes dépend généralement de l’acquisition et de l’analyse pathologique d’échantillons de tissus, qui fournissent des informations cruciales sur le grade histologique, le sous-type, le stade et divers autres biomarqueurs tumoraux.

figure-protocol-3
Figure 3 : Catégorisation des algorithmes d’apprentissage automatique pour la prise de décision clinique. Les types d’algorithmes d’apprentissage automatique dans le diagramme sont illustrés pour mieux comprendre la méthodologie appliquée. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Les statistiques et le ML sont deux disciplines distinctes qui se croisent fréquemment. Les statistiques consistent à collecter, analyser et interpréter des données, en travaillant généralement avec des ensembles de données plus petits et bien définis, et se concentre principalement sur la comparaison et le résumé des informations. En revanche, le ML est un sous-ensemble de l’intelligence artificielle qui crée des modèles prédictifs, souvent en traitant de jeux de données volumineux et complexes. Si les statistiques jouent un rôle important dans la recherche confirmatoire et la compréhension des mécanismes sous-jacents, l’apprentissage automatique est plus efficace dans la recherche exploratoire, la découverte de schémas complexes et la gestion des données manquantes. Des méthodes telles que la régression logistique peuvent être considérées à la fois comme des modèles statistiques et des modèles d’apprentissage automatique supervisé, illustrant les distinctions floues entre les deux domaines. En fin de compte, les chercheurs doivent évaluer leurs objectifs de recherche et la nature de leurs données afin de choisir la méthode la plus adaptée.

6. Modélisation de la MLP et de ses variantes

MLP, également appelé perceptron multicouche, est un type d’architecture de réseau neuronal comportant plusieurs couches neuronales entre les couches d’entrée et de sortie, comme illustré à la Figure 4. La MLP a été introduite dans les années 1950 et a gagné une large popularité grâce aux progrès et aux avancées de la rétropropagation dans les années 1980, ce qui a contribué à minimiser la perte. Les principes d’apprentissage de base de la MLP sont les réseaux neuronaux, les poids et les valeurs de biais pour calculer la sortie. Enfin, connaître la fonction d’activation et la valeur seuil pour obtenir la sortie dans la couche de sortie. Dans la méthodologie proposée, les nœuds de la couche d’entrée, de la couche cachée et de la couche de sortie correspondent respectivement à des caractéristiques cliniques et géniques, des couches entièrement connectées avec activation ReLU, et un seul neurone avec activation sigmoïde pour prédire respectivement le résultat binaire du type d’indication (Risque, Diagnostic). Les principaux avantages sont qu’ils sont simples à entraîner et à interpréter. Cependant, le MLP simple ne peut pas gérer de grands ensembles de données et est sensible au tauxd’apprentissage de 26. Par conséquent, pour surmonter ces inconvénients, le MLP avec Learning Rate Scheduler est considéré selon l’architecture donnée à la Figure 3B. La MLP avec LR est un mécanisme dynamique puissant avec une décroissance abrupte, une décroissance exponentielle, une décroissance inverse du temps, un ReduceLROnPlateau et un recuit cosinus. Au lieu d’une valeur LR fixe, le taux d’apprentissage varie en fonction de la performance et de l’entraînement du modèle.

figure-protocol-4
Figure 4 : Modéliser un perceptron multicouche et MLP avec un planificateur LR. (A) Perceptron multi-couches : La structure de MLP est illustrée avec la couche d’entrée, la couche cachée et la couche de sortie. La première couche reçoit l’entrée et la traite dans la seconde couche avec des activations, et la sortie est reçue dans la dernière couche. MLP est simple à mettre en œuvre. (B) MLP avec planificateur LR : C’est similaire au MLP ; cependant, un planificateur de taux d’apprentissage est ajouté pour contrôler la vitesse d’entraînement afin d’obtenir un meilleur taux de convergence. Le taux d’apprentissage est réduit à un plateau. Cela réduit les minima de dépassement. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Cette approche est plus efficace, fiable et efficace pour les données tabulaires. De plus, il existe des avantages tels qu’une amélioration stable de la convergence sur des données bruitées, une généralisation améliorée et un effort réduit dans l’ajustement des hyperparamètres. Cependant, pour certaines tâches de prédiction, des difficultés peuvent survenir, comme rester bloqué dans les minima locaux. De plus, dans l’architecture large et profonde de MLP présentée à la Figure 5, des composants larges et profonds sont introduits dans le MLP pour exceller dans la correspondance de corrélation, la mémorisation de règles et l’apprentissage de nouveaux motifs, tout en maintenant des standards élevés de généralisation. En combinant ces aspects dans la couche de sortie, la sortie binaire est prédite27. Cependant, il existe des limites à la généralisation des caractéristiques invisibles et à la surgénéralisation. En conclusion, MLP avec norme de lot et abandon est utilisé pour normaliser le processus d’entraînement, en intégrant le dropout pour l’apprentissage et la généralisation des attributs inconnus. En particulier, cette technique peut être appliquée aux données de haute dimension et aide à prévenir le sur-ajustement. Néanmoins, cette technique souffre de limitations de taille de lot, d’une consommation mémoire accrue (due aux couches de normalisation par lots), et n’est pas une solutionuniverselle 28,29.

figure-protocol-5
Figure 5 : Modéliser MLP à l’échelle du réseau et du réseau profond. Le diagramme illustre le chemin profond de la MLP, qui peut capturer des relations non linéaires et combine la sortie avec une unité sigmoïde pour la classification. Cette architecture capture l’apprentissage des motifs et les connaissances pour des données de biomarqueurs hétérogènes. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

7. TabNet

Le TabNet est un modèle d’apprentissage profond connu sous le nom de Tabular Network, développé par l’équipe de recherchede Google 30. La principale motivation du modèle TabNet est de concilier les différences entre les approches DL pour les approches image, texte, parole (CNN, Autoencodeur, Transformers) et apprentissage automatique en arbre (XGBoost, Random Forest, LightGBM). De plus, les limites des approches DL ont un impact considérable sur le modèle TabNet, MLP étant un modèle paramétrisé. Par-dessus tout, les approches DL manquent d’interprétation dans les problèmes réels, l’apprentissage auto-supervisé et la capacité d’apprentissageséquentiel 31. Les modèles TabNet sont limités à des applications telles que la prédiction du risqued’assurance 32, l’estimation de la teneur en cendres de charbon33, la prédiction de toxicitéchimique 34 et la détection de la triche par testséducatifs 35. L’architecture de TabNet est donnée à la Figure 6.

figure-protocol-6
Figure 6 : Modélisation du réseau tabulaire. Le réseau tabulaire prend les caractéristiques d’entrée au format tabulaire et applique la technique du transformateur de manière séquentielle dans chaque bloc. Le bloc GLU, également appelé bloc linéaire à portes, contrôle le flux d’information à travers le réseau, facilitant la sélection des caractéristiques et l’apprentissage stable. La sortie est présentée dans la couche de sortie à partir de la sortie accumulée. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

D’après le diagramme d’architecture ci-dessus, le système est divisé en quatre composantes : bloc d’entrée, transformateur de caractéristiques partagées, étapes de décision séquentielles et le calcul des pertes utilisant l’optimisation. Dans les caractéristiques catégorielles, les traits sont convertis en entiers suivant la couche d’immersion. En même temps, les caractéristiques continues sont prises telles quelles. Enfin, les caractéristiques sont converties en un vecteur de caractéristiques unifié où x ∈ Rd. À l’étape suivante, des couches entièrement connectées avec des fonctions d’activation sont implémentées, suivies d’une transformation pour convertir les données en vecteur, et une décision est prise. À la troisième étape, le transformateur d’attention, le masquage, le transformateur de décision et l’accumulation de prédiction sont utilisés successivement. Les objectifs de cette étape sont l’attention sélective, le raisonnement séquentiel et les voies décisionnelles. À la dernière étape, soit des méthodes binaires d’entropie croisée sont utilisées pour déterminer la perte et optimiser la valeur. De plus, la régularisation est réalisée en utilisant une attention parcimonieuse pour éviter le sur-ajustement.

8. AutoInt

L’apprentissage automatique de l’interaction des caractéristiques via les réseaux neuronaux auto-attentifs (AutoInt) est la forme complète de l’AutoInt, introduite dans la prédiction du taux de clics (CTR) 36 et appliquée ultérieurement à diverses applications, notamment la prédiction des défauts logiciels37, les systèmes de recommandation38 et la détection du génome39. Il existe des limites dans les approches existantes de ML, notamment la gestion de données parcimonieuses de haute dimension, les caractéristiques combinatoires d’ordre supérieur, la compréhension de la capacité de prédiction de ces fonctionnalités, ainsi que la nécessité d’ingénierie manuelle des caractéristiques. Tous ces défis mentionnés sont abordés par le modèle AutoInt avec efficacité, efficacité et explicabilité. L’objectif de l’AutoInt dans la méthodologie proposée est de prédire si la variante donnée est d’un type d’indication à risque ou diagnostique. Sept étapes sont proposées pour l’ensemble de données donné, comme montré à la Figure 6, ainsi que le code source. Premièrement, la lecture des données et le prétraitement sont implémentés pour encoder toutes les caractéristiques catégorielles en entiers et associer les étiquettes à 0 et 1 pour Risque et Diagnostic, respectivement. À la deuxième étape, une représentation des caractéristiques est effectuée pour créer la matrice d’immersion ; à son tour, la matrice est convertie pour normaliser les caractéristiques numériques. Il existe des couches d’interaction où l’interaction neutre automatique entre les caractéristiques est apprise sans interaction manuelle avec les transformateurs. De plus, plusieurs têtes apprennent différents types d’interactions, et enfin, les caractéristiques sont concaténées, améliorant ainsi la représentation. Des connexions résiduelles sont présentes pour apprendre à la fois des interactions d’ordre inférieur et supérieur, telles qu’une caractéristique, deux caractéristiques, 3 caractéristiques, etc. Enfin, à partir du réseau résiduel, les sorties sont transmises à la fonction sigmoïde pour les calculs de valeurs binaires, comme montré à la Figure 7.

figure-protocol-7
Figure 7 : Modélisation du réseau AutoInt. Le réseau AutoInt apprend automatiquement les fonctionnalités, où la couche d’intégration prend les caractéristiques et les mappe dans la couche suivante à l’aide d’un mécanisme d’auto-attention et de connexions résiduelles. Le dernier composant possède la couche MLP et les fonctions d’activation pour produire la sortie. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les expériences sont menées en utilisant des approches ML et DL pour comparer leurs performances. Parallèlement, la création de modèles d’apprentissage automatique utilisant à la fois des mécanismes d’apprentissage supervisé et non supervisé est envisagée. Les techniques supervisées utilisées dans cette méthodologie sont les algorithmes de régression logistique, arbre de décision, forêt aléatoire, augmentation de gradient, machine à vecteurs de support et K-Voisins les plus proches. Ces ...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le travail proposé aborde clairement l’importance des biomarqueurs dans l’identification et le suivi d’une maladie et de ses caractéristiques. L’approche suggérée pour la méthodologie des biomarqueurs repose sur quatre étapes essentielles : une préparation minutieuse des données (nettoyage, encodage, élimination des identifiants) ; codage uniforme de la cible (Risque=0, Diagnostic=1) ; la normalisation des fonctionnalités et l’intégration profonde de haute qualité pour des modèles tels q...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs n’ont rien à divulguer.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs n’ont reçu aucun financement externe.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Modèle AutoIntUniversité de Pékinhttps://github.com/shichence/AutoIntApprentissage automatique de l’interaction des caractéristiques via des réseaux de neurones auto-attentifs : algorithme efficace pour apprendre automatiquement les interactions de caractéristiques de haut ordre pour des caractéristiques catégorielles et numériques (clairsemées)
deepctr_torch.modèlesOpen sourcehttps://github.com/shenweichen/DeepCTR-TorchEnsemble modulaire et extensible de modèles CTR basés sur l’apprentissage profond pour construire facilement leur propre modèle personnalisé.
Colaboratoire GoogleGooglehttps://colab.research.google.com/Cloud-based  ; environnement pour écrire et exécuter du code Python via le navigateur pour l’apprentissage automatique et l’analyse des données
Keras 2.6.0Kerashttps://keras.io/Fournit une interface Python pour exécuter des réseaux de neurones qui fonctionne au-dessus de Tensorflow
MarkerDB 2.0MarkerDBhttps://markerdb.ca/downloadsBase de données publique disponible des biomarqueurs moléculaires
Matplotlib 3.4.3Matplotlib  ;https://matplotlib.org/Bibliothèque de visualisation pour python
Numpy 1.21.4Engourdihttps://numpy.org/Package fondamental pour l’informatique scientifique avec Python
Pandas 1.3.4Pandashttps://pandas.pydata.org/Outil d’analyse et de manipulation de données open source, puissant, flexible et facile à utiliser, construit sur le langage de programmation Python.
Python 3.8.10Fondation Python Softwarehttps://www.python.org/Langage de programmation populaire qui intègre plus efficacement les systèmes d’apprentissage profond.
pytorch_tabnet.tab_modelPytorchhttps://pypi.org/project/pytorch-tabnet/Pour la mise en œuvre de problèmes de classification binaire/multi-classes et de régression.
Scikit-learnScikit-learnhttps://scikit-learn.org/stable/Module Python pour les algorithmes d’apprentissage automatique
SeabornSeabornhttps://seaborn.pydata.org/Bibliothèque de visualisation de données de haut niveau pour dessiner des graphiques statistiques attrayants et informatifs
Modèle TabNetGooglehttps://github.com/dreamquark-ai/tabnetTabNet est un réseau de neurones de bout en bout conçu pour traiter directement les données tabulaires
Tensorflow 2.6.0Googlehttps://www.tensorflow.org/Une plateforme de bout en bout pour l’apprentissage automatique

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Mollarasouli, F., Bakirhan, N. K., Ozkan, S. A. Introduction to biomarkers. The detection of biomarkers. , Academic Press. 1-22 (2022).
  2. Doroszkiewicz, J., Groblewska, M., Mroczko, B. Molecular biomarkers and their implications for the early diagnosis of selected neurodegenerative diseases. Int J Mol Sci. 23 (9), 4610(2022).
  3. Steyaert, S., et al. Multimodal data fusion for cancer biomarker discovery with deep learning. Nat Mach Intell. 5 (4), 351-362 (2023).
  4. DeGroat, W., et al. Multimodal AI/ML for discovering novel biomarkers and predicting disease using multi-omics profiles of patients with cardiovascular diseases. Sci Rep. 14 (1), 26503(2024).
  5. Myrou, A., Barmpagiannos, K., Ioakimidou, A., Savopoulos, C. Molecular biomarkers in neurological diseases: advances in diagnosis and prognosis. Int J Mol Sci. 26 (5), 2231(2025).
  6. Bansal, A., Shukla, A. K., Bansal, S. Machine learning methods for predictive analytics in health care. Proc IEEE Int Conf Syst Modeling Adv Res Trends. , 258-262 (2021).
  7. Adeghe, E. P., Okolo, C. A., Ojeyinka, O. T. A review of the use of machine learning in predictive analytics for patient health outcomes in pharmacy practice. OARJ Life Sci. 7 (1), 052-058 (2024).
  8. Mirabnahrazam, G., et al. Machine learning based multimodal neuroimaging genomics dementia score for predicting future conversion to Alzheimer's disease. J Alzheimers Dis. 87 (3), 1345-1365 (2022).
  9. Taj, F., Stein, L. D. MMDRP: drug response prediction and biomarker discovery using multimodal deep learning. Bioinform Adv. 4 (1), vbae010(2024).
  10. Lazaros, K., et al. Non-invasive biomarkers in the era of big data and machine learning. Sens. 25 (5), 1396(2025).
  11. Mathema, V. B., Sen, P., Lamichhane, S., Orešič, M., Khoomrung, S. Deep learning facilitates multi-data type analysis and predictive biomarker discovery in cancer precision medicine. Comput Struct Biotechnol J. 21, 1372-1382 (2023).
  12. Pearson, T. A., et al. Precision health analytics with predictive analytics and implementation research: JACC state-of-the-art review. JACC. 76 (3), 306-320 (2020).
  13. Parvin, N., Joo, S. W., Jung, J. H., Mandal, T. K. Multimodal AI in biomedicine: Pioneering the future of biomaterials, diagnostics, and personalized healthcare. Nanomaterials. 15 (12), 895(2025).
  14. Somepalli, G., Goldblum, M., Schwarzschild, A., Bruss, C. B., Goldstein, T. SAINT: Improved neural networks for tabular data via row attention and contrastive pre-training. arXiv. , (2021).
  15. Libbrecht, M. W., Noble, W. S. Machine learning applications in genetics and genomics. Nat Rev Genet. 16 (6), 321-332 (2015).
  16. Huang, S., Chaudhary, K., Garmire, L. X. More is better: Recent progress in multi-omics data integration methods. Front Genet. 8, 84(2017).
  17. Li, Y., Huang, C., Ding, L., Li, Z., Pan, Y., Gao, X. Deep learning in bioinformatics: introduction, application, and perspective in the big data era. Methods. 166, 4-21 (2019).
  18. Frangogiannis, N. G. Biomarkers: Hopes and challenges in the path from discovery to clinical practice. Transl Res. 159 (4), 197-204 (2012).
  19. Frantzi, M., et al. Omics-derived biomarkers and novel drug targets for improved intervention in advanced prostate cancer. Diagn. 10 (9), 658(2020).
  20. Jackson, H., et al. MarkerDB 2.0: A comprehensive molecular biomarker database for 2025. Nucleic Acids Res. 53, D1415-D1426 (2025).
  21. DeGroat, W., et al. IntelliGenes: A novel machine learning pipeline for biomarker discovery and predictive analysis using multi-genomic profiles. Bioinform. 39 (12), btad755(2023).
  22. Thelagathoti, R. K., et al. A hybrid sequential feature selection approach for identifying new potential mRNA biomarkers for Usher syndrome using machine learning. Biomol. 15 (7), 963(2025).
  23. Ng, S., Masarone, S., Watson, D., Barnes, M. R. The benefits and pitfalls of machine learning for biomarker discovery. Cell Tissue Res. 394 (1), 17-31 (2023).
  24. Chudzik, A., Śledzianowski, A., Przybyszewski, A. W. Machine learning and digital biomarkers can detect early stages of neurodegenerative diseases. Sens. 24 (5), 1572(2024).
  25. Chang, C. H., Lin, C. H., Lane, H. Y. Machine learning and novel biomarkers for the diagnosis of Alzheimer's disease. Int J Mol Sci. 22 (5), 2761(2021).
  26. Bzdo, D., Altman, N., Krzywinski, M. Statistics versus machine learning. Nat Methods. 15 (4), 233-234 (2018).
  27. Bikku, T. Multi-layered deep learning perceptron approach for health risk prediction. J Big Data. 7 (1), 50(2020).
  28. Smith, L. N. A disciplined approach to neural network hyper-parameters: part 1-learning rate, batch size, momentum, and weight decay. arXiv. , (2018).
  29. Kim, T. Generalizing MLPs with dropouts, batch normalization, and skip connections. arXiv. , (2021).
  30. Chen, G., Chen, P., Shi, Y., Hsieh, C. Y., Liao, B., Zhang, S. Rethinking the usage of batch normalization and dropout in the training of deep neural networks. arXiv. , (2019).
  31. Arik, S. Ö, Pfister, T. Tabnet: attentive interpretable tabular learning. Proc AAAI Conf Artif Intell. 35 (8), 6679-6687 (2021).
  32. Qamar, T., Bawany, N. Z. Understanding the black-box: towards interpretable and reliable deep learning models. PeerJ Comput Sci. 9, e1629(2023).
  33. McDonnell, K., Murphy, F., Sheehan, B., Masello, L., Castignani, G. Deep learning in insurance: accuracy and model interpretability using TabNet. Expert Syst Appl. 217, 119543(2023).
  34. Zhou, M., Wen, Z., Xu, G., Zhang, Z., Zhou, C. Deep learning with TabNet: Rapid coal ash content estimation via X-ray fluorescence. Int J Coal Prep Util. 45 (3), 523-547 (2025).
  35. Mustafa, F. M., et al. TabNet and TabTransformer: Novel deep learning models for chemical toxicity prediction in comparison with machine learning. J Appl Toxicol. , (2025).
  36. Zhen, Y., Zhu, X. An ensemble learning approach based on TabNet and machine learning models for cheating detection in educational tests. Educ Psychol Meas. 84 (4), 780-809 (2024).
  37. Song, W., et al. Autoint: Automatic feature interaction learning via self-attentive neural networks. Proc ACM Int Conf Inf Knowl Manage. , 1161-1170 (2019).
  38. Jadhav, S., Manikandan, S., Ryu, D. Enhancing the software defect prediction using AutoInt. IEEE Int Conf Big Data Smart Comput. , 103-104 (2025).
  39. He, H., Zhang, R., Zhang, Y., Ren, J. AAIN: Attentional aggregative interaction network for deep learning based recommender systems. Neurocomputing. 547, 126374(2023).
  40. Fan, Y., Waldmann, P. Tabular deep learning: A comparative study applied to multi-task genome-wide prediction. BMC Bioinform. 25 (1), 22(2024).
  41. Kanász, R., Drotár, P., Gnip, P., Zoričák, M. Clash of titans on imbalanced data: TabNet vs XGBoost. Conf IEEE Trans Artif. , 320-325 (2024).
  42. Hwang, Y., Song, J. Recent deep learning methods for tabular data. Commun Stat Appl Methods. 30 (2), 215-226 (2023).
  43. Gorishniy, Y., et al. TabR: Tabular deep learning meets nearest neighbors in 2023. arXiv. , (2023).
  44. Kalidindi, A., Arrama, M. B. A TabTransformer based model for detecting botnet-attacks on internet of things using deep learning. J Theor Appl Inf Technol. 101 (13), 5206-5218 (2023).
  45. Holzmüller, D., Grinsztajn, L., Steinwart, I. RealMLP: Advancing MLPs and default parameters for tabular data. ELLIS Workshop on Representation Learning and Generative Models for Structured Data. , (2025).
  46. Zhu, B., et al. Xtab: cross-table pretraining for tabular transformers. arXiv. , (2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Machine Learning BiomarkersMultimodal BiomarkersPredictive Health AnalyticsMolecular BiomarkersDisease MonitoringRisk AssessmentPatient StratificationDeep Learning TechniquesProtein BiomarkersGenetic Biomarkers

Related Articles