Research Article

Op machine learning gebaseerde multimodale moleculaire biomarkers voor voorspellende gezondheidsanalyse

DOI:

10.3791/69241

January 16th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Machine learning met multimodale biomarkers verbetert de voorspelling en monitoring van ziekten, wat veelbelovende vooruitgang in de gezondheidszorg op verschillende gebieden biedt en de gezondheidsuitkomsten verbetert door nauwkeurige ziektevoorspelling.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Elk jaar worden veel mensen wereldwijd geleidelijk getroffen door de verwoestende gezondheidsproblemen zoals hartziekten, luchtweginfecties, neurologische stoornissen, cognitieve stress, kanker, beroerte, diabetes, enzovoort, wat leidt tot ernstige gezondheidscomplicaties en bijbehorende afwijkingen. Daarom zijn vroege gezondheidsanalyses cruciaal, omdat ze tijdige interventie met gerichte therapieën mogelijk maken, wat mogelijk directe verlichting en blijvende langetermijnvoordelen biedt die de ziekteprogressie kunnen vertragen. Vanwege de complexe pathofysiologische processen en heterogene klinische onderzoeken bij diverse gezondheidsproblemen is er behoefte aan zeer sensitive, multimodale biomarkers en effectieve onderzoeksbenaderingen om de gezondheidsuitkomsten van patiënten nauwkeurig te detecteren en te monitoren. Daarom worden machine learning-algoritmen met verschillende categorieën en technieken overwogen voor het voorspellen van uitkomsten, waaronder prognose, risicobeoordeling, patiëntstratificatie en ziektemonitoring. De stroom van het voorgestelde werk is verdeeld in drie fasen, waarbij de eerste fase het belang van de gezondheidszorg definieert met casestudy's, gevolgd door de traditionele Machine Learning (ML) algoritmen, traditionele Deep Learning (DL) benaderingen en moderne DL-technieken (TabNet en AutoInt) in de tweede fase. Ten slotte worden de experimenten uitgevoerd om de resultaten te rechtvaardigen. Dit werk benadrukt de groepering van modaliteiten door het integreren van moleculaire eiwit-, chemische en genetische biomarkers met opkomende ML-kenmerken. De resultaten geven een significante verbetering aan in het voorspellen van de nauwkeurigheid met behulp van de voorgestelde methodologie.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Het zorgsysteem maakt steeds vaker gebruik van voorspellende analyses om patiënten te monitoren en gezondheidsuitkomsten tijdig te diagnosticeren, wat proactieve zorg faciliteert en de patiëntuitkomsten verbetert. Door voorspellende analyses te integreren met biomarkers kunnen clinici de diagnostische nauwkeurigheid verbeteren, effectieve behandelingen identificeren, de voortgang van de therapie monitoren en waardevolle inzichten verkrijgen in ziektemechanismen, wat uiteindelijk leidt tot beter geïnformeerde en effectieve behandelbeslissingen. Biomarkers verwijzen naar de kenmerken van biologische moleculen of indicatoren die in monsters voorkomen, zoals biovloeistoffen, weefsels, cellen, DNA, RNA, bloed en urine, die de aanwezigheid of progressie van een ziekte in het menselijk lichaam meten en zo helpen de effectiviteit van de behandelingte beoordelen 1.

De vooruitgang in de toepassing van moleculaire biomarkers speelt een cruciale rol in gepersonaliseerde geneeskunde door specifieke moleculen nauwkeurig te meten om unieke gezondheidsproblemen bij patiënten te identificeren, waardoor gerichte behandelstrategieën vanaf debeginfase mogelijk zijn. In de toekomst zullen multimodale benaderingen helpen om meerdere modaliteiten van complexe ziektepatronen te integreren, waardoor een nauwkeurigere identificatie van de ziekteprognose bij kanker en neurodegeneratieve ziekten mogelijk wordt gemaakt via geavanceerde voorspellende analytische technieken3. De geavanceerde methodologie maakt gebruik van multi-omics-data, bio-informatica en ML-algoritmen om nieuwe biomarkers te identificeren, waardoor patiëntspecifieke risicoprofilering en subjectieve behandelstrategieën voor hart- en vaatziekten (CVD's) en andere complexe ziekten mogelijk zijn4. De combinatie van moleculaire biomarkers en multi-omics benaderingen biedt potentie om de diagnostische nauwkeurigheid en therapeutische stratificatie bij neurologische aandoeningente verbeteren.

Met de vooruitgang van ML-technieken kunnen multimodale moleculaire biomarkers diverse datatypen integreren om nieuwe ziektesignaturen in diverse gezondheidsproblemen te identificeren, waardoor nauwkeurigere diagnoses en gepersonaliseerde behandelstrategieën mogelijk worden. Voortbouwend op dit potentieel onderzoekt de auteur verschillende ML-technieken in de gezondheidszorg om risicofactoren voor ziektediagnose te voorspellen en benadrukt hij hun belang in verschillende zorgsectoren6. Doordat ML de diagnose en behandeling van ziekten transformeert, maken farmaceutische praktijken steeds vaker gebruik van besluitvormingsalgoritmen om de gezondheidsuitkomsten van patiënten te analyseren en aan hun dagelijkse behoeften te voldoen, waardoor meer geïnformeerde en effectieve zorg mogelijk wordt7. Door gebruik te maken van de potentiële noodzaak van multimodale data-integratie, ontwikkelde deze studie biomarkers met behulp van multimodale data (MRI en genetisch) om de ontwikkeling en progressie van de ziekte van Alzheimer te voorspellen, waarbij werd aangetoond dat genetische gegevens de toekomstige progressie van Alzheimer bij normale controlepersonen beter voorspelden, terwijl MRI-data stabiele milde cognitieve stoornissen beter karakteriseerden en beide combineerden, met een betere kwaliteit van classificatieprestatie8.

Verder vooruit in de toepassing van multimodale data-analyse maakt multimodaal deep learning gebruik van genexpressiegegevens om geneesmiddelen te identificeren die specifieke cellijnen van nieuwe biologische moleculen aanpakken, waarmee wordt verduidelijkt hoe genomische variaties de behandelingsrespons beïnvloeden9. In combinatie met de vooruitgang in multimodale data-analyse komen niet-invasieve biomarkers, geëvalueerd met behulp van AI- en ML-metrics, naar voren als veelbelovende diagnosetools, met verschillende specificiteits- en gevoeligheidsprofielen ten opzichte van invasieve biomarkers, afhankelijk van de specifieke toepassing en datacontext10. In lijn met het groeiende belang van multimodale data-analyse kunnen Deep Learning (DL) ensemblemodellen complexe data effectief verwerken door nieuwe biomarkers te integreren, waaronder gen-eiwitinteracties, om kankeronderzoek te verbeteren en behandelstrategieën te optimaliseren11. Naarmate DL-ensemblemodellen het kankeronderzoek blijven bevorderen, speelt voorspellende analyse een cruciale rol bij ziektediagnose en behandeling door grote hoeveelheden collectieve data uit meerdere bronnen, waaronder diverse gezondheidsproblemen, te analyseren om een uitgebreid overzicht te geven van de status, zoals risicobeoordeling en diagnose12.

Het doel van het voorgestelde protocol is het implementeren van ML- en DL-gebaseerde algoritmen die de verschillende biologische markers integreren om de nauwkeurigheid van gezondheidsanalyses te verbeteren. Conventionele voorspellingstechnieken die gebruikmaken van biomarkers zijn doorgaans gebaseerd op single-modality data en lineaire statistische modellen, die mogelijk de ingewikkelde, niet-lineaire relaties die de ziekteontwikkeling en individuele verschillen beïnvloeden, niet voldoende vastleggen. De integratie van enorme hoeveelheden data uit observaties, e-health records, laboratoriummetingen, fysieke metingen en klinische beoordelingen biedt een belangrijke kans om risicobeoordeling in patiëntdiagnose te synthetiseren en te optimaliseren13. Biomarkers spelen een cruciale rol in precisiegeneeskunde, doordat ze gerichte behandeling op het juiste moment mogelijk maken. Hoewel biomarkers complex zijn en uitdagingen vormen bij het meten van ziektesubtypes en moleculaire groei, zijn ze van onschatbare waarde bij het beoordelen van toxische reacties onder verschillende abnormale omstandigheden, waardoor verdere analyse mogelijk wordt. Door gebruik te maken van biomarkers tijdens klinische observatie kunnen zorgprofessionals de ziekteprogressie nauwkeuriger voorspellen en de respons op de behandeling monitoren. Uiteindelijk maakt de convergentie van multimodale moleculaire biomarkers in gezondheidszorganalyse met AI effectievere patroonherkenning mogelijk, waarbij bestaande kenmerken worden aangepast om de klinische impact te beperken.

In vergelijking met geavanceerde benaderingen, vooral het werk van Somepalli et al.14, waar de auteurs ML-algoritmen voorstelden op genoomgegevens, zoals metabole, epigenetische en proteomische data, en algemene richtlijnen voorstelden voor het selecteren van ML-algoritmen. Er is echter een beperking op de analyse van de data. In het bestaande werkwerden 15 ongecontroleerde integratiemethoden toegepast op omics-data, met de nadruk op computationele uitdagingen. Daarentegen zijn er beperkingen op de reikwijdte en analyse van de methoden. Bovendien behandelden Huang et al.16 de meeste DL-methoden voor het analyseren van diverse toepassingen, met als doel de kracht van big data en computationele kaders te begrijpen. De nadelen waren onder andere data-onevenwichtigheden, overfitting en interpretatieproblemen. Het voorgestelde protocol is cruciaal om een kritieke kloof in integratief biomarkeronderzoek aan te pakken, aangezien de huidige technieken er niet in slagen om hoogdimensionale en diverse biologische data effectief te combineren. Door gebruik te maken van geavanceerde ML en DL die uitblinken in patroonherkenning, featureselectie en multimodale fusie, is de voorgestelde indiening bedoeld om robuuste voorspellende signaturen te identificeren die vroege diagnose, prognose en individuele behandelopties verbeteren. Dit protocol pakt direct de beperking van disjointed biomarker-beoordelingen aan door een uitgebreid, datagedreven model te presenteren dat schaalbare, interpreteerbare en klinisch relevante gezondheidsvoorspellingen mogelijk maakt.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Experimentele workflow

Figuur 1 illustreert een georganiseerde en modulaire workflowpijplijn die is ontworpen om moleculaire biomarkers te categoriseren in categorieën Risico- of Diagnostische indicaties met behulp van machine learning- en deep learning-technieken. Hier volgt een gedetailleerde stapsgewijze uitleg van het proces:

  1. Dataset-acquisitie
    De dataset is verzameld uit MarkerDB 2.0, een zorgvuldig samengestelde database van moleculaire biomarkers.
  2. Datavoorverwerking
    Dit zorgt voor datakwaliteit en consistentie door nulwaarden en ontbrekende vermeldingen te verwerken, categorische features te coderen met LabelEncoder en numerieke features (bijv. entrez_gene_id) te schalen met StandardScaler.
  3. Feature-engineering
    Het selecteren van relevante kenmerken die de biomarkerclassificatie beïnvloeden, datalekken voorkomen en de modelprestaties verbeteren, wordt aanbevolen.
  4. Modelontwikkeling
    De gebruikte benaderingen zijn Logistic Regression, Random Forest, XGBoost, terwijl in DL: MLP, MLP met LR Scheduler, AutoInt, TabNet. De uitgevoerde activiteiten zijn hyperparameterafstemming, kruisvalidatie en optimalisatie voor classificatietaken.
  5. Datasplitsing
    Hier wordt de trainingsset (80%) gebruikt om modelparameters te leren, en de testset (20%) wordt gebruikt om het model te evalueren op onzichtbare data. In de laatste fase worden evaluatie-metrics gebruikt om ervoor te zorgen dat prestaties holistisch worden gemeten, vooral in onevenwichtige klassenscenario's.

figure-protocol-1
Figuur 1: Stroomdiagram van het voorgestelde werk. De workflow van het voorgestelde probleem wordt in deze figuur weergegeven. De stappen zijn data-preprocessing, feature engineering, modelontwikkeling, splitsing, modelevaluatie met behulp van metrics en biomarker-analyse. Klik hier om een grotere versie van deze figuur te bekijken.

2. Datasetbeschrijving

De naam van de dataset is all_sequence_variants met de csv-extensie. Er zijn kolommen met namen als 'id', 'variation', 'position', 'external_link', 'gene_symbol', 'entrez_gene_id', 'reference', conditions', 'indication_types', waarbij allemaal objecttype zijn behalve id als int-type en entrez_gene_id als float-type. Het totale aantal rijen is 42818 met 9 kolommen. Bovendien bevat de dataset nulwaarden voor variatie, positie, external_link, entrez_gene_id, referentie, condities en indication_types. De dataset is afkomstig van de link gegeven als: https://markerdb.ca/downloads17

3. Dataset-preprocessing

In deze fase begint de voorverwerking van data met het verzamelen van dataset-informatie, beschrijvingen, het identificeren van duplicaten en het lokaliseren van ontbrekende/nul waarden. Er is geen impact van het external_link kenmerk wanneer het wordt gemeten met de correlatiecoëfficiënt, en daarom wordt het verwijderd. De nulwaarden van categorische en numerieke kolommen worden respectievelijk gevuld met de mediaan en het gemiddelde. Ten slotte is de vorm van input en output in de dataset (42787, 6)(42787,). De invoerkolommen zijn 'id', 'variatie', 'positie', 'gene_symbol', 'entrez_gene_id', 'voorwaarden', terwijl de doelkolom indication_types is.

4. Biomarkers: Categorieën, data-uitdagingen en de rol van moleculair risico

Een biomarker is een kwantificeerbare eigenschap die ofwel normale of abnormale biologische activiteiten of reacties op verschillende blootstellingen of interventies aangeeft. Biomarkers kunnen moleculair, histologisch, radiografisch of fysiologisch van aard zijn en zijn onderverdeeld in zeven primaire categorieën: (1) Een diagnostische biomarker bepaalt of een individu een specifieke ziekte of aandoening heeft en of deze binnen een subtype valt, (2) Een monitoringbiomarker geeft de progressie van een ziekte en de respons op behandeling aan, (3) Een responsbiomarker geeft aan of een patiënt reageert op een medicijn of therapie, zoals een verandering in hartslag, (4) Een voorspellende biomarker kan vaststellen of iemand risico loopt op het ontwikkelen van een bepaalde ziekte en hoe hij of zij kan reageren op een bepaalde behandeling, (5) Een prognostische biomarker kan inzicht geven in de kans op ziekteprogressie of terugkeer als een patiënt vatbaar is voor een specifieke gezondheidsuitkomst, (6) Een risicobiomarker beoordeelt het potentiële risiconiveau voor een aandoening voordat een patiënt een officiële diagnose krijgt, en (7) Een veiligheidsbiomarker beoordeelt het potentieel voor toxische of bijwerking die kunnen ontstaan door behandeling. Deze studie richt zich voornamelijk op de analyse van moleculaire biomarkers die verband houden met risicobeoordeling en diagnostiek, zoals weergegeven in Figuur 2. Gezien de enorme hoeveelheid klinische data die wereldwijd beschikbaar is, zijn biomarkers essentieel voor het sturen van klinische beslissingen, het bevorderen van onderzoek en het faciliteren van gepersonaliseerde geneeskunde.

figure-protocol-2
Figuur 2: Biomarkercategorie voor klinische besluitvorming. De beslissingen van de biomarker worden in dit diagram weergegeven. Op basis van de analyses die op de biomarkers worden toegepast, worden klinische beslissingen genomen en worden ML-algoritmen geïmplementeerd. Klik hier om een grotere versie van deze figuur te bekijken.

Het vinden en begrijpen van klinisch bruikbare biomarkerinformatie is een uitdaging vanwege het grote scala aan typen, kenmerken en kwaliteit van biomarkers. De snelle groei van biomarkerstudies in de afgelopen twee decennia heeft de toegang tot uitgebreide en actuele gegevens, vooral voor moleculaire biomarkers, verder bemoeilijkt. Dit heeft geleid tot problemen zoals inconsistente bevindingen, het herontdekken van bestaande biomarkers, tegenstrijdige resultaten en over het hoofd geziene kansen omgevestigde biomarkers te benutten. De opkomst van "omics"-metingen heeft dit probleem verergerd, wat heeft geleid tot een proliferatie van nieuwe moleculaire biomarkers in klinische tests en de literatuur, waardoor het steeds moeilijker wordt om biomarkerkennis effectief te navigeren en toe te passen19.

MarkerDB 2.0 biedt toegang tot diverse moleculaire biomarkers voor experimentele doeleinden20. Verschillende biomarkers worden gebruikt in klinisch onderzoek en gezondheidszorgtoepassingen om ziekten te diagnosticeren, voorspellen en monitoren. Onder deze eiwitbiomarkers gebruiken biofluiden zoals serum, bloed, cerebrospinaal vocht (CSF), peritoneale vloeistof, vruchtwater, plasma en urine om aandoeningen zoals diabetes mellitus, tuberculose, het syndroom van Down en myopathie-gerelateerde aandoeningen te analyseren. Evenzo gebruiken genetische biomarkers gensymbolen zoals LRP1, LPP, MAPT en SPI1 om aandoeningen te analyseren zoals leeftijdsgebonden maculadegeneratie, allergische ziekten, de ziekte van Alzheimer, kanker en astma. Bovendien helpen multimodale moleculaire biomarkers het patiëntrisico en diagnostische indicatoren te meten21. Dit werk benadrukt de noodzaak van gezondheidszorganalyse met ML-benaderingen om ziektediagnose, voorspelling en gepersonaliseerde behandeling te verbeteren.

5. Modellering van statistische ML-benaderingen voor biomarkerontdekking

De toepassing van ML-benaderingen heeft de gezondheidszorg op tal van manieren getransformeerd. Specifiek zijn moleculaire biomarkers geanalyseerd met behulp van diverse ML-technieken, waaronder Principal Component Analysis (PCA), K-means clustering (KMA), Nearest Neighbor Analysis (NNA) en neurale netwerkalgoritmen22. Deze modellen identificeren ingewikkelde patronen uit gekozen kenmerken, beheren onvolledige of inconsistente data en ondersteunen realtime tracking van ziekteverloop. Naast het diagnosticeren van ziekten bieden ML-algoritmen belangrijke inzichten in patiëntkwesties door data-analyse en visualisatie, waardoor snelle en gerichte zorg mogelijk is23. Hierdoor verbetert dit de gezondheidsuitkomsten van patiënten in bijzondere omstandigheden. Bovendien wordt het vermogen van ML om biomarkerontdekking en therapeutische resultaten over verschillende ziekten, waaronder de analyse van moleculaire biomarkers, te revolutioneren.

ML-algoritmen worden ingedeeld in vijf hoofdtypen, zoals weergegeven in Figuur 3. Supervised learning is het proces van trainen op gelabelde datasets om input-outputrelaties te begrijpen, waardoor het ideaal is voor taken zoals classificatie en regressie, zoals beslissingsbomen en ondersteunende vectormachines. Ongecontroleerd leren identificeert patronen binnen niet-gelabelde data en wordt vaak toegepast voor clustering en dimensionaliteitsreductie, met technieken zoals k-means clustering en principal component analysis. Semi-supervised learning voegt zowel gelabelde als niet-gelabelde data samen om voorspellingen te genereren. Reinforcement learning richt zich op besluitvorming gebaseerd op feedback uit de omgeving, en wordt vaak gebruikt in gaming en robotica, met methoden zoals Q-learning en deep reinforcement learning-netwerken. Deep learning maakt gebruik van kunstmatige neurale netwerken met meerdere lagen om ingewikkelde patronen in data te identificeren. Deze techniek helpt bij het voorspellen van biomarkers voor veelvoorkomende ziekten, waaronder kanker, beroerte, de ziekte van Alzheimer en de ziekte van Parkinson. Talrijke klinisch goedgekeurde toepassingen maken gebruik van deze technologie24,25. De precieze diagnose van patiënten met kwaadaardige tumoren hangt doorgaans af van de verworven en pathologische analyse van weefselmonsters, die cruciale informatie opleveren over histologische graad, subtype, stadium en diverse andere tumorbiomarkers.

figure-protocol-3
Figuur 3: Categorisering van machine learning-algoritmen voor klinische besluitvorming. De typen ML-algoritmen in het diagram worden geïllustreerd om het toegepaste methodologium beter te begrijpen. Klik hier om een grotere versie van deze figuur te bekijken.

Statistiek en ML zijn twee aparte disciplines die vaak samenkomen. Statistiek omvat het verzamelen, analyseren en interpreteren van data, meestal met kleinere, goed gedefinieerde datasets, en richt zich voornamelijk op het vergelijken en samenvatten van informatie. ML daarentegen is een subset van kunstmatige intelligentie die voorspellende modellen creëert, vaak gericht op grote en complexe datasets. Hoewel statistiek een belangrijke rol speelt bij bevestigend onderzoek en het begrijpen van onderliggende mechanismen, is ML effectiever in verkennend onderzoek, het ontdekken van complexe patronen en het beheren van ontbrekende data. Methoden zoals logistische regressie kunnen worden beschouwd als zowel statistische modellen als supervised ML-modellen, wat de vage verschillen tussen de twee domeinen illustreert. Uiteindelijk moeten onderzoekers hun onderzoeksdoelstellingen en de aard van hun data evalueren om de meest geschikte methode te kiezen.

6. Modellering van MLP en varianten van MLP

MLP, ook bekend als een multilayer perceptron, is een type neurale netwerkarchitectuur met meerdere neuronlagen tussen de invoer- en uitvoerlagen, zoals geïllustreerd in Figuur 4. MLP werd geïntroduceerd in de jaren 1950 en kreeg brede toepassing door de vooruitgang en vooruitgang in backpropagation in de jaren 1980, wat hielp het verlies te minimaliseren. De basisprincipes van MLP zijn neurale netwerken, gewichten en biaswaarden voor het berekenen van de output. Ten slotte om de activatiefunctie en drempelwaarde te kennen om de output in de outputlaag te krijgen. In de voorgestelde methodologie komen de knooppunten in de inputlaag, verborgen laag en outputlaag overeen met klinische en genkenmerken, volledig verbonden lagen met ReLU-activatie, en een enkele neuron met sigmoidactivatie om respectievelijk de binaire uitkomst van indicatietype (Risico, Diagnostisch) te voorspellen. De belangrijkste voordelen zijn dat ze eenvoudig te trainen en te interpreteren zijn. De eenvoudige MLP kan echter geen grote datasets verwerken en is gevoelig voor de leersnelheidvan 26. Daarom wordt MLP met Learning Rate Scheduler overwogen om deze nadelen te overwinnen met de architectuur die in Figuur 3B wordt gegeven. MLP met LR is een krachtig dynamisch mechanisme met steile verval, exponentiële verval, inverse tijdsverval, ReduceLROnPlateau en cosinus-annealing. In plaats van een vaste LR-waarde verandert de leersnelheid op basis van de modelprestaties en training.

figure-protocol-4
Figuur 4: Modellering van meerlagige Perceptron en MLP met een LR-scheduler. (A) Multi-Layer Perceptron: De structuur van MLP wordt geïllustreerd met Input Layer, Hidden Layer en Output Layer. De eerste laag ontvangt de input en verwerkt deze in de tweede laag met activaties, en de output wordt ontvangen in de laatste laag. MLP is eenvoudig te implementeren. (B) MLP met LR Scheduler: Dit lijkt op MLP; er wordt echter een Learning Rate Scheduler toegevoegd om de trainingssnelheid te regelen voor een betere convergentiesnelheid. Het leertempo is op een plateau afgenomen. Dit vermindert de minima van overschrijdingen. Klik hier om een grotere versie van deze figuur te bekijken.

Deze aanpak is efficiënter, betrouwbaarder en effectiever voor tabelgegevens. Daarnaast zijn er voordelen zoals stabiele convergentieverbetering op ruisachtige data, verbeterde generalisatie en minder inspanning bij hyperparameterafstemming. Voor sommige voorspellingstaken kunnen er echter moeilijkheden ontstaan, zoals vast komen te zitten in lokale minima. Bovendien worden in de brede en diepe MLP-architectuur zoals gepresenteerd in Figuur 5 brede en diepe componenten geïntroduceerd in de MLP om uit te blinken in correlatiemapping, het onthouden van regels en het leren van nieuwe patronen, terwijl hoge standaarden van generalisatie behouden blijven. Door deze aspecten te combineren tot de uitvoerlaag, wordt de binaire uitvoervoorspeld met 27. Er zijn echter beperkingen aan het generaliseren van onzichtbare kenmerken en overgeneralisatie. Samenvattend wordt MLP met batchnorm en uitval gebruikt om het trainingsproces te normaliseren, waarbij uitval wordt geïntegreerd voor het leren en wordt generaliseerd van onbekende attributen. Deze techniek kan met name worden toegepast op hoogdimensionale data en helpt overfitting te voorkomen. Desalniettemin heeft deze techniek last van beperkingen in batchgrootte, een verhoogd geheugenverbruik (door Batch Normalization-lagen) en is het geen universele oplossing28,29.

figure-protocol-5
Figuur 5: Modellering van MLP-breed en diep netwerk. Het diagram illustreert het diepe pad van de MLP, dat niet-lineaire relaties kan vastleggen en de output combineert met een sigmoid-eenheid voor classificatie. Deze architectuur legt patroonleer en kennis vast voor heterogene biomarkergegevens. Klik hier om een grotere versie van deze figuur te bekijken.

7. TabNet

De TabNet is een deep learning-model dat bekend staat als Tabular Network, ontwikkeld door het Google Research-team30. De belangrijkste motivatie van het TabNet-model is het overbruggen van verschillen tussen de DL-benaderingen voor beeld-, tekst-, spraak- (CNN, Autoencoder, Transformers) en boomgebaseerde ML-benaderingen (XGBoost, Random Forest, LightGBM). Bovendien hebben de beperkingen van DL-benaderingen een enorme impact op het TabNet-model, waarbij MLP een geparametriseerd model is. Bovenal ontbreekt het aan interpretatie van DL-benaderingen bij echte problemen, zelfbegeleid leren en sequentiële leercapaciteit31. De TabNet-modellen zijn beperkt tot toepassingen zoals verzekeringsrisicovoorspelling32, schatting van steenkoolasgehalte33, voorspelling van chemische toxiciteit34 en detectie van fraude in educatieve tests35. De architectuur van TabNet is weergegeven in Figuur 6.

figure-protocol-6
Figuur 6: Modellering van een tabulair netwerk. Het Tabulaire netwerk neemt invoerfuncties in een tabelformaat en past de transformatortechniek op een sequentiele manier toe in elk blok. Het GU-blok, ook wel het Gated Linear Unit-blok genoemd, regelt de informatiestroom door het netwerk, wat de selectie van functies en stabiel leren vergemakkelijkt. De output wordt in de outputlaag gepresenteerd uit de geaccumuleerde output. Klik hier om een grotere versie van deze figuur te bekijken.

Uit het bovenstaande architectuurdiagram is het systeem verdeeld in vier componenten: Inputblok, Shared Feature Transformer, Sequentiële Beslissingsstappen en de verliesberekening met behulp van optimalisatie. In de categorische kenmerken worden de kenmerken omgezet naar gehele getallen na de inbeddinglaag. Tegelijkertijd worden de continue kenmerken genomen zoals ze zijn. Ten slotte worden de features omgezet in een uniforme featurevector waarbij x ∈ Rd. In de volgende stap worden volledig verbonden lagen met activatiefuncties geïmplementeerd, gevolgd door een transformatie om de data om te zetten in een vector, en wordt een beslissing genomen. In de derde stap worden de aandachtstransformator, maskering, beslissingstransformator en voorspellingsaccumulatie achtereenvolgens gebruikt. De doelstellingen van deze stap zijn selectieve aandacht, sequentiële redenering en beslissingspaden. In de laatste stap worden binaire kruisentropie of vergelijkbare methoden gebruikt om het verlies te vinden en de waarde te optimaliseren. Verder wordt regularisatie uitgevoerd met spaarzame aandacht om overfitting te voorkomen.

8. AutoInt

Automatisch Feature Interaction Learning via Self-Attendentive Neural Networks (AutoInt) is de volledige vorm van AutoInt, geïntroduceerd in Click-through rate (CTR) voorspelling36 en later toegepast op diverse toepassingen, waaronder softwaredefectvoorspelling37, aanbevelingssystemen38 en genoomdetectie39. Er zijn beperkingen in de bestaande ML-benaderingen, waaronder het omgaan met hoogdimensionale, spaarzame data, combinatorische kenmerken van hogere orde, het begrijpen van de voorspellingsmogelijkheden van de eigenschap en de noodzaak van handmatige feature-engineering. Al deze genoemde uitdagingen worden door het AutoInt-model aangepakt met efficiëntie, effectiviteit en uitlegbaarheid. Het doel van AutoInt in de voorgestelde methodologie is te voorspellen of de gegeven variant van een risico- of diagnostisch indicatietype is. Er zijn zeven stappen voorgesteld voor de gegeven dataset, zoals weergegeven in Figuur 6, samen met de broncode. Ten eerste worden het lezen van data en het voorverwerken geïmplementeerd om alle categorische kenmerken als gehele getallen te coderen en de labels te mappen naar 0 en 1 voor respectievelijk Risico en Diagnostisch. In de tweede stap wordt feature-representatie uitgevoerd om de embedding-matrix te creëren; op zijn beurt wordt de matrix omgezet om de numerieke kenmerken te normaliseren. Er zijn interactieve lagen waarbij de neutrale automatische interactie tussen de kenmerken wordt geleerd zonder handmatige interactie met de transformatoren. Bovendien leren meerdere hoofden verschillende soorten interacties, en uiteindelijk worden de kenmerken samengevoegd, wat de representatie versterkt. Residuele verbindingen zijn aanwezig om zowel lagere als hogere orde interacties te leren, zoals 1 kenmerk, 2 kenmerken, 3 kenmerken, enzovoort. Ten slotte worden vanuit het residuele netwerk de uitvoer doorgegeven aan de sigmoidfunctie voor binaire waardeberekeningen, zoals weergegeven in Figuur 7.

figure-protocol-7
Figuur 7: Modellering van het AutoInt-netwerk. Het AutoInt-netwerk leert automatisch features, waarbij de embedding-laag de features neemt en ze in de volgende laag omzet met behulp van een zelf-aandacht mechanisme en residuele verbindingen. De laatste component bevat de MLP-laag en activatiefuncties om de output te produceren. Klik hier om een grotere versie van deze figuur te bekijken.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De experimenten worden uitgevoerd met ML- en DL-benaderingen om hun prestaties te vergelijken. Tegelijkertijd wordt overwogen om ML-modellen te creëren die zowel begeleide als ongecontroleerde leermechanismen gebruiken. De begeleide technieken die in deze methodologie worden gebruikt zijn Logistic Regression, Decision Tree, Random Forest, Gradient Boost, Support Vector Machine en K-Nearest Neighbor algoritmen. Deze algoritmen variëren van eenvoudige statistische modellen tot complexe boo...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Het voorgestelde werk bespreekt duidelijk het belang van biomarkers bij de identificatie en monitoring van een ziekte en haar kenmerken. De voorgestelde aanpak voor biomarkermethodologie is gebaseerd op vier essentiële stappen: zorgvuldige gegevensvoorbereiding (schoonmaken, coderen, identificeren elimineren); uniforme doelcodering (Risk=0, Diagnostic=1); normalisatie van features en hoogwaardige deep embedding voor modellen zoals AutoInt37/TabNet; en een solide i...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs hebben niets te onthullen.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs ontvingen geen externe financiering.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
AutoInt ModelPeking Universityhttps://github.com/shichence/AutoIntAutomatisch leren van functie-interacties via zelf-attentieve neurale netwerken: Efficiënt algoritme om automatisch hogere-orde functie-interacties te leren voor (sparse) categorische en numerieke kenmerken
deepctr_torch.modelsOpen sourcehttps://github.com/shenweichen/DeepCTR-TorchModulair en uitbreidbaar pakket van op deep learning gebaseerde CTR-modellen om eenvoudig een eigen aangepast model te bouwen.
Google ColaboratoryGooglehttps://colab.research.google.com/Cloud-gebaseerde  omgeving om Python-code via de browser te schrijven en uit te voeren voor machine learning, gegevensanalyse
Keras 2.6.0Kerashttps://keras.io/Biedt een Python-interface voor het uitvoeren van neurale netwerken die bovenop Tensorflow draaien
MarkerDB 2.0MarkerDBhttps://markerdb.ca/downloadsPubliek beschikbare database van moleculaire biomarkers
Matplotlib 3.4.3Matplotlib https://matplotlib.org/Visualisatiebibliotheek voor python
Numpy 1.21.4Numpyhttps://numpy.org/Fundamenteel pakket voor wetenschappelijk rekenen met Python
Pandas 1.3.4Pandashttps://pandas.pydata.org/Krachtige, flexibele en eenvoudig te gebruiken open source tool voor gegevensanalyse en -manipulatie gebouwd op de Python-programmeertaal.
Python 3.8.10Python Software Foundationhttps://www.python.org/Populair programmeertaal die deep learning-systemen effectiever integreert.
pytorch_tabnet.tab_modelPytorchhttps://pypi.org/project/pytorch-tabnet/Voor het implementeren van binaire/meervoudige classificatie- en regressieproblemen.
Scikit-learnScikit-learnhttps://scikit-learn.org/stable/Python-module voor machine learning-algoritmen
SeabornSeabornhttps://seaborn.pydata.org/High-level datavisualisatiebibliotheek voor het tekenen van aantrekkelijke en informatieve statistische grafieken
TabNet ModelGooglehttps://github.com/dreamquark-ai/tabnetTabNet is een end-to-end neurale netwerk ontworpen om tabelgegevens direct te verwerken
Tensorflow 2.6.0Googlehttps://www.tensorflow.org/Een end-to-end platform voor machine learning

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Mollarasouli, F., Bakirhan, N. K., Ozkan, S. A. Introduction to biomarkers. The detection of biomarkers. , Academic Press. 1-22 (2022).
  2. Doroszkiewicz, J., Groblewska, M., Mroczko, B. Molecular biomarkers and their implications for the early diagnosis of selected neurodegenerative diseases. Int J Mol Sci. 23 (9), 4610(2022).
  3. Steyaert, S., et al. Multimodal data fusion for cancer biomarker discovery with deep learning. Nat Mach Intell. 5 (4), 351-362 (2023).
  4. DeGroat, W., et al. Multimodal AI/ML for discovering novel biomarkers and predicting disease using multi-omics profiles of patients with cardiovascular diseases. Sci Rep. 14 (1), 26503(2024).
  5. Myrou, A., Barmpagiannos, K., Ioakimidou, A., Savopoulos, C. Molecular biomarkers in neurological diseases: advances in diagnosis and prognosis. Int J Mol Sci. 26 (5), 2231(2025).
  6. Bansal, A., Shukla, A. K., Bansal, S. Machine learning methods for predictive analytics in health care. Proc IEEE Int Conf Syst Modeling Adv Res Trends. , 258-262 (2021).
  7. Adeghe, E. P., Okolo, C. A., Ojeyinka, O. T. A review of the use of machine learning in predictive analytics for patient health outcomes in pharmacy practice. OARJ Life Sci. 7 (1), 052-058 (2024).
  8. Mirabnahrazam, G., et al. Machine learning based multimodal neuroimaging genomics dementia score for predicting future conversion to Alzheimer's disease. J Alzheimers Dis. 87 (3), 1345-1365 (2022).
  9. Taj, F., Stein, L. D. MMDRP: drug response prediction and biomarker discovery using multimodal deep learning. Bioinform Adv. 4 (1), vbae010(2024).
  10. Lazaros, K., et al. Non-invasive biomarkers in the era of big data and machine learning. Sens. 25 (5), 1396(2025).
  11. Mathema, V. B., Sen, P., Lamichhane, S., Orešič, M., Khoomrung, S. Deep learning facilitates multi-data type analysis and predictive biomarker discovery in cancer precision medicine. Comput Struct Biotechnol J. 21, 1372-1382 (2023).
  12. Pearson, T. A., et al. Precision health analytics with predictive analytics and implementation research: JACC state-of-the-art review. JACC. 76 (3), 306-320 (2020).
  13. Parvin, N., Joo, S. W., Jung, J. H., Mandal, T. K. Multimodal AI in biomedicine: Pioneering the future of biomaterials, diagnostics, and personalized healthcare. Nanomaterials. 15 (12), 895(2025).
  14. Somepalli, G., Goldblum, M., Schwarzschild, A., Bruss, C. B., Goldstein, T. SAINT: Improved neural networks for tabular data via row attention and contrastive pre-training. arXiv. , (2021).
  15. Libbrecht, M. W., Noble, W. S. Machine learning applications in genetics and genomics. Nat Rev Genet. 16 (6), 321-332 (2015).
  16. Huang, S., Chaudhary, K., Garmire, L. X. More is better: Recent progress in multi-omics data integration methods. Front Genet. 8, 84(2017).
  17. Li, Y., Huang, C., Ding, L., Li, Z., Pan, Y., Gao, X. Deep learning in bioinformatics: introduction, application, and perspective in the big data era. Methods. 166, 4-21 (2019).
  18. Frangogiannis, N. G. Biomarkers: Hopes and challenges in the path from discovery to clinical practice. Transl Res. 159 (4), 197-204 (2012).
  19. Frantzi, M., et al. Omics-derived biomarkers and novel drug targets for improved intervention in advanced prostate cancer. Diagn. 10 (9), 658(2020).
  20. Jackson, H., et al. MarkerDB 2.0: A comprehensive molecular biomarker database for 2025. Nucleic Acids Res. 53, D1415-D1426 (2025).
  21. DeGroat, W., et al. IntelliGenes: A novel machine learning pipeline for biomarker discovery and predictive analysis using multi-genomic profiles. Bioinform. 39 (12), btad755(2023).
  22. Thelagathoti, R. K., et al. A hybrid sequential feature selection approach for identifying new potential mRNA biomarkers for Usher syndrome using machine learning. Biomol. 15 (7), 963(2025).
  23. Ng, S., Masarone, S., Watson, D., Barnes, M. R. The benefits and pitfalls of machine learning for biomarker discovery. Cell Tissue Res. 394 (1), 17-31 (2023).
  24. Chudzik, A., Śledzianowski, A., Przybyszewski, A. W. Machine learning and digital biomarkers can detect early stages of neurodegenerative diseases. Sens. 24 (5), 1572(2024).
  25. Chang, C. H., Lin, C. H., Lane, H. Y. Machine learning and novel biomarkers for the diagnosis of Alzheimer's disease. Int J Mol Sci. 22 (5), 2761(2021).
  26. Bzdo, D., Altman, N., Krzywinski, M. Statistics versus machine learning. Nat Methods. 15 (4), 233-234 (2018).
  27. Bikku, T. Multi-layered deep learning perceptron approach for health risk prediction. J Big Data. 7 (1), 50(2020).
  28. Smith, L. N. A disciplined approach to neural network hyper-parameters: part 1-learning rate, batch size, momentum, and weight decay. arXiv. , (2018).
  29. Kim, T. Generalizing MLPs with dropouts, batch normalization, and skip connections. arXiv. , (2021).
  30. Chen, G., Chen, P., Shi, Y., Hsieh, C. Y., Liao, B., Zhang, S. Rethinking the usage of batch normalization and dropout in the training of deep neural networks. arXiv. , (2019).
  31. Arik, S. Ö, Pfister, T. Tabnet: attentive interpretable tabular learning. Proc AAAI Conf Artif Intell. 35 (8), 6679-6687 (2021).
  32. Qamar, T., Bawany, N. Z. Understanding the black-box: towards interpretable and reliable deep learning models. PeerJ Comput Sci. 9, e1629(2023).
  33. McDonnell, K., Murphy, F., Sheehan, B., Masello, L., Castignani, G. Deep learning in insurance: accuracy and model interpretability using TabNet. Expert Syst Appl. 217, 119543(2023).
  34. Zhou, M., Wen, Z., Xu, G., Zhang, Z., Zhou, C. Deep learning with TabNet: Rapid coal ash content estimation via X-ray fluorescence. Int J Coal Prep Util. 45 (3), 523-547 (2025).
  35. Mustafa, F. M., et al. TabNet and TabTransformer: Novel deep learning models for chemical toxicity prediction in comparison with machine learning. J Appl Toxicol. , (2025).
  36. Zhen, Y., Zhu, X. An ensemble learning approach based on TabNet and machine learning models for cheating detection in educational tests. Educ Psychol Meas. 84 (4), 780-809 (2024).
  37. Song, W., et al. Autoint: Automatic feature interaction learning via self-attentive neural networks. Proc ACM Int Conf Inf Knowl Manage. , 1161-1170 (2019).
  38. Jadhav, S., Manikandan, S., Ryu, D. Enhancing the software defect prediction using AutoInt. IEEE Int Conf Big Data Smart Comput. , 103-104 (2025).
  39. He, H., Zhang, R., Zhang, Y., Ren, J. AAIN: Attentional aggregative interaction network for deep learning based recommender systems. Neurocomputing. 547, 126374(2023).
  40. Fan, Y., Waldmann, P. Tabular deep learning: A comparative study applied to multi-task genome-wide prediction. BMC Bioinform. 25 (1), 22(2024).
  41. Kanász, R., Drotár, P., Gnip, P., Zoričák, M. Clash of titans on imbalanced data: TabNet vs XGBoost. Conf IEEE Trans Artif. , 320-325 (2024).
  42. Hwang, Y., Song, J. Recent deep learning methods for tabular data. Commun Stat Appl Methods. 30 (2), 215-226 (2023).
  43. Gorishniy, Y., et al. TabR: Tabular deep learning meets nearest neighbors in 2023. arXiv. , (2023).
  44. Kalidindi, A., Arrama, M. B. A TabTransformer based model for detecting botnet-attacks on internet of things using deep learning. J Theor Appl Inf Technol. 101 (13), 5206-5218 (2023).
  45. Holzmüller, D., Grinsztajn, L., Steinwart, I. RealMLP: Advancing MLPs and default parameters for tabular data. ELLIS Workshop on Representation Learning and Generative Models for Structured Data. , (2025).
  46. Zhu, B., et al. Xtab: cross-table pretraining for tabular transformers. arXiv. , (2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Machine Learning BiomarkersMultimodal BiomarkersPredictive Health AnalyticsMolecular BiomarkersDisease MonitoringRisk AssessmentPatient StratificationDeep Learning TechniquesProtein BiomarkersGenetic Biomarkers

Related Articles