$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Il campo della ricerca biologica ha assistito a progressi significativi negli ultimi anni, in particolare nell'area delle tecnologie omiche. Queste tecnologie forniscono preziose informazioni sulla natura complessa dei sistemi biologici. Tuttavia, ogni tecnologia omica offre una prospettiva unica sui componenti biologici, richiedendo l'integrazione di dati multi-omici per ottenere una comprensione completa.
La multi-omica comprende varie classi di biomolecole che possono essere definite quantitativamente grazie all'avvento di nuove e potenti tecniche di sequenziamento ad alto rendimento. Tra i diversi tipi di tecnologie omiche ci sono la genomica, l'epigenomica, la trascrittomica, la proteomica, la metabolomica, la metagenomica, la lipidomica e la glicomica. La genomica prevede lo studio dei genomi di un organismo, mentre l'epigenomica si concentra sulla struttura di supporto del genoma, compresi i leganti di proteine e RNA, le strutture alternative del DNA e le modifiche chimiche sul DNA. La trascrittomica comprende lo studio di tutte le molecole di RNA, inclusi mRNA, rRNA, tRNA e altri RNA non codificanti. La proteomica prevede lo studio delle proteine, comprese le modifiche apportate a specifici gruppi di proteine. La metabolomica si concentra sull'insieme di piccole molecole (metaboliti) all'interno di una matrice biologica. La metagenomica prevede lo studio di comunità microbiche in habitat ben definiti con specifiche proprietà fisico-chimiche. La lipidomica comprende lo studio dell'intero complemento dei lipidi cellulari, mentre la glicomica si concentra sullo studio del glicoma, compresi i carboidrati e gli zuccheri1.
L'integrazione di dati multi-omici ha guadagnato una crescente attenzione nella comunità scientifica grazie al suo potenziale di svelare fenomeni biologici complessi. Combinando i dati provenienti da più tecnologie omiche, i ricercatori possono superare i limiti dei singoli set di dati e ottenere una visione più olistica dei sistemi biologici. Questo approccio integrato consente l'identificazione di nuovi biomarcatori, la scoperta di meccanismi di malattia e la delucidazione di intricati percorsi biologici.
Il numero di citazioni dei termini "Multiomica" e "Multi-omica" in PubMed è aumentato significativamente nel corso degli anni, passando da 307 nel 2018 a 1414 nel 2021 a 3933 nel 2023. L'integrazione di diversi tipi di variabili omiche sta diventando sempre più comune in quanto consente un'indagine più approfondita sui meccanismi alla base delle malattie e delle disfunzioni degli organismi. I singoli approcci omici forniscono una visione limitata e parziale della biologia nascosta, poiché si concentrano su un'unica prospettiva. Tuttavia, integrando i dati multi-omici, possiamo far luce sull'interazione di diverse biomolecole, comprendere le relazioni all'interno di più strati e colmare il divario tra genotipo e fenotipo. Nel complesso, gli approcci multi-omici possono aiutare a rispondere a domande importanti come la classificazione di diversi sottogruppi di malattie, la previsione di biomarcatori fondamentali associati alla malattia e l'acquisizione di una migliore comprensione dei percorsi e dei meccanismi biologici. Nelle sezioni seguenti, i diversi set di dati omici possono anche essere indicati come "visualizzazioni" di dati o "blocchi" di dati.
Le tecniche per l'integrazione multi-omica possono essere classificate in tre sottogruppi principali, come descritto da Reel et al. (2021)2 e Ritchie et al. (2015)3 (Figura 1).
Integrazione o concatenazione precoce di basso livello: questo approccio prevede la concatenazione di variabili da ogni singolo set di dati in un'unica matrice. Tuttavia, l'integrazione precoce non considera la distribuzione univoca di ciascun tipo di dati omici e può assegnare un peso maggiore a determinati tipi di dati omici con dimensioni maggiori. Pone anche sfide come un aumento del rischio di maledizione della dimensionalità, rumore aggiunto, variabili altamente correlate e problemi di scalabilità computazionale. Nonostante queste limitazioni, l'integrazione precoce consente l'identificazione di cambiamenti coordinati tra più strati omici e migliora l'interpretazione biologica.
Integrazione di livello medio, medio o basato sulla trasformazione: in questo approccio, i modelli di integrazione matematica vengono applicati ai molteplici livelli di dati omici. L'integrazione media si concentra sulla fusione di sottoinsiemi o rappresentazioni estratte dalle fonti. Due sotto-approcci all'interno dell'integrazione intermedia sono l'approccio middle-up e l'approccio middle-down. L'approccio middle-up prevede punteggi concatenati ottenuti dalla riduzione della dimensionalità su ciascun blocco, rendendolo adatto alla gestione di dati eterogenei. Tuttavia, potrebbe non essere interpretabile. L'approccio middle-down prevede la selezione delle variabili locali e la successiva analisi su sottoinsiemi di variabili concatenate, consentendo una più facile interpretazione dei modelli. L'integrazione media offre vantaggi quali un migliore rapporto segnale/rumore, una dimensionalità ridotta e una maggiore potenza statistica.
High-level, integrazione tardiva o model-based: questo approccio prevede l'esecuzione di analisi a ogni singolo livello omico e la combinazione dei risultati in modo ad-hoc. Include la fusione dei risultati di modelli a blocco singolo per identificare i biomarcatori da ciascuna fonte e fornire un'interpretazione congiunta dei risultati. L'integrazione tardiva non aumenta la dimensionalità dello spazio di input e funziona con la distribuzione univoca di ogni dato omico. È particolarmente appropriato quando uno strato omico è più predittivo di altri. Tuttavia, l'integrazione tardiva può trascurare le relazioni cross-omiche e affrontare sfide legate alla mancanza di comprensione delle connessioni tra i blocchi di dati iniziali e la potenziale perdita di informazioni biologiche attraverso la modellazione individuale.