Ten manuskrypt zawiera obszerny przewodnik krok po kroku dotyczący integracji danych multiomicznych w badaniach biologicznych.
Integracja danych multiomicznych odnosi się do procesu łączenia i analizowania danych mierzonych na tym samym zestawie próbek biologicznych za pomocą różnych technologii omicznych, takich jak genomika, epigenomika, transkryptomika, proteomika, metabolomika, mikrobiomy, lipidomika i glikomika. Mimo że podejścia multiomiczne mają podobne cele jak analizy jednoblokowe lub jednotomiczne (na przykład opis, dyskryminacja, klasyfikacja lub przewidywanie), są one w stanie uchwycić szersze spektrum informacji molekularnych, zapewniając w ten sposób głębsze zrozumienie systemów biologicznych i ich złożonych interakcji. Rzeczywiście, połączenie zbiorów danych multi-omicznych umożliwia poprawę dokładności prognozowania i daje bardziej wiarygodne wyniki, zwłaszcza w przypadkach, gdy liczba dostępnych próbek jest ograniczona. Co więcej, również dzięki najnowszym osiągnięciom technik uczenia maszynowego, analizy multiomiczne są obecnie odpowiednie do odkrywania ukrytych wzorców i złożonych zjawisk powstających wśród różnych związków biologicznych.
Głównym celem tej pracy jest przedstawienie pełnego protokołu, który jest powszechnie stosowany w badaniach multiomicznych, od wstępnego sformułowania problemu do narzędzi przydatnych do biologicznej interpretacji wyników. W artykule szczegółowo opisano różne metody integracji danych multiomicznych, w tym podejścia oparte na konkatenacji (niskopoziomowe), transformacyjne (mid-level) i modelowe (high-level), a także podkreślono ich ograniczenia i zalety, a także przedstawiono ogólne narzędzia wizualizacyjne i diagnostyczne.