Method Article

Analiza transkryptomiczna oparta na zbiorowych danych RNA-seq

DOI:

10.3791/69611

January 16th, 2026

* These authors contributed equally

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejszy protokół ustanawia kompletny pipeline do analizy procesu masowego RNA-seq od surowych danych do analizy wzbogacenia funkcjonalnego.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bezalkoholowa stłuszczona wątroba (NAFL) jest zwykle uważana za łagodne schorzenie; jednak gdy choroba przechodzi w niealkoholowe steato-wątroby (NASH), pacjenci są znacznie bardziej narażeni na rozwój końcowej choroby wątroby. Wiele badań próbuje wyjaśnić molekularny mechanizm leżący u podstaw przejścia z NAFL do NASH. Technologie sekwencjonowania o wysokiej przepustowości (takie jak RNA-seq w masie) pozwoliły badaczom uzyskać głębsze zrozumienie poprzez badanie transkryptomu, ujawnianie ekspresji cząsteczek, aktywacji szlaków sygnalizacyjnych oraz innych czynników związanych z postępem choroby. Dostępnych jest mnóstwo otwartych źródeł danych, które badacze mogą analizować w celu identyfikacji potencjalnych celów leczenia chorób. Jednak powiązane badania są ograniczone przez brak efektywnego i wiarygodnego procesu analizy transkryptomu w górnym zakresie. Tutaj dostępna jest wysoce powtarzalna i przyjazna dla użytkownika analiza upstream oraz powiązany potok analizy różnicowej genów, umożliwiający ustandaryzowane przetwarzanie i głęboką analizę danych prywatnych lub publicznych. Potok podzielony jest na cztery etapy: (1) kontrola jakości danych; (2) mapowanie genów; (3) różnicowa analiza genów; oraz (4) analizę funkcjonalną. Proces ten ma na celu odkrycie molekularnych mechanizmów transformacji choroby oraz wsparcie naukowców w przesiewaniu potencjalnych celów leków i podejść terapeutycznych poprzez analizę danych RNA-seq w całości.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niealkoholowa stłuszczeniowa choroba wątroby (NAFLD) jest najpowszechniejszą chorobą przewlekłej wątroby na świecie, dotykającą ponad jedną czwartą populacji. Jego częstość gwałtownie wzrosła w ostatnich dekadach 1,2,3. Rosnące obciążenie chorobą, zwłaszcza jej bardziej zaawansowaną formą, niealkoholowym steato-zapaleniem wątroby (NASH), stanowi poważne globalne wyzwanie zdrowotne i duże obciążenie ekonomiczne4. Pierwszym stadium NAFLD jest niealkoholowa stłuszczona wątroba (NAFL), któremu towarzyszą stany zapalne i włóknienie, które mogą przechodzić do NASH. Ten ostatni znacząco zwiększa ryzyko postępu do końcowego stadium choroby wątroby, w tym marskości wątroby i raka wątrobowokomórkowego (HCC)5,6,7. Częstość zachorowalności i śmiertelność HCC wiąże się ze wzrostem NASH 8,9, a oczekuje się, że NAFLD/NASH stanie się głównym wskazaniem do przeszczepu wątroby do 2030roku 10. Jednak postęp kliniczny NAFLD jest wysoce heterogeniczny, co poważnie utrudnia rozwój odpowiednich leków12, dlatego szczególnie ważne jest precyzyjne zbadanie mechanizmów molekularnych zaangażowanych w proces.

Zbiorowe pozyskiwanie informacji o składzie komórkowym oparte na RNA-sequ może znacząco wyjaśnić patogenezę różnych chorób. W ostatnich dekadach przeprowadzono liczne badania RNA-seq na organizmach modelowych i ludziach, aby wyjaśnić różnice w ekspresji genów w progresji NASH 13,14,15 oraz zidentyfikować nowe cele terapeutyczne do interwencji. Na podstawie analizy RNA-seq w całości, Xiong i in. stwierdzili, że komórki nieprzymięszowe (NPC) w wątrobie biorą udział w procesach takich jak tworzenie macierzy zewnątrzkomórkowej i adhezja komórek, które przyczyniają się do progresji NASH16. Li i in. wykazali, że białko skojarzające z guzem Wilmsa wątroby (WTAP) w hepatocytach reguluje nagromadzenie i stan zapalny pozamacizowanych lipidów, co sprzyja powstawaniu NASH17. Chociaż analiza RNA-seq w masie jest potężnym narzędziem do wyjaśniania mechanizmów NASH, jej wyniki są bardzo wrażliwe na jakość danych upstream. Heterogeniczność operacji eksperymentalnych i procesów analitycznych w górnym toku może poważnie osłabić wiarygodność danych, maskując prawdziwe informacje biologiczne i zakłócając dokładność kolejnych analiz. Dlatego ważne jest ustanowienie zestawu ustandaryzowanych procedur analizy w górnym zakresie.

W porównaniu z sekwencjonowaniem pojedynczokomórkowego RNA (scRNA-seq), RNA-seq objętościowy oferuje kilka wyraźnych zalet zarówno w projektowaniu eksperymentalnym, jak i praktycznym zastosowaniu. Chociaż scRNA-seq umożliwia identyfikację heterogeniczności komórkowej na poziomie pojedynczych komórek oraz precyzyjną analizę cech transkrypcji specyficznych dla typu komórek, wiąże się to z wysokimi kosztami, złożonymi wymaganiami dotyczącymi przetwarzania danych oraz ograniczoną czułością do wykrywania transkryptów o niskiej ilości.18. Dla porównania, RNA-seq objętości zapewnia większą głębokość sekwencjonowania, niższe koszty i większą przepustowość próbek, co czyni go szczególnie odpowiednim do analiz różnicowej ekspresji genów na poziomie populacji oraz do eksploracji mechanizmów molekularnych19. Dlatego w oparciu o ustandaryzowane procesy analityczne, RNA-seq objęte pozostaje efektywnym, opłacalnym i solidnym podejściem do badania molekularnych podstaw chorób złożonych.

Protokół ten został zaprojektowany specjalnie dla zbiorów danych RNA-seq pochodzących z tkanek ludzkich o wysokiej integralności RNA (RIN ≥ 7,0) i wystarczającej ilości RNA wejściowego (≥ 500 ng na próbkę). Aby zapewnić niezawodne wykonywanie kroków wyrównania i ilościfikacji, zaleca się lokalną stację roboczą wyposażoną w co najmniej 10-rdzeniowy procesor, 32 GB RAM oraz minimum 200 GB wolnej przestrzeni na dysku. Bazując na tych wymaganiach, protokół zapewnia efektywny i przyjazny dla użytkownika proces analityczny pracy, w tym szczegółowe instrukcje operacyjne oraz ustandaryzowane konfiguracje parametrów, aby sprostać potrzebom badaczy analizujących duże dane transkryptomiczne.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Do celów demonstracyjnych publicznie dostępny zbiór danych PRJNA1023502 opracowany przez Lan Bai i in. został wykorzystany do zilustrowania każdego etapu zarówno analiz w górnym, jak i dalszym ciągu20. Ponieważ ten zbiór danych pochodzi z otwartej bazy danych NCBI, nie są wymagane dodatkowe uprawnienia ani etyczne zgody. Zobacz Tabelę Materiałów , aby zweryfikować wszystkie wymagane wersje oprogramowania i pakietów R. Publicznie dostępny zbiór danych PRJNA1023502 zawiera 6 próbek nie-NASH, 6 NAFL oraz 6 NASH RNA-seq wątroby. W tym protokole zbiór danych został wykorzystany do demonstracji wszystkich etapów masowego workflow RNA-seq, w tym pobierania danych z bazy danych, kontroli jakości (fastp), wyrównania (HISAT2), ilościfikacji (featureCounts) oraz analiz różnicowych ekspresji i wzbogacania funkcjonalnych w dalszej fazie.

1. Instalacja zestawu narzędzi

  1. Odwiedź oficjalną stronę Toolkit i pobierz wersję 3.2.1.

2. Pobieranie danych publicznych

  1. Uzyskaj numer.
    1. Uzyskaj dostęp w dodatkuartykułu 20, sekcji Dostępność danych lub wyszukując słowa kluczowe w bazie danych NCBI.
    2. Wpisz prefetch w terminalu, aby go pobrać.

3. Generowanie macierzy liczenia genów

  1. Zdefiniuj ścieżki i ustawienia zgodnie z opisaniem poniżej:
    REFERENCE=~/reference/human/GRCh38/GRCh38.primary_assembly.genome.fa
    GTF=~/reference/human/GRCh38/gencode.v44.annotation.gtf
    INDEX=~/reference/human/GRCh38/GRCh38_index
    FASTQ_DIR=~/SRA_tutorial/fastq
    OUT_FASTP=~/RNAseq/fastp
    OUT_HISAT2=~/RNAseq/hisat2
    OUT_COUNTS=~/RNAseq/counts
    ​mkdir -p $FASTQ_DIR $OUT_FASTP $OUT_HISAT2 $OUT_COUNTS
    1. Pobierz ludzki referencyjny genom (pierwotny zespół GRCh38) oraz odpowiadający mu plik adnotacji genu (gencode.v44, kompleksowy zestaw adnotacji genów) z oficjalnej bazy danych GENCODE (https://www.gencodegenes.org/human/).
      for f in SRR*; do [[ ! $f =~ \.sra$ ]] && mv "$f" "$f.sra"; done
      ​for f in SRR*; do [[ ! $f =~ \.sra$ ]] && mv "$f" "$f.sra"; done
  2. Przemianuj pliki.
    1. Upewnij się, że wszystkie pliki używają rozszerzenia ., aby ułatwić dokładne rozpoznanie i przetwarzanie przez narzędzia dalsze.
    2. Wykonaj następujące polecenia:
      for f in SRR*; do [[ ! $f =~ \.sra$ ]] && mv "$f" "$f.sra"; done
  3. Wykonaj następujące polecenie, aby przekonwertować pliki na format FASTQ:
    for f in *.sra; do fasterq-dump "$f" --split-files -O $FASTQ_DIR - e 20; done
  4. Zbuduj indeks HISAT2 na podstawie genomu referencyjnego.
    hisat2-build $REFERENCE $INDEX
  5. Przetwarzaj pliki FASTQ z wizualnym monitorowaniem postępów.
    for fq in $FASTQ_DIR/*.fastq; do
    ​sample=$(basename "$fq" .fastq)
    1. Dla danych sekwencjonowania na końcach parowanych wykonaj następujące polecenie
      for fq1 in $FASTQ_DIR/*_1.fastq; do
      sample=$(basename "$fq1" _1.fastq)
      ​fq2=$FASTQ_DIR/${sample}_2.fastq
    2. Wykonaj kontrolę jakości i filtrowanie za pomocą fastp i wypisz wyniki do katalogu $OUT_FASTP. Dla danych sekwencjonowania jednokierunkowego wykonaj następujące polecenie:
      fastp \
      -i "${fq}" \
      -o $OUT_FASTP/${sample}.clean.fastq \
      -h $OUT_FASTP/${sample}.html \
      -j $OUT_FASTP/${sample}.json \
      -w 20

      Dla danych sekwencjonowania parowanego na końcu wykonaj następujące polecenie:
      fastp \
      -i "${fq}" \ -I "$fq2" \
      -o $OUT_FASTP/${sample}_1.clean.fastq \
      -O $OUT_FASTP/${sample}_2.clean.fastq \
      -h $OUT_FASTP/${sample}.html \
      -j $OUT_FASTP/${sample}.json \
      ​-w 20
    3. Dla każdej próbki sprawdź raport HTML pod kątem wizualnej kontroli jakości oraz sprawdź raport JSON pod kątem ustrukturyzowanych metryk, w tym jakości odczytu, dystrybucji GC, redundancji odczytu i zanieczyszczenia adapterów. Upewnij się, że wszystkie próbki spełniają następujące progi jakości: Q30 ≥ 85%, wskaźnik zanieczyszczenia adapterów < 5%, oraz brak nieprawidłowych wzorców GC. Przechowuj wszystkie pliki wyjściowe w katalogu $OUT_FASTP.
    4. Wykonaj wyrównanie sekwencji za pomocą HISAT2, wygeneruj pliki SAM i wyślij je do katalogu $OUT_HISAT2. Dla danych sekwencjonowania jednokierunkowego wykonaj następujące polecenie:
      hisat2 -p 20 \ -x $INDEX \-U $OUT_FASTP/${sample}.clean.fastq \
      -S $OUT_HISAT2/${sample}.sam

      Dla danych sekwencjonowania parowanego na końcu wykonaj następujące polecenie:
      hisat2 -p 20 \-x $INDEX \-1 $OUT_FASTP/${sample}_1.clean.fastq \
      -2 $OUT_FASTP/${sample}_2.clean.fastq \
      ​-S $OUT_HISAT2/${sample}.sam
    5. Wykonaj wyrównanie HISAT2 odczytów filtrowanych jakościowo do ludzkiego genomu referencyjnego, używając indeksu zbudowanego z pliku FASTA z pierwotnego zespołu GRCh38. Udostępnij przykładowe polecenia zarówno dla sekwencjonowania jednokierunkowego, jak i sparowanego.
    6. Przekonwertuj SAM na BAM, posortuj i indeksuj.
      samtools view -@ 20 -bS $OUT_HISAT2/${sample}.sam \
      | samtools sort -@ 20 -o $OUT_HISAT2/${sample}.sorted.bam
      samtools index $OUT_HISAT2/${sample}.sorted.bam
      ​done
    7. Wygeneruj plik SAM dla każdej próbki i przekonwertuj go na posortowany i zindeksowany plik BAM za pomocą SAMtools. Dla wysokiej jakości próbek transkryptomicznych u ludzi (integralność RNA, RIN ≥ 8,0), należy upewnić się, że ogólny wskaźnik dopasowania przekracza 85%; dla typowych masowych próbek RNA-seq (RIN ≥ 7,0) uznaje się wskaźniki dopasowania ≥ 70% za akceptowalne.
    8. Wykonaj kwantyfikację genów za pomocą featureCount.
      featureCounts -T 20 -p -s 0 \
      -a $GTF \
      -o $OUT_COUNTS /${sample}.counts.txt \
      $OUT_HISAT2/${sample}.sorted.bam
      Done
    9. Sprawdź plik wyjściowy z rozdzieleniem tabulatorów (*.counts.txt) oraz jego raport podsumowujący (*.counts.txt.summary) wygenerowany przez featureCounts dla każdej próbki. Zapewnić, że wskaźnik przypisania odczytu spełnia typowy próg ≥70% dla ludzkiego RNA-seq; Znacznie niższa szybkość może wskazywać na niedopasowaną orientację nici, problemy z adnotacjami lub słabą jakość wyrównania. Dla tego niespecyficznego dla wątku RNA-seq można użyć parametru -s 0. Dla bibliotek specyficznych dla pasm zastąp -s 0 z -s 1 lub -s 2 w poleceniu.
  6. Wygeneruj macierz liczb genów zgodnie z opisaniem poniżej.
    1. Zainicjalizuj macierz liczeń identyfikatorami genów i liczbami z pierwszej próbki.
      cut -f1 $(ls $OUT_COUNTS/*.counts.txt | head -1) > all_counts.txt
    2. Iteracyjnie dodawaj liczby z każdej próbki do jednej macierzy.
      for f in $OUT_COUNTS/*.counts.txt; do
      cut -f7 "$f" | paste all_counts.txt - > tmp && mv tmp
      all_counts.txt
      ​done
    3. Dodaj linię nagłówka z przykładowymi identyfikatorami do macierzy liczb.
      samples=$(ls *.counts.txt | sed 's/.counts.txt//' | paste -sd "\t")
      echo -e "Geneid\t$samples" | cat - all_counts.txt > counts_matrix.txt
    4. Wyodrębniaj długości genów z pliku GTF (suma długości eksonów na gen).
      awk '$3=="exon"{match($0,/gene_id "([^"]+)"/,a); if(a[1]!=""){len=$5-$4+1; gene_len[a[1]]+=len}} END{print "GENE_ID\tLENGTH"; for(g in gene_len) print g"\t"gene_len[g]}' \$GTF > gene_length.txt

4. Przetwarzanie macierzy surowej liczby i adnotacja genów

  1. Inicjalizacja i ładowanie odpowiedniego pakietu R w środowisku R.
    1. Użyj funkcji install.packages() do instalacji tidyverse, ggplot2, ggrepel, RColorBrewer, ggridges, FactoMineR. Pakiet tidyverse jest wykorzystywany do manipulacji danymi i wykresów; Pakiet GGplot2 jest wykorzystywany do wizualizacji; Pakiet Ggrepel jest używany do nienakładających się etykiet tekstowych; pakiet RColorBrewer jest stosowany do palet kolorów; Pakiet Ggridges jest stosowany do działek grzbietowych; pakiet FactoMineR jest wykorzystywany do analizy PCA i wielowariantowej.
    2. Użyj funkcji BiocManager::install() do instalacji biomaRt, DESeq2, clusterProfiler. Pakiet biomaRt jest wykorzystywany do adnotacji genów z Ensembl; pakiet DESeq2 jest wykorzystywany do analizy różniczkowej ekspresji; pakiet clusterProfiler jest wykorzystywany do analizy wzbogacania funkcjonalnego.
    3. Przeczytaj oryginalną macierz liczenia wygenerowaną w kroku 2, użyj biomaRt do odwzorowania identyfikatora Ensembl na nazwę genu HGNC do dalszej analizy, usuń zduplikowaną kolumnę Geneid i wygeneruj wyczyszczoną macierz liczników. Użyj oryginalnej macierzy liczeń (counts_matrix.csv) jako wejścia, z identyfikatorami genów Ensembl jako wierszami, a próbkami jako kolumnami. Zapisz macierz wyczyszczonych liczb jako wyjście (clean_counts_.csv), z symbolami genów HGNC jako wierszami, a próbkami jako kolumnami.
      mart <- useMart("ensembl", dataset = "hsapiens_gene_ensembl")
      id_map <- getBM(attributes = c("ensembl_gene_id", "hgnc_symbol"),
      filters = "ensembl_gene_id",
      values = exprSet$GeneID,
      mart = mart)
      exprSet <- exprSet %>%
      left_join(id_map, by = c("GeneID" = "ensembl_gene_id")) %>%
      filter(!is.na(hgnc_symbol), hgnc_symbol != "") %>%
      distinct(hgnc_symbol, .keep_all = TRUE) %>%
      column_to_rownames("hgnc_symbol")

5. Kwantyfikacja ekspresji genów

UWAGA: Szczegółowy scenariusz można znaleźć w Pliku Uzupełniającym 1 .

  1. Wykonaj następujące polecenie, aby obliczyć fragmenty na kilobazę transkrypcji na milion zmapowanych odczytów (FPKM) oraz transkrypcje na milion (TPM).
    counts <- read.csv("output/clean_counts_SRA.csv", header=TRUE, row.names=1)
    gene_len <- read.delim("data/gene_length.txt", header=FALSE, col.names=c("gene_symbol","length"))
    gene_len <- gene_len %>% distinct(gene_symbol, .keep_all=TRUE)
    rownames(gene_len) <- gene_len$gene_symbol
    gene_len <- gene_len[match(rownames(counts), gene_len$gene_symbol),]
    length_bp <- gene_len$length
    fpkm <- (counts / length_bp) * 1e9 / colSums(counts)
    write.csv(fpkm, "output/clean_fpkm_SRA.csv")
    tpm <- (counts / length_bp) / colSums(counts / length_bp) * 1e6
    write.csv(tpm, "output/clean_tpm_SRA.csv")

6. Grupowanie próbek i wizualizacja różnic

  1. Oceń jakość danych, analizując klasteryzację prób za pomocą PCA. Szczegółowy scenariusz można znaleźć w Pliku Uzupełniającym 1 .
  2. Do wizualizacji PCA użyj poniższego kodu.
    gene.pca <- PCA(exprSet, ncp = 2, scale.unit = TRUE, graph = FALSE)
    ggplot(pca_sample, aes(x = Dim.1, y = Dim.2)) +
    geom_point(aes(color = group)) +
    labs(x = paste('PC1:', pca_eig1, '%'),
    y = paste('PC2:', pca_eig2, '%'))

7. Analiza różniczkowych wyrażeń i wizualizacja wyników

UWAGA: Szczegółowy scenariusz można znaleźć w Pliku Uzupełniającym 1 .

  1. Wykonaj następujące polecenia, aby skonstruować zbiór danych DESeq2 i ustaw próg. Przed modelowaniem zachowano tylko geny o łącznej liczbie > 1 we wszystkich próbkach. Zidentyfikuj geny różnicowo ekspresyjne (DEG) za pomocą progów istotności skorygowanej wartości p < 0,05 oraz |log2FC| > 0.5.
    dds <- DESeq(DESeqDataSetFromMatrix(countData = exprSet, colData = colData, design = ~group)); sizeFactors(dds); res <- results(dds); dds <- dds[rowSums(counts(dds)) > 1,]
    dd1 <- results(dds, contrast = contrast, alpha = 0.05)
    dd2 <- lfcShrink(dds, contrast = contrast, res = dd1, type = "ashr")
  2. Wizualizuj geny o różnicowej ekspresji za pomocą wykresu wulkanu.
    ggplot(data = data, aes(x = log2FoldChange, y = -log10(padj))) +
    geom_point(aes(color = group), alpha = 1, size = 1.2) +
    geom_hline(yintercept = -log10(0.05), lty = 4) +
    geom_vline(xintercept = c(-0.5, 0.5), lty = 4) +
    geom_text_repel(data = subset(data, abs(log2FoldChange) >= 1.5 & padj < 0.05),
    aes(label = gene_id))

8. Przeprowadzanie analizy i wizualizacji wzbogacania funkcjonalnego

UWAGA: Szczegółowy scenariusz można znaleźć w Pliku Uzupełniającym 1 .

  1. Wizualizuj wyniki wzbogacania KEGG.
    EGG <- enrichKEGG(gene = gene$ENTREZID, organism = 'hsa',
    pvalueCutoff = 0.05, qvalueCutoff = 0.05)
    ggplot(symboldata, aes(richFactor, Description)) +
    geom_point(aes(color = p.adjust, size = Count))
  2. Wizualizuj wyniki wzbogacania GO. Dostosowuj wizualizację, modyfikując rozdzielczość łuku (n=500), mapowania kolorów oraz układ faset zgodnie ze specyfikacją eksperymentalną.
    ego <- enrichGO(gene = gene$ENTREZID, OrgDb = "org.Hs.eg.db", ont = "ALL",
    pvalueCutoff = 0.05, qvalueCutoff = 0.05, pAdjustMethod = "BH")
    ggplot(df) +
    ggforce::geom_link(aes(x = 0, y = Description, xend = -log10(p.adjust),
    yend = Description, color = ONTOLOGY), n = 500, show.legend = FALSE) +
    facet_wrap(~ONTOLOGY, scales = "free", ncol = 1)
  3. Wizualizuj wyniki analizy wzbogacania zestawu genów (GSEA). Dostosuj liczbę ścieżek, skalowanie gęstości i przezroczystość warstw, aby uwzględnić różne rozkłady wielkości efektów.
    genelist <- sort(res$log2FoldChange, decreasing = TRUE)
    names(genelist) <- rownames(res)
    hallmarks <- read.gmt('resource/h.all.v2023.2.Hs.symbols.gmt')
    y <- GSEA(genelist, TERM2GENE = hallmarks, pvalueCutoff = 0.05)
    gsearesult <- yd %>% arrange(desc(NES)) %>% slice_head(n = 10)
    ggplot(gsearesult, aes(x = logFC, y = Description, fill = -log10(pvalue))) +
    geom_density_ridges(alpha = 0.8, scale = 0.8) +
    geom_point(aes(size = abs(NES), x = -0.4, color = NES)) +
    scale_fill_distiller(palette = 'Spectral') +
    scale_color_distiller(palette = 'Reds') +
    scale_size_continuous(range = c(2, 6))

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Przepływ analizy upstream dla masowego RNA-seq został zilustrowany na Rysunku 1A. Ten workflow wykonuje kolejno następujące kluczowe kroki na platformie Linux: po pierwsze, rygorystyczna kontrola jakości surowych danych sekwencjonowania jest wykonywana za pomocą fastp, aby usunąć niskiej jakości odczyty i sekwencje adapterów; następnie HISAT2 dopasowuje wysokiej jakości odczyty do genomu referencyjnego, a Samtools konwertuje i sortuje pliki wyrównania; wreszcie FeatureCounts przeprowadza kwa...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Analiza danych RNA-seq w całości charakteryzuje się interdyscyplinarnym zadaniem integrującym genomikę, bioinformatykę, statystykę i informatykę. Pełny przepływ pracy analityczny obejmuje wiele etapów w górę i w dolnym kierunku, w tym wstępne przetwarzanie surowych danych, kontrolę jakości, wyrównywanie sekwencji, kwantyfikację na poziomie genów, normalizację danych, analizę różnicowej ekspresji oraz interpretację biologiczną. Wśród tych etapów szczególnie istotne jest dokładne przekształcenie surowych odczytów sekwencjo...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy deklarują, że nie mają żadnych konfliktów interesów.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy chcieliby podziękować opiekunom publicznie dostępnych baz danych wykorzystanych w tym badaniu.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
biomaRtBioconductor2.64.0Adnotacja genów z Ensembl
clusterProfilerBioconductor4.16.0Analiza wzbogacania funkcjonalnego
DESeq2Bioconductor1.48.1Analiza różniczkowa ekspresji
FactoMineRAgroParisTech2.11.0Analiza PCA i wielowymiarowa
fastpOpenGene1.0.1Kontrola jakości i filtrowanie danych FASTQ
Liczba cechDział Bioinformatyki, Instytut Badań Medycznych im. Waltera i Elizy Hallów2.0.0  Policz liczbę odczytów przypisanych do każdego genu w celu ilościowania ekspresji genów
ggplot2Pozycja3.5.2Wizualizacja danych
GgrepelKamil Slowikowski0.9.6Etykiety tekstowe nienakładające się
GgridgesClaus O. Wilke0.5.6Tworz działki grzbietowe
HISAT2Uniwersytet Johnsa Hopkinsa2.2.1Dopasuj filtrowane wysokiej jakości odczyty do genomu referencyjnego
RR Core Team 4.5.0Środowisko do obliczania, analizy i wizualizacji danych
RColorBrewerErich Neuwirth1.1.3Palety kolorów do wyznaczania wykresów
samtoolsStrumień pracy w genomice na dużą skalę1.22.0Konwertowanie i przetwarzanie plików SAM dla efektywnego odzyskiwania i dostępu
Zestaw narzędziNarodowe Centrum Informacji Biotechnologicznej3.2.1Pobierz i wstępnie przetwarzaj surowe dane sekwencjonowania z bazy danych NCBI

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Asrani, S. K., Devarbhavi, H., Eaton, J., Kamath, P. S. Burden of liver diseases in the world. J Hepatol. 70 (1), 151-171 (2019).
  2. Friedman, S. L., Neuschwander-Tetri, B. A., Rinella, M., Sanyal, A. J. Mechanisms of NAFLD development and therapeutic strategies. Nat Med. 24 (7), 908-922 (2018).
  3. Estes, C., Razavi, H., Loomba, R., Younossi, Z., Sanyal, A. J. Modeling the epidemic of nonalcoholic fatty liver disease demonstrates an exponential increase in burden of disease. Hepatol Baltim Med. 67 (1), 123-133 (2018).
  4. Younossi, Z. M., et al. The economic and clinical burden of nonalcoholic fatty liver disease in the United States and Europe. Hepatol Baltim Med. 64 (5), 1577-1586 (2016).
  5. Rinella, M. E. Nonalcoholic fatty liver disease: a systematic review. JAMA. 313 (22), 2263-2273 (2015).
  6. Hardy, T., Oakley, F., Anstee, Q. M., Day, C. P. Nonalcoholic Fatty Liver Disease: Pathogenesis and Disease Spectrum. Annu Rev Pathol. 11, 451-496 (2016).
  7. Geier, A., Tiniakos, D., Denk, H., Trauner, M. From the origin of NASH to the future of metabolic fatty liver disease. Gut. 70 (8), 1570-1579 (2021).
  8. Tan, D. J. H., et al. Clinical characteristics, surveillance, treatment allocation, and outcomes of non-alcoholic fatty liver disease-related hepatocellular carcinoma: a systematic review and meta-analysis. Lancet Oncol. 23 (4), 521-530 (2022).
  9. Ng, C. H., et al. Mortality Outcomes by Fibrosis Stage in Nonalcoholic Fatty Liver Disease: A Systematic Review and Meta-analysis. Clin Gastroenterol Hepatol Off Clin Pract J Am Gastroenterol Assoc. 21 (4), 931-939.e5 (2023).
  10. Yong, J. N., et al. Outcomes of Nonalcoholic Steatohepatitis After Liver Transplantation: An Updated Meta-Analysis and Systematic Review. Clin Gastroenterol Hepatol Off Clin Pract J Am Gastroenterol Assoc. 21 (1), 45-54.e6 (2023).
  11. Diehl, A. M., Day, C. Cause, Pathogenesis, and Treatment of Nonalcoholic Steatohepatitis. New Engl J Med. 377 (21), 2063-2072 (2017).
  12. Konerman, M. A., Jones, J. C., Harrison, S. A. Pharmacotherapy for NASH: Current and emerging. J Hepatol. 68 (2), 362-375 (2018).
  13. Gapp, B., et al. Farnesoid X Receptor Agonism, Acetyl-Coenzyme A Carboxylase Inhibition, and Back Translation of Clinically Observed Endpoints of De Novo Lipogenesis in a Murine NASH Model. Hepatol Commun. 4 (1), 109-125 (2020).
  14. Marcher, A. B., et al. Transcriptional regulation of Hepatic Stellate Cell activation in NASH. Sci Rep. 9 (1), 2324(2019).
  15. Govaere, O., et al. Transcriptomic profiling across the nonalcoholic fatty liver disease spectrum reveals gene signatures for steatohepatitis and fibrosis. Sci Transl Med. 12 (572), eaba4448(2020).
  16. Xiong, X., et al. Landscape of Intercellular Crosstalk in Healthy and NASH Liver Revealed by Single-Cell Secretome Gene Analysis. Mol Cell. 75 (3), 644-660.e5 (2019).
  17. Li, X., et al. Deficiency of WTAP in hepatocytes induces lipoatrophy and non-alcoholic steatohepatitis (NASH). Nat Commun. 13 (1), 4549(2022).
  18. Haque, A., Engel, J., Teichmann, S. A., Lönnberg, T. A practical guide to single-cell RNA-sequencing for biomedical research and clinical applications. Genome Med. 9 (1), 75(2017).
  19. Li, X., Wang, C. Y. From bulk, single-cell to spatial RNA sequencing. Int J Oral Sci. 13 (1), 36(2021).
  20. Bai, L., et al. Multispecies transcriptomics identifies SIKE as a MAPK repressor that prevents NASH progression. Sci Transl Med. 16, eade7347(2024).
  21. Pertea, M., Kim, D., Pertea, G. M., Leek, J. T., Salzberg, S. L. Transcript-level expression analysis of RNA-seq experiments with HISAT, StringTie and Ballgown. Nat Protoc. 11 (9), 1650-1667 (2016).
  22. Love, M. I., Huber, W., Anders, S. Moderated estimation of fold change and dispersion for RNA-seq data with DESeq2. Genome Biol. 15 (12), 550(2014).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Bulk RNA SeqTranscriptomic AnalysisDifferential Gene AnalysisFunctional AnalysisQuality ControlGene MappingNonalcoholic Fatty LiverSteatohepatitis ProgressionMolecular MechanismsDisease Biomarkers

Related Articles