Method Article

ניתוח טרנסקריפטומי המבוסס על נתוני RNA-seq בכמויות גדולות

DOI:

10.3791/69611

January 16th, 2026

* These authors contributed equally

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

הפרוטוקול הנוכחי קובע מסלול שלם לניתוח תהליך ה-RNA-seq המוני מנתונים גולמיים ועד ניתוח העשרה פונקציונלית.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

כבד שומני לא אלכוהולי (NAFL) נחשב בדרך כלל למצב שפיר; עם זאת, לאחר שהמצב מתקדם לדלקת כבד לא אלכוהולית (NASH), החולים ניצבים בפני סיכון מוגבר משמעותית לפתח מחלת כבד בשלב סופי. מחקרים רבים מנסים להבהיר את המנגנון המולקולרי שמאחורי המעבר מ-NAFL ל-NASH. טכנולוגיות ריצוף בתפוקה גבוהה (כגון RNA-seq בכמויות גדולות) סיפקו לחוקרים הבנה מעמיקה יותר על ידי בחינת הטרנסקריפטום, חשיפת ביטוי מולקולות, הפעלת מסלולי איתות וגורמים נוספים הקשורים להתקדמות המחלה. יש שפע של נתונים בקוד פתוח הזמין לחוקרים לנתח כדי לזהות מטרות פוטנציאליות לטיפול במחלות. עם זאת, מחקר קשור מוגבל בשל היעדר תהליך יעיל ואמין לניתוח במעלה הזרם של הטרנסקריפטום. כאן מסופק ניתוח מעלה וניתוח גנטי דיפרנציאלי קשור לשכפול וידידותי למשתמש, כדי להשיג עיבוד סטנדרטי וניתוח מעמיק של נתונים פרטיים או ציבוריים. הצינור מחולק לארבעה שלבים: (1) בקרת איכות של נתונים; (2) מיפוי גנים; (3) ניתוח גנים שונה; ו-(4) אנליזה פונקציונלית. תהליך זה נועד לחשוף את המנגנונים המולקולריים של טרנספורמציית מחלות ולסייע לחוקרים בסינון מטרות תרופות פוטנציאליות וגישות טיפוליות באמצעות ניתוח נתוני RNA-seq בכמויות גדולות.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחלת כבד שומני שאינה אלכוהולית (NAFLD) היא מחלת הכבד הכרונית השכיחה ביותר בעולם, המשפיעה על יותר מרבע מהאוכלוסייה. השכיחות שלו עלתה באופן דרמטי בעשורים האחרונים, 1,2,3. נטל המחלה הגובר, במיוחד הצורה המתקדמת יותר שלה, דלקת כבד לא אלכוהולית (NASH), מציבה אתגר בריאותי עולמי משמעותי ונטל כלכלי כבד. השלב הראשון של NAFLD הוא כבד שומני לא אלכוהולי (NAFL), שמלווה בדלקת ופיברוזיס שיכולים להתקדם ל-NASH. האחרון מעלה משמעותית את הסיכון להתפתחות למחלות כבד בשלב סופי, כולל שחמת כבד וקרצינומה כבדית (HCC)5,6,7. שכיחות ותמותת HCC קשורות לעלייה ב-NASH 8,9, וצפוי ש-NAFLD/NASH יהפוך לאינדיקטור המוביל להשתלת כבד עד 2030. עם זאת, ההתקדמות הקלינית של NAFLD היא הטרוגנית מאוד11, מה שמקשה מאוד על פיתוח התרופות הרלוונטיות12, ולכן חשוב במיוחד לחקור בדיוק את המנגנונים המולקולריים המעורבים.

רכישת מידע על הרכב תאי מבוססת RNA-seq בכמויות גדולות יכולה להבהיר משמעותית את הפתוגנזה של מחלות שונות. בעשורים האחרונים נערכו מחקרים רבים של RNA-seq באורגניזמים מודליים ובבני אדם כדי להבהיר הבדלים בביטוי גנים בהתקדמות NASH 13,14,15, במטרה לזהות מטרות טיפוליות חדשות להתערבות. בהתבסס על ניתוח RNA-seq בכמויות גדולות, Xiong ואחרים מצאו שתאים לא-פרנכימליים (NPCs) בכבד מעורבים בתהליכים כמו יצירת מטריצה חוץ-תאית והיצמדות תאים, התורמים להתפתחות NASH16. לי ועמיתיו הראו כי חלבון 1-אסוציאציה של גידול וילמס בכבד (WTAP) בכבד מווסת הצטברות ודלקת שומנים חוץ-רחמיים, ובכך מקדם את היווצרות NASH17. למרות שניתוח RNA-seq בכמויות גדולות הוא כלי עוצמתי להבהרת מנגנוני NASH, תוצאותיו רגישות מאוד לאיכות הנתונים העליונים. ההטרוגניות של פעולות ניסוי ותהליכי ניתוח במעלה הזרם עלולה לפגוע קשות באמינות הנתונים, ובכך להסתיר מידע ביולוגי אמיתי ולהפריע לדיוק הניתוחים הבאים. לכן, חשוב לקבוע סט של נהלי ניתוח סטנדרטיים במעלה הזרם.

בהשוואה לריצוף RNA חד-תאי (scRNA-seq), RNA-seq בכמויות גדולות מציע מספר יתרונות ברורים הן בתכנון ניסויים והן ביישומים מעשיים. בעוד ש-scRNA-seq מאפשר זיהוי הטרוגניות תאית ברמת התא היחיד ומאפשר ניתוח מדויק של תכונות שעתוק ספציפיות לסוג התא, הוא קשור לעלות גבוהה, דרישות עיבוד נתונים מורכבות ורגישות מוגבלת לזיהוי תמלילים בעלי שפע נמוך18. לעומת זאת, RNA-seq בכמויות גדולות מספק עומק ריצוף גבוה יותר, עלות נמוכה יותר וקצב דגימה גבוה יותר, מה שהופך אותו למתאים במיוחד לניתוחי ביטוי גנים שונים ברמת האוכלוסייה ולחקר מנגנונים מולקולריים19. לכן, כאשר מונחים על ידי זרימות עבודה אנליטיות סטנדרטיות, RNA-seq בכמויות גדולות נשאר גישה יעילה, חסכונית וחזקה לחקירת הבסיס המולקולרי של מחלות מורכבות.

פרוטוקול זה תוכנן במיוחד למאגרי נתונים של RNA-seq בכמויות גדולות שמקורם ברקמות אנושיות עם שלמות RNA גבוהה (RIN ≥ 7.0) וכמות RNA נכנסת מספקת (≥ 500 ng לדגימה). כדי להבטיח ביצוע אמין של שלבי יישור וכמות, מומלץ לבנות תחנת עבודה מקומית המצוידת בלפחות מעבד של 10 ליבות, 32 GB זיכרון RAM ומינימום של 200 GB של שטח דיסק פנוי. בהתבסס על דרישות אלו, הפרוטוקול מספק זרימת עבודה אנליטית יעילה וידידותית למשתמש, הכוללת הוראות תפעוליות מפורטות ותצורות פרמטרים סטנדרטיות, כדי לענות על צרכי החוקרים המנתחים נתוני טרנסקריפטומיה בקנה מידה גדול.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

למטרות הדגמה, מערך הנתונים הזמין לציבור PRJNA1023502 שנוצר על ידי לאן באי ואחרים שימש להמחשת כל שלב של ניתוחים מעלה ומורד הזרם20. מכיוון שמאגר נתונים זה מגיע ממאגר ה-SRA בגישה פתוחה של NCBI, אין צורך בהרשאות נוספות או אישורים אתיים. ראו את טבלת החומרים כדי לאמת את כל גרסאות התוכנה וה-R-package הנדרשות. מערך הנתונים הזמין לציבור כולל PRJNA1023502 6 דגימות שאינן NASH, 6 דגימות NAFL, ו-6 דגימות RNA-seq של כבד NASH. בפרוטוקול זה, מערך הנתונים שימש להדגמת כל שלבי תהליך ה-RNA-seq המרוכז, כולל שליפת נתונים ממסד הנתונים של SRA, בקרת איכות (fastp), יישור (HISAT2), כימות (featureCounts), וניתוחי הבעה דיפרנציאלית והעשרה פונקציונלית בהמשך הזרם.

1. התקנת ערכת כלים SRA

  1. בקרו באתר הרשמי של SRA Toolkit והורדו את גרסה 3.2.1.

2. הורדת נתונים ציבוריים

  1. קבל את מספר ה-SRA.
    1. ניתן לגשת אליו בתוספתמאמר 20, בסעיף זמינות הנתונים, או בחיפוש מילות מפתח במאגר הנתונים של NCBI SRA.
    2. הקלד prefetch <מספר SRA> בטרמינל כדי להוריד אותו.

3. יצירת מטריצת ספירת גנים

  1. הגדר מסלולים והגדרות כפי שמתואר להלן:
    REFERENCE=~/reference/human/GRCh38/GRCh38.primary_assembly.genome.fa
    GTF=~/reference/human/GRCh38/gencode.v44.annotation.gtf
    INDEX=~/reference/human/GRCh38/GRCh38_index
    FASTQ_DIR=~/SRA_tutorial/fastq
    OUT_FASTP=~/RNAseq/fastp
    OUT_HISAT2=~/RNAseq/hisat2
    OUT_COUNTS=~/RNAseq/counts
    ​mkdir -p $FASTQ_DIR $OUT_FASTP $OUT_HISAT2 $OUT_COUNTS
    1. הורד את הגנום האנושי (GRCh38 primary assembly) ואת קובץ ההערות הגנטי המתאים (gencode.v44, מערך האנוטציה הגנטי המקיף) מבסיס הנתונים הרשמי של GENCODE (https://www.gencodegenes.org/human/).
      for f in SRR*; do [[ ! $f =~ \.sra$ ]] && mv "$f" "$f.sra"; done
      ​for f in SRR*; do [[ ! $f =~ \.sra$ ]] && mv "$f" "$f.sra"; done
  2. שנה את שם קבצי ה-SRA.
    1. ודא שכל קבצי ה-SRA משתמשים בסיומת קובץ .sra כדי להקל על זיהוי ועיבוד מדויקים על ידי כלים במורד הזרם.
    2. בצע את הפקודות הבאות:
      for f in SRR*; do [[ ! $f =~ \.sra$ ]] && mv "$f" "$f.sra"; done
  3. בצע את הפקודה הבאה כדי להמיר קבצי SRA לפורמט FASTQ:
    for f in *.sra; do fasterq-dump "$f" --split-files -O $FASTQ_DIR - e 20; done
  4. בנה אינדקס HISAT2 מהגנום הרלוונטי.
    hisat2-build $REFERENCE $INDEX
  5. עבד קבצי FASTQ עם ניטור התקדמות ויזואלי.
    for fq in $FASTQ_DIR/*.fastq; do
    ​sample=$(basename "$fq" .fastq)
    1. לנתוני רצף בקצה זוגי, בצע את הפקודה הבאה
      for fq1 in $FASTQ_DIR/*_1.fastq; do
      sample=$(basename "$fq1" _1.fastq)
      ​fq2=$FASTQ_DIR/${sample}_2.fastq
    2. לבצע בקרת איכות וסינון באמצעות fastp ולהוציא את התוצאות לתיקיית $OUT_FASTP. לנתוני ריצוף חד-קצה, בצע את הפקודה הבאה:
      fastp \
      -i "${fq}" \
      -o $OUT_FASTP/${sample}.clean.fastq \
      -h $OUT_FASTP/${sample}.html \
      -j $OUT_FASTP/${sample}.json \
      -w 20

      לנתוני ריצוף בקצה זוגי, בצע את הפקודה הבאה:
      fastp \
      -i "${fq}" \ -I "$fq2" \
      -o $OUT_FASTP/${sample}_1.clean.fastq \
      -O $OUT_FASTP/${sample}_2.clean.fastq \
      -h $OUT_FASTP/${sample}.html \
      -j $OUT_FASTP/${sample}.json \
      ​-w 20
    3. לכל מדגם, בדקו את דוח ה-HTML לבקרת איכות ויזואלית והתייעצו עם דוח JSON למדדים מובנים, כולל איכות קריאה, הפצת GC, גיבוי קריאה וזיהום מתאמים. ודאו שכל הדגימות עומדות בספי האיכות הבאים: Q30 ≥ 85%, שיעור זיהום המתאם < 5%, ואין דפוסי GC חריגים. אחסן את כל קבצי הפלט בתיקיית $OUT_FASTP.
    4. בצע יישור רצפים באמצעות HISAT2, יצירת קבצי SAM ופלט אותם לתיקיית $OUT_HISAT2. לנתוני ריצוף חד-קצה, בצע את הפקודה הבאה:
      hisat2 -p 20 \ -x $INDEX \-U $OUT_FASTP/${sample}.clean.fastq \
      -S $OUT_HISAT2/${sample}.sam

      לנתוני ריצוף בקצה זוגי, בצע את הפקודה הבאה:
      hisat2 -p 20 \-x $INDEX \-1 $OUT_FASTP/${sample}_1.clean.fastq \
      -2 $OUT_FASTP/${sample}_2.clean.fastq \
      ​-S $OUT_HISAT2/${sample}.sam
    5. בצע יישור HISAT2 של הקריאות המסוננות באיכות לגנום הייחוס האנושי, באמצעות אינדקס שנבנה מקובץ FASTA הראשי של GRCh38. ספק פקודות לדוגמה הן לנתוני רצף חד-קצה והן לנתוני רצף בקצה הזוגי.
    6. המור SAM ל-BAM, מיין ואנדקס.
      samtools view -@ 20 -bS $OUT_HISAT2/${sample}.sam \
      | samtools sort -@ 20 -o $OUT_HISAT2/${sample}.sorted.bam
      samtools index $OUT_HISAT2/${sample}.sorted.bam
      ​done
    7. יצר קובץ SAM לכל דגימה והמיר אותו לקובץ BAM ממויין ומאונדקס באמצעות SAMtools. לדגימות טרנסקריפטומיות אנושיות איכותיות (מספר שלמות RNA, RIN ≥ 8.0), ודאו ששיעור היישור הכולל עולה על 85%; לדגימות RNA-seq נפוצות (RIN ≥ 7.0), יש לשקול שיעורי יישור ≥ 70% מקובל.
    8. בצע כימות גנים באמצעות featureCount.
      featureCounts -T 20 -p -s 0 \
      -a $GTF \
      -o $OUT_COUNTS /${sample}.counts.txt \
      $OUT_HISAT2/${sample}.sorted.bam
      Done
    9. בדוק את קובץ הפלט המוגדר בלשוניות (*.counts.txt) ואת דוח הסיכום שלו (*.counts.txt.summary) שנוצר על ידי featureCounts עבור כל דגימה. להבטיח שקצב הקצאת הקריאה עומד בסף הטיפוסי של ≥70% עבור RNA-seq בנפח אנושי; קצב נמוך בהרבה עשוי להעיד על כיוון לא תואם, בעיות בהערות או איכות יישור ירודה. השתמשו בפרמטר -s 0 עבור מערך הנתונים RNA-seq שאינו ספציפי לגידול. לספריות ייעודיות לחוטים, החליפו את -s 0 ב-s 1 או -s 2 בפקודה.
  6. צור את מטריצת ספירת הגנים כפי שמתואר להלן.
    1. אתחול את מטריצת הספירות עם מזהי גנים וספירות מהדגימה הראשונה.
      cut -f1 $(ls $OUT_COUNTS/*.counts.txt | head -1) > all_counts.txt
    2. מוסיפים באופן איטרטיבי ספירות מכל דגימה למטריצה אחת.
      for f in $OUT_COUNTS/*.counts.txt; do
      cut -f7 "$f" | paste all_counts.txt - > tmp && mv tmp
      all_counts.txt
      ​done
    3. הוסף שורת כותרת עם מזהי דגימות למטריצת הספירה.
      samples=$(ls *.counts.txt | sed 's/.counts.txt//' | paste -sd "\t")
      echo -e "Geneid\t$samples" | cat - all_counts.txt > counts_matrix.txt
    4. הוצא אורכי גנים מקובץ GTF (סכום אורכי האקסון לכל גן).
      awk '$3=="exon"{match($0,/gene_id "([^"]+)"/,a); if(a[1]!=""){len=$5-$4+1; gene_len[a[1]]+=len}} END{print "GENE_ID\tLENGTH"; for(g in gene_len) print g"\t"gene_len[g]}' \$GTF > gene_length.txt

4. עיבוד מטריצת ספירה גולמית והערות גנים

  1. אתחול סביבת R וטעינת חבילת R הרלוונטית.
    1. השתמש בפונקציות install.packages() כדי להתקין tidyverse, ggplot2, ggrepel, RColorBrewer, ggridges, FactoMineR. חבילת tidyverse משמשת למניפולציה וגרפיה של נתונים; חבילת ggplot2 משמשת לויזואליזציה; חבילת ה-ggrepel משמשת לתוויות טקסט שאינן חופפות; חבילת RColorBrewer משמשת לפלטות צבעים; חבילת גרידג'ס משמשת למגרשי רכסים; חבילת FactoMineR משמשת לניתוח PCA ולניתוח רב-משתני.
    2. השתמש בפונקציית BiocManager::install() כדי להתקין את biomaRt, DESeq2, clusterProfiler. חבילת biomaRt משמשת לסימון גנים מ-Ensembl; חבילת DESeq2 משמשת לניתוח ביטויים דיפרנציאליים; חבילת clusterProfiler משמשת לניתוח העשרה פונקציונלית.
    3. קרא את מטריצת הספירה המקורית שנוצרה בשלב 2, השתמש ב-biomaRt כדי למפות את מזהה אנסמבל לשם הגן של HGNC לניתוח הבא, הסר עמודת גניד כפולה, ויצר את מטריצת הספירה המנוקה. השתמש במטריצת הספירות המקורית (counts_matrix.csv) כקלט, כאשר מזהי גנים של Ensembl הם שורות ודגימות כעמודות. שמרו את מטריצת הספירות המנוקות כפלט (clean_counts_SRA.csv), עם סמלי גן HGNC כשורות ודגימות כעמודות.
      mart <- useMart("ensembl", dataset = "hsapiens_gene_ensembl")
      id_map <- getBM(attributes = c("ensembl_gene_id", "hgnc_symbol"),
      filters = "ensembl_gene_id",
      values = exprSet$GeneID,
      mart = mart)
      exprSet <- exprSet %>%
      left_join(id_map, by = c("GeneID" = "ensembl_gene_id")) %>%
      filter(!is.na(hgnc_symbol), hgnc_symbol != "") %>%
      distinct(hgnc_symbol, .keep_all = TRUE) %>%
      column_to_rownames("hgnc_symbol")

5. כימות ביטוי גנים

הערה: עיין בתיק המשלים 1 לתסריט המפורט.

  1. בצע את הפקודה הבאה כדי לחשב קטעים לכל קילו-בסיס של תמלול לכל מיליון קריאות ממופות (FPKM) ותמלולים למיליון (TPM).
    counts <- read.csv("output/clean_counts_SRA.csv", header=TRUE, row.names=1)
    gene_len <- read.delim("data/gene_length.txt", header=FALSE, col.names=c("gene_symbol","length"))
    gene_len <- gene_len %>% distinct(gene_symbol, .keep_all=TRUE)
    rownames(gene_len) <- gene_len$gene_symbol
    gene_len <- gene_len[match(rownames(counts), gene_len$gene_symbol),]
    length_bp <- gene_len$length
    fpkm <- (counts / length_bp) * 1e9 / colSums(counts)
    write.csv(fpkm, "output/clean_fpkm_SRA.csv")
    tpm <- (counts / length_bp) / colSums(counts / length_bp) * 1e6
    write.csv(tpm, "output/clean_tpm_SRA.csv")

6. אשכולות דגימות והדמיית הבדלים

  1. הערכו את איכות הנתונים על ידי בדיקת אשכולות דגימות דרך PCA. עיין בקובץ המשלים 1 לתסריט המפורט.
  2. להמחשת PCA, השתמשו בקוד למטה.
    gene.pca <- PCA(exprSet, ncp = 2, scale.unit = TRUE, graph = FALSE)
    ggplot(pca_sample, aes(x = Dim.1, y = Dim.2)) +
    geom_point(aes(color = group)) +
    labs(x = paste('PC1:', pca_eig1, '%'),
    y = paste('PC2:', pca_eig2, '%'))

7. ניתוח ביטוי דיפרנציאלי והדמיית תוצאות

הערה: עיין בתיק המשלים 1 לתסריט המפורט.

  1. בצע את הפקודות הבאות כדי לבנות את מערך הנתונים DESeq2 ולהגדיר את הסף. רק גנים עם ספירת > 1 בכל המדגמים נשמרו לפני המודל. זיהוי גנים מבוטאים באופן שונה (DEGs) באמצעות ספי מובהקות של ערך p מותאם < 0.05 ו-|log2FC| > 0.5.
    dds <- DESeq(DESeqDataSetFromMatrix(countData = exprSet, colData = colData, design = ~group)); sizeFactors(dds); res <- results(dds); dds <- dds[rowSums(counts(dds)) > 1,]
    dd1 <- results(dds, contrast = contrast, alpha = 0.05)
    dd2 <- lfcShrink(dds, contrast = contrast, res = dd1, type = "ashr")
  2. דמיינו גנים המובעים באופן שונה באמצעות גרף הר געש.
    ggplot(data = data, aes(x = log2FoldChange, y = -log10(padj))) +
    geom_point(aes(color = group), alpha = 1, size = 1.2) +
    geom_hline(yintercept = -log10(0.05), lty = 4) +
    geom_vline(xintercept = c(-0.5, 0.5), lty = 4) +
    geom_text_repel(data = subset(data, abs(log2FoldChange) >= 1.5 & padj < 0.05),
    aes(label = gene_id))

8. ביצוע ניתוח העשרה פונקציונלית והדמיה

הערה: עיין בתיק המשלים 1 לתסריט המפורט.

  1. הדמיינו תוצאות העשרה של KEGG.
    EGG <- enrichKEGG(gene = gene$ENTREZID, organism = 'hsa',
    pvalueCutoff = 0.05, qvalueCutoff = 0.05)
    ggplot(symboldata, aes(richFactor, Description)) +
    geom_point(aes(color = p.adjust, size = Count))
  2. תדמיין תוצאות העשרת GO. התאם את הוויזואליזציה על ידי שינוי רזולוציית הקשת (n=500), מיפוי צבעים וסידור הפאות בהתאם למפרטים ניסיוניים.
    ego <- enrichGO(gene = gene$ENTREZID, OrgDb = "org.Hs.eg.db", ont = "ALL",
    pvalueCutoff = 0.05, qvalueCutoff = 0.05, pAdjustMethod = "BH")
    ggplot(df) +
    ggforce::geom_link(aes(x = 0, y = Description, xend = -log10(p.adjust),
    yend = Description, color = ONTOLOGY), n = 500, show.legend = FALSE) +
    facet_wrap(~ONTOLOGY, scales = "free", ncol = 1)
  3. המחשת תוצאות ניתוח העשרת קבוצות גנים (GSEA). כוון את מספר המסלולים, קנה המידה של רכס הצפיפות ושקיפות השכבה כדי להתאים להתפלגויות גודל אפקט שונות.
    genelist <- sort(res$log2FoldChange, decreasing = TRUE)
    names(genelist) <- rownames(res)
    hallmarks <- read.gmt('resource/h.all.v2023.2.Hs.symbols.gmt')
    y <- GSEA(genelist, TERM2GENE = hallmarks, pvalueCutoff = 0.05)
    gsearesult <- yd %>% arrange(desc(NES)) %>% slice_head(n = 10)
    ggplot(gsearesult, aes(x = logFC, y = Description, fill = -log10(pvalue))) +
    geom_density_ridges(alpha = 0.8, scale = 0.8) +
    geom_point(aes(size = abs(NES), x = -0.4, color = NES)) +
    scale_fill_distiller(palette = 'Spectral') +
    scale_color_distiller(palette = 'Reds') +
    scale_size_continuous(range = c(2, 6))

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

תהליך הניתוח במעלה הזרם עבור RNA-seq בכמויות גדולות מוצג באיור 1A. תהליך עבודה זה מבצע ברצף את השלבים המרכזיים הבאים בפלטפורמת לינוקס: ראשית, בקרת איכות קפדנית של נתוני ריצוף גולמיים מתבצעת באמצעות fastp להסרת קריאות באיכות נמוכה ורצפי מתאמים; בהמשך, HISAT2 מיישר קריאות באיכות גבוהה לגנום הייחוס, כאשר Samtools ממיר וממיין את קבצי היישור; לבסוף, FeatureCounts מבצע כימות ברמת הגן ליצירת מטריצת ביטוי גן, המספקת קלט איכותי לניתוח במורד הזרם. עיבוד וניתוח סטטיסטי מאוחר יותר של מטריצת הביטויים המת...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ניתוח נתוני RNA-seq בכמויות גדולות מאופיין כמשימה בין-תחומית המשלבת גנומיקה, ביואינפורמטיקה, סטטיסטיקה ומדעי המחשב. תהליך עבודה אנליטי מלא כולל מספר שלבים מעלה ואחרון, כולל עיבוד מוקדם של נתונים גולמיים, בקרת איכות, יישור רצפים, כימות ברמת גנים, נרמול נתונים, ניתוח ביטוי דיפרנציאלי ופרשנות ביולוגית. בין השלבים הללו, המרה מדויקת של קריאות ריצוף גולמיות למטריצת ביטוי גנים איכותית היא קריטית במיוחד, שכן שגיאות שנוצרות במהלך עיבוד בזרם עלולות להתפשט לכל המסקנות הביולוגיות במורד הזרם. לכן, הק...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מצהירים שאין להם ניגודי עניינים.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים רוצים להודות למנהלי מאגרי המידע הזמינים לציבור ששימשו במחקר זה.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
ביומארטביו-קונדוקטור2.64.0הערת גנים מתוך Ensembl
clusterProfilerביו-קונדוקטור4.16.0ניתוח העשרה פונקציונלית
DESeq2ביו-קונדוקטור1.48.1ניתוח ביטוי דיפרנציאלי
FactoMineRאגרופריזטק2.11.0PCA וניתוח רב-משתני
fastpOpenGene1.0.1בקרת איכות וסינון נתוני FASTQ
ספירות תכונותמחלקת ביואינפורמטיקה, מכון וולטר ואליזה הול למחקר רפואי2.0.0  ספרו את מספר הקריאות שממופו לכל גן לכימות ביטוי גנים
ggplot2הנחה3.5.2ויזואליזציה של נתונים
גרפלקמיל סלואיקובסקי0.9.6תוויות טקסט שאינן חופפות
גרידג'סקלאוס או. וילקה0.5.6יצירת עגרות רכס (ridgeline)
HISAT2אוניברסיטת ג'ונס הופקינס2.2.1יישר את הקריאות האיכותיות המסוננות לגנום הייחוס
RR Core Team 4.5.0סביבה לחישוב, ניתוח והדמיה של נתונים
RColorBrewerאריך נויירת'1.1.3פלטות צבעים לתכנון
SAMTOOLSזרם עבודה בגנומיקה בקנה מידה גדול1.22.0המרה ועיבוד קבצי SAM לשליפת וגישה יעילה
ערכת כלים של SRAהמרכז הלאומי למידע ביוטכנולוגי3.2.1השגת ועיבוד מוקדם של נתוני ריצוף גולמיים ממסד הנתונים של NCBI SRA

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Asrani, S. K., Devarbhavi, H., Eaton, J., Kamath, P. S. Burden of liver diseases in the world. J Hepatol. 70 (1), 151-171 (2019).
  2. Friedman, S. L., Neuschwander-Tetri, B. A., Rinella, M., Sanyal, A. J. Mechanisms of NAFLD development and therapeutic strategies. Nat Med. 24 (7), 908-922 (2018).
  3. Estes, C., Razavi, H., Loomba, R., Younossi, Z., Sanyal, A. J. Modeling the epidemic of nonalcoholic fatty liver disease demonstrates an exponential increase in burden of disease. Hepatol Baltim Med. 67 (1), 123-133 (2018).
  4. Younossi, Z. M., et al. The economic and clinical burden of nonalcoholic fatty liver disease in the United States and Europe. Hepatol Baltim Med. 64 (5), 1577-1586 (2016).
  5. Rinella, M. E. Nonalcoholic fatty liver disease: a systematic review. JAMA. 313 (22), 2263-2273 (2015).
  6. Hardy, T., Oakley, F., Anstee, Q. M., Day, C. P. Nonalcoholic Fatty Liver Disease: Pathogenesis and Disease Spectrum. Annu Rev Pathol. 11, 451-496 (2016).
  7. Geier, A., Tiniakos, D., Denk, H., Trauner, M. From the origin of NASH to the future of metabolic fatty liver disease. Gut. 70 (8), 1570-1579 (2021).
  8. Tan, D. J. H., et al. Clinical characteristics, surveillance, treatment allocation, and outcomes of non-alcoholic fatty liver disease-related hepatocellular carcinoma: a systematic review and meta-analysis. Lancet Oncol. 23 (4), 521-530 (2022).
  9. Ng, C. H., et al. Mortality Outcomes by Fibrosis Stage in Nonalcoholic Fatty Liver Disease: A Systematic Review and Meta-analysis. Clin Gastroenterol Hepatol Off Clin Pract J Am Gastroenterol Assoc. 21 (4), 931-939.e5 (2023).
  10. Yong, J. N., et al. Outcomes of Nonalcoholic Steatohepatitis After Liver Transplantation: An Updated Meta-Analysis and Systematic Review. Clin Gastroenterol Hepatol Off Clin Pract J Am Gastroenterol Assoc. 21 (1), 45-54.e6 (2023).
  11. Diehl, A. M., Day, C. Cause, Pathogenesis, and Treatment of Nonalcoholic Steatohepatitis. New Engl J Med. 377 (21), 2063-2072 (2017).
  12. Konerman, M. A., Jones, J. C., Harrison, S. A. Pharmacotherapy for NASH: Current and emerging. J Hepatol. 68 (2), 362-375 (2018).
  13. Gapp, B., et al. Farnesoid X Receptor Agonism, Acetyl-Coenzyme A Carboxylase Inhibition, and Back Translation of Clinically Observed Endpoints of De Novo Lipogenesis in a Murine NASH Model. Hepatol Commun. 4 (1), 109-125 (2020).
  14. Marcher, A. B., et al. Transcriptional regulation of Hepatic Stellate Cell activation in NASH. Sci Rep. 9 (1), 2324(2019).
  15. Govaere, O., et al. Transcriptomic profiling across the nonalcoholic fatty liver disease spectrum reveals gene signatures for steatohepatitis and fibrosis. Sci Transl Med. 12 (572), eaba4448(2020).
  16. Xiong, X., et al. Landscape of Intercellular Crosstalk in Healthy and NASH Liver Revealed by Single-Cell Secretome Gene Analysis. Mol Cell. 75 (3), 644-660.e5 (2019).
  17. Li, X., et al. Deficiency of WTAP in hepatocytes induces lipoatrophy and non-alcoholic steatohepatitis (NASH). Nat Commun. 13 (1), 4549(2022).
  18. Haque, A., Engel, J., Teichmann, S. A., Lönnberg, T. A practical guide to single-cell RNA-sequencing for biomedical research and clinical applications. Genome Med. 9 (1), 75(2017).
  19. Li, X., Wang, C. Y. From bulk, single-cell to spatial RNA sequencing. Int J Oral Sci. 13 (1), 36(2021).
  20. Bai, L., et al. Multispecies transcriptomics identifies SIKE as a MAPK repressor that prevents NASH progression. Sci Transl Med. 16, eade7347(2024).
  21. Pertea, M., Kim, D., Pertea, G. M., Leek, J. T., Salzberg, S. L. Transcript-level expression analysis of RNA-seq experiments with HISAT, StringTie and Ballgown. Nat Protoc. 11 (9), 1650-1667 (2016).
  22. Love, M. I., Huber, W., Anders, S. Moderated estimation of fold change and dispersion for RNA-seq data with DESeq2. Genome Biol. 15 (12), 550(2014).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Bulk RNA SeqTranscriptomic AnalysisDifferential Gene AnalysisFunctional AnalysisQuality ControlGene MappingNonalcoholic Fatty LiverSteatohepatitis ProgressionMolecular MechanismsDisease Biomarkers

Related Articles