Method Article

تحليل النسخ النصي بناء على بيانات RNA-seq الجماعية

DOI:

10.3791/69611

January 16th, 2026

* These authors contributed equally

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يضع البروتوكول الحالي خط أنابيب كامل لتحليل عملية تسلسل RNA الجماعي من البيانات الخام إلى تحليل الإثراء الوظيفي.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعتبر الكبد الدهني غير الكحولي (NAFL) عادة حالة حميدة؛ ومع ذلك، بمجرد تطور الحالة إلى التهاب الكبد الدهني غير الكحولي (NASH)، يواجه المرضى خطرا مرتفعا بشكل كبير للإصابة بمرض الكبد في المرحلة النهائية. تحاول العديد من الدراسات توضيح الآلية الجزيئية الكامنة وراء الانتقال من NAFL إلى NASH. قدمت تقنيات التسلسل عالي الإنتاجية (مثل الحمض النووي الريبي الضخم) فهما أعمق للباحثين من خلال فحص النسخ النصي، وكشف تعبير الجزيئات، وتنشيط مسارات الإشارة، وعوامل أخرى مرتبطة بتقدم المرض. هناك ثروة من البيانات مفتوحة المصدر متاحة للباحثين لتحليلها لتحديد الأهداف المحتملة لعلاج الأمراض. ومع ذلك، فإن الأبحاث ذات الصلة محدودة بسبب نقص عملية فعالة وموثوقة لتحليل النسخ النصي في أعلى المجرب. هنا، يتم توفير تحليل علوي قابل للتكرار وسهل الاستخدام وخط أنابيب تحليل جيني تفاضلي ذي صلة لتحقيق معالجة موحدة وتحليل عميق للبيانات الخاصة أو العامة. ينقسم خط الأنابيب إلى أربع خطوات: (1) مراقبة جودة البيانات؛ (2) رسم خرائط الجينات؛ (3) تحليل جيني تفريقي؛ و(4) التحليل الدالي. تهدف هذه العملية إلى كشف الآليات الجزيئية لتحول المرض ومساعدة الباحثين في فحص الأهداف الدوائية المحتملة والأساليب العلاجية من خلال تحليل بيانات الحمض النووي الريبي الضخم.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

مرض الكبد الدهني غير الكحولي (NAFLD) هو أكثر أمراض الكبد الدهنية المزمنة انتشارا على مستوى العالم، حيث يصيب أكثر من ربع السكان. وقد زادت حدوثها بشكل كبير في العقود الأخيرة 1,2,3. العبء المتزايد للمرض، وخاصة شكله الأكثر تقدما، التهاب الكبد الدهني غير الكحولي (NASH)، يشكل تحديا صحيا عالميا كبيرا وعبئا اقتصاديا ثقيلا4. المرحلة الأولى من مرض الكبد الدهني غير الكحولي هي الكبد الدهني غير الكحولي (NAFL)، والتي ترافق التهاب وتليف يمكن أن يتطور إلى NASH. الأخير يزيد بشكل كبير من خطر التقدم إلى مرض الكبد في المرحلة النهائية، بما في ذلك تليف الكبد وسرطان الخلايا الكبدية (HCC)5,6,7. يرتبط معدل حدوث ووفيات HCC بزيادة NASH 8,9، ومن المتوقع أن يصبح NAFLD/NASH المؤشر الرئيسي لزراعة الكبد بحلول عام 2030. ومع ذلك، فإن التطور السريري ل NAFLD متعدد التجانس للغاية11، مما يعيق بشدة تطوير الأدوية ذات الصلة12، مما يجعل من المهم بشكل خاص استكشاف الآليات الجزيئية المعنية بدقة.

يمكن أن يوضح الجمع الكبير لمعلومات تركيب الخلايا المعتمد على تسلسل الحمض النووي الريبي بشكل كبير سبب المرض لمختلف الأمراض. في العقود الأخيرة، أجريت العديد من الدراسات الجماعية على RNA-seq على الكائنات النموذجية والبشر لتوضيح اختلافات التعبير الجيني في تقدم NASH 13,14,15، لتحديد أهداف علاجية جديدة للتدخل. استنادا إلى تحليل الحمض النووي الريبي الضخم، وجد شيونغ وآخرون أن الخلايا غير المحيطة (NPCs) في الكبد تشارك في عمليات مثل تكوين المصفوفة خارج الخلايا والتصاق الخلايا، والتي تساهم في تقدم NASH16. أظهر لي وآخرون أن بروتين ويلمز المرتبط 1 (WTAP) في الخلايا الكبدية ينظم تراكم الدهون خارج الرحم والالتهاب، مما يعزز تكوين NASH17. على الرغم من أن تحليل تسلسل الحمض النووي الريبي الجماعي أداة قوية لتوضيح آليات NASH، إلا أن نتائجه حساسة للغاية لجودة البيانات في المراحل الأولى. يمكن أن يؤثر التباين في العمليات التجريبية وعمليات التحليل على مستوى التحليل بشكل كبير من موثوقية البيانات، مما يخفي المعلومات البيولوجية الحقيقية ويتدخل في دقة التحليلات اللاحقة. لذلك، من المهم وضع مجموعة من إجراءات التحليل الموحدة في الأعلى.

مقارنة بتسلسل الحمض النووي الريبي أحادي الخلية (scRNA-seq)، يقدم تسلسل RNA الضخم عدة مزايا واضحة في تصميم التجارب والتطبيقات العملية. بينما يتيح scRNA-seq تحديد التغاير الخلوي على مستوى الخلية الواحدة ويسمح بتحليل دقيق لخصائص النسخ الخاصة بنوع الخلية، إلا أنه مرتبط بتكلفة عالية، ومتطلبات معالجة بيانات معقدة، وحساسية محدودة للكشف عن النسخ منخفضةالوفرة 18. في المقابل، يوفر تسلسل RNA-seq بالكميات الأكبر عمقا أعلى للتسلسل وتكلفة أقل، وإنتاجية عينة أعلى، مما يجعله مناسبا بشكل خاص لتحليلات التعبير الجيني التفاضلي على مستوى السكان واستكشاف الآليات الجزيئية19. لذلك، عند توجيه سير العمل التحليلي الموحد، يظل تسلسل RNA-seq بالكميات الأكبر نهجا فعالا وفعالا من حيث التكلفة وقويا للتحقيق في الأساس الجزيئي للأمراض المعقدة.

تم تصميم هذا البروتوكول خصيصا لمجموعات بيانات RNA-seq الضخمة المستمدة من أنسجة بشرية ذات سلامة RNA عالية (RIN ≥ 7.0) وكمية كافية من RNA مدخل (≥ 500 نانوغرام لكل عينة). لضمان تنفيذ خطوات المحاذاة والقياس بشكل موثوق، يوصى بمحطة عمل محلية مزودة بمعالج لا يقل عن 10 أنوية، وذاكرة RAM بسعة 32 جيجابايت، ومساحة لا تقل عن 200 جيجابايت من مساحة القرص الحرة. استنادا إلى هذه المتطلبات، يوفر البروتوكول سير عمل تحليلي فعال وسهل الاستخدام، يشمل تعليمات تشغيلية مفصلة وتكوينات معلمات موحدة، لتلبية احتياجات الباحثين الذين يحللون بيانات النسخ واسعة النطاق.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لأغراض التوضيح، تم استخدام مجموعة البيانات المتاحة للجمهور PRJNA1023502 أنشأها لان باي وآخرون لتوضيح كل خطوة من التحليلات العليا واللاحقة20. نظرا لأن هذه المجموعة تأتي من قاعدة بيانات NCBI SRA ذات الوصول المفتوح، فلا حاجة إلى أذونات إضافية أو موافقات أخلاقية. راجع جدول المواد للتحقق من جميع إصدارات البرمجيات وحزمة R المطلوبة. تتكون مجموعة البيانات المتاحة للجمهور PRJNA1023502 من 6 عينات غير NASH، و6 عينات NAFL، و6 عينات RNA-seq للكبد NASH. في هذا البروتوكول، تم استخدام مجموعة البيانات لعرض جميع خطوات سير عمل RNA-seq الجماعي، بما في ذلك استرجاع البيانات من قاعدة بيانات SRA، ومراقبة الجودة (fastp)، والمحاذاة (HISAT2)، والقياس الكمي (featureCounts)، وتحليلات التعبير التفاضلي والإثراء الوظيفي في مرحلة لاحقة.

1. تركيب مجموعة أدوات SRA

  1. قم بزيارة الموقع الرسمي لمجموعة أدوات SRA وحمل الإصدار 3.2.1.

2. تحميل البيانات العامة

  1. احصل على رقم SRA.
    1. يمكنك الوصول إليه في الملحق20 للمقالة، أو قسم توفر البيانات، أو بالبحث عن الكلمات المفتاحية في قاعدة بيانات NCBI SRA.
    2. اكتب الجلب المسبق <رقم SRA> في الطرفية لتحميله.

3. توليد مصفوفة عدد الجينات

  1. حدد المسارات والإعدادات كما هو موضح أدناه:
    REFERENCE=~/reference/human/GRCh38/GRCh38.primary_assembly.genome.fa
    GTF=~/reference/human/GRCh38/gencode.v44.annotation.gtf
    INDEX=~/reference/human/GRCh38/GRCh38_index
    FASTQ_DIR=~/SRA_tutorial/fastq
    OUT_FASTP=~/RNAseq/fastp
    OUT_HISAT2=~/RNAseq/hisat2
    OUT_COUNTS=~/RNAseq/counts
    ​mkdir -p $FASTQ_DIR $OUT_FASTP $OUT_HISAT2 $OUT_COUNTS
    1. قم بتنزيل الجينوم المرجعي البشري (التجميع الأساسي GRCh38) وملف التعليقات الجينية المقابل (gencode.v44، مجموعة شاملة للتعليقات الجينية) من قاعدة بيانات GENCODE الرسمية (https://www.gencodegenes.org/human/).
      for f in SRR*; do [[ ! $f =~ \.sra$ ]] && mv "$f" "$f.sra"; done
      ​for f in SRR*; do [[ ! $f =~ \.sra$ ]] && mv "$f" "$f.sra"; done
  2. أعد تسمية ملفات SRA.
    1. تأكد من أن جميع ملفات SRA تستخدم امتداد ملف .sra لتسهيل التعرف الدقيق والمعالجة بواسطة الأدوات اللاحقة.
    2. نفذ الأوامر التالية:
      for f in SRR*; do [[ ! $f =~ \.sra$ ]] && mv "$f" "$f.sra"; done
  3. نفذ الأمر التالي لتحويل ملفات SRA إلى صيغة FASTQ:
    for f in *.sra; do fasterq-dump "$f" --split-files -O $FASTQ_DIR - e 20; done
  4. ابن مؤشر HISAT2 من الجينوم المرجعي.
    hisat2-build $REFERENCE $INDEX
  5. معالجة ملفات FASTQ مع مراقبة التقدم البصرية.
    for fq in $FASTQ_DIR/*.fastq; do
    ​sample=$(basename "$fq" .fastq)
    1. لبيانات التسلسل المزدوج في النهاية، نفذ الأمر التالي
      for fq1 in $FASTQ_DIR/*_1.fastq; do
      sample=$(basename "$fq1" _1.fastq)
      ​fq2=$FASTQ_DIR/${sample}_2.fastq
    2. قم بإجراء مراقبة الجودة والتصفية باستخدام fastp وإخراج النتائج إلى مجلد $OUT_FASTP. لبيانات التسلسل أحادية الطرف، نفذ الأمر التالي:
      fastp \
      -i "${fq}" \
      -o $OUT_FASTP/${sample}.clean.fastq \
      -h $OUT_FASTP/${sample}.html \
      -j $OUT_FASTP/${sample}.json \
      -w 20

      لبيانات التسلسل المزدوج من النهايات، نفذ الأمر التالي:
      fastp \
      -i "${fq}" \ -I "$fq2" \
      -o $OUT_FASTP/${sample}_1.clean.fastq \
      -O $OUT_FASTP/${sample}_2.clean.fastq \
      -h $OUT_FASTP/${sample}.html \
      -j $OUT_FASTP/${sample}.json \
      ​-w 20
    3. لكل عينة، افحص تقرير HTML للتحكم البصري في الجودة واستشر تقرير JSON للحصول على مقاييس منظمة، بما في ذلك جودة القراءة، توزيع GC، تكرار القراءة، وتلوث المحولات. تأكد من أن جميع العينات تحقق عتبات الجودة التالية: Q30 ≥ 85٪، معدل تلوث المحول < 5٪، وعدم وجود أنماط GC غير طبيعية. قم بتخزين جميع ملفات الإخراج في مجلد $OUT_FASTP.
    4. قم بمحاذاة التسلسل باستخدام HISAT2، وتوليد ملفات SAM، وإخراجها إلى مجلد $OUT_HISAT2. لبيانات التسلسل أحادية الطرف، نفذ الأمر التالي:
      hisat2 -p 20 \ -x $INDEX \-U $OUT_FASTP/${sample}.clean.fastq \
      -S $OUT_HISAT2/${sample}.sam

      لبيانات التسلسل المزدوج من النهايات، نفذ الأمر التالي:
      hisat2 -p 20 \-x $INDEX \-1 $OUT_FASTP/${sample}_1.clean.fastq \
      -2 $OUT_FASTP/${sample}_2.clean.fastq \
      ​-S $OUT_HISAT2/${sample}.sam
    5. قم بمحاذاة HISAT2 للقراءات المصفاة بالجودة إلى الجينوم المرجعي البشري، باستخدام مؤشر مبني من ملف FASTA التجميع الأساسي GRCh38. قدم أوامر نموذجية لكل من بيانات التسلسل أحادية الطرف والطرفين المزدوجين.
    6. حول SAM إلى BAM، فرز، وفهرس.
      samtools view -@ 20 -bS $OUT_HISAT2/${sample}.sam \
      | samtools sort -@ 20 -o $OUT_HISAT2/${sample}.sorted.bam
      samtools index $OUT_HISAT2/${sample}.sorted.bam
      ​done
    7. قم بإنشاء ملف SAM لكل عينة وتحويله إلى ملف BAM مرتبة ومفهرسة باستخدام SAMtools. بالنسبة لعينات النسخ البشري عالية الجودة (رقم سلامة الحمض النووي الريبي، RIN ≥ 8.0)، تأكد من أن معدل المحاذاة الكلي يتجاوز 85٪؛ بالنسبة لعينات RNA-seq النموذجية (RIN ≥ 7.0)، اعتبر معدلات المحاذاة مقبولة بنسبة 70٪ ≥.
    8. قم بقياس الجينات باستخدام featureCount.
      featureCounts -T 20 -p -s 0 \
      -a $GTF \
      -o $OUT_COUNTS /${sample}.counts.txt \
      $OUT_HISAT2/${sample}.sorted.bam
      Done
    9. تحقق من ملف الإخراج المحدد بالتبويب (*.counts.txt) وتقرير الملخص الخاص به (*.counts.txt.summary) الذي يتم تولده بواسطة featureCounts لكل عينة. ضمان أن معدل تعيين القراءة يحقق الحد المعتاد ≥70٪ لحجم RNA البشري الضخم؛ قد يشير معدل أقل بشكل ملحوظ إلى عدم تطابق اتجاه الخيوط، أو مشاكل في التعليقات، أو جودة محاذاة ضعيفة. استخدم المعامل -s 0 لهذه المجموعة غير الخاصة بسلسلة RNA. بالنسبة لمكتبات خاصة بالخيوط، استبدل -s 0 ب -s 1 أو -s 2 في الأمر.
  6. أنشئ مصفوفة عدد الجينات كما هو موضح أدناه.
    1. قم بتهيئة مصفوفة العد باستخدام معرفات الجينات والعد من العينة الأولى.
      cut -f1 $(ls $OUT_COUNTS/*.counts.txt | head -1) > all_counts.txt
    2. أضف العدات من كل عينة بشكل تكراري إلى مصفوفة واحدة.
      for f in $OUT_COUNTS/*.counts.txt; do
      cut -f7 "$f" | paste all_counts.txt - > tmp && mv tmp
      all_counts.txt
      ​done
    3. أضف سطر رأس مع معرفات عينات إلى مصفوفة الأعداد.
      samples=$(ls *.counts.txt | sed 's/.counts.txt//' | paste -sd "\t")
      echo -e "Geneid\t$samples" | cat - all_counts.txt > counts_matrix.txt
    4. استخرج أطوال الجينات من ملف GTF (مجموع أطوال الإكسونات لكل جين).
      awk '$3=="exon"{match($0,/gene_id "([^"]+)"/,a); if(a[1]!=""){len=$5-$4+1; gene_len[a[1]]+=len}} END{print "GENE_ID\tLENGTH"; for(g in gene_len) print g"\t"gene_len[g]}' \$GTF > gene_length.txt

4. معالجة مصفوفة العد الخام وتوضيح الجينات

  1. تهيئة بيئة R وتحميل حزمة R ذات الصلة.
    1. استخدم وظائف install.packages() لتثبيت tidyverse، ggplot2، ggrepel، RColorBrewer، ggridges، FactoMineR. تستخدم حزمة tidyverse للتلاعب بالبيانات ورسم البيانات؛ تستخدم حزمة ggplot2 للتصور؛ تستخدم حزمة ggrepel لتسميات النصوص غير المتداخلة؛ تستخدم حزمة RColorBrewer للوحات الألوان؛ تستخدم حزمة غريدجز لقطع الأراضي على التلال؛ تستخدم حزمة FactoMineR في تحليل PCA والتحليل متعدد المتغيرات.
    2. استخدم دالة BiocManager::install() لتثبيت biomaRt وDESeq2 وclusterProfiler. تستخدم حزمة biomaRt في التعليقات الجينية من Ensembl؛ تستخدم حزمة DESeq2 لتحليل التعبيرات التفاضلية؛ تستخدم حزمة clusterProfiler لتحليل الإثراء الوظيفي.
    3. اقرأ مصفوفة العد الأصلية التي تم إنشاؤها في الخطوة 2، واستخدم biomaRt لربط معرف المجموعة باسم جين HGNC للتحليل لاحقا، وإزالة عمود Geneid المكرر، وإنشاء مصفوفة العد المنظفة. استخدم مصفوفة العد الأصلية (counts_matrix.csv) كمدخل، مع معرفات جينات Ensembl كصفوف والعينات كأعمدة. احفظ مصفوفة العد النظيفة كمخرج (clean_counts_SRA.csv)، مع رموز جينات HGNC كصفوف والعينات كأعمدة.
      mart <- useMart("ensembl", dataset = "hsapiens_gene_ensembl")
      id_map <- getBM(attributes = c("ensembl_gene_id", "hgnc_symbol"),
      filters = "ensembl_gene_id",
      values = exprSet$GeneID,
      mart = mart)
      exprSet <- exprSet %>%
      left_join(id_map, by = c("GeneID" = "ensembl_gene_id")) %>%
      filter(!is.na(hgnc_symbol), hgnc_symbol != "") %>%
      distinct(hgnc_symbol, .keep_all = TRUE) %>%
      column_to_rownames("hgnc_symbol")

5. قياس تعبير الجينات

ملاحظة: راجع الملف التكميلي 1 للنص المفصل.

  1. نفذ الأمر التالي لحساب الشظايا لكل كيلوبيس من النص لكل مليون قراءة مبرمجة (FPKM) والنصوص لكل مليون (TPM).
    counts <- read.csv("output/clean_counts_SRA.csv", header=TRUE, row.names=1)
    gene_len <- read.delim("data/gene_length.txt", header=FALSE, col.names=c("gene_symbol","length"))
    gene_len <- gene_len %>% distinct(gene_symbol, .keep_all=TRUE)
    rownames(gene_len) <- gene_len$gene_symbol
    gene_len <- gene_len[match(rownames(counts), gene_len$gene_symbol),]
    length_bp <- gene_len$length
    fpkm <- (counts / length_bp) * 1e9 / colSums(counts)
    write.csv(fpkm, "output/clean_fpkm_SRA.csv")
    tpm <- (counts / length_bp) / colSums(counts / length_bp) * 1e6
    write.csv(tpm, "output/clean_tpm_SRA.csv")

6. تجميع العينات وتصور الفروقات

  1. قيم جودة البيانات من خلال فحص تجميع العينات عبر PCA. راجع الملف التكميلي 1 للنص التفصيلي.
  2. لعرض PCA، استخدم الكود أدناه.
    gene.pca <- PCA(exprSet, ncp = 2, scale.unit = TRUE, graph = FALSE)
    ggplot(pca_sample, aes(x = Dim.1, y = Dim.2)) +
    geom_point(aes(color = group)) +
    labs(x = paste('PC1:', pca_eig1, '%'),
    y = paste('PC2:', pca_eig2, '%'))

7. تحليل التعبير التفاضلي وتصور النتائج

ملاحظة: راجع الملف التكميلي 1 للنص المفصل.

  1. نفذ الأوامر التالية لإنشاء مجموعة بيانات DESeq2 وحدد العتبة. تم الاحتفاظ فقط بالجينات التي لديها إجمالي عدد > 1 عبر جميع العينات قبل النمذجة. تحديد الجينات المعبر عنها بشكل تفاضلي (DEGs) باستخدام عتبات الدلالة لقيمة p المعدلة < 0.05 و |log2FC| > 0.5.
    dds <- DESeq(DESeqDataSetFromMatrix(countData = exprSet, colData = colData, design = ~group)); sizeFactors(dds); res <- results(dds); dds <- dds[rowSums(counts(dds)) > 1,]
    dd1 <- results(dds, contrast = contrast, alpha = 0.05)
    dd2 <- lfcShrink(dds, contrast = contrast, res = dd1, type = "ashr")
  2. تصور الجينات المعبر عنها بشكل مختلف باستخدام مخطط بركاني.
    ggplot(data = data, aes(x = log2FoldChange, y = -log10(padj))) +
    geom_point(aes(color = group), alpha = 1, size = 1.2) +
    geom_hline(yintercept = -log10(0.05), lty = 4) +
    geom_vline(xintercept = c(-0.5, 0.5), lty = 4) +
    geom_text_repel(data = subset(data, abs(log2FoldChange) >= 1.5 & padj < 0.05),
    aes(label = gene_id))

8. إجراء تحليل وتصوير الإثراء الوظيفي

ملاحظة: راجع الملف التكميلي 1 للنص المفصل.

  1. تصور نتائج إثراء KEGG.
    EGG <- enrichKEGG(gene = gene$ENTREZID, organism = 'hsa',
    pvalueCutoff = 0.05, qvalueCutoff = 0.05)
    ggplot(symboldata, aes(richFactor, Description)) +
    geom_point(aes(color = p.adjust, size = Count))
  2. تخيل نتائج إثراء GO. تخصيص التصور عن طريق تعديل دقة القوس (n=500)، وتعيينات الألوان، وترتيب الأوجه وفقا للمواصفات التجريبية.
    ego <- enrichGO(gene = gene$ENTREZID, OrgDb = "org.Hs.eg.db", ont = "ALL",
    pvalueCutoff = 0.05, qvalueCutoff = 0.05, pAdjustMethod = "BH")
    ggplot(df) +
    ggforce::geom_link(aes(x = 0, y = Description, xend = -log10(p.adjust),
    yend = Description, color = ONTOLOGY), n = 500, show.legend = FALSE) +
    facet_wrap(~ONTOLOGY, scales = "free", ncol = 1)
  3. تصور نتائج تحليل إثراء مجموعات الجينات (GSEA). قم بضبط عدد المسارات، ومقياس الكثافة على الحواف، وشفافية الطبقة لاستيعاب توزيعات حجم التأثير المختلفة.
    genelist <- sort(res$log2FoldChange, decreasing = TRUE)
    names(genelist) <- rownames(res)
    hallmarks <- read.gmt('resource/h.all.v2023.2.Hs.symbols.gmt')
    y <- GSEA(genelist, TERM2GENE = hallmarks, pvalueCutoff = 0.05)
    gsearesult <- yd %>% arrange(desc(NES)) %>% slice_head(n = 10)
    ggplot(gsearesult, aes(x = logFC, y = Description, fill = -log10(pvalue))) +
    geom_density_ridges(alpha = 0.8, scale = 0.8) +
    geom_point(aes(size = abs(NES), x = -0.4, color = NES)) +
    scale_fill_distiller(palette = 'Spectral') +
    scale_color_distiller(palette = 'Reds') +
    scale_size_continuous(range = c(2, 6))

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يتم توضيح سير عمل التحليل الصادر للRNA-seq بالجملة في الشكل 1A. ينفذ هذا السير الخطوات الرئيسية التالية بشكل متسلسل على منصة لينكس: أولا، يتم تنفيذ مراقبة دقيقة في جودة بيانات التسلسل الخام باستخدام fastp لإزالة القراءات منخفضة الجودة وتسلسلات المحولات؛ بعد ذلك، يقوم HISAT2 بمحاذاة القراءات عالية الجودة مع الجينوم المرجعي، حيث يقوم Samtools بتحويل وترتيب ملفات المحاذاة؛ وأخيرا، يقوم FeatureCounts بقياس الكمية على مستوى الجين لتوليد مصفوفة تعبير الجينات، مما يوفر مدخلات عالية الجودة للتحليل ا...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يتميز تحليل بيانات تسلسل الحمض النووي الريبي الجماعي بأنه مهمة متعددة التخصصات تدمج الجينوميات، والمعلوماتية الحيوية، والإحصاء، وعلوم الحاسوب. يشمل سير العمل التحليلي الكامل عدة خطوات في البداية والأسفل، بما في ذلك معالجة البيانات الخام، ومراقبة الجودة، ومحاذاة التسلسل، والقياس على مستوى الجينات، وتطبيع البيانات، وتحليل التعبير التفاضلي، والتفسير البيولوجي. من بين هذه الخطوات، يعد تحويل قراءات التسلسل الخام بدقة إلى مصفوفة تعبير جيني عالية الجودة أمرا بالغ الأهمية، حيث يمكن أن تنتشر الأخ...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعلن المؤلفون أنهم لا يملكون تضارب مصالح.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يرغب المؤلفون في شكر القائمين على قواعد البيانات المتاحة للجمهور المستخدمة في هذه الدراسة.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
biomaRtالموصل الحيوي2.64.0تعليق الجينات من Ensembl
clusterProfilerالموصل الحيوي4.16.0تحليل الإثراء الوظيفي
DESeq2الموصل الحيوي1.48.1تحليل التعبير التفاضلي
فاكتوماينرأجروباريستك2.11.0تحليل PCA والتحليل متعدد المتغيرات
فاست بيأوبن جين1.0.1مراقبة الجودة وتصفية بيانات FASTQ
عدد الميزاتقسم المعلوماتية الحيوية، معهد والتر وإليزا هول للأبحاث الطبية2.0.0  عد عدد القراءات التي تم تحويلها لكل جين لقياس تعبير الجين
ggplot2الوضع3.5.2تصور البيانات
غريبلكميل سلوويكوفسكي0.9.6تسميات النصوص غير المتداخلة
غريدجزكلاوس أو. ويلكي0.5.6أنشئ مخططات على خطوط المرتفعات
HISAT2جامعة جونز هوبكنز2.2.1محاذاة القراءات عالية الجودة المفلترة مع الجينوم المرجعي
Rفريق R Core 4.5.0بيئة لحساب البيانات وتحليلها وتصورها
RColorBrewerإريك نويورث1.1.3لوحات الألوان للرسم
Samtoolsمسار عمل الجينوميات واسعة النطاق1.22.0تحويل ومعالجة ملفات SAM لاسترجاع والوصول الفعال
مجموعة أدوات SRAالمركز الوطني لمعلومات التكنولوجيا الحيوية3.2.1الحصول على بيانات التسلسل الخام ومعالجتها مسبقا من قاعدة بيانات NCBI SRA

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Asrani, S. K., Devarbhavi, H., Eaton, J., Kamath, P. S. Burden of liver diseases in the world. J Hepatol. 70 (1), 151-171 (2019).
  2. Friedman, S. L., Neuschwander-Tetri, B. A., Rinella, M., Sanyal, A. J. Mechanisms of NAFLD development and therapeutic strategies. Nat Med. 24 (7), 908-922 (2018).
  3. Estes, C., Razavi, H., Loomba, R., Younossi, Z., Sanyal, A. J. Modeling the epidemic of nonalcoholic fatty liver disease demonstrates an exponential increase in burden of disease. Hepatol Baltim Med. 67 (1), 123-133 (2018).
  4. Younossi, Z. M., et al. The economic and clinical burden of nonalcoholic fatty liver disease in the United States and Europe. Hepatol Baltim Med. 64 (5), 1577-1586 (2016).
  5. Rinella, M. E. Nonalcoholic fatty liver disease: a systematic review. JAMA. 313 (22), 2263-2273 (2015).
  6. Hardy, T., Oakley, F., Anstee, Q. M., Day, C. P. Nonalcoholic Fatty Liver Disease: Pathogenesis and Disease Spectrum. Annu Rev Pathol. 11, 451-496 (2016).
  7. Geier, A., Tiniakos, D., Denk, H., Trauner, M. From the origin of NASH to the future of metabolic fatty liver disease. Gut. 70 (8), 1570-1579 (2021).
  8. Tan, D. J. H., et al. Clinical characteristics, surveillance, treatment allocation, and outcomes of non-alcoholic fatty liver disease-related hepatocellular carcinoma: a systematic review and meta-analysis. Lancet Oncol. 23 (4), 521-530 (2022).
  9. Ng, C. H., et al. Mortality Outcomes by Fibrosis Stage in Nonalcoholic Fatty Liver Disease: A Systematic Review and Meta-analysis. Clin Gastroenterol Hepatol Off Clin Pract J Am Gastroenterol Assoc. 21 (4), 931-939.e5 (2023).
  10. Yong, J. N., et al. Outcomes of Nonalcoholic Steatohepatitis After Liver Transplantation: An Updated Meta-Analysis and Systematic Review. Clin Gastroenterol Hepatol Off Clin Pract J Am Gastroenterol Assoc. 21 (1), 45-54.e6 (2023).
  11. Diehl, A. M., Day, C. Cause, Pathogenesis, and Treatment of Nonalcoholic Steatohepatitis. New Engl J Med. 377 (21), 2063-2072 (2017).
  12. Konerman, M. A., Jones, J. C., Harrison, S. A. Pharmacotherapy for NASH: Current and emerging. J Hepatol. 68 (2), 362-375 (2018).
  13. Gapp, B., et al. Farnesoid X Receptor Agonism, Acetyl-Coenzyme A Carboxylase Inhibition, and Back Translation of Clinically Observed Endpoints of De Novo Lipogenesis in a Murine NASH Model. Hepatol Commun. 4 (1), 109-125 (2020).
  14. Marcher, A. B., et al. Transcriptional regulation of Hepatic Stellate Cell activation in NASH. Sci Rep. 9 (1), 2324(2019).
  15. Govaere, O., et al. Transcriptomic profiling across the nonalcoholic fatty liver disease spectrum reveals gene signatures for steatohepatitis and fibrosis. Sci Transl Med. 12 (572), eaba4448(2020).
  16. Xiong, X., et al. Landscape of Intercellular Crosstalk in Healthy and NASH Liver Revealed by Single-Cell Secretome Gene Analysis. Mol Cell. 75 (3), 644-660.e5 (2019).
  17. Li, X., et al. Deficiency of WTAP in hepatocytes induces lipoatrophy and non-alcoholic steatohepatitis (NASH). Nat Commun. 13 (1), 4549(2022).
  18. Haque, A., Engel, J., Teichmann, S. A., Lönnberg, T. A practical guide to single-cell RNA-sequencing for biomedical research and clinical applications. Genome Med. 9 (1), 75(2017).
  19. Li, X., Wang, C. Y. From bulk, single-cell to spatial RNA sequencing. Int J Oral Sci. 13 (1), 36(2021).
  20. Bai, L., et al. Multispecies transcriptomics identifies SIKE as a MAPK repressor that prevents NASH progression. Sci Transl Med. 16, eade7347(2024).
  21. Pertea, M., Kim, D., Pertea, G. M., Leek, J. T., Salzberg, S. L. Transcript-level expression analysis of RNA-seq experiments with HISAT, StringTie and Ballgown. Nat Protoc. 11 (9), 1650-1667 (2016).
  22. Love, M. I., Huber, W., Anders, S. Moderated estimation of fold change and dispersion for RNA-seq data with DESeq2. Genome Biol. 15 (12), 550(2014).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Bulk RNA SeqTranscriptomic AnalysisDifferential Gene AnalysisFunctional AnalysisQuality ControlGene MappingNonalcoholic Fatty LiverSteatohepatitis ProgressionMolecular MechanismsDisease Biomarkers

Related Articles