$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
1. إعداد البيئة وتثبيت RiboCode
- افتح نافذة محطة Linux الطرفية وقم بإنشاء بيئة conda:
كوندا إنشاء -n ريبوكود بيثون = 3.8
- التبديل إلى البيئة التي تم إنشاؤها وتثبيت RiboCode والتبعيات:
conda تنشيط RiboCode
كوندا تثبيت -c بيوكوندا ريبوكود ريبومينر sra-tools fastx_toolkit cutadapt القوس نجمة samtools
2. إعداد البيانات
- احصل على ملفات مرجعية للجينوم.
- للحصول على التسلسل المرجعي، انتقل إلى موقع Ensemble على الويب في https://www.ensembl.org/index.html، وانقر فوق القائمة العلوية تنزيل والقائمة الموجودة على الجانب الأيسر FTP Download. في الجدول المعروض، انقر فوق FASTA في العمود DNA (FASTA) والصف الذي يكون فيه النوع إنسانا. في الصفحة المفتوحة ، انسخ رابط Homo_sapiens. GRCh38.dna.primary_assembly.fa.gz ، ثم قم بتنزيله وفك ضغطه في الجهاز الطرفي:
wget -c \
http://ftp.ensembl.org/pub/release-104/fasta/homo_sapiens/dna/Homo_sapiens.GRCh38.dna.primary_assembly.fa.gz
gzip -d Homo_sapiens. GRCh38.dna.primary_assembly.fa.gz
- للحصول على تعليق توضيحي مرجعي، انقر بزر الماوس الأيمن فوق GTF في العمود Gene sets في صفحة الويب التي تم فتحها آخر مرة. انسخ رابط Homo_sapiens. GRCh38.104.gtf.gz وقم بتنزيله باستخدام:
wget -c \
http://ftp.ensembl.org/pub/release-104/gtf/homo_sapiens/Homo_sapiens.GRCh38.104.gtf.gz
gzip -d Homo_sapiens. GRCh38.104.gtf.gz
ملاحظة: يوصى بالحصول على ملف GTF من موقع Ensemble على الويب لأنه يحتوي على تعليقات توضيحية للجينوم منظمة في تسلسل هرمي من ثلاثة مستويات ، أي أن كل جين يحتوي على نصوص تحتوي على exons وترجمات اختيارية (على سبيل المثال ، تسلسلات الترميز [CDS] ، موقع بدء الترجمة ، موقع نهاية الترجمة). عندما تكون التعليقات التوضيحية للجين أو النص مفقودة، على سبيل المثال، ملف GTF تم الحصول عليه من UCSC أو NCBI، استخدم GTFupdate لإنشاء GTF محدث مع تعليقات توضيحية كاملة للتسلسل الهرمي بين الوالدين والطفل: GTFupdate original.gtf > update.gtf. بالنسبة لملف التعليقات التوضيحية بتنسيق .gff، استخدم مجموعة أدوات AGAT24 أو أي أداة أخرى للتحويل إلى تنسيق .gtf.
- احصل على تسلسلات rRNA.
- افتح متصفح UCSC Genome في https://genome.ucsc.edu وانقر فوق أدوات | مستعرض الجدول في القائمة المنسدلة.
- في الصفحة المفتوحة، حدد الثدييات للكلاد، والإنسان للجينوم، وجميع الجداول للمجموعة، وrmask للجدول، والجينوم للمنطقة. بالنسبة للتصفية، انقر فوق إنشاء للانتقال إلى صفحة جديدة وتعيين repClass كما يتطابق مع rRNA.
- انقر فوق إرسال ثم قم بتعيين تنسيق الإخراج إلى تسلسل وإخراج اسم الملف ك hg38_rRNA.fa. أخيرا ، انقر فوق الحصول على | الإخراج احصل على تسلسل لاسترداد تسلسل rRNA.
- احصل على مجموعات بيانات التنميط الريبوسومي من أرشيف قراءة التسلسل (SRA).
- قم بتنزيل عينات النسخ المتماثل لمجموعة علاج si-eIF3e وإعادة تسميتها:
فاست كيو تفريغ SRR9047190 SRR9047191 SRR9047192
مف SRR9047190.fastq سي-eIF3e-1.fastq
mv SRR9047191.fastq si-eIF3e-2.fastq
mv SRR9047192.fastq si-eIF3e-3.fastq
- قم بتنزيل عينات النسخ المتماثل للمجموعة الضابطة وإعادة تسميتها:
فاست كيو تفريغ SRR9047193 SRR9047194 SRR9047195
mv SRR9047193.fastq si-Ctrl-1.fastq
mv SRR9047194.fastq si-Ctrl-2.fastq
mv SRR9047195.fastq si-Ctrl-3.fastq
ملاحظة: تم الحصول على معرفات الانضمام إلى SRA لمجموعات البيانات النموذجية هذه من موقع التعبير الجيني الشامل (GEO)25 عن طريق البحث عن GSE131074.
3. تقليم المحولات وإزالة تلوث الحمض النووي الريبي الريبي
- (اختياري) قم بإزالة المحولات من بيانات التسلسل. تخطي هذه الخطوة إذا تم بالفعل قص تسلسلات المحول، كما في هذه الحالة. خلاف ذلك ، استخدم cutadapt لقص المحولات من القراءات.
for i in si-Ctrl-1 si-Ctrl-2 si-Ctrl-3 si-eIF3e-1 si-eIF3e-2 si-eIF3e-3
فعل
cutadapt -m 15 --مباراة-قراءة-أحرف البدل -a CTGTAGGCACCATCAAT \
-o ${i}_trimmed.fastq ${i}.fastq
منجز
ملاحظة: سيختلف تسلسل المحول بعد -a المعلمة اعتمادا على إعداد مكتبة cDNA. يتم تجاهل القراءات الأقصر من 15 (التي يعطيها -m) لأن الأجزاء المحمية من الريبوسوم عادة ما تكون أطول من هذا الحجم.
- قم بإزالة تلوث الحمض النووي الريبي الريبي باستخدام الخطوات التالية:
- تسلسلات مرجع rRNA للفهرس:
ربطة عنق بناء -f hg38_rRNA.fa hg38_rRNA
- قم بمحاذاة القراءات إلى مرجع rRNA لاستبعاد القراءات الناشئة عن rRNA:
for i in si-Ctrl-1 si-Ctrl-2 si-Ctrl-3 si-eIF3e-1 si-eIF3e-2 si-eIF3e-3
فعل
ربطة عنق -n 0 -y -a --norc --best --strata -S -p 4 -l 15 \
--un=./${i}_noncontam.fastq hg38_rRNA -q ${i}.fastq ${i}.aln
منجز
-p يحدد عدد مؤشرات الترابط لتشغيل المهام بالتوازي. وبالنظر إلى الحجم الصغير نسبيا لقراءات الإطار الإقليمي الموحد، ينبغي تحديد حجج أخرى (مثل -n و-y و-a و-norc و--best و--strata و-l) لضمان أن تكون التحالفات المبلغ عنها هي الأفضل. لمزيد من التفاصيل، يرجى الرجوع إلى موقع Bowtie الإلكتروني26.
4. محاذاة القراءات النظيفة مع الجينوم
- إنشاء فهرس الجينوم.
مكدير STAR_hg38_genome
STAR --runThreadN 8 --runMode genomeGenerate --genomeDir ./STAR_hg38_genome --genomeFastaFiles Homo_sapiens. GRCh38.dna.primary_assembly.fa --sjdbGTFملف Homo_sapiens. GRCh38.104.gtf
- قم بمحاذاة القراءات النظيفة (بدون تلوث rRNA) مع المرجع الذي تم إنشاؤه.
for i in si-Ctrl-1 si-Ctrl-2 si-Ctrl-3 si-eIF3e-1 si-eIF3e-2 si-eIF3e-3
فعل
STAR --runThreadN 8 --outFilterType Normal --outWigType تذبذب --outWigStrand تقطعت بهم السبل --outWigNorm RPM --outFilterMismatchNmax 1 --outFilterMultimapNmax 1 --genomeDir STAR_hg38_genome --readFilesIn ${i}_noncontam.fastq --outFileNamePrefix ${i}. --outSAMtype BAM SortedByCoordinate --quantMode TranscriptomeSAM GeneCounts --outSAMattributes All
منجز
ملاحظة: كثيرا ما تتم إضافة نيوكليوتيد غير قالب إلى نهاية 5 'لكل قراءة بواسطة النسخ العكسي27 ، والذي سيتم قصه بكفاءة بواسطة STAR أثناء قيامه بإجراء القطع الناعم بشكل افتراضي. يتم وصف معلمات STAR في دليل STAR28.
- فرز ملفات محاذاة الفهرسة.
for i in si-Ctrl-1 si-Ctrl-2 si-Ctrl-3 si-eIF3e-1 si-eIF3e-2 si-eIF3e-3
فعل
samtools فرز -T ${i}. Aligned.toTranscriptome.out.sorted \
-o ${i}. Aligned.toTranscriptome.out.sorted.bam \
${i}. Aligned.toTranscriptome.out.bam
مؤشر samtools ${i}. Aligned.toTranscriptome.out.sorted.bam
مؤشر samtools ${i}. Aligned.sortedByCoord.out.bam
منجز
5. اختيار حجم RPFs وتحديد مواقعها P
- إعداد التعليقات التوضيحية للنصوص.
prepare_transcripts -g Homo_sapiens. GRCh38.104.gtf \
-و Homo_sapiens. GRCh38.dna.primary_assembly.fa -o RiboCode_annot
ملاحظة: يقوم هذا الأمر بتجميع المعلومات المطلوبة من نسخ mRNA من ملف GTF ويستخرج التسلسلات لكافة نسخ mRNA من ملف FASTA (يتم تجميع كل نسخة عن طريق دمج exons وفقا للهياكل المحددة في ملف GTF).
- حدد RPFs ذات الأطوال المحددة وحدد مواقعها في موقع P.
for i in si-Ctrl-1 si-Ctrl-2 si-Ctrl-3 si-eIF3e-1 si-eIF3e-2 si-eIF3e-3
فعل
metaplots -a RiboCode_annot -r ${i}. Aligned.toTranscriptome.out.bam \
-o ${i} -f0_percent 0.35 -pv1 0.001 -pv2 0.001
منجز
ملاحظة: يقوم هذا الأمر بتخطيط ملفات التعريف المجمعة لنهاية 5 'من القراءات المحاذاة لكل طول حول رموز بدء (أو إيقاف) الترجمة المشروحة. يمكن تحديد موقع P المعتمد على طول القراءة يدويا من خلال فحص مخططات التوزيع (على سبيل المثال ، الشكل 1B) لمسافات الإزاحة بين نهايات 5 أقدام من القراءات الرئيسية وكودون البدء. يقوم RiboCode أيضا بإنشاء ملف تكوين لكل عينة، حيث يتم تلقائيا تحديد مواضع موقع P للقراءات التي تعرض أنماط دورية 3-nt مهمة. تحدد المعلمات -f0_percent و -pv1 و -pv2 عتبة النسبة وتخفيضات القيمة p لتحديد قراءات RPF المخصبة في إطار القراءة. في هذا المثال، يتم تعريف النيوكليوتيدات +12 و+13 و+13 من نهاية 5 أقدام من قراءات 29 و30 و31 nt يدويا في كل ملف تكوين.
- تحرير ملفات التكوين لكل عينة ودمجها
ملاحظة: لإنشاء مجموعة توافقية من ORFs الفريدة وضمان تغطية كافية للقراءات لإجراء تحليل لاحق، يتم دمج القراءات المحددة لجميع العينات في الخطوة السابقة. يتم استخدام قراءات الأطوال المحددة المحددة في ملف merged_config.txt (الملف التكميلي 1) ومعلومات موقع P الخاصة بها لتقييم إمكانات الترجمة ل ORFs في الخطوة التالية.
6. De novo التعليق التوضيحي ترجمة ORFs
- قم بتشغيل RiboCode.
RiboCode -a RiboCode_annot -c merged_config.txt -l yes -g \
-O RiboCode_ORFs_result -S ATG -M 5 -A CTG,GTG,TTG
حيث تكون المعلمات الهامة لهذا الأمر كما يلي:
-c ، ملف تكوين يحتوي على مسار ملفات الإدخال ومعلومات القراءات المحددة ومواقع P الخاصة بها.
-l، بالنسبة للنصوص التي تحتوي على عدة كودونات بدء في المنبع من كودونات التوقف، ما إذا كانت أطول ORFs (المنطقة من كودون البدء الأكثر بعدا إلى كودون التوقف) تستخدم لتقييم إمكانات الترجمة الخاصة بها. إذا تم تعيينها إلى لا، تحديد كودونات البدء تلقائيا.
-s، كودون (كودونات) البدء الأساسي المستخدم لتحديد ORFs.
-A، (اختياريا) كودونات البدء غير القانونية (على سبيل المثال، CTG، GTG، وTTG للإنسان) المستخدمة لتحديد ORF، والتي قد تختلف في الميتوكوندريا أو نواة الأنواع الأخرى29.
-m ، الحد الأدنى للطول (أي الأحماض الأمينية) ل ORFs.
-o ، بادئة اسم ملف الإخراج التي تحتوي على تفاصيل ORFs المتوقعة (الملف التكميلي 2).
-g و -b ، إخراج ORFs المتوقعة إلى GTF أو تنسيق السرير ، على التوالي.
7. (اختياري) ORF القياس الكمي والإحصاءات
- يقرأ عدد RPF في كل ORF.
for i in si-Ctrl-1 si-Ctrl-2 si-Ctrl-3 si-eIF3e-1 si-eIF3e-2 si-eIF3e-3
فعل
ORFcount -g RiboCode_ORFs_result_collapsed.gtf \
-r ${i}. Aligned.sortedByCoord.out.bam -f 15 -l 5 -m 25 -M 35 \
-o ${i}_ORF.counts -s yes -c intersection-strict
منجز
ملاحظة: لاستبعاد الريبوسومات المتراكمة المحتملة حول بداية ونهاية ORFs، لا يتم احتساب عدد القراءات المخصصة في أول 15 (محددة بواسطة - f) وآخر 5 كودونات (محددة بواسطة -l). واختياريا، تقتصر أطوال ال RPFs المعدودة على النطاق من 25 إلى 35 nt (الأحجام الشائعة ل RPFs).
- حساب الإحصاءات الأساسية ل ORFs المكتشفة باستخدام RiboCode:
RiboCode_utils Rscript. R
ملاحظة: RiboCode_utils. يوفر R (الملف التكميلي 3) سلسلة من الإحصاءات لمخرجات RiboCode ، على سبيل المثال ، حساب عدد ORFs المحددة ، وعرض توزيع أطوال ORF ، وحساب كثافات RPF العادية (أي RPKM ، يقرأ لكل كيلوقاعدة لكل مليون قراءة خريطة).
8. تصور (اختياري) ل ORFs المتوقعة
- احصل على المواضع النسبية لكودونات البدء والتوقف ل ORF المطلوب (على سبيل المثال ، ENSG00000100902_35292349_35292552_67) على نسخته من RiboCode_ORFs_result_collapsed.txt (الملف التكميلي 3). ثم ، ارسم كثافة RPF يقرأ في ORF:
plot_orf_density -a RiboCode_annot -c merged_config.txt -t ENST00000622405 \
-s 33 -e 236 --start-codon ATG -o ENSG00000100902_35292349_35292552_67
حيث يحدد - s و -e موضع بدء الترجمة وتوقفها لتخطيط ORF. --start-codon يحدد كودون البدء الخاص ب ORF ، والذي سيظهر في عنوان الشكل. -o يحدد بادئة اسم ملف الإخراج.
9. (اختياري) تحليل الميتاجين باستخدام RiboMiner
ملاحظة: قم بإجراء تحليل metagene لتقييم تأثير ضربة EIF3E القاضية على ترجمة ORFs المشروحة المحددة، باتباع الخطوات التالية:
- قم بإنشاء تعليقات توضيحية للنصوص ل RiboMiner ، والتي تستخرج أطول نسخة لكل جين استنادا إلى ملف التعليقات التوضيحية الذي تم إنشاؤه بواسطة RiboCode (الخطوة 5.1).
OutputTranscriptInfo -c RiboCode_annot/transcripts_cds.txt \
-ز Homo_sapiens. GRCh38.104.gtf -f RiboCode_annot/transcripts_sequence.fa \
-o longest.transcripts.info.txt -o all.transcripts.info.txt
- قم بإعداد ملف التكوين ل RiboMiner. انسخ ملف التكوين الذي تم إنشاؤه بواسطة أمر metaplots الخاص ب RiboCode (الخطوة 5.4) وأعد تسميته "RiboMiner_config.txt". ثم قم بتعديله وفقا للتنسيق الموضح في الملف التكميلي 4.
- تحليلات الميتاجين باستخدام ريبومينر
- استخدم MetageneAnalysis لإنشاء ملف تعريف إجمالي ومتوسط لكثافات RPFs عبر النصوص.
التحليل الفوقي -f RiboMiner_config.txt -c longest.transcripts.info.txt \
-o MA_normed -U codon -M RPKM -u 100 -d 400 -l 100 -n 10 -m 1 -e 5 --norm yes \
-y 100 --نوع UTR
حيث تكون المعلمات المهمة هي: --type، تحليل إما CDS أو UTR المناطق؛ ---norm ، سواء تطبيع كثافة القراءة ؛ -y، عدد الكودونات المستخدمة لكل نسخة؛ -U ، كثافة RPF المؤامرة إما على مستوى الكودون أو مستوى nt ؛ -u و -d ، تحديد نطاق مناطق التحليل المتعلقة ببدء الكودون أو إيقاف الكودون ؛ -l، الحد الأدنى لطول (أي عدد المدونات) ل CDS؛ -M ، وضع تصفية النصوص ، إما العد أو RPKM ؛ -n الحد الأدنى من التهم أو RPKM في CDS للتحليل. -m الحد الأدنى من الأعداد أو RPKM من CDS في المنطقة العادية ؛ -ه، عدد الكودونات المستبعدة من المنطقة العادية.
- قم بإنشاء مجموعة من ملفات pdf لمقارنة الإشغالات الريبوسومية على mRNA في خلايا التحكم والخلايا الناقصة eIF3.
PlotMetageneAnalysis -i MA_normed_dataframe.txt -o MA_normed \
-ز سي-كرترل,سي-eIF3e -r سي-Ctrl-1,si-Ctrl-2,si-Ctrl-3__si-eIF3e-1,si-eIF3e-2,si-eIF3e-3 -u 100 -d 400 --mode mean
ملاحظة: يقوم PlotMetageneAnalysis بإنشاء مجموعة من ملفات pdf. تتوفر تفاصيل حول استخدام MetageneAnalysis و PlotMetageneAnalysis على موقع RiboMiner على الويب30.