9 Mayıs 2017
Bu protokol, acemi biyoinformatikçiler için karşılaştırmalı bir de novo transkriptom derlemesi ve açıklama iş akışını ana hatlarıyla belirtir. İş akışı tamamen CyVerse aracılığıyla ücretsiz olarak kullanılabilir ve Veri Deposu ile bağlanır. Komut satırı ve grafik kullanıcı arayüzleri kullanılır, ancak gereken tüm kodlar kopyalanıp yapıştırılabilir.
Bu prosedürün genel amacı, ham FASTQ dosyalarından başlayarak De Novo transkriptomik aracılığıyla diferansiyel gen ekspresyonunu değerlendirmek, birleştirmek, açıklama eklemek ve karşılaştırmaktır. Bu yöntem, bir organizmanın içinde hangi transkriptlerin olduğu, bu transkriptlerin bu organizmaların içinde ne yaptığı ve deneysel koşullar arasındaki farkların neler olduğu dahil olmak üzere karşılaştırmalı ve moleküler biyolojideki soruları yanıtlamaya yardımcı olabilir. Bu tekniğin temel avantajı etkileşimli bir ortam sağlamasıdır.
Talep üzerine hesaplama kaynakları sağlar ve araştırmacıların RNA-Seq verilerini hemen analiz etmeye başlamalarına olanak tanır. Bu yöntem, biyolojik sistemlerin nasıl değiştiğini anlamak için birden fazla doku, koşul ve zaman noktası içeren tek bir organizma içindeki deneyleri karşılaştıran araştırmacılar için özellikle yararlıdır. Bu yöntem, genomları olmayan model olmayan organizmalara odaklanmıştır, ancak genom düzenekleri mevcut olan organizmalara, hatta montajlarında on veya yüz binlerce iskele bulunanlara bile uygulanabilir.
Başlamak için, Keşif Ortamında Atmosfere erişin. Kayıt sayfasına giderek ücretsiz bir CyVerse hesabı talep edin. Hesaba kaydolmak için kurumsal bir e-posta kullanın.
Ardından, uygulamalar ve hizmetler sekmesine gidin ve Atmosphere'e erişim talep edin. Keşif Ortamı'na erişim otomatik olarak verilir. DE olarak kısaltılan Keşif Ortamı'nda oturum açın. Ardından, veri deposundaki tüm klasörleri içeren bir menü açmak için Veri sekmesini seçin.
Projeyle ilişkili tüm verileri barındıracak bir ana proje klasörü oluşturun. Veri penceresinin üst kısmındaki araç çubuğunu bulun ve Dosya, Yeni Klasör'ü seçin. Klasör adlarında veya herhangi bir giriş çıktı dosyası adında boşluk veya özel karakterler kullanmayın.
Bunun yerine, uygun olduğunda alt çizgi veya tire kullanın. Ham FASTQ dizi dosyalarını ve klasörü (1_Raw_Sequence, Klasör A_Raw_Reads adlı bir alt klasöre yükleyin. İki gigabitin altındaki dosyalar için, ana DE masaüstündeki Veri düğmesine tıklayarak veri penceresi araç çubuğuna gitmek için veri deposunun basit karşıya yükleme özelliğini kullanın.
Yükle, Masaüstünden Basit Yükleme'yi seçin. Ardından, yerel bilgisayardaki ham FASTQ sıralama dosyalarına gitmek için Gözat düğmesini seçin. DE'deki FastQC uygulamasını kullanarak karşıya yüklenen ham sıralama okumalarını değerlendirin. DE'de bulunan tüm analiz uygulamalarını içeren bir pencere açmak için ana DE masaüstündeki Uygulamalar düğmesini seçin. Pencerenin üst kısmındaki arama araç çubuğunda FastQC aracını arayın.
Birden fazla FASTQ dosyası varsa çoklu dosya sürümünü açın. Dosya'yı seçin ve yeni bir klasör oluşturun, ardından bu klasörü çıkış klasörü olarak seçin. FASTQ okuma dosyalarını Giriş Verilerini Seç adlı araç penceresine yükleyin ve Analizi Başlat'ı seçin.
DE'de programlanabilir Trimmomatic uygulamasını arayın ve açın. Ham FASTQ okuma dosyalarının klasörünü ayarlar bölümüne yükleyin. Sıralama dosyalarının tek mi yoksa çift uçlu mu olacağını seçin.
Gözat düğmesini seçerek ve dosya yolunu görüntüleme kutusuna yapıştırarak sağlanan standart denetim dosyasını kullanın. Trimmomatic kontrol dosyasını seçin ve analizi başlatın. Kaliteli kırpma dizisi okumaları için, DE'de Sickle uygulamasını arayın ve açın. Giriş okumaları olarak kırpılan FASTQ okumalarını seçin ve çıktı dosyalarını yeniden adlandırın.
Seçeneklere kalite ayarlarını dahil edin. Wiki sayfasına giderek Atmosphere örneğinin en güncel sürümünü açın. Trinity ve Trinotate görüntüsünün en son sürümünün bağlantısını seçin.
Başlatmak İçin Oturum Aç düğmesini seçin ve ardından Atmosphere bulut sunucusunu adlandırın. Orta3 veya büyük3 bir örnek boyutu seçin. Bulut sunucusunu başlatın ve derlenmesini bekleyin.
Bir Atmosfer görüntüsü döndürülemezse, daha küçük bir örnek için başvurmayı deneyebilir veya daha büyük bir tahsis için Jetstream'e başvurabilirsiniz. Tüm ayrıntılar tamamlayıcı wiki'de. Trinity çıktı dosyalarını DE'deki 3_Assembly klasörüne taşıyın ve klasörü A_Trinity_de_novo_assembly olarak etiketleyin.
Trinity'yi çalıştırmak, komut satırı bilgisi ve büyük analizleri tamamlamak için birkaç gün veya muhtemelen haftalar gerektirir. Komut satırını anlamaya yardımcı olmak için wiki'ye bağlı ücretsiz kaynaklar mevcuttur. Birleştirilen her transkriptomu A_Trinity_de_novo_assembly klasörünün içinde bir alt klasör verin.
Her transkriptomla ilişkili organizmaların ve tedavilerin bilimsel adları da dahil olmak üzere benzersiz adlar kullanın, ardından 3_Assembly klasöründe Klasör B_rnaQUAT_Output adlı başka bir alt klasör oluşturun. De Novo rnaQUAST adlı uygulamayı açın. Analizi adlandırın ve çıkış klasörü olarak Klasör B_rnaQUAST_Output'ı seçin.
Transkript kod çözücüyü arayın ve Keşif Ortamındaki De Novo Trinity Assembly çıktı fasta dosyasında kod çözücüyü çalıştırın. Analizin DE.Name deseq2 uygulamasını açın ve çıktı klasörünü 4_Differential_Expresssion olarak seçin. Giriş bölümünde, Trinity Derlemesi çalıştırmasından sayımlar tablosu dosyasını seçin.
Ayrıca, contig adlarının bulunabileceği sütunu seçin. Hangi sütunların karşılaştırıldığını belirlemek için counts veri tablosu dosyasından sütun başlıklarını girin. Koşulların her biri arasına virgül ekleyin.
Contig adlarını içeren ilk sütun başlığını dahil etmeyin. Çoğaltmalar için aynı adı yineleyin. İkinci satırda, karşılaştırılacak iki koşulun adlarını sağlayın.
İlk satırda verilen sütun başlığı adlarını eşleştirin. Burada, her ön işleme adımından sonra sıralama okumalarının sistematik bir karşılaştırması gösterilmektedir. Kırpma işleminden sonra, okuma daha az çarpık GC içeriğine ve dizi içeriğine sahip olmalı ve yüksek kalite puanına sahip okumalar için daha büyük bir orana sahip olmalıdır.
De Novo transkriptomlarını bir araya getirmek için yüksek kaliteli okumalar gereklidir. Hızlı kalite kontrolünden elde edilen sonuçlar, dizilenen organizmalara ve numunelere bağlıdır. Karşılaştırılacak tüm numuneler arasında tekdüzelik ile, aşağı akış ön işleme okumalarının birincil amacıdır.
rnaQUAST, taksonomik sınıflardaki bilinen çekirdek genlere dayalı montajlar hakkında özet istatistikler oluşturmak için güçlendirme kodundan yararlanır. Birleştiricilerin doğruluğu, transkript başına uyumsuzluk sayısı ve kaç transkriptin kanonik genlerle eşleştiği ile ortaya çıkar. Burada sunulan son dört alt nokta, contig ve izoform uzunluğunun özet istatistiklerinin yanı sıra beklenen izoformların kapsamını sağlar.
NAx, y ekseninin uzunluğundan daha uzun olan contiglerin yüzdesini temsil eder. Birleştirilmiş kesir, uzunluğuna bölünen en uzun tek birleştirilmiş transkripttir. Kapsanan fraksiyon olarak, BUSCO'dan gelen çekirdek prokaryotik veya ökaryotik genler tarafından beklendiği gibi tam birleştirilmiş transkriptin izoformlarının yüzdesidir.
Bu videoyu izledikten sonra, transkriptomların nasıl birleştirileceğini ve girileceğini iyi anlamış olmalısınız. Ek olarak, bu protokol iki koşul arasındaki diferansiyel gen ekspresyonunu tespit etmenize izin verecektir. Genel olarak, bireyler biyoinformatik paketlerle mücadele ederler çünkü çok fazla var, bunlarla ilişkili çok sayıda ayar ve değişken var ve genellikle gerçekten yürütmek için komut satırı hakkında bilgi sahibi olmanız gerekiyor.
Diğer araştırmacıların ne yapıldığını anlayabilmesi için veri girdilerinizi ve analiz çıktılarınızı etiketlemek ve düzenlemek önemlidir. Sipariş adımlarının tamamlandığını, program sürümlerini ve örnek bilgileri eklemelisiniz. Ayrıca, klasör veya dosya adlarındaki boşlukları atlayın.
Yeni araçlar ve araçların yeni sürümleri sürekli olarak entegre edilmektedir, ancak araçların eski sürümleri de korunmaktadır. Tüm değişiklikler eşlik eden wiki'ye kaydedilecektir. Bu prosedürü takiben, fenotip varyasyonu, ekspresyon profillerini değiştiren koşullar ve fonksiyonel genomik için ilgilenilen genlerin tanımlanması gibi soruların yanıtlanmasına yardımcı olmak için ağ analizi, GO zenginleştirme ve metabolik yol tanımlama gibi diğer biyoinformatik yöntemler gerçekleştirilebilir.
Bu protokol, yeni başlayan biyoinformatikçiler için tasarlanmış, de novo transkriptom montajı ve anotasyonu için bir iş akışını özetlemektedir. CyVerse üzerinden erişilebilen, RNA-Seq verilerinin analizi için etkileşimli bir ortam sunmaktadır.
Bu iş akışı, biyofarmasötik Ar-Ge ekiplerinin model olmayan organizmalardan yüksek kaliteli transkriptomik veriler üretmesini sağlayarak, yeterince araştırılmamış biyolojik sistemlerde hedef doğrulamayı destekler. De novo montaj ve diferansiyel ekspresyon analizi için etkileşimli, bulut tabanlı bir ortam sunarak, erken keşif aşamasındaki mekanistik risk azaltma süreçlerinin önündeki engelleri ortadan kaldırır. Bu yaklaşım, deneysel perturbasyonlara verilen organizmaya özgü yanıtlar incelenirken öngörü güvenini artırarak portföy önceliklendirmesine bilgi sağlar.
Yöntem, öncü bileşik tanımlama çalışmaları öncesinde hipotez testlerini ve yolak netleştirmeyi destekleyerek, erken keşif sürecine uyum sağlar.