$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Homo sapiens ve Drosophila melanogaster , Mus musculus ve Danio rerio gibi birkaç temel model hayvan türü şu andaki ve geçmiş işlevsel genomik çalışmaların çoğunu temsil etmektedir. Bununla birlikte, yüksek verimli sıralama teknolojisinin hızla azalan maliyeti, modeli olmayan ( aka "ihmal edilmiş" veya "yetersiz") hayvan türleri için fonksiyonel genomik için fırsatlar sağlamaktadır 1 . Model dışı organizmalar sık sık ekonomik olarak ilgili türleri ( örneğin istiridye, karides, yengeç) temsil eden ve model türlerinde bulunanların dışında yeni fenotipleri ve biyolojik sistemleri araştırmak için fırsatlar sunduğu için bu, genomikte önemli bir geçiştir.
Yetersiz organizmalar benzersiz biyolojik sistemleri araştırmak için cazip bir fırsat sunmasına rağmen, biyoenformatik analiz sırasında araştırmacılar tarafından karşılaşılan birçok zorluk vardır. BazılarıBir başka deyişle, referans genom, organizmaya özgü ontolojiler gibi yetersiz organizmalarda çalışan araştırmacılar için genetik kaynakların bulunmaması sonucunda ortaya çıkan zorluklar geniş veri setlerini işlemek için doğar. Nükleik asit izolasyonu ve sekanslama zorlukları genellikle rutin olarak bulunur Veri analizininkilerle karşılaştırılması ve bu tür biyoinformatik analizler, genellikle dizinleme projelerinin en hafife alınmış maliyeti olduğu kanıtlanmıştır 2 . Örneğin, basit bir yeni nesil sıralama biyoenformatik analiz, aşağıdaki adımlardan oluşabilir: kaliteli filtreleme ve ham dizileme okumaları düzeltme, kısa okumaları daha büyük bitişik parçalara toplama ve biyolojik anlamayı kazanmak için ek açıklama ve / veya diğer sistemlerle karşılaştırmalar. Görünüşte basit olmakla birlikte, bu örnek iş akışı, laboratuvar tezgahı bilgisayarının ötesinde özel bilgi ve hesaplama kaynakları gerektirir;Model organizmalar.
Doğal zorluklar altyapı veya bilgi temelli olabilir. Klasik bir altyapı zorluğu, uygun hesaplama kaynaklarına erişimdir. Örneğin, montaj ve açıklama işlemi, RAM (256 GB-1 TB) büyüklüğüne ve çalıştırılacak birkaç işlemci / çekirdeğe sahip güçlü bilgisayarlar veya bilgisayar kümeleri gerektiren hesaplama yoğun algoritmalara dayanır. Ne yazık ki, birçok araştırmacı ya bu tür bilgi işlem kaynaklarına erişemiyor ya da bu sistemlerle etkileşime girmek için gerekli bilgiye sahip değil. Diğer araştırmacılar üniversiteleri veya kurumları aracılığıyla yüksek performanslı bilgi işlem kümelerine erişebilir ancak bu kaynaklara erişim sınırlı olabilir ve bazen hesaplama saat başına ücret alınır, yani CPU işlemcilerinin sayısı ile gerçek zamanlı "saat Saatler "içinde çalışıyor. ABD Ulusal Bilim Vakfı tarafından finanse edilen siyasal altyapı sisteminden yararlanmaAmerika Birleşik Devletleri'nde ve dünyanın dört bir yanındaki araştırmacılar için kaynakları hesaplamak için ücretsiz erişim sağlayan Cyverse 3 gibi, burada gösterildiği gibi altyapı sorunlarını hafifletmeye yardımcı olabilir.
Tipik bir bilgi temelli soruna bir örnek, tam analizler için gerekli yazılımı anlamaktır. Sıralamaya dayalı bir projeyi etkin bir şekilde yürütmek için, araştırmacıların biyoinformatik analizler için geliştirilmiş sayısız yazılım araçlarını bilmeleri gerekir. Her bir paketin öğrenilmesi tek başına zor olsa da, paketlerin sürekli yükseltildiği, yeniden yayınlandığı, yeni iş akışlarına dahil edildiği ve bazen yeni lisanslar altında kullanılması kısıtlandığından daha da kötüye gidiyor. Buna ek olarak, bu araçların giriş ve çıkışlarını birbirine bağlamak, bazen bunları uyumlu hale getirmek için veri türlerini dönüştürmeyi ve iş akışına başka bir araç eklemeyi gerektirir. Son olarak, hangi yazılım paketininEn iyi 'bir analiz için ve belirli deneysel koşullar için sıklıkla en iyi yazılımı tanımlamak ince bir farktır. Bazı durumlarda, yazılımın kullanışlı incelemeleri mevcuttur, ancak yeni güncellemelerin ve yazılım seçeneklerinin sürülmesine bağlı olarak, bunlar hızla yenilenmektedir.
Yetersiz organizmaları araştıran araştırmacılar için, doğuştan gelen bu zorluklar, yeni bir organizmada verilerin analiz edilmesiyle ilgili zorlukların yanında ortaya çıkmaktadır. Bu yetersiz organizmaya özgü zorluklar, gen açıklaması sırasında en iyi şekilde gösterilir. Örneğin, yetersiz organizmalar sıklıkla gen ortolojisi ve işlevini belirlemek için makul bir şekilde kullanılabilen yakından ilişkili bir model organizmasına sahip değildirler ( örneğin deniz omurgasızları ve Drosophila ). Birçok biyoinformatik araç aynı zamanda, gen işlevini tanımlamak için kullanılabilen yapısal motifleri tanımlamak için "eğitim" gerektirir. Bununla birlikte, eğitim verileri genellikle mod için geçerlidirEl organizmaları ve eğitimli gizli Markov modelleri (HMM), biyologların ve hatta birçok biyoinformatikçinin dışındadır. Son olarak, model organizmaların verilerini kullanarak ek açıklama yapılabilse bile, model organizmalarla ilişkili bazı gen ontolojileri, yetersiz organizmanın biyolojisi ve doğal tarihi dikkate alındığında ( örneğin , Drosophila'dan karidese bilgi aktarma) mantıklı değil.
Bu güçlüklerin ışığında, özellikle de akılda kalan, yetersiz organizmalar üzerine yeni analizler yapan araştırmacılar ile biyoenformatik kaynakların geliştirilmesi gerekmektedir. Önümüzdeki birkaç yıl sürecek fonksiyonel genomik sıralama projeleri, model ve eksik organizmalar arasındaki boşluğu kapatmaya yardımcı olacaktır ( https://genome10k.soe.ucsc.edu/ ), ancak zorlukları çözmek için geliştirilmesi gereken birçok araç bulunmaktadır Yukarıda düşünülmüş. CyVerse, i ekosistemlerini yaratmaya adamıştırVeri yönetimini, biyoinformatik analiz araçlarını ve veri görselleştirmelerini yaşam bilimcilerine sunmak için varolan siyasal altyapıyı ve üçüncü parti uygulamalarını birbirine bağlayarak kullanılabilirlik. Birlikte çalışabilirlik, ölçeklenebilir hesaplama kaynakları sağlayarak ve dosya biçimi dönüşümlerini ve platformlar arasında aktarılan veri miktarını sınırlayarak biyoinformatik uygulamalar ve platformlar arasındaki geçişlerin düzelmesine yardımcı olur. CyVerse, Discovery Environment (DE 4 , Atmosfer 5 ve Veri Deposu 3 de dahil olmak üzere çeşitli platformlar sunmaktadır. DE, web tabanlı ve kullanıcı dostu "point-and-click" formatlarına ("uygulamalar" olarak adlandırılan birçok biyoinformatik analitik araçlara sahiptir) sahiptir ") Ve büyük veri kümelerinin ( yani, ham dizilim okumaları, bir araya getirilmiş genomların) depolandığı ve yönetildiği Data Store için grafiksel kullanıcı arabirimidir (GUI). Atmosfer, araştırmacılara yüksek esneklik sağlayan bulut bilgi işlem hizmetidir.Önceden kurulmuş geniş bir biyoinformatik araçlara sahip olan Sanal Makine hesaplama kaynakları kullanılarak. Bu platformların her ikisi de Veri Deposu'na bağlıdır ve burada açıklanan gibi iş akışları oluşturmak için birlikte kullanılabilir. Bu rapor de novo transkriptom montajı ve diferansiyel gen ekspresyon analiz çalışma akışları üzerine odaklanır ve ayrıca biyoinformatik analizler geliştirme ve yürütme ile ilgili bazı en iyi uygulamalara değinir. CyVerse'ın daha geniş görevine ( http://www.cyverse.org/about ) ve ayrıntılı platform açıklamalarına ( http://www.cyverse.org/learning-center ) ilişkin açıklama halka açıktır. Burada açıklanan tüm analizler Discovery Environment 4 (DE) ve Atmosfer 5'i kullanır ve araştırmacıların tüm hesaplama düzeyleri için onları erişilebilir kılacak şekilde sunulur. DE iş akışları ve AtmosferUzun vadeli provenance, tekrar kullanılabilirlik ve tekrarlanabilirlik sağlamak için resimlere doğrudan URL'ler kullanılarak başvurulabilir.