June 23rd, 2012
Pooled DNA dizi büyük kohortlarında karmaşık fenotipleri ile ilişkili nadir türevlerini algılamak için hızlı ve maliyet-etkin bir stratejidir. Burada SPLINTER'da yazılım paketi kullanarak 32 kanser ilişkili genlerin havuzlu, yeni nesil dizileme sayısal analiz açıklanmaktadır. Bu yöntem, ölçeklenebilir ve menfaat fenotipi için geçerlidir.
Bu prosedürün genel amacı, nadir fonksiyonel varyasyonun baskınlığını gösteren bir birey popülasyonu içindeki genleri tanımlamaktır. Bu, önce bir DNA örneği popülasyonunun bir araya getirilmesiyle gerçekleştirilir. İkinci adım, yeni nesil bir sıralama kitaplığı oluşturmak ve sıralamaktır.
Bunu, okumaların referans sırasına göre hizalanması ve bir hata modelinin oluşturulması izler. Son adım, kıymık algoritmasını kullanarak hesaplamalı analizdir. Sonuç olarak, havuzlanmış Yeni nesil dizilemenin kıymık analizi, nadir fonksiyonel varyans baskınlığına sahip popülasyonlardaki genleri göstermek için kullanılır.
Bugün, akıl hocam ve iş ortağımız Rob Mitra'nın laboratuvarında yüksek lisans öğrencisi olan Francesco Vilania olacak ve ona laboratuvarımda yüksek lisans öğrencisi olan Enrique Ramos katılacak. Bu tekniğin, tek tek genotipler gibi mevcut yöntemlere göre en büyük avantajı, herhangi bir ön bilgi gerektirmeden karışık bir DNA molekülü popülasyonunda çok hassas bir şekilde nadir dizi varyantlarını tespit etmenize izin vermesidir. Bu yöntem, büyük kohort çalışmalarında nadir varyantlara neden olan yeni hastalıkların sıklığının nasıl belirleneceği gibi genetik ve genomik alanlardaki temel soruların yanıtlanmasına yardımcı olabilir.
Her kıymık deneyi, optimum doğruluk elde etmek için negatif ve pozitif bir kontrolün varlığını gerektirir, PFU ultra yüksek sadakat kullanarak PCR reaksiyon karışımını hazırlayın. DNA polimeraz. Negatif kontrol, klonlanmış bir vektör omurgası gibi genetik varyasyon olmadığı bilinen herhangi bir DNA dizisinden elde edilen bir PCR ürünüdür.
Burada, M 13 MP 18 vektöründen 1.934 baz çifti amplikon kullanılmıştır. Pozitif kontrol, tüm popülasyonda mevcut olan önceden doğrulanmış herhangi bir dizi varyantı kümesi olabilir. Bu veri mevcut değilse, bu laboratuvar, bu tabloda listelendiği gibi PGMT kolay vektörüne klonlanan mühendislik dizilerinin bir karışımından PCR ürünü başına 331 bazdan oluşan yapay bir pozitif kontrol tasarlamıştır.
Bu diziler, hasta havuzundaki gerçek varyantların çeşitli küçük alel frekanslarını taklit etmek için birleştirilir. Bu videoya eşlik eden yazılı protokolde tartışıldığı gibi numunelerin PCR amplifikasyonunu takiben, fazla primerlerin her bir PCR ürününü kyogen kayık hızlı kolon saflaştırması veya büyük ölçekli temizlik için vakum manifoldlu 96 kuyulu filtre plakasını kullanarak temizleyin. Saflaştırıldıktan sonra, her bir PCR ürününü standart teknikler kullanarak ölçün.
Tüm PCR ürünlerini ve kontrollerini molekül sayısına göre normalleştirilmiş bir havuzda birleştirmeye hazırlanın. Konsantrasyona göre havuzlama, küçük amplikonların daha büyük ürünler üzerinde aşırı temsil edilmesine neden olacaktır. Bunun yerine, amplikon başına normalleştirilmiş sayıda molekül toplayın.
Pipetleme sırasında doğruluğu korumak için yeterince büyük olan rastgele sayılar seçin. PCR ürünlerini ve kontrollerini çekin. PCR ürünlerinin ligasyonu gereklidir, çünkü küçük PCR başvuru sahiplerinin parçalanması muhtemelen temsili kendi amaçlarına doğru önyargılı hale getirecektir.
Bu nedenle, çekme PCR ürünlerini parçalanmadan önce büyük bir ambalaja tabi tutuyoruz. Protokolde listelendiği gibi T dört Ligaz, T dört PNK ve PEG kullanarak künt uçlu ligasyon için karışımı hazırlayın. Reaksiyonu 17 saat boyunca 22 santigrat derecede inkübe edin.
20 dakika boyunca 65 santigrat derecede inkübasyon ile devam edin ve daha sonra dört santigrat derecede tutun. 50 nanogram numuneyi bir arose jele yükleyerek ligasyonu kontrol edin. Başarılı ligasyon, şeritte yüksek moleküler ağırlıklı bir bant bulunmasına neden olacaktır.
Daha az viskoz hale getirmek için numuneyi Qiagen PB Tamponunda 10'a bir oranında seyrelterek rastgele bir sonikasyon stratejisi ile DNA parçalanmasına hazırlanın. Daha sonra, 24 örnek diagon düğümü biyo yırtılması kullanarak PCR ürünlerinin büyük özünü parçalayın, dakikada 40 saniye açık ve 20 saniye kapalı olmak üzere 25 dakika boyunca yüksek güçte sonikasyon yapın. Bir agro jel üzerindeki DNA parçalanmasının sonuçlarını kontrol edin ve metinde açıklandığı gibi ışıklı dizileme ile devam edin.
Sıralamaya başlamak için hizalamayı okuyun. Ham sıralamayı dönüştürün, dosyaları eşarp formatına okuyun veya sıkıştırın. Sıkıştırma isteğe bağlıdır.
İlgili herhangi bir bilgiyi kaybetmeden sonraki analiz adımları için zamandan ve yerden tasarruf sağlar. Dahil edilen hizalama aracını kullanarak, ham okumaları açıklamalı daha hızlı referans dizisine hizalayın. Hedeflenen bölgelere özgü olarak, PCR reaksiyonlarının yanı sıra pozitif ve negatif kontroller de bulunur.
Giriş formatı eşarp formatında veya sıkıştırılmış olmalıdır. Ardından, metinde açıklandığı gibi dosya etiketleme işlemini gerçekleştirin. Her çalıştırma, her çalıştırma için model hatalarına doğru varyant çağrısı için karakterize edilecek benzersiz bir sıralama hatası profili oluşturur.
Sıralı varyasyonun dağıtıldığı bilinen bir iç denetim, hizalanmış etiketli dosyadan her havuz örnek kitaplığına dahil edilir. Negatif kontrol referans dizisi ile birlikte verilen aracı kullanarak bir hata modeli dosyası oluşturun, tüm negatif kontrol dizisi kullanılabilir veya alternatif olarak beş asal ve üç asal ucu ile belirtildiğinde yalnızca bir alt küme kullanılabilir. Benzersiz okumalar ve sahte sayımlar her zaman uygulanmalıdır.
Araç, sıfır, bir veya iki ile biten çıktı dosyası adı parametresi olarak adlandırılan üç dosya oluşturur. Bu dosyalar, kıymık ile varyant çağrısı için sırasıyla sıfır birinci ve ikinci dereceden bir hata modeline karşılık gelir. İkinci dereceden hata modeli, çalıştırma hata oranı profilinin görselleştirilmesi için her zaman kullanılmalıdır.
Hata modeli grafiğini çizmek için kullanılan Pearl komut dosyası, sıfırıncı dereceden hata modeli dosyasında bir PDF hata grafiği oluşturmak için kullanılabilir. Çizim dosyası, belirli hata eğilimlerini ortaya çıkarır ve analiz için maksimum okuma tabanı sayısını çıkarmak için kullanılabilir. Aşağıdaki bölümde, nadir dizi varyantlarını tespit etmek için hata modeli kullanılarak hizalanmış dosyada splinter'ın nasıl çalıştırılacağı gösterilecektir.
Analizdeki ilk adım, referans dizisini ve hata modelini kullanarak hizalanmış dosya üzerinde splinter'ı çalıştırmaktır. Tek okuma bazları, kusurlu olduğu tespit edilirse analizden çıkarılabilir. P değeri sınırı, varyant çağırma analizinin ne kadar katı olacağını belirler.
Eksi 1.301'lik minimum kesme iyi bir başlangıçtır. Havuz boyutu seçeneği, gerçek havuzdaki tek bir alelinkinden daha düşük küçük alel frekanslarına sahip potansiyel varyansı ortadan kaldırarak algoritma sinyalini gürültü ayrımına göre optimize eder. Havuz boyutu seçeneği, deneyde analiz edilen gerçek alel sayısından daha büyük olan en yakın değere ayarlanmalıdır.
Daha düşük frekanslarda çağrılan varyans, gürültü olarak göz ardı edilecektir. Tüm parametreleri ve dosya adlarını girdikten sonra splinter'ı çalıştırın. Bu dosya, varyant türünün konumunun açıklamasıyla birlikte örnek genelinde istatistiksel olarak anlamlı olan tüm isabetleri döndürür.
DNA zinciri başına P değeri, varyantın frekansı ve DNA zinciri başına toplam kapsama alanı. Liste şişesi, numune boyunca kapsama alanını normalleştirmek için kıymık tarafından kullanılır. İlk alan ilgilenilen amplikonu gösterirken, ikinci alan mutasyonun mevcut olduğu konumu gösterir.
N, dizinin geri kalanının herhangi bir mutasyon içermediğini gösterir. Bir normalizasyon olan pozitif kontrolün analizi, belirli bir çalışma için hassasiyeti ve özgüllüğü en üst düzeye çıkarmanın anahtarıdır. Bu önemlidir, çünkü büyük olasılıkla eksi 1.301'lik ilk kesme tüm yanlış pozitifleri ortadan kaldırmak için yeterli olmayacaktır.
Her kıymık analizi, çağrılan her varyant için gerçek P değerini gösterecektir ve bu bir öncelik olarak tahmin edilememektedir. Bununla birlikte, tüm analiz, bilinen gerçek pozitif baz pozisyonları için ilk çıktıda görüntülenen en az katı P değeri kullanılarak tekrarlanabilir. Bu, gerçek pozitiflere kıyasla tipik olarak çok daha az önemli P değerlerine sahip olan yanlış pozitiflerin tümü olmasa da çoğunu hariç tutarken, tüm gerçek pozitifleri korumaya hizmet edecektir.
Bu işlemi otomatikleştirmek için, kesme test cihazı komut dosyası kullanılabilir. Kesme test cihazı komut dosyası, bir kıymık çıktı dosyası ve normalleştirme için kullanılanla ilgili olarak sekmeyle ayrılmış bir dosya biçiminde pozitif kontrol isabetlerinin bir listesini gerektirir. Ortaya çıkan çıktı, aşamalı olarak en uygun olana ulaşan bir kesme listesi olacaktır.
Son satır, çalışma için en uygun sınırı temsil eder ve bu nedenle veri analizi için kullanılabilir. En optimal sonuç, birinin duyarlılığını ve özgüllüğünü elde etmektir. Bununla birlikte, ulaşılmazsa, kıymık analizi, dahil edilen okuma tabanlarının sayısı değiştirilerek optimize edilebilir.
Son kesme, kıymık çıktı dosyasını optimum kesmenin altındaki isabetlerden filtreleyecek olan kesme kesme komut dosyası kullanılarak verilere uygulanabilir. Bu adım, örnekte bulunan keskin nişancıları ve indelleri içerecek olan son kıymık çıktı dosyasını oluşturacaktır. Eklemeler için çıktının, değiştirmeler veya silmeler için çıktıdan biraz farklı olduğunu lütfen unutmayın.
Havuzlanmış bir örnekteki tek bir alel için kapsama fonksiyonunun bir fonksiyonu olarak doğruluk, bu tür bir çizimde görselleştirilir. Doğruluk, eğrinin altındaki alanın, bir alıcı operatör eğrisinin UC'sini kısaltması olarak tahmin edilir ve 0,5'lik rastgele bir doğruluktan 1,0'lık mükemmel bir doğruluğa kadar değişir. Bu örnekte, bir UC, 200 501.000 alel havuzlarında tek mutant alellerin tespiti için alel başına kapsama fonksiyonunun bir fonksiyonu olarak çizilmiştir.
Burada bir UC, eklemeler, silmeler ve değiştirmeler için toplamın bir fonksiyonu olarak çizilir. Bu hata grafiği, belirli bir konumda hatalı bir tabanın dahil edilme olasılığını gösterir. Hata profili, sıralama okumasının üç asal ucuna doğru artan bir eğilimle düşük hata oranlarını gösterir.
Özellikle, farklı referans nükleotidleri farklı hata olasılıkları gösterir. Bu grafik, alel başına 25 kattan fazla kapsama alanına sahip pozisyonlar için alel frekansını tahmin etmede kıymıkın doğruluğunu ortaya koymaktadır. Kıymık tarafından tahmin edilen havuzlanmış DNA alel frekansları ile genom çapında ilişkilendirme çalışmaları veya GWAS sonuçları ile ölçülen alel sayıları arasında bir karşılaştırma.
Çok yüksek bir korelasyonla, 974 bireyden oluşan bir popülasyon çekildi ve sıralama için 20 kilobazın üzerinde hedeflendi. Nadir varyantların tespiti için kıymık uygulandı. Standart protokolü takiben, her bireyin daha önce etiketli ve yeni varyantların genotiplemesi arasındaki gwas uyumu ile gerçekleştirilen genotiplemesi vardı.
Havuzlanmış örnekte çağrılanlar mükemmeldi. İkisi popülasyonda nadir olan üç varyant, sıralama sonuçlarından denovo olarak adlandırıldı ve bireysel piro dizilemesi, küçük alel frekansları veya piro dizilimi ile çekilen dizileme arasındaki matematik uyumu ile doğrulandı. Havuza alınan örneğinizde nadir bulunan varyansınızı bulmayı bitirdikten sonra, birçok kişi tanımlanan varyansın işlevsel sonuçlarının neler olduğunu bilmek ister.
Bu nedenle, varyansınızın ek açıklaması, bir geliştirmeden sonraki süreçte bir sonraki adım haline gelir. Bu teknik, DNA dizileme alanındaki araştırmacıların, büyük bir popülasyon çalışmasında nadir varyantları karakterize etmek için nadir varyantları hızlı ve uygun maliyetli bir şekilde incelemelerinin yolunu açtı. Bu videoyu izledikten sonra, bir havuzdaki nadir dizi varyantlarının, kıymık kullanılarak DNA örneğinin nasıl tespit edileceğini iyi anlamış olmalısınız.
Toplu DNA dizilimi, büyük popülasyonlarda karmaşık özelliklerle bağlantılı nadir genetik varyantları tanımlamak için verimli bir yöntemdir. Bu makalede, 32 kanserle ilgili genin toplu dizileme verilerinin SPLINTER yazılım paketi kullanılarak yapılan hesaplamalı analizine değinilmektedir.
Detecting rare genomic variants in large populations is critical for target validation in complex disease research, where common variants fail to explain phenotypic variability. The SPLINTER-enabled pooled sequencing approach provides a cost-effective, scalable method to interrogate therapeutic hypotheses by identifying low-frequency functional variants without prior variant knowledge. This supports early discovery de-risking by enabling allele frequency estimation and variant confirmation in disease-relevant cohorts, directly informing portfolio prioritization and mechanistic follow-up.
The method fits within the discovery continuum from hypothesis generation to lead identification, providing variant detection outputs that inform target selection and assay readiness.