Bu protokol, bireyler içindeki çift örneklerin genetik kimliğini doğrulayarak bireyler arası kontaminasyon ve uyumsuzluğu tespit etmek için bir kalite kontrol çerçevesinin uygulanmasını açıklar.
Yöntem makalesi
Bu protokol, bireyler içindeki çift örneklerin genetik kimliğini doğrulayarak bireyler arası kontaminasyon ve uyumsuzluğu tespit etmek için bir kalite kontrol çerçevesinin uygulanmasını açıklar.
Hasta biyoörneklerinin yüksek verimli işlemesi, yeni nesil dizileme ile ve moleküler verilerin hasta düzeyi ve örnek düzeyindeki klinik verilerle karşılaştırılması, biyonumune tutum zinciri boyunca örnek tanımlayıcılarının hassas takibi ve eşleşmesini gerektirir ve biyobelirteç çalışma sonuçlarının sağlam yorumlanmasını sağlamak için kritik öneme sahiptir. Numune ve veri işleme iş akışlarında bireysel adımların izlenmesinin yanı sıra, biyobilişim çözümleri aynı hastadan alındığını doğrulamak için de kullanılabilir. Burada, aynı bireyden gelen eşleşen örnekleri belirlemek için biyoinformatik iş akışının kullanımı gösterilmektedir. Analiz iş akışı, hasta örneklem kaynağı için karşılaştırılıp doğrulanacak herhangi iki veya daha fazla NGS veri seti çifti için uygundur. Genom genelinde örnek karşılaştırmalarına dayalı bir puanlama algoritması, kullanıcının iki örneğin aynı bireyden gelip çıkmadığını belirlemesini sağlar. Özellikle, seçilmiş bağlantı dengesizliği blokları içindeki tek-nükleotid polimorfizmaları (SNP) örnekleri tanımlamak ve karşılaştırmak için kullanılır. Eşleşen ve uyumsuz örneklerin izinli ve sıkı seçimi için eşik kombinasyonları belirlendi. Bu protokolün faydası, klinik tümör dokusu ve kan örneklerinin kalite kontrolü ve doğrulanmasına uygulanmasıyla gösterilmiştir; bu yöntem 2.000'den fazla hastadan çok sayıda omik modalitesini kapsamaktadır.
Klinik örneklerin büyük ölçekli toplanması ve analizi, aynı veya farklı modalitelerden ve klinik hasta ve örnek düzeyindeki verilerin doğru eşleştirilmesi, doğru yorumlama ve bilinçli karar verme için gerekli olduğundan, örneklerin tutma zinciri boyunca tam olarak takip edilmesini gerektirir. İyi klinik uygulamalar altında örnek işleme protokollerini kolaylaştırmak için yapılan yoğun çabalara rağmen, örnek değişimi veya yanlış etiketleme çeşitli aşamalarda, biyopsi/örnek çıkarmadan hazırlık ve işleme aşamalarına ve veri analiz aşamasına kadar gerçekleşebilir (Şekil 1). Artan örnek sayısı ve örnek işleme adımlarıyla birlikte, numune değişimi ve çapraz kontaminasyon olasılığı artar. Bu, yanlış örnek-hasta ilişkilerine sahip verilerin analizine yol açabilir, bu da sonraki analizleri ve sonuçları etkileyebilir ve bu nedenle klinik genomik araştırmalarında dikkate alınması gereken önemli bir unsurdur. Klinik çalışmalarda, örneklerin yanlış tanımlanması, özellikle küçükörneklem büyüklüğü 1 olan çalışmalarda genel sonuçları güçlü şekilde etkileyebilir. Bireyler arasında kontaminasyon, aynı hastadan birçok numune karşılaştırıldığında farklılıkların belirlenmesinde güç kaybına ve yanlış pozitif sonuçlara yol açabilir. Örnek değişimleri, genetik ilişkilerin tespit gücünü etkiler ve genom çapında ilişki analizinde karmaşık özelliklerin kalıtsallığının küçümsenmesine yolaçabilir 2.
Kanser araştırmaları, genomik ve transkriptomik analizlerin yapıldığı alanlardanbiridir3, özellikle genomik ve fenotipik hastalar arası ve intra-hasta heterojenliği izlemektedir. Kanser araştırmalarının bir yönü, aynı hastadan alınan örneklerin farklı mutasyonlar ve kopya sayı değişiklikleri taşıyabileceği ve böylece bağımsız varyant allelfrekansları gösterebilmesidir 4. Özellikle birden fazla omik türünden veri yorumlanırken, aynı bireylerden alınan çoklu modal veri setlerinin doğru entegrasyonu önemlidir ve bu nedenle bireyler arasıkirlenmenin izlenmesini gerektirir 5,6,7,8. Kanser genom atlası programı (TCGA) ve akciğer genomi araştırma konsorsiyumu (LGRC) veri setleri üzerinde yapılan çalışmalar, bazı çalışmalarda ortalama %3 örnek yanlış tanımlama oranlarını ve %~20'ye kadar çıktığınıtespit etmiştir: 2,9,10,11. Bu örnekler, örnek değişimlerinin ve çapraz kontaminasyonun izlenmesinin öneminigösterir 12. Her süreç adımında rutin izleme ve kalite kontrolünün ötesinde, sıralama sonuçlarının karşılaştırmalı analizi nihai kalite kontrolü görevini görür. Bu, veri analizi ve yorumuna geçmeden önce doğru örnek eşleşmesini sağlar.
Aynı bireyden mi kaynaklandığını belirlemek için çeşitli biyoinformatikyaklaşımlar geliştirilmiştir 1,4,13,14,15,16. İlk yaklaşımlar, örnek kimliğini doğrulamak için kısa tandemtekrarlardan yararlandı 17. RNA ve DNA seviyesinde yeni nesil dizileme verileri artık tek nükleotid polimorfizmlerine dayalı örnekler çiftleri arasında karşılaştırma yapılmasınaolanak tanır 18. Farklı dizileme modaliteleri ve veri setlerine uygulanabilirlikleri açısından farklılık gösterirler; örneğin RNA dizileme19 veya tüm ekzom dizilemeverileri 5 için, uygulanması (örneğin dizilemeşeritleri 20) arasında kontrol ve kullanım kolaylığı açısından farklılık gösterirler. Aynı bireyden alınan örnekler 20–45 tek nükleotid polimorfizmine dayanarak tanımlanabilse de, kanser araştırmalarında genellikle kullanılan düşük ve orta kapsama dizileme yaklaşımları çok sayıda SNP'nin entegrasyonunugerektirir 1.
Burada, eşleşen örneklerin kalite kontrolü için kullanılan SNP15'in bağlantı dengesizliği blokları kullanılarak yapılan bu yaklaşımın uygulanması ve ayarlamaları açıklanmaktadır. Yaklaşımın düşük sahte bayrak oranı ve yanlış eşleşme oranına sahip olduğu gösterilmiştir ve iş akışı, tüm ekzom dizileme ve RNA dizileme örnekleri arasında modaliteler arasında karşılaştırma yapılmasına ve farklı veri formatlarıyla kullanıma olanak tanır. Yöntemin klinik çalışma örneklerindeki veri setleri arasında büyük ölçekli uygulanabilirliği için, biyoinformatik ürün hattı ortak iş akışı dili (CWL)21,22 ile uygulanmıştır. Okunabilirliği ve YAML benzeri sözdizimi sayesinde, sınırlı programlama deneyimine sahip bilim insanları iş akışının genel yapısını ve analiz sonuçlarını kolayca yorumlayabilir. CWL'nin bir diğer önemli özelliği, tahsis edilen hesaplama kaynaklarını tam şekilde kullanacak süreçlerin paralelleştirilmesini sağlayan scatter/collect işlevselliğidir. Kullanıcılar, belirli adımların hangi koşullarda uygulanacağını belirleyerek ortaya çıkan analizlerin esnekliğini artırabilir. CWL, veritabanı depolama, grafik kullanıcı arayüzü ve iş dağıtıcısı gibi tam bir iş akışı yönetim sisteminin diğer bileşenleriyle entegre edilebilir ve tekrarlanabilir bilimsel analizler seti oluşturmak, çalıştırmak ve sürdürmek için güçlü bir platform oluşturur. Bu nedenle, bu uygulama tanımlı iş akışı yönetim sistemleri bağlamında iş akışına kolay erişim ve veri setlerinin yüksek verimli işlemesini sağlar.
Ayrıca, eşleştirilmiş ve eşleşmeyen örnekler arasında ayarlama seçimi parametre eşik eşiğinin etkileri araştırıldı ve uyumsuz vakaların izinli ve katı seçimi için eşikler belirlendi. Bu parametrelerin değiştirilmesinin örnek çift seçimi üzerindeki etkileri ve farklı omik modaliteleri içinde ve arasında uygulanabilirliği sergilendi. Bu parametrelerin etkili bir şekilde ince ayarlanması, kullanıcıların yorumlarının katığını ayarlamalarını sağlar. İş akışı, birkaç bin örnekten oluşan büyük ölçekli klinik veri setlerine uygulandı.
Etik beyannamesi: Bireyler arası kontaminasyonun bu analizi, tamamlanmış birinci ve faz II klinik çalışmalardan bireysel hasta düzeyindeki veriler kullanılarak geriye dönük olarak gerçekleştirildi; Roche'un sorumlu veri yeniden kullanımı sürecine uygun olarak ve her çalışma için ana bilgilendirilmiş onay formuna uygun olarak gerçekleştirildi. Her çalışmanın yürütülmesinden önce Etik Komitesi/Kurumsal İnceleme Kurulu onayı alındı. Katılımcılar, bu çalışmalara katılmak için bilgilendirilmiş onay verdiler ve imzaladılar.
Biyoinformatik iş akışı
NOT: Biyobilişim iş akışı uygulaması, yeni nesil dizileme verilerinden türetilen ham fastq dosyalarından başlar; örneğin tam genom, tam ekzom veya tam transkriptom dizileme. Burada açıklanan bireysel adımlar CWL iş akışına entegre edilmiştir.
1. Gerekli referans materyalleri
2. Referans genom, sıralama ve indeksleme için hizalanma
3. Parmak izi çıkarma
4. Benzerlik puanlarının hesaplanması
5. Kod kullanılabilirliği
Hesaplama iş akışı Github: https://github.com/Roche/sample-matching-workflow'da erişilebilir olacak.
CWL iş akışı uygulaması
Örnek değişimlerinin tanımlanması için daha önce kurulmuş bir yaklaşıma dayanan, örnek değişimlerinin tanımlanması için tek-nükleotid polimorfizmlerinin bağlantı dengesizliği bloklarını kullanan bir çalışma akışıuygulanmıştır 15. Yazarlar bu yöntem için %0 FMR ve %0,01 FFR sınıflandırma oranları göstermiştir. Diğer yaklaşımlarla karşılaştırıldığında, yüksek ve orta kapsama alanda NGSCheckmate'e benzer performans ve düşük kapsama ile minimal bölgesel genomik örtüşmede NGSCheckmate'e göre daha iyi performans gösterdi. Conpair ve BAMixChecker 13,15,25 ile karşılaştırıldığında kesin olmayan sonuçlar elde edildi. Burada, iş akışı CWL'de uygulandı, LOD eşikleri incelendi ve optimize edildi; ayrıca RNA dizileme çiftleri ile DNA dizileme çiftlerinin karşılaştırılması veya dokudan alınan örnekler ile doku ile periferik kan örnekleri arasında modaliteler arasında uygulandı (Şekil 3, Tablo 1). İş akışı uygulaması, tüm olası örnek çiftlerinin çapraz karşılaştırılmasına veya önceden tanımlanmış bir listeden seçilmiş örnekler arasında karşılaştırmaya olanak sağladı.
İş akışı girişi, seçilmiş bir haplotip seti kullanır. Bunlar, bağlantı dengesizliği bloklarında tek nükleotid polimorfizmlerinin hesaplanmasında kullanılır. Bu SNP bloklarının çiftler arasında log-odds oranı (LOD) puanlarının hesaplanması, eşleşen ve uyumsuz örnekler arasında ayırt edilebilmektedir. Daha önce, LOD < -5 ve LOD > 5 aralığındaki LOD puanlarının, eşleşen örnekçiftlerini doğru şekilde sınıflandırdığı gösterilmiştir 15. Ek LOD puanları (LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR), tümör örneğinde olası heterozigotluk kaybı dikkate alınarak hesaplanır (bir örnekte heterozigot bölgeler diğer örnekte homozigot olarak tespit edilir).
Giriş parametreleri ve eşik değerlerinin uyum/uyumsuzluk oranları üzerindeki etkisi
Bu iş akışının değerlendirilmesi, performansını ve doğruluğunu etkileyen üç kritik yönü vurguladı. İlk olarak, haplotip haritasının kapsadığı genomik bölgelerin seçilmesi kritik bir adım oldu. Bu bölgelerin seçimi, eşleştirme sürecinin ayırt edici gücünü doğrudan etkiler. İkinci olarak, okuma hizalama stratejileri ile parmak izi çıkarımı için kullanılan özel haplotip haritalarının birleşimi, nihai analiz sonuçlarını önemli ölçüde etkiledi. Bu yukarı akış işlem adımlarındaki varyasyonlar, eşleşme puanlarına yayılan ince önyargılar getirebilir (Şekil 4A–B). Üçüncü olarak, örnek eşleşmesini belirlemek için eşiklerin dikkatli değerlendirilmesi ve seçimi çok önemliydi. Optimal eşik değerleri, belirli veri modalitesine (örneğin, tüm ekzom dizileme ile tüm transkriptom dizileme) ve değerlendirilen genomik bölgelere bağlı olarak önemli ölçüde değişebilir. Farklı eşikler, yaklaşımın katılığını ayarlayabilir (yüksek yanlış pozitif oranı ile yüksek yanlış negatif oranı) (Şekil 4C). Bunu büyük bir klinik örnek grubu için ele almak amacıyla, yöntem hem izinli hem de katı örneklem eşleşme skorları kombinasyonlarını LOD skorları ve karşılaştırıcı kombinasyonlarına göre tanımlamak üzere uyarlandı. İlk eşik yaklaşımı (I), üç LOD puanı (LOD_SCORE, LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR) üzerindeki herhangi bir pozitif değer dikkate alınarak sağlandı. TUMOR_NORMAL ve NORMAL_TUMOR puanları hakkında bilgi ekleyerek, kanser örneklerindeki kopya sayısı değişiklikleri nedeniyle oluşan heterozigotluk kaybının etkileri azaltılabilir. Buna karşılık, yanlış pozitifleri azaltmak için uyarlanmış iki alternatif filtreleme kriterinin uygulanmasıyla daha katı bir uyumsuzluk eşiği (II) uygulandı: (a) sadece eşleşme olarak kategorize edilme, eğer pozitifse LOD_SCORE, b) belirli bir örneklem için LOD_SCORE, o örneklemin diğer çift puanının maksimum puanından yüksekse ve LOD_SCOREs örnekler arasında eşleşmesi beklenmiyorsa (belgelenmiş hasta kaynaklı hastaya göre) eşleşme olarak kategorize edilmek; LOD_SCORE kendisi olumsuz olsa bile.
Bu uygulamada, izin verici eşik oluşturmak için, yukarıdaki kriterlerden herhangi birine (I, IIa, IIb) göre eşleşme olarak belirlenen herhangi bir örnek çifti eşleşme olarak kabul edilir. Bu, tüm tespit edilen uyumsuzluklara yüksek güven sağladı, ancak bazı potansiyel gerçek uyumsuzlukların eşleşme olarak adlandırılması (yani yanlış negatifler) karşılığında gerçekleşti. İzin eşiğinin daha katı eşiklerle karşılaştırılması, eşleşmesiz olarak sınıflandırılan çiftlerin yüzdesinde bir değişim olduğunu gösterdi. Yaklaşımlar arasındaki fark, analiz edilen tüm çalışmalarda %3,9 (üç LOD puanından herhangi biri pozitif (I)), %13,3 (LOD_SCORE pozitif olmalı (IIa)), %9,2 (LOD_SCORE eşleşmeyen çiftlere (IIb)) ve %3,6 (yukarıdakilerden herhangi biri dikkate alınarak eşleşme belirtilmiş) arasında değişmiştir (Şekil 4C).
Genomik bölge kapsamasının etkisi
Eşleşmiş ve uyumsuz örnekler için negatif ve pozitif LOD puanları arasındaki fark, geniş genom bölgeleri (tüm genom dizileme (WGS) veya WGS örneklerinin diğer modalitelerle karşılaştırılması) kapsandığında en yüksektir; böylece eşik seçimi kolaylaştırılır (Şekil 5A). Tam ekzom dizileme ve RNA dizileme karşılaştırmalarında LOD puanları sıfıra yaklaşır ve eşik yaklaşımları sonuçları etkiler; bu da daha düşük genomik kapsama sahip modaliteler için eşiklerin katı olduğunu değerlendirmenin önemini vurgular. Pozitif LOD skorlarına sahip bilinen eşleştirilmiş örneklerden elde edilen sonuçların dağılımı Şekil 5B'de gösterilmiştir. Javed ve ark. (2020), bağlantı dengesizliği blokları kullanıldığında, eşleşen ve eşleşmeyen örnekler arasında ayırt etmek için %0,02 genom örtüşmesinin yeterliolduğunu göstermiştir 15.
Doğrulama
Yaklaşım, aynı bireylerden alınan bilinen bir dizi örneği beklenen ek meme kanseri, kolorektal kanser ve akciğer kanseri tam ekzom dizileme (WES) ve RNA dizileme veri setlerinde doğrulandı (Şekil 6A). Aynı bireyden alınan örneklem çiftleri %100 eşleşme oranı gösterdi (Şekil 6B), farklı bireylerden kaynaklandığı bilinen diğer örneklerle yapılan ek karşılaştırmalar ise %100 uyumsuzluk oranı gösterdi. Bu veri setlerinin hiçbirinde ne yanlış pozitif ne de yanlış negatif gözlemlenmedi.
Özetle, kalite kontrol iş akışının uygulanması, standartlaştırılmış ve tekrarlanabilir bir yaklaşım sunarak yeni nesil dizileme örneklerinin çiftlerinin bireyler arası karşılaştırmalarını kolaylaştırır. Ortaya çıkan LOD puan eşikleri, büyük genomik bölgesel örtüşmeye sahip örnekler için düşük yanlış pozitif ve yanlış negatif oranlar sağlar ve düşük dizileme derinliğine sahip veya genomik örtüşme az olan örnekler için ek eşik optimizasyonu uygulanabilir.

Şekil 1: Örnek değişimlerinin ve yanlış etiketlemelerin şematik temsili. (A) İki birey arasında birer örnekten oluşan bir örnek değişimi. (B) Biyopsi çıkarımından dizileme verilerinin analizine kadar örnek işleme adımlarının temsili. BioRender'da oluşturuldu. Voith von Voithenberg, L. (2026) https://BioRender.com/xhbp178. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 2: CWL'de örnek eşleştirme kalite kontrol iş akışını çalıştırmak için gereken giriş dosyaları ve parametreler için kullanıcı arayüzünün temsili. Dosya ve parametre girişi için grafiksel kullanıcı arayüzü. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 3: Örnek eşleştirme iş akışından elde edilen sonuçlar. Örnek bir DNA dizileme seti (tüm genom ve tüm ekzom dizileme) örnekleri için LOD puanlarının dağılımı (solda), DNA dizileme ile RNA dizileme arasında karşılaştırma için (ortada) çok az eşleşen numunenin dağılımına kıyasla nasıl davrandığını göstermek için ve farklı bireylerden (uyumsuzluklar) kaynaklandığı bilinen verilerle örnek daha büyük bir RNA dizileme çiftleri grubu (sağda) için (uyumsuzluklar, açık kırmızı) ve aynı kişiden (kibrit, açık yeşil). Kısaltmalar; LOD = log oranı oranı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 4: LOD puanlarında örnek farklılıklar gözlemlendi. (A) bilinen uyumsuz ve eşleşen örnekler seti için farklı dizi hizalama yaklaşımları ve haplotip haritaları birleştirildiğinde, ve (B) tümör ile normal bilginin entegrasyonuyla puanlama için. (C) Farklı sıkılıkta eşik yaklaşımlarıyla tanımlanan örnek uyum ve uyumsuzluk sayısının meydana gelmesi. Kısaltmalar; LOD = log oranı oranı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 5: Farklı yeni nesil dizileme yöntemlerini karşılaştırmak için LOD puanlarının örnek dağılımı olarak. (A) Kan ve tümör dokusundan DNA dizileme ile tümör dokusundan RNA dizileme arasında beklenen uyumsuz ve eşleşen örneklerin LOD puan dağılımı (B) Farklı modaliteler kombinasyonları için eşleştirilmiş örneklerin LOD puan dağılımı. Kısaltmalar; LOD = log oranı oranı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 6: Meme kanseri WES ve RNA dizileme veri seti analizi için LOD puanlarının dağılımı Tanımlanmamış meme kanseri veri seti Caris Life Sciences'tan alınmış olup, kapsamlı tümör profillemesinden türetilmiştir. (A) Tümör WES örnekleri (solda) ile RNA dizileme örnekleri (sağda) karşılaştırmaları için LOD skorlarının logaritmik oluşu. (B) Aynı bireylerden beklenen çiftler için LOD puan dağılımları (WES üst sıra, RNA dizileme alt sıra). Kısaltmalar; LOD = log oranı oranı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
| LEFT_GROUP_VALUE | RIGHT_GROUP_VALUE | SONUÇ | LOD_SCORE | LOD_SCORE_ TUMOR_NORMAL | LOD_SCORE_ NORMAL_TUMOR |
| Örnek 1 | Örnek 1 | EXPECTED_MATCH | 38.119266 | 29.649485 | 29.649485 |
| Örnek 1 | Örnek 2 | EXPECTED_MISMATCH | -2.552644 | -4.57422 | 5.283698 |
| Örnek 2 | Örnek 1 | EXPECTED_MISMATCH | -2.552644 | 5.283698 | -4.57422 |
| Örnek 2 | Örnek 2 | EXPECTED_MATCH | 12.328737 | 8.796457 | 8.796457 |
Tablo 1: Çapraz Parmak İzleri çalıştırılıp elde edilen örnek sonuçlar. Tablo, örnek eşleştirme yaklaşımıyla karşılaştırılan bir çift örneklemin örnek sonuçlarını göstermektedir.
Örnek eşleşmelerini tanımlamak için çeşitli yöntemler mevcuttur: 1,4,13,14,15,16. Burada, birden fazla omik modalitesinde uygulanabilir SNP bağlantı dengesizliği blokları kullanılarak düşük yanlış pozitif ve yanlış negatif oranları olan bir yaklaşımın uygulanmasıtanımlanmıştır 15. Uygulama, standart bir iş akışı ortamında veri kümeleri arasında yüksek verimli işlemeyi kolaylaştırmak için CWL'de gerçekleştirildi. İş akışı değerlendirmesi, yaklaşımı uygularken dikkate alınması gereken üç önemli unsuru belirledi. Sürecin önemli adımlarından biri, haplotip haritasının kapsadığı genomik bölgeleri seçmektir. Ayrıca, farklı haplotip haritaları kullanılarak okuma hizalamasını parmak izi çıkarımı ile birleştirmek analiz sonuçlarını etkileyebilir. Ayrıca, veri modalitesine ve kapsanan bölgelere bağlı olabilecek eşiklerin dikkatli değerlendirilmesi ve seçimi gereklidir ve bu da daha fazla veya daha az izin veren örneklem eşleştirme çağrısına yol açabilir.
Büyük klinik örnek setlerinin değerlendirilmesi için, yöntem, izin veren ve katı örnek eşleştirme puanları için eşik kombinasyonlarını tanımlamak üzere uyarlandı. Yöntem, LOD puanlarından herhangi birini (LOD_SCORE, LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR) veya iki alternatif filtreleme kriterini içeren birleşik puan dikkate alınarak izin veren eşik yaklaşımını içerecek şekilde ayarlandı ve böylece daha katı bir örneklem seçimi sağlandı. Yaklaşımın uygulanabilirliği, genomik bölgeler arasında SNP bilgisinin mevcut olduğu örneklerle sınırlıdır; örneğin yeni nesil dizileme verileri. Ayrıca, karşılaştırmalı analiz ve örnek eşleştirmesi için aynı bireyden en az çift örnek gereklidir. Hedefli yöntemlerle elde edilen mutasyon durumu veya cinsiyet gibi hasta meta verileri gibi ek klinik bilgiler, yüksek boyutlu moleküler veriler ile hasta düzeyindeki klinik veriler arasında eşleşme için ek kanıt sağlamak amacıyla kullanılabilir.
Yaklaşımın iş akışı yönetim ortamında uygulanması ve paralel veri depolama olasılığı, bireyler arası kirlenme için örneklerin yüksek verimli kalite kontrol analizini mümkün kılar. Böylece, veri setleri ve örnekler arasında yaklaşımın erişilebilirliğini ve tekrarlanabilirliğini artırır. Bu yaklaşımdaki eşik kriterlerinin uyarlanabilirliği, düşük ve yüksek tümör mutasyon yükü ve kopya sayısı değişikliklerine sahip kanser örneklerinin işlenmesini ve analizini mümkün kılar; bu değişiklikler heterozigotluğun kaybına yol açabilir ve böylece genotip olasılığını etkileyebilir.
Yöntem, insan bireylerden alınan yeni nesil dizileme verilerini içeren ve kişi başına birden fazla örneklem bulunan her türlü projede geniş bir uygulama bulunabilir. Bu, bireysel hastalar için kişiselleştirilmiş yaklaşımlardan, farklı hastalık bölgeleri için yüksek boyutlu moleküler veriler toplayan büyük klinik çalışmalara kadar uzanabilir. Kalite kontrol iş akışları, türler arası kontaminasyonun araştırılması ve yüksek boyutlu moleküler veri setlerini klinik bilgilerle bağlayarak yeni nesil dizileme verileri için herhangi bir kalite kontrol boru hattına entegre edilmesi yaklaşımlarıyla birleştirilebilir.
Tüm yazarlar F. Hoffmann-La Roche Ltd'nin çalışanı veya dış yüklenicisi ve hissedarıdır. Ayrıca, Zachary Whitfield Rancho Biosciences'ta, Ana Teixeira ise A4Pbio'da çalışandır. Yazarlar rekabet eden çıkarlar belirtmemektedir.
Örneklerini sağladıkları için hastalara ve ailelerine içtenlikle teşekkür ediyoruz. Özellikle klinik araştırma organizasyonlarımızdaki çalışma ekipleri, araştırmacı ekipleri ve proje ekiplerine en derin katkıları için en derin teşekkürlerimizi sunuyoruz. Yazarlar, el yazmasını eleştirel okumaları ve değerli yorumları için N. Nair ve E. Guarin'e teşekkür eder. Ayrıca, ek veri setlerinin erişilebilir hale getirilmesine verdiği destek için A. Cosolo'ya teşekkürlerimizi sunarız. Roche genelinde Gelişmiş Veri ve İçgörüler Paylaşımı (EDIS) ağının veri küratı ve uyumlandırma konusundaki çabalarını takdir ediyoruz.
| Ad | Şirket | Katalog numarası | Yorumlar |
|---|---|---|---|
| FastQC | v0.11.9 | SCR_014583 | |
| MultiQC | v1.8 | SCR_014982 | |
| BWA-MEM | v0.7.17 | SCR_010910 | |
| STAR | v2.7.9a | SCR_004463 | |
| SAMtools | V1.12, v1.19.2 | SCR_005227 | |
| -& faidx | |||
| -& Sort | |||
| -& Indeks | |||
| - addreplacerg | |||
| Picard | V2.25.5, v3.0.0 | SCR_006525 | |
| - CreateSequenceDictionary | |||
| - MarkDuplicates | |||
| - build_fingerprint_maps | |||
| - ExtractFingerprints | |||
| - CrosscheckFingerprints | |||
| CWL | v1.2 | SCR_015528 | |
| R | R v4.3.1 | SCR_001905 | |
| dplyr v1.1.4 |
Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste
İzin iste