Yöntem makalesi

Multiomik Yeni Nesil Dizileme Verilerinde Bireyler Arası Kontaminasyon ve Uyumsuzluğun Tespit Edilmesi

DOI:

10.3791/69428

17 Nisan 2026

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu protokol, bireyler içindeki çift örneklerin genetik kimliğini doğrulayarak bireyler arası kontaminasyon ve uyumsuzluğu tespit etmek için bir kalite kontrol çerçevesinin uygulanmasını açıklar.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Hasta biyoörneklerinin yüksek verimli işlemesi, yeni nesil dizileme ile ve moleküler verilerin hasta düzeyi ve örnek düzeyindeki klinik verilerle karşılaştırılması, biyonumune tutum zinciri boyunca örnek tanımlayıcılarının hassas takibi ve eşleşmesini gerektirir ve biyobelirteç çalışma sonuçlarının sağlam yorumlanmasını sağlamak için kritik öneme sahiptir. Numune ve veri işleme iş akışlarında bireysel adımların izlenmesinin yanı sıra, biyobilişim çözümleri aynı hastadan alındığını doğrulamak için de kullanılabilir. Burada, aynı bireyden gelen eşleşen örnekleri belirlemek için biyoinformatik iş akışının kullanımı gösterilmektedir. Analiz iş akışı, hasta örneklem kaynağı için karşılaştırılıp doğrulanacak herhangi iki veya daha fazla NGS veri seti çifti için uygundur. Genom genelinde örnek karşılaştırmalarına dayalı bir puanlama algoritması, kullanıcının iki örneğin aynı bireyden gelip çıkmadığını belirlemesini sağlar. Özellikle, seçilmiş bağlantı dengesizliği blokları içindeki tek-nükleotid polimorfizmaları (SNP) örnekleri tanımlamak ve karşılaştırmak için kullanılır. Eşleşen ve uyumsuz örneklerin izinli ve sıkı seçimi için eşik kombinasyonları belirlendi. Bu protokolün faydası, klinik tümör dokusu ve kan örneklerinin kalite kontrolü ve doğrulanmasına uygulanmasıyla gösterilmiştir; bu yöntem 2.000'den fazla hastadan çok sayıda omik modalitesini kapsamaktadır.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Klinik örneklerin büyük ölçekli toplanması ve analizi, aynı veya farklı modalitelerden ve klinik hasta ve örnek düzeyindeki verilerin doğru eşleştirilmesi, doğru yorumlama ve bilinçli karar verme için gerekli olduğundan, örneklerin tutma zinciri boyunca tam olarak takip edilmesini gerektirir. İyi klinik uygulamalar altında örnek işleme protokollerini kolaylaştırmak için yapılan yoğun çabalara rağmen, örnek değişimi veya yanlış etiketleme çeşitli aşamalarda, biyopsi/örnek çıkarmadan hazırlık ve işleme aşamalarına ve veri analiz aşamasına kadar gerçekleşebilir (Şekil 1). Artan örnek sayısı ve örnek işleme adımlarıyla birlikte, numune değişimi ve çapraz kontaminasyon olasılığı artar. Bu, yanlış örnek-hasta ilişkilerine sahip verilerin analizine yol açabilir, bu da sonraki analizleri ve sonuçları etkileyebilir ve bu nedenle klinik genomik araştırmalarında dikkate alınması gereken önemli bir unsurdur. Klinik çalışmalarda, örneklerin yanlış tanımlanması, özellikle küçükörneklem büyüklüğü 1 olan çalışmalarda genel sonuçları güçlü şekilde etkileyebilir. Bireyler arasında kontaminasyon, aynı hastadan birçok numune karşılaştırıldığında farklılıkların belirlenmesinde güç kaybına ve yanlış pozitif sonuçlara yol açabilir. Örnek değişimleri, genetik ilişkilerin tespit gücünü etkiler ve genom çapında ilişki analizinde karmaşık özelliklerin kalıtsallığının küçümsenmesine yolaçabilir 2.

Kanser araştırmaları, genomik ve transkriptomik analizlerin yapıldığı alanlardanbiridir3, özellikle genomik ve fenotipik hastalar arası ve intra-hasta heterojenliği izlemektedir. Kanser araştırmalarının bir yönü, aynı hastadan alınan örneklerin farklı mutasyonlar ve kopya sayı değişiklikleri taşıyabileceği ve böylece bağımsız varyant allelfrekansları gösterebilmesidir 4. Özellikle birden fazla omik türünden veri yorumlanırken, aynı bireylerden alınan çoklu modal veri setlerinin doğru entegrasyonu önemlidir ve bu nedenle bireyler arasıkirlenmenin izlenmesini gerektirir 5,6,7,8. Kanser genom atlası programı (TCGA) ve akciğer genomi araştırma konsorsiyumu (LGRC) veri setleri üzerinde yapılan çalışmalar, bazı çalışmalarda ortalama %3 örnek yanlış tanımlama oranlarını ve %~20'ye kadar çıktığınıtespit etmiştir: 2,9,10,11. Bu örnekler, örnek değişimlerinin ve çapraz kontaminasyonun izlenmesinin öneminigösterir 12. Her süreç adımında rutin izleme ve kalite kontrolünün ötesinde, sıralama sonuçlarının karşılaştırmalı analizi nihai kalite kontrolü görevini görür. Bu, veri analizi ve yorumuna geçmeden önce doğru örnek eşleşmesini sağlar.

Aynı bireyden mi kaynaklandığını belirlemek için çeşitli biyoinformatikyaklaşımlar geliştirilmiştir 1,4,13,14,15,16. İlk yaklaşımlar, örnek kimliğini doğrulamak için kısa tandemtekrarlardan yararlandı 17. RNA ve DNA seviyesinde yeni nesil dizileme verileri artık tek nükleotid polimorfizmlerine dayalı örnekler çiftleri arasında karşılaştırma yapılmasınaolanak tanır 18. Farklı dizileme modaliteleri ve veri setlerine uygulanabilirlikleri açısından farklılık gösterirler; örneğin RNA dizileme19 veya tüm ekzom dizilemeverileri 5 için, uygulanması (örneğin dizilemeşeritleri 20) arasında kontrol ve kullanım kolaylığı açısından farklılık gösterirler. Aynı bireyden alınan örnekler 20–45 tek nükleotid polimorfizmine dayanarak tanımlanabilse de, kanser araştırmalarında genellikle kullanılan düşük ve orta kapsama dizileme yaklaşımları çok sayıda SNP'nin entegrasyonunugerektirir 1.

Burada, eşleşen örneklerin kalite kontrolü için kullanılan SNP15'in bağlantı dengesizliği blokları kullanılarak yapılan bu yaklaşımın uygulanması ve ayarlamaları açıklanmaktadır. Yaklaşımın düşük sahte bayrak oranı ve yanlış eşleşme oranına sahip olduğu gösterilmiştir ve iş akışı, tüm ekzom dizileme ve RNA dizileme örnekleri arasında modaliteler arasında karşılaştırma yapılmasına ve farklı veri formatlarıyla kullanıma olanak tanır. Yöntemin klinik çalışma örneklerindeki veri setleri arasında büyük ölçekli uygulanabilirliği için, biyoinformatik ürün hattı ortak iş akışı dili (CWL)21,22 ile uygulanmıştır. Okunabilirliği ve YAML benzeri sözdizimi sayesinde, sınırlı programlama deneyimine sahip bilim insanları iş akışının genel yapısını ve analiz sonuçlarını kolayca yorumlayabilir. CWL'nin bir diğer önemli özelliği, tahsis edilen hesaplama kaynaklarını tam şekilde kullanacak süreçlerin paralelleştirilmesini sağlayan scatter/collect işlevselliğidir. Kullanıcılar, belirli adımların hangi koşullarda uygulanacağını belirleyerek ortaya çıkan analizlerin esnekliğini artırabilir. CWL, veritabanı depolama, grafik kullanıcı arayüzü ve iş dağıtıcısı gibi tam bir iş akışı yönetim sisteminin diğer bileşenleriyle entegre edilebilir ve tekrarlanabilir bilimsel analizler seti oluşturmak, çalıştırmak ve sürdürmek için güçlü bir platform oluşturur. Bu nedenle, bu uygulama tanımlı iş akışı yönetim sistemleri bağlamında iş akışına kolay erişim ve veri setlerinin yüksek verimli işlemesini sağlar.

Ayrıca, eşleştirilmiş ve eşleşmeyen örnekler arasında ayarlama seçimi parametre eşik eşiğinin etkileri araştırıldı ve uyumsuz vakaların izinli ve katı seçimi için eşikler belirlendi. Bu parametrelerin değiştirilmesinin örnek çift seçimi üzerindeki etkileri ve farklı omik modaliteleri içinde ve arasında uygulanabilirliği sergilendi. Bu parametrelerin etkili bir şekilde ince ayarlanması, kullanıcıların yorumlarının katığını ayarlamalarını sağlar. İş akışı, birkaç bin örnekten oluşan büyük ölçekli klinik veri setlerine uygulandı.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Etik beyannamesi: Bireyler arası kontaminasyonun bu analizi, tamamlanmış birinci ve faz II klinik çalışmalardan bireysel hasta düzeyindeki veriler kullanılarak geriye dönük olarak gerçekleştirildi; Roche'un sorumlu veri yeniden kullanımı sürecine uygun olarak ve her çalışma için ana bilgilendirilmiş onay formuna uygun olarak gerçekleştirildi. Her çalışmanın yürütülmesinden önce Etik Komitesi/Kurumsal İnceleme Kurulu onayı alındı. Katılımcılar, bu çalışmalara katılmak için bilgilendirilmiş onay verdiler ve imzaladılar.

Biyoinformatik iş akışı
NOT: Biyobilişim iş akışı uygulaması, yeni nesil dizileme verilerinden türetilen ham fastq dosyalarından başlar; örneğin tam genom, tam ekzom veya tam transkriptom dizileme. Burada açıklanan bireysel adımlar CWL iş akışına entegre edilmiştir.

1. Gerekli referans materyalleri

  1. Biyoinformatik iş akışı için aşağıdakileri sağlayın:
    1. İnsan referans genomu (GRCh38) içinde . fasta formatı.
    2. Karşılık gelen indeksleme dosyası .fasta.fai olarak sunuldu.
    3. İlgili sözlük .dict formatında.
    4. SNP'ler ve bağlantı dengesizlik blokları için ilgi çekici genomik bölgeleri eşleştiren bir haplotip haritası (örneğin, Picard build_fingerprint_maps, SCR_006525).
  2. Haplotip haritasının başlığının referans genomla eşleştiğinden emin olun.

2. Referans genom, sıralama ve indeksleme için hizalanma

  1. Aşağıdaki adımlar için çıktıları sağlamak üzere CWL iş akışını çalıştırın ( Materyal Tablosunda araç listesi) (Şekil 2).
  2. CWL iş akışını, eşleştirilmiş fastq dosyaları veya hizalanmış bam dosyalarından oluşan bir dizin sağlayarak başlatın.
  3. Örneğin R1/R2, CWL komutunda giriş düzenli ifade deseni olarak bu deseni verin.
  4. Ayrıca, iş akışının çalışacağı konumu, genom referansını ve haplotip eşleme dosyalarını da verin.
    NOT: Herkese karşılaştırma için tam giriş dizini kullanılır. Bir dosya alt kümesi karşılaştırılacaksa, karşılaştırma için dosya isimlerini içeren virgülle ayrılmış bir dosya sağlayın. Gelişmiş seçenek, rastgele erişimli bellek ve süreci çalıştıracak merkezi işlem birimi sayısının seçilmesine olanak tanır.
  5. Fastq dosyalarını bir eşleme algoritması kullanarak insan referans genomuna eşleyin.
    NOT: Dizileme modalitesine bağlı olarak, DNA dizileme sonuçları23 için BWA-MEM kullanılırken, RNA dizileme sonuçları24 için splice farkında haritalayıcı STAR kullanılır. STAR hizalanması için örnek bir kod aşağıda sunulmaktadır:
    STAR \
    --readFilesCommand zcat \
    --runThreadN 8 \
    --outSAMmapqUnique 60 \
    --outSAMattributes Tüm \
    --outReadsUnmapped Fastx \
    --outTmpDir /tmp/STARtmp/ \
    --runDirPerm All_RWX \
    --outSAMtype BAM Sıralanmamış \
    --outFileNamePrefix /FILENAME_ \
    --outSAMattrRGline ID:FILEID. L001 SM:ÖRNEK \
    --genomDir /REF/GENOME/DIR \
    --readFiles/path/to/FILENAME'de. R1.fastq.gz /path/to/FILENAME. R2.fastq.gz
  6. Ortaya çıkan hizalanmış ikili hizalama matrisi (BAM) dosyalarını okuma koordinatına göre SAMtools sıralaması (samtools sort -o FILENAME_OUT.bam FILENAME_IN.bam) kullanarak sıralayın.
  7. Sıralanmış BAM dosyalarını SAMtools index (samtools index FILENAME_OUT.bam) kullanarak indeksleyin.
  8. Picard MarkDuplicates kullanarak kopyaları işaretleyin ve çıkarın.
  9. SAMtools kullanarak BAM dosyalarını yeniden indeksleyin ve okuma gruplarını (RG) ekleyin.
    NOT: BAM dosyalarının iş akışının çalışması için RG etiketleri olmalıdır.

3. Parmak izi çıkarma

  1. Sıralanmış ve indekslenmiş BAM dosyalarını kullanarak Picard ExtractFingerprints kullanarak SNP parmak izlerini tespit edin.
  2. Ortaya çıkan varyant çağrı formatı (VCF) dosyalarının ara depolamasını, yalnızca örnekler arasında karşılaştırma amacıyla kullanın.

4. Benzerlik puanlarının hesaplanması

  1. Picard CrossCheckFingerprints kullanılarak crosscheck_metrics dosya formatında crosscheck_metrics.txt olarak sağlanan bağlantı dengesizliği bloklarına dayalı benzerlik oranı puanlarını (LOD) hesaplayabilirsiniz.
    NOT: İş akışı uygulaması, tüm olası örnek çiftleri kombinasyonlarının çapraz karşılaştırılmasına veya önceden tanımlanmış bir listeden seçilmiş örnekler arasında karşılaştırmaya olanak tanır.
  2. Ara VCF dosyalarını sil.
  3. crosscheck_metrics dosyası, test edilen her örnek çifti için dört karşılaştırma sunar. LOD puanlarının yorumu şöyledir:
    LOD puanı > 0: örnekler muhtemelen aynı bireyden (örnek eşleşmesi)
    LOD puanı ≤ 0: örnekler muhtemelen farklı bireylerden geliyor
  4. Örnek eşleşmeler için kesme değerini, örneğin R veya Python'da LOD puan dağılımını histogram olarak görselleştirerek doğrulayın (Şekil 3).
  5. Deneyimli biyoinformatik uzmanlığını içeren bir işbirlikçi ekip, örnek kimliklerinin kesin olarak tanımlanması ve kullanılan eşiklerin ayarlanması için yeterli olup olmadığını belirlemek için önerilen bir ekip, örneğin üç LOD puanının tamamını dahil ederek veya farklı bireylerden kaynaklanan örneklerin LOD puan dağılımıyla karşılaştırma yapılabilir.
    NOT: Örnek karışıklıkları birden fazla beklenmedik eşleşmeye (aynı bağışçıdan alınan örneklerde LOD puanı < 0) ve uyumsuzluklara (farklı bağışçılardan alınan örnekler için LOD puanı > 0) yol açabilir. Karmaşık yorumlar, çapraz fonksiyonel ekip ile biyoinformatik uzmanı arasında yakın alışveriş gerektirir.

5. Kod kullanılabilirliği

Hesaplama iş akışı Github: https://github.com/Roche/sample-matching-workflow'da erişilebilir olacak.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

CWL iş akışı uygulaması
Örnek değişimlerinin tanımlanması için daha önce kurulmuş bir yaklaşıma dayanan, örnek değişimlerinin tanımlanması için tek-nükleotid polimorfizmlerinin bağlantı dengesizliği bloklarını kullanan bir çalışma akışıuygulanmıştır 15. Yazarlar bu yöntem için %0 FMR ve %0,01 FFR sınıflandırma oranları göstermiştir. Diğer yaklaşımlarla karşılaştırıldığında, yüksek ve orta kapsama alanda NGSCheckmate'e benzer performans ve düşük kapsama ile minimal bölgesel genomik örtüşmede NGSCheckmate'e göre daha iyi performans gösterdi. Conpair ve BAMixChecker 13,15,25 ile karşılaştırıldığında kesin olmayan sonuçlar elde edildi. Burada, iş akışı CWL'de uygulandı, LOD eşikleri incelendi ve optimize edildi; ayrıca RNA dizileme çiftleri ile DNA dizileme çiftlerinin karşılaştırılması veya dokudan alınan örnekler ile doku ile periferik kan örnekleri arasında modaliteler arasında uygulandı (Şekil 3, Tablo 1). İş akışı uygulaması, tüm olası örnek çiftlerinin çapraz karşılaştırılmasına veya önceden tanımlanmış bir listeden seçilmiş örnekler arasında karşılaştırmaya olanak sağladı.

İş akışı girişi, seçilmiş bir haplotip seti kullanır. Bunlar, bağlantı dengesizliği bloklarında tek nükleotid polimorfizmlerinin hesaplanmasında kullanılır. Bu SNP bloklarının çiftler arasında log-odds oranı (LOD) puanlarının hesaplanması, eşleşen ve uyumsuz örnekler arasında ayırt edilebilmektedir. Daha önce, LOD < -5 ve LOD > 5 aralığındaki LOD puanlarının, eşleşen örnekçiftlerini doğru şekilde sınıflandırdığı gösterilmiştir 15. Ek LOD puanları (LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR), tümör örneğinde olası heterozigotluk kaybı dikkate alınarak hesaplanır (bir örnekte heterozigot bölgeler diğer örnekte homozigot olarak tespit edilir).

Giriş parametreleri ve eşik değerlerinin uyum/uyumsuzluk oranları üzerindeki etkisi
Bu iş akışının değerlendirilmesi, performansını ve doğruluğunu etkileyen üç kritik yönü vurguladı. İlk olarak, haplotip haritasının kapsadığı genomik bölgelerin seçilmesi kritik bir adım oldu. Bu bölgelerin seçimi, eşleştirme sürecinin ayırt edici gücünü doğrudan etkiler. İkinci olarak, okuma hizalama stratejileri ile parmak izi çıkarımı için kullanılan özel haplotip haritalarının birleşimi, nihai analiz sonuçlarını önemli ölçüde etkiledi. Bu yukarı akış işlem adımlarındaki varyasyonlar, eşleşme puanlarına yayılan ince önyargılar getirebilir (Şekil 4A–B). Üçüncü olarak, örnek eşleşmesini belirlemek için eşiklerin dikkatli değerlendirilmesi ve seçimi çok önemliydi. Optimal eşik değerleri, belirli veri modalitesine (örneğin, tüm ekzom dizileme ile tüm transkriptom dizileme) ve değerlendirilen genomik bölgelere bağlı olarak önemli ölçüde değişebilir. Farklı eşikler, yaklaşımın katılığını ayarlayabilir (yüksek yanlış pozitif oranı ile yüksek yanlış negatif oranı) (Şekil 4C). Bunu büyük bir klinik örnek grubu için ele almak amacıyla, yöntem hem izinli hem de katı örneklem eşleşme skorları kombinasyonlarını LOD skorları ve karşılaştırıcı kombinasyonlarına göre tanımlamak üzere uyarlandı. İlk eşik yaklaşımı (I), üç LOD puanı (LOD_SCORE, LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR) üzerindeki herhangi bir pozitif değer dikkate alınarak sağlandı. TUMOR_NORMAL ve NORMAL_TUMOR puanları hakkında bilgi ekleyerek, kanser örneklerindeki kopya sayısı değişiklikleri nedeniyle oluşan heterozigotluk kaybının etkileri azaltılabilir. Buna karşılık, yanlış pozitifleri azaltmak için uyarlanmış iki alternatif filtreleme kriterinin uygulanmasıyla daha katı bir uyumsuzluk eşiği (II) uygulandı: (a) sadece eşleşme olarak kategorize edilme, eğer pozitifse LOD_SCORE, b) belirli bir örneklem için LOD_SCORE, o örneklemin diğer çift puanının maksimum puanından yüksekse ve LOD_SCOREs örnekler arasında eşleşmesi beklenmiyorsa (belgelenmiş hasta kaynaklı hastaya göre) eşleşme olarak kategorize edilmek; LOD_SCORE kendisi olumsuz olsa bile.

Bu uygulamada, izin verici eşik oluşturmak için, yukarıdaki kriterlerden herhangi birine (I, IIa, IIb) göre eşleşme olarak belirlenen herhangi bir örnek çifti eşleşme olarak kabul edilir. Bu, tüm tespit edilen uyumsuzluklara yüksek güven sağladı, ancak bazı potansiyel gerçek uyumsuzlukların eşleşme olarak adlandırılması (yani yanlış negatifler) karşılığında gerçekleşti. İzin eşiğinin daha katı eşiklerle karşılaştırılması, eşleşmesiz olarak sınıflandırılan çiftlerin yüzdesinde bir değişim olduğunu gösterdi. Yaklaşımlar arasındaki fark, analiz edilen tüm çalışmalarda %3,9 (üç LOD puanından herhangi biri pozitif (I)), %13,3 (LOD_SCORE pozitif olmalı (IIa)), %9,2 (LOD_SCORE eşleşmeyen çiftlere (IIb)) ve %3,6 (yukarıdakilerden herhangi biri dikkate alınarak eşleşme belirtilmiş) arasında değişmiştir (Şekil 4C).

Genomik bölge kapsamasının etkisi
Eşleşmiş ve uyumsuz örnekler için negatif ve pozitif LOD puanları arasındaki fark, geniş genom bölgeleri (tüm genom dizileme (WGS) veya WGS örneklerinin diğer modalitelerle karşılaştırılması) kapsandığında en yüksektir; böylece eşik seçimi kolaylaştırılır (Şekil 5A). Tam ekzom dizileme ve RNA dizileme karşılaştırmalarında LOD puanları sıfıra yaklaşır ve eşik yaklaşımları sonuçları etkiler; bu da daha düşük genomik kapsama sahip modaliteler için eşiklerin katı olduğunu değerlendirmenin önemini vurgular. Pozitif LOD skorlarına sahip bilinen eşleştirilmiş örneklerden elde edilen sonuçların dağılımı Şekil 5B'de gösterilmiştir. Javed ve ark. (2020), bağlantı dengesizliği blokları kullanıldığında, eşleşen ve eşleşmeyen örnekler arasında ayırt etmek için %0,02 genom örtüşmesinin yeterliolduğunu göstermiştir 15.

Doğrulama
Yaklaşım, aynı bireylerden alınan bilinen bir dizi örneği beklenen ek meme kanseri, kolorektal kanser ve akciğer kanseri tam ekzom dizileme (WES) ve RNA dizileme veri setlerinde doğrulandı (Şekil 6A). Aynı bireyden alınan örneklem çiftleri %100 eşleşme oranı gösterdi (Şekil 6B), farklı bireylerden kaynaklandığı bilinen diğer örneklerle yapılan ek karşılaştırmalar ise %100 uyumsuzluk oranı gösterdi. Bu veri setlerinin hiçbirinde ne yanlış pozitif ne de yanlış negatif gözlemlenmedi.

Özetle, kalite kontrol iş akışının uygulanması, standartlaştırılmış ve tekrarlanabilir bir yaklaşım sunarak yeni nesil dizileme örneklerinin çiftlerinin bireyler arası karşılaştırmalarını kolaylaştırır. Ortaya çıkan LOD puan eşikleri, büyük genomik bölgesel örtüşmeye sahip örnekler için düşük yanlış pozitif ve yanlış negatif oranlar sağlar ve düşük dizileme derinliğine sahip veya genomik örtüşme az olan örnekler için ek eşik optimizasyonu uygulanabilir.

figure-results-1
Şekil 1: Örnek değişimlerinin ve yanlış etiketlemelerin şematik temsili. (A) İki birey arasında birer örnekten oluşan bir örnek değişimi. (B) Biyopsi çıkarımından dizileme verilerinin analizine kadar örnek işleme adımlarının temsili. BioRender'da oluşturuldu. Voith von Voithenberg, L. (2026) https://BioRender.com/xhbp178. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-2
Şekil 2: CWL'de örnek eşleştirme kalite kontrol iş akışını çalıştırmak için gereken giriş dosyaları ve parametreler için kullanıcı arayüzünün temsili. Dosya ve parametre girişi için grafiksel kullanıcı arayüzü. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-3
Şekil 3: Örnek eşleştirme iş akışından elde edilen sonuçlar. Örnek bir DNA dizileme seti (tüm genom ve tüm ekzom dizileme) örnekleri için LOD puanlarının dağılımı (solda), DNA dizileme ile RNA dizileme arasında karşılaştırma için (ortada) çok az eşleşen numunenin dağılımına kıyasla nasıl davrandığını göstermek için ve farklı bireylerden (uyumsuzluklar) kaynaklandığı bilinen verilerle örnek daha büyük bir RNA dizileme çiftleri grubu (sağda) için (uyumsuzluklar, açık kırmızı) ve aynı kişiden (kibrit, açık yeşil). Kısaltmalar; LOD = log oranı oranı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-4
Şekil 4: LOD puanlarında örnek farklılıklar gözlemlendi. (A) bilinen uyumsuz ve eşleşen örnekler seti için farklı dizi hizalama yaklaşımları ve haplotip haritaları birleştirildiğinde, ve (B) tümör ile normal bilginin entegrasyonuyla puanlama için. (C) Farklı sıkılıkta eşik yaklaşımlarıyla tanımlanan örnek uyum ve uyumsuzluk sayısının meydana gelmesi. Kısaltmalar; LOD = log oranı oranı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-5
Şekil 5: Farklı yeni nesil dizileme yöntemlerini karşılaştırmak için LOD puanlarının örnek dağılımı olarak. (A) Kan ve tümör dokusundan DNA dizileme ile tümör dokusundan RNA dizileme arasında beklenen uyumsuz ve eşleşen örneklerin LOD puan dağılımı (B) Farklı modaliteler kombinasyonları için eşleştirilmiş örneklerin LOD puan dağılımı. Kısaltmalar; LOD = log oranı oranı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-6
Şekil 6: Meme kanseri WES ve RNA dizileme veri seti analizi için LOD puanlarının dağılımı Tanımlanmamış meme kanseri veri seti Caris Life Sciences'tan alınmış olup, kapsamlı tümör profillemesinden türetilmiştir. (A) Tümör WES örnekleri (solda) ile RNA dizileme örnekleri (sağda) karşılaştırmaları için LOD skorlarının logaritmik oluşu. (B) Aynı bireylerden beklenen çiftler için LOD puan dağılımları (WES üst sıra, RNA dizileme alt sıra). Kısaltmalar; LOD = log oranı oranı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

LEFT_GROUP_VALUERIGHT_GROUP_VALUESONUÇLOD_SCORELOD_SCORE_
TUMOR_NORMAL
LOD_SCORE_
NORMAL_TUMOR
Örnek 1Örnek 1EXPECTED_MATCH38.11926629.64948529.649485
Örnek 1Örnek 2EXPECTED_MISMATCH-2.552644-4.574225.283698
Örnek 2Örnek 1EXPECTED_MISMATCH-2.5526445.283698-4.57422
Örnek 2Örnek 2EXPECTED_MATCH12.3287378.7964578.796457

Tablo 1: Çapraz Parmak İzleri çalıştırılıp elde edilen örnek sonuçlar. Tablo, örnek eşleştirme yaklaşımıyla karşılaştırılan bir çift örneklemin örnek sonuçlarını göstermektedir.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Örnek eşleşmelerini tanımlamak için çeşitli yöntemler mevcuttur: 1,4,13,14,15,16. Burada, birden fazla omik modalitesinde uygulanabilir SNP bağlantı dengesizliği blokları kullanılarak düşük yanlış pozitif ve yanlış negatif oranları olan bir yaklaşımın uygulanmasıtanımlanmıştır 15. Uygulama, standart bir iş akışı ortamında veri kümeleri arasında yüksek verimli işlemeyi kolaylaştırmak için CWL'de gerçekleştirildi. İş akışı değerlendirmesi, yaklaşımı uygularken dikkate alınması gereken üç önemli unsuru belirledi. Sürecin önemli adımlarından biri, haplotip haritasının kapsadığı genomik bölgeleri seçmektir. Ayrıca, farklı haplotip haritaları kullanılarak okuma hizalamasını parmak izi çıkarımı ile birleştirmek analiz sonuçlarını etkileyebilir. Ayrıca, veri modalitesine ve kapsanan bölgelere bağlı olabilecek eşiklerin dikkatli değerlendirilmesi ve seçimi gereklidir ve bu da daha fazla veya daha az izin veren örneklem eşleştirme çağrısına yol açabilir.

Büyük klinik örnek setlerinin değerlendirilmesi için, yöntem, izin veren ve katı örnek eşleştirme puanları için eşik kombinasyonlarını tanımlamak üzere uyarlandı. Yöntem, LOD puanlarından herhangi birini (LOD_SCORE, LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR) veya iki alternatif filtreleme kriterini içeren birleşik puan dikkate alınarak izin veren eşik yaklaşımını içerecek şekilde ayarlandı ve böylece daha katı bir örneklem seçimi sağlandı. Yaklaşımın uygulanabilirliği, genomik bölgeler arasında SNP bilgisinin mevcut olduğu örneklerle sınırlıdır; örneğin yeni nesil dizileme verileri. Ayrıca, karşılaştırmalı analiz ve örnek eşleştirmesi için aynı bireyden en az çift örnek gereklidir. Hedefli yöntemlerle elde edilen mutasyon durumu veya cinsiyet gibi hasta meta verileri gibi ek klinik bilgiler, yüksek boyutlu moleküler veriler ile hasta düzeyindeki klinik veriler arasında eşleşme için ek kanıt sağlamak amacıyla kullanılabilir.

Yaklaşımın iş akışı yönetim ortamında uygulanması ve paralel veri depolama olasılığı, bireyler arası kirlenme için örneklerin yüksek verimli kalite kontrol analizini mümkün kılar. Böylece, veri setleri ve örnekler arasında yaklaşımın erişilebilirliğini ve tekrarlanabilirliğini artırır. Bu yaklaşımdaki eşik kriterlerinin uyarlanabilirliği, düşük ve yüksek tümör mutasyon yükü ve kopya sayısı değişikliklerine sahip kanser örneklerinin işlenmesini ve analizini mümkün kılar; bu değişiklikler heterozigotluğun kaybına yol açabilir ve böylece genotip olasılığını etkileyebilir.

Yöntem, insan bireylerden alınan yeni nesil dizileme verilerini içeren ve kişi başına birden fazla örneklem bulunan her türlü projede geniş bir uygulama bulunabilir. Bu, bireysel hastalar için kişiselleştirilmiş yaklaşımlardan, farklı hastalık bölgeleri için yüksek boyutlu moleküler veriler toplayan büyük klinik çalışmalara kadar uzanabilir. Kalite kontrol iş akışları, türler arası kontaminasyonun araştırılması ve yüksek boyutlu moleküler veri setlerini klinik bilgilerle bağlayarak yeni nesil dizileme verileri için herhangi bir kalite kontrol boru hattına entegre edilmesi yaklaşımlarıyla birleştirilebilir.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tüm yazarlar F. Hoffmann-La Roche Ltd'nin çalışanı veya dış yüklenicisi ve hissedarıdır. Ayrıca, Zachary Whitfield Rancho Biosciences'ta, Ana Teixeira ise A4Pbio'da çalışandır. Yazarlar rekabet eden çıkarlar belirtmemektedir.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Örneklerini sağladıkları için hastalara ve ailelerine içtenlikle teşekkür ediyoruz. Özellikle klinik araştırma organizasyonlarımızdaki çalışma ekipleri, araştırmacı ekipleri ve proje ekiplerine en derin katkıları için en derin teşekkürlerimizi sunuyoruz. Yazarlar, el yazmasını eleştirel okumaları ve değerli yorumları için N. Nair ve E. Guarin'e teşekkür eder. Ayrıca, ek veri setlerinin erişilebilir hale getirilmesine verdiği destek için A. Cosolo'ya teşekkürlerimizi sunarız. Roche genelinde Gelişmiş Veri ve İçgörüler Paylaşımı (EDIS) ağının veri küratı ve uyumlandırma konusundaki çabalarını takdir ediyoruz.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
FastQCv0.11.9SCR_014583
MultiQCv1.8SCR_014982
BWA-MEMv0.7.17SCR_010910
STARv2.7.9aSCR_004463
SAMtoolsV1.12, v1.19.2SCR_005227
-&  faidx
-&  Sort
-&  Indeks
- addreplacerg
PicardV2.25.5, v3.0.0SCR_006525
- CreateSequenceDictionary
- MarkDuplicates
- build_fingerprint_maps
- ExtractFingerprints
- CrosscheckFingerprints
CWLv1.2SCR_015528
RR v4.3.1SCR_001905
dplyr v1.1.4

Kaynaklar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Westphal, M., et al. SMaSH: sample matching using SNPs in humans. BMC Genomics. 20 (12), 1001(2019).
  2. Westra, H. J., et al. MixupMapper: correcting sample mix-ups in genome-wide datasets increases power to detect small genetic effects. Bioinformatics. 27 (15), 2104-2111 (2011).
  3. Addala, V., et al. Computational immunogenomic approaches to predict response to cancer immunotherapies. Nat. Rev. Clin. Oncol. 21 (1), 28-46 (2024).
  4. Schröder, J., Corbin, V., Papenfuss, A. T. HYSYS: have you swapped your samples. Bioinformatics. 33 (4), 596-598 (2017).
  5. Pengelly, R. J., et al. A SNP profiling panel for sample tracking in whole-exome sequencing studies. Genome Med. 5 (9), 89(2013).
  6. Subramanian, I., et al. Multi-omics data integration, interpretation, and its application. Bioinform Biol Insights. 14, 117793221989905(2020).
  7. Baião, A. R., et al. A technical review of multi-omics data integration methods: from classical statistical to deep generative approaches. Brief Bioinform. 26 (4), bbaf355(2025).
  8. Wang, Z., Zhao, Y., Zhang, L. Emerging trends and hot topics in the application of multi-omics in drug discovery: A bibliometric and visualized study. Curr Pharm Anal. 21 (1), 20-32 (2024).
  9. Morris, S., et al. Two algorithms for biospecimen comparison and differentiation using SNP genotypes. Pharmacogenomics. 14 (4), 379-390 (2013).
  10. Yoo, S., et al. MODMatcher: multi-omics data matcher for integrative genomic analysis. PLoS Comput Biol. 10 (8), e1003790(2014).
  11. Li, L., et al. SMAP is a pipeline for sample matching in proteogenomics. Nat Commun. 13 (1), 744(2022).
  12. Cibulskis, K., et al. ContEst: estimating cross-contamination of human samples in next-generation sequencing data. Bioinformatics. 27 (18), 2601-2602 (2011).
  13. Chun, H., Kim, S. BAMixChecker: an automated checkup tool for matched sample pairs in NGS cohort. Bioinformatics. 35 (22), 4806-4808 (2019).
  14. Lee, S., et al. NGSCheckMate: software for validating sample identity in next-generation sequencing studies within and across data types. Nucleic Acids Res. 45 (11), e103-e103 (2017).
  15. Javed, N., et al. Detecting sample swaps in diverse NGS data types using linkage disequilibrium. Nature Commun. 11 (1), 3697(2020).
  16. Wang, P. P. S., Parker, W. T., Branford, S., Schreiber, A. W. BAM-matcher: a tool for rapid NGS sample matching. Bioinformatics. 32 (17), 2699-2701 (2016).
  17. Katsanis, S. H., Wagner, J. K. Characterization of the standard and recommended codis markers. J Forensic Sci. 58, s1(2013).
  18. Yousefi, S., et al. BIOS consortium. A SNP panel for identification of DNA and RNA specimens. BMC Genomics. 19 (1), 90(2018).
  19. Huang, J., Chen, J., Lathrop, M., Liang, L. A tool for RNA sequencing sample identity check. Bioinformatics. 29 (11), 1463-1464 (2013).
  20. Goldfeder, R. L., et al. A bioinformatics approach for determining sample identity from different lanes of high-throughput sequencing data. PLoS ONE. 6 (8), e23683(2011).
  21. Crusoe, M. R., et al. Methods included: standardizing computational reuse and portability with the common workflow language. Commun ACM. 65 (6), 54-63 (2022).
  22. Ahmed, A. E., et al. Design considerations for workflow management systems use in production genomics research and the clinic. Scientific Rep. 11 (1), (2021).
  23. Li, H., Durbin, R. Fast and accurate short read alignment with Burrows-Wheeler transform. Bioinformatics. 25 (14), 1754-1760 (2009).
  24. Dobin, A., et al. STAR: ultrafast universal RNA-seq aligner. Bioinformatics. 29 (1), 15-21 (2013).
  25. Bergmann, E. A., et al. Conpair: concordance and contamination estimator for matched tumor–normal pairs. Bioinformatics. 32 (20), 3196-3198 (2016).

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

Multiomik VerilerNumune KontaminasyonuNumune Uyu mazl TespitiBiyoenformatik AkGenom Boyu Kar la t rmaTek N kleotid PolimorfizmleriBa lant Dengesizli iKlinik BiyobelgelerBiyobelirte Validasyonu

İlgili makaleler