Artykuł metodologiczny

Wykrywanie zanieczyszczeń międzyosobowych i niezgodności w multiomice danych sekwencjonowania nowej generacji

DOI:

10.3791/69428

17 kwietnia 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Protokół ten opisuje wdrożenie ram kontroli jakości w celu wykrywania zanieczyszczeń międzyosobowych i niezgodności w danych sekwencjonowania nowej generacji poprzez weryfikację tożsamości genetycznej par próbek w poszczególnych osobnikach.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wysokoprzepustowe przetwarzanie próbek biologicznych pacjentów poprzez sekwencjonowanie nowej generacji oraz porównanie danych molekularnych z danymi klinicznymi na poziomie pacjenta i próbki wymagają precyzyjnego śledzenia i dopasowywania identyfikatorów próbek w całym łańcuchu przechowywania próbek biologicznych i są kluczowe dla umożliwienia solidnej interpretacji wyników badań biomarkerowych. Oprócz śledzenia poszczególnych etapów w procesie przetwarzania próbek i danych, rozwiązania bioinformatyczne mogą być wykorzystywane do potwierdzania, że próbki pochodzą od tego samego pacjenta. Tutaj pokazano wykorzystanie pracy bioinformatycznej do identyfikacji dopasowanych próbek pochodzących od tej samej osoby. Workflow analizy jest odpowiedni dla porównania i weryfikacji dwóch lub więcej par zbiorów danych NGS pod kątem pochodzenia próbki pacjenta. Algorytm punktacji oparty na porównaniach próbek w całym genomie pozwala użytkownikowi ustalić, czy dwie próbki pochodzą od tej samej osoby. Konkretnie, do identyfikacji i porównania próbek używa się polimorfizmów pojedynczych nukleotydów (SNP) w wybranych blokach nierównowagi sprzężeń. Zidentyfikowano kombinacje progowe dla dopuszczalnego i rygorystycznego wyboru próbek dopasowanych i niedopasowanych. Przydatność tego protokołu została udowodniona poprzez jego zastosowanie w kontroli jakości i walidacji klinicznych tkanek nowotworowych oraz próbek krwi, obejmujących wiele metod omiki od ponad 2000 pacjentów.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Duże zbieranie i analiza próbek klinicznych wymagają dokładnego śledzenia próbek w łańcuchu przechowywania, ponieważ prawidłowe dopasowanie danych molekularnych z tych samych lub różnych metod oraz danych na poziomie pacjentów i próbek klinicznych jest niezbędne do dokładnej interpretacji i podejmowania świadomych decyzji. Pomimo rygorystycznych wysiłków na rzecz usprawnienia protokołów przetwarzania próbek w ramach dobrej praktyki klinicznej, wymiana próbek lub błędne oznakowanie może występować na różnych etapach – od biopsji/pobierania próbki, przez etapy przygotowania i przetwarzania, aż po etap analizy danych (Rysunek 1). Wraz ze wzrostem liczby próbek i etapów przetwarzania wzrasta prawdopodobieństwo wymiany próbek i zanieczyszczenia krzyżowego. Może to skutkować analizą danych z nieprawidłowymi relacjami próba-pacjent, co wpływa na dalsze analizy i wnioski, dlatego jest to ważny aspekt do uwzględnienia w badaniach genomiki klinicznej. W badaniach klinicznych nieprawidłowa identyfikacja próbek może znacząco wpłynąć na ogólne wyniki, zwłaszcza w badaniach z małą wielkością próby1. Zanieczyszczenie u osób może prowadzić do utraty zasilania podczas identyfikacji różnic oraz fałszywie pozytywnych wyników podczas porównywania wielu próbek od tego samego pacjenta. Zamiany próbek wpływają na zdolność wykrywania skojarzeń genetycznych i mogą prowadzić do niedoszacowania dziedziczności złożonych cech w analizie asocjacji całego genomu2.

Badania nad rakiem są jednym z obszarów, w których przeprowadzane są szeroko zakrojone analizy genomowe i transkryptomiczne, w szczególności monitorowanie heterogeniczności genomowej i fenotypowej między pacjentami i wewnątrzpacjentami. Jednym z aspektów badań nad rakiem jest to, że próbki tego samego pacjenta mogą mieć różne mutacje i zmiany liczby kopii, a tym samym wykazywać niezależne częstotliwość alleli wariantów4. Szczególnie przy interpretacji danych z różnych typów omiki ważna jest prawidłowa integracja wielomodalnych zbiorów danych od tych samych osób, co wymaga monitorowania zanieczyszczenia międzyosobowego 5,6,7,8. Badania na zbiorach danych z programu Cancer Genome Atlas (TCGA) oraz Lung Genomic Research Consortium (LGRC) wykazały średnio 3% błędnej identyfikacji prób i nawet ~20% w niektórych badaniach 2,9,10,11. Te przykłady pokazują znaczenie monitorowania występowania wymian próbek i zanieczyszczenia krzyżowego12. Poza rutynowym monitorowaniem i kontrolą jakości na każdym etapie procesu, analiza porównawcza wyników sekwencjonowania pełni rolę ostatecznej kontroli jakości. Zapewnia to dokładne dopasowanie próbek przed przejściem do analizy i interpretacji danych.

Opracowano szereg metod bioinformatycznych, które pozwalają zidentyfikować, czy próbki pochodzą od tej samej osoby 1,4,13,14,15,16. Początkowe podejścia wykorzystywały krótkie powtórzenia tandemowe do weryfikacji tożsamości próbki17. Dane sekwencjonowania nowej generacji na poziomie RNA i DNA pozwalają teraz na porównanie par próbek na podstawie polimorfizmów pojedynczych nukleotydów18. Różnią się pod względem zastosowania do różnych metod sekwencjonowania i zbiorów danych, np. dla sekwencjonowania RNA19 lub całych danych egzomowych5, ich implementacji, np. sprawdzania na ścieżkach sekwencjonowania20, oraz łatwości obsługi. Chociaż próbki od tej samej osoby można zidentyfikować na podstawie 20–45 polimorfizmów pojedynczych nukleotydów, podejścia sekwencjonowania o niskim i średnim pokryciu, typowo stosowane w badaniach nad rakiem, wymagają integracji dużej liczby SNP1.

Tutaj opisano implementację i dostosowania jednego z takich podejść z wykorzystaniem bloków nierównowagi sprzężeń SNP15, które są używane do kontroli jakości dopasowanych próbek. Wykazano, że podejście to charakteryzuje się niskim wskaźnikiem fałszywych flag i fałszywych dopasowań, a workflow pozwala na porównanie między modalnościami, np. między sekwencjonowaniem całych egzomu a próbkami RNA, a także do użycia z różnymi formatami danych. Dla szerokiego zastosowania metody w zbiorach danych w próbkach badań klinicznych, pipeline bioinformatyczny został wdrożony w wspólnym języku workflow (CWL)21,22. Dzięki czytelności i składni podobnej do YAML, naukowcy z ograniczonym doświadczeniem programistycznym mogą łatwo interpretować ogólną strukturę workflow i wyników analizy. Kolejną kluczową cechą CWL jest funkcjonalność scatter/gather (rozpraszanie), która umożliwia równoległość procesów w pełnym wykorzystaniu przydzielonych zasobów obliczeniowych. Użytkownicy mogą określić warunki, w jakich wykonywane są określone kroki, co zwiększa elastyczność uzyskanych analiz. CWL może być zintegrowany z innymi komponentami kompletnego systemu zarządzania przepływem pracy, takimi jak przechowywanie danych w bazie danych, graficzny interfejs użytkownika czy dyspozytor zadań, tworząc potężną platformę do tworzenia, uruchamiania i utrzymywania powtarzalnego zestawu analiz naukowych. Dzięki temu implementacja umożliwia ułatwiony dostęp do przepływów pracy oraz wysokoprzepustowe przetwarzanie zbiorów danych w kontekście zdefiniowanych systemów zarządzania przepływami pracy.

Ponadto zbadano wpływ regulacji parametrów dostrojenia między dopasowanymi a niedopasowanymi próbkami oraz określono progi dla permisywnego i rygorystycznego wyboru przypadków niedopasowanych. Pokazano wpływ modyfikacji tych parametrów na wybór par próbek oraz ich zastosowanie w obrębie i w różnych modalnościach omicznych. Skuteczne dostrojenie tych parametrów pozwoli użytkownikom dostosować rygorystykę interpretacji. Workflow został zastosowany na zestawie dużych zbiorów danych klinicznych z kilkoma tysiącami próbek.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Oświadczenie etyczne: Ta analiza zanieczyszczenia międzyosobowego została przeprowadzona retrospektywnie, wykorzystując indywidualne dane na poziomie pacjentów z ukończonych badań klinicznych fazy I i II, zgodnie z odpowiedzialnym procesem ponownego wykorzystania danych Roche oraz zgodnie z głównym formularzem uzgodnienia wiedzy dla każdego badania. Przed przeprowadzeniem każdego badania uzyskano zgody Komisji Etyki/Instytucjonalnej Rady Przeglądowej. Uczestnicy wyrazili i podpisali świadomą zgodę na udział w tych badaniach.

Przepływ pracy bioinformatyki
UWAGA: Implementacja przepływu pracy bioinformatycznego zaczyna się od surowych plików fastq pochodzących z danych sekwencjonowania nowej generacji, np. sekwencjonowania całego genomu, całego egzomu lub całego transkryptomu. Poszczególne kroki opisane tutaj są zintegrowane z przepływem pracy CWL.

1. Wymagane materiały referencyjne

  1. W przypadku pracy bioinformatycznej dostarcz następujące elementy:
    1. Ludzki genom referencyjny (GRCh38) w . Format FASTA .
    2. Odpowiadający plik indeksujący jako .fasta.fai.
    3. Odpowiedni słownik w formacie .dict .
    4. Mapa haplotypów dopasowująca genomowe obszary zainteresowania dla SNP i bloków nierównowagi sprzężeń (np. Picard build_fingerprint_maps, SCR_006525).
  2. Upewnij się, że nagłówek mapy haplotypów odpowiada genomowi referencyjnemu.

2. Dopasowanie do genomu referencyjnego, sortowanie i indeksowanie

  1. Uruchom workflow CWL, aby dostarczyć wyniki dla następujących kroków opisanych poniżej (lista narzędzi w Tabeli Materiałów) (Rysunek 2).
  2. Rozpocznij workflow CWL, udostępniając katalog sparowanych plików fastq lub wyrównanych plików bam.
  3. Podaj wzorzec, np. R1/R2, jako wzorzec regularny wejściowy w poleceniu CWL.
  4. Dodatkowo podaj lokalizację przepływu pracy, referencje genomu oraz pliki mapowania haplotypów.
    UWAGA: Do porównania all-to-all używa się pełnego katalogu wejściowego. Jeśli ma być porównywany podzbiór plików, należy podać plik oddzielony przecinkami zawierający nazwy plików do porównania. Opcja zaawansowana pozwala na wybór pamięci o dostępie losowym oraz liczby jednostek centralnych do wykonania procesu.
  5. Przypisz pliki fastq do ludzkiego genomu referencyjnego za pomocą algorytmu mapowania.
    UWAGA: W zależności od metody sekwencjonowania, BWA-MEM jest używany do wyników sekwencjonowania DNA23, a do wyników sekwencjonowania RNA24 używany jest mapper rozpoznający splicowanie STAR. Przykładowy kod wyrównania STAR znajduje się poniżej:
    GWIAZDA \
    --readFilesCommand zcat \
    --runThreadN 8 \
    --outSAMmapqUnique 60 \
    --outSAMattributes Wszystkie \
    --outReadsUnmapped Fastx \
    --outTmpDir /tmp/STARtmp/ \
    --runDirPerm All_RWX \
    --outSAMtyp BAM Niesortowane \
    --outFileNamePrefix /FILENAME_ \
    --outSAMattrRGline ID:FILEID. L001 SM:SAMPLE \
    --genomeDir /REF/GENOME/DIR \
    --readFilesIn /path/to/FILENAME. R1.fastq.gz /path/to/FILENAME. R2.fastq.gz
  6. Posortuj powstałe wyrównane pliki binarnej macierzy wyrównania (BAM) według współrzędnych odczytu, używając SAMtools sort (samtools sort -o FILENAME_OUT.bam FILENAME_IN.bam).
  7. Indeksuj posortowane pliki BAM, używając indeksu SAMtools (indeks samtools FILENAME_OUT.bam).
  8. Oznaczaj i usuwaj duplikaty, używając Picard MarkDuplicates.
  9. Ponownie indeksuj pliki BAM i włączaj grupy odczytu (RG) za pomocą narzędzi SAMtools.
    UWAGA: Pliki BAM muszą mieć tagi RG, aby workflow działał.

3. Wyodrębnienie odcisków palców

  1. Użyj posortowanych i indeksowanych plików BAM, aby zidentyfikować odciski palców SNP za pomocą Picard ExtractFingerprints.
  2. Używaj pośredniej pamięci pośredniej plików formatu wywołań wariantu (VCF) wyłącznie do porównania między próbkami.

4. Obliczanie wyników podobieństwa

  1. Użyj Picard CrossCheckFingerprints do obliczania log odds ratio (LOD) podobnych na podstawie bloków nierównowagi powiązań, które są udostępniane w formacie pliku crosscheck_metrics jako crosscheck_metrics.txt.
    UWAGA: Implementacja workflow pozwala na porównanie krzyżowe wszystkich możliwych kombinacji par próbek lub wybrane porównanie między próbkami z wcześniej zdefiniowanej listy.
  2. Usuń pliki VCF pośredniego.
  3. Plik crosscheck_metrics zawiera cztery porównania dla każdej pary testowanych próbek. Interpretacja wyników LOD wygląda następująco:
    Wynik LOD > 0: próbki prawdopodobnie pochodzą od tej samej osoby (dopasowanie próbki)
    Wynik LOD ≤ 0: próbki prawdopodobnie pochodzą od różnych osób
  4. Zweryfikowaj wartość odcięcia dla dopasowań próbek, wizualizując rozkład wyników LOD jako histogram, na przykład w R lub Pythonie (Rysunek 3).
  5. Zaleca się współpracę zespołu z doświadczoną wiedzą bioinformatyczną, aby ustalić, czy dowody są wystarczające do jednoznacznej identyfikacji tożsamości prób i potencjalnej korekty progów, na przykład poprzez uwzględnienie wszystkich trzech wyników LOD lub porównanie z rozkładem wyników LOD dla prób znanych z różnych osób.
    UWAGA: Pomyłki próbek mogą skutkować wieloma nieoczekiwanymi dopasowaniami (wynik LOD < 0 dla próbek tego samego dawcy) oraz niedopasowaniami (wynik LOD > 0 dla próbek od różnych dawców). Złożone interpretacje wymagają ścisłej wymiany między zespołem międzyfunkcyjnym a ekspertem bioinformatycznym.

5. Dostępność kodów

Workflow obliczeniowy będzie dostępny na Github: https://github.com/Roche/sample-matching-workflow.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Implementacja workflow CWL
Wprowadzono workflow do identyfikacji dopasowań próbek, oparty na wcześniej ustalonym podejściu wykorzystującym bloki nierównowagi wiązań polimorfizmów pojedynczych nukleotydów do identyfikacji zamian próbek,15. Autorzy wykazali wskaźniki klasyfikacji 0% FMR i 0,01% FFR dla tej metody. Porównanie z innymi podejściami wykazało podobne wyniki jak NGSCheckmate przy wysokim i średnim pokryciu oraz lepsze wyniki niż NGSCheckmate przy niskim pokryciu i minimalnym regionalnym nakładaniu się genomowym. Wyniki niejednoznaczne uzyskano przy porównaniu z Conpair i BAMixChecker 13,15,25. Tutaj workflow został wdrożony w CWL, zbadano i zoptymalizowano progi LOD oraz zastosowano go do porównania par sekwencjonowania RNA i par sekwencjonowania DNA lub między modalnościami w próbkach pobranych z tkanek oraz między próbkami tkanek i krwi obwodowej (Rysunek 3, Tabela 1). Implementacja workflow umożliwiła porównanie krzyżowe wszystkich możliwych kombinacji par próbek lub wybrane porównanie między próbkami z wcześniej zdefiniowanej listy.

Dane wejściowe do workflow wykorzystują wybrany zestaw haplotypów. Są one używane do obliczania polimorfizmów pojedynczych nukleotydów w blokach nierównowagi sprzężeń. Obliczanie wyników logarytmicznego ilorazu szans (LOD) tych bloków SNP w parach próbek pozwala rozróżnić próbki dopasowane od niedopasowanych. Wcześniej wyniki LOD w zakresie LOD < -5 i LOD > 5 wykazywały prawidłową klasyfikację dopasowanych par próbek15. Dodatkowe wyniki LOD (LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR) oblicza się z uwzględnieniem potencjalnej utraty heterozygotyczności w próbce nowotworu dla którejkolwiek z próbek (obszary heterozygotyczne w jednej próbie wykryte jako homozygoticzne w drugiej).

Wpływ parametrów wejściowych i progów na wskaźniki dopasowania/niezgodności
Ocena tego przepływu pracy podkreśliła trzy kluczowe aspekty wpływające na jego wydajność i dokładność. Po pierwsze, wybór regionów genomowych objętych mapą haplotypów okazał się kluczowym krokiem. Wybór tych regionów bezpośrednio wpływa na dyskryminującą siłę procesu dopasowywania. Po drugie, połączenie strategii wyrównania odczytu oraz specyficznych map haplotypów używanych do ekstrakcji odcisków palców znacząco wpłynęło na końcowe wyniki analizy. Zmiany w tych etapach przetwarzania powyżej mogą wprowadzać subtelne uprzedzenia, które przenoszą się na dopasowane wyniki (Rysunek 4A–B). Po trzecie, niezbędna była staranna ocena i dobór progów do ustalenia dopasowania próby. Optymalne wartości progowe mogą się znacznie różnić w zależności od konkretnej metody danych (np. sekwencjonowanie całych egzomu vs. całych transkryptomów) oraz ocenianych regionów genomowych. Różne progi mogą dostosować rygorystykę podejścia (wysoki wskaźnik fałszywie pozytywnych vs. wysoki wskaźnik fałszywie negatywnych) (Rysunek 4C). Aby rozwiązać ten problem dla dużej grupy prób klinicznych, metoda została dostosowana do definiowania zarówno permisywnych, jak i rygorystycznych kombinacji wyników dopasowywania próby na podstawie kombinacji użytych wyników LOD i porównawczego. Pierwsze podejście progowe (I) osiągnięto poprzez rozpatrzenie dowolnej wartości pozytywnej spośród trzech wyników LOD (LOD_SCORE, LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR). Uwzględniając informacje o wynikach TUMOR_NORMAL i NORMAL_TUMOR, można złagodzić skutki utraty heterozygotyczności, wynikającej ze zmian w liczbie kopii próbek nowotworowych. Z kolei wprowadzono bardziej rygorystyczny próg dla niezgodności (II) poprzez zastosowanie dwóch alternatywnych kryteriów filtrowania, dostosowanych do zmniejszenia liczby fałszywie pozytywnych: (a) kategoryzacja jako dopasowanie tylko LOD_SCORE jest pozytywne, b) kategoryzacja jako dopasowanie, jeśli dla danej próby LOD_SCORE jest wyższy niż maksymalny wynik innych LOD_SCOREs parowych próbek próby, której nie oczekuje się zgodności (na podstawie udokumentowanego pacjenta pochodzenia), nawet jeśli sam LOD_SCORE jest ujemny.

W tym zastosowaniu, aby wygenerować próg permisywny, każda para prób oznaczona jako dopasowanie według któregokolwiek z powyższych kryteriów (I, IIa, IIb) była uznawana za dopasowanie. Zapewniało to wysoką pewność co do wszystkich zidentyfikowanych niezgodności, kosztem potencjalnych rzeczywistych niezgodności oznaczanych jako dopasowania (czyli fałszywie negatywne). Porównanie progu permisywnego z bardziej rygorystycznymi progami wykazało przesunięcie w odsetku par klasyfikowanych jako niedopasowania. Różnica między podejściami we wszystkich analizowanych badaniach wynosiła 3,9% (każdy z trzech punktów LOD uzyskał pozytywny wynik (I)), 13,3% (LOD_SCORE musi być pozytywny (IIa)), 9,2% (LOD_SCORE w porównaniu do par niepasujących do próby (IIb)) oraz 3,6% (uwzględniając którykolwiek z powyższych punktów do wskazania dopasowania) (Rysunek 4C).

Wpływ pokrycia regionów genomowych
Różnica między ujemnymi a dodatnimi wynikami LOD dla dopasowanych i niedopasowanych próbek jest największa, gdy obejmuje się szeroki zakres regionów genomowych (sekwencjonowanie całego genomu (WGS) lub porównanie próbek WGS z innymi metodami), co ułatwia selekcję progową (rysunek 5A). W porównaniach sekwencjonowania całych egzomu i RNA, wyniki LOD są bliższe zeru, a podejścia progowe wpływają na wyniki, co podkreśla znaczenie oceny rygorystycznej progów dla modalności o niższym pokryciu genomowym. Rozkład wyników ze znanych prób sparowanych z dodatnimi wynikami LOD przedstawiono na Rysunku 5B. Javed i in. (2020) wykazali, że już 0,02% nakładania się genomu wystarcza do rozróżnienia między dopasowanymi a niedopasowanymi próbkami przy użyciu bloków nierównowagi sprzężenia15.

Walidacja
Podejście to zostało zweryfikowane na dodatkowych zbiorach danych dotyczących raka piersi, raka jelita grubego oraz sekwencjonowania pełnego egzomu (WES) i sekwencjonowania RNA, dla których znany zestaw próbek miał pochodzić od tych samych osób (Rysunek 6A). Pary próbek od tej samej osoby wykazały 100% wskaźnik dopasowania (rysunek 6B), podczas gdy dodatkowe porównania z innymi próbami pochodzącymi od różnych osób wykazały 100% wskaźnik niedopasowania. Nie zaobserwowano ani fałszywie pozytywnych, ani fałszywie negatywnych wyników w żadnym z tych zbiorów danych.

Podsumowując, wdrożenie workflow kontroli jakości ułatwia porównania między osobami parami próbek sekwencjonowania nowej generacji poprzez zapewnienie standaryzowanego, powtarzalnego podejścia. Uzyskane progi LOD dają niskie wskaźniki fałszywie pozytywnych i fałszywie ujemnych dla próbek z dużym regionalnym nakładaniem się genomu, a dodatkowa optymalizacja progowa może być stosowana dla próbek o niskiej głębokości sekwencjonowania lub przy niewielkim nakładaniu się genomu.

figure-results-1
Rysunek 1: Schematyczne przedstawienie występowania zamian próbek i błędnego oznaczania. (A) Zamiana próbek po jednej próbce między dwiema osobami. (B) Reprezentacja kroków przetwarzania próbek od pobierania biopsji do analizy danych sekwencjonowanych. Stworzone w BioRender. Voith von Voithenberg, L. (2026) https://BioRender.com/xhbp178. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

figure-results-2
Rysunek 2: Reprezentacja interfejsu użytkownika dla plików wejściowych oraz parametrów niezbędnych do uruchomienia procesu kontroli jakości próbek w CWL. Graficzny interfejs użytkownika do wprowadzania plików i parametrów. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

figure-results-3
Rysunek 3: Wyniki uzyskane z procesu dopasowywania próbek. Rozkład wyników LOD dla wzorowego zestawu próbek sekwencjonowania DNA (sekwencjonowanie całego genomu i całego egzomu) (po lewej), do porównania sekwencjonowania DNA i sekwencjonowania RNA (w środku), aby pokazać, jak bardzo niewiele niedopasowanych próbek zachowuje się w porównaniu z rozkładem dopasowanych próbek, oraz dla przykładowej większej kohorty par sekwencjonowania RNA (po prawej) z danymi znanymi pochodzącymi od różnych osób (niedopasowania, jasnoczerwony) oraz od tej samej osoby (zapałki, jasnozielony). Skróty; LOD = logarytmiczny iloraz szans. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

figure-results-4
Rysunek 4: Przykładowe różnice w wyniku LOD zaobserwowane. (A) przy łączeniu różnych metod wyrównywania sekwencji i map haplotypów dla zestawu znanych niedopasowanych i dopasowanych próbek, oraz (B) przy ocenie przez integrację informacji nowotworowych i normalnych. (C) Występowanie liczby dopasowań i niezgodności próbek określonych przez podejścia thresholding o różnej rygorystyczności. Skróty; LOD = logarytmiczny iloraz szans. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

figure-results-5
Rysunek 5: Przykładowy rozkład wyników LOD do porównania różnych modalności sekwencjonowania nowej generacji. (A) Rozkład wyników LOD oczekiwanych niedopasowanych i dopasowanych próbek pomiędzy sekwencjonowaniem DNA z krwi i tkanki nowotworowej a sekwencjonowaniem RNA z tkanki nowotworowej. (B) rozkład wyników LOD dopasowanych próbek dla kombinacji różnych metod. Skróty; LOD = logarytmiczny iloraz szans. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

figure-results-6
Rysunek 6: Rozkład wyników LOD do analizy zbioru danych o raku piersi WES i sekwencjonowaniu RNA. Zidentyfikowany zbiór danych dotyczących raka piersi został pozyskany z Caris Life Sciences i pochodzi z kompleksowego profilowania nowotworów. (A) Logarytmiczne wystąpienie wyników LOD dla porównań między próbkami WES z nowotworów (po lewej) a próbkami sekwencjonującymi RNA (po prawej). (B) rozkłady wyników LOD dla oczekiwanych par próbek od tych samych osób (górny rząd WES, dolny rząd sekwencjonujący RNA). Skróty; LOD = logarytmiczny iloraz szans. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

LEFT_GROUP_VALUERIGHT_GROUP_VALUEREZULTATLOD_SCORELOD_SCORE_
TUMOR_NORMAL
LOD_SCORE_
NORMAL_TUMOR
Przykład 1Przykład 1EXPECTED_MATCH38.11926629.64948529.649485
Przykład 1Przykład 2EXPECTED_MISMATCH-2.552644-4.574225.283698
Przykład 2Przykład 1EXPECTED_MISMATCH-2.5526445.283698-4.57422
Przykład 2Przykład 2EXPECTED_MATCH12.3287378.7964578.796457

Tabela 1: Przykładowe wyniki uzyskane podczas przeprowadzenia Crosscheck Fingerprints. Tabela pokazuje wzorcowe wyniki pary próbek porównanych metodą dopasowywania prób.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dostępnych jest wiele metod identyfikacji dopasowania próbek: 1,4,13,14,15,16. Tutaj opisano wdrożenie podejścia wykorzystującego bloki nierównowagi powiązania SNP, które można mieć zastosowanie w wielu modalnościach omicznych, z niskimi wskaźnikami fałszywie pozytywnych i fałszywie negatywnych wyników15. Implementacja została przeprowadzona w CWL, aby ułatwić przetwarzanie o wysokiej przepustowości między zbiorami danych w ramach ustandaryzowanego środowiska workflow. Ocena przepływu pracy zidentyfikowała trzy kluczowe aspekty do rozważenia przy stosowaniu podejścia. Kluczowym krokiem w tym procesie jest wybór regionów genomowych objętych mapą haplotypów. Dodatkowo, łączenie wyrównania odczytu z ekstrakcją odcisków palców przy użyciu różnych map haplotypów może wpłynąć na wyniki analizy. Ponadto staranna ocena i wybór progów, które mogą zależeć od modalności danych i obejmowanych regionów, są niezbędne i mogą prowadzić do bardziej lub mniej liberalnego dopasowywania próbek.

Do oceny dużych zbiorów prób klinicznych metoda została dostosowana do definiowania kombinacji progów dla permisywnych i rygorystycznych wyników dopasowywania próbek. Metoda została dostosowana do uwzględnienia podejścia progowego z uwzględnieniem łącznego wyniku obejmującego dowolny z wyników LOD (LOD_SCORE, LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR) lub dwa alternatywne kryteria filtrowania, co skutkowało bardziej rygorystycznym wyborem próbek. Zastosowanie tego podejścia ogranicza się do próbek, dla których dostępne są informacje SNP z różnych regionów genomowych, np. dane sekwencjonowania nowej generacji. Ponadto do analizy porównawczej i dopasowywania próbek wymagane są co najmniej pary próbek od tej samej osoby. Dodatkowe informacje kliniczne, takie jak status mutacji uzyskany metodami celowanymi lub metadane pacjenta, np. płeć, mogą być wykorzystywane do dostarczenia dodatkowych dowodów na dopasowanie danych molekularnych o wysokim wymiarze a danych klinicznych na poziomie pacjenta.

Wdrożenie tego podejścia w środowisku zarządzania przepływem pracy, z możliwością równoległego przechowywania danych, umożliwia wysokoprzepustową analizę jakości próbek pod kątem zanieczyszczeń międzyludzkich. W ten sposób zwiększa dostępność i powtarzalność podejścia w zbiorach danych i próbkach. Elastyczność kryteriów progowych w tym podejściu umożliwia przetwarzanie i analizę próbek nowotworów o niskim i wysokim obciążeniu mutacyjnym guza oraz zmianach w liczbie kopii, które mogą prowadzić do utraty heterozygotyczności i tym samym wpływać na prawdopodobieństwo genotypu.

Metoda ta może znaleźć szerokie zastosowanie w każdym rodzaju projektu obejmującego sekwencjonowanie nowej generacji danych od osób ludzkich i dla którego dostępna jest więcej niż jedna próba na osobę. Może to obejmować zarówno indywidualne podejścia dla poszczególnych pacjentów, jak i duże badania kliniczne zbierające wysokowymiarowe dane molekularne dla różnych obszarów chorób. Można go łączyć z procesami kontroli jakości, badaniem skażenia międzygatunkowego oraz podejściami łączącymi wysokowymiarowe zbiory danych molekularnych z informacjami klinicznymi w celu integracji z dowolnym procesem kontroli jakości dla danych sekwencjonowania nowej generacji.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wszyscy autorzy są pracownikami lub zewnętrznymi wykonawcami i akcjonariuszami F. Hoffmann-La Roche Ltd. Dodatkowo, Zachary Whitfield jest pracownikiem Rancho Biosciences, a Ana Teixeira jest pracownicą A4Pbio. Autorzy deklarują brak konkurencyjnych interesów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Serdecznie dziękujemy pacjentom i ich rodzinom za przekazanie próbek. Składamy najgłębsze podziękowania wszystkim zaangażowanym w badania kliniczne, szczególnie członkom zespołów badawczych, zespołów badawczych i projektowych w naszych organizacjach badawczych, za ich nieoceniony wkład. Autorzy dziękują N. Nairowi i E. Guarinowi za krytyczną lekturę rękopisu oraz cenne uwagi. Wyrażamy również podziękowania A. Cosolo za wsparcie w udostępnianiu kolejnych zbiorów danych. Dziękujemy sieci Roche Enhanced Data and Insights Sharing (EDIS) za ich wysiłki w zakresie kuracji i harmonizacji danych.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
FastQCv0.11.9SCR_014583
MultiQCv1.8SCR_014982
BWA-MEMv0.7.17SCR_010910
GWIAZDAv2.7.9aSCR_004463
SAMtoolsV1.12, v1.19.2SCR_005227
-  faidx
-  sortować
-  Indeks
- addresubredrg
PicardV2.25.5, v3.0.0SCR_006525
- CreateSequenceDictionary
- MarkDuplicates
- build_fingerprint_maps
- ExtractFingerprints
- CrosscheckFingerprints
CWLv1.2SCR_015528
RR v4.3.1SCR_001905
Dplyr v1.1.4

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. SMaSH: sample matching using SNPs in humans. BMC Genomics. 20 (12), 1001(2019).">Westphal, M., et al. SMaSH: sample matching using SNPs in humans. BMC Genomics. 20 (12), 1001(2019).
  2. MixupMapper: correcting sample mix-ups in genome-wide datasets increases power to detect small genetic effects. Bioinformatics. 27 (15), 2104-2111 (2011).">Westra, H. J., et al. MixupMapper: correcting sample mix-ups in genome-wide datasets increases power to detect small genetic effects. Bioinformatics. 27 (15), 2104-2111 (2011).
  3. Computational immunogenomic approaches to predict response to cancer immunotherapies. Nat. Rev. Clin. Oncol. 21 (1), 28-46 (2024).">Addala, V., et al. Computational immunogenomic approaches to predict response to cancer immunotherapies. Nat. Rev. Clin. Oncol. 21 (1), 28-46 (2024).
  4. HYSYS: have you swapped your samples. Bioinformatics. 33 (4), 596-598 (2017).">Schröder, J., Corbin, V., Papenfuss, A. T. HYSYS: have you swapped your samples. Bioinformatics. 33 (4), 596-598 (2017).
  5. A SNP profiling panel for sample tracking in whole-exome sequencing studies. Genome Med. 5 (9), 89(2013).">Pengelly, R. J., et al. A SNP profiling panel for sample tracking in whole-exome sequencing studies. Genome Med. 5 (9), 89(2013).
  6. Multi-omics data integration, interpretation, and its application. Bioinform Biol Insights. 14, 117793221989905(2020).">Subramanian, I., et al. Multi-omics data integration, interpretation, and its application. Bioinform Biol Insights. 14, 117793221989905(2020).
  7. A technical review of multi-omics data integration methods: from classical statistical to deep generative approaches. Brief Bioinform. 26 (4), bbaf355(2025).">Baião, A. R., et al. A technical review of multi-omics data integration methods: from classical statistical to deep generative approaches. Brief Bioinform. 26 (4), bbaf355(2025).
  8. Emerging trends and hot topics in the application of multi-omics in drug discovery: A bibliometric and visualized study. Curr Pharm Anal. 21 (1), 20-32 (2024).">Wang, Z., Zhao, Y., Zhang, L. Emerging trends and hot topics in the application of multi-omics in drug discovery: A bibliometric and visualized study. Curr Pharm Anal. 21 (1), 20-32 (2024).
  9. Two algorithms for biospecimen comparison and differentiation using SNP genotypes. Pharmacogenomics. 14 (4), 379-390 (2013).">Morris, S., et al. Two algorithms for biospecimen comparison and differentiation using SNP genotypes. Pharmacogenomics. 14 (4), 379-390 (2013).
  10. MODMatcher: multi-omics data matcher for integrative genomic analysis. PLoS Comput Biol. 10 (8), e1003790(2014).">Yoo, S., et al. MODMatcher: multi-omics data matcher for integrative genomic analysis. PLoS Comput Biol. 10 (8), e1003790(2014).
  11. SMAP is a pipeline for sample matching in proteogenomics. Nat Commun. 13 (1), 744(2022).">Li, L., et al. SMAP is a pipeline for sample matching in proteogenomics. Nat Commun. 13 (1), 744(2022).
  12. ContEst: estimating cross-contamination of human samples in next-generation sequencing data. Bioinformatics. 27 (18), 2601-2602 (2011).">Cibulskis, K., et al. ContEst: estimating cross-contamination of human samples in next-generation sequencing data. Bioinformatics. 27 (18), 2601-2602 (2011).
  13. BAMixChecker: an automated checkup tool for matched sample pairs in NGS cohort. Bioinformatics. 35 (22), 4806-4808 (2019).">Chun, H., Kim, S. BAMixChecker: an automated checkup tool for matched sample pairs in NGS cohort. Bioinformatics. 35 (22), 4806-4808 (2019).
  14. NGSCheckMate: software for validating sample identity in next-generation sequencing studies within and across data types. Nucleic Acids Res. 45 (11), e103-e103 (2017).">Lee, S., et al. NGSCheckMate: software for validating sample identity in next-generation sequencing studies within and across data types. Nucleic Acids Res. 45 (11), e103-e103 (2017).
  15. Detecting sample swaps in diverse NGS data types using linkage disequilibrium. Nature Commun. 11 (1), 3697(2020).">Javed, N., et al. Detecting sample swaps in diverse NGS data types using linkage disequilibrium. Nature Commun. 11 (1), 3697(2020).
  16. BAM-matcher: a tool for rapid NGS sample matching. Bioinformatics. 32 (17), 2699-2701 (2016).">Wang, P. P. S., Parker, W. T., Branford, S., Schreiber, A. W. BAM-matcher: a tool for rapid NGS sample matching. Bioinformatics. 32 (17), 2699-2701 (2016).
  17. Characterization of the standard and recommended codis markers. J Forensic Sci. 58, s1(2013).">Katsanis, S. H., Wagner, J. K. Characterization of the standard and recommended codis markers. J Forensic Sci. 58, s1(2013).
  18. A SNP panel for identification of DNA and RNA specimens. BMC Genomics. 19 (1), 90(2018).">Yousefi, S., et al. BIOS consortium. A SNP panel for identification of DNA and RNA specimens. BMC Genomics. 19 (1), 90(2018).
  19. A tool for RNA sequencing sample identity check. Bioinformatics. 29 (11), 1463-1464 (2013).">Huang, J., Chen, J., Lathrop, M., Liang, L. A tool for RNA sequencing sample identity check. Bioinformatics. 29 (11), 1463-1464 (2013).
  20. A bioinformatics approach for determining sample identity from different lanes of high-throughput sequencing data. PLoS ONE. 6 (8), e23683(2011).">Goldfeder, R. L., et al. A bioinformatics approach for determining sample identity from different lanes of high-throughput sequencing data. PLoS ONE. 6 (8), e23683(2011).
  21. Methods included: standardizing computational reuse and portability with the common workflow language. Commun ACM. 65 (6), 54-63 (2022).">Crusoe, M. R., et al. Methods included: standardizing computational reuse and portability with the common workflow language. Commun ACM. 65 (6), 54-63 (2022).
  22. Design considerations for workflow management systems use in production genomics research and the clinic. Scientific Rep. 11 (1), (2021).">Ahmed, A. E., et al. Design considerations for workflow management systems use in production genomics research and the clinic. Scientific Rep. 11 (1), (2021).
  23. Fast and accurate short read alignment with Burrows-Wheeler transform. Bioinformatics. 25 (14), 1754-1760 (2009).">Li, H., Durbin, R. Fast and accurate short read alignment with Burrows-Wheeler transform. Bioinformatics. 25 (14), 1754-1760 (2009).
  24. STAR: ultrafast universal RNA-seq aligner. Bioinformatics. 29 (1), 15-21 (2013).">Dobin, A., et al. STAR: ultrafast universal RNA-seq aligner. Bioinformatics. 29 (1), 15-21 (2013).
  25. Conpair: concordance and contamination estimator for matched tumor–normal pairs. Bioinformatics. 32 (20), 3196-3198 (2016).">Bergmann, E. A., et al. Conpair: concordance and contamination estimator for matched tumor–normal pairs. Bioinformatics. 32 (20), 3196-3198 (2016).

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Dane multiomiczneKontaminacja pr bekWykrywanie niezgodno ci pr bekPrzep yw bioinformatycznyPor wnanie w szerokim zakresie genomuPolimorfizmy pojedynczego nukleotyduR wnowaga sprz eKliniczne biopr bkiWalidacja biomarker w

Powiązane artykuły