Artigo de método

Detectando Contaminação Interindividual e Descorrespondências em Dados de Sequenciamento de Próxima Geração Multiômica

DOI:

10.3791/69428

17 de abril de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo descreve a implementação de uma estrutura de controle de qualidade para detectar contaminação e desajustes entre indivíduos nos dados de sequenciamento de próxima geração, verificando a identidade genética de pares de amostras dentro dos indivíduos.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O processamento de alta produtividade de bioamostras de pacientes por sequenciamento de próxima geração e a comparação de dados moleculares com dados clínicos em nível de paciente e amostra exigem rastreamento preciso e correspondência dos identificadores da amostra ao longo da cadeia de custódia da bioamostra e são fundamentais para permitir uma interpretação robusta dos resultados de ensaios de biomarcadores. Além de rastrear etapas individuais nos fluxos de processamento de amostras e dados, soluções de bioinformática podem ser usadas para confirmar que as amostras se originam do mesmo paciente. Aqui, é apresentado o uso de um fluxo de trabalho de bioinformática para identificar amostras pareadas originadas do mesmo indivíduo. O fluxo de trabalho de análise é adequado para quaisquer dois ou mais pares de conjuntos de dados NGS a serem comparados e verificados quanto à origem da amostra do paciente. Um algoritmo de pontuação baseado em comparações genômicas de amostras permite ao usuário determinar se duas amostras vêm do mesmo indivíduo. Especificamente, polimorfismos de nucleotídeo único (SNPs) dentro de blocos selecionados de desequilíbrio de ligação são usados para identificar e comparar amostras. Combinações de limiar para seleção permissiva e rigorosa de amostras combinadas e descompatadas foram identificadas. A utilidade desse protocolo foi demonstrada por meio de sua aplicação ao controle de qualidade e validação de tecidos tumorais clínicos e amostras de sangue, abrangendo múltiplas modalidades cômicas de mais de 2.000 pacientes.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A coleta e análise em larga escala de amostras clínicas exigem o acompanhamento exato das amostras ao longo de sua cadeia de custódia, pois a correspondência correta de dados moleculares da mesma ou de diferentes modalidades e dados clínicos em nível de paciente e amostra é essencial para uma interpretação precisa e tomada de decisões informadas. Apesar dos esforços rigorosos para simplificar os protocolos de processamento de amostras sob boas práticas clínicas, a troca ou rotulagem incorreta da amostra pode ocorrer em várias etapas, desde a biópsia/extração da amostra até as etapas de preparação e processamento, e até a fase de análise dos dados (Figura 1). Com o aumento do número de amostras e das etapas de processamento da amostra, a probabilidade de trocas de amostras e contaminação cruzada aumenta. Isso pode resultar na análise de dados com relações incorretas entre amostra e paciente, afetando análises e conclusões posteriores, sendo assim um aspecto importante a ser considerado na pesquisa em genômica clínica. Em estudos clínicos, a identificação incorreta de amostras pode impactar fortemente os resultados gerais, especialmente em estudos com tamanho de amostrapequeno 1. A contaminação entre indivíduos pode levar à perda de energia para identificar diferenças e resultados falsos positivos ao comparar múltiplas amostras do mesmo paciente. Trocas de amostras influenciam o poder de detecção de associações genéticas e podem levar à subestimação da herdabilidade de características complexas na análise de associação genômicaampla 2.

A pesquisa em câncer é uma das áreas em que são realizadas análises genômicas e transcriptômicas em largaescala, monitorando especificamente a heterogeneidade genômica e fenotípica entre e intrapacientes. Um aspecto da pesquisa em câncer é que amostras do mesmo paciente podem apresentar mutações diferentes e alterações no número de cópias, apresentando assim frequências aleladas variantesindependentes 4. Especialmente ao interpretar dados de múltiplos tipos de ómicos, a integração correta de conjuntos de dados multimodais dos mesmos indivíduos é importante e, portanto, requer monitoramento da contaminação entre indivíduos 5,6,7,8. Estudos sobre conjuntos de dados do programa de atlas genômico do câncer (TCGA) e do Consórcio de Pesquisa Genômica Pulmonar (LGRC) identificaram taxas de identificação erradas de amostras de 3% em média e de até ~20% em certosestudos 2,9,10,11. Esses exemplos mostram a importância de monitorar a ocorrência de trocas de amostras e contaminaçãocruzada 12. Além do monitoramento rotineiro e do controle de qualidade em cada etapa do processo, uma análise comparativa dos resultados do sequenciamento atua como uma verificação final de qualidade. Isso garante a correspondência precisa das amostras antes de passar para a análise e interpretação dos dados.

Diversas abordagens de bioinformática foram estabelecidas para identificar se as amostras derivam do mesmo indivíduo 1,4,13,14,15,16. As abordagens iniciais utilizaram repetições curtas em tandem para verificar a identidade da amostra17. Dados de sequenciamento de próxima geração no nível de RNA e DNA agora permitem a comparação entre pares de amostras com base nos polimorfismos de nucleotídeoúnico 18. Eles diferem quanto à sua aplicabilidade a diferentes modalidades e conjuntos de dados de sequenciamento, por exemplo, para sequenciamento deRNA 19 ou para dados de sequenciamento de exomainteiro 5, sua implementação, por exemplo, verificação entre as rotas de sequenciamento20, e facilidade de uso. Embora amostras do mesmo indivíduo possam ser identificadas com base em 20–45 polimorfismos de nucleotídeo único, abordagens de sequenciamento de baixa a média cobertura tipicamente usadas em pesquisa do câncer exigem a integração de um grande número deSNPs 1.

Aqui, são descritos os ajustes e implementações de uma dessas abordagens usando blocos de desequilíbrio de ligação dosSNPs 15, que é usado para o controle de qualidade de amostras pareadas. A abordagem demonstrou ter baixa taxa de falsa bandeira e taxa de falsa correspondência, e o fluxo de trabalho permite a comparação entre modalidades, por exemplo, entre amostras de sequenciamento de exomas inteiros e RNA, bem como para o uso com diferentes formatos de dados. Para aplicabilidade em larga escala do método entre conjuntos de dados em amostras de ensaios clínicos, o pipeline de bioinformática foi implementado em linguagem comum de fluxo de trabalho (CWL)21,22. Devido à sua legibilidade e sintaxe semelhante à do YAML, cientistas com experiência limitada em programação podem facilmente interpretar a estrutura geral do fluxo de trabalho e dos resultados da análise. Outra característica chave do CWL é sua funcionalidade scatter/collect, que permite a paralelização de processos para utilizar totalmente os recursos computacionais alocados. Os usuários podem especificar as condições sob as quais determinadas etapas são executadas, aumentando assim a flexibilidade das análises resultantes. O CWL pode ser integrado a outros componentes de um sistema completo de gerenciamento de fluxos de trabalho, como armazenamento de banco de dados, interface gráfica do usuário e despachante de tarefas, formando uma plataforma poderosa para criar, executar e manter um conjunto reproduzível de análises científicas. Assim, essa implementação permite o acesso facilitado ao fluxo de trabalho e o processamento de alto rendimento dos conjuntos de dados no contexto de sistemas definidos de gerenciamento de fluxos de trabalho.

Além disso, foram investigados os efeitos do limiar dos parâmetros de seleção de ajuste entre amostras pareadas e não pareadas, e foram determinados limiares para seleção permissiva e rigorosa de casos inadequados. Foram apresentados os efeitos da modificação desses parâmetros na seleção de pares de amostras e sua aplicabilidade dentro e entre diferentes modalidades ômicas. Ajustar esses parâmetros de forma eficaz permitirá que os usuários ajustem a rigor de suas interpretações. O fluxo de trabalho foi aplicado a um conjunto de conjuntos de dados clínicos em grande escala com vários milhares de amostras.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Declaração de ética: Esta análise da contaminação entre indivíduos foi realizada retrospectivamente utilizando dados individuais em nível de paciente de estudos clínicos de fase I e fase II concluídos, de acordo com o processo responsável de reutilização de dados de Roche e em conformidade com o formulário mestre de consentimento informado para cada estudo. As aprovações do Comitê de Ética/Comitê de Revisão Institucional foram obtidas para cada estudo antes de sua condução. Os participantes deram e assinaram consentimento informado para participar desses estudos.

Fluxo de trabalho em bioinformática
NOTA: A implementação do fluxo de trabalho em bioinformática começa com arquivos fastq brutos derivados de dados de sequenciamento de próxima geração, por exemplo, sequenciamento de genoma inteiro, exoma inteiro ou transcriptoma completo. As etapas individuais descritas aqui estão integradas ao fluxo de trabalho da CWL.

1. Materiais de referência necessários

  1. Para o fluxo de trabalho de bioinformática, forneça o seguinte:
    1. Genoma de referência humano (GRCh38) em . Formato fasta .
    2. Arquivo de indexação correspondente como .fasta.fai.
    3. Dicionário correspondente em formato .dict .
    4. Um mapa de haplótipo que corresponde a regiões genômicas de interesse para SNPs e blocos de desequilíbrio de ligação (por exemplo, Picard build_fingerprint_maps, SCR_006525).
  2. Certifique-se de que o cabeçalho do mapa do haplótipo corresponda ao genoma de referência.

2. Alinhamento ao genoma de referência, ordenação e indexação

  1. Execute o fluxo de trabalho CWL para fornecer os resultados das seguintes etapas descritas abaixo (lista de ferramentas na Tabela de Materiais) (Figura 2).
  2. Inicie o fluxo de trabalho CWL fornecendo um diretório de arquivos fastq pareados ou arquivos bam alinhados.
  3. Forneça o padrão, por exemplo, R1/R2, como um padrão de expressão regular de entrada no comando CWL.
  4. Além disso, forneça o local para o fluxo de trabalho a ser executado, a referência do genoma e os arquivos de mapeamento de haplótipos.
    NOTA: Para uma comparação all-to-all, é usado o diretório de entrada completo. Se um subconjunto de arquivos for comparado, forneça um arquivo separado por vírgulas contendo os nomes dos arquivos para comparação. A opção avançada permite a seleção de memória de acesso aleatório e o número de unidades centrais de processamento para executar o processo.
  5. Mapeie os arquivos fastq para o genoma de referência humano usando um algoritmo de mapeamento.
    NOTA: Dependendo da modalidade de sequenciamento, o BWA-MEM é usado para os resultados de sequenciamento de DNA23, e o mapeador consciente de splice-aware STAR é usado para os resultados de sequenciamentode RNA 24. Código exemplar para alinhamento STAR é fornecido abaixo:
    STAR \
    --readFilesCommand zcat \
    --runThreadN 8 \
    --outSAMmapqUnique 60 \
    --outSAMattributes Todos \
    --outReadsUnmapped Fastx \
    --outTmpDir /tmp/STARtmp/ \
    --runDirPerm All_RWX \
    --saída SAMtipo BAM Não Classificado \
    --outNomeFilePrefixo /FILENAME_ \
    --outSAMattrRGline ID:FILEID. L001 SM:EXEMPLO \
    --genomeDir /REF/GENOME/DIR \
    --readFilesEm /caminho/para/NOME do ARQUIVO. R1.fastq.gz /path/para/FILENAME. R2.fastq.gz
  6. Ordene os arquivos de matriz binária de alinhamento (BAM) alinhados resultantes por coordenada de leitura usando SAMtools sort (samtools sort -o FILENAME_OUT.bam FILENAME_IN.bam).
  7. Indexe os arquivos BAM ordenados usando o índice SAMtools (índice samtools FILENAME_OUT.bam).
  8. Marque e remova duplicatas usando Picard MarkDuplicates.
  9. Reindexe arquivos BAM e inclua grupos de leitura (RG) usando ferramentas SAMtools.
    NOTA: Arquivos BAM devem ter tags RG para que o fluxo de trabalho funcione.

3. Extrair impressões digitais

  1. Use os arquivos BAM ordenados e indexados para identificar impressões digitais SNP usando o Picard ExtractFingerprints.
  2. Use o armazenamento intermediário dos arquivos resultantes do formato variante de chamada (VCF) apenas para fins de comparação entre amostras.

4. Cálculo das pontuações de similaridade

  1. Use o Picard CrossCheckFingerprints para calcular logaritaritários de odds ratio (LOD) de similaridade com base em blocos de desequilíbrio de ligação, que são fornecidos em um formato de arquivo crosscheck_metrics como crosscheck_metrics.txt.
    NOTA: A implementação do fluxo de trabalho permite uma comparação cruzada de todas as combinações possíveis de pares de amostras ou uma comparação selecionada entre amostras de uma lista pré-definida.
  2. Exclua arquivos VCF intermediários.
  3. O arquivo crosscheck_metrics fornece quatro comparações para cada par de amostras testadas. A interpretação das pontuações do LOD é a seguinte:
    Pontuação LOD > 0: as amostras provavelmente se originam do mesmo indivíduo (correspondência amostral)
    Pontuação LOD ≤ 0: as amostras provavelmente se originam de indivíduos diferentes
  4. Valide o valor de corte para correspondências de amostras visualizando a distribuição de pontuação LOD como um histograma, por exemplo, em R ou Python (Figura 3).
  5. Sugere-se uma equipe colaborativa com expertise experiente em bioinformática para determinar se as evidências são suficientes para uma identificação inequívoca das identidades das amostras e um possível ajuste dos limiares utilizados, por exemplo, incluindo os três escores LOD ou uma comparação com a distribuição de escores LOD de amostras conhecidas por serem originárias de indivíduos diferentes.
    NOTA: Confusões de amostras podem resultar em múltiplas correspondências inesperadas (pontuação LOD < 0 para amostras do mesmo doador) e incompatibilidades (pontuação LOD > 0 para amostras de doadores diferentes). Interpretações complexas exigem uma troca próxima entre a equipe multifuncional e o especialista em bioinformática.

5. Disponibilidade de código

O fluxo de trabalho computacional será disponibilizado no Github: https://github.com/Roche/sample-matching-workflow.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Implementação de fluxo de trabalho CWL
Um fluxo de trabalho para identificação de correspondências de amostras, baseado em uma abordagem previamente estabelecida que utiliza blocos de desequilíbrio de ligação de polimorfismos de nucleotídeo único para identificação de trocas de amostras, foiimplementado 15. Os autores apresentaram taxas de classificação de 0% FMR e 0,01% FFR para esse método. Uma comparação com outras abordagens mostrou desempenho semelhante ao NGSCheckmate em cobertura alta e intermediária e desempenho melhorado em relação ao NGSCheckmate em baixa cobertura e com sobreposição genômica regional mínima. Resultados inconclusivos foram obtidos ao comparar com Conpair e BAMixChecker13, 15, 25. Aqui, o fluxo de trabalho foi implementado em CWL, limiares de LOD foram investigados e otimizados, e foi aplicado para a comparação de pares de sequenciamento de RNA e DNA ou entre modalidades dentro de amostras extraídas de tecido e entre amostras de tecido e sangue periférico (Figura 3, Tabela 1). A implementação do fluxo de trabalho permitia uma comparação cruzada de todas as combinações possíveis de pares de amostras ou uma comparação selecionada entre amostras de uma lista pré-definida.

A entrada do fluxo de trabalho utiliza um conjunto selecionado de haplótipos. Esses são usados para calcular polimorfismos de nucleotídeo único em blocos de desequilíbrio de ligação. O cálculo das pontuações da razão logarítmic-odds (LOD) desses blocos de SNPs entre pares de amostras permite diferenciar entre amostras pareadas e incompatíveis. Anteriormente, pontuações LOD na faixa de LOD < -5 e LOD > 5 já foram demonstradas classificar corretamente pares de amostrascorrespondentes 15. Escores adicionais de LOD (LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR) são calculados levando em consideração uma possível perda de heterozigosidade na amostra tumoral para qualquer uma das amostras (regiões heterozigotas em uma amostra detectadas como homozigotas na outra).

Influência dos parâmetros de entrada e limiares nas taxas de correspondência/desajuste
A avaliação desse fluxo de trabalho destacou três aspectos críticos que impactam seu desempenho e precisão. Primeiro, a seleção das regiões genômicas cobertas pelo mapa do haplótipo provou ser um passo decisivo. A escolha dessas regiões influencia diretamente o poder discriminativo do processo de correspondência. Segundo, a combinação das estratégias de alinhamento de leitura e dos mapas de haplótipos específicos usados para extração de impressões digitais afetou significativamente os resultados finais da análise. Variações nessas etapas de processamento a montante podem introduzir sutis vieses que se propagam para as pontuações correspondentes (Figuras 4A–B). Terceiro, uma avaliação cuidadosa e a seleção dos limiares para determinar uma correspondência amostral foram essenciais. Os valores de limiar ótimos podem variar consideravelmente dependendo da modalidade específica dos dados (por exemplo, sequenciamento do exoma completo vs. sequenciamento do transcriptoma inteiro) e das regiões genômicas avaliadas. Diferentes limiares podem ajustar a rigor da abordagem (alta taxa de falsos positivos vs. alta taxa de falsos negativos) (Figura 4C). Para lidar com isso em uma grande coorte de amostras clínicas, o método foi adaptado para definir combinações de escores de correspondência permissivas e rigorosas com base na combinação dos escores LOD usados e do comparador. Uma primeira abordagem de limiar (I) foi alcançada considerando qualquer valor positivo entre os três escores do LOD (LOD_SCORE, LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR). Ao incluir informações sobre os escores de TUMOR_NORMAL e NORMAL_TUMOR, os efeitos da perda de heterozigosidade, ocorrida devido à alteração do número de cópias das amostras de câncer, podem ser mitigados. Por outro lado, um limiar mais rigoroso para desajustes (II) foi implementado aplicando dois critérios alternativos de filtragem, adaptados para reduzir falsos positivos: (a) categorização apenas como correspondência, se LOD_SCORE for positivo, b) categorização como correspondência, se, para uma determinada amostra, LOD_SCORE for maior do que a pontuação máxima do outro LOD_SCOREs par a par dessa amostra entre amostras que não se espera que correspondam (com base no paciente documentado de origem), Mesmo que o LOD_SCORE em si seja negativo.

Nesta aplicação, para gerar um limiar permissivo, qualquer par de amostras designado como correspondência por qualquer um dos critérios acima (I, IIa, IIb) foi considerado uma correspondência. Isso proporcionou alta confiança em todas as incompatibilidades identificadas, à custa de algumas possíveis incompatibilidades verdadeiras serem designadas como correspondências (ou seja, falsos negativos). Uma comparação do limiar permissivo com limiares mais rigorosos mostrou uma mudança na porcentagem de pares classificados como desajustes. A diferença entre as abordagens, em todos os estudos analisados, variou de 3,9% (qualquer um dos três escores LOD positivo (I)), 13,3% (LOD_SCORE deve ser positivo (IIa)), 9,2% (LOD_SCORE em comparação com pares não correspondentes de uma amostra (IIb)) e 3,6% (considerando se algum dos pontos acima designou uma correspondência) (Figura 4C).

Influência da cobertura de regiões genômicas
A diferença entre escores LOD negativos e positivos para amostras combinadas e desajustadas é maior quando uma ampla gama de regiões genômicas é coberta (sequenciamento do genoma completo (WGS) ou comparação de amostras WGS com outras modalidades), facilitando assim a seleção de limiar (Figura 5A). Para sequenciamento do exoma inteiro e comparação de RNA, as pontuações LOD se aproximam de zero, com abordagens de limiar afetando os resultados, destacando a importância de avaliar a rigor dos limiares para modalidades com menor cobertura genômica. Uma distribuição de resultados de amostras pareadas conhecidas com escores positivos de LOD é apresentada na Figura 5B. Javed et al. (2020) mostraram que apenas 0,02% de sobreposição genômica é suficiente para distinguir amostras pareadas e não combinadas ao usar blocos de desequilíbriode ligação 15.

Validação
A abordagem foi validada em conjuntos de dados adicionais de sequenciamento do exoma completo (WES) e RNA, para os quais um conjunto conhecido de amostras deveria provinher dos mesmos indivíduos (Figura 6A). Pares de amostras do mesmo indivíduo apresentaram uma taxa de compatibilidade de 100% (Figura 6B), enquanto comparações adicionais com outras amostras conhecidas por terem origem em indivíduos diferentes mostraram uma taxa de descompasso de 100%. Nem falsos positivos nem falsos negativos foram observados em nenhum desses conjuntos de dados.

Em resumo, implementar o fluxo de trabalho de controle de qualidade facilita comparações interindividuais de pares de amostras de sequenciamento de próxima geração ao fornecer uma abordagem padronizada e reprodutível. Os limiares resultantes da pontuação LOD produzem baixas taxas de falsos positivos e falsos negativos para amostras com grande sobreposição regional genômica, e otimização adicional de limiar pode ser aplicada para amostras com baixa profundidade de sequenciamento ou para as quais há pouca sobreposição genômica.

figure-results-1
Figura 1: Representação esquemática da ocorrência de trocas de amostras e rotulagem incorreta. (A) Troca de amostras de uma amostra de cada um entre dois indivíduos. (B) Representação das etapas do processamento da amostra, desde a extração da biópsia até a análise dos dados de sequenciamento. Criado no BioRender. Voith von Voithenberg, L. (2026) https://BioRender.com/xhbp178. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-2
Figura 2: Representação da interface do usuário para arquivos de entrada e parâmetros necessários para executar o fluxo de trabalho de controle de qualidade de correspondência de amostras no CWL. Interface gráfica para entrada de arquivos e parâmetros. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-3
Figura 3: Resultados obtidos do fluxo de trabalho de correspondência de amostras. Distribuição dos escores LOD para um conjunto exemplar de amostras de sequenciamento de DNA (genoma inteiro e sequenciamento do exoma inteiro) (esquerda), para uma comparação entre sequenciamento de DNA e sequenciamento de RNA (centro) para mostrar como muito poucas amostras descompatadas se comportam em comparação com a distribuição das amostras combinadas, e para uma coorte exemplarmente maior de pares de sequenciamento de RNA (à direita) com dados conhecidos por provinher de indivíduos diferentes (descorrespondências, vermelho claro) e do mesmo indivíduo (fósforos, verde claro). Abreviações; LOD = razão logaritária de chances. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-4
Figura 4: Diferenças exemplares na pontuação do LOD observadas. (A) ao combinar diferentes abordagens de alinhamento de sequências e mapas de haplótipos para um conjunto de amostras conhecidas como descompatíveis e pareadas, e (B) para pontuação por integração de informações tumorais e normais. (C) Ocorrência do número de correspondências e desajustes de amostra definidos por abordagens de limiar de diferentes stringências. Abreviações; LOD = razão logaritária de chances. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-5
Figura 5: Distribuição exemplar dos escores LOD para comparação de diferentes modalidades de sequenciamento de próxima geração. (A) Distribuição dos escores LOD de amostras esperados e combinadas entre sequenciamento de DNA de sangue e tecido tumoral e sequenciamento de RNA de tecido tumoral. (B) Distribuição de pontuação LOD de amostras pareadas para combinações de diferentes modalidades. Abreviações; LOD = razão logaritária de chances. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-6
Figura 6: Distribuição dos escores LOD para a análise de um conjunto de dados de WES e sequenciamento de RNA para câncer de mama. O conjunto de dados de câncer de mama desidentificado foi obtido da Caris Life Sciences e é derivado de um perfil tumoral abrangente. (A) Ocorrência logarítmica dos escores LOD para comparações entre amostras de WES tumorais (esquerda) e entre amostras de sequenciamento de RNA (direita). (B) Distribuições de pontuação LOD para pares esperados de amostras dos mesmos indivíduos (fileira superior WES, linha inferior sequenciante de RNA). Abreviações; LOD = razão logaritária de chances. Por favor, clique aqui para ver uma versão ampliada desta figura.

LEFT_GROUP_VALUERIGHT_GROUP_VALUERESULTADOLOD_SCORELOD_SCORE_
TUMOR_NORMAL
LOD_SCORE_
NORMAL_TUMOR
Exemplo 1Exemplo 1EXPECTED_MATCH38.11926629.64948529.649485
Exemplo 1Exemplo 2EXPECTED_MISMATCH-2.552644-4.574225.283698
Exemplo 2Exemplo 1EXPECTED_MISMATCH-2.5526445.283698-4.57422
Exemplo 2Exemplo 2EXPECTED_MATCH12.3287378.7964578.796457

Tabela 1: Resultados exemplares obtidos ao realizar Crosscheck Fingerprints. A tabela mostra resultados exemplares de um par de amostras comparadas pela abordagem de correspondência amostral.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Uma variedade de métodos para identificar correspondências amostrais estádisponível 1,4,13,14,15,16. Aqui, foi descritaa implementação de uma abordagem usando blocos de desequilíbrio de ligação SNP aplicáveis em múltiplas modalidades de ómicas, com baixas taxas de falsos positivos e falsos negativos. A implementação foi feita em CWL para facilitar o processamento de alto rendimento entre conjuntos de dados dentro de um ambiente de fluxo de trabalho padronizado. A avaliação do fluxo de trabalho identificou três aspectos-chave a considerar ao aplicar a abordagem. Uma etapa fundamental no processo é selecionar as regiões genômicas cobertas pelo mapa do haplótipo. Além disso, combinar alinhamento de leitura com extração de impressões digitais usando diferentes mapas de haplótipos pode afetar os resultados da análise. Além disso, a avaliação cuidadosa e seleção dos limiares, que podem depender da modalidade dos dados e das regiões abrangidas, são essenciais e podem levar a uma chamada de correspondência amostral mais ou menos permissiva.

Para avaliar grandes conjuntos de amostras clínicas, o método foi adaptado para definir combinações de limiares para escores permissivos e rigorosos de correspondência de amostras. O método foi ajustado para incluir uma abordagem de limiar permissivo, considerando uma pontuação combinada que compreenda qualquer um dos escores LOD (LOD_SCORE, LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR) ou dois critérios alternativos de filtragem, resultando em uma seleção mais rigorosa das amostras. A aplicabilidade da abordagem é limitada a amostras para as quais informações de SNP em diversas regiões genômicas estão disponíveis, por exemplo, dados de sequenciamento de próxima geração. Além disso, são necessários pelo menos pares de amostras do mesmo indivíduo para análise comparativa e correspondência de amostras. Informações clínicas adicionais, como status de mutação obtido por métodos direcionados ou metadados do paciente, como sexo, podem ser usadas para fornecer mais evidências de correspondência entre dados moleculares de alta dimensão e dados clínicos em nível de paciente.

A implementação da abordagem em um ambiente de gerenciamento de fluxo de trabalho, com possibilidade de armazenamento paralelo de dados, permite uma análise de controle de qualidade de alta produtividade das amostras para contaminação entre indivíduos. Assim, aumenta a acessibilidade e a reprodutibilidade da abordagem entre conjuntos de dados e amostras. A adaptabilidade dos critérios de limiar nessa abordagem permite o processamento e análise de amostras de câncer com baixa e alta carga mutacional tumoral e alterações no número de cópias, que podem levar à perda de heterozigosidade e, assim, afetar a probabilidade do genótipo.

O método pode encontrar ampla aplicabilidade em qualquer tipo de projeto que envolva dados de sequenciamento de próxima geração de indivíduos humanos e para os quais há mais de uma amostra por pessoa disponível. Isso pode variar desde abordagens personalizadas para pacientes individuais até grandes ensaios clínicos coletando dados moleculares de alta dimensão para diferentes áreas da doença. Ele pode ser combinado com fluxos de trabalho de controle de qualidade, investigação de contaminação entre espécies e abordagens para conectar conjuntos de dados moleculares de alta dimensão com informações clínicas para integração em qualquer pipeline de controle de qualidade para dados de sequenciamento de próxima geração.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Todos os autores são empregados ou contratados externos e acionistas da F. Hoffmann-La Roche Ltd. Além disso, Zachary Whitfield é funcionário da Rancho Biosciences, e Ana Teixeira é funcionária da A4Pbio. Os autores declaram não haver interesses concorrentes.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Agradecemos sinceramente aos pacientes e suas famílias por fornecerem suas amostras. Expressamos nossa mais profunda gratidão a todos os envolvidos nos estudos clínicos, especialmente aos membros das equipes de estudo, equipes de pesquisadores e equipes de projeto em nossas organizações de pesquisa clínica, por suas contribuições inestimáveis. Os autores agradecem a N. Nair e E. Guarin pela leitura crítica do manuscrito e pelos valiosos comentários. Também expressamos nossa gratidão a A. Cosolo por seu apoio em tornar acessíveis conjuntos de dados adicionais. Reconhecemos a rede Enhanced Data and Insights Sharing (EDIS) de toda a Roche por seus esforços na curadoria e harmonização de dados.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
FastQCv0.11.9SCR_014583
MultiQCv1.8SCR_014982
BWA-MEMv0.7.17SCR_010910
STARv2.7.9aSCR_004463
SAMtoolsV1.12, v1.19.2SCR_005227
-  faidx
-  Ordenar
-  Índice
- addreplacerg
PicardV2.25.5, v3.0.0SCR_006525
- CreateSequenceDictionary
- MarkDuplicates
- build_fingerprint_maps
- ExtratoImpressões digitais
- Verificação CruzadaImpressões digitais
CWLv1.2SCR_015528
RR v4.3.1SCR_001905
dplyr v1.1.4

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Westphal, M., et al. SMaSH: sample matching using SNPs in humans. BMC Genomics. 20 (12), 1001(2019).
  2. Westra, H. J., et al. MixupMapper: correcting sample mix-ups in genome-wide datasets increases power to detect small genetic effects. Bioinformatics. 27 (15), 2104-2111 (2011).
  3. Addala, V., et al. Computational immunogenomic approaches to predict response to cancer immunotherapies. Nat. Rev. Clin. Oncol. 21 (1), 28-46 (2024).
  4. Schröder, J., Corbin, V., Papenfuss, A. T. HYSYS: have you swapped your samples. Bioinformatics. 33 (4), 596-598 (2017).
  5. Pengelly, R. J., et al. A SNP profiling panel for sample tracking in whole-exome sequencing studies. Genome Med. 5 (9), 89(2013).
  6. Subramanian, I., et al. Multi-omics data integration, interpretation, and its application. Bioinform Biol Insights. 14, 117793221989905(2020).
  7. Baião, A. R., et al. A technical review of multi-omics data integration methods: from classical statistical to deep generative approaches. Brief Bioinform. 26 (4), bbaf355(2025).
  8. Wang, Z., Zhao, Y., Zhang, L. Emerging trends and hot topics in the application of multi-omics in drug discovery: A bibliometric and visualized study. Curr Pharm Anal. 21 (1), 20-32 (2024).
  9. Morris, S., et al. Two algorithms for biospecimen comparison and differentiation using SNP genotypes. Pharmacogenomics. 14 (4), 379-390 (2013).
  10. Yoo, S., et al. MODMatcher: multi-omics data matcher for integrative genomic analysis. PLoS Comput Biol. 10 (8), e1003790(2014).
  11. Li, L., et al. SMAP is a pipeline for sample matching in proteogenomics. Nat Commun. 13 (1), 744(2022).
  12. Cibulskis, K., et al. ContEst: estimating cross-contamination of human samples in next-generation sequencing data. Bioinformatics. 27 (18), 2601-2602 (2011).
  13. Chun, H., Kim, S. BAMixChecker: an automated checkup tool for matched sample pairs in NGS cohort. Bioinformatics. 35 (22), 4806-4808 (2019).
  14. Lee, S., et al. NGSCheckMate: software for validating sample identity in next-generation sequencing studies within and across data types. Nucleic Acids Res. 45 (11), e103-e103 (2017).
  15. Javed, N., et al. Detecting sample swaps in diverse NGS data types using linkage disequilibrium. Nature Commun. 11 (1), 3697(2020).
  16. Wang, P. P. S., Parker, W. T., Branford, S., Schreiber, A. W. BAM-matcher: a tool for rapid NGS sample matching. Bioinformatics. 32 (17), 2699-2701 (2016).
  17. Katsanis, S. H., Wagner, J. K. Characterization of the standard and recommended codis markers. J Forensic Sci. 58, s1(2013).
  18. Yousefi, S., et al. BIOS consortium. A SNP panel for identification of DNA and RNA specimens. BMC Genomics. 19 (1), 90(2018).
  19. Huang, J., Chen, J., Lathrop, M., Liang, L. A tool for RNA sequencing sample identity check. Bioinformatics. 29 (11), 1463-1464 (2013).
  20. Goldfeder, R. L., et al. A bioinformatics approach for determining sample identity from different lanes of high-throughput sequencing data. PLoS ONE. 6 (8), e23683(2011).
  21. Crusoe, M. R., et al. Methods included: standardizing computational reuse and portability with the common workflow language. Commun ACM. 65 (6), 54-63 (2022).
  22. Ahmed, A. E., et al. Design considerations for workflow management systems use in production genomics research and the clinic. Scientific Rep. 11 (1), (2021).
  23. Li, H., Durbin, R. Fast and accurate short read alignment with Burrows-Wheeler transform. Bioinformatics. 25 (14), 1754-1760 (2009).
  24. Dobin, A., et al. STAR: ultrafast universal RNA-seq aligner. Bioinformatics. 29 (1), 15-21 (2013).
  25. Bergmann, E. A., et al. Conpair: concordance and contamination estimator for matched tumor–normal pairs. Bioinformatics. 32 (20), 3196-3198 (2016).

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

Dados Multi micosContamina o de AmostrasDetec o de Incompatibilidade de AmostrasFluxo de Trabalho de Bioinform ticaCompara o Gen mica AmplaPolimorfismos de Nucleot deo nicoDesequil brio de Liga oBiosamples Cl nicasValida o de Biomarcadores

Artigos relacionados