Artículo de método

Detección de contaminación y desajustes entre individuos en datos de secuenciación de próxima generación multiómica

DOI:

10.3791/69428

17 de abril de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo describe la implementación de un marco de control de calidad para detectar contaminación y desajustes entre individuos en los datos de secuenciación de nueva generación, verificando la identidad genética de pares de muestras dentro de los individuos.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El procesamiento de alto rendimiento de biomuestras de pacientes mediante secuenciación de nueva generación y la comparación de datos moleculares con datos clínicos a nivel de paciente y muestra requieren un seguimiento preciso y la comparación de identificadores de muestras a lo largo de la cadena de custodia de la biomuestra, y son fundamentales para permitir una interpretación robusta de los resultados de ensayos con biomarcadores. Además de rastrear pasos individuales en los flujos de trabajo de procesamiento de muestras y datos, se pueden utilizar soluciones bioinformáticas para confirmar que las muestras provienen del mismo paciente. Aquí se muestra el uso de un flujo de trabajo bioinformático para identificar muestras emparejadas que se originan en la misma persona. El flujo de trabajo de análisis es adecuado para comparar y verificar dos o más pares de conjuntos de datos NGS para el origen de la muestra del paciente. Un algoritmo de puntuación basado en comparaciones genómicas de muestras permite al usuario determinar si dos muestras provienen del mismo individuo. Específicamente, se utilizan polimorfismos de nucleótido único (SNPs) dentro de bloques seleccionados de desequilibrio de enlace para identificar y comparar muestras. Se identificaron combinaciones umbral para la selección permisiva y rigurosa de muestras emparejadas y desajustadas. La utilidad de este protocolo se demostró mediante su aplicación al control de calidad y validación de tejido tumoral clínico y muestras de sangre, abarcando múltiples modalidades ómicas de más de 2.000 pacientes.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La recogida y análisis a gran escala de muestras clínicas requiere el seguimiento exacto de las muestras a lo largo de su cadena de custodia, ya que la correcta correspondencia de datos moleculares de la misma modalidad o de diferentes modalidades y datos clínicos a nivel de paciente y muestra es esencial para una interpretación precisa y una toma de decisiones informada. A pesar de los rigurosos esfuerzos para agilizar los protocolos de procesamiento de muestras bajo buenas prácticas clínicas, el intercambio o el etiquetado incorrecto de muestras pueden ocurrir en varias etapas, desde la biopsia/extracción de la muestra hasta los pasos de preparación y procesamiento, y hasta la etapa de análisis de datos (Figura 1). Con el aumento del número de muestras y los pasos de procesamiento de muestras, aumenta la probabilidad de intercambios de muestras y contaminación cruzada. Esto puede dar lugar al análisis de datos con relaciones incorrectas entre la muestra y el paciente, afectando el análisis y las conclusiones posteriores, y por ello es un aspecto importante a tener en cuenta en la investigación genómica clínica. En los estudios clínicos, la identificación incorrecta de muestras puede afectar fuertemente los resultados generales, especialmente en estudios con tamaño de muestrapequeño 1. La contaminación entre individuos puede provocar pérdida de energía para identificar diferencias y resultados falsos positivos al comparar múltiples muestras del mismo paciente. Los intercambios de muestras influyen en el poder de detección de asociaciones genéticas y pueden llevar a la subestimación de la heredabilidad de rasgos complejos en el análisis de asociaciones genómicasa nivel genómico 2.

La investigación del cáncer es una de las áreas en las que se realizan análisis genómicos y transcriptómicos a granescala, monitorizando específicamente la heterogeneidad genómica y fenotípica entre y dentro del paciente. Un aspecto de la investigación sobre el cáncer es que las muestras del mismo paciente pueden portar mutaciones y alteraciones en el número de copias diferentes, y por tanto mostrar frecuencias alélicas variantesindependientes 4. Especialmente al interpretar datos de múltiples tipos ómicos, la correcta integración de conjuntos de datos multimodales de los mismos individuos es importante y, por tanto, requiere monitorizar la contaminación interindividual 5,6,7,8. Estudios sobre conjuntos de datos del programa de atlas genómico del cáncer (TCGA) y del consorcio de investigación genómica pulmonar (LGRC) han identificado tasas de identificación errónea de muestras de un 3% de media y de hasta ~20% en ciertosestudios 2,9,10,11. Estos ejemplos muestran la importancia de monitorizar la ocurrencia de intercambios de muestras y contaminacióncruzada 12. Más allá del seguimiento rutinario y el control de calidad en cada paso del proceso, un análisis comparativo de los resultados de la secuenciación actúa como un control final de calidad. Esto garantiza una comparación precisa de muestras antes de pasar al análisis e interpretación de datos.

Se han establecido varios enfoques bioinformáticos para identificar si las muestras provienen del mismoindividuo 1,4,13,14,15,16. Los enfoques iniciales aprovecharon repeticiones cortas en tándem para verificar la identidad de lamuestra 17. Los datos de secuenciación de nueva generación a nivel de ARN y ADN permiten ahora la comparación entre pares de muestras basándose en polimorfismos de un solonucleótido 18. Difieren en su aplicabilidad a diferentes modalidades y conjuntos de datos de secuenciación, por ejemplo, para secuenciación deARN 19 o para datos de secuenciación completadel exoma 5, su implementación, por ejemplo, la comprobación a través de las líneas desecuenciación 20, y la facilidad de uso. Aunque se pueden identificar muestras del mismo individuo basándose en 20–45 polimorfismos de nucleótido único, los enfoques de secuenciación de cobertura baja a media que se usan típicamente en la investigación oncológica requieren la integración de un gran número deSNPs1.

Aquí se describen la implementación y los ajustes a uno de estos enfoques utilizando bloques de desequilibrio de enlace de losSNPs 15, que se utilizan para el control de calidad de muestras emparejadas. Se ha demostrado que este enfoque tiene una baja tasa de falsa bandera y de falsa coincidencia, y el flujo de trabajo permite la comparación entre modalidades, por ejemplo, entre muestras de secuenciación completa del exoma y secuenciación de ARN, así como para su uso con diferentes formatos de datos. Para la aplicabilidad a gran escala del método entre conjuntos de datos en muestras de ensayos clínicos, la cadena de bioinformática se implementó en el lenguaje común de flujo de trabajo (CWL)21,22. Gracias a su legibilidad y sintaxis similar a YAML, los científicos con experiencia limitada en programación pueden interpretar fácilmente la estructura general del flujo de trabajo y los resultados del análisis. Otra característica clave de la CWL es su funcionalidad de dispersión/recogida, que permite la paralelización de procesos para aprovechar plenamente los recursos computacionales asignados. Los usuarios pueden especificar las condiciones bajo las cuales se ejecutan ciertos pasos, aumentando así la flexibilidad de los análisis resultantes. CWL puede integrarse con otros componentes de un sistema completo de gestión de flujos de trabajo, como almacenamiento de bases de datos, una interfaz gráfica de usuario y un despachador de trabajos, formando una plataforma potente para crear, ejecutar y mantener un conjunto reproducible de análisis científicos. Así, esta implementación permite un acceso facilitado al flujo de trabajo y el procesamiento de alto rendimiento de conjuntos de datos en el contexto de sistemas de gestión de flujos de trabajo definidos.

Además, se investigaron los efectos del umbral de los parámetros de selección de ajuste entre muestras emparejadas y no emparejadas, y se determinaron umbrales para la selección permisiva y estricta de casos desajustados. Se mostraron los efectos de modificar estos parámetros en la selección de pares de muestras y su aplicabilidad dentro y entre diferentes modalidades ómicas. Afinar eficazmente estos parámetros permitirá a los usuarios ajustar la precisión de sus interpretaciones. El flujo de trabajo se aplicó a un conjunto de conjuntos de datos clínicos a gran escala con varios miles de muestras.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Declaración ética: Este análisis de contaminación entre individuos se realizó retrospectivamente utilizando datos individuales a nivel de paciente de estudios clínicos de fase I y fase II completados, de acuerdo con el proceso responsable de reutilización de datos de Roche y conforme al formulario maestro de consentimiento informado para cada estudio. Se obtuvieron las aprobaciones del Comité de Ética y del Comité de Revisión Institucional para cada estudio antes de su realización. Los participantes dieron y firmaron su consentimiento informado para participar en estos estudios.

Flujo de trabajo en bioinformática
NOTA: La implementación del flujo de trabajo de bioinformática comienza con archivos rápidos en bruto derivados de datos de secuenciación de nueva generación, por ejemplo, secuenciación de genomas completos, exomas completos o transcriptomas completos. Los pasos individuales descritos aquí están integrados en el flujo de trabajo de CWL.

1. Materiales de referencia requeridos

  1. Para el flujo de trabajo de bioinformática, proporciona lo siguiente:
    1. Genoma de referencia humano (GRCh38) en . Formato fasta .
    2. Archivo de indexación correspondiente como .fasta.fai.
    3. Diccionario correspondiente en formato .dict .
    4. Un mapa de haplotipos que coincide con regiones genómicas de interés para SNPs y bloques de desequilibrio de ligamiento (por ejemplo, Picard build_fingerprint_maps, SCR_006525).
  2. Asegúrate de que el encabezado del mapa del haplotipo coincida con el genoma de referencia.

2. Alineación con el genoma de referencia, clasificación e indexación

  1. Ejecuta el flujo de trabajo CWL para proporcionar los resultados de los siguientes pasos descritos a continuación (lista de herramientas en la Tabla de Materiales) (Figura 2).
  2. Inicia el flujo de trabajo CWL proporcionando un directorio de archivos fastq emparejados o archivos bam alineados.
  3. Proporciona el patrón, por ejemplo, R1/R2, como un patrón de expresión regular de entrada en el comando CWL.
  4. Además, proporciona la ubicación para ejecutar el flujo de trabajo, la referencia genómica y los archivos de mapeo de haplotipos.
    NOTA: Para una comparación all-to-all, se utiliza el directorio de entrada completo. Si se va a comparar un subconjunto de archivos, proporciona un archivo separado por comas que contenga los nombres de los archivos para comparar. La opción avanzada permite seleccionar memoria de acceso aleatorio y el número de unidades centrales de procesamiento para ejecutar el proceso.
  5. Mapea los archivos fastq al genoma de referencia humano usando un algoritmo de mapeo.
    NOTA: Dependiendo de la modalidad de secuenciación, BWA-MEM se utiliza para los resultados de secuenciación deADN 23, y el mapper consciente de splice-aware STAR se emplea para los resultados de secuenciaciónde ARN 24. A continuación se proporciona un código ejemplar para la alineación STAR:
    STAR \
    --readFilesCommand zcat \
    --runThreadN 8 \
    --outSAMmapqUnique 60 \
    --outSAM atributos Todos \
    --outReadsUnmapped Fastx \
    --outTmpDir /tmp/STARtmp/ \
    --runDirPerm All_RWX \
    --outSAMtype BAM No clasificado \
    --outNombreArchivoPrefijo /FILENAME_ \
    --outSAMattrRGline ID:FILEID. L001 SM:EJEMPLO \
    --genomeDir /REF/GENOME/DIR \
    --readFilesEn /path/to/FILENAME. R1.fastq.gz /path/to/FILENAME. R2.fastq.gz
  6. Ordena los archivos resultantes de la matriz de alineación binaria alineada (BAM) por coordenada de lectura usando SAMtools sort (samtools sort -o FILENAME_OUT.bam FILENAME_IN.bam).
  7. Indexa los archivos BAM ordenados usando el índice SAMtools (índice samtools FILENAME_OUT.bam).
  8. Marca y elimina duplicados usando Picard MarkDuplicates.
  9. Reindexa los archivos BAM e incluye grupos de lectura (RG) usando SAMtools.
    NOTA: Los archivos BAM deben tener etiquetas RG para que el flujo de trabajo funcione.

3. Extraer huellas dactilares

  1. Utiliza los archivos BAM ordenados e indexados para identificar huellas digitales SNP usando Picard ExtractFingerprints.
  2. Utiliza el almacenamiento intermedio de los archivos resultantes de formato de llamada variante (VCF) únicamente para fines de comparación entre muestras.

4. Cálculo de puntuaciones de similitud

  1. Utiliza Picard CrossCheckFingerprints para calcular puntuaciones logarítmicas de razón de probabilidades (LOD) de similitud basadas en bloques de desequilibrio de enlace, que se proporcionan en un formato de archivo crosscheck_metrics como crosscheck_metrics.txt.
    NOTA: La implementación del flujo de trabajo permite una comparación cruzada de todas las combinaciones posibles de pares de muestras o una comparación seleccionada entre muestras de una lista predefinida.
  2. Elimina archivos VCF intermedios.
  3. El archivo crosscheck_metrics proporciona cuatro comparaciones para cada par de muestras analizadas. La interpretación de las puntuaciones del LOD es la siguiente:
    Puntuación LOD > 0: las muestras probablemente se originan en el mismo individuo (coincidencia muestral)
    Puntuación LOD ≤ 0: las muestras probablemente se originan en individuos diferentes
  4. Valida el valor de corte para coincidencias de muestras visualizando la distribución de puntuación LOD como un histograma, por ejemplo, en R o Python (Figura 3).
  5. Se sugiere un equipo colaborativo con experiencia en bioinformática para determinar si la evidencia es suficiente para una identificación inequívoca de las identidades de las muestras y un posible ajuste de los umbrales utilizados, por ejemplo, incluyendo las tres puntuaciones LOD o comparando la distribución de puntuaciones LOD de muestras conocidas por proceder de diferentes individuos.
    NOTA: Las confusión de muestras pueden resultar en múltiples coincidencias inesperadas (puntuación LOD < 0 para muestras del mismo donante) y desajustes (puntuación LOD > 0 para muestras de diferentes donantes). Las interpretaciones complejas requieren un intercambio estrecho entre el equipo multifuncional y el experto en bioinformática.

5. Disponibilidad de código

El flujo de trabajo computacional estará disponible en Github: https://github.com/Roche/sample-matching-workflow.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Implementación del flujo de trabajo CWL
Seimplementó un flujo de trabajo para la identificación de coincidencias de muestras, basado en un enfoque previamente establecido que utiliza bloques de desequilibrio de enlace de polimorfismos de un solo nucleótido para la identificación de intercambios de muestras. Los autores han mostrado tasas de clasificación de 0% FMR y 0,01% FFR para este método. Una comparación con otros enfoques mostró un rendimiento similar a NGSCheckmate en cobertura alta e intermedia y mejorado en el rendimiento sobre NGSCheckmate en baja cobertura y con una mínima superposición genómica regional. Se obtuvieron resultados inconclusos al comparar con Conpair y BAMixChecker 13,15,25. Aquí, el flujo de trabajo se implementó en CWL, se investigaron y optimizaron los umbrales LOD, y se aplicó para la comparación de pares de secuenciación de ARN y pares de secuenciación de ADN o entre modalidades dentro de muestras extraídas de tejido y entre muestras de tejido y sangre periférica (Figura 3, Tabla 1). La implementación del flujo de trabajo permitía una comparación cruzada de todas las combinaciones posibles de pares de muestras o una comparación seleccionada entre muestras de una lista predefinida.

La entrada del flujo de trabajo utiliza un conjunto seleccionado de haplotipos. Estos se utilizan para calcular polimorfismos de un solo nucleótido en bloques de desequilibrio de ligamento. El cálculo de las puntuaciones logarítmicas (LOD) de estos bloques de SNPs a través de pares de muestras permite diferenciar entre muestras emparejadas y desajustadas. Anteriormente, se ha demostrado que las puntuaciones LOD en el rango de LOD < -5 y LOD > 5 clasifican correctamente pares de muestrasemparejadas 15. Se calculan puntuaciones adicionales de LOD (LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR) teniendo en cuenta una posible pérdida de heterocigosidad en la muestra tumoral para cualquiera de las dos muestras (regiones heterocigotas en una muestra detectadas como homocigotas en la otra).

Influencia de los parámetros de entrada y los umbrales en las tasas de coincidencia/desajuste
La evaluación de este flujo de trabajo destacó tres aspectos críticos que afectan a su rendimiento y precisión. En primer lugar, la selección de regiones genómicas cubiertas por el mapa haplotípico resultó ser un paso decisivo. La elección de estas regiones influye directamente en el poder discriminatorio del proceso de emparejamiento. En segundo lugar, la combinación de estrategias de alineación de lecturas y los mapas de haplotipos específicos utilizados para la extracción de huellas dactilares influyó significativamente en los resultados finales del análisis. Las variaciones en estos pasos de procesamiento aguas arriba pueden introducir sesgos sutiles que se propagan a las puntuaciones correspondientes (Figuras 4A–B). En tercer lugar, una evaluación cuidadosa y la selección de umbrales para determinar una coincidencia muestral fueron esenciales. Los valores umbral óptimos pueden variar considerablemente dependiendo de la modalidad específica de datos (por ejemplo, secuenciación completa del exoma vs. secuenciación del transcriptoma completo) y de las regiones genómicas que se evalúen. Diferentes umbrales pueden ajustar la rigor del enfoque (alta tasa de falsos positivos vs. alta tasa de falsos negativos) (Figura 4C). Para abordar esto en una gran cohorte de muestras clínicas, el método se adaptó para definir combinaciones permisivas y estrictas de puntuaciones de emparejamiento de muestras basadas en la combinación de puntuaciones LOD utilizadas y el comparador. Se logró un primer enfoque de umbral (I) considerando cualquier valor positivo entre las tres puntuaciones LOD (LOD_SCORE, LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR). Al incluir información en las puntuaciones de TUMOR_NORMAL y NORMAL_TUMOR, se pueden mitigar los efectos de la pérdida de heterocigosidad, que ocurre debido a alteraciones en el número de copias de muestras de cáncer. Por el contrario, se implementó un umbral más estricto para las desadaptaciones (II) aplicando dos criterios alternativos de filtrado, adaptados para reducir los falsos positivos: (a) categorización solo como coincidencia, si LOD_SCORE es positivo, b) categorización como coincidencia, si, para una muestra dada, LOD_SCORE es mayor que la puntuación máxima de la otra LOD_SCOREs por pares de esa muestra entre muestras que no se espera que coincida (según el paciente documentado de origen), Aunque la LOD_SCORE en sí sea negativa.

En esta aplicación, para generar un umbral permisivo, cualquier par de muestras designado como coincidencia según cualquiera de los criterios anteriores (I, IIa, IIb) se consideraba coincidencia. Esto proporcionaba alta confianza en todas las desadaptaciones identificadas, a costa de que algunas posibles descoincidencias verdaderas fueran designadas como coincidencias (es decir, falsos negativos). Una comparación del umbral permisivo con umbrales más estrictos mostró un cambio en el porcentaje de pares clasificados como desajustes. La diferencia entre los enfoques, en todos los estudios analizados, osciló entre el 3,9% (cualquiera de las tres puntuaciones LOD positiva (I)), 13,3% (LOD_SCORE debe ser positiva (IIa)), 9,2% (LOD_SCORE comparado con pares no coincidentes de una muestra (IIb)) y 3,6% (teniendo en cuenta si alguno de los anteriores para designar una coincidencia) (Figura 4C).

Influencia de la cobertura de regiones genómicas
La diferencia entre las puntuaciones LOD negativas y positivas para muestras emparejadas y desajustadas es mayor cuando se cubre una amplia gama de regiones genómicas (secuenciación del genoma completo (WGS) o comparación de muestras WGS con otras modalidades), facilitando así la selección de umbrales (Figura 5A). Para la secuenciación de exomas completos y las comparaciones de ARN, las puntuaciones LOD se acercan más a cero, con enfoques de umbral que afectan a los resultados, lo que destaca la importancia de evaluar la rigurosidad de los umbrales para modalidades con menor cobertura genómica. Una distribución de resultados de muestras emparejadas conocidas con puntuaciones positivas de LOD se muestra en la Figura 5B. Javed et al. (2020) han demostrado que tan solo un 0,02% de solapamiento genómico es suficiente para distinguir entre muestras emparejadas y no emparejadas al usar bloques de desequilibriode ligamiento 15.

Validación
El enfoque fue validado en conjuntos de datos adicionales de secuenciación del exoma completo (WES) y ARN de cáncer de mama, cáncer colorrectal y cáncer de pulmón (WES), para los cuales se esperaba que un conjunto conocido de muestras procediera de los mismos individuos (Figura 6A). Los pares de muestras del mismo individuo mostraron una tasa de coincidencia del 100% (Figura 6B), mientras que comparaciones adicionales con otras muestras conocidas por proceder de individuos diferentes mostraron una tasa de desajuste del 100%. No se observaron ni falsos positivos ni falsos negativos en ninguno de estos conjuntos de datos.

En resumen, implementar el flujo de trabajo de control de calidad facilita comparaciones interindividuales de pares de muestras de secuenciación de nueva generación al proporcionar un enfoque estandarizado y reproducible. Los umbrales resultantes de puntuación LOD arrojan bajas tasas de falsos positivos y falsos negativos para muestras con gran solapamiento regional genómico, y se puede aplicar una optimización adicional del umbral para muestras con baja profundidad de secuenciación o para las que hay poca superposición genómica.

figure-results-1
Figura 1: Representación esquemática de la ocurrencia de intercambios de muestras y etiquetados incorrectos. (A) Intercambio de muestras de una muestra entre dos individuos. (B) Representación de los pasos de procesamiento de muestras desde la extracción por biopsia hasta el análisis de los datos de secuenciación. Creado en BioRender. Voith von Voithenberg, L. (2026) https://BioRender.com/xhbp178. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-2
Figura 2: Representación de la interfaz de usuario para archivos de entrada y parámetros necesarios para ejecutar el flujo de trabajo de control de calidad de coincidencia de muestras en CWL. Interfaz gráfica para la entrada de archivos y parámetros. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-3
Figura 3: Resultados obtenidos del flujo de trabajo de comparación de muestras. Distribución de puntuaciones LOD para un conjunto ejemplar de muestras de secuenciación de ADN (secuenciación del genoma completo y del exoma completo) (izquierda), para una comparación entre secuenciación de ADN y secuenciación de ARN (centro) para mostrar cuán pocas muestras desajustadas se comportan en comparación con la distribución de las muestras emparejadas, y para una cohorte ejemplar más grande de pares de secuenciación de ARN (derecha) con datos que se sabe que provienen de individuos diferentes (desajustes, rojo claro) y del mismo individuo (cerillas, verde claro). Abreviaturas; LOD = ratio logarítmica de probabilidades. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-4
Figura 4: Diferencias ejemplares en la puntuación LOD observadas. (A) al combinar diferentes enfoques de alineación de secuencias y mapas de haplotipos para un conjunto de muestras conocidas como desajustadas y emparejadas, y (B) para la puntuación mediante la integración de información tumoral y normal. (C) Ocurrencia del número de coincidencias y desajustes de muestra definidos por enfoques de umbral de diferentes rigurosidades. Abreviaturas; LOD = ratio logarítmica de probabilidades. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-5
Figura 5: Distribución ejemplar de puntuaciones LOD para comparar diferentes modalidades de secuenciación de nueva generación. (A) Distribución de puntuaciones LOD de muestras esperadas desemparejadas y emparejadas entre la secuenciación de ADN de sangre y tejido tumoral y la secuenciación de ARN de tejido tumoral. (B) Distribución de puntuaciones LOD de muestras emparejadas para combinaciones de diferentes modalidades. Abreviaturas; LOD = ratio logarítmica de probabilidades. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-6
Figura 6: Distribución de las puntuaciones LOD para el análisis de un conjunto de datos de WES y secuenciación de ARN para cáncer de mama. El conjunto de datos sobre el cáncer de mama desidentificado se obtuvo de Caris Life Sciences y se deriva de un perfilado tumoral integral. (A) Ocurrencia logarítmica de las puntuaciones LOD para comparaciones entre muestras de WES tumorales (izquierda) y entre muestras de secuenciación de ARN (derecha). (B) Distribuciones de puntuación LOD para pares esperados de muestras de los mismos individuos (fila superior WES, fila inferior con secuenciación de ARN). Abreviaturas; LOD = ratio logarítmica de probabilidades. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

LEFT_GROUP_VALUERIGHT_GROUP_VALUERESULTADOLOD_SCORELOD_SCORE_
TUMOR_NORMAL
LOD_SCORE_
NORMAL_TUMOR
Ejemplo 1Ejemplo 1EXPECTED_MATCH38.11926629.64948529.649485
Ejemplo 1Ejemplo 2EXPECTED_MISMATCH-2.552644-4.574225.283698
Ejemplo 2Ejemplo 1EXPECTED_MISMATCH-2.5526445.283698-4.57422
Ejemplo 2Ejemplo 2EXPECTED_MATCH12.3287378.7964578.796457

Tabla 1: Resultados ejemplares obtenidos al realizar Crosscheck Fingerprints. La tabla muestra resultados ejemplares de un par de muestras comparadas mediante el enfoque de emparejamiento muestral.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Existen diversos métodos para identificar coincidenciasmuestrales 1,4,13,14,15,16. Aquí, se describió la implementación de un enfoque utilizando bloques de desequilibrio de enlace SNP aplicables a múltiples modalidades ómicas, con bajas tasas de falsos positivos y falsosnegativos. La implementación se realizó en CWL para facilitar el procesamiento de alto rendimiento entre conjuntos de datos dentro de un entorno de flujo de trabajo estandarizado. La evaluación del flujo de trabajo identificó tres aspectos clave a considerar al aplicar el enfoque. Un paso clave en el proceso es seleccionar las regiones genómicas cubiertas por el mapa de haplotipos. Además, combinar la alineación de lectura con la extracción de huellas dactilares utilizando diferentes mapas de haplotipos puede afectar los resultados del análisis. Además, la evaluación y selección cuidadosa de los umbrales, que pueden depender de la modalidad de los datos y las regiones cubiertas, son esenciales y pueden dar lugar a una llamada de emparejamiento de muestras más o menos permisiva.

Para evaluar grandes conjuntos de muestras clínicas, el método se adaptó para definir combinaciones de umbrales para puntuaciones permisivas y estrictas de emparejamiento muestral. El método se ajustó para incluir un enfoque de umbral permisivo considerando una puntuación combinada que incluyera cualquiera de las puntuaciones LOD (LOD_SCORE, LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR) o dos criterios alternativos de filtrado, resultando en una selección más estricta de muestras. La aplicabilidad del enfoque se limita a muestras para las que esté disponible información SNP en una variedad de regiones genómicas, por ejemplo, datos de secuenciación de nueva generación. Además, se requieren al menos pares de muestras del mismo individuo para el análisis comparativo y la correspondencia de muestras. Información clínica adicional, como el estado de mutación obtenido mediante métodos dirigidos o metadatos del paciente, como el sexo, puede utilizarse para proporcionar más evidencia de coincidencia entre datos moleculares de alta dimensión y datos clínicos a nivel de paciente.

La implementación del enfoque en un entorno de gestión de flujo de trabajo, con posibilidad de almacenamiento paralelo de datos, permite un análisis de control de calidad de alto rendimiento de muestras para detectar contaminación entre individuos. Así, aumenta la accesibilidad y la reproducibilidad del enfoque entre conjuntos de datos y muestras. La adaptabilidad de los criterios de umbral en este enfoque permite el procesamiento y análisis de muestras de cáncer con baja o alta carga mutacional tumoral y alteraciones en el número de copias que pueden provocar pérdida de heterocigosidad y, por tanto, afectar la probabilidad del genotipo.

El método puede encontrar una amplia aplicabilidad en cualquier tipo de proyecto que implique datos de secuenciación de nueva generación de individuos humanos y para el que haya disponible más de una muestra individual por persona. Esto puede ir desde enfoques personalizados para pacientes individuales hasta grandes ensayos clínicos que recopilan datos moleculares de alta dimensión para diferentes áreas de la enfermedad. Puede combinarse con flujos de trabajo de control de calidad, investigación de contaminaciones entre especies y enfoques para vincular conjuntos de datos moleculares de alta dimensión con información clínica para su integración en cualquier canal de control de calidad para datos de secuenciación de próxima generación.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Todos los autores son empleados o contratistas externos y accionistas de F. Hoffmann-La Roche Ltd. Además, Zachary Whitfield es empleado de Rancho Biosciences y Ana Teixeira es empleada de A4Pbio. Los autores no declaran intereses en competencia.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Agradecemos sinceramente a los pacientes y a sus familias por proporcionar sus muestras. Expresamos nuestro más profundo agradecimiento a todos los implicados en los estudios clínicos, especialmente a los miembros de los equipos de estudio, equipos de investigadores y equipos de proyecto en nuestras organizaciones de investigación clínica, por sus contribuciones invaluables. Los autores agradecen a N. Nair y E. Guarin su lectura crítica del manuscrito y sus valiosos comentarios. También expresamos nuestro agradecimiento a A. Cosolo por su apoyo para hacer accesibles conjuntos de datos adicionales. Agradecemos a la red de Enhanced Data and Insights Sharing (EDIS) de toda Roche por sus esfuerzos en la curación y armonización de datos.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
FastQCv0.11.9SCR_014583
MultiQCv1.8SCR_014982
BWA-MEMv0.7.17SCR_010910
STARv2.7.9aSCR_004463
SAMtoolsV1.12, v1.19.2SCR_005227
-  faidx
-  Ordenar
-  Índice
- addreplacerg
PicardV2.25.5, v3.0.0SCR_006525
- CreateSequenceDictionary
- MarkDuplicates
- build_fingerprint_maps
- ExtractFingerprints
- Verificación cruzadaHuellas
CWLv1.2SCR_015528
RR v4.3.1SCR_001905
dplyr v1.1.4

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Westphal, M., et al. SMaSH: sample matching using SNPs in humans. BMC Genomics. 20 (12), 1001(2019).
  2. Westra, H. J., et al. MixupMapper: correcting sample mix-ups in genome-wide datasets increases power to detect small genetic effects. Bioinformatics. 27 (15), 2104-2111 (2011).
  3. Addala, V., et al. Computational immunogenomic approaches to predict response to cancer immunotherapies. Nat. Rev. Clin. Oncol. 21 (1), 28-46 (2024).
  4. Schröder, J., Corbin, V., Papenfuss, A. T. HYSYS: have you swapped your samples. Bioinformatics. 33 (4), 596-598 (2017).
  5. Pengelly, R. J., et al. A SNP profiling panel for sample tracking in whole-exome sequencing studies. Genome Med. 5 (9), 89(2013).
  6. Subramanian, I., et al. Multi-omics data integration, interpretation, and its application. Bioinform Biol Insights. 14, 117793221989905(2020).
  7. Baião, A. R., et al. A technical review of multi-omics data integration methods: from classical statistical to deep generative approaches. Brief Bioinform. 26 (4), bbaf355(2025).
  8. Wang, Z., Zhao, Y., Zhang, L. Emerging trends and hot topics in the application of multi-omics in drug discovery: A bibliometric and visualized study. Curr Pharm Anal. 21 (1), 20-32 (2024).
  9. Morris, S., et al. Two algorithms for biospecimen comparison and differentiation using SNP genotypes. Pharmacogenomics. 14 (4), 379-390 (2013).
  10. Yoo, S., et al. MODMatcher: multi-omics data matcher for integrative genomic analysis. PLoS Comput Biol. 10 (8), e1003790(2014).
  11. Li, L., et al. SMAP is a pipeline for sample matching in proteogenomics. Nat Commun. 13 (1), 744(2022).
  12. Cibulskis, K., et al. ContEst: estimating cross-contamination of human samples in next-generation sequencing data. Bioinformatics. 27 (18), 2601-2602 (2011).
  13. Chun, H., Kim, S. BAMixChecker: an automated checkup tool for matched sample pairs in NGS cohort. Bioinformatics. 35 (22), 4806-4808 (2019).
  14. Lee, S., et al. NGSCheckMate: software for validating sample identity in next-generation sequencing studies within and across data types. Nucleic Acids Res. 45 (11), e103-e103 (2017).
  15. Javed, N., et al. Detecting sample swaps in diverse NGS data types using linkage disequilibrium. Nature Commun. 11 (1), 3697(2020).
  16. Wang, P. P. S., Parker, W. T., Branford, S., Schreiber, A. W. BAM-matcher: a tool for rapid NGS sample matching. Bioinformatics. 32 (17), 2699-2701 (2016).
  17. Katsanis, S. H., Wagner, J. K. Characterization of the standard and recommended codis markers. J Forensic Sci. 58, s1(2013).
  18. Yousefi, S., et al. BIOS consortium. A SNP panel for identification of DNA and RNA specimens. BMC Genomics. 19 (1), 90(2018).
  19. Huang, J., Chen, J., Lathrop, M., Liang, L. A tool for RNA sequencing sample identity check. Bioinformatics. 29 (11), 1463-1464 (2013).
  20. Goldfeder, R. L., et al. A bioinformatics approach for determining sample identity from different lanes of high-throughput sequencing data. PLoS ONE. 6 (8), e23683(2011).
  21. Crusoe, M. R., et al. Methods included: standardizing computational reuse and portability with the common workflow language. Commun ACM. 65 (6), 54-63 (2022).
  22. Ahmed, A. E., et al. Design considerations for workflow management systems use in production genomics research and the clinic. Scientific Rep. 11 (1), (2021).
  23. Li, H., Durbin, R. Fast and accurate short read alignment with Burrows-Wheeler transform. Bioinformatics. 25 (14), 1754-1760 (2009).
  24. Dobin, A., et al. STAR: ultrafast universal RNA-seq aligner. Bioinformatics. 29 (1), 15-21 (2013).
  25. Bergmann, E. A., et al. Conpair: concordance and contamination estimator for matched tumor–normal pairs. Bioinformatics. 32 (20), 3196-3198 (2016).

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Datos multi micoscontaminaci n de muestrasdetecci n de discordancia de muestrasflujo de trabajo bioinform ticocomparaci n a nivel gen micopolimorfismos de nucle tido nicodesequilibrio de ligamientobiomuestras cl nicasvalidaci n de biomarcadores

Artículos relacionados