$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Implementación del flujo de trabajo CWL
Seimplementó un flujo de trabajo para la identificación de coincidencias de muestras, basado en un enfoque previamente establecido que utiliza bloques de desequilibrio de enlace de polimorfismos de un solo nucleótido para la identificación de intercambios de muestras. Los autores han mostrado tasas de clasificación de 0% FMR y 0,01% FFR para este método. Una comparación con otros enfoques mostró un rendimiento similar a NGSCheckmate en cobertura alta e intermedia y mejorado en el rendimiento sobre NGSCheckmate en baja cobertura y con una mínima superposición genómica regional. Se obtuvieron resultados inconclusos al comparar con Conpair y BAMixChecker 13,15,25. Aquí, el flujo de trabajo se implementó en CWL, se investigaron y optimizaron los umbrales LOD, y se aplicó para la comparación de pares de secuenciación de ARN y pares de secuenciación de ADN o entre modalidades dentro de muestras extraídas de tejido y entre muestras de tejido y sangre periférica (Figura 3, Tabla 1). La implementación del flujo de trabajo permitía una comparación cruzada de todas las combinaciones posibles de pares de muestras o una comparación seleccionada entre muestras de una lista predefinida.
La entrada del flujo de trabajo utiliza un conjunto seleccionado de haplotipos. Estos se utilizan para calcular polimorfismos de un solo nucleótido en bloques de desequilibrio de ligamento. El cálculo de las puntuaciones logarítmicas (LOD) de estos bloques de SNPs a través de pares de muestras permite diferenciar entre muestras emparejadas y desajustadas. Anteriormente, se ha demostrado que las puntuaciones LOD en el rango de LOD < -5 y LOD > 5 clasifican correctamente pares de muestrasemparejadas 15. Se calculan puntuaciones adicionales de LOD (LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR) teniendo en cuenta una posible pérdida de heterocigosidad en la muestra tumoral para cualquiera de las dos muestras (regiones heterocigotas en una muestra detectadas como homocigotas en la otra).
Influencia de los parámetros de entrada y los umbrales en las tasas de coincidencia/desajuste
La evaluación de este flujo de trabajo destacó tres aspectos críticos que afectan a su rendimiento y precisión. En primer lugar, la selección de regiones genómicas cubiertas por el mapa haplotípico resultó ser un paso decisivo. La elección de estas regiones influye directamente en el poder discriminatorio del proceso de emparejamiento. En segundo lugar, la combinación de estrategias de alineación de lecturas y los mapas de haplotipos específicos utilizados para la extracción de huellas dactilares influyó significativamente en los resultados finales del análisis. Las variaciones en estos pasos de procesamiento aguas arriba pueden introducir sesgos sutiles que se propagan a las puntuaciones correspondientes (Figuras 4A–B). En tercer lugar, una evaluación cuidadosa y la selección de umbrales para determinar una coincidencia muestral fueron esenciales. Los valores umbral óptimos pueden variar considerablemente dependiendo de la modalidad específica de datos (por ejemplo, secuenciación completa del exoma vs. secuenciación del transcriptoma completo) y de las regiones genómicas que se evalúen. Diferentes umbrales pueden ajustar la rigor del enfoque (alta tasa de falsos positivos vs. alta tasa de falsos negativos) (Figura 4C). Para abordar esto en una gran cohorte de muestras clínicas, el método se adaptó para definir combinaciones permisivas y estrictas de puntuaciones de emparejamiento de muestras basadas en la combinación de puntuaciones LOD utilizadas y el comparador. Se logró un primer enfoque de umbral (I) considerando cualquier valor positivo entre las tres puntuaciones LOD (LOD_SCORE, LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR). Al incluir información en las puntuaciones de TUMOR_NORMAL y NORMAL_TUMOR, se pueden mitigar los efectos de la pérdida de heterocigosidad, que ocurre debido a alteraciones en el número de copias de muestras de cáncer. Por el contrario, se implementó un umbral más estricto para las desadaptaciones (II) aplicando dos criterios alternativos de filtrado, adaptados para reducir los falsos positivos: (a) categorización solo como coincidencia, si LOD_SCORE es positivo, b) categorización como coincidencia, si, para una muestra dada, LOD_SCORE es mayor que la puntuación máxima de la otra LOD_SCOREs por pares de esa muestra entre muestras que no se espera que coincida (según el paciente documentado de origen), Aunque la LOD_SCORE en sí sea negativa.
En esta aplicación, para generar un umbral permisivo, cualquier par de muestras designado como coincidencia según cualquiera de los criterios anteriores (I, IIa, IIb) se consideraba coincidencia. Esto proporcionaba alta confianza en todas las desadaptaciones identificadas, a costa de que algunas posibles descoincidencias verdaderas fueran designadas como coincidencias (es decir, falsos negativos). Una comparación del umbral permisivo con umbrales más estrictos mostró un cambio en el porcentaje de pares clasificados como desajustes. La diferencia entre los enfoques, en todos los estudios analizados, osciló entre el 3,9% (cualquiera de las tres puntuaciones LOD positiva (I)), 13,3% (LOD_SCORE debe ser positiva (IIa)), 9,2% (LOD_SCORE comparado con pares no coincidentes de una muestra (IIb)) y 3,6% (teniendo en cuenta si alguno de los anteriores para designar una coincidencia) (Figura 4C).
Influencia de la cobertura de regiones genómicas
La diferencia entre las puntuaciones LOD negativas y positivas para muestras emparejadas y desajustadas es mayor cuando se cubre una amplia gama de regiones genómicas (secuenciación del genoma completo (WGS) o comparación de muestras WGS con otras modalidades), facilitando así la selección de umbrales (Figura 5A). Para la secuenciación de exomas completos y las comparaciones de ARN, las puntuaciones LOD se acercan más a cero, con enfoques de umbral que afectan a los resultados, lo que destaca la importancia de evaluar la rigurosidad de los umbrales para modalidades con menor cobertura genómica. Una distribución de resultados de muestras emparejadas conocidas con puntuaciones positivas de LOD se muestra en la Figura 5B. Javed et al. (2020) han demostrado que tan solo un 0,02% de solapamiento genómico es suficiente para distinguir entre muestras emparejadas y no emparejadas al usar bloques de desequilibriode ligamiento 15.
Validación
El enfoque fue validado en conjuntos de datos adicionales de secuenciación del exoma completo (WES) y ARN de cáncer de mama, cáncer colorrectal y cáncer de pulmón (WES), para los cuales se esperaba que un conjunto conocido de muestras procediera de los mismos individuos (Figura 6A). Los pares de muestras del mismo individuo mostraron una tasa de coincidencia del 100% (Figura 6B), mientras que comparaciones adicionales con otras muestras conocidas por proceder de individuos diferentes mostraron una tasa de desajuste del 100%. No se observaron ni falsos positivos ni falsos negativos en ninguno de estos conjuntos de datos.
En resumen, implementar el flujo de trabajo de control de calidad facilita comparaciones interindividuales de pares de muestras de secuenciación de nueva generación al proporcionar un enfoque estandarizado y reproducible. Los umbrales resultantes de puntuación LOD arrojan bajas tasas de falsos positivos y falsos negativos para muestras con gran solapamiento regional genómico, y se puede aplicar una optimización adicional del umbral para muestras con baja profundidad de secuenciación o para las que hay poca superposición genómica.

Figura 1: Representación esquemática de la ocurrencia de intercambios de muestras y etiquetados incorrectos. (A) Intercambio de muestras de una muestra entre dos individuos. (B) Representación de los pasos de procesamiento de muestras desde la extracción por biopsia hasta el análisis de los datos de secuenciación. Creado en BioRender. Voith von Voithenberg, L. (2026) https://BioRender.com/xhbp178. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 2: Representación de la interfaz de usuario para archivos de entrada y parámetros necesarios para ejecutar el flujo de trabajo de control de calidad de coincidencia de muestras en CWL. Interfaz gráfica para la entrada de archivos y parámetros. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 3: Resultados obtenidos del flujo de trabajo de comparación de muestras. Distribución de puntuaciones LOD para un conjunto ejemplar de muestras de secuenciación de ADN (secuenciación del genoma completo y del exoma completo) (izquierda), para una comparación entre secuenciación de ADN y secuenciación de ARN (centro) para mostrar cuán pocas muestras desajustadas se comportan en comparación con la distribución de las muestras emparejadas, y para una cohorte ejemplar más grande de pares de secuenciación de ARN (derecha) con datos que se sabe que provienen de individuos diferentes (desajustes, rojo claro) y del mismo individuo (cerillas, verde claro). Abreviaturas; LOD = ratio logarítmica de probabilidades. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 4: Diferencias ejemplares en la puntuación LOD observadas. (A) al combinar diferentes enfoques de alineación de secuencias y mapas de haplotipos para un conjunto de muestras conocidas como desajustadas y emparejadas, y (B) para la puntuación mediante la integración de información tumoral y normal. (C) Ocurrencia del número de coincidencias y desajustes de muestra definidos por enfoques de umbral de diferentes rigurosidades. Abreviaturas; LOD = ratio logarítmica de probabilidades. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 5: Distribución ejemplar de puntuaciones LOD para comparar diferentes modalidades de secuenciación de nueva generación. (A) Distribución de puntuaciones LOD de muestras esperadas desemparejadas y emparejadas entre la secuenciación de ADN de sangre y tejido tumoral y la secuenciación de ARN de tejido tumoral. (B) Distribución de puntuaciones LOD de muestras emparejadas para combinaciones de diferentes modalidades. Abreviaturas; LOD = ratio logarítmica de probabilidades. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 6: Distribución de las puntuaciones LOD para el análisis de un conjunto de datos de WES y secuenciación de ARN para cáncer de mama. El conjunto de datos sobre el cáncer de mama desidentificado se obtuvo de Caris Life Sciences y se deriva de un perfilado tumoral integral. (A) Ocurrencia logarítmica de las puntuaciones LOD para comparaciones entre muestras de WES tumorales (izquierda) y entre muestras de secuenciación de ARN (derecha). (B) Distribuciones de puntuación LOD para pares esperados de muestras de los mismos individuos (fila superior WES, fila inferior con secuenciación de ARN). Abreviaturas; LOD = ratio logarítmica de probabilidades. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
| LEFT_GROUP_VALUE | RIGHT_GROUP_VALUE | RESULTADO | LOD_SCORE | LOD_SCORE_ TUMOR_NORMAL | LOD_SCORE_ NORMAL_TUMOR |
| Ejemplo 1 | Ejemplo 1 | EXPECTED_MATCH | 38.119266 | 29.649485 | 29.649485 |
| Ejemplo 1 | Ejemplo 2 | EXPECTED_MISMATCH | -2.552644 | -4.57422 | 5.283698 |
| Ejemplo 2 | Ejemplo 1 | EXPECTED_MISMATCH | -2.552644 | 5.283698 | -4.57422 |
| Ejemplo 2 | Ejemplo 2 | EXPECTED_MATCH | 12.328737 | 8.796457 | 8.796457 |
Tabla 1: Resultados ejemplares obtenidos al realizar Crosscheck Fingerprints. La tabla muestra resultados ejemplares de un par de muestras comparadas mediante el enfoque de emparejamiento muestral.