$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Aquí, demostramos una suite de protocolos de corrección de error de la secuencia que pueden ser fácilmente implementadas para estudiar las mutaciones con baja VAFs en diferentes enfermedades. El factor más importante es la incorporación de UMIs con cada molécula antes de la secuencia ya que permiten la corrección de errores de lecturas raws. Los métodos aquí descritos permiten a los investigadores incorporar UMIs personalizados paneles de genes disponibles en el mercado y diseñado oligos específicos del gene.
Protocolo estándar de NGS impide la detección de mutaciones con VAF por debajo del 2% debido a la tasa de error de la secuencia, y esto limita la aplicación de NGS en estudios donde es crucial la detección de variantes raras. Por eludir la tasa de error estándar de NGS, ECS permite la detección sensible de estas variantes crudas. Por ejemplo, la detección de las mutaciones patógenas cuando estas mutaciones surgen en primer lugar (por lo tanto con baja VAF) es imprescindible para informar a la intervención temprana de la enfermedad14,15. En la investigación de la leucemia, la detección de residual mínima enfermedad (células leucémicas residuales después del tratamiento) informa a estratificación de riesgo y podría ser utilizada para informar las opciones de tratamiento de manera que las evaluaciones de citometría de flujo binario no se pueden. Además, la ECS es aplicable para detectar circulación de ácido nucleico tumor y para evaluar el potencial metastático en pacientes con tumores sólidos mediante la evaluación de la presencia/ausencia, así como la carga variable de ciertas mutaciones que son características de la primaria tumor de16.
Como se muestra en la tabla 1, el poder de usar modelo de error de posición específica basada en la distribución binomial para llamar variantes depende en gran medida el número de secuenciadas bibliotecas así como la profundidad de la secuencia utilizada para construir el modelo de error. La robustez del modelo de error aumenta con la mayor cantidad de muestras y más profundidad de la secuencia. Se recomienda utilizar al menos 10 muestras secuenciadas con un promedio de cobertura Lea-corregido error de x 3000 por ejemplo para construir un perfil de error para cada muestra. El enfoque de la posición específica es similar a MAGERI, pero en lugar de utilizar una tasa de error global para todo tipo de sustitución diferente seis (A > C/T > G, A > G/T > C, A > T/T > A, C > A/G > T, C > G/G > C C > T/G > A)13, modelo de cada sustitución independientemente en cada posición. Por ejemplo, una tasa de error de C > T en una determinada posición genómica es diferente a otra posición. Nuestro enfoque también toma en cuenta un efecto de la secuencia por lotes, como la tasa de substitución baja observada en una secuencia de la carrera podría ser diferente de otra carrera. Por lo tanto, es importante modelar cada posición para todo tipo de sustitución especialmente cuando las muestras de pistas de secuencia diferentes se combinaron para construir el modelo.
Una consideración importante al diseñar un experimento ECS es el umbral de detección deseada. La belleza de los estudios NGS es que pueden escalar fácilmente en términos de genes/objetivos de interés, umbral de detección (dictado por la profundidad de la secuencia) y número de personas consultadas. Por ejemplo, si los investigadores están interesados en encontrar mutaciones raras en dos amplicones con un umbral de detección de 0.0001, piscina máximo 75 muestras en una sola secuencia ejecutar utilizando química MiSeq V2 que lee hasta 15 millones (2 amplicons * 10.000 moléculas * 10 Lee para corrección de errores * 75 muestras = 15 millones de la secuencia de lecturas). Los investigadores pueden variar el número de moléculas en la secuencia o el número de muestras agrupadas en una sola secuencia para ajustar el umbral de detección. En nuestros estudios, decidimos encontrar mutaciones con un umbral de detección de VAF 0.0001 (1:10, 000) utilizando el panel de genes Illumina. Rutinariamente utilizamos 250 ng de a partir de ADN para asegurar que suficientes moléculas son capturadas para alcanzar el umbral de detección ya mencionado. Los investigadores pueden optar por iniciar con la menor cantidad de ADN (50 ng recomienda) si el límite de detección deseado es > 0.001 VAF.
Como se añaden las UMIs en los índices de i5, ajustes de la secuencia deben modificarse en consecuencia. Por ejemplo, utilizamos UMIs N 16, y la configuración de la secuencia final pares 2 x 144 lecturas, 8 ciclos de índice 1 y 16 ciclos de índice 2 a diferencia de los habituales 8 ciclos de índice 2. El aumento en el índice 2 ciclo es compensado por una disminución en el número total de ciclos a la Lee. Si los investigadores optan por utilizar 12N UMIs10,17, debe cambiarse la configuración a 12 ciclos de índice 2.
Este método de secuenciación basada en UMI está optimizado para corregir errores de secuenciación. Sigue siendo subóptima en el trato con jackpotting PCR, que es un tema para todo método basado en amplificación. Se realizaron rondas de la secuencia y validación post-bioinformática usando ddPCR, y apenas detectamos cualquier falsos positivos debido a jackpotting PCR. No obstante, se recomienda que los investigadores llevar a cabo los experimentos con polimerasa de alta fidelidad para garantizar errores de amplificación baja.