23 de junio de 2012
La secuenciación del ADN agrupado es una estrategia rápida y rentable para la detección de variantes raras asociadas con fenotipos complejos en grandes cohortes. A continuación se describe el análisis computacional de combinado, secuenciación de próxima generación de los 32 genes relacionados con el cáncer utilizando el paquete de software Splinter. Este método es escalable y aplicable a cualquier fenotipo de interés.
El objetivo general de este procedimiento es identificar genes dentro de una población de individuos que presentan una predominancia de variación funcional rara. Esto se logra primero agrupando una población de muestras de ADN. El segundo paso consiste en crear y secuenciar una biblioteca de secuenciación de próxima generación.
A continuación, se realiza el alineamiento de las lecturas a la secuencia de referencia y la creación de un modelo de errores. El paso final consiste en el análisis computacional mediante el algoritmo splinter. En última instancia, el análisis splinter de la secuenciación masiva de próxima generación se utiliza para identificar genes dentro de poblaciones que albergan una predominancia de variación funcional rara, demostrando así el procedimiento.
Hoy será Francesco Vilania, quien es estudiante de posgrado en el laboratorio de mi mentor y colaborador, Rob Mitra, y estará acompañado por Enrique Ramos, un estudiante de posgrado en mi laboratorio. La principal ventaja de esta técnica frente a métodos existentes como los genotipos individuales únicos es que permite detectar con gran precisión variantes de secuencia raros en una población mixta de moléculas de ADN sin requerir ninguna información previa. Este método puede ayudar a responder preguntas clave en los campos de la genética y la genómica, como cómo determinar la frecuencia de variantes raros novedosos que causan enfermedades en estudios de cohortes grandes.
Cada experimento de desdoblamiento requiere la presencia de un control negativo y uno positivo para obtener una precisión óptima; prepare la mezcla de reacción de PCR utilizando la ADN polimerasa PFU de ultra alta fidelidad. El control negativo es un producto de PCR de cualquier secuencia de ADN conocida por no tener variación genética, como un vector clonado en su armazón.
Aquí se utiliza un amplicón de 1.934 pares de bases del vector M13 MP18. El control positivo puede ser cualquier conjunto de variantes de secuencia previamente validadas presentes en toda la población. Si estos datos no están disponibles, este laboratorio ha diseñado un control positivo artificial que consiste en un producto de PCR de 331 pares de bases a partir de una mezcla de secuencias modificadas clonadas en el vector PGMT easy, como se indica en esta tabla.
Estas secuencias se combinan para imitar diversas frecuencias alélicas menores de variantes reales dentro del grupo de pacientes. Tras la amplificación por PCR de las muestras según se describe en el protocolo escrito que acompaña a este video, purifique cada producto de PCR de los cebadores en exceso utilizando kyogen kayak quick column purification, o placas de filtro de 96 pocillos con manifold de vacío para limpieza a gran escala. Una vez purificados, cuantifique cada producto de PCR mediante técnicas estándar.
Prepárese para combinar todos los productos de PCR y controles en un grupo normalizado por número de moléculas. Agrupar por concentración dará como resultado una sobrerrepresentación de amplicones pequeños frente a productos más grandes. En cambio, agrupe un número normalizado de moléculas por amplicón.
Elige números arbitrarios que sean lo suficientemente grandes para mantener la precisión durante la pipetación. Retira los productos de PCR y los controles. La ligación de los productos de PCR es necesaria porque la fragmentación de pequeños fragmentos de PCR probablemente sesgará la representación hacia sus extremos.
Debido a esta razón, ligamos los productos de PCR de captura en un con grande antes de su fragmentación. Prepare la mezcla para la ligación de extremos romos utilizando T four Ligase, T four PNK y PEG según se indica en el protocolo. Incube la reacción a 22 grados Celsius durante 17 horas.
Incubar posteriormente a 65 grados Celsius durante 20 minutos y mantener a cuatro grados Celsius. A continuación, verificar la ligación cargando 50 nanogramos de muestra en un gel de agarosa. Una ligación exitosa dará como resultado una banda de alto peso molecular presente en la pista.
Prepárese para la fragmentación del ADN mediante una estrategia de sonicación aleatoria diluyendo la muestra de uno a diez en tampón Qiagen PB para hacerla menos viscosa. Luego, fragmente el gran cono de productos de PCR utilizando un bio ruptor con nodo diagonal de 24 muestras, sometiendo a sonicación a alta potencia durante 25 minutos con ciclos de 40 segundos encendidos y 20 segundos apagados por minuto. Verifique los resultados de la fragmentación del ADN en un gel de agarosa y continúe con la secuenciación iluminosa según se describe en el texto.
Para comenzar la secuenciación, realice el alineamiento de lecturas. Convierta los archivos de lecturas de secuenciación crudos al formato scarf o comprímalos. La compresión es opcional.
Ahorra tiempo y espacio para los pasos posteriores de análisis sin perder ninguna información relevante. Utilizando la herramienta de alineamiento incluida, alinee las lecturas crudas con la secuencia de referencia faster anotada. Específicos de las regiones diana incluyen las reacciones de PCR, así como los controles positivo y negativo.
El formato de entrada debe estar en formato scarf o comprimido. A continuación, realice la etiquetación de archivos como se describe en el texto. Cada ejecución genera un perfil único de errores de secuenciación que debe caracterizarse para realizar una llamada precisa de variantes y modelar los errores de cada ejecución.
Se incluye un control interno conocido por presentar variación de secuencia en cada biblioteca de muestras agrupadas a partir del archivo etiquetado alineado. Genere un archivo de modelo de error utilizando la herramienta incluida con la secuencia de referencia del control negativo; pueden usarse todas las secuencias del control negativo o, alternativamente, solo un subconjunto cuando se especifique mediante sus extremos cinco primario y tres primario. Siempre se deben aplicar lecturas únicas y conteos pseudo.
La herramienta generará tres archivos cuyos nombres serán los del parámetro de nombre de archivo de salida, seguidos de cero, uno o dos. Estos archivos corresponden respectivamente a un modelo de error de orden cero, primero y segundo para la llamada de variantes con splinter. Siempre debe utilizarse el modelo de error de segundo orden para la visualización del perfil de tasa de error del análisis.
El script Pearl utilizado para trazar el gráfico del modelo de error se puede emplear para generar un gráfico de errores en formato PDF a partir del archivo del modelo de error de orden cero. El archivo gráfico revelará tendencias específicas de errores por corrida y puede utilizarse para inferir el número máximo de bases leídas para el análisis. La siguiente sección demostrará cómo ejecutar splinter en el archivo alineado utilizando el modelo de error para detectar variantes de secuencia raras.
El primer paso en el análisis consiste en ejecutar splinter en el archivo alineado utilizando la secuencia de referencia y el modelo de error. Se pueden excluir bases individuales de lectura del análisis si se detecta que son defectuosas. El valor umbral de P dicta qué tan riguroso será el análisis de llamado de variantes.
Un valor umbral mínimo de -1,301 es un buen punto de partida. La opción de tamaño de grupo optimiza la discriminación señal-ruido del algoritmo al eliminar la varianza potencial con frecuencias de alelos menores que la de un solo alelo en el grupo real. La opción de tamaño de grupo debe establecerse en el valor más cercano que sea mayor que el número real de alelos analizados en el experimento.
La varianza detectada en frecuencias más bajas será ignorada como ruido. Después de ingresar todos los parámetros y nombres de archivos, ejecute splinter. Este archivo devuelve todos los resultados significativos estadísticamente en la muestra, con una descripción de la posición y del tipo de variante.
Valor p por frecuencia del fragmento de ADN de la variante y cobertura total por fragmento de ADN. La lista de viales se utiliza por splinter para normalizar la cobertura a través de la muestra. El primer campo indica el ampricón de interés, mientras que el segundo campo indica la posición en la que está presente la mutación.
N indica que el resto de la secuencia no contiene ninguna mutación. En una normalización, el análisis del control positivo es fundamental para maximizar la sensibilidad y la especificidad en un ensayo determinado. Esto es importante porque lo más probable es que el valor umbral inicial de -1,301 no sea suficiente para eliminar todos los falsos positivos.
Cada análisis de astillas mostrará el valor P real para cada variante detectada, el cual no podría predecirse de antemano. Sin embargo, todo el análisis puede repetirse utilizando el valor P menos estricto mostrado en la salida inicial para las posiciones de bases verdaderamente positivas conocidas. Esto servirá para conservar todos los verdaderos positivos mientras se excluyen la mayoría, si no todos, los falsos positivos, que típicamente presentan valores P mucho menos significativos en comparación con los verdaderos positivos.
Para automatizar este proceso, se puede utilizar el script del probador de puntos de corte. El script del probador de puntos de corte requiere un archivo de salida de splinter y una lista de hits de control positivo en forma de un archivo delimitado por tabulaciones como el utilizado para la normalización. La salida resultante será una lista de puntos de corte que progresivamente alcancen el óptimo.
La última línea representa el corte más óptimo para la corrida y por lo tanto puede utilizarse para el análisis de datos. El resultado óptimo consiste en alcanzar una sensibilidad y especificidad de uno. Sin embargo, si no se alcanza, el análisis de fragmentos puede optimizarse modificando el número de bases de lectura incorporadas.
El corte final se puede aplicar a los datos utilizando el script cutoff cut, que filtrará el archivo de salida de splinter eliminando los resultados por debajo del valor de corte óptimo. Este paso generará el archivo final de salida de splinter, que contendrá los fragmentos y las inserciones/deleciones presentes en la muestra. Tenga en cuenta que el formato de salida para inserciones es ligeramente diferente al de sustituciones o deleciones.
La precisión en función de la cobertura para un solo alelo en una muestra agrupada se visualiza en este tipo de gráfico. La precisión se estima como el área bajo la curva, abreviada como AUC (área bajo la curva característica de operación del receptor), y varía desde una precisión aleatoria de 0,5 hasta una precisión perfecta de 1,0. En este ejemplo, la AUC se representa como función de la cobertura por alelo para la detección de alelos mutantes individuales en grupos de 200 a 501 000 alelos.
Aquí se representa gráficamente una UC como función del total de inserciones, eliminaciones y sustituciones. Este gráfico de errores muestra la probabilidad de incorporar una base errónea en una posición determinada. El perfil de errores muestra tasas bajas de errores con una tendencia creciente hacia el extremo tres prima de la lectura de secuenciación.
Los nucleótidos de referencia notablemente diferentes presentan probabilidades de error distintas. Este gráfico revela la precisión de splinter al estimar la frecuencia alélica en posiciones que tuvieron un cubrimiento superior a 25 veces por alelo. Una comparación entre las frecuencias alélicas de ADN agrupado estimadas por splinter y los conteos alélicos medidos mediante estudios de asociación del genoma completo o resultados de GWAS.
En una correlación muy alta, se obtuvo una población de 974 individuos y se dirigió un fragmento de más de 20 kilobases para secuenciación. Se aplicó Splinter para la detección de variantes raras. Siguiendo el protocolo estándar, cada individuo había sido genotipado previamente mediante concordancia de gwas entre el genotipado de variantes marcadas y variantes nuevas.
Las llamadas en la muestra agrupada fueron excelentes. Se identificaron tres variantes, dos de las cuales eran raras en la población, como eventos *de novo* a partir de los resultados de secuenciación, y se validaron mediante pirosecuenciación individual; las frecuencias del alelo minoritario y la concordancia matemática entre la pirosecuenciación y la secuenciación agrupada fueron excelentes. Una vez que haya terminado de encontrar sus variantes raras en la muestra agrupada, muchas personas desean saber cuáles son las consecuencias funcionales de las variantes que han identificado.
Por lo tanto, la anotación de su varianza se convierte en el siguiente paso del proceso tras un desarrollo. Esta técnica allanó el camino para que los investigadores en el campo del secuenciamiento de ADN estudiaran variantes raras de forma rápida y rentable, permitiendo la caracterización de variantes raras en estudios con poblaciones grandes. Después de ver este video, debería tener una buena comprensión sobre cómo detectar variantes de secuencia raras en una muestra de ADN agrupada utilizando splinter.
La secuenciación de ADN agrupado es un método eficiente para identificar variantes genéticas raras asociadas a rasgos complejos en poblaciones grandes. Este artículo detalla el análisis computacional de datos de secuenciación agrupada de 32 genes relacionados con el cáncer utilizando el paquete de software SPLINTER.
Detectar variantes genómicas raras en poblaciones grandes es fundamental para la validación de dianas en la investigación de enfermedades complejas, donde las variantes comunes no logran explicar la variabilidad fenotípica. El enfoque de secuenciación agrupada habilitado por SPLINTER proporciona un método rentable y escalable para investigar hipótesis terapéuticas mediante la identificación de variantes funcionales de baja frecuencia sin conocimiento previo de las variantes. Esto apoya la reducción de riesgos en las fases iniciales del descubrimiento al permitir la estimación de frecuencias alélicas y la confirmación de variantes en cohortes relevantes para la enfermedad, informando directamente la priorización de carteras y el seguimiento mecanicista.
El método se integra en el continuo de descubrimiento desde la generación de hipótesis hasta la identificación de candidatos, proporcionando resultados de detección de variantes que orientan la selección de objetivos y la preparación de ensayos.