June 23rd, 2012
La secuenciación del ADN agrupado es una estrategia rápida y rentable para la detección de variantes raras asociadas con fenotipos complejos en grandes cohortes. A continuación se describe el análisis computacional de combinado, secuenciación de próxima generación de los 32 genes relacionados con el cáncer utilizando el paquete de software Splinter. Este método es escalable y aplicable a cualquier fenotipo de interés.
El objetivo general de este procedimiento es identificar genes dentro de una población de individuos que muestran una preponderancia de variación funcional rara. Esto se logra agrupando primero una población de muestras de ADN. El segundo paso es crear y secuenciar una biblioteca de secuenciación de próxima generación.
A esto le sigue la alineación de las lecturas con la secuencia de referencia y la creación de un modelo de error. El último paso es el análisis computacional utilizando el algoritmo splinter. En última instancia, el análisis de fragmentos de la secuenciación agrupada de la próxima generación se utiliza para mostrar genes dentro de poblaciones que albergan una preponderancia de varianza funcional rara
.Hoy será el turno de Francesco Vilania, estudiante de posgrado en el laboratorio de mi mentor y colaborador nuestro, Rob Mitra, y estará acompañado por Enrique Ramos, estudiante de posgrado en mi laboratorio. La principal ventaja de esta técnica sobre los métodos existentes, como los genotipos individuales individuales, es que permite detectar con mucha precisión variantes de secuencias raras en una población mixta de moléculas de ADN sin necesidad de ninguna información previa. Este método puede ayudar a responder preguntas clave en los campos de la genética y la genómica, como cómo determinar la frecuencia de nuevas enfermedades que causan variantes raras en grandes estudios de cohortes.
Cada experimento de fragmentación requiere la presencia de un control negativo y positivo para obtener una precisión óptima, prepare la mezcla de reacción de PCR utilizando PFU de ultra alta fidelidad. ADN polimerasa. El control negativo es un producto de PCR a partir de cualquier secuencia de ADN que se sepa que no tiene variación genética, como la columna vertebral de un vector clonado.
Aquí, se utiliza un amplicón de par de bases 1.934 del vector M 13 MP 18. El control positivo puede ser cualquier conjunto de variantes de secuencia previamente validadas presentes en toda la población. Si estos datos no están disponibles, este laboratorio ha diseñado un control positivo artificial que consiste en una base 331 por producto de PCR a partir de una mezcla de secuencias de ingeniería clonadas en el vector fácil PGMT como se enumera en esta tabla.
Estas secuencias se combinan para imitar varias frecuencias alélicas menores de variantes verdaderas dentro del grupo de pacientes. Después de la amplificación de muestras por PCR, como se explica en el protocolo escrito que acompaña a este vídeo, limpie cada producto de PCR del exceso de cebadores utilizando la purificación rápida en columna de kayak de kyogen, o placas de filtro de 96 pocillos con colector de vacío para una limpieza a gran escala. Una vez purificado, cuantifique cada producto de PCR utilizando técnicas estándar.
Prepárese para combinar todos los productos y controles de PCR en un grupo normalizado por número de moléculas. La agrupación por concentración dará lugar a una sobrerrepresentación de amplicones pequeños sobre productos más grandes. En su lugar, agrupe un número normalizado de moléculas por amplicones.
Elija números arbitrarios que sean lo suficientemente grandes como para mantener la precisión durante el pipeteo. Tire de los productos y controles de PCR. La ligadura de los productos de PCR es necesaria porque la fragmentación de los pequeños solicitantes de PCR probablemente sesgará la representación hacia sus fines.
Por esta razón, ligamos los productos de PCR de extracción en grandes dimensiones antes de su fragmentación. Prepare la mezcla para la ligadura roma con T cuatro ligasa, T cuatro PNK y PEG como se indica en el protocolo. Incubar la reacción a 22 grados centígrados durante 17 horas.
Siga con la incubación a 65 grados centígrados durante 20 minutos y manténgala a cuatro grados centígrados. Verifique la ligadura cargando 50 nanogramos de muestra en un gel surgido. Una ligadura exitosa dará como resultado una banda de alto peso molecular presente en el carril.
Prepárese para la fragmentación del ADN a través de una estrategia de sonicación aleatoria diluyendo la muestra 10 a uno en Qiagen PB Buffer para que sea menos viscosa. A continuación, fragmente el gran cono de los productos de PCR utilizando una bioruptura del nodo de diagnóstico de 24 muestras, sonicate a alta potencia en el transcurso de 25 minutos con 40 segundos encendidos y 20 segundos apagados por minuto. Verifique los resultados de la fragmentación del ADN en un agrogel y proceda con la secuenciación luminosa como se describe en el texto.
Para comenzar la secuenciación, lea alineación. Convierta la secuenciación en bruto, lea los archivos en formato de bufanda o comprímalos. La compresión es opcional.
Ahorra tiempo y espacio para los siguientes pasos de análisis sin perder ninguna información relevante. Con la herramienta de alineación incluida, alinee las lecturas sin procesar con la secuencia de referencia más rápida anotada. Específicas de las regiones objetivo incluyen las reacciones de PCR, así como los controles positivos y negativos.
El formato de entrada debe estar en formato bufanda o comprimido. A continuación, realice el etiquetado de archivos como se describe en el texto. Cada ejecución genera un perfil único de error de secuenciación que se caracterizará para una llamada precisa de variantes para modelar errores para cada ejecución.
Se incluye un control interno que se sabe que se implementa de la variación de secuencia en cada biblioteca de muestras de grupo desde el archivo etiquetado alineado. Genere un archivo de modelo de error utilizando la herramienta incluida con la secuencia de referencia de control negativo, se puede usar toda la secuencia de control negativo o, alternativamente, solo un subconjunto cuando se especifica por sus cinco extremos primos y tres primos. Siempre se deben aplicar lecturas únicas y pseudorecuentos.
La herramienta generará tres archivos denominados como parámetro de nombre de archivo de salida que terminan en cero, uno o dos. Estos archivos corresponden a un modelo de error cero de primer y segundo orden respectivamente para la llamada de variantes con splinter. El modelo de error de segundo orden siempre se debe utilizar para la visualización del perfil de tasa de errores de ejecución.
El script Pearl utilizado para trazar el gráfico del modelo de error se puede emplear para generar un gráfico de error PDF en el archivo del modelo de error de orden cero. El archivo de trazado revelará las tendencias de error específicas de la ejecución y se puede utilizar para inferir el número máximo de bases de lectura para el análisis. En la siguiente sección se muestra cómo ejecutar splinter en el archivo alineado utilizando el modelo de error para detectar variantes de secuencia raras.
El primer paso en el análisis es ejecutar splinter en el archivo alineado utilizando la secuencia de referencia y el modelo de error. Las bases de lectura única se pueden excluir del análisis si se encuentra defectuosa. El valor de corte P dicta el grado de riguroso del análisis de llamadas a variantes.
Un límite mínimo de menos 1,301 es un buen comienzo. La opción de tamaño del grupo optimiza la señal del algoritmo para la discriminación de ruido al eliminar la variación potencial con frecuencias de alelos menores menores que la de un solo alelo en el grupo real. La opción de tamaño de grupo debe establecerse en el valor más cercano que sea mayor que el número real de alelos analizados en el experimento.
La varianza llamada a frecuencias más bajas se ignorará como ruido. Después de ingresar todos los parámetros y nombres de archivo, ejecute splinter. Este archivo devuelve todas las visitas que son estadísticamente significativas en toda la muestra con una descripción de la posición del tipo de variante de variante.
Valor p por cadena de ADN, frecuencia de la variante y cobertura total por cadena de ADN. El vial de lista es utilizado por la astilla para normalizar la cobertura en toda la muestra. El primer campo indica el amplicón de interés, mientras que el segundo campo indica la posición en la que está presente la mutación.
N indica que el resto de la secuencia no contiene ninguna mutación. Una normalización, el análisis del control positivo es clave para maximizar la sensibilidad y la especificidad para una ejecución en particular. Esto es importante porque lo más probable es que el corte inicial de menos 1,301 no sea suficiente para eliminar todos los falsos positivos.
Cada análisis de fragmentación mostrará el valor P real para cada variante llamada, que no se pudo predecir con una prioridad. Sin embargo, todo el análisis se puede repetir utilizando el valor P menos estricto que se muestra en la salida inicial para las posiciones base positivas verdaderas conocidas. Esto servirá para retener todos los verdaderos positivos y excluir la mayoría, si no todos, los falsos positivos, que suelen tener valores de P mucho menos significativos en comparación con los verdaderos positivos.
Para automatizar este proceso, se puede utilizar el script del probador de corte. El script del probador de corte requiere un archivo de salida de fragmentación y una lista de aciertos de control positivo en forma de un archivo delimitado por tabulaciones como el que se usa para la normalización. La salida resultante será una lista de puntos de corte que alcancen progresivamente el óptimo.
La última línea representa el límite más óptimo para la ejecución y, por lo tanto, se puede utilizar para el análisis de datos. El resultado óptimo es lograr la sensibilidad y especificidad de uno. Sin embargo, si no se alcanza, el análisis de fragmentación se puede optimizar cambiando el número de bases de lectura incorporadas.
El límite final se puede aplicar a los datos mediante el script de corte de corte, que filtrará el archivo de salida de fragmentación de los hits por debajo del corte óptimo. Este paso generará el archivo de salida de fragmento final, que contendrá recortes e indels presentes en la muestra. Tenga en cuenta que la salida de las inserciones es ligeramente diferente a la de las sustituciones o eliminaciones.
En este tipo de gráfico se visualiza la precisión en función de la cobertura de un solo alelo en una muestra agrupada. La precisión se estima como el área bajo la curva abreviada como UC de una curva del operador del receptor y oscila entre una precisión aleatoria de 0,5 y una precisión perfecta de 1,0. En este ejemplo, se representa un UC en función de la cobertura por alelo para la detección de alelos mutantes individuales en grupos de 200 501.000 alelos.
Aquí se representa un UC como una función del total de inserciones, eliminaciones y sustituciones. Este gráfico de error muestra la probabilidad de incorporar una base errónea en una posición dada. El perfil de error muestra tasas de error bajas con una tendencia creciente hacia los tres extremos principales de la lectura de secuenciación.
En particular, los diferentes nucleótidos de referencia muestran diferentes probabilidades de error. Este gráfico revela la precisión de la astilla en la estimación de la frecuencia alélica para posiciones que tenían una cobertura superior a 25 veces por alelo. Una comparación entre las frecuencias de alelos de ADN agrupadas estimadas por fragmentación con los recuentos de alelos medidos por estudios de asociación de genoma completo o resultados de GWAS.
En una correlación muy alta, se extrajo una población de 974 individuos y se seleccionaron más de 20 kilobases para su secuenciación. Splinter se aplicó para la detección de variantes raras. Siguiendo el protocolo estándar, a cada individuo se le realizó previamente el genotipado por gwas concordancia entre el genotipado de las variantes marcadas y las nuevas.
Los llamados en la muestra agrupada fueron excelentes. Tres variantes, dos de las cuales eran raras en la población, se denominaron denovo a partir de los resultados de la secuenciación, y se validaron mediante pirosecuenciación individual, frecuencias alélicas menores o concordancia matemática entre la pirosecuenciación y la secuenciación extraída fue excelente. Una vez que haya terminado de encontrar su varianza rara en su muestra agrupada, muchas personas quieren saber cuáles son las consecuencias funcionales de la varianza que han identificado.
Por lo tanto, la anotación de su variación se convierte en el siguiente paso en el proceso después de un desarrollo. Esta técnica allanó el camino para que los investigadores en el campo de la secuenciación de ADN estudiaran variantes raras de una manera rápida y rentable para caracterizar variantes raras en estudios de poblaciones grandes. Después de ver este video, debería tener una buena comprensión de cómo detectar variantes de secuencia raras en un grupo, muestra de ADN usando astillas.
La secuenciación de ADN agrupado es un método eficiente para identificar variantes genéticas raras vinculadas a rasgos complejos en poblaciones grandes. Este artículo detalla el análisis computacional de datos de secuenciación agrupados de 32 genes relacionados con el cáncer utilizando el paquete de software SPLINTER.
Detecting rare genomic variants in large populations is critical for target validation in complex disease research, where common variants fail to explain phenotypic variability. The SPLINTER-enabled pooled sequencing approach provides a cost-effective, scalable method to interrogate therapeutic hypotheses by identifying low-frequency functional variants without prior variant knowledge. This supports early discovery de-risking by enabling allele frequency estimation and variant confirmation in disease-relevant cohorts, directly informing portfolio prioritization and mechanistic follow-up.
The method fits within the discovery continuum from hypothesis generation to lead identification, providing variant detection outputs that inform target selection and assay readiness.