4 de abril de 2018
Secuenciación de próxima generación dirigido es un método tiempo y costo-eficiente que se está haciendo cada vez más popular en la investigación de la enfermedad y diagnóstico clínico. El protocolo descrito aquí presenta el complejo flujo de trabajo necesarios para la secuencia y el proceso de bioinformática para identificar variantes genéticas que contribuyen a la enfermedad.
El objetivo general de la secuenciación dirigida de próxima generación es dilucidar los determinantes genéticos de diversas enfermedades constitucionales centrándose en las regiones genómicas de particular interés. Este método puede ayudarnos a responder preguntas clave sobre la ideología genética de una enfermedad, particularmente cuando existen asociaciones genéticas previamente conocidas. Esta técnica es altamente eficiente.
Produce millones de lecturas en un corto período de tiempo, las obtenemos a un costo relativamente bajo, hay una carga computacional relativamente baja, especialmente cuando lo comparamos con otros enfoques de secuenciación de próxima generación. Las implicaciones de la técnica se extienden hacia el diagnóstico de enfermedades neurodegenerativas, que son fenotípica y genéticamente heterogéneas, pero tienen muchos loci genéticos asociados conocidos. Aunque este método está especialmente dirigido a las enfermedades neurodegenerativas, también podría aplicarse a otras enfermedades constitucionales con regiones genómicas de interés previamente identificadas.
Por lo general, las personas nuevas en este método tendrán dificultades porque el procesamiento bioinformático requerido para el análisis final de variantes raras puede ser computacionalmente intensivo y crear muchas fuentes de error. En este procedimiento, las muestras de sangre humana se recogen en tubos de EDTA K2 de tres y cuatro mililitros para proporcionar un volumen total de unos 12 mililitros. Centrifugar las muestras de sangre a 750 veces la gravedad durante 20 minutos.
Esto fraccionará cada muestra en una fase superior de plasma, una fase media delgada de leucocitos y una fase inferior de eritrocitos. Pipetee el plasma de la parte superior de la muestra de sangre con una pipeta de transferencia desechable. Dispense en múltiples alícuotas de 500 microlitros y almacene a 80 grados centígrados negativos para futuros análisis bioquímicos.
Extraiga el ADN de la muestra de sangre con un kit de extracción de sangre de acuerdo con las instrucciones del fabricante. A continuación, el ADN extraído se utiliza para preparar una biblioteca de secuenciación para la secuenciación de próxima generación. Una vez completada la ejecución de la secuenciación, en un equipo, busque los archivos dentro del entorno informático basado en la nube seleccionando Ejecuciones en el panel de navegación.
Seleccione la ejecución de secuenciación adecuada para navegar a la página de resumen de ejecución. Seleccione Descargar para obtener datos de la nube. En el cuadro de diálogo que aparece, seleccione los archivos FASTQ como el tipo de archivo que desea descargar y haga clic en Descargar.
En la página Resumen de ejecución del entorno informático basado en la nube, vaya a Gráficos para analizar la calidad de la ejecución de secuenciación con las distintas cifras generadas por el entorno informático. En la página Gráficos de ejecución, busque la figura etiquetada Datos por ciclo, en Gráfico seleccione Intensidad y, en Canal, seleccione Todos los canales para generar el gráfico de intensidad de la señal. En el panel Ejecutar navegación, seleccione la pestaña Control de calidad de indexación para buscar el histograma de control de calidad de indexación, que se encuentra en el lado derecho de la página.
En la página Resumen de ejecución del entorno informático basado en la nube, haga clic en Métricas en el panel de navegación Ejecución para navegar a las métricas de calidad. En Densidad kelvin por milímetro cuadrado, asegúrese de que la densidad del clúster de la secuencia esté dentro del rango recomendado por el kit de enriquecimiento que se está utilizando. En este caso, de 1.200 a 1.400 kelvin por milímetro cuadrado.
En el Porcentaje total mayor o igual que Q30, asegúrese de que el valor sea mayor o igual que 85%, lo que refleja la calidad de las lecturas de secuenciación. En Alineado, asegúrese de que el valor sea similar al porcentaje de control positivo que se incluyó en la ejecución de secuenciación. Por ejemplo, si se utilizó un control positivo del 1%, el porcentaje alineado esperado sería aproximadamente del 1 al 5% y las variaciones dentro de unos pocos puntos decimales son aceptables.
Comience este proceso importando las lecturas de secuenciación de FASTQ en el software de procesamiento de datos. Dentro del área de navegación, haga clic con el botón derecho y seleccione Nueva carpeta. Asigne un nombre a la carpeta que quede claro en cuanto a la ejecución de secuenciación que se realizó.
En la barra de herramientas de la parte superior, seleccione Importar y, en la lista desplegable, elija la plataforma con la que se realizó la secuenciación. A los efectos de ONDRISeq, se elige Ilumina. En el cuadro de diálogo, desplácese y seleccione los archivos FASTQ de la ejecución de secuenciación que se está procesando.
En las opciones generales del cuadro de diálogo, haga clic en el cuadro situado junto a Lecturas emparejadas si la secuenciación utilizó químicas finales emparejadas. En la información de lectura emparejada del cuadro de diálogo, seleccione Fin emparejado si el archivo FASTQ de lectura directa aparece antes de la lectura inversa en la lista de archivos. Establezca la distancia mínima de lectura emparejada en uno y la distancia máxima en 1000.
En las opciones de Ilumina del cuadro de diálogo, seleccione Eliminar lecturas fallidas. En la lista desplegable Puntuación de calidad, seleccione la canalización NGS que se utilizó para la secuenciación. Seleccione Siguiente en la parte inferior del cuadro de diálogo.
Seleccione Guardar y Crear subcarpetas por unidad de lote. Seleccione Siguiente en la parte inferior del cuadro de diálogo. Elija la carpeta que se creó anteriormente.
Aquí es donde se importarán los archivos FASTQ. Seleccione Finalizar en la parte inferior del cuadro de diálogo y espere hasta que se importen los archivos FASTQ. Haga clic en la pestaña Procesos para ver el estado de la importación de archivos.
A continuación, diseñe un flujo de trabajo dentro del software para realizar la resecuenciación y la llamada de variantes de acuerdo con las instrucciones del fabricante. El diseño del flujo de trabajo de resecuenciación y llamada a variantes es el aspecto más difícil de este procedimiento. Nuestro equipo investigó las mejores prácticas y utilizó el método de prueba y error para crear el flujo de trabajo más sólido que se adaptara a nuestras necesidades.
Para ejecutar los archivos de lectura de secuenciación FASTQ importados a través del flujo de trabajo bioinformático personalizado, comience identificando el flujo de trabajo en la caja de herramientas del software y haga doble clic en él. Dentro del cuadro de diálogo que aparece, localice las carpetas de archivos FASTQ que se importaron dentro del área de navegación. Resalte todas las carpetas seleccionándolas en el área de navegación y, a continuación, haga clic en la casilla situada junto a Lote.
Utilice la flecha hacia la derecha para mover los archivos a los elementos seleccionados. Haga clic en Siguiente en la parte inferior del cuadro de diálogo. En el cuadro de diálogo, revise la descripción general del lote para asegurarse de que se seleccionaron los archivos FASTQ correctos y, a continuación, haga clic en Siguiente.
Revise los pasos del flujo de trabajo en el cuadro de diálogo para asegurarse de que se seleccionaron los archivos y las ubicaciones de exportación correctos al diseñar el flujo de trabajo. Estos pasos incluyen la asignación de lecturas a la secuencia de referencia, la eliminación de lecturas asignadas duplicadas, la creación de estadísticas para las regiones de destino, la exportación de archivos BAM, la exportación de texto delimitado por tabulaciones, el filtro basado en la superposición y la exportación de archivos VCF. En el paso final del cuadro de diálogo, Gestión de resultados, seleccione la opción Guardar en carpeta de entrada.
Haga clic en Finalizar en la parte inferior del cuadro de diálogo. El paso final es realizar la anotación de variantes en el archivo VCF de cada muestra, tal como se describe en el protocolo de texto. Las metodologías demostradas en este video se aplicaron a 528 muestras de ADN de participantes de individuos que se han inscrito en ONDRI.
Las muestras se ejecutaron en el panel ONDRISeq en 22 corridas de 24 muestras por corrida. En general, se determinó que los datos de secuenciación eran de alta calidad, con una cobertura media de la muestra de 78 veces. Una media del 95,6% de las lecturas coincidieron con la secuencia de referencia, y todas las ejecuciones de ONDRISeq tenían más del 90% de las lecturas asignadas.
De las lecturas mapeadas, el 92.0% y una puntuación de Phred mayor o igual a Q30. Para demostrar la utilidad de este flujo de trabajo de NGS dirigido, se presenta el ejemplo de un hombre de 68 años, paciente con enfermedad de Parkinson, que muestra una reducción de la producción de N. La varianza anotada se selecciona para identificar aquellos que tienen más probabilidades de ser de importancia clínica, como se indica en los cuadros rojos.
Al realizar este procedimiento, es importante recordar que los pasos deben adaptarse adecuadamente a la plataforma de secuenciación, al kit de enriquecimiento que se utilizó y a las necesidades de la investigación. Después de su desarrollo, esta técnica allanó el camino para que los investigadores en el campo de la genética obtuvieran datos específicos de alta calidad para cada región, sin dejar de ser menos costosos que sus contrapartes del exoma completo y del genoma completo.
La secuenciación dirigida de nueva generación es un método rentable para identificar variantes genéticas asociadas con enfermedades, particularmente trastornos neurodegenerativos. Este protocolo describe el flujo de trabajo para la secuenciación y los procesos bioinformáticos implicados.
La secuenciación dirigida de nueva generación (NGS) con una canalización bioinformática robusta permite una interrogación precisa de los determinantes genéticos conocidos en enfermedades constitucionales y neurodegenerativas. Este enfoque proporciona una identificación de variantes con alta confianza, apoyando el descubrimiento temprano y la investigación traslacional, al tiempo que optimiza la asignación de recursos. Su eficiencia y escalabilidad lo convierten en un activo estratégico para organizaciones de I+D basadas en carteras que buscan conocimientos genéticos accionables.
Este flujo de trabajo dirigido de NGS y bioinformática integra desde el descubrimiento inicial hasta la investigación traslacional, conectando la identificación de variantes con la validación funcional.