4.15
El genoma completo de un organismo no se puede secuenciar en secuencias continuas, incluso la última generación de tecnologías de secuenciación produce datos fragmentados a partir de miles de fragmentos cortos de ADN que van desde 50 a 1000 pb de longitud.
Estas secuencias cortas de ADN, llamadas lecturas, deben ensamblarse para reconstruir la secuencia completa de un genoma en un proceso llamado ensamblaje del genoma.
Hay cuatro pasos principales en cualquier ensamblaje del genoma de próxima generación: análisis de datos sin procesar, ensamblaje de contig, andamiaje y, finalmente, cierre de brechas.
El primer paso es analizar la calidad de los datos brutos adquiridos y, a continuación, eliminar cualquier contaminación, datos sesgados o lecturas de mala calidad con un gran número de nucleótidos desconocidos.
A continuación, se recortan las lecturas limpias para eliminar las secuencias del adaptador de sus extremos. Las bases en los extremos del fragmento que no superan el umbral de calidad también se recortan.
A continuación, se utiliza una herramienta de montaje adecuada para ensamblar las lecturas en secuencias contiguas, llamadas contigs, basadas en los segmentos de ADN superpuestos.
El ensamblaje comparativo del genoma se puede utilizar cuando se dispone de un genoma de referencia de un organismo estrechamente relacionado para dirigir la reconstrucción del nuevo genoma. Aquí, las lecturas se alinean con el genoma de referencia, y esto proporciona un diseño para los pasos posteriores en el ensamblaje del genoma.
Alternativamente, el ensamblaje del genoma de novo debe realizarse en ausencia de un genoma de referencia. Aquí, las lecturas superpuestas se utilizan para orientar las secuencias en contigs más largos.
En el siguiente paso, las lecturas cortas emparejadas, que son lecturas que sobresalen al final de los contigs, se utilizan para andamiar el genoma.
Los espacios entre los contigs adyacentes se rellenan con Ns en caso de secuencias desconocidas. Sin embargo, si se utilizan lecturas largas de más de 1 kb de longitud para unir contigs, los espacios se pueden rellenar con secuencias reales.
El resultado es un genoma ensamblado que luego debe anotarse con la ayuda de herramientas automatizadas, un proceso llamado anotación del genoma.
Los dos objetivos principales de la anotación del genoma son la estructura génica y la predicción de la función génica, comúnmente conocidas como anotación estructural y anotación funcional, respectivamente.
Mientras que la anotación estructural conduce a la identificación de los elementos genómicos, como las regiones codificantes, los motivos reguladores, etc., la anotación funcional ayuda a identificar correctamente la función biológica de estos elementos estructurales, especialmente, los genes codificadores de proteínas.
Las herramientas de anotación del genoma utilizan los datos disponibles, incluidas las transcripciones conocidas, las secuencias de proteínas o señales, los genes predichos de otros genomas secuenciados o las firmas de dominios conservados, como referencias para cualquier nueva anotación.
Una vez que el software alinea estos datos disponibles con el borrador del genoma, es necesario filtrarlos y pulirlos, ya sea manualmente o utilizando herramientas de anotación para obtener un conjunto final de anotaciones genéticas.
El genoma se refiere a todo el material genético de un organismo. Puede variar desde unos pocos millones de pares de bases en células microbianas hast…
Copyright © 2026 MyJoVE Corporation. Todos los derechos reservados.