9 de mayo de 2011
Se presenta un sitio web público de computación para el análisis de secuencias genómicas. Se detecta patrones de secuencias de ADN con varias organizaciones no-aleatorio composiciones de nucleótidos. Este recurso también genera secuencias al azar, con diversos niveles de complejidad.
El objetivo general de este procedimiento es explorar la no aleatoriedad de rango medio, también denominada heterogeneidad, de una secuencia genómica especificada por el usuario. Esto se logra examinando primero la composición de oligonucleótidos de una secuencia de entrada y generando una tabla de frecuencias de los oligonucleótidos que componen la secuencia. Este objetivo se alcanza mediante la invocación del programa SRI Analyzer.
El segundo paso consiste en producir secuencias aleatorias que tengan exactamente la misma composición de oligonucleótidos que la secuencia de entrada. Esto se logra invocando el programa generador SRI. El tercer paso del procedimiento es encontrar segmentos dentro de las secuencias de entrada y aleatorizadas que estén significativamente enriquecidos con un nucleótido particular o una combinación de nucleótidos, por ejemplo, GC o ag.
Este objetivo se logra mediante el programa MRI Analyzer. El paso final del procedimiento consiste en descargar los archivos que contienen las secuencias de todas las regiones MRI detectadas por el programa. En última instancia, se pueden obtener resultados que muestran que la mayoría de las regiones genómicas de las arias multicelulares están significativamente enriquecidas en segmentos que contienen extremos en la composición de bases detectados para cada uno de los cuatro nucleótidos o cualquier combinación de ellos.
Estas regiones homogéneas se asocian con conformaciones inusuales del ADN y/o propiedades particulares del ADN. Este método puede ayudar a responder preguntas clave en el campo de la genómica, como encontrar elementos de ADN potencialmente funcionales dentro de vastas áreas de secuencias no codificantes, incluyendo regiones intergénicas o entradas. Aunque este método puede proporcionar información sobre genomas de mamíferos, también puede aplicarse a otros organismos como invertebrados, plantas, hongos y bacterias.
Abra la página principal del paquete en línea de genómica de rango medio en homogeneidad o G GM I en www.bioinfo.utoledo. edu/gri/el recurso web. También proporciona información detallada sobre los programas en el enlace de ayuda Cómo leer.
Aunque todos los materiales publicados sobre MRI genómico y algoritmos similares se enumeran en los enlaces a recursos relevantes, cree un archivo con una secuencia con formato rápido para iniciar una sesión de análisis A-G-M-R-I. Una secuencia con formato rápido comienza con un acento circunflejo o el símbolo mayor que, seguido de un identificador único o nombre y la secuencia en las líneas siguientes. Solo se procesarán los nucleótidos T, G, A y C mediante MRI genómico, aunque se permiten otros caracteres de entrada.
Se utiliza el archivo de secuencia del gen PKD uno. Para demostrar la sesión, presione el botón de inicio. Esto abre una nueva página web, que ofrece la opción de copiar y pegar la secuencia de entrada en la ventana proporcionada, o si el archivo es grande.
Para cargarlo, haga clic en el botón elegir archivo para subir un archivo. Busque el archivo deseado. Luego haga clic en el botón iniciar esta sesión con este archivo. Aparecerá una confirmación de que el archivo se cargó correctamente en la parte superior de la página. A continuación.
Este mensaje es un identificador de la sesión actual, que en este caso es C ocho EP cero seis. Para analizar la inhomogeneidad de corto alcance de la secuencia de entrada, haga clic en el botón analizar inhomogeneidad de corto alcance. El programa abre una nueva página, diseñada específicamente para la ejecución del programa SRI Analyzer.
Aquí debemos elegir la longitud máxima de los oligonucleótidos que se examinarán. Dado que nuestras secuencias de entrada son de tamaño medio, aproximadamente 50.000 nucleótidos, seleccionamos formadores como la longitud máxima de oligonucleótidos para los cuales se calcularán las frecuencias. Finalmente, debemos presionar inmediatamente el botón analizar archivo.
El programa calcula las frecuencias de todos los oligonucleótidos de la longitud elegida y longitudes menores dentro de la secuencia de entrada. Para ver las frecuencias de todos los oligonucleótidos, haga clic en el enlace descargar archivo de composición. Este archivo se denomina archivo de usuario.
com representa una tabla con tres columnas. La primera columna especifica los oligonucleótidos. La segunda representa sus frecuencias relativas, y la tercera representa el número de ocurrencias de oligonucleótidos dentro de la secuencia de entrada.
Para generar secuencias aleatorias con la misma composición de oligonucleótidos que el archivo de entrada, haga clic en la pestaña del generador SRI. En la nueva página, elija el número de muestras de secuencias aleatorias que se generarán. Cada una de estas muestras contendrá secuencias aleatorias con el mismo número y longitud que las secuencias de entrada en el archivo del usuario.
En este ejemplo, el archivo de usuario es la secuencia del gen PKD1. A continuación, seleccione la longitud más larga de oligonucleótidos para la cual se aproximarán las frecuencias en las secuencias aleatorizadas, activando el botón de opción para formadores, que corresponde a oligonucleótidos de cuatro bases. Luego, elija dos como el número de muestras de secuencias aleatorizadas que se generarán.
Finalmente, inicie el programa haciendo clic en el botón generar archivo para las secuencias de entrada de cientos de miles de nucleótidos. Podría tardar unos minutos en generar secuencias aleatorias. Por lo tanto, espere hasta que aparezcan enlaces azules de descarga en la parte inferior de esta página.
Para analizar la homogeneidad media en las secuencias de entrada y aleatorizadas, haga clic en la pestaña del analizador de MRI. En la nueva página, seleccione una secuencia para analizar desde el cuadro de lista de archivos para analizar. Luego, elija contenido de GC de la lista de siete tipos de contenido.
El contenido de GC representa la composición de G más C. El campo de tamaño de ventana permite seleccionar la longitud de la ventana para la cual se examinarán las secuencias ricas y pobres en contenido. Mantenga el tamaño de ventana predeterminado de 50 nucleótidos.
Finalmente, elija los umbrales superior e inferior para las regiones ricas y pobres en contenido, respectivamente. Estos umbrales pueden definirse según el número de nucleótidos particulares en la ventana actual o según el porcentaje de estos nucleótidos en la ventana. En este caso, elijamos inicialmente valores aleatorios del 60 % para el umbral superior y del 30 % para el umbral inferior.
A continuación, presione el botón para analizar el archivo. Tras esto, aparece un enlace al archivo de salida y se muestra una representación gráfica de los resultados. Todas las regiones ricas en contenido a lo largo de la secuencia de entrada se marcan como picos azules hacia arriba y las regiones pobres en contenido como picos rojos hacia abajo. El gráfico muestra que hay demasiados picos azules que indican regiones ricas en GC y muchos menos picos rojos que indican regiones pobres en GC.
Esto significa que los parámetros elegidos no son óptimos. Para la siguiente iteración, utilice un umbral superior del 75 % y un umbral inferior del 32 %. Vuelva a iniciar el analizador de MRI haciendo clic en el botón analizar archivo.
El nuevo gráfico muestra que incluso para los nuevos parámetros mucho más estrictos, hay cientos de picos azules. Por lo tanto, aumente el umbral superior al 80% y repita los cálculos. El nuevo gráfico muestra que hay 62 regiones ricas en GC con un contenido de GC mayor o igual al 80% y 28 regiones pobres en GC con un contenido de GC inferior al 32%. A continuación, compare los resultados del archivo de entrada con las dos secuencias aleatorizadas que tienen la misma composición de oligonucleótidos que el gen PKD1.
Para hacer esto, cambie la secuencia del gen PKD uno a la aleatoria utilizando el cuadro de lista del archivo a analizar, manteniendo los mismos parámetros para las regiones ricas en GC y pobres en GC. La nueva representación gráfica generada para la secuencia aleatoria número uno ilustra que esta secuencia aleatoria tiene solo una región pobre en GC y 31 regiones ricas en GC. Otra secuencia aleatoria puede presentar algunas fluctuaciones en el número de regiones ricas y pobres en contenido, pero la tendencia debería ser la misma.
Las secuencias aleatorias para el gen PKD tienen varias veces menos. Las regiones ricas en GC son más de 10 veces menos que las regiones pobres en GC. La siguiente demostración utiliza otro tipo de contenido de MRI.
En el mismo paquete, los intrones de un gen humano contienen varias regiones ricas en purinas asociadas con estructuras DNAex. En la página web del analizador MRI, cambie el contenido de ADN a nucleótidos ag que representan purinas. Mantenga el tamaño de ventana igual a 50 bases y cambie el umbral superior al 80 % y el umbral inferior al 10 %. Luego, presione el botón analizar archivo para invocar el programa.
El gráfico mostrado indica que este gen tiene seis regiones ricas en AG, representadas por picos verticales azules, y 14 regiones pobres en AG, representadas por picos rojos. A continuación, compare estos resultados obtenidos para el gen PKD1 con los datos provenientes de las secuencias aleatorizadas que tienen la misma composición de oligonucleótidos que el gen en estudio: primero cambie a la secuencia aleatorizada, por ejemplo la número dos, y mantenga los mismos parámetros que en la prueba anterior. El gráfico correspondiente a esta secuencia aleatoria muestra que contiene solo una región rica en AG y ninguna región pobre en AG.
Todos los datos generados durante la sesión se guardan en archivos especiales a los que se puede acceder mediante la pestaña de archivos para descargar, ubicada en la esquina superior derecha de cada página web. Después de abrir este enlace, descargue la secuencia de entrada, así como todas las secuencias aleatorizadas generadas. Debajo de esta lista de archivos, hay un enlace a la tabla de frecuencia de oligonucleótidos generada por el programa analizador SRI.
Luego hay enlaces a todos los resultados generados por el programa analizador de MRI durante la sesión. Por ejemplo, haga clic en el archivo usuario un archivo RAND uno cuatro AGCO 50 32 14, que representa los resultados obtenidos para la secuencia aleatorizada. Número uno con los siguientes parámetros: contenido de AG del 50 %, ventana de longitud de 50 nucleótidos, umbral superior de 32 nucleótidos y umbral inferior de 14 nucleótidos.
En este archivo, todos los segmentos de secuencias de nucleótidos que coinciden con criterios ricos o pobres en contenido, junto con sus coordenadas, están disponibles como una lista según sus posiciones consecutivas a lo largo de la secuencia de entrada. Después de ver este video, debería tener una buena comprensión de cómo navegar a través de MRI genómico, un recurso computacional.
Este artículo presenta un recurso web computacional diseñado para el análisis de secuencias genómicas, centrándose en la detección de composiciones de nucleótidos no aleatorias. La herramienta genera secuencias aleatorizadas con composiciones de oligonucleótidos similares, facilitando la exploración de inhomogeneidades genómicas.
La MRI genómica proporciona un enfoque computacional para detectar patrones no aleatorios de nucleótidos en el ADN no codificante, apoyando la validación de objetivos mediante la identificación de elementos reguladores con posible significado funcional. Esto permite reducir el riesgo mecanicista en las fases iniciales del descubrimiento al vincular la inhomogeneidad de la secuencia con procesos biológicos como la expresión génica y la recombinación. El recurso mejora la confianza predictiva en la identificación de compuestos activos al priorizar regiones genómicas con composición de bases extrema para el desarrollo de ensayos posteriores.
El método se integra en el continuo de descubrimiento, desde la validación del blanco hasta la identificación de compuestos activos y el trabajo preclínico, al proporcionar resultados cuantitativos sobre el enriquecimiento de secuencias que informan las decisiones de reducción de riesgos biológicos.