May 9th, 2011
Se presenta un sitio web público de computación para el análisis de secuencias genómicas. Se detecta patrones de secuencias de ADN con varias organizaciones no-aleatorio composiciones de nucleótidos. Este recurso también genera secuencias al azar, con diversos niveles de complejidad.
El objetivo general de este procedimiento es explorar el rango medio, no aleatorio, también llamado homogeneidad de una secuencia genómica especificada por el usuario. Esto se logra examinando primero la composición de oligonucleótidos de una secuencia de entrada y generando una tabla de frecuencias de oligonucleótidos que componen la secuencia. Este objetivo se logra invocando el programa SRI Analyzer.
El segundo paso es producir secuencias aleatorias que tengan exactamente la misma composición de oligonucleótidos que la secuencia de entrada. Esto se logra invocando el programa generador de SRI. El tercer paso del procedimiento es encontrar segmentos dentro de la entrada y secuencias aleatorias que estén significativamente enriquecidas por un nucleótido o combinación de nucleótidos en particular, por ejemplo, GC o ag.
Este objetivo se logra con el programa MRI Analyzer. El paso final del procedimiento es descargar los archivos que contienen las secuencias de todas las regiones de resonancia magnética detectadas por el programa. En última instancia, se pueden obtener resultados que muestran que la mayoría de las regiones genómicas de arias multicelulares están significativamente enriquecidas por segmentos que contienen extremos de composición de bases detectados para cada uno de los cuatro nucleótidos o cualquiera de sus combinaciones.
Estos en regiones homogéneas se asocian con confirmaciones inusuales de ADN y/o propiedades particulares del ADN. Este método puede ayudar a responder preguntas clave en el campo de la genómica, como encontrar elementos de ADN potencialmente funcionales dentro de vastas áreas de secuencias no codificantes, incluidas las regiones intergénicas o entradas. Aunque este método puede proporcionar información sobre los genomas de los mamíferos, también se puede aplicar a otros organismos como invertebrados, plantas, hongos y bacterias.
Abra la página de inicio del paquete en línea genómico de rango medio en homogeneidad o G GM I en www.bioinfo.utoledo. También proporciona información detallada sobre los programas en el enlace de ayuda cómo Léame.
Si bien todos los materiales publicados sobre resonancia magnética genómica y algoritmos similares se enumeran en los enlaces a los recursos relevantes, enlace cree un archivo con una secuencia formateada más rápida para iniciar la sesión de análisis A-G-M-R-I. Una secuencia con formato más rápido comienza con una zanahoria o el símbolo mayor que, seguido de un identificador o nombre único y una secuencia en las siguientes líneas. Solo los nucleótidos TG y C se procesarán mediante resonancia magnética genómica, aunque se permiten otras entradas de caracteres.
Se utiliza el archivo de secuencia para el gen PKD one. Para demostrar la sesión, presione el botón de inicio. Esto abre una nueva página web, que da la opción de copiar y pegar la secuencia de entrada en la ventana proporcionada, o si el archivo es grande.
Para cargarlo, haga clic en el botón elegir archivo para cargar un archivo. Busque el archivo deseado. A continuación, haga clic en el botón Iniciar esta sesión con este archivo La confirmación de que el archivo se ha cargado correctamente se muestra en la parte superior de la página. Abajo.
Este mensaje es un identificador de la sesión actual, que en este caso es C eight EP oh six. Para analizar el rango corto en homogeneidad de la secuencia de entrada, haga clic en el botón analizar rango corto en homogeneidad. El programa abre una nueva página, diseñada específicamente para la ejecución del programa SRI Analyzer.
Aquí tenemos que elegir la longitud máxima de los nucleótidos oligonucleótidos que se van a examinar. Dado que nuestras secuencias de entrada de tamaño medio son de aproximadamente 50.000 nucleótidos, seleccionamos los formadores como la longitud más alta de oligonucleótidos para los que se calcularán las frecuencias. Finalmente, debemos presionar el botón analizar archivo inmediatamente.
El programa calcula las frecuencias de todos los oligonucleótidos de la longitud elegida y longitudes más pequeñas dentro de la secuencia de entrada. Para ver las frecuencias de todos los oligonucleótidos, haga clic en el enlace descargar archivo de composición. Este archivo se denomina archivo de usuario.
com representa una tabla con tres columnas. La primera columna especifica los oligonucleótidos. El segundo representa sus frecuencias relativas y el tercero representa el número de ocurrencias de oligonucleótidos dentro de la secuencia de entrada.
Para generar secuencias aleatorias con la misma composición de oligonucleótidos que el archivo de entrada, haga clic en la pestaña Generador de SRI. En la nueva página, elija el número de muestras de secuencias aleatorias que se van a generar. Cada una de estas muestras contendrá secuencias aleatorias del mismo número y longitud que las secuencias de entrada en el archivo de usuario.
En este ejemplo, el archivo de usuario es la secuencia del gen PKD one. A continuación, elija la longitud más larga de oligonucleótidos para los que se aproximarán las frecuencias en las secuencias aleatorias seleccionando el botón de opción para los formadores, que representa cuatro oligonucleótidos base. A continuación, elija dos para el número de muestras de secuencias aleatorias que se van a generar.
Finalmente, inicie el programa haciendo clic en el botón generar archivo para las secuencias de entrada de cientos de miles de nucleótidos. Podría llevar un par de minutos generar secuencias aleatorias. Por lo tanto, espere hasta que aparezcan los enlaces de descarga azules en la parte inferior de esta página.
Para analizar el rango medio en la homogeneidad de las secuencias de entrada y aleatorias, haga clic en la pestaña del analizador de resonancia magnética. En la nueva página, seleccione la secuencia que se va a analizar en el cuadro de lista del archivo para analizar. A continuación, elija Contenido de GC de la lista de siete tipos de contenido.
El contenido de GC representa la composición G más C. El campo de tamaño de ventana permite seleccionar la longitud de la ventana para la que se examinarán las secuencias ricas y pobres de contenido. Mantenga el tamaño de ventana predeterminado de 50 nucleótidos.
Por último, elija el umbral superior e inferior para las regiones de contenido rico y pobre en contenido, respectivamente. Estos umbrales se pueden definir por el número de nucleótidos particulares en la ventana actual o por el porcentaje de estos nucleótidos en la ventana. En este caso, elijamos inicialmente valores aleatorios de 60% para el umbral superior y 30% para el umbral inferior.
A continuación, presione el botón analizar archivo Después de esto, aparece un enlace al archivo de salida y se muestra una representación gráfica de los resultados. Todas las regiones ricas en contenido a lo largo de la secuencia de entrada se marcan como picos ascendentes azules y las regiones pobres en contenido como picos descendentes rojos. El gráfico muestra que hay demasiados picos azules que muestran regiones ricas en GC y muchos menos picos rojos que muestran regiones pobres en GC.
Esto significa que los parámetros elegidos no son óptimos. Para la siguiente iteración, use un umbral superior del 75 % y un umbral inferior del 32 %. Nuevamente, inicie el analizador de resonancia magnética haciendo clic en el botón analizar archivo.
El nuevo gráfico muestra que incluso para los nuevos parámetros mucho más estrictos, hay cientos de picos azules. Por lo tanto, aumente el umbral superior al 80% y repita los cálculos. El nuevo gráfico muestra que 62 regiones ricas en GC tienen un contenido de GC mayor o igual al 80% y 28 regiones pobres en GC con un contenido de GC inferior al 32%A continuación, compare los resultados del archivo de entrada con las dos secuencias aleatorias que tienen la misma composición de oligonucleótidos que el gen PKD one.
Para hacer esto, cambie la secuencia de PKD un gen a uno aleatorio usando el cuadro de lista de archivo para analizar mientras mantiene los mismos parámetros para las regiones ricas y pobres en GC. La visualización gráfica recién generada para la secuencia aleatoria número uno ilustra que esta secuencia aleatoria tiene solo una región pobre en GC y 31 regiones ricas en GC. Otra secuencia aleatoria puede presentar alguna fluctuación en el número de regiones ricas y pobres en contenido, pero la tendencia debería ser la misma.
Las secuencias aleatorias de PKD un gen tienen varias veces menos. Las regiones ricas en GC son más de 10 veces menos regiones pobres en GC. La siguiente demostración utiliza otro tipo de contenido de resonancia magnética.
En el mismo paquete, un gen humano Los intrones de este gen contienen varias regiones ricas en purinas asociadas con estructuras DN aex. En la página web del analizador de resonancia magnética, cambie el contenido de ADN a nucleótidos ag que representan purinas. Mantenga el tamaño de la ventana igual a 50 bases y cambie el umbral superior a 80% y el umbral inferior a 10% Luego presione el botón analizar archivo para invocar el programa.
El gráfico mostrado muestra que este gen tiene seis regiones ricas en ag que se muestran con picos verticales azules y 14 regiones pobres en ag que se muestran con picos rojos. A continuación, compare estos resultados obtenidos para el gen PKD one con los datos de las secuencias aleatorias que tienen la misma composición de oligonucleótidos que el gen objeto de estudio, primero cambie a la secuencia aleatoria, por ejemplo la número dos, y mantenga los mismos parámetros que en la prueba anterior. El gráfico de esta secuencia aleatoria muestra que contiene solo una región rica en AG y ninguna región pobre en AG.
Todos los datos generados durante la sesión se guardan en archivos especiales a los que se puede acceder a través de la pestaña de archivos de descarga en la esquina superior derecha de cada página web. Después de abrir este enlace, descargue la secuencia de entrada, así como todas las secuencias aleatorias generadas. Debajo de esta lista de archivos, hay un enlace a la tabla de frecuencia de oligonucleótidos generada por el programa analizador SRI.
A continuación, hay enlaces a todos los resultados generados por el programa analizador de resonancia magnética durante la sesión. Por ejemplo, haga clic en el archivo de usuario un archivo RAND uno cuatro AGCO 50 32 14, que representa los resultados obtenidos para la secuencia aleatoria. Número uno con los siguientes parámetros, contenido de ag de 50 nucleótidos de ventana larga, umbral superior, 32 nucleótidos y umbral inferior de 14 nucleótidos.
En este archivo, todos los segmentos de secuencia de nucleótidos que coinciden con los criterios de contenido rico o malo, y sus coordenadas están disponibles como una lista de acuerdo con sus posiciones consecutivas a lo largo de la secuencia de entrada. Después de ver este video, debe tener una buena comprensión de cómo navegar a través de la resonancia magnética genómica, recurso computacional.
Este artículo presenta un recurso web computacional diseñado para el análisis de secuencias genómicas, enfocándose en la detección de composiciones de nucleótidos no aleatorias. La herramienta genera secuencias aleatorizadas con composiciones de oligonucleótidos similares, facilitando la exploración de inhomogeneidades genómicas.
Genomic MRI provides a computational approach to detect non-random nucleotide patterns in non-coding DNA, supporting target validation by identifying regulatory elements with potential functional significance. This enables mechanistic de-risking in early discovery by linking sequence inhomogeneity to biological processes such as gene expression and recombination. The resource enhances predictive confidence in lead identification by prioritizing genomic regions with extreme base composition for downstream assay development.
The method integrates into the discovery continuum from target validation through lead identification to preclinical work by providing quantitative outputs on sequence enrichment that inform biological de-risking decisions.