28 de junio de 2018
Secuenciación profunda de las poblaciones de levaduras seleccionadas para las interacciones 2-híbrido de levadura positivos potencialmente produce una gran cantidad de información sobre la interacción de las proteínas de socio. Aquí, describimos el funcionamiento de herramientas bioinformáticas específico y personalizado software actualizado para analizar los datos de la secuencia de estas pantallas.
Este método puede ayudar a responder preguntas clave sobre la naturaleza de los interactomas proteicos. La principal ventaja de esta técnica es que todo el procesamiento bioinformático es operado por una interfaz fácil de usar. Este software emplea una interfaz gráfica de usuario fácil de usar que los biólogos moleculares, biólogos celulares y bioquímicos que no tienen mucha experiencia en bioinformática pueden usar para completar fácilmente sus análisis.
Generalmente, las personas nuevas en el procesamiento de datos de secuencia tienen dificultades porque los programas informáticos son confusos y engorrosos. Pensamos que facilitar la informática haría que toda la técnica fuera mucho más accesible y útil. El primer paso en este procedimiento es descargar e instalar el programa de software MAPster como se describe en el protocolo de texto.
A continuación, introduzca los archivos y parámetros necesarios a través de la pestaña Principal. Seleccione el botón Pairwise apropiado para ingresar los archivos para el análisis de DEEPN. Desactive la opción Emparejamiento para ejecutarla en formato de lectura única.
Cargue archivos en MAPster arrastrando y soltando en la ventana correspondiente. De los genomas indexados enumerados en el cuadro Genoma, seleccione una fuente de genoma de ADN de referencia que corresponda a la fuente de las inserciones de la biblioteca de presas Y2H. Dado que HISAT2 admite subprocesos múltiples, en el cuadro Subprocesos, indique el número de procesos informáticos que se dedicarán al programa de mapeo.
Especifique un nombre de archivo de salida, se recomienda un nombre corto pero descriptivo sin espacios ni caracteres especiales, ya que este nombre de archivo se utilizará durante todo el proceso de DEEPN. Con el botón Abrir directorio de salida, especifique una carpeta para generar los archivos asignados. Una vez que se hayan seleccionado los archivos y parámetros adecuados, utilice el botón Agregar a la cola para agregar el trabajo de asignación a la cola de trabajos.
Una vez que se hayan introducido todos los trabajos en la cola de trabajos, haga clic en el botón Ejecutar cola. Comience este análisis abriendo el software DEEPN. En la ventana principal, seleccione la información de la biblioteca de presas correspondiente en el cuadro de selección superior.
Seleccione una carpeta donde puedan ir los archivos procesados haciendo clic en el botón Carpeta de trabajo y navegando al directorio de carpetas. Una vez seleccionada una carpeta de trabajo, DEEPN creará tres subcarpetas con los nombres indicados. Para un análisis correcto, asegúrese de colocar los archivos SAM correctos en las carpetas correctas y de saber qué archivos tienen lecturas asignadas y no asignadas.
Si utiliza archivos sam que contienen lecturas asignadas y no asignadas, como las que se producen con la configuración predeterminada del programa MAPster, colóquelos en la carpeta sam_files. Inicie el procesamiento haciendo clic en el botón Recuento de genes más creación de unión. El tiempo de procesamiento depende del tamaño y el número de archivos de datos de secuencia y de la velocidad de procesamiento del ordenador utilizado.
Una vez que DEEPN haya procesado los datos, se creará un conjunto completo de carpetas. El siguiente paso es realizar un análisis en Stat Maker. Abra Stat_Maker y haga clic en el botón Verificar instalación.
Si se ejecuta por primera vez, Stat_Maker instalará automáticamente R, JAGS y Bioconductor extrayendo estos recursos de Internet. Una vez que se detecten R, JAGS y Bioconductor, Stat_Maker se activará y permitirá más entradas del usuario. Haga clic en el botón Elegir carpeta para navegar a la carpeta de trabajo que DEEPN procesó.
Stat_Maker automáticamente encontrará y enumerará los archivos para el análisis estadístico en la ventana. Arrastre y suelte los archivos apropiados de la ventana de lista de archivos de arriba a las ventanas de archivos de abajo para cada conjunto de datos vectoriales y de cebo y para cada condición de crecimiento, no seleccionada y seleccionada. Es importante destacar Stat_Maker requiere conjuntos de datos duplicados solo para vectores vacíos, dos muestras de poblaciones no seleccionadas y dos muestras de seleccionadas.
Esto da una estimación de la variabilidad dentro del experimento. Haga clic en el botón Ejecutar. Dependiendo de la velocidad de la computadora, el cálculo tomará entre cinco y 15 minutos.
Los resultados de la salida Stat_Maker se colocan en una nueva subcarpeta dentro de la carpeta de trabajo principal con la etiqueta Stat_Maker Resultados. Revisa los resultados. Para revisar los datos de cada candidato potencial, abra el software DEEPN, seleccione la información de la biblioteca de presas correspondiente y, a continuación, seleccione la carpeta de trabajo correcta utilizando la carpeta de trabajo.
Haga clic en el botón Consulta de explosión para cargar una nueva ventana. En el cuadro de texto superior, escriba el nombre del gen o el número NM de GenBank para seleccionar el gen candidato de interés. El nombre del gen corresponde al nombre que aparece en el archivo de salida de Stat Maker.
Escriba Enter o Return, que inicia la recuperación del gen de interés. Seleccione los conjuntos de datos que se utilizarán para el análisis mediante los menús Seleccionar conjunto de datos. Por lo general, estos incluyen solo el vector y las muestras de cebo cultivadas en condiciones no selectivas y la muestra de cebo cultivada en condiciones de selección.
Inicialmente, la carga de los datos y el nombre del gen puede llevar un poco de tiempo con el programa Blast Query, pero una vez que se carga el conjunto de datos, irá mucho más rápido. Blast_Query mostrará los puntos de fusión a lo largo de la secuencia de interés y la abundancia de cada punto de fusión. Esto se puede mostrar tanto en un formato de tabla usando la pestaña Resultados como en un formato gráfico usando la pestaña Trazar.
Para exportar estos resultados a un archivo csv, haga clic en el botón Guardar csv en la parte superior derecha. En la ventana de DEEPN, haga clic en el botón Profundidad de lectura en Analizar datos. Una vez que se abra la ventana Profundidad de lectura, escriba el número NM en el cuadro de texto superior.
Utilice el menú desplegable para seleccionar el conjunto de datos relevante que contiene el gen enriquecido de interés. Utilice la tabla de la izquierda y los gráficos de la derecha para determinar cuántas lecturas se encontraron en los datos que corresponden al gen de interés. El programa Stat Maker produce un archivo visible en Excel que resume la información pertinente necesaria para identificar las proteínas candidatas que interactúan.
También se muestra el análisis correspondiente de si los plásmidos correspondientes a la presa candidata contienen el marco de lectura abierto adecuado. La consulta Blast evalúa cada gen y ordena las diferentes posiciones de acuerdo con su abundancia en el conjunto de datos cuantificado por las ppm del número total de uniones encontradas dentro de la base de datos. En este ejemplo, la posición más abundante que es In ORF y In Frame es la posición 867, lo que indica que el nucleótido 867 de la secuencia de referencia GenBank NCBI NM_019648 es el comienzo del fragmento de presa.
Este gráfico muestra una secuencia hipotética y cómo diseñar el oligo de cinco primos para capturar el marco y el punto de fusión correctos entre el dominio de activación Gal4 y la secuencia de presas de interés. Esta ventana de profundidad de lectura muestra cuántas secuencias se encontraron en los datos que corresponden a las posiciones de nucleótidos de la secuencia de interés. Una vez dominado, el procesamiento de datos se puede realizar en 10 a 20 horas, la mayoría de las veces sin supervisión.
Las pantallas de DEEPN y el análisis informático correspondiente allanarán el camino para que los investigadores de una amplia gama de campos exploren las redes de interacción con su proteína de interés. El programa MAPster está diseñado para facilitar el mapeo de archivos de secuencia de experimentos DEEPN. También proporciona un método fácil de usar para mapear archivos de secuencia para hacer referencia al ADN para una variedad de aplicaciones, como RNA-Seq o ChIP-Seq.
Aunque el software DEEPN está diseñado específicamente para procesar datos de dos híbridos de levadura por lotes, también se puede utilizar para procesar datos de RNA-Seq. El programa Stat Maker no solo predice qué genes dan una interacción auténtica entre dos híbridos de levadura, sino que también recopila una serie de otros parámetros, como la información del marco de lectura, lo que permite a los investigadores filtrar rápidamente sus resultados candidatos. Una vez identificadas las proteínas candidatas que interactúan, es importante validar las interacciones mediante ensayos estándar de dos híbridos de levadura, ensayos bioquímicos de extracción o métodos relacionados.
Vea la transcripción completa y acceda a miles de videos científicos
Este artículo describe un método para analizar interactomas proteicos mediante secuenciación profunda de poblaciones de levaduras seleccionadas por interacciones positivas en el sistema de doble híbrido en levadura. Destaca el uso de herramientas bioinformáticas fáciles de usar que simplifican el proceso de análisis para investigadores sin experiencia extensa en bioinformática.
Este método permite la identificación de alto rendimiento de interacciones proteína-proteína mediante ensayos de doble híbrido en levadura acoplados a secuenciación profunda, proporcionando datos cuantitativos de enriquecimiento que apoyan la validación de objetivos y la reducción de riesgos mecanicistas en las fases iniciales del descubrimiento. El flujo de trabajo bioinformático integrado reduce la dependencia de conocimientos especializados, acelerando el paso de descubrimiento a liderazgo al ofrecer mapas de interacción reproducibles y resueltos por marco. Este enfoque mejora la confianza predictiva en la selección de objetivos y apoya campañas de cribado escalables en diversas áreas terapéuticas.
El método se integra en la fase temprana del descubrimiento, apoyando la identificación de dianas mediante el perfilado de interacciones y contribuyendo a la identificación de compuestos prometedores a través de redes de interacción validadas.