Todas las muestras utilizadas para determinar los marcos de lectura abierta (ORF) seleccionados en este estudio se obtuvieron de la isla de Starbuck, Sitio 7 (STAR7) y Caroline Atoll, Sitio 9 (CAR9) de las islas del sur de línea. Se recogió un estimado de 100 litros de agua de mar de estos sitios por debajo de las bombas de achique capa límite utilizando coral, como se describió previamente 5. Contenido de las bombas fueron objeto de fraccionamiento a través de grandes filtros con poros para eliminar pequeños eucariotas y posteriormente se concentraron usando 100 kDa filtros de flujo tangencial dejando sólo los microbios y los virus como partículas (VLP). Para separar las VLPs, permaneciendo el agua de mar se pasa a través de filtros de 0,45 micras resultantes en el virome. El cloroformo se introdujo a esta fracción viral para detener el crecimiento de las células restantes y se almacenó a 4 ° C.
VLPs fueron purificados utilizando el método del cloruro de cesio, en el que los gradientes de densidad se separan a través de centrifugación y permiten la recuperación de viriones a ~ 1,35 g / ml a 1,5 g / ml 3. El ADN viral fue extraído por medio de un CTAB / fenol: cloroformo protocolo y se amplifica a través de la amplificación de desplazamiento múltiple utilizando reactivos Phi29. La secuenciación del virome se llevó a cabo con la tecnología de pirosecuenciación disponible comercialmente.
Bioinformática utilizados en el procesamiento y selección de los ORFs virales para este estudio son los siguientes. Tres etapas de pre-procesamiento se utilizaron en los metagenomes virales CAR9 y STAR7. En primer lugar, software pública se utiliza para eliminar secuencias de etiqueta que resultaron de la amplificación del ADN viral antes de la secuenciación 27. En segundo lugar, los artefactos de secuenciación comunes como los duplicados de secuencia y bajo número de copias se filtraron fuera del conjunto de datos a través de un programa de bioinformática adicional 28. Por último, se llevó a cabo la eliminación de la contaminación secuencia extraña 29 para aquellas secuencias que tenían ≥ 90% de cobertura y ≥ 94% de identidad con las secuencias en las siguientes bases de datos: RefSeq vgenomas irus; Humano - Referencia GRCh37; Humano - Celera Genomics; Humano - Craig Venter (HuRef); Humano - Seong-Jin Kim (Corea); Humano - Cromosoma 7 Versión 2 (TCAG); y Human - James Watson, Yanhuang (YH; asiática), Yoruba (NA18507; Africano) secuencias de referencia 21. A raíz de estos procesos, secuencias de las muestras CAR9 totalizaron 591.600 y secuencias STAR7 totalizaron 939.311. Estas secuencias fueron subidos a MGRAST y ensamblados a través del software ensamblador con la configuración predeterminada. Contigs fueron traducidos al 6 marcos de lectura y los marcos de lectura abierta (putativos pORFs) fueron identificados mediante secuencias de comandos, como se ha descrito previamente 21.
Para identificar ORFs desconocidos se llevaron a cabo una serie de búsquedas de similitud basada eliminar ORFs de función conocida. Brevemente, las siguientes búsquedas se realizaron con sus criterios de búsqueda correspondientes 21:
- Similitud significativa de ≥ 95% de identidad más de ≥40 pares de bases (pb) por MGRAST Blat en la base de datos M5NR.
- Similitud significativa (e-valor ≤ 0,001) por TBLASTN contra todos metagenomes públicas en mi base de datos de recursos Metagenoma.
- Similitud significativa (e-valor ≤ 0,001) por BLASTP y TBLASTN contra la base de datos de NR.
- Similitud significativa (e-valor ≤ 0,001) por RPS-BLAST contra la base de datos de dominio Conservadas.
- Traducciones de proteínas a partir de una fracción selecto de cada conjunto de datos en comparación contra las estructuras de proteínas resueltas en el Protein Data Bank.
- Cálculo de frecuencias dinucleotide utilizando paquete Dinucleotide Firmas.
Los pORFs resultantes fueron diseñados para la expresión en E. coli utilizando a disposición del público el software de diseño de genes. Back-traducción de las secuencias de amino-ácido empleado una tabla de uso de codones universal diseñada para dar cabida a la expresión en E. coli con un umbral de uso mínimo de 2%. Secuencia de reconocimiento de la enzima de restriccións para BamHI y HindIII fueron excluidos de las secuencias para facilitar la clonación. Una empresa externa sintetiza el gen ingeniería secuencias de 30 y luego ORFs fueron clonados en un promotor número pBAD vector medio-copia, pEMB11, a través de la clonación de enzimas de restricción estándar. Todos los clones se transformaron en E. coli K-12 cepa BW 27784 23.
Las placas de ensayo Multi-fenotipo (MAP)
Una tubería de alto rendimiento y software robusto fue aprovechado para el análisis de los mapas, la PMAnalyzer 24. El oleoducto fue desarrollado en un entorno de servidor Linux y realiza varias etapas que incluyen: análisis de los archivos de densidad óptica, el formato de datos en archivos de texto legible, pre-procesamiento de las curvas de crecimiento para la garantía de calidad (QA), y la realización de las técnicas de modelado matemático para analizar las curvas de crecimiento . Las secuencias de comandos de modelado primarios fueron desarrollados en Python versión 2.7.5 para hacer uso del módulo PyLab.
MAP reproducibilidad se evaluó utilizando el error estándar (SE) para los datos replicados (Figura 2A). Curvas de crecimiento primas se compararon con curvas de crecimiento logística para determinar si el programa PMAnalyzer crecimiento clon precisión parametrizada y modelada durante la experimentación (datos no mostrados). Para más información sobre la exactitud y validez de los mapas y PMAnalyzer ver Cuevas et al. 24
Después de la validación del método, los datos MAP se analizó utilizando los parámetros múltiples, como la tasa máxima de crecimiento (μ max) y el nivel de crecimiento (GL), proporcionados por la tubería de proceso. Visualización comparativa de las curvas de crecimiento se utiliza a menudo para la interpretación de los datos de crecimiento; sin embargo, el número de curvas que se puede visualizar en un momento para la comparación tiene limitaciones. Para analizar numerosas curvas de crecimiento al mismo tiempo, mapa de calor parcelas fueron derivados imploraron comparar decenas de clones cultivados en una sola substrate contra de respuesta promedio que las condiciones '(Figura 2B). La influencia colocado por la sobreexpresión de una nueva proteína del fago se observa a través de cambios en parámetros de la curva, específicamente: retardo de fase, la fase exponencial y el rendimiento de biomasa máxima (asíntota). Como un ejemplo, la subida empinada de la fase lag a la fase exponencial modelado en la curva de crecimiento para la proteína de la cápside (Figura 2A) es reproducida por un cambio rápido en la intensidad del color de negro a blanco para el mismo clon en la trama dinámica de la Figura 2B .
Para obtener una imagen global de distribución de clon en toda sustratos, clasificaciones fenotípicas derivados de la GL fueron utilizados (Figura 3). Aquí, los cuatro fenotipos están separados en cuatro gráficos, donde la altura de cada barra representa el número de clones que muestran que el fenotipo para un sustrato específico. Los valores atípicos en los datos se reconocen como clones que caen en la "ganancia de funcio "o" pérdida de categoría de función ". Los valores atípicos pueden ser buscados individualmente e investigaron más de cerca experimentalmente. Además, análisis global reconoce sesgos de sustrato en el ensayo. Sustratos tales como fenilalanina, ácido málico, glicina y resultaron en una clasificación "no crecimiento". Los sustratos que caen constantemente en la clasificación hay crecimiento, a través de todos los clones, no se inclinan fuertemente en la caracterización funcional de aguas abajo.
Metabolómica
Los productos catabólicos de clones que expresan genes de fagos desconocidos se identificaron utilizando la metabolómica. Brevemente, los clones se cultivaron en ya sea un cultivo continuo o paso en serie en medio de cultivo por lotes antes de ser enviado a cabo para el análisis de GC-TOFMS en una instalación de núcleo metabolómica. Para más detalles sobre el procesamiento de muestras, el análisis, y la normalización de GC-TOFMS implementadas por la facilidad de la base elegida ver Fiehn et al. 31 Briefly, se añade 1 ml de disolvente de extracción en frío a cada muestra, después de lo cual las muestras se agitaron en vórtex y se sonicaron en un baño frío durante 5 min. Las muestras se centrifugaron y finalmente media de la muestra se decanta y se secaron para su análisis. Extractos se purifican y pinchos con marcadores de índice de retención interno antes de ser embarcados en el cromatógrafo de gases y luego fue trasladado posteriormente al espectrómetro de masas. Los datos de cada muestra se analiza de manera que se reportan intensidades de señal para todas las señales detectadas en el cromatograma. Para la normalización, la abundancia de picos para cada muestra se resume y la abundancia total de los picos son promediadas entre todas las muestras en el conjunto. Abundancias de metabolitos por muestra se dividen por el pico de abundancia de la muestra y luego se multiplican por la abundancia media de pico de la muestra establecida. Los datos resultantes se utiliza para el análisis de la metabolómica en la investigación discutida.
Validación de la metabolómica reproducibilidad estaba obligado adeterminar el tamaño apropiado de la muestra para cada método de cultivo. Para detectar la precisión visto dentro de las muestras y la variación visto a través de tamaños de muestra el error estándar de la media (S M) tanto para n = 3 y n = 6 conjuntos de datos fueron revisados (Figura 5B). Independientemente de la cultura continua (CC) tamaño de la muestra, menos de 1% de los datos tenía una S M ≤ 1,5. La mediana S M s eran 221 y 300, y los valores oscilaron 0-7,55 x 10 5 y 3,74 x 10 5, para n = 3 yn = 6 respectivamente. S M s también se calcularon para cada grupo de muestra de réplicas en el método de cultivo en serie (SC). Una vez más, a menos de 1% de los datos tenía una S M ≤ 1,5, una mediana S M de 137, y un rango de 0 a 3,51 x 10 5. Para comparar las distribuciones S m entre cada conjunto de muestras (CC n = 3 vs . CC n = 6, CC n = 3 vs SC n = 3, y CC n = 6 vs. SC n = 3) se realizó una prueba de permutación. El distriblución de cualquiera de cultivo continuo S M valora el conjunto de datos no fue significativamente diferente de la distribución de los valores de la cultura de serie S M (p-valor = 0,0). Sin embargo, la distribución de los valores S M para cultivo continuo de datos n = 3 fue significativamente diferente de la de los valores S M para el cultivo continuo n = 6 datos (p-valor = 1.908804 x 10 -49). Por último, el coeficiente de variación por metabolito se comparó antes y después de la implementación de una etapa de garantía de calidad (QA) (Figura 5C). En total, 210 metabolitos fueron retirados después de la implementación de la tubería de control de calidad (40% de los datos). Menos de 1% de los datos eliminados tenía una abundancia metabolito de cero, ~ 2% era de datos de patrón interno, ~ 5% fue datos de metabolitos nunca antes observada en E. coli, y los metabolitos restantes (> 30%) tenían un coeficiente de variación mayor que 1.
Al igual que con el análisis MAP, observatio mundialns proporciona una comprensión inicial de la profundidad de la metabolómica información ofertas. Para obtener una imagen global, clones fueron agrupados jerárquicamente en función de sus abundancias relativas de metabolitos que proporcionan información sobre los perfiles-clon metabolito, potenciales clones con funciones relacionadas, y los valores atípicos-clon metabolito (Figura 6). Para poner de relieve las funciones de proteínas, metabolitos están separados y agrupados en base a las vías metabólicas comunes. El uso de este análisis con resultados preliminares, era evidente que la metabolómica es capaz de separar genes de diferentes clases (Figura 6, resaltado clones). Además, la identificación de valores atípicos con los datos de la metabolómica se determinó mediante el cálculo de las puntuaciones normalizadas (puntuaciones z) para cada par-clon metabolito. Para asegurar la significación estadística, los valores atípicos se definen como un par-clon metabolito con un valor de puntuación Z de 2, que representa sólo el 5 por ciento de los datos (datos no mostrados).
ether.within-page = "always"> 
Figura 1. Definiciones de clasificaciones fenotipo. (A) Relación entre el nivel de crecimiento (GL) y tasa de crecimiento máxima. Los puntos de datos círculo rojo representan las curvas de crecimiento que muestran poca o ninguna utilización de sustratos. (B) Representación Diagrama de caja que define el umbral de crecimiento basado en la distribución de las curvas de crecimiento con una tasa de crecimiento mínimo (<0,15 OD / hr). (C) La varianza y desviación estándar de GL se calcula para sustrato de D-galactosa. Líneas de trazos cortos representan dos desviaciones estándar lejos de la media. Por favor, haga clic aquí para ver una versión más grande de esta figura.
highres.jpg "/>
Figura 2. Mapas de validación a través de la precisión y la diferenciación. (A) Curvas de crecimiento para clones estructurales (cápsida) y metabólicos (anotados Tiorredoxina), dos clones metabólicas novedosas (EDT2440, EDT2441), y el de respuesta promedio de los clones cultivados en sacarosa, D- galactosa y D-manosa en los mapas. Las líneas azules indican el error estándar visto entre los datos replicadas (n = 3). (B) Las curvas de crecimiento para 47 diferentes clones se representan como mapas de calor para la sacarosa, D-galactosa y D-manosa. El estructural (círculo verde) anotado y clones metabólicos (círculo naranja), dos clones metabólicas novedosas (círculos azules oscuros y claros), y la respuesta promedio (círculo rojo) se destacan. Haga clic aquí para ver una versión más grande de esta figura.
pload / 52854 / 52854fig3highres.jpg "width =" 700 "/>
Figura 3. Distribución Clone para cada fenotipo a través de múltiples sustratos. El recuento de fenotipo-clon de 47 clones a través de 72 condiciones de crecimiento en carbono específico. Tabla proporciona conteos directos para cada fenotipo. Por favor, haga clic aquí para ver una versión más grande de esta figura.

Figura 4. Diagrama que detalla la construcción del aparato de cultivo continuo. (A) pasos utilizados para construir los puertos α-γ del reactor de cultivo continuo, (b) pasos utilizados para construir el puerto de flujo hacia fuera del reactor de cultivo continuo, y (C ) los pasos para construir puertos δ y ε del biberón cultivo continuo. = "Https://www.jove.com/files/ftp_upload/52854/52854fig4highres.jpg" target = "_ blank"> Haga clic aquí para ver una versión más grande de esta figura.

Figura 5. Comparación de los métodos Phenomic presentados. (A) Flujo de trabajo para la preparación de las placas Multi-fenotipo de ensayo (MAP), cultivos continuos y culturas de serie. (B) El porcentaje de error estándar de la media (S M) cuenta tanto para n = 3 y n = 6 tamaños de muestra para el cultivo continuo (CC) y la cultura de serie (SC) métodos de preparación para la metabolómica. El eje y es en una escala logarítmica. (C) Las distribuciones de los coeficientes de variación (CV) por metabolito, antes y después de la implementación de la tubería de control de calidad para el método de cultivo continuo (CC).g5highres.jpg "target =" _ blank "> Haga clic aquí para ver una versión más grande de esta figura.

Figura 6. perfiles metabolómicos de clones que crecen en cultivo continuo. La abundancia de metabolitos mediana de un conjunto de metabolitos se trazan para 84 clones cultivados en cultivos continuos. Perfiles de metabolitos de clones anotados estructurales (cápside) y metabólicos (Tiorredoxina), dos clones metabólicas novedosas (EDT2440, EDT2441), y la respuesta metabólica media se destacan en rojo. Por favor, haga clic aquí para ver una versión más grande de esta figura.
| Compuesto | Carbono | Nitrógeno | Azufre | Fósforo |
| Glicerol | - | 0,40% | 0,40% | 0,40% |
| Cloruro amónico | 9,5 mM | - | 9,5 mM | 9,5 mM |
| El sulfato de sodio | 0,250 mM | 0,250 mM | - | 0,250 mM |
| Sulfato de magnesio | 1,0 mM | 1,0 mM | - | 1,0 mM |
| Fosfato de potasio | 1,32 mM | 1,32 mM | 1,32 mM | - |
| Cloruro de magnesio | - | - | * | - |
| Cloruro de potasio | 10 mM | 10 mM | 10 mM | 10 mM |
| Cloruro de calcio | 0,5 M | 0,5 M | 0,5 M | 0,5 M |
| Cloruro de sodio | 5 mM | 5 mM | 5 mM | 5 mM |
| El cloruro férrico | 6 M | 6 M | 6 M | 6 M |
| L- arabinosa | 0,10% | 0,10% | 0,10% | 0,10% |
| MOPS pH 7,4 | 1x | 1x | 1x | 1x |
Tabla 1. Los compuestos y concentraciones de los diferentes medios basales usados en los mapas. * 1,0 mM de cloruro de magnesio está sustituido. 1x MOPS = MOPS 40 mM, 4 mM Tricine.
| Sustratos de carbono | Sustratos de nitrógeno | Sustratos de azufre | Psustratos hosphorus |
| 2 desoxi-D-ribosa | 2-desoxi-D-ribosa | Ácido 1-butano-sulfónico | adenosina-5-monophoshate |
| Ácido acético 4 hidroxi fenil- | acetamida | acetil cisteína | beta-glicerofosfato |
| ácido acético | adenina | D-cisteína | creatinephosphate |
| adenosina-5-monofosfato | adenosina | D-metionina | D-glucosa-6-fosfato |
| adonitol | alantoína | dietil-ditiofosfato | dietil-ditiofosfato |
| alfa-D-glucosa | beta-feniletilamina | DL-etionina | DL-alfa-glicerofosfato |
| alfa-D-lactosa | biuret | glutatión | fosfato de potasio |
| alfa-D-melebiose | citidina | ácido isetiónico | pirofosfato de sodio |
| ácido cítrico | citosina | Ácido L-cisteico | tiofosfato de sodio |
| D-alanina | D-alanina | L-cisteína | |
| D-arabinosa | D-asparagina | Ácido L-djenkolic |
| D-arabitol | D-aspartato | L-metionina |
| D-asparagina | D-cisteína | sulfato de magnesio |
| D-aspartato | D-glucosamina | ácido metanosulfónico |
| D-celubiosa | Ácido D-glutámico | N-acetil-DL-metionina |
| D-cisteína | Ácido DL-alfa-amino-N-butírico | N-acetil-L-cisteína |
| D-fructosa | D-metionina | potasio-tetra-thionate |
| D-galactosa | D-serina | Tiosulfato de Sodio |
| D-glucosamina | D-valina | ácido sulfanic |
| D-glucosa | ácido gamma-amino-N-butírico | taurina |
| D-glucosa-6-fosfato | glicina | ácido taurocólico |
| D-glutamato | guanidina | tiourea |
| D-manosa | histamina | |
| D-rafinosa | inosina |
| D-ribosa | L-alanina |
| D-salicina | L-arginina |
| D-serina | L-asparagina |
| D-trehalosa | L-citrulina |
| D-xilosa | L-cisteína |
| dulcitol | Ácido L-glutámico |
| glicerol | L-glutamina |
| glicina | L-glutatión |
| i-eritritol | L-histidina |
| inosina | L-isoleucina |
| L-alanina | L-leucina |
| L-arabinosa | L-lisina |
| L-arabitol | L-metionina |
| L-asparagina | L-ornitina |
| L-aspartato | L-fenil-alanina |
| Ácido L-cisteico | L-prolina |
| L-cisteína | Ácido L-piro-glutámico |
| L-fucosa | L-serina; L-treonina |
| Ácido L-glutámico | L-triptófano |
| L-glutamina | L-valina |
| L-isoleucina | N-acetil-D-glucosamina |
| L-leucina | putrescina |
| L-lisina | tiourea |
| L-metionina | timidina |
| L-fenilalanina | timina |
| Ácido L-piro-glutámico | tiramina |
| L-ramnosa | tirosina |
| L-serina | uridina |
| L-sorbosa | |
| L-treonina |
| L-triptófano |
| L-valina |
| L-xilosa |
| lactato |
| lactulosa |
| malato |
| myo-inositol |
| ácido oxálico |
| sorbato de potasio |
| ácido propiónico |
| putrescina |
| ácido quínico |
| piruvato de sodio |
| succinato de sodio |
| sacarosa |
| timidina |
| xilitol |
Tabla 2. Lista de sustratos utilizados en los experimentos de MAP.